Source
Docling — README et documentation chunking (MIT, HybridChunker)
Candidat principal pour le parsing, licence sans piège, exécution locale, chunking structurel natif.
Confirmée#ocr#rag#documents#doclingPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026À revérifier le 15 déc. 2026
- Organisation
- Docling / IBM Research / LF AI & Data
- Type
- GitHub
- Fiabilité
- Fiabilité haute
- Publié
- v2.127.0, 14/09/2026
- Consulté le
- 16 septembre 2026
- Sujets
- ocr, rag, documents, docling
Citée par 4 page(s)
Chunking et embeddingsRAG · Découper les documents en passages exploitables, les étiqueter (dont l'ACL), les vectoriser avec un modèle multilingue sous licence libre, et estimer la mémoire des index.RAG : vue d'ensembleRAG · Pipeline documentaire de la Box, de l'ingestion des dossiers à la réponse citée, avec le filtre de permissions au cœur de la recherche.Ingestion : parsing, OCR, métadonnées, synchronisationRAG · Transformer les PDF, Word, Excel, mails et scans d'un cabinet en texte structuré et étiqueté (dossier, ACL, page), puis le maintenir à jour et supprimer proprement.Évaluer Docling sur un corpus juridique françaisExpérimentation · Mesurer la qualité d'extraction (texte, structure, tableaux, OCR) et le débit de Docling sur des actes, courriers scannés, contrats et tableaux fictifs, contre Unstructured et PyMuPDF.
Ce que dit la source : MIT ; environ 66 000 étoiles ; formats PDF / DOCX / PPTX / XLSX / HTML / EPUB / images / audio ; analyse de mise en page et tableaux ; plusieurs moteurs OCR ; export Markdown / HTML / JSON / DocTags ; « Local execution capabilities for sensitive data and air-gapped environments ». Page chunking : chunking hiérarchique par structure et HybridChunker tokenization-aware (tokenizer, max_tokens, merge_peers, repeat_table_header).
Ce qu'on en retient : candidat principal pour le parsing, licence sans piège, exécution locale, chunking structurel natif.
Limites : qualité sur des actes juridiques scannés en français à mesurer.