Évaluer Docling sur un corpus juridique français
Mesurer la qualité d'extraction (texte, structure, tableaux, OCR) et le débit de Docling sur des actes, courriers scannés, contrats et tableaux fictifs, contre Unstructured et PyMuPDF.
- Statut du test
- À tester
- Priorité
- Moyenne
- Prévu pour
- Octobre 2026
- Hypothèse
- Docling (MIT) avec Tesseract fra extrait correctement texte, structure et tableaux des documents juridiques français natifs, et atteint une qualité OCR acceptable sur des scans de qualité moyenne, à un débit compatible avec l'ingestion initiale d'un cabinet sur CPU.
- Procédure
- Corpus fictif de 100 documents : 30 PDF natifs (contrats, conclusions), 30 scans à 3 qualités (300 dpi propre, 200 dpi, photocopie dégradée), 20 mails (.eml, .msg), 10 tableurs, 10 Word. Vérité terrain : texte et structure saisis à la main pour 30 documents. Mesurer taux d'erreur caractères et mots (OCR), fidélité des tableaux (cellules correctes), détection des titres et articles, pages par minute sur CPU puis GPU si disponible. Comparer Docling, Unstructured hi_res, PyMuPDF + Tesseract, et PaddleOCR pour l'OCR seul.
Pourquoi
Le parsing est la première étape du pipeline et la moins visible : une erreur d'OCR ou un tableau linéarisé produit des chunks inutilisables sans que personne ne s'en aperçoive (ingestion). Docling est le candidat principal (MIT, exécution locale, HybridChunker) 1 ; sa qualité sur le français juridique n'est pas documentée.
Protocole
- Constituer le corpus fictif décrit dans la procédure (rien de réel) ; produire les scans en imprimant puis numérisant à trois qualités.
- Saisir la vérité terrain pour 30 documents (texte, titres, tableaux).
- Exécuter Docling (OCR Tesseract
fra4), Unstructuredhi_res2, PyMuPDF + Tesseract 3 (usage de test uniquement, AGPL), et PaddleOCR 5 sur l'OCR seul. - Mesurer : taux d'erreur caractères et mots ; cellules de tableaux correctes ; titres et numéros d'articles détectés ; pages par minute ; mémoire.
- Inspecter à la main 10 documents par outil pour les erreurs qualitatives (ordre de lecture, colonnes, en-têtes répétés).
Critères
Docling est retenu si le taux d'erreur mots sur scans 300 dpi est inférieur à 2 % (à confirmer), si les tableaux simples sont restitués cellule par cellule, et si le débit CPU permet d'ingérer 10 000 pages en une nuit (estimation de volume à confirmer). Sinon, combiner OCRmyPDF + PaddleOCR en amont.
Résultat
À venir.
Sources
- 1Docling — README et documentation chunking (MIT, HybridChunker)GitHubFiabilité hauteDocling / IBM Research / LF AI & Data · publié v2.127.0, 14/09/2026 · consulté le 16 sept. 2026 · fiche source
- 2Unstructured — README (Apache 2.0, stratégies, limites open source)GitHubFiabilité hauteUnstructured · publié lu le 16/09/2026 · consulté le 16 sept. 2026 · fiche source
- 3PyMuPDF — licence AGPL-3.0 ou commercialeDocumentation officielleFiabilité hauteArtifex · publié lu le 16/09/2026 · consulté le 16 sept. 2026 · fiche source
- 4Tesseract — tessdata_best (Apache 2.0, fra.traineddata)GitHubFiabilité hauteTesseract OCR · publié lu le 16/09/2026 · consulté le 16 sept. 2026 · fiche source
- 5PaddleOCR 3.0 — rapport technique et licenceÉtudeFiabilité moyennePaddlePaddle · publié juillet 2025 · consulté le 16 sept. 2026 · fiche source