Aller au contenu
Expérimentation

Évaluer Docling sur un corpus juridique français

Mesurer la qualité d'extraction (texte, structure, tableaux, OCR) et le débit de Docling sur des actes, courriers scannés, contrats et tableaux fictifs, contre Unstructured et PyMuPDF.

Hypothèse#rag#ocr#documents#doclingPublié le 16 sept. 2026Mis à jour le 16 sept. 2026
Statut du test
À tester
Priorité
Moyenne
Prévu pour
Octobre 2026
Hypothèse
Docling (MIT) avec Tesseract fra extrait correctement texte, structure et tableaux des documents juridiques français natifs, et atteint une qualité OCR acceptable sur des scans de qualité moyenne, à un débit compatible avec l'ingestion initiale d'un cabinet sur CPU.
Procédure
Corpus fictif de 100 documents : 30 PDF natifs (contrats, conclusions), 30 scans à 3 qualités (300 dpi propre, 200 dpi, photocopie dégradée), 20 mails (.eml, .msg), 10 tableurs, 10 Word. Vérité terrain : texte et structure saisis à la main pour 30 documents. Mesurer taux d'erreur caractères et mots (OCR), fidélité des tableaux (cellules correctes), détection des titres et articles, pages par minute sur CPU puis GPU si disponible. Comparer Docling, Unstructured hi_res, PyMuPDF + Tesseract, et PaddleOCR pour l'OCR seul.

Pourquoi

Le parsing est la première étape du pipeline et la moins visible : une erreur d'OCR ou un tableau linéarisé produit des chunks inutilisables sans que personne ne s'en aperçoive (ingestion). Docling est le candidat principal (MIT, exécution locale, HybridChunker) 1 ; sa qualité sur le français juridique n'est pas documentée.

Protocole

  1. Constituer le corpus fictif décrit dans la procédure (rien de réel) ; produire les scans en imprimant puis numérisant à trois qualités.
  2. Saisir la vérité terrain pour 30 documents (texte, titres, tableaux).
  3. Exécuter Docling (OCR Tesseract fra 4), Unstructured hi_res 2, PyMuPDF + Tesseract 3 (usage de test uniquement, AGPL), et PaddleOCR 5 sur l'OCR seul.
  4. Mesurer : taux d'erreur caractères et mots ; cellules de tableaux correctes ; titres et numéros d'articles détectés ; pages par minute ; mémoire.
  5. Inspecter à la main 10 documents par outil pour les erreurs qualitatives (ordre de lecture, colonnes, en-têtes répétés).

Critères

Docling est retenu si le taux d'erreur mots sur scans 300 dpi est inférieur à 2 % (à confirmer), si les tableaux simples sont restitués cellule par cellule, et si le débit CPU permet d'ingérer 10 000 pages en une nuit (estimation de volume à confirmer). Sinon, combiner OCRmyPDF + PaddleOCR en amont.

Résultat

À venir.

Sources

  1. 1Docling — README et documentation chunking (MIT, HybridChunker)GitHubFiabilité hauteDocling / IBM Research / LF AI & Data · publié v2.127.0, 14/09/2026 · consulté le 16 sept. 2026 · fiche source
  2. 2Unstructured — README (Apache 2.0, stratégies, limites open source)GitHubFiabilité hauteUnstructured · publié lu le 16/09/2026 · consulté le 16 sept. 2026 · fiche source
  3. 3PyMuPDF — licence AGPL-3.0 ou commercialeDocumentation officielleFiabilité hauteArtifex · publié lu le 16/09/2026 · consulté le 16 sept. 2026 · fiche source
  4. 4Tesseract — tessdata_best (Apache 2.0, fra.traineddata)GitHubFiabilité hauteTesseract OCR · publié lu le 16/09/2026 · consulté le 16 sept. 2026 · fiche source
  5. 5PaddleOCR 3.0 — rapport technique et licenceÉtudeFiabilité moyennePaddlePaddle · publié juillet 2025 · consulté le 16 sept. 2026 · fiche source
content/experiments/evaluer-docling-sur-corpus-juridique.md210 mots