Source
Tesseract — tessdata_best (Apache 2.0, fra.traineddata)
OCR CPU de référence, sans dépendance GPU, utilisable par Docling, OCRmyPDF, PyMuPDF.
- Organisation
- Tesseract OCR
- Type
- GitHub
- Fiabilité
- Fiabilité haute
- Publié
- lu le 16/09/2026
- Consulté le
- 16 septembre 2026
- Sujets
- ocr, licence
Citée par 2 page(s)
Ingestion : parsing, OCR, métadonnées, synchronisationRAG · Transformer les PDF, Word, Excel, mails et scans d'un cabinet en texte structuré et étiqueté (dossier, ACL, page), puis le maintenir à jour et supprimer proprement.Évaluer Docling sur un corpus juridique françaisExpérimentation · Mesurer la qualité d'extraction (texte, structure, tableaux, OCR) et le débit de Docling sur des actes, courriers scannés, contrats et tableaux fictifs, contre Unstructured et PyMuPDF.
Ce que dit la source : moteur Tesseract 5 (LSTM) et données tessdata_best sous Apache 2.0 ; fra.traineddata disponible ; variantes tessdata / tessdata_best / tessdata_fast.
Ce qu'on en retient : OCR CPU de référence, sans dépendance GPU, utilisable par Docling, OCRmyPDF, PyMuPDF.
Limites : précision sur les scans de mauvaise qualité à mesurer.