Aller au contenu
Terme

Tesseract

Moteur d'OCR open source (Apache 2.0) maintenu depuis Google, fonctionnant sur CPU, avec des modèles de langue dont le français.

Confirmée#ocr#documentsPublié le 16 sept. 2026Mis à jour le 16 sept. 2026

Moteur d'OCR open source (Apache 2.0) maintenu depuis Google, fonctionnant sur CPU, avec des modèles de langue dont le français.

RAGAussi : tesseract-ocr

Tesseract est la brique OCR classique pour les documents scannés. Il est utilisé par OCRmyPDF, Docling ou Unstructured pour ajouter une couche texte aux PDF image.

Pour un cabinet, une part importante des pièces est scannée : la qualité de l'OCR conditionne directement ce que le RAG peut retrouver. Les alternatives plus récentes (PaddleOCR, modèles de vision) sont à comparer sur des scans réels.

content/glossary/tesseract.md64 mots