Terme
Tesseract
Moteur d'OCR open source (Apache 2.0) maintenu depuis Google, fonctionnant sur CPU, avec des modèles de langue dont le français.
Moteur d'OCR open source (Apache 2.0) maintenu depuis Google, fonctionnant sur CPU, avec des modèles de langue dont le français.
RAGAussi : tesseract-ocr
Tesseract est la brique OCR classique pour les documents scannés. Il est utilisé par OCRmyPDF, Docling ou Unstructured pour ajouter une couche texte aux PDF image.
Pour un cabinet, une part importante des pièces est scannée : la qualité de l'OCR conditionne directement ce que le RAG peut retrouver. Les alternatives plus récentes (PaddleOCR, modèles de vision) sont à comparer sur des scans réels.