Tag
#ocr
15 entrée(s) portent ce tag.
Sources
10
Docling — README et documentation chunking (MIT, HybridChunker)Source · Candidat principal pour le parsing, licence sans piège, exécution locale, chunking structurel natif.16 sept. 2026Marker — README (licence code et poids des modèles)Source · Un cabinet d'avocats (entité commerciale) doit vérifier son éligibilité ; à écarter par prudence pour une offre commerciale.16 sept. 2026MinerU — README (licence custom, prérequis GPU)Source · Puissant mais licence custom à lire intégralement ; dépendance GPU CUDA à vérifier sur AMD.16 sept. 2026Nougat (Meta) — code MIT, poids CC BY-NCSource · Inutilisable pour un usage commercial et hors cible (pas de documents juridiques).16 sept. 2026OCRmyPDF — licence MPL-2.0Source · Utile en prétraitement : le PDF conserve son image et gagne une couche texte cherchable, réutilisable par tout parseur.16 sept. 2026PaddleOCR 3.0 — rapport technique et licenceSource · Alternative à Tesseract avec détection de mise en page, à tester sur CPU et sur GPU AMD.16 sept. 2026PyMuPDF — licence AGPL-3.0 ou commercialeSource · AGPL acceptable en usage interne au cabinet, à analyser juridiquement pour une Box distribuée.16 sept. 2026RAGFlow — README (Apache 2.0, DeepDoc, prérequis)Source · Pipeline documentaire riche, mais empreinte lourde et permissions par équipe peu détaillées.16 sept. 2026Tesseract — tessdata_best (Apache 2.0, fra.traineddata)Source · OCR CPU de référence, sans dépendance GPU, utilisable par Docling, OCRmyPDF, PyMuPDF.16 sept. 2026Unstructured — README (Apache 2.0, stratégies, limites open source)Source · Bonne couverture de formats (dont e-mails), mais fonctions avancées réservées à l'offre commerciale.16 sept. 2026
Glossaire
3
DoclingTerme · Bibliothèque open source d'IBM Research pour convertir PDF, Word, PowerPoint, HTML et images en texte structuré (Markdown, JSON), avec analyse de mise en page, extraction des tableaux et OCR.16 sept. 2026OCR (reconnaissance optique de caractères)Terme · Conversion d'une image de texte (document scanné, photo, PDF image) en texte exploitable par une machine.16 sept. 2026TesseractTerme · Moteur d'OCR open source (Apache 2.0) maintenu depuis Google, fonctionnant sur CPU, avec des modèles de langue dont le français.16 sept. 2026