Aller au contenu
Tag

#ocr

15 entrée(s) portent ce tag.

Sources

10

Docling — README et documentation chunking (MIT, HybridChunker)Source · Candidat principal pour le parsing, licence sans piège, exécution locale, chunking structurel natif.Marker — README (licence code et poids des modèles)Source · Un cabinet d'avocats (entité commerciale) doit vérifier son éligibilité ; à écarter par prudence pour une offre commerciale.MinerU — README (licence custom, prérequis GPU)Source · Puissant mais licence custom à lire intégralement ; dépendance GPU CUDA à vérifier sur AMD.Nougat (Meta) — code MIT, poids CC BY-NCSource · Inutilisable pour un usage commercial et hors cible (pas de documents juridiques).OCRmyPDF — licence MPL-2.0Source · Utile en prétraitement : le PDF conserve son image et gagne une couche texte cherchable, réutilisable par tout parseur.PaddleOCR 3.0 — rapport technique et licenceSource · Alternative à Tesseract avec détection de mise en page, à tester sur CPU et sur GPU AMD.PyMuPDF — licence AGPL-3.0 ou commercialeSource · AGPL acceptable en usage interne au cabinet, à analyser juridiquement pour une Box distribuée.RAGFlow — README (Apache 2.0, DeepDoc, prérequis)Source · Pipeline documentaire riche, mais empreinte lourde et permissions par équipe peu détaillées.Tesseract — tessdata_best (Apache 2.0, fra.traineddata)Source · OCR CPU de référence, sans dépendance GPU, utilisable par Docling, OCRmyPDF, PyMuPDF.Unstructured — README (Apache 2.0, stratégies, limites open source)Source · Bonne couverture de formats (dont e-mails), mais fonctions avancées réservées à l'offre commerciale.