Source
Unstructured — README (Apache 2.0, stratégies, limites open source)
Bonne couverture de formats (dont e-mails), mais fonctions avancées réservées à l'offre commerciale.
Confirmée#ocr#documents#ragPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026À revérifier le 15 déc. 2026
- Organisation
- Unstructured
- Type
- GitHub
- Fiabilité
- Fiabilité haute
- Publié
- lu le 16/09/2026
- Consulté le
- 16 septembre 2026
- Sujets
- ocr, documents, rag
Citée par 2 page(s)
Ingestion : parsing, OCR, métadonnées, synchronisationRAG · Transformer les PDF, Word, Excel, mails et scans d'un cabinet en texte structuré et étiqueté (dossier, ACL, page), puis le maintenir à jour et supprimer proprement.Évaluer Docling sur un corpus juridique françaisExpérimentation · Mesurer la qualité d'extraction (texte, structure, tableaux, OCR) et le débit de Docling sur des actes, courriers scannés, contrats et tableaux fictifs, contre Unstructured et PyMuPDF.
Ce que dit la source : Apache 2.0 ; environ 15 000 étoiles ; 60+ formats ; stratégies fast / hi_res / ocr_only ; dépendances tesseract-ocr, poppler, libreoffice ; chunking by_title / basic ; chunking, embedding et enrichissement avancés « reserved for the commercial Unstructured Pipelines platform ».
Ce qu'on en retient : bonne couverture de formats (dont e-mails), mais fonctions avancées réservées à l'offre commerciale.
Limites : dépendances système lourdes.