Source
Stratégies de chunking pour le RAG (synthèses 2026)
Point de départ 400 à 800 tokens, overlap 10 à 15 %, puis mesurer sur notre corpus.
- Organisation
- Firecrawl / Prem AI
- Type
- Article technique
- Fiabilité
- Fiabilité moyenne
- Publié
- 2026
- Consulté le
- 16 septembre 2026
- Sujets
- rag, chunking
Citée par 2 page(s)
Chunking et embeddingsRAG · Découper les documents en passages exploitables, les étiqueter (dont l'ACL), les vectoriser avec un modèle multilingue sous licence libre, et estimer la mémoire des index.Comparer les modèles d'embeddings sur du français juridiqueExpérimentation · Mesurer recall@k et MRR de bge-m3, multilingual-e5-large, Qwen3-Embedding (0.6B, 4B) et nomic-embed-text v2 sur le jeu de questions du corpus fictif, avec et sans reranker.
Ce que dit la source : synthèses non peer-reviewed : 256 à 512 tokens pour les questions factuelles, 512 à 1 024 pour l'analytique / multi-hop ; « start at 512 with 10 to 20% overlap » ; le splitter récursif reste « the safest default » ; une étude Vectara (NAACL 2025, citée) trouve que le chunking à taille fixe surpasse souvent le chunking sémantique sur documents réels.
Ce qu'on en retient : point de départ 400 à 800 tokens, overlap 10 à 15 %, puis mesurer sur notre corpus.
Limites : articles d'éditeurs ; l'étude Vectara n'a pas été lue directement.