Aller au contenu
Source

Stratégies de chunking pour le RAG (synthèses 2026)

Point de départ 400 à 800 tokens, overlap 10 à 15 %, puis mesurer sur notre corpus.

Confirmée#rag#chunkingPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026À revérifier le 15 déc. 2026
Organisation
Firecrawl / Prem AI
Type
Article technique
Fiabilité
Fiabilité moyenne
Publié
2026
Consulté le
16 septembre 2026
Sujets
rag, chunking

Citée par 2 page(s)

Ce que dit la source : synthèses non peer-reviewed : 256 à 512 tokens pour les questions factuelles, 512 à 1 024 pour l'analytique / multi-hop ; « start at 512 with 10 to 20% overlap » ; le splitter récursif reste « the safest default » ; une étude Vectara (NAACL 2025, citée) trouve que le chunking à taille fixe surpasse souvent le chunking sémantique sur documents réels.

Ce qu'on en retient : point de départ 400 à 800 tokens, overlap 10 à 15 %, puis mesurer sur notre corpus.

Limites : articles d'éditeurs ; l'étude Vectara n'a pas été lue directement.

content/sources/chunking-strategies-2026.md103 mots