Expérimentation
Comparer les modèles d'embeddings sur du français juridique
Mesurer recall@k et MRR de bge-m3, multilingual-e5-large, Qwen3-Embedding (0.6B, 4B) et nomic-embed-text v2 sur le jeu de questions du corpus fictif, avec et sans reranker.
- Statut du test
- À tester
- Priorité
- Moyenne
- Prévu pour
- Novembre 2026
- Hypothèse
- Sur des questions juridiques en français, bge-m3 et multilingual-e5-large atteignent un recall@10 comparable ; le reranker bge-reranker-v2-m3 apporte un gain de MRR supérieur à celui du changement de modèle d'embeddings ; la recherche hybride (BM25 + vecteurs, RRF) bat chacune des deux recherches seules.
- Procédure
- Corpus fictif chunké (Docling, 400 à 800 tokens). Jeu de 150 questions avec chunks de référence. Pour chaque modèle : vectoriser, mesurer recall@5/10/20 et MRR en dense seul, BM25 seul (tsvector french), hybride RRF k=60. Puis ajouter bge-reranker-v2-m3 et Qwen3-Reranker-0.6B sur 40 candidats. Mesurer aussi le temps de vectorisation de 100 000 chunks sur CPU et GPU, et la mémoire.
Pourquoi
Le choix du modèle d'embeddings conditionne toute la recherche et impose une réindexation complète en cas de changement (chunking et embeddings). Les classements génériques (MTEB) ne disent rien du français juridique. jina-embeddings-v3 est exclu d'office (CC BY-NC) 1.
Protocole
- Corpus et jeu de questions de l'évaluation, version figée.
- Modèles : bge-m3, multilingual-e5-large (avec préfixes
query:/passage:), Qwen3-Embedding-0.6B et 4B, nomic-embed-text v2 ; vérifier licence, dimensions et contexte sur chaque model card avant le test (chiffres non vérifiés dans nos recherches). - Trois modes de recherche : dense, BM25 (PostgreSQL
tsvectorconfigurationfrench), hybride RRF k = 60. - Rerankers : bge-reranker-v2-m3 2, Qwen3-Reranker-0.6B 3, sur 40 candidats, sortie 10.
- Métriques : recall@5/10/20, MRR ; temps de vectorisation pour 100 000 chunks (CPU, GPU) ; mémoire de l'index à 768 / 1 024 / 2 560 dimensions.
- Variante : chunks de 512 tokens à taille fixe, pour tester l'effet du chunking en même temps 4.
Critères
Retenir le modèle au meilleur recall@10 en hybride + reranker, à licence MIT ou Apache 2.0, dont le coût d'ingestion reste compatible avec une nuit de traitement pour un cabinet. À égalité, préférer le plus petit.
Résultat
À venir.
Sources
- 1Jina AI — jina-embeddings-v3 (annonce et licence CC BY-NC 4.0)Constructeur / éditeurFiabilité hauteJina AI · publié 2024-09 · consulté le 16 sept. 2026 · fiche source
- 2BAAI/bge-reranker-v2-m3 — model cardDocumentation officielleFiabilité hauteBAAI · publié 02/2024 · consulté le 16 sept. 2026 · fiche source
- 3Qwen/Qwen3-Reranker — model card (0.6B / 4B / 8B)Documentation officielleFiabilité hauteAlibaba Qwen · publié 05/06/2025 · consulté le 16 sept. 2026 · fiche source
- 4Stratégies de chunking pour le RAG (synthèses 2026)Article techniqueFiabilité moyenneFirecrawl / Prem AI · publié 2026 · consulté le 16 sept. 2026 · fiche source