Aller au contenu
Expérimentation

Comparer les modèles d'embeddings sur du français juridique

Mesurer recall@k et MRR de bge-m3, multilingual-e5-large, Qwen3-Embedding (0.6B, 4B) et nomic-embed-text v2 sur le jeu de questions du corpus fictif, avec et sans reranker.

Hypothèse#rag#embeddings#reranking#benchmarkPublié le 16 sept. 2026Mis à jour le 16 sept. 2026
Statut du test
À tester
Priorité
Moyenne
Prévu pour
Novembre 2026
Hypothèse
Sur des questions juridiques en français, bge-m3 et multilingual-e5-large atteignent un recall@10 comparable ; le reranker bge-reranker-v2-m3 apporte un gain de MRR supérieur à celui du changement de modèle d'embeddings ; la recherche hybride (BM25 + vecteurs, RRF) bat chacune des deux recherches seules.
Procédure
Corpus fictif chunké (Docling, 400 à 800 tokens). Jeu de 150 questions avec chunks de référence. Pour chaque modèle : vectoriser, mesurer recall@5/10/20 et MRR en dense seul, BM25 seul (tsvector french), hybride RRF k=60. Puis ajouter bge-reranker-v2-m3 et Qwen3-Reranker-0.6B sur 40 candidats. Mesurer aussi le temps de vectorisation de 100 000 chunks sur CPU et GPU, et la mémoire.

Pourquoi

Le choix du modèle d'embeddings conditionne toute la recherche et impose une réindexation complète en cas de changement (chunking et embeddings). Les classements génériques (MTEB) ne disent rien du français juridique. jina-embeddings-v3 est exclu d'office (CC BY-NC) 1.

Protocole

  1. Corpus et jeu de questions de l'évaluation, version figée.
  2. Modèles : bge-m3, multilingual-e5-large (avec préfixes query: / passage:), Qwen3-Embedding-0.6B et 4B, nomic-embed-text v2 ; vérifier licence, dimensions et contexte sur chaque model card avant le test (chiffres non vérifiés dans nos recherches).
  3. Trois modes de recherche : dense, BM25 (PostgreSQL tsvector configuration french), hybride RRF k = 60.
  4. Rerankers : bge-reranker-v2-m3 2, Qwen3-Reranker-0.6B 3, sur 40 candidats, sortie 10.
  5. Métriques : recall@5/10/20, MRR ; temps de vectorisation pour 100 000 chunks (CPU, GPU) ; mémoire de l'index à 768 / 1 024 / 2 560 dimensions.
  6. Variante : chunks de 512 tokens à taille fixe, pour tester l'effet du chunking en même temps 4.

Critères

Retenir le modèle au meilleur recall@10 en hybride + reranker, à licence MIT ou Apache 2.0, dont le coût d'ingestion reste compatible avec une nuit de traitement pour un cabinet. À égalité, préférer le plus petit.

Résultat

À venir.

Sources

  1. 1Jina AI — jina-embeddings-v3 (annonce et licence CC BY-NC 4.0)Constructeur / éditeurFiabilité hauteJina AI · publié 2024-09 · consulté le 16 sept. 2026 · fiche source
  2. 2BAAI/bge-reranker-v2-m3 — model cardDocumentation officielleFiabilité hauteBAAI · publié 02/2024 · consulté le 16 sept. 2026 · fiche source
  3. 3Qwen/Qwen3-Reranker — model card (0.6B / 4B / 8B)Documentation officielleFiabilité hauteAlibaba Qwen · publié 05/06/2025 · consulté le 16 sept. 2026 · fiche source
  4. 4Stratégies de chunking pour le RAG (synthèses 2026)Article techniqueFiabilité moyenneFirecrawl / Prem AI · publié 2026 · consulté le 16 sept. 2026 · fiche source
content/experiments/comparer-embeddings-francais.md200 mots