Aller au contenu
Expérimentation

Comparer la qualité en français des modèles candidats

Évaluer en aveugle gpt-oss-120b, Qwen3-30B-A3B, Mistral Small 3.2 / 4, Gemma 3 27B, Llama 3.3 70B et les modèles européens sur des tâches juridiques françaises : rédaction, synthèse, citation fidèle, refus d'inventer.

Brouillon#gpt-oss#qwen#mistral#gemma#llama#avocats#rag#benchmarkPublié le 16 sept. 2026Mis à jour le 16 sept. 2026
Statut du test
À tester
Priorité
Haute
Prévu pour
Novembre 2026
Hypothèse
gpt-oss-120b et Mistral Small 4 produisent un français juridique jugé acceptable par un avocat dans plus de 80 % des cas ; Qwen3-30B-A3B est nettement en retrait sur la rédaction mais équivalent sur la synthèse avec passages fournis ; les modèles de 7 à 22 Md (Lucie, EuroLLM) ne suffisent pas pour l'assistant principal. Le taux d'hallucination de citations est le critère discriminant.
Procédure
1) Constituer 40 tâches en français, anonymisées ou synthétiques : 10 rédactions (courrier, clause), 10 synthèses de pièces fournies, 10 questions avec passages RAG à citer, 10 questions pièges (information absente des pièces : le modèle doit dire qu'il ne sait pas). 2) Même prompt système, même température, même format de citation pour tous les modèles ; llama-server avec les templates officiels (--jinja pour gpt-oss). 3) Évaluation en aveugle par deux relecteurs (dont un juriste) sur une grille : exactitude, fidélité des citations, qualité de la langue, respect des consignes, refus justifié. 4) Compléter par les scores COLE et CARTE publiés si disponibles pour ces modèles. 5) Consigner temps de réponse et tokens générés par tâche.
Prochaine action
Rédiger la grille d'évaluation et recruter un relecteur juriste ; dépend du jeu de tâches FR partagé avec les benchmarks de charge.

Pourquoi

Aucune fiche modèle ne documente sérieusement la qualité en français : gpt-oss-120b ne liste pas ses langues 3, Llama 3.3 déclare le français 4 mais est trop lent, et aucun classement consolidé n'existe. Deux benchmarks académiques français, COLE 1 et CARTE 2, existent, mais leurs scores par modèle n'ont pas été extraits et ne couvrent pas le registre juridique. Le choix du modèle principal (Q-009) ne peut pas reposer sur les seuls débits.

Protocole

Voir procedure. Les 40 tâches et la grille seront versionnées dans le dépôt ; les pièces sont synthétiques ou anonymisées (aucune donnée réelle de client).

Critères de succès

  • Classement des modèles sur les quatre familles de tâches, avec accord inter-relecteurs.
  • Taux d'hallucination de citation par modèle (critère bloquant au-delà de 5 %, hypothèse de seuil).
  • Décision sur le couple « modèle principal / modèle rapide » pour la Box.

Résultat

À venir.

Sources

  1. 1COLE : a Comprehensive Benchmark for French Language Understanding Evaluation (arXiv 2510.05046)ÉtudeFiabilité hautearXiv · publié 2025-10 · consulté le 16 sept. 2026 · fiche source
  2. 2CARTE : a Benchmark for Mapping Language Model Knowledge Across France (arXiv 2606.01995)ÉtudeFiabilité hautearXiv · publié 2026-06 · consulté le 16 sept. 2026 · fiche source
  3. 3openai/gpt-oss-120b — fiche modèleDocumentation officielleFiabilité hauteOpenAI · publié 2025-08-05 · consulté le 16 sept. 2026 · fiche source
  4. 4meta-llama/Llama-3.3-70B-Instruct — fiche modèleDocumentation officielleFiabilité hauteMeta · publié 2024-12-06 · consulté le 16 sept. 2026 · fiche source
content/experiments/comparer-qualite-francais-modeles.md145 mots