Aller au contenu
Question· Q-003

Quelle quantification retenir pour le modèle principal ?

Arbitrage entre qualité (Q8/MXFP4 natif), mémoire disponible pour le KV cache multi-utilisateur et vitesse.

À vérifier#quantification#gpt-oss#qwen#benchmarkPublié le 16 sept. 2026Mis à jour le 16 sept. 2026
Identifiant
Q-003
Statut
Ouverte
Priorité
Moyenne

Enjeu

Sur 128 Go, un modèle de 60 Go laisse la place à un KV cache confortable ; un modèle de 110 Go (Qwen3 235B Q3) n'en laisse presque plus. gpt-oss-120b est nativement en MXFP4 (environ 61 Go), ce qui simplifie l'arbitrage. Pour les modèles denses, Q4_K_M vs Q5/Q6/Q8 change la qualité en français de façon à mesurer sur nos propres tâches (résumé, extraction de clauses).

À faire

Jeu d'évaluation en français (voir évaluation du RAG), puis comparaison de deux ou trois quantifications par modèle candidat.

content/questions/q-003-quantification.md86 mots