Question· Q-003
Quelle quantification retenir pour le modèle principal ?
Arbitrage entre qualité (Q8/MXFP4 natif), mémoire disponible pour le KV cache multi-utilisateur et vitesse.
- Identifiant
- Q-003
- Statut
- Ouverte
- Priorité
- Moyenne
Enjeu
Sur 128 Go, un modèle de 60 Go laisse la place à un KV cache confortable ; un modèle de 110 Go (Qwen3 235B Q3) n'en laisse presque plus. gpt-oss-120b est nativement en MXFP4 (environ 61 Go), ce qui simplifie l'arbitrage. Pour les modèles denses, Q4_K_M vs Q5/Q6/Q8 change la qualité en français de façon à mesurer sur nos propres tâches (résumé, extraction de clauses).
À faire
Jeu d'évaluation en français (voir évaluation du RAG), puis comparaison de deux ou trois quantifications par modèle candidat.