gpt-oss-120b
MoE OpenAI de 117 Md (5,1 Md actifs) sous Apache 2.0 : le candidat principal de la Box, mesuré entre 30 et 56 t/s sur Strix Halo selon le runtime.
Fiche modèle
- Fournisseur
- OpenAI
- Famille
- gpt-oss
- Paramètres
- 117 Md (5,1 Md actifs)
- Architecture
- Mixture of Experts
- Contexte
- 128k tokens
- Licence
- Apache 2.0 (+ gpt-oss usage policy)
- Sortie
- 5 août 2025
- Format natif
- MXFP4 (GGUF officiel 59,02 Go)
- Mémoire Q4Estimation
- ≈ 59 Go
- Mémoire Q8Estimation
- ≈ 63 Go
- Mémoire FP16Estimation
- ≈ 65 Go
- Appel d'outils
- Oui
- Raisonnement
- Optionnel
- Français
- Inconnu
- Quantifications
- MXFP4, Q8_0, Q4_K_M
- Usage recommandé
- assistant généraliste, synthèse de documents, RAG avec outils
- Hugging Face
- fiche modèle
L'essentiel
- MoE de 117 Md de paramètres dont 5,1 Md actifs par token : il tient dans 128 Go et génère vite parce qu'il lit peu de poids par token 1.
- Licence Apache 2.0, complétée d'une courte « usage policy » : exploitable commercialement 1.
- Mesures publiées sur Strix Halo : 51 à 56 t/s en génération sous llama.cpp, mais environ 30 t/s sous LM Studio ROCm. Sources contradictoires, non arbitrées.
- Le français n'est pas listé sur la fiche modèle : qualité à mesurer.
- C'est le point de départ de la Box, pas une décision définitive (voir Q-009).
Pourquoi ce modèle nous intéresse
La machine candidate a une bande passante mémoire d'environ 212 Go/s mesurés 11. En génération, le débit est borné par la quantité de poids lus à chaque token. Un modèle dense de 70 Md en Q4 lit environ 42 Go par token et plafonne vers 5 t/s. gpt-oss-120b ne lit que les poids de ses experts actifs (5,1 Md, soit quelques Go) : il produit dix fois plus de tokens par seconde pour une empreinte mémoire comparable (59 Go). C'est le compromis qualité / vitesse le plus favorable identifié pour une machine à mémoire unifiée.
Il supporte nativement le function calling, les sorties structurées et un niveau de raisonnement réglable (reasoning_effort bas, moyen ou haut) 1. Pour un RAG avec outils (recherche documentaire, citation), ce sont des prérequis.
Caractéristiques
| Caractéristique | Valeur | Origine |
|---|---|---|
| Paramètres | 117 Md total, 5,1 Md actifs | fiche modèle 1 |
| Architecture | 36 couches, 64 têtes Q / 8 têtes KV, dim. tête 64, attention alternée dense / fenêtre glissante 128 | blog HF 2 (à revérifier sur config.json) |
| Contexte | 128k (RoPE) | fiche modèle |
| Précision native | MXFP4 sur les experts | fiche modèle |
| Format de prompt | harmony (obligatoire ; --jinja sous llama.cpp) | guide llama.cpp 3 |
| Outils | function calling, navigation, exécution Python, structured outputs | fiche modèle |
| Raisonnement | réglable (low / medium / high) | fiche modèle |
Licence et usage commercial
Apache 2.0, assortie d'une « small complementary use policy » 1. Pas de seuil d'utilisateurs, pas de clause géographique, pas d'obligation d'affichage. La politique d'usage complémentaire doit être relue avant intégration dans une offre commerciale ; elle n'a pas été analysée dans cette recherche.
Français
Non vérifié. La fiche modèle ne liste pas les langues supportées 1. Aucun benchmark français publié n'a été trouvé pour ce modèle. C'est une des raisons de l'expérimentation comparer la qualité française des modèles. Pellegrini note par ailleurs un « poor tool calling » dans ses tests 6 : à vérifier dans nos conditions (format harmony correctement activé ou non).
Performances publiées sur Strix Halo
| Génération (t/s) | Prompt (t/s) | Conditions | Type |
|---|---|---|---|
| 55,57 (tg128) | 726,99 (pp512) | llama.cpp b9049, Vulkan RADV, Beelink GTR9 Pro, Mesa 26.0+, noyau 6.19+ 5 | communauté |
| 53,4 | — | llama-server ROCm, Q4_K_M, GMKtec/Beelink 7 | indépendant |
| 51,1 | 174 (charge applicative) | ROCm 7.2.0, fork Lychee b8182, environ 59 Go GPU, pic environ 140 W 6 | indépendant |
| environ 48 (Linux), 40 (Windows) | — | LM Studio, 4 bits 9 | constructeur |
| environ 30 | — | LM Studio + runtime ROCm llama.cpp 8 | indépendant |
| environ 45 mono, environ 168 agrégés sur 16 slots | — | HIP ROCm 7.2.0, mars 2026 ; modèle non précisé dans le résumé (probablement ce modèle) 10 | communauté |
Sous vLLM sur Strix Halo : aucune mesure trouvée.
Mémoire et contexte
- Poids : GGUF officiel 59,02 Go ; environ 64 Go de mémoire recommandés par le guide llama.cpp 3. Les GGUF « Q8_0 » (63,4 Go) ou « Q4_K_M » (62,8 Go) ne réduisent pas la taille, car les experts restent en MXFP4 4 : la quantification supplémentaire n'a pas d'intérêt.
- KV cache (estimation, formule 2 × couches × têtes KV × dim. tête × octets) : 36 × 8 × 64 × 2 × 2 = 73 728 octets par token en f16, borne haute puisque la moitié des couches utilise une fenêtre glissante de 128 tokens. Soit environ 0,6 Go pour 8k tokens, 2,4 Go pour 32k, 9,7 Go pour 128k, par slot. En q8_0, moitié moins.
- Budget indicatif (estimation) : 59 Go de poids + 4 slots × 32k en q8_0 (environ 5 Go) + système : moins de 70 Go, dans la limite GTT recommandée par AMD. Détail dans KV cache.
Limites
- Qualité du français non documentée.
- Format harmony : un runtime mal configuré dégrade les appels d'outils.
- 59 Go de poids : le modèle occupe la moitié de la mémoire ; cohabitation avec embeddings, reranker et base vectorielle à vérifier.
- Aucune mesure multi-utilisateurs certaine sur ce modèle (le chiffre « 168 t/s agrégés » n'identifie pas le modèle).
À tester
- Benchmark gpt-oss-120b à 1 utilisateur : Vulkan vs ROCm, pp512/tg128, profondeurs 0 / 4k / 32k.
- Montée en charge de 1 à 10 utilisateurs avec
-np 4puis-np 8. - Qualité française et fidélité des citations sur un jeu de dossiers juridiques anonymisés.
- Fiabilité du function calling avec
--jinjaet le template harmony.
Sources
- 1openai/gpt-oss-120b — fiche modèleDocumentation officielleFiabilité hauteOpenAI · publié 2025-08-05 · consulté le 16 sept. 2026 · fiche source
- 2Hugging Face — Welcome GPT OSSArticle techniqueFiabilité hauteHugging Face · publié 2025-08-05 · consulté le 16 sept. 2026 · fiche source
- 3Guide officiel llama.cpp : running gpt-oss (#15396)GitHubFiabilité hauteggml-org · Georgi Gerganov · publié 2025-08 · consulté le 16 sept. 2026 · fiche source
- 4unsloth/gpt-oss-120b-GGUFAutreFiabilité moyenneUnsloth · publié 2025 · consulté le 16 sept. 2026 · fiche source
- 5strix-halo-guide (README + BENCHMARKS.md)GitHubFiabilité moyenneGitHub (communauté) · hogeheer499 · publié 2026-03 → 2026-08-30 · consulté le 16 sept. 2026 · fiche source
- 6Running 122B-Parameter LLMs Locally on AMD Strix Halo (Pellegrini, LinkedIn)BenchmarkFiabilité moyenneLinkedIn (article personnel) · Pellegrini · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 7strix-halo-llm-perf (visorcraft)BenchmarkFiabilité moyenneGitHub (communauté) · visorcraft · publié 2026-02-16 (màj) · consulté le 16 sept. 2026 · fiche source
- 8Local LLM Speed Test: GPT-OSS, Qwen3.6 and Hermes on 128GB Unified Memory (MindStudio)BenchmarkFiabilité moyenneMindStudio · publié 2026-07-21 · consulté le 16 sept. 2026 · fiche source
- 9Using a Framework Desktop for local AI (blog Framework)Constructeur / éditeurFiabilité moyenneFramework Computer Inc. · Nirav Patel · publié 2025-07-07 (màj 2025-12-02) · consulté le 16 sept. 2026 · fiche source
- 10llama.cpp discussion #20856 — Known-Good Strix Halo ROCm + llama.cpp StackGitHubFiabilité moyenneGitHub ggml-org (communauté) · realugbun · publié 2026-03-22 (màj 2026-07-23) · consulté le 16 sept. 2026 · fiche source
- 11AMD Strix Halo (Ryzen AI Max+ 395) GPU Performance (llm-tracker)BenchmarkFiabilité hautellm-tracker.info · lhl · publié 2025-05-17 · consulté le 16 sept. 2026 · fiche source