Aller au contenu
Modèle

gpt-oss-120b

MoE OpenAI de 117 Md (5,1 Md actifs) sous Apache 2.0 : le candidat principal de la Box, mesuré entre 30 et 56 t/s sur Strix Halo selon le runtime.

À vérifier#gpt-oss#llama-cpp#strix-halo#benchmark#kv-cachePublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026À revérifier le 15 déc. 2026

Fiche modèle

Fournisseur
OpenAI
Famille
gpt-oss
Paramètres
117 Md (5,1 Md actifs)
Architecture
Mixture of Experts
Contexte
128k tokens
Licence
Apache 2.0 (+ gpt-oss usage policy)
Sortie
5 août 2025
Format natif
MXFP4 (GGUF officiel 59,02 Go)
Mémoire Q4Estimation
≈ 59 Go
Mémoire Q8Estimation
≈ 63 Go
Mémoire FP16Estimation
≈ 65 Go
Appel d'outils
Oui
Raisonnement
Optionnel
Français
Inconnu
Quantifications
MXFP4, Q8_0, Q4_K_M
Usage recommandé
assistant généraliste, synthèse de documents, RAG avec outils
Hugging Face
fiche modèle

L'essentiel

  • MoE de 117 Md de paramètres dont 5,1 Md actifs par token : il tient dans 128 Go et génère vite parce qu'il lit peu de poids par token 1.
  • Licence Apache 2.0, complétée d'une courte « usage policy » : exploitable commercialement 1.
  • Mesures publiées sur Strix Halo : 51 à 56 t/s en génération sous llama.cpp, mais environ 30 t/s sous LM Studio ROCm. Sources contradictoires, non arbitrées.
  • Le français n'est pas listé sur la fiche modèle : qualité à mesurer.
  • C'est le point de départ de la Box, pas une décision définitive (voir Q-009).

Pourquoi ce modèle nous intéresse

La machine candidate a une bande passante mémoire d'environ 212 Go/s mesurés 11. En génération, le débit est borné par la quantité de poids lus à chaque token. Un modèle dense de 70 Md en Q4 lit environ 42 Go par token et plafonne vers 5 t/s. gpt-oss-120b ne lit que les poids de ses experts actifs (5,1 Md, soit quelques Go) : il produit dix fois plus de tokens par seconde pour une empreinte mémoire comparable (59 Go). C'est le compromis qualité / vitesse le plus favorable identifié pour une machine à mémoire unifiée.

Il supporte nativement le function calling, les sorties structurées et un niveau de raisonnement réglable (reasoning_effort bas, moyen ou haut) 1. Pour un RAG avec outils (recherche documentaire, citation), ce sont des prérequis.

Caractéristiques

CaractéristiqueValeurOrigine
Paramètres117 Md total, 5,1 Md actifsfiche modèle 1
Architecture36 couches, 64 têtes Q / 8 têtes KV, dim. tête 64, attention alternée dense / fenêtre glissante 128blog HF 2 (à revérifier sur config.json)
Contexte128k (RoPE)fiche modèle
Précision nativeMXFP4 sur les expertsfiche modèle
Format de promptharmony (obligatoire ; --jinja sous llama.cpp)guide llama.cpp 3
Outilsfunction calling, navigation, exécution Python, structured outputsfiche modèle
Raisonnementréglable (low / medium / high)fiche modèle

Licence et usage commercial

Apache 2.0, assortie d'une « small complementary use policy » 1. Pas de seuil d'utilisateurs, pas de clause géographique, pas d'obligation d'affichage. La politique d'usage complémentaire doit être relue avant intégration dans une offre commerciale ; elle n'a pas été analysée dans cette recherche.

Français

Non vérifié. La fiche modèle ne liste pas les langues supportées 1. Aucun benchmark français publié n'a été trouvé pour ce modèle. C'est une des raisons de l'expérimentation comparer la qualité française des modèles. Pellegrini note par ailleurs un « poor tool calling » dans ses tests 6 : à vérifier dans nos conditions (format harmony correctement activé ou non).

Performances publiées sur Strix Halo

Génération (t/s)Prompt (t/s)ConditionsType
55,57 (tg128)726,99 (pp512)llama.cpp b9049, Vulkan RADV, Beelink GTR9 Pro, Mesa 26.0+, noyau 6.19+ 5communauté
53,4llama-server ROCm, Q4_K_M, GMKtec/Beelink 7indépendant
51,1174 (charge applicative)ROCm 7.2.0, fork Lychee b8182, environ 59 Go GPU, pic environ 140 W 6indépendant
environ 48 (Linux), 40 (Windows)LM Studio, 4 bits 9constructeur
environ 30LM Studio + runtime ROCm llama.cpp 8indépendant
environ 45 mono, environ 168 agrégés sur 16 slotsHIP ROCm 7.2.0, mars 2026 ; modèle non précisé dans le résumé (probablement ce modèle) 10communauté

Sous vLLM sur Strix Halo : aucune mesure trouvée.

Mémoire et contexte

  • Poids : GGUF officiel 59,02 Go ; environ 64 Go de mémoire recommandés par le guide llama.cpp 3. Les GGUF « Q8_0 » (63,4 Go) ou « Q4_K_M » (62,8 Go) ne réduisent pas la taille, car les experts restent en MXFP4 4 : la quantification supplémentaire n'a pas d'intérêt.
  • KV cache (estimation, formule 2 × couches × têtes KV × dim. tête × octets) : 36 × 8 × 64 × 2 × 2 = 73 728 octets par token en f16, borne haute puisque la moitié des couches utilise une fenêtre glissante de 128 tokens. Soit environ 0,6 Go pour 8k tokens, 2,4 Go pour 32k, 9,7 Go pour 128k, par slot. En q8_0, moitié moins.
  • Budget indicatif (estimation) : 59 Go de poids + 4 slots × 32k en q8_0 (environ 5 Go) + système : moins de 70 Go, dans la limite GTT recommandée par AMD. Détail dans KV cache.

Limites

  • Qualité du français non documentée.
  • Format harmony : un runtime mal configuré dégrade les appels d'outils.
  • 59 Go de poids : le modèle occupe la moitié de la mémoire ; cohabitation avec embeddings, reranker et base vectorielle à vérifier.
  • Aucune mesure multi-utilisateurs certaine sur ce modèle (le chiffre « 168 t/s agrégés » n'identifie pas le modèle).

À tester

Sources

  1. 1openai/gpt-oss-120b — fiche modèleDocumentation officielleFiabilité hauteOpenAI · publié 2025-08-05 · consulté le 16 sept. 2026 · fiche source
  2. 2Hugging Face — Welcome GPT OSSArticle techniqueFiabilité hauteHugging Face · publié 2025-08-05 · consulté le 16 sept. 2026 · fiche source
  3. 3Guide officiel llama.cpp : running gpt-oss (#15396)GitHubFiabilité hauteggml-org · Georgi Gerganov · publié 2025-08 · consulté le 16 sept. 2026 · fiche source
  4. 4unsloth/gpt-oss-120b-GGUFAutreFiabilité moyenneUnsloth · publié 2025 · consulté le 16 sept. 2026 · fiche source
  5. 5strix-halo-guide (README + BENCHMARKS.md)GitHubFiabilité moyenneGitHub (communauté) · hogeheer499 · publié 2026-03 → 2026-08-30 · consulté le 16 sept. 2026 · fiche source
  6. 6Running 122B-Parameter LLMs Locally on AMD Strix Halo (Pellegrini, LinkedIn)BenchmarkFiabilité moyenneLinkedIn (article personnel) · Pellegrini · publié 2026 · consulté le 16 sept. 2026 · fiche source
  7. 7strix-halo-llm-perf (visorcraft)BenchmarkFiabilité moyenneGitHub (communauté) · visorcraft · publié 2026-02-16 (màj) · consulté le 16 sept. 2026 · fiche source
  8. 8Local LLM Speed Test: GPT-OSS, Qwen3.6 and Hermes on 128GB Unified Memory (MindStudio)BenchmarkFiabilité moyenneMindStudio · publié 2026-07-21 · consulté le 16 sept. 2026 · fiche source
  9. 9Using a Framework Desktop for local AI (blog Framework)Constructeur / éditeurFiabilité moyenneFramework Computer Inc. · Nirav Patel · publié 2025-07-07 (màj 2025-12-02) · consulté le 16 sept. 2026 · fiche source
  10. 10llama.cpp discussion #20856 — Known-Good Strix Halo ROCm + llama.cpp StackGitHubFiabilité moyenneGitHub ggml-org (communauté) · realugbun · publié 2026-03-22 (màj 2026-07-23) · consulté le 16 sept. 2026 · fiche source
  11. 11AMD Strix Halo (Ryzen AI Max+ 395) GPU Performance (llm-tracker)BenchmarkFiabilité hautellm-tracker.info · lhl · publié 2025-05-17 · consulté le 16 sept. 2026 · fiche source
content/models/gpt-oss-120b.md909 mots