Source
Hugging Face — Welcome GPT OSS
Architecture gpt-oss-120b : 36 couches, 64 têtes Q / 8 têtes KV, dim tête 64, attention alternée dense / fenêtre glissante 128, RoPE 128K.
- Organisation
- Hugging Face
- Type
- Article technique
- Fiabilité
- Fiabilité haute
- Publié
- 2025-08-05
- Consulté le
- 16 septembre 2026
- Sujets
- gpt-oss, kv-cache
Citée par 3 page(s)
KV cache : calcul et dimensionnementMulti-utilisateurs · Formule du KV cache, effet de GQA et MLA, quantification q8_0/q4_0, tableau d'estimations pour gpt-oss-120b, Qwen3-30B-A3B et Llama 70B à 8k/32k/128k, et impact du nombre de slots sur la mémoire.gpt-oss-120bModèle · MoE OpenAI de 117 Md (5,1 Md actifs) sous Apache 2.0 : le candidat principal de la Box, mesuré entre 30 et 56 t/s sur Strix Halo selon le runtime.gpt-oss-20bModèle · Petit frère de gpt-oss-120b (21 Md, 3,6 Md actifs, 11,3 Go en GGUF) : modèle de repli rapide ou de tâches secondaires, non mesuré sur Strix Halo dans nos sources.
Ce que dit la source
Architecture gpt-oss-120b : 36 couches, 64 têtes Q / 8 têtes KV, dim tête 64, attention alternée dense / fenêtre glissante 128, RoPE 128K.
Ce qu'on en retient
Paramètres utilisés pour le calcul du KV cache (borne haute).
Limites
À revérifier sur le config.json du modèle.