Aller au contenu
Source

Hugging Face — Welcome GPT OSS

Architecture gpt-oss-120b : 36 couches, 64 têtes Q / 8 têtes KV, dim tête 64, attention alternée dense / fenêtre glissante 128, RoPE 128K.

Confirmée#gpt-oss#kv-cachePublié le 16 sept. 2026Mis à jour le 16 sept. 2026
Organisation
Hugging Face
Type
Article technique
Fiabilité
Fiabilité haute
Publié
2025-08-05
Consulté le
16 septembre 2026
Sujets
gpt-oss, kv-cache

Citée par 3 page(s)

Ce que dit la source

Architecture gpt-oss-120b : 36 couches, 64 têtes Q / 8 têtes KV, dim tête 64, attention alternée dense / fenêtre glissante 128, RoPE 128K.

Ce qu'on en retient

Paramètres utilisés pour le calcul du KV cache (borne haute).

Limites

À revérifier sur le config.json du modèle.

content/sources/huggingface-welcome-gpt-oss.md51 mots