Aller au contenu
Modèle

gpt-oss-20b

Petit frère de gpt-oss-120b (21 Md, 3,6 Md actifs, 11,3 Go en GGUF) : modèle de repli rapide ou de tâches secondaires, non mesuré sur Strix Halo dans nos sources.

À vérifier#gpt-oss#llama-cppPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026À revérifier le 15 déc. 2026

Fiche modèle

Fournisseur
OpenAI
Famille
gpt-oss
Paramètres
21 Md (3,6 Md actifs)
Architecture
Mixture of Experts
Contexte
128k tokens
Licence
Apache 2.0 (+ gpt-oss usage policy)
Sortie
5 août 2025
Format natif
MXFP4 (GGUF 11,27 Go)
Mémoire Q4Estimation
≈ 11 Go
Appel d'outils
Oui
Raisonnement
Optionnel
Français
Inconnu
Quantifications
MXFP4
Usage recommandé
tâches secondaires (titres, résumés courts), modèle de repli, tests de charge
Hugging Face
fiche modèle

Pourquoi ce modèle nous intéresse

Même famille, même format harmony, mêmes capacités d'outils que gpt-oss-120b, pour 11,27 Go en GGUF 3. Il peut servir de modèle secondaire chargé en parallèle du modèle principal : génération de titres de conversation, reformulation de requêtes pour le RAG, classification. Avec 3,6 Md de paramètres actifs, sa génération devrait être nettement plus rapide que celle du 120b (estimation par la formule bande passante / poids actifs ; aucune mesure Strix Halo trouvée).

Caractéristiques

  • MoE 21 Md total, 3,6 Md actifs ; contexte 128k ; MXFP4 sur les experts 2.
  • Function calling, structured outputs, raisonnement réglable 1.
  • « Fits in a single 16GB GPU » selon Hugging Face 2.

Licence et usage commercial

Apache 2.0 avec la même « usage policy » complémentaire que le 120b 1.

Français

Non vérifié : langues non listées.

Performances publiées sur Strix Halo

Non trouvé dans les sources consultées.

Mémoire et contexte

Poids 11,3 Go. KV cache : paramètres d'architecture (couches, têtes KV) non extraits dans cette recherche ; estimation à faire à partir du config.json.

Limites

Qualité attendue inférieure au 120b ; intérêt principal : vitesse et faible empreinte. Pas de mesure locale.

À tester

Débit mono et multi-utilisateurs, cohabitation en mémoire avec le 120b, qualité des tâches secondaires en français.

content/models/gpt-oss-20b.md214 mots