Source
Guide officiel llama.cpp : running gpt-oss (#15396)
Tailles GGUF : gpt-oss-20b 11,27 Go, gpt-oss-120b 59,02 Go ; mémoire d'environ 64 Go pour le 120b ; lancement avec --jinja, -c, -np et chat-template-k.
- Organisation
- ggml-org
- Auteur
- Georgi Gerganov
- Type
- GitHub
- Fiabilité
- Fiabilité haute
- Publié
- 2025-08
- Consulté le
- 16 septembre 2026
- Sujets
- gpt-oss, llama-cpp
Citée par 4 page(s)
llama.cpp et llama-serverInférence · Le moteur de départ de la Box : slots, contexte partagé, KV cache quantifié, flash attention, métriques Prometheus, images Docker ROCm/Vulkan et flags connus pour gfx1151.KV cache : calcul et dimensionnementMulti-utilisateurs · Formule du KV cache, effet de GQA et MLA, quantification q8_0/q4_0, tableau d'estimations pour gpt-oss-120b, Qwen3-30B-A3B et Llama 70B à 8k/32k/128k, et impact du nombre de slots sur la mémoire.gpt-oss-120bModèle · MoE OpenAI de 117 Md (5,1 Md actifs) sous Apache 2.0 : le candidat principal de la Box, mesuré entre 30 et 56 t/s sur Strix Halo selon le runtime.gpt-oss-20bModèle · Petit frère de gpt-oss-120b (21 Md, 3,6 Md actifs, 11,3 Go en GGUF) : modèle de repli rapide ou de tâches secondaires, non mesuré sur Strix Halo dans nos sources.
Ce que dit la source
Tailles GGUF : gpt-oss-20b 11,27 Go, gpt-oss-120b 59,02 Go ; mémoire d'environ 64 Go pour le 120b ; lancement avec --jinja, -c, -np et chat-template-kwargs reasoning_effort.
Ce qu'on en retient
Référence pour l'empreinte mémoire de gpt-oss sous llama.cpp et pour le format harmony via --jinja.
Limites
Guide d'août 2025 ; les flags peuvent avoir évolué.