Tag
#gpt-oss
25 entrée(s) portent ce tag.
Matériel
2
HP Z2 Mini G1a (Ryzen AI Max+ PRO 395, 128 Go)Matériel · Station compacte HP sur Strix Halo PRO : seule machine 128 Go de la famille à annoncer de la mémoire ECC et un support professionnel, à un prix proche du Framework (3 342 à 3 734 $).16 sept. 2026NVIDIA DGX Spark (GB10)Matériel · Mini-station NVIDIA à 128 Go de mémoire unifiée et 273 Go/s : même classe de bande passante que le Framework Desktop mais avec CUDA, un prompt processing très supérieur et un prix passé à 4 699 $ en février 2026.16 sept. 2026
Modèles
2
gpt-oss-120bModèle · MoE OpenAI de 117 Md (5,1 Md actifs) sous Apache 2.0 : le candidat principal de la Box, mesuré entre 30 et 56 t/s sur Strix Halo selon le runtime.16 sept. 2026gpt-oss-20bModèle · Petit frère de gpt-oss-120b (21 Md, 3,6 Md actifs, 11,3 Go en GGUF) : modèle de repli rapide ou de tâches secondaires, non mesuré sur Strix Halo dans nos sources.16 sept. 2026
Benchmarks
4
gpt-oss-120b Q4_K_M — llama-server ROCm — 53,4 t/s (visorcraft)Benchmark · gpt-oss-120b sous llama-server avec backend ROCm sur un mini-PC Strix Halo : 53,4 t/s en génération.16 sept. 2026gpt-oss-120b MXFP4 — llama.cpp Vulkan RADV b9049 — 55,6 t/s (hogeheer)Benchmark · Meilleure mesure publiée de gpt-oss-120b sur Strix Halo : 55,57 t/s en génération et 727 t/s en prompt processing, Vulkan RADV, Beelink GTR9 Pro.16 sept. 2026gpt-oss-120b — LM Studio (runtime ROCm llama.cpp) — environ 30 t/s (MindStudio)Benchmark · gpt-oss-120b servi par LM Studio avec le runtime ROCm : environ 30 t/s, soit près de la moitié des mesures llama.cpp directes. Contradiction documentée.16 sept. 2026gpt-oss-120b MXFP4 — llama.cpp ROCm 7.2.0 (fork Lychee b8182) — 51,1 t/s (Pellegrini)Benchmark · gpt-oss-120b sous ROCm 7.2.0 avec un fork llama.cpp : 51,1 t/s en génération, 174 t/s en prompt (charge applicative), environ 59 Go GPU, pic 140 W.16 sept. 2026
Expérimentations
4
Benchmark gpt-oss-120b à 1 utilisateur : Vulkan vs ROCm, contexte court et longExpérimentation · Reproduire sur le Framework Desktop les 51 à 56 t/s publiés pour gpt-oss-120b, comparer les deux backends et mesurer la dégradation à 4k et 32k de profondeur.16 sept. 2026Montée en charge de 1 à 10 utilisateurs : gpt-oss-120b et Qwen3-30B-A3BExpérimentation · Mesurer le débit par utilisateur, l'agrégé et le TTFT p95 à 1, 2, 3, 5 et 10 clients simultanés avec des prompts français courts, RAG et dossiers, pour remplir la matrice de capacité.16 sept. 2026Comparer la qualité en français des modèles candidatsExpérimentation · Évaluer en aveugle gpt-oss-120b, Qwen3-30B-A3B, Mistral Small 3.2 / 4, Gemma 3 27B, Llama 3.3 70B et les modèles européens sur des tâches juridiques françaises : rédaction, synthèse, citation fidèle, refus d'inventer.16 sept. 2026Comparer Vulkan/RADV et ROCm/HIP dans llama.cppExpérimentation · Mesurer sur nos modèles cibles et nos longueurs de prompt RAG le débit de prompt processing et de génération des deux backends GPU de llama.cpp, pour trancher Q-008.16 sept. 2026
Questions
2
Quelle quantification retenir pour le modèle principal ?Question · Arbitrage entre qualité (Q8/MXFP4 natif), mémoire disponible pour le KV cache multi-utilisateur et vitesse.16 sept. 2026Quel modèle principal pour le cabinet d'avocats ?Question · gpt-oss-120b est le candidat par défaut (MoE, Apache 2.0, 61 Go) ; Qwen3 235B-A22B et les Mistral récents sont à comparer sur des tâches juridiques en français.16 sept. 2026
Sources
4
Guide officiel llama.cpp : running gpt-oss (#15396)Source · Tailles GGUF : gpt-oss-20b 11,27 Go, gpt-oss-120b 59,02 Go ; mémoire d'environ 64 Go pour le 120b ; lancement avec --jinja, -c, -np et chat-template-k.16 sept. 2026Hugging Face — Welcome GPT OSSSource · Architecture gpt-oss-120b : 36 couches, 64 têtes Q / 8 têtes KV, dim tête 64, attention alternée dense / fenêtre glissante 128, RoPE 128K.16 sept. 2026openai/gpt-oss-120b — fiche modèleSource · 117 Md de paramètres dont 5,1 Md actifs ; Apache 2.0 avec une « small complementary use policy » ; function calling, navigation web, exécution Python.16 sept. 2026unsloth/gpt-oss-120b-GGUFSource · Tailles GGUF : F16 65,4 Go, Q8_0 63,4 Go, Q4_K_M 62,8 Go (les experts restent en MXFP4).16 sept. 2026
Glossaire
6
Function calling (appel d'outils)Terme · Capacité d'un modèle à produire, au lieu d'une réponse en texte libre, un appel structuré à une fonction externe (recherche, calcul, requête) dont le résultat lui est ensuite renvoyé.16 sept. 2026LLM (grand modèle de langage)Terme · Réseau de neurones entraîné sur de très grands volumes de texte pour prédire le token suivant, capable de comprendre et de produire du langage naturel.16 sept. 2026MoE (mélange d'experts)Terme · Architecture de modèle dans laquelle chaque token n'active qu'une petite partie des paramètres (quelques « experts » choisis par un routeur), ce qui réduit le calcul et la lecture mémoire par token.16 sept. 2026MXFP4Terme · Format numérique à 4 bits en virgule flottante avec facteurs d'échelle partagés par blocs, utilisé notamment par les modèles gpt-oss pour leurs couches d'experts.16 sept. 2026Paramètres actifsTerme · Nombre de paramètres effectivement utilisés pour traiter un token dans un modèle à mélange d'experts, par opposition au nombre total de paramètres stockés.16 sept. 2026QuantificationTerme · Réduction de la précision numérique des poids d'un modèle (par exemple de 16 bits à 4 bits) pour diminuer sa taille en mémoire et accélérer l'inférence, au prix d'une perte de qualité généralement faible.16 sept. 2026