DeepSeek R1 (et distillations)
MoE de 671 Md sous MIT : impraticable sur 128 Go à taille complète ; seules les distillations 32B et 70B sont exécutables (11,2 t/s mesurés pour Distill-Qwen-32B).
Fiche modèle
- Fournisseur
- DeepSeek
- Famille
- DeepSeek R1
- Paramètres
- 671 Md (37 Md actifs)
- Architecture
- Mixture of Experts
- Contexte
- 128k tokens
- Licence
- MIT
- Sortie
- 20 janvier 2025
- Mémoire Q4Estimation
- ≈ 380 Go
- Appel d'outils
- Oui
- Raisonnement
- Oui
- Français
- Inconnu
- Quantifications
- Q4 (impraticable), Distill-Qwen-32B Q4_K_M
- Hugging Face
- fiche modèle
Pourquoi ce modèle nous intéresse
DeepSeek R1 a popularisé les modèles de raisonnement ouverts sous licence MIT. Il sert ici de référence pour deux notions : l'impraticabilité des très grands MoE sur 128 Go, et l'attention latente (MLA) qui divise le KV cache par un facteur important.
Caractéristiques
MoE 671 Md / 37 Md actifs, MLA, contexte 128k 1. Environ 380 Go en Q4 (estimation) : trois fois la mémoire disponible. La date de sortie du frontmatter (20 janvier 2025) est conventionnelle ; la fiche couvre janvier à mai 2025.
MLA compresse clés et valeurs en un vecteur latent, avec une réduction de 93,3 % du KV cache par rapport à DeepSeek 67B 2. La formule standard du KV cache ne s'applique pas à ces modèles.
Distillations exécutables
| Modèle | Licence | Taille Q4 | Mesure Strix Halo |
|---|---|---|---|
| R1-Distill-Qwen-32B | Apache 2.0 | 19,8 Go | 11,2 t/s (Q4_K_M) 4 |
| R1-Distill-Llama-70B | Llama 3.3 Community License | environ 42 Go (estimation) | non trouvé ; attendu environ 5 t/s comme tout 70B dense |
Ces distillations sont des modèles denses classiques (Qwen2.5 ou Llama) entraînés sur les sorties de R1 : ils n'ont pas MLA ni l'architecture MoE.
Successeur : DeepSeek V4
DeepSeek V4 Flash (284 Md / 13 Md actifs, MIT, contexte 1 M) 3 a été exécuté sur Strix Halo en UD-IQ2_XXS (90,86 Go) à 13,27 t/s 5 : praticable mais très quantifié et presque toute la mémoire.
Licence et usage commercial
MIT pour R1 et V4 ; Apache 2.0 pour Distill-Qwen-32B ; licence Llama pour Distill-Llama-70B.
Français
Non documenté.
Limites
Modèle complet impraticable. Distillations : raisonnement verbeux, lent sur un dense, qualité française inconnue.
À tester
Distill-Qwen-32B uniquement comme point de comparaison « raisonnement » face à Magistral Small et gpt-oss-120b high.
Sources
- 1deepseek-ai/DeepSeek-R1 — fiche modèleDocumentation officielleFiabilité hauteDeepSeek · publié 2025-01 → 2025-05 · consulté le 16 sept. 2026 · fiche source
- 2DeepSeek-V2 — Multi-head Latent Attention (arXiv 2405.04434)ÉtudeFiabilité hauteDeepSeek-AI · publié 2024-05 · consulté le 16 sept. 2026 · fiche source
- 3deepseek-ai/DeepSeek-V4-Flash — fiche modèleDocumentation officielleFiabilité hauteDeepSeek · publié 2026-04 · consulté le 16 sept. 2026 · fiche source
- 4praveentechworld — AMD Strix Halo Local LLM Benchmarks: 128GB Unified Memory GuideBlogFiabilité faiblepraveentechworld.com · Praveen · publié 2026-09-09 · consulté le 16 sept. 2026 · fiche source
- 5strix-halo-guide (README + BENCHMARKS.md)GitHubFiabilité moyenneGitHub (communauté) · hogeheer499 · publié 2026-03 → 2026-08-30 · consulté le 16 sept. 2026 · fiche source