Aller au contenu
Modèle

DeepSeek R1 (et distillations)

MoE de 671 Md sous MIT : impraticable sur 128 Go à taille complète ; seules les distillations 32B et 70B sont exécutables (11,2 t/s mesurés pour Distill-Qwen-32B).

Confirmée#deepseek#llama-cpp#kv-cachePublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026À revérifier le 15 déc. 2026

Fiche modèle

Fournisseur
DeepSeek
Famille
DeepSeek R1
Paramètres
671 Md (37 Md actifs)
Architecture
Mixture of Experts
Contexte
128k tokens
Licence
MIT
Sortie
20 janvier 2025
Mémoire Q4Estimation
≈ 380 Go
Appel d'outils
Oui
Raisonnement
Oui
Français
Inconnu
Quantifications
Q4 (impraticable), Distill-Qwen-32B Q4_K_M
Hugging Face
fiche modèle

Pourquoi ce modèle nous intéresse

DeepSeek R1 a popularisé les modèles de raisonnement ouverts sous licence MIT. Il sert ici de référence pour deux notions : l'impraticabilité des très grands MoE sur 128 Go, et l'attention latente (MLA) qui divise le KV cache par un facteur important.

Caractéristiques

MoE 671 Md / 37 Md actifs, MLA, contexte 128k 1. Environ 380 Go en Q4 (estimation) : trois fois la mémoire disponible. La date de sortie du frontmatter (20 janvier 2025) est conventionnelle ; la fiche couvre janvier à mai 2025.

MLA compresse clés et valeurs en un vecteur latent, avec une réduction de 93,3 % du KV cache par rapport à DeepSeek 67B 2. La formule standard du KV cache ne s'applique pas à ces modèles.

Distillations exécutables

ModèleLicenceTaille Q4Mesure Strix Halo
R1-Distill-Qwen-32BApache 2.019,8 Go11,2 t/s (Q4_K_M) 4
R1-Distill-Llama-70BLlama 3.3 Community Licenseenviron 42 Go (estimation)non trouvé ; attendu environ 5 t/s comme tout 70B dense

Ces distillations sont des modèles denses classiques (Qwen2.5 ou Llama) entraînés sur les sorties de R1 : ils n'ont pas MLA ni l'architecture MoE.

Successeur : DeepSeek V4

DeepSeek V4 Flash (284 Md / 13 Md actifs, MIT, contexte 1 M) 3 a été exécuté sur Strix Halo en UD-IQ2_XXS (90,86 Go) à 13,27 t/s 5 : praticable mais très quantifié et presque toute la mémoire.

Licence et usage commercial

MIT pour R1 et V4 ; Apache 2.0 pour Distill-Qwen-32B ; licence Llama pour Distill-Llama-70B.

Français

Non documenté.

Limites

Modèle complet impraticable. Distillations : raisonnement verbeux, lent sur un dense, qualité française inconnue.

À tester

Distill-Qwen-32B uniquement comme point de comparaison « raisonnement » face à Magistral Small et gpt-oss-120b high.

Sources

  1. 1deepseek-ai/DeepSeek-R1 — fiche modèleDocumentation officielleFiabilité hauteDeepSeek · publié 2025-01 → 2025-05 · consulté le 16 sept. 2026 · fiche source
  2. 2DeepSeek-V2 — Multi-head Latent Attention (arXiv 2405.04434)ÉtudeFiabilité hauteDeepSeek-AI · publié 2024-05 · consulté le 16 sept. 2026 · fiche source
  3. 3deepseek-ai/DeepSeek-V4-Flash — fiche modèleDocumentation officielleFiabilité hauteDeepSeek · publié 2026-04 · consulté le 16 sept. 2026 · fiche source
  4. 4praveentechworld — AMD Strix Halo Local LLM Benchmarks: 128GB Unified Memory GuideBlogFiabilité faiblepraveentechworld.com · Praveen · publié 2026-09-09 · consulté le 16 sept. 2026 · fiche source
  5. 5strix-halo-guide (README + BENCHMARKS.md)GitHubFiabilité moyenneGitHub (communauté) · hogeheer499 · publié 2026-03 → 2026-08-30 · consulté le 16 sept. 2026 · fiche source
content/models/deepseek-r1.md294 mots