Tag
#deepseek
7 entrée(s) portent ce tag.
Sources
4
deepseek-ai/DeepSeek-R1 — fiche modèleSource · MoE 671 Md / 37 Md actifs avec MLA, contexte 128k, licence MIT ; distillations R1-Distill-Qwen-32B (Apache 2.0) et R1-Distill-Llama-70B (licence Llama.16 sept. 2026DeepSeek-V2 — Multi-head Latent Attention (arXiv 2405.04434)Source · MLA compresse le KV cache en un vecteur latent ; réduction de 93,3 % du KV cache par rapport à DeepSeek 67B.16 sept. 2026deepseek-ai/DeepSeek-V4-Flash — fiche modèleSource · MoE 284 Md / 13 Md actifs, FP4/FP8 natif, contexte 1 M, licence MIT.16 sept. 2026praveentechworld — AMD Strix Halo Local LLM Benchmarks: 128GB Unified Memory GuideSource · Bande passante effective environ 213 Go/s (« 75 à 80 % » d'un théorique annoncé à 273 Go/s) ; Llama 3.3 70B Q4_K_M (42,5 Go) 5,1 t/s en HIP ROCm 6.3+.16 sept. 2026