Aller au contenu
Modèle

Mistral Small 3.2 (24B, 2506)

Dense 24 Md de Mistral AI, Apache 2.0, vision et function calling : l'option « éditeur français » de taille moyenne, environ 10 à 12 t/s en Q6 selon Framework.

À vérifier#mistral#llama-cppPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026À revérifier le 15 déc. 2026

Fiche modèle

Fournisseur
Mistral AI
Famille
Mistral Small
Paramètres
24 Md
Architecture
Dense
Contexte
128k tokens
Licence
Apache 2.0
Sortie
20 juin 2025
Mémoire Q4Estimation
≈ 15 Go
Mémoire Q8Estimation
≈ 25 Go
Appel d'outils
Oui
Raisonnement
Non
Français
Bon
Quantifications
Q4_K_M, Q6_K, Q8_0
Usage recommandé
rédaction en français, lecture de documents avec images
Hugging Face
fiche modèle

L'essentiel

  • Dense 24 Md avec vision, contexte 128k, Apache 2.0 1.
  • Éditeur français, ce qui compte pour l'argumentaire commercial et pour la qualité attendue en français (hypothèse : aucun score publié n'a été extrait).
  • Environ 14,5 Go en Q4 (estimation) : cohabite facilement avec un modèle principal plus gros.
  • Dense : génération bornée vers 12 à 15 t/s en Q4 sur Strix Halo (estimation ; 10 à 12 t/s mesurés en Q6 par Framework).

Pourquoi ce modèle nous intéresse

Pour un cabinet d'avocats, un modèle d'un éditeur français sous licence permissive est un argument de confiance. Sa taille permet de le charger en second modèle : rédaction de courriers, reformulation, lecture de pièces scannées grâce à la vision. La version 3.2 met l'accent sur la robustesse du function calling 1.

Caractéristiques

Dense 24 Md, vision, contexte 128k, function calling. Date de sortie : juin 2025 (jour du frontmatter conventionnel).

Licence et usage commercial

Apache 2.0, confirmé par le tableau des licences Mistral 2. Attention : tous les modèles Mistral ne sont pas Apache 2.0 (Medium 3 propriétaire ; Medium 3.5 et Devstral 2 en « Modified MIT »). Vérifier la licence par fiche.

Français

Multilingue ; éditeur français. Aucun score COLE ou CARTE extrait. Appréciation « good » = hypothèse raisonnable, à vérifier.

Performances publiées sur Strix Halo

Environ 10 t/s sous Windows et 12 t/s sous Linux en Q6_K sous LM Studio, donnée constructeur Framework 3. Aucun llama-bench indépendant trouvé. Estimation Q4 : 212 Go/s ÷ 14,5 Go ≈ 14 t/s.

Mémoire et contexte

Poids environ 14,5 Go en Q4, 25 Go en Q8 (estimation). Paramètres d'attention non relevés : KV cache à calculer depuis le config.json.

Limites

Dense : dix fois plus lent que gpt-oss-120b en génération pour une qualité vraisemblablement inférieure sur les tâches complexes (hypothèse). Pas de mode raisonnement (voir Magistral Small).

À tester

Qualité rédactionnelle française contre gpt-oss-120b et Qwen3-30B-A3B ; lecture de PDF scannés via la vision ; débit llama-bench Q4 et Q8.

Sources

  1. 1mistralai/Mistral-Small-3.2-24B-Instruct-2506 — fiche modèleDocumentation officielleFiabilité hauteMistral AI · publié 2025-06 · consulté le 16 sept. 2026 · fiche source
  2. 2Mistral AI — Models overview (licences)Documentation officielleFiabilité hauteMistral AI · publié 2026 · consulté le 16 sept. 2026 · fiche source
  3. 3Using a Framework Desktop for local AI (blog Framework)Constructeur / éditeurFiabilité moyenneFramework Computer Inc. · Nirav Patel · publié 2025-07-07 (màj 2025-12-02) · consulté le 16 sept. 2026 · fiche source
content/models/mistral-small-3-2.md329 mots