Qwen3-Embedding (0.6B / 4B / 8B)
Famille d'embeddings Alibaba (juin 2025), contexte 32k, dimensions réglables jusqu'à 4096, plus de 100 langues, Apache 2.0 : le 8B est le plus puissant mais le plus lourd à servir.
Fiche modèle
- Fournisseur
- Alibaba Qwen
- Famille
- Qwen3-Embedding
- Paramètres
- 0,6 / 4 / 8 Md
- Architecture
- Embedding
- Contexte
- 32k tokens
- Licence
- Apache 2.0
- Sortie
- 5 juin 2025
- Mémoire Q8Estimation
- ≈ 8 Go
- Mémoire FP16Estimation
- ≈ 16 Go
- Appel d'outils
- Non
- Raisonnement
- Non
- Français
- Bon
- Quantifications
- f16, Q8_0
- Usage recommandé
- embeddings à long contexte, qualité maximale de recherche
- Hugging Face
- fiche modèle
Pourquoi cette famille nous intéresse
Trois tailles (0,6 / 4 / 8 Md), dimensions 1024 / 2560 / 4096 réglables de 32 au maximum, contexte 32k, plus de 100 langues, Apache 2.0 1. Le contexte de 32k permet d'embarquer des sections entières de contrat sans chunking agressif. Le frontmatter décrit le 8B.
Caractéristiques et mémoire
Le 8B pèse environ 16 Go en f16, 8 Go en Q8 (estimation) : c'est un LLM décodeur utilisé comme encodeur, donc bien plus coûteux à l'indexation que bge-m3 (568 M). Le 0.6B (environ 1,2 Go) est l'alternative économique de la même famille. Dépôt et exemples d'intégration 2.
Licence
Apache 2.0.
Français
Multilingue ; à mesurer.
Performances publiées sur Strix Halo
Non trouvé.
Limites et à tester
Coût d'indexation et cohabitation mémoire avec le LLM principal ; comparer rappel et temps d'indexation 0.6B vs 8B vs bge-m3 sur 10 000 pages.
Sources
- 1Qwen/Qwen3-Embedding-0.6B — fiche modèle (famille 0.6B / 4B / 8B)Documentation officielleFiabilité hauteAlibaba Qwen · publié 2025-06-05 · consulté le 16 sept. 2026 · fiche source
- 2QwenLM/Qwen3-Embedding — dépôt GitHubGitHubFiabilité hauteAlibaba Qwen · publié 2025 · consulté le 16 sept. 2026 · fiche source