Aller au contenu
Modèle

Qwen3-Embedding (0.6B / 4B / 8B)

Famille d'embeddings Alibaba (juin 2025), contexte 32k, dimensions réglables jusqu'à 4096, plus de 100 langues, Apache 2.0 : le 8B est le plus puissant mais le plus lourd à servir.

À vérifier#embeddings#rag#qwenPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026À revérifier le 15 déc. 2026

Fiche modèle

Fournisseur
Alibaba Qwen
Famille
Qwen3-Embedding
Paramètres
0,6 / 4 / 8 Md
Architecture
Embedding
Contexte
32k tokens
Licence
Apache 2.0
Sortie
5 juin 2025
Mémoire Q8Estimation
≈ 8 Go
Mémoire FP16Estimation
≈ 16 Go
Appel d'outils
Non
Raisonnement
Non
Français
Bon
Quantifications
f16, Q8_0
Usage recommandé
embeddings à long contexte, qualité maximale de recherche
Hugging Face
fiche modèle

Pourquoi cette famille nous intéresse

Trois tailles (0,6 / 4 / 8 Md), dimensions 1024 / 2560 / 4096 réglables de 32 au maximum, contexte 32k, plus de 100 langues, Apache 2.0 1. Le contexte de 32k permet d'embarquer des sections entières de contrat sans chunking agressif. Le frontmatter décrit le 8B.

Caractéristiques et mémoire

Le 8B pèse environ 16 Go en f16, 8 Go en Q8 (estimation) : c'est un LLM décodeur utilisé comme encodeur, donc bien plus coûteux à l'indexation que bge-m3 (568 M). Le 0.6B (environ 1,2 Go) est l'alternative économique de la même famille. Dépôt et exemples d'intégration 2.

Licence

Apache 2.0.

Français

Multilingue ; à mesurer.

Performances publiées sur Strix Halo

Non trouvé.

Limites et à tester

Coût d'indexation et cohabitation mémoire avec le LLM principal ; comparer rappel et temps d'indexation 0.6B vs 8B vs bge-m3 sur 10 000 pages.

content/models/qwen3-embedding-8b.md146 mots