Qwen3-Reranker (0.6B / 4B / 8B)
Famille de rerankers Alibaba (juin 2025), contexte 32k, plus de 100 langues, Apache 2.0 : plus puissante que bge-reranker mais plus coûteuse par passage.
Fiche modèle
- Fournisseur
- Alibaba Qwen
- Famille
- Qwen3-Reranker
- Paramètres
- 0,6 / 4 / 8 Md
- Architecture
- Reranker
- Contexte
- 32k tokens
- Licence
- Apache 2.0
- Sortie
- 5 juin 2025
- Mémoire Q8Estimation
- ≈ 8 Go
- Mémoire FP16Estimation
- ≈ 16 Go
- Appel d'outils
- Non
- Raisonnement
- Non
- Français
- Bon
- Quantifications
- f16, Q8_0
- Usage recommandé
- reranking de passages longs
- Hugging Face
- fiche modèle
Pourquoi cette famille nous intéresse
Rerankers de 0,6 / 4 / 8 Md produisant un score yes/no, contexte 32k, plus de 100 langues, Apache 2.0 1. Le contexte long permet de réordonner des passages de plusieurs pages (conclusions, jugements) sans les tronquer. Le frontmatter décrit le 8B.
Caractéristiques et mémoire
Le 8B pèse environ 16 Go en f16, 8 Go en Q8 (estimation) ; chaque paire question-passage est un passage avant d'un LLM de 8 Md : pour 20 passages de 1 000 tokens, c'est 20 000 tokens de prompt processing par requête (estimation), ce qui pèse sur le TTFT. Le 0.6B est l'option raisonnable pour la Box ; le 8B, un test de qualité. Dépôt commun 2.
Licence
Apache 2.0.
Performances publiées sur Strix Halo
Non trouvé.
À tester
Précision et latence 0.6B vs 8B vs bge-reranker-v2-m3 sur les mêmes 50 questions.
Sources
- 1Qwen/Qwen3-Reranker-0.6B — fiche modèle (famille 0.6B / 4B / 8B)Documentation officielleFiabilité hauteAlibaba Qwen · publié 2025-06-05 · consulté le 16 sept. 2026 · fiche source
- 2QwenLM/Qwen3-Embedding — dépôt GitHubGitHubFiabilité hauteAlibaba Qwen · publié 2025 · consulté le 16 sept. 2026 · fiche source