Aller au contenu
Modèle

Qwen3-Reranker (0.6B / 4B / 8B)

Famille de rerankers Alibaba (juin 2025), contexte 32k, plus de 100 langues, Apache 2.0 : plus puissante que bge-reranker mais plus coûteuse par passage.

À vérifier#reranking#rag#qwenPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026À revérifier le 15 déc. 2026

Fiche modèle

Fournisseur
Alibaba Qwen
Famille
Qwen3-Reranker
Paramètres
0,6 / 4 / 8 Md
Architecture
Reranker
Contexte
32k tokens
Licence
Apache 2.0
Sortie
5 juin 2025
Mémoire Q8Estimation
≈ 8 Go
Mémoire FP16Estimation
≈ 16 Go
Appel d'outils
Non
Raisonnement
Non
Français
Bon
Quantifications
f16, Q8_0
Usage recommandé
reranking de passages longs
Hugging Face
fiche modèle

Pourquoi cette famille nous intéresse

Rerankers de 0,6 / 4 / 8 Md produisant un score yes/no, contexte 32k, plus de 100 langues, Apache 2.0 1. Le contexte long permet de réordonner des passages de plusieurs pages (conclusions, jugements) sans les tronquer. Le frontmatter décrit le 8B.

Caractéristiques et mémoire

Le 8B pèse environ 16 Go en f16, 8 Go en Q8 (estimation) ; chaque paire question-passage est un passage avant d'un LLM de 8 Md : pour 20 passages de 1 000 tokens, c'est 20 000 tokens de prompt processing par requête (estimation), ce qui pèse sur le TTFT. Le 0.6B est l'option raisonnable pour la Box ; le 8B, un test de qualité. Dépôt commun 2.

Licence

Apache 2.0.

Performances publiées sur Strix Halo

Non trouvé.

À tester

Précision et latence 0.6B vs 8B vs bge-reranker-v2-m3 sur les mêmes 50 questions.

content/models/qwen3-reranker-8b.md144 mots