bge-m3 (embeddings)
Embedding multilingue BAAI de 568 M de paramètres, dimension 1024, contexte 8192, MIT : le candidat par défaut pour le RAG de la Box.
Fiche modèle
- Fournisseur
- BAAI
- Famille
- BGE
- Paramètres
- 568 M
- Architecture
- Embedding
- Contexte
- 8k tokens
- Licence
- MIT
- Sortie
- 1 février 2024
- Mémoire FP16Estimation
- ≈ 1 Go
- Appel d'outils
- Non
- Raisonnement
- Non
- Français
- Bon
- Quantifications
- f16, Q8_0
- Usage recommandé
- embeddings RAG multilingues, recherche hybride dense + sparse
- Hugging Face
- fiche modèle
Pourquoi ce modèle nous intéresse
bge-m3 produit des embeddings denses de dimension 1024, mais aussi des représentations sparse (lexicales) et multi-vecteurs (ColBERT), à partir d'un encodeur XLM-R de 568 M de paramètres ; contexte 8192 tokens, plus de 100 langues, licence MIT 1. La combinaison dense + sparse dans un même modèle simplifie la recherche hybride.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Paramètres | 568 M |
| Dimension | 1024 (dense) ; sparse et ColBERT en option |
| Contexte | 8192 tokens |
| Langues | plus de 100 |
Mémoire : environ 1,2 Go en f16 (estimation : 568 M × 2 octets). Servable par llama-server (/v1/embeddings) 2 ou par un service dédié.
Licence et usage commercial
MIT.
Français
Multilingue, largement utilisé en français ; qualité sur du texte juridique à mesurer sur notre corpus.
Performances publiées sur Strix Halo
Non trouvé. La charge d'indexation (des milliers de chunks) est du prompt processing pur : à mesurer.
Limites et à tester
Date de sortie conventionnelle (février 2024). Tester : rappel sur 50 questions de dossiers, coût d'indexation d'un corpus de 10 000 pages, cohabitation mémoire avec le LLM principal.
Sources
- 1BAAI/bge-m3 — fiche modèleDocumentation officielleFiabilité hauteBAAI · publié 2024-02 · consulté le 16 sept. 2026 · fiche source
- 2llama.cpp — README de llama-server (tools/server)GitHubFiabilité hauteggml-org · publié 2026 (master) · consulté le 16 sept. 2026 · fiche source