Modèles d’embedding locaux (auto-hébergés)
Les modèles d’embedding de texte ouverts et auto-hébergeables pour un système RAG local : dimensions, longueur de contexte, score MTEB, VRAM et disponibilité sur Ollama. Triés par VRAM. Les noms de modèles, scores et licences restent en anglais, source unique.
Réponse rapide
Un système RAG auto-hébergé (« discuter avec vos propres documents ») a trois couches : un modèle d'EMBEDDING qui transforme le texte en vecteurs, une base de données vectorielle qui les stocke et les recherche, et un LLM local qui rédige la réponse. Ce tableau compare la première couche — 20 modèles d'embedding de texte ouverts et auto-hébergeables — par dimensions d'embedding, longueur de contexte, score au banc d'essai MTEB, VRAM et possibilité de les récupérer directement depuis Ollama. Il est trié par VRAM (ce qui tient sur votre matériel), du plus petit d'abord : plus gros n'est pas automatiquement meilleur — un petit modèle qui tient sur votre GPU et indexe vite bat souvent un géant de classement que vous peinez à faire tourner.
Choix honnêtes pour 2026 : pour le démarrage local le plus simple, nomic-embed-text se récupère depuis Ollama et tourne en ~0,3 Go ; le meilleur rapport qualité/VRAM est Qwen3-Embedding-0.6B (70,7 sur MTEB-eng-v2, Apache-2.0, ~1,5 Go, natif Ollama), jusqu'à Qwen3-Embedding-8B si vous avez le GPU ; pour le multilingue + la recherche hybride dense/creuse, bge-m3 (MIT, contexte 8K, 100+ langues) ; l'option la plus légère en CPU seul est all-MiniLM-L6-v2 (~0,1 Go). Un piège : NV-Embed-v2 et jina-embeddings-v3 dominent leurs classements mais sont sous CC-BY-NC — PAS utilisables pour un RAG commercial. Et les scores MTEB ne sont comparables QU'AU SEIN du même banc d'essai (English 56-task vs MTEB-eng-v2 vs MMTEB multilingue sont des échelles différentes — lisez le banc d'essai dans chaque cellule). CSV/JSON gratuits sous CC BY 4.0.
Télécharger le CSV Télécharger le JSON API REST →
Ollama = un seul ollama pull. Les scores MTEB portent leur banc d'essai ; ne comparez qu'au sein du même. ~ = confiance moindre.
| Modèle | Paramètres | Dims | Contexte | MTEB | VRAM | Ollama | Licence | Meilleur usage |
|---|---|---|---|---|---|---|---|---|
| all-MiniLM-L6-v2 sentence-transformers | 22.7M | 384 | 256 | 56.26 MTEB(eng) ORIGINAL 56-task mean ~56.26 (leaderboard, NOT on card; card lists only ArguAna 50.17) | 0.1 GB | all-minilm | Apache-2.0 | Ultra-light CPU-only RAG, prototyping, very high throughput; weakest accuracy + short 256-token limit. Ollama all-minilm:latest = :22m = this (L6-v2); :33m = L12-v2 |
| nomic-embed-text-v1.5 Nomic AI | 137M | 768 ↓ 512, 256, 128, 64 | 8,192 | 62.28 MTEB(eng) ORIGINAL 56-task mean = 62.28 (full 768-dim) | 0.3 GB | nomic-embed-text | Apache-2.0 | Default general-purpose English RAG on modest hardware; long 8K docs + MRL dimension truncation. NB: Ollama shows a 2K default num_ctx but the model max is 8192 — raise num_ctx |
| granite-embedding-278m-multilingual ML IBM | 278M | 768 | 512 | 48.2 MTEB(eng) Retrieval mean = 48.2; MIRACL 18-lang mean = 58.3 (IBM Granite Embedding paper) — retrieval-only, NOT full MTEB means | 0.6 GB | granite-embedding:278m | Apache-2.0 | Lightweight, truly-open (Apache-2.0) multilingual retrieval; tiny+fast, but only 12 languages and 512-token window. MUST pull granite-embedding:278m — bare/:latest/:30m is the 30M English-only model |
| paraphrase-multilingual-mpnet-base-v2 ML sentence-transformers | 278M | 768 | 512 | — Not on modern MTEB/MMTEB leaderboards — a legacy STS/paraphrase model predating MTEB-era retrieval benchmarking (expect materially weaker retrieval than E5/BGE/Granite) | 0.6 GB | paraphrase-multilingual | Apache-2.0 | Tiny, CPU-friendly multilingual semantic similarity / clustering / dedup; pull-and-go on Ollama (paraphrase-multilingual:278m), but weak for precision RAG. Model max 512 tokens though ST truncates to 128 by default |
| mxbai-embed-large-v1 mixedbread.ai | 335M | 1024 ↓ 512, 256 (MRL; supports arbitrary truncate_dim + binary/int8 quant) | 512 | 64.68 MTEB(eng) ORIGINAL 56-task mean = 64.68 | 0.7 GB | mxbai-embed-large | Apache-2.0 | Strong English retrieval; was SOTA for BERT-large size (Mar 2024); needs a retrieval query prompt prefix ('Represent this sentence for searching relevant passages:') |
| bge-large-en-v1.5 BAAI | 335M | 1024 | 512 | 64.23 MTEB(eng) ORIGINAL 56-task mean = 64.23 | 0.7 GB | bge-large | MIT | Proven, permissive (MIT, commercial-OK) English RAG baseline; short 512-token chunks; prepend the retrieval instruction to queries. Ollama bge-large:335m = this model |
| nomic-embed-text-v2-moe ML Nomic AI | 475M total / 305M active | 768 ↓ 256 (768->256) | 512 | 65.8 MIRACL nDCG@10 mean = 65.80 (multilingual); BEIR = 52.86 (English) — model-card retrieval numbers, NOT an MTEB mean | 1 GB | nomic-embed-text-v2-moe | Apache-2.0 | Multilingual RAG wanting big-model retrieval quality at small active-param (305M) inference cost; first general-purpose MoE embedder |
| multilingual-e5-large-instruct ML Microsoft (intfloat) | 560M | 1024 | 512 | 63.2 MMTEB multilingual mean ~63.2 (132 tasks) — ranked #1 among open models in the MMTEB paper | 1.1 GB | — | MIT | Top open MMTEB-multilingual retrieval at 560M; needs a query instruction prefix for peak quality; 512-token window. Only community (not official) Ollama uploads |
| multilingual-e5-large ML Microsoft (intfloat) | 560M | 1024 | 512 | 58.6 MMTEB multilingual mean ~58.6 (132 tasks) — ranked 4th in the MMTEB paper | 1.1 GB | — | MIT | Proven permissive multilingual RAG workhorse; no instructions, just query:/passage: prefixes; the safe MIT default — but 512-token window and only community (not official) Ollama uploads |
| bge-m3 ML BAAI | 568M | 1024 | 8,192 | 59.56 No single MTEB scalar on card — headline is MIRACL(18-lang)+MKQA(25-lang) SOTA. Community-reported MMTEB multilingual mean ~59.56. Uniquely does dense + sparse + ColBERT multi-vector in one model | 1.2 GB | bge-m3 | MIT | The self-host multi-vector specialist: ONE model doing dense + sparse (lexical) + native ColBERT-style late-interaction, 8K context — ideal for hybrid RAG + rerank. Ollama tag bge-m3:567m |
| jina-embeddings-v3 ML Jina AI | 570M | 1024 ↓ 32-1024 | 8,192 | 65.52 MTEB English mean ~65.52 (jina-reported, ~56-task original MTEB) — NOT multilingual MMTEB | 1.2 GB | — | CC-BY-NC-4.0 non commercial | Excellent all-round multilingual dense retrieval: 8K context, task-LoRA + Matryoshka to 32d — BUT CC-BY-NC-4.0 blocks commercial use (contact Jina); late-interaction is a separate model (jina-colbert-v2) |
| snowflake-arctic-embed-l-v2.0 ML Snowflake | 568M total (303M non-embedding) | 1024 ↓ 256 (MRL + quantization-aware; ~128 bytes/vector) | 8,192 | 55.6 MTEB(eng) Retrieval nDCG@10 ~55.6 (retrieval-only, NOT a full MTEB mean); multilingual MIRACL nDCG@10 ~64.9 | 1.2 GB | snowflake-arctic-embed2 | Apache-2.0 | Multilingual long-context RAG that must not sacrifice English retrieval; compressible (MRL+quant) vectors. Ollama tag snowflake-arctic-embed2:568m |
| Qwen3-Embedding-0.6B ML Alibaba (Qwen) | 0.6B | 1024 ↓ 32-1024 (MRL, user-defined output dim) | 32,768 | 70.7 MTEB(eng, v2) mean = 70.70 (card table); MMTEB multilingual mean = 64.33 | 1.5 GB | qwen3-embedding:0.6b | Apache-2.0 | Best quality-per-VRAM small embedder — 70.7 MTEB(eng,v2) at ~1.5GB fp16, 32K context, Ollama-native; strong CPU/edge RAG |
| gte-large-en-v1.5 Alibaba (Tongyi) | 434M | 1024 | 8,192 | 65.39 MTEB(eng) ORIGINAL 56-task mean = 65.39 (SOTA within size class at release) | 1.5 GB | — | Apache-2.0 | Best small-footprint 8K-context English encoder — cheap/fast to serve at ~1.5GB; ideal high-throughput RAG default. Not in the official Ollama library |
| stella_en_1.5B_v5 NovaSearch | 1.5B | 1024 ↓ 512, 768, 1024, 2048, 4096, 6144, 8192 (separate trained projection heads; 1024 recommended) | 512 | 69.43 MTEB(eng, v2) mean ~69.43 (leaderboard; NOT on card). On the OLDER 56-task board it was ~71.19 — different benchmark, don't mix | 3.5 GB | — | MIT | Efficient English RAG with flexible output dims — near-7B quality at ~1.5B/3.5GB; but only 512-token inputs (chunk small); no official Ollama tag |
| Qwen3-Embedding-4B ML Alibaba (Qwen) | 4B | 2560 ↓ 32-2560 (MRL, user-defined output dim) | 32,768 | 74.6 MTEB(eng, v2) mean = 74.60 (card table); MMTEB multilingual mean = 69.45 | 9 GB | qwen3-embedding:4b | Apache-2.0 | Mid-tier multilingual RAG when 0.6B underfits but a 7-8B model won't fit the GPU; ~9GB fp16 |
| gte-Qwen2-7B-instruct ML Alibaba (Tongyi) | 7B | 3584 | 32,768 | 70.24 MTEB(eng) ORIGINAL 56-task mean = 70.24 (Jun 16 2024); C-MTEB (Chinese, 35 tasks) = 72.05 — not comparable to v2 boards | 15 GB | — | Apache-2.0 | Strong bilingual EN/ZH retrieval, 32K context, commercial-friendly Apache-2.0 (2024-era SOTA); no official Ollama tag |
| e5-mistral-7b-instruct Microsoft (intfloat) | 7B | 4096 | 4,096 | 66.63 MTEB(eng) ORIGINAL 56-task mean = 66.63 (arXiv:2401.00368; NOT stated on HF card — from the paper) | 15 GB | — | MIT | The original LLM-as-embedder; proven MIT-licensed English 7B retriever, but now superseded by Qwen3/gte-Qwen2. Max input 4096 tokens (not 32K) |
| NV-Embed-v2 NVIDIA | 7.85B | 4096 | 32,768 | 72.31 MTEB(eng) ORIGINAL 56-task mean = 72.31 (Aug 2024, #1 at launch) — NOT comparable to Qwen3's MTEB(eng,v2) | 16 GB | — | CC-BY-NC-4.0 non commercial | Highest raw score on the original 56-task English MTEB — but CC-BY-NC-4.0 explicitly forbids commercial use; research/eval only, NOT for commercial RAG |
| Qwen3-Embedding-8B ML Alibaba (Qwen) | 8B | 4096 ↓ 32-4096 (MRL, user-defined output dim) | 32,768 | 75.22 MTEB(eng, v2) mean = 75.22 (card table); MMTEB multilingual mean = 70.58 (#1) — do NOT conflate; both distinct from the older 56-task board | 17 GB | qwen3-embedding:8b | Apache-2.0 | Top open-weight retrieval embedder in 2026 (#1 MMTEB), Apache-2.0, native Ollama pull; the default when ~17GB VRAM is available |
Ceci est la couche de récupération d'une pile RAG auto-hébergée. Stockez ces vecteurs dans une base de données vectorielle auto-hébergée, jumelez-la à un runtime local du comparatif des runtimes IA et à un modèle génératif de la base de données de LLM locaux. Fait partie de la base de connaissances IA locale de D-Central. Scores MTEB tirés du classement HuggingFace ; vérifiez la fiche de modèle et la licence à jour avant tout usage en production.
Vérifiez la fiche de modèle et la licence à jour avant tout usage en production. Ce jeu de données ouvert (CC BY 4.0) fait partie du catalogue de données ouvertes de D-Central.
Produits, réparations et guides connexes
- comment D-Central diagnostique les réparations ASIC
- bibliothèque de dépannage ASIC
- manuels ASIC et guides de réparation
- hashboards de remplacement
- cartes de contrôle ASIC
- blocs d’alimentation ASIC
- hashboard de remplacement pour la famille S19
- carte de contrôle de remplacement C52
- bloc d’alimentation APW12 pour S19
- comparer les specs dans la base de mineurs ASIC
- comparer les specs des mineurs ASIC
- base de mineurs ASIC
- services de réparation ASIC
- specs et rentabilité de l’Antminer S19
- acheter un Antminer S19 testé
- guide d’entretien Antminer S19
- service de réparation Antminer S19
- specs de l’Antminer S21
- Bitmain Antminer S21
- guide d’entretien Antminer S21
- puce BM1370BC pour S21 Pro
Dernière révision: 27 juillet 2026.
