Model card
| Développeur | DeepSeek |
|---|---|
| Family | DeepSeek |
| Licence | MIT |
| Modality | text |
| Parameters (B) | 1600 (V4-Pro MoE), 284 (V4-Flash MoE) |
| Context window | 1000000 |
| Release date | avril 2026 |
| Primary languages | en,zh |
| Hugging Face | deepseek-ai/DeepSeek-V4-Pro |
| Ollama | Not on Ollama registry |
DeepSeek V4 débarque : contexte 1M, poids MIT, et une question à mille milliards de paramètres
Le 24 avril 2026, DeepSeek a publié la famille V4 en préversion — deux modèles Mixture-of-Experts, tous deux à poids ouverts sur Hugging Face sous licence MIT pure, tous deux avec une fenêtre de contexte de 1M de tokens et des modes duaux Réflexion / Sans-réflexion. DeepSeek-V4-Pro est un modèle de 1,6 billion de paramètres avec 49B actifs par token ; DeepSeek-V4-Flash fait 284B au total avec 13B actifs. Les notes de version et les poids sont sortis le même jour.
C’est le successeur direct de DeepSeek V3, le modèle de décembre 2024 qui a fait de « la performance frontière pour moins de 6 M$ » un sujet de conversation. V4 poursuit la même ligne de recherche — routage DeepSeekMoE et Multi-head Latent Attention — à l’échelle 2,4x sur les paramètres totaux et 8x sur le contexte, et fait passer la licence du DeepSeek License maison au MIT pur. Ce dernier changement compte plus qu’il n’y paraît : MIT signifie que les quantiseurs, distilleurs et fine-tuneurs peuvent bâtir sur ces poids sans lire d’abord un contrat sur mesure.
Ce qu’il y a dans les poids
- V4-Pro : 1,6T de paramètres totaux, 49B actifs par token — DeepSeek revendique une performance rivalisant avec les meilleurs modèles fermés
- V4-Flash : 284B au total, 13B actifs — le jeu de l’efficacité, visant le segment que V3 (671B/37B actifs) occupait, avec une empreinte active plus petite
- Contexte de 1M de tokens sur les deux, contre 128K pour V3 — le slogan est « l’ère du contexte 1M économique »
- Modes duaux : Réflexion (traces de raisonnement, style R1) et Sans-réflexion dans un seul jeu de poids — plus de scission V4 / série R à ce niveau
- Licence MIT, poids complets sur Hugging Face, identifiants API
deepseek-v4-proetdeepseek-v4-flash
Le tarif de l’API hébergée au lancement se situait bien en dessous de la frontière fermée — environ 1,74 $ par million de tokens d’entrée et 3,48 $ par million de tokens de sortie pour V4-Pro en juillet 2026, selon les tarifs publiés par DeepSeek. L’inférence hébergée bon marché n’est pas de la souveraineté, mais elle maintient la pression sur les prix de tout le monde, et cette pression est un dividende pour les plebs même si vous ne touchez jamais leur API.
Un pleb peut-il vraiment le faire tourner ?
Calcul honnête, règle maison : un quant Q4 demande environ 0,6 Go par milliard de paramètres totaux, plus la surcharge de contexte — et un cache KV d’1M de tokens est un monstre mémoire à lui seul, même avec la compression MLA.
- V4-Pro (1,6T) : ~960 Go en Q4. Ce n’est pas un rig, c’est un rack. Territoire multi-nœuds — même huit cartes de 96 Go n’y suffisent pas avec le contexte. À la maison, V4-Pro est un modèle d’API qui se trouve avoir des poids téléchargeables. Que les poids soient ouverts compte quand même (auditabilité, distillations, pas de tapis tiré) — mais personne ne fait tourner ça sur un circuit 120V.
- V4-Flash (284B) : ~170 Go en Q4. C’est celui qui est intéressant. Un Mac Studio M3 Ultra de 192 Go peut le contenir — mais Apple a retiré les paliers 256/512 Go et la config 192 Go n’existe plus qu’en occasion ; consultez la fiche M3 Ultra avant de bâtir un plan dessus. Une paire de boîtiers à mémoire unifiée de 128 Go (Strix Halo, DGX Spark) reliés ensemble entre aussi dans la fourchette. Avec seulement 13B actifs par token, une fois que les poids rentrent, les tokens sortent à un rythme utilisable même sur du matériel limité en bande passante.
Pour la plupart des rigs domestiques, la stack souveraine pratique se construit encore dans la classe 20–120B — voyez le tour d’horizon des meilleurs LLM locaux pour 2026. L’histoire locale de V4 commencera vraiment quand les distillations communautaires arriveront, comme les distills de R1 ont amené le raisonnement sur les cartes de 24 Go.
Ce que ça signifie pour la stack souveraine
Trois leçons. Un : la frontière à poids ouverts ne s’est pas refermée — le même printemps où Meta a déplacé son effort frontière derrière une API, DeepSeek a livré un modèle à un billion de paramètres sous MIT. La feuille de route dont vous dépendez compte. Deux : 1M de contexte sous licence ouverte change ce que les pipelines RAG locaux doivent faire : une base de code entière ou une année de dossiers tient dans la fenêtre, sans gymnastique de récupération. Trois : la forme 284B/13B actifs de V4-Flash annonce où s’en vont les modèles pertinents pour les plebs — énorme capacité éparse, petit calcul actif, taillé pour les boîtiers à mémoire unifiée plutôt que pour les piles de GPU.
Sa position face au reste du champ ouvert — licences, classes de VRAM et juridiction — est cartographiée dans le tableau comparatif des poids ouverts. Rendons à César : V4 s’appuie sur Transformer, Switch Transformer, le précédent MoE ouvert de Mixtral et la propre lignée V2/V3/R1 de DeepSeek — c’est de la recherche publique qui se compose, et c’est exactement pourquoi les poids ouverts méritent d’être défendus.
Recommended hardware
Multi-GPU rig or cloud territory. For most plebs, the 70B distillation is plenty.
Get it running
-
01
Install Ollama →
Ten-minute local LLM runtime. One binary, zero cloud.
-
02
Give it a web UI →
Open-WebUI turns Ollama into a self-hosted ChatGPT.
-
03
Understand quantization →
GGUF Q4/Q8/FP16 — which weights fit your GPU, explained.
Further reading: the Sovereign AI for Bitcoiners Manifesto for why sovereign inference matters, and From S19 to Your First AI Hashcenter for repurposing your mining rack into a Hashcenter that runs models like this one.
