En février 2026, une équipe de DeepSeek-AI, de l’Université de Pékin et de l’Université Tsinghua a discrètement publié un article que presque personne en dehors du monde de l’ingénierie d’inference n’a remarqué. Ce n’est pas un nouveau model. Ce n’est pas un chatbot. C’est de la plomberie — le genre de plomberie de centre de données sans glamour qui détermine si l’IA à weights ouverts que vous pouvez réellement télécharger reste assez bon marché pour être servie à grande échelle. L’article s’intitule DualPath: Breaking the Storage Bandwidth Bottleneck in Agentic LLM Inference (arXiv 2602.21548), et c’est une petite pièce importante de ce qui explique pourquoi le côté ouvert du monde de l’IA continue de combler l’écart avec le côté fermé et loué.
La réponse courte : DualPath (arXiv 2602.21548) est un système de serving de centre de données de DeepSeek-AI, pas un model. Il corrige un goulot d’étranglement de bande passante de stockage dans l’inference d’agents multi-tours de longue durée en chargeant le KV-cache via les cartes réseau côté decode inactives, rapportant jusqu’à 1.87x hors ligne et 1.96x de débit moyen en ligne par rapport à la base de référence interne de DeepSeek. Le gain de souveraineté, c’est la recherche ouverte plus les weights ouverts sous licence MIT — pas d’exécuter cela à la maison.
Points clés à retenir
- DualPath est de l’infrastructure, pas un model. C’est un système de serving à l’échelle pour l’inference LLM agentique — la couche qui exécute un model déjà entraîné pour des milliers d’utilisateurs à la fois.
- Le goulot d’étranglement qu’il attaque, c’est l’E/S de stockage, pas le calcul GPU. Dans les charges de travail d’agents multi-tours de longue durée, la partie lente est le va-et-vient du KV-cache vers et depuis le stockage, et une moitié des cartes réseau du cluster reste inactive pendant que l’autre se noie.
- L’astuce, c’est un second chemin de chargement. DualPath tire aussi le cache via les NIC de stockage inactives des moteurs decode, puis le remet aux moteurs prefill par RDMA rapide — avec un ordonnanceur qui choisit le chemin en direct.
- Les gains mesurés : jusqu’à 1.87x hors ligne et une moyenne de 1.96x de débit en ligne — mais toujours par rapport au cadre interne non modifié de DeepSeek (“Basic”), pas une base publique.
- Pourquoi un Bitcoiner souverain devrait s’en soucier : recherche ouverte + weights ouverts sous licence MIT signifie que le model que vous téléchargez peut être possédé, audité et exécuté pour toujours — il ne peut pas être géo-restreint ni retiré sous vos pieds comme peut l’être un accès API loué.
Le problème en termes simples : le stockage est le mur, pas le GPU
Si vous n’avez jamais utilisé l’IA qu’à travers une boîte de clavardage, le modèle mental est simple : vous tapez, un gros GPU coûteux réfléchit, vous obtenez une réponse. Ce modèle convient pour une seule question courte. Il s’effondre dès que vous pointez la même machine vers un agent de longue durée — une IA qui lit une immense base de code, appelle des outils, prend vingt tours, et garde toute la conversation en tête pendant tout ce temps. À cette échelle, le GPU n’est souvent pas ce que vous attendez. Vous attendez le stockage.
Pour comprendre pourquoi, il vous faut deux notions de jargon, et elles valent la peine d’être apprises parce qu’elles expliquent presque tout du comportement de l’inference moderne.
KV-cache : la mémoire de travail du model
Quand un model de langage lit votre prompt, pour chaque token il calcule une paire de vecteurs internes — une “clé” et une “valeur” — qui résument ce que ce token signifie dans le context. Collectivement, c’est le KV-cache. Le cache est ce qui permet au model de générer le mot suivant sans relire toute la conversation depuis le début à chaque fois. Le hic : le cache grossit avec la longueur de context. Une session d’agent d’un million de tokens (le context par défaut de DeepSeek-V4 est un plein 1,000,000 de tokens) produit un KV-cache énorme — bien trop grand pour rester en mémoire GPU en direct pour des milliers d’utilisateurs concurrents. Il est donc écrit vers un stockage distribué rapide et relu quand cette conversation revient.
Voici l’analogie du monde du minage. Pensez au GPU comme à votre carte de hachage ASIC — la chose qui fait le vrai travail — et au KV-cache comme à une pile d’historique de shares et d’état de pool que vous devez charger avant que la carte puisse faire quoi que ce soit d’utile. Si la carte peut broyer des hashes bien plus vite que vous ne pouvez lui fournir l’état dont elle a besoin hors du disque, vous n’êtes plus limité par le calcul. Vous êtes limité par l’E/S. Le silicium coûteux tourne au ralenti en attendant que les octets arrivent par le fil. C’est précisément la situation que DeepSeek a mesurée dans l’inference agentique de longue durée : le débit est dominé par l’E/S de stockage du KV-cache, pas par le calcul.
Prefill vs decode, et pourquoi on les sépare
L’inference se déroule en deux phases. Le prefill est la lecture en bloc : le model ingère tout le prompt (ou recharge le KV-cache d’une conversation) en une grande passe parallèle. Le decode est le filet : le model émet la réponse un token à la fois, chaque étape dépendant de la précédente. Ces deux phases ont des appétits complètement différents — le prefill est un sprint de bande passante, le decode est un long footing sensible à la latence — si bien que les grands systèmes de serving les désagrègent désormais, exécutant le prefill sur un bassin de GPU et le decode sur un autre. C’est la “séparation PD,” et c’est la pratique standard à la frontière.
La désagrégation est bonne pour l’efficacité de calcul, mais elle crée une laide asymétrie dans le réseau de stockage. Quand une conversation de retour a besoin de son KV-cache rechargé, cette charge tombe sur les moteurs prefill. Leurs cartes réseau de stockage (NIC) saturent en charriant d’énormes caches hors du stockage persistant. Pendant ce temps, les moteurs decode — occupés à émettre des tokens, mais sans tirer de gros caches du disque — ont des NIC de stockage presque inactives. Un côté du cluster s’étouffe ; les tuyaux de l’autre côté sont vides. C’est cette asymétrie qui plafonne le débit du système. Vous avez acheté toute cette bande passante réseau et on ne vous laisse en utiliser que la moitié.
Comment DualPath fonctionne : ouvrir la deuxième voie
L’idée centrale de DualPath est presque embarrassante d’intuitivité une fois le problème bien cadré : si les NIC de stockage des moteurs prefill sont engorgées et que les NIC de stockage des moteurs decode sont inactives, routez une partie du trafic par les inactives. L’ingéniosité consiste à faire fonctionner cela physiquement sans briser la séparation prefill/decode qui existe pour de bonnes raisons.
Le système fait tourner deux chemins de chargement et choisit entre eux dynamiquement :
- Chemin 1 — Stockage → Prefill (la route traditionnelle). Le KV-cache des tokens déjà vus (“hit”) est lu directement depuis le stockage persistant dans le tampon du moteur prefill. C’est le chemin conventionnel, et quand les tuyaux côté prefill ont de la marge, c’est le bon.
- Chemin 2 — Stockage → Decode → Prefill (la route nouvelle). Au lieu de forcer chaque lecture de cache par les NIC prefill congestionnées, DualPath charge le KV-cache dans les moteurs decode en utilisant leurs NIC de stockage autrement inactives, puis le transfère vers les moteurs prefill par RDMA à haute bande passante sur le réseau de calcul. RDMA — remote direct memory access — permet à une machine de lire la mémoire d’une autre via InfiniBand sans déranger les CPU, si bien que ce passage de relais est rapide.
Un ordonnanceur adaptatif siège au-dessus et décide, en temps réel, quel chemin chaque chargement doit prendre — en équilibrant les longueurs de file d’attente des NIC de stockage et la charge de calcul GPU pour qu’aucun côté du cluster ne devienne le goulot d’étranglement. C’est, en effet, un répartiteur de charge pour le trafic KV-cache qui permet enfin au système d’utiliser toute sa bande passante réseau au lieu de la moitié.
Un simple diagramme texte de l’asymétrie que DualPath corrige :
BEFORE (PD-disaggregated, single path)
Persistent storage (3FS SSDs)
| cache reads
v
[PREFILL NICs] ===> SATURATED (bottleneck)
[DECODE NICs] ---> idle (wasted bandwidth)
AFTER (DualPath, two paths + scheduler)
Persistent storage (3FS SSDs)
| |
v v
[PREFILL NICs] [DECODE NICs] <- both now carry cache
^ |
| RDMA over v
+---- compute network -----+
(scheduler picks the path live)
Les chiffres — et l'astérisque honnête
DeepSeek rapporte jusqu'à 1.87x d'amélioration du débit d'inference hors ligne et une amélioration moyenne de 1.96x du débit de serving en ligne, sans violations de SLO (SLO = le niveau de service de latence que le système promet aux utilisateurs ; le point est que l'accélération ne se fait pas au prix de réponses plus lentes).
Maintenant l'astérisque, qui compte et que nous n'enterrerons pas : les deux chiffres sont mesurés par rapport à “Basic” — le cadre d'inference interne non modifié de DeepSeek, pas par rapport à une base externe ou publique. Le cadrage honnête est donc “jusqu'à 1.87x hors ligne / moyenne 1.96x en ligne par rapport à la base de référence interne de DeepSeek.” C'est un gain d'ingénierie réel et utile sur un vrai cluster ; ce n'est pas la prétention que DualPath est 1.96x plus rapide que ce que vous exécutez aujourd'hui. Quiconque ramène cela à “DeepSeek a doublé la vitesse d'inference” a laissé tomber la partie qui le rend digne de confiance.
Le matériel sur lequel cela tourne vraiment
C'est fermement le territoire des centres de données. Chaque nœud porte 8 GPU NVIDIA Hopper avec des NIC dual 400 Gbps, câblés ensemble avec InfiniBand et RDMA, soutenus par un stockage SSD distribué (le 3FS de DeepSeek). Les expériences à grande échelle atteignent jusqu'à environ 1,152 GPU — bien au-delà d'un millier. Les codes de répartition publiés par configuration (des choses comme “48P96D” pour la course hors ligne) illustrent combien de GPU sont assignés au prefill versus au decode ; tenez le chiffre arrondi “1000+ GPU” pour le solide. Le point pour nos besoins : personne n'exécute DualPath sur une machine de maison. C'est la couche de serving d'une flotte.
Un bémol à énoncer clairement, comme pour tout résultat de recherche systèmes : ces gains ont été démontrés sur le cluster spécifique que DeepSeek a testé — les nœuds Hopper, le tissu InfiniBand/RDMA, et le stockage distribué 3FS décrits plus haut. Une optimisation de serving dont toute l'astuce est de rééquilibrer le trafic entre cartes réseau n'est jamais meilleure que le réseau sur lequel elle tourne ; hors d'un centre de données comparablement provisionné, les jolis multiplicateurs ne doivent pas être tenus pour acquis. C'est normal, et utile à savoir avant que quiconque traite 1.96x comme une loi de la nature.
Les articles, et le moment V4
DualPath n'est pas arrivé dans le vide. C'est un barreau sur une échelle de recherche ouverte DeepSeek, et lire l'échelle explique pourquoi l'écosystème à weights ouverts continue de gagner en capacité.
DeepSeek-V3 (arXiv 2412.19437) est la fondation : un model Mixture-of-Experts de 671B au total / 37B actifs. “Mixture-of-Experts” signifie qu'une seule fraction des paramètres du réseau s'active pour un token donné — 37 milliards sur les 671 milliards — ce qui explique comment un model aussi énorme reste abordable à exécuter. V3 a introduit le Multi-head Latent Attention (MLA) et la conception DeepSeekMoE, l'équilibrage de charge sans perte auxiliaire, un objectif Multi-Token Prediction, l'entraînement en précision mixte FP8, et 14.8T de tokens de pré-entraînement. Il est sous licence MIT.
DeepSeek-V3.2 (arXiv 2512.02556, sorti vers décembre 2025) est le rafraîchissement de la famille V3 sur lequel DualPath a réellement été évalué. L'article DualPath indique sa taille comme 660B — notez cela, pas 671B ; 671B est le total plus ancien de V3/V3.1, et V3.2 est coté à 660B dans l'article. La fonctionnalité phare de V3.2 est le DeepSeek Sparse Attention (DSA), une approche quasi linéaire du context long utilisant un “lightning indexer” léger plus une sélection fine de tokens — pour que le model s'attende aux tokens qui comptent au lieu de payer un coût quadratique sur toute la fenêtre. DualPath a aussi été testé sur un DeepSeek 27B interne réduit et sur le dense Qwen2.5-32B, pour montrer que la technique se généralise au-delà d'une seule architecture.
Et puis, le 24 avril 2026, la récompense : DeepSeek a publié et mis en open source l'aperçu V4. DeepSeek-V4-Pro fait 1.6T au total / 49B actifs ; DeepSeek-V4-Flash fait 284B au total / 13B actifs — tous deux Mixture-of-Experts, tous deux avec un context par défaut d'1 million de tokens sur les services officiels de DeepSeek. La fiche de model officielle Hugging Face de V4-Pro décrit un schéma hybride d'attention compressée — CSA (Compressed Sparse Attention) + HCA (Heavily Compressed Attention) — et indique qu'à 1M de context, V4-Pro n'exige que 27 % des FLOPs d'inference par token unique et 10 % du KV cache par rapport à DeepSeek-V3.2. CNBC a confirmé la sortie open source le même jour, notant que les développeurs peuvent le télécharger, l'exécuter localement et le modifier dans la plupart des cas.
Une frontière honnête, parce que la précision est tout le point d'un site de référence : DualPath est un article côté serving sur V3.2 et Qwen, pas sur V4. L'article DualPath ne mentionne ni V4, ni CSA, ni HCA, ni ces chiffres d'efficacité de 27 %/10 %. Nous les plaçons côte à côte parce qu'ils font partie du même arc de recherche ouverte — systèmes de serving et architectures de models poussant ensemble le coût de l'IA ouverte vers le bas — pas parce que DualPath a produit les chiffres de V4. Les confondre serait exactement le genre d'erreur que ce site existe pour corriger.
Pourquoi c'est une histoire de souveraineté de l'IA
Voici la partie qui compte vraiment pour un Bitcoiner souverain, et elle n'a rien à voir avec le fait que 1.96x soit le bon multiplicateur.
Il y a deux façons d'obtenir l'accès à un model d'IA de frontière. Vous pouvez le louer — appeler l'API de quelqu'un, payer par token, et dépendre de cette entreprise pour garder les lumières allumées, maintenir le soutien de votre juridiction, et ne pas retirer le model sur lequel vous avez construit. Ou vous pouvez le posséder — télécharger les weights, un fichier, sur un disque que vous contrôlez, et l'exécuter sur du matériel que vous contrôlez, pour toujours. Toute la pile de DeepSeek — V4-Pro, V4-Flash, V3.2, V3.1, R1 — est livrée sous la licence MIT pour le code et les weights. L'usage commercial, la modification, la redistribution, le fine-tune et la distillation sont tous permis, sans frais et sans restriction d'usage. Et une recherche comme DualPath est publiée ouvertement, si bien que les techniques qui rendent ces models bon marché à servir ne sont pas un secret commercial — elles sont dans la littérature pour que quiconque les lise et les reproduise.
Cette possession a quatre propriétés qu'une API louée ne peut jamais vous donner, et il vaut mieux être précis plutôt que de faire du slogan à leur sujet :
- Un accès qui ne peut pas être révoqué. Un fichier de weights téléchargé continue de fonctionner que l'entreprise qui l'a fait vous serve encore ou non.
- L'auditabilité. Des weights ouverts et une recherche ouverte signifient que la chose peut être inspectée, sondée et comprise — pas traitée comme une boîte scellée qu'il faut se contenter de croire.
- La reproductibilité. Un article ouvert plus des weights ouverts signifie qu'un résultat peut être relancé et vérifié par quelqu'un d'autre que le fournisseur.
- La possession. Le fichier est à vous. Il peut être isolé (air-gapped), archivé, fine-tuné sur vos propres données, et exécuté dans dix ans sans compte, sans abonnement et sans permission.
Contrastez cela, factuellement et sans théâtralité, avec le comportement documenté des models fermés loués. Ce n'est pas une attaque contre un laboratoire quelconque — dans plusieurs de ces cas le laboratoire avait le moins de contrôle de toute la chaîne — c'est une description du modèle d'accès lui-même, qui est une location :
- Révocation par contrôle des exportations. Le 12 juin 2026, le gouvernement américain a émis une directive de contrôle des exportations (rapportée le 14 juin 2026) ordonnant à Anthropic de suspendre tout accès à Claude Fable 5 et Mythos 5 pour les ressortissants étrangers dans le monde entier. Anthropic a déclaré qu'elle a dû désactiver brusquement les deux models pour tous les clients afin d'assurer la conformité. Nous couvrons cet événement en profondeur dans notre article phare sur l'interdiction de Claude Fable 5 ; le statut en cours reste en développement au moment de ce reportage.
- Interdictions basées sur la propriété/l'identité. Une mise à jour des conditions d'utilisation d'Anthropic le 5 septembre 2025 interdit le service aux entreprises détenues à plus de 50 % par des entités en Chine, en Russie, en Iran ou en Corée du Nord — peu importe où elles opèrent physiquement. C'est un passage du blocage par adresse IP au blocage selon qui vous possède.
- Restrictions régionales. OpenAI comme Anthropic publient des listes de pays pris en charge ; un accès depuis une région non prise en charge peut faire bloquer un compte.
- Dépréciation contrôlée par le fournisseur. Les models loués sont retirés selon un calendrier. GPT-4.5 a été lancé en février 2025, a vu son API coupée en juillet 2025, et quitte ChatGPT en juin 2026 ; GPT-4o, 4.1, 4.1-mini et o4-mini ont été retirés de ChatGPT le 13 février 2026 ; GPT-5.1 le 11 mars 2026 ; o3 doit suivre le 26 août 2026. Un fichier de weights ouverts sauvegardé n'a pas de date de retraite.
C'est la même thèse qu'un Bitcoiner tient déjà sur l'argent, appliquée au calcul : une permission est quelque chose qui peut être révoquée, et la réponse durable est de posséder la pile. Vous pouvez lire notre traitement plus complet de cet argument dans bâtir une IA souveraine au Canada et à travers le hub IA. DualPath s'inscrit dans cette histoire non pas comme un outil de souveraineté que vous utilisez, mais comme une preuve que le côté ouvert du domaine fait un travail de systèmes sérieux, de grade frontière, en public — ce qui est exactement ce qui fait que les weights ouverts valent la peine d'être possédés.
Ce que vous pouvez vraiment exécuter à la maison (et ce que vous ne pouvez pas)
Soyons scrupuleusement clairs, parce que c'est là que le battage s'infiltre d'habitude. Vous ne pouvez pas exécuter DualPath. C'est un système de serving de mille GPU. Vous ne pouvez pas non plus, réalistement, exécuter les models phares complets dans leur précision native — le model complet de classe 671B à quantization 4 bits a besoin d'environ 376–404GB de mémoire (les sources varient), et l'empreinte BF16 complète sur disque est autour de 715GB. C'est le territoire des serveurs et des stations de travail, pas d'un PC de jeu. V4-Pro à 1.6T au total est encore plus hors de portée pour la maison.
Ce que vous pouvez posséder et exécuter, c'est la partie de l'écosystème construite exactement pour cela. Il y a deux paliers honnêtes :
Palier 1 — le model complet, quantifié, sur une machine à haute mémoire
La quantization communautaire (notamment les quants dynamiques d'Unsloth) réduit le phare complet assez pour l'auto-héberger sur une seule machine à haute RAM, lentement. La construction 1.58/1.66 bits atterrit autour de 162–170GB et peut tourner sur un seul GPU de 24GB plus 128GB de RAM système avec délestage Mixture-of-Experts. Une construction 2 bits fait environ 245–251GB et veut grosso modo 226GB de RAM+VRAM combinées, générant à environ 5 tokens/seconde — utilisable pour du travail par lots, pas pour un clavardage réactif. La règle empirique : votre VRAM plus RAM devrait à peu près égaler la taille du fichier quant. Les grandes machines Apple Silicon à mémoire unifiée sont le chemin mono-boîte le plus propre pour ces gros quants ; les débits rapportés pour elles (par exemple, ~40 tokens/sec pour une construction V3.2 int4 sur Apple Silicon haut de gamme) doivent être traités comme approximatifs, pas comme une spécification.
Palier 2 — les models distillés (le palier pleb réaliste)
C'est là que la plupart des gens devraient réellement vivre. DeepSeek a distillé le raisonnement de R1 dans six models denses — 1.5B, 7B, 14B et 32B sur une base Qwen2.5, et 8B et 70B sur une base Llama 3 — entraînés sur environ 800k échantillons de raisonnement R1. Ils tournent sur des outils ordinaires : Ollama, llama.cpp, vLLM, ou SGLang, avec un GGUF Q4_K_M par défaut. Paliers VRAM honnêtes à Q4_K_M :
| Model distillé | VRAM approx. (Q4_K_M) | Matériel réaliste |
|---|---|---|
| 7B (Qwen2.5) | ~6–8GB | RTX 3060 |
| 8B (Llama 3) | ~6–8GB | RTX 3060 |
| 14B (Qwen2.5) | ~12–16GB | RTX 4070 |
| 32B (Qwen2.5) | ~24GB | RTX 3090 / 4090 (meilleur raisonnement mono-GPU) |
| 70B (Llama 3) | ~40–48GB | Double RTX 3090 / 64GB+ Apple Silicon |
Si vous voulez le parcours complet — choisir un model, dimensionner la VRAM, installer Ollama ou llama.cpp, et l'angle de résidence des données au Canada — nous l'avons déjà écrit. Voir notre guide compagnon sur exécuter DeepSeek localement au Canada, et les outils autour : le calculateur VRAM de LLM local, la comparaison de GPU pour LLM locaux, et la base de données de models LLM locaux. Cet article est le compagnon “pourquoi l'écosystème ouvert est fort” de ce guide “comment l'exécuter” — nous ne refaisons pas le mode d'emploi ici.
Où s'inscrit D-Central
Nous sommes une boutique de minage Bitcoin, pas un laboratoire d'IA, et nous ne prétendrons pas le contraire. Ce qui nous tient à cœur — et nous a toujours tenu à cœur — c'est la même chose que rendent possible les weights ouverts de DeepSeek : posséder votre pile plutôt que de la louer. Un mineur qui fait tourner son propre nœud, détient ses propres clés, et hashe sur du matériel qu'il contrôle comprend déjà la différence entre une permission et une possession. L'IA à weights ouverts est une couche de plus de ce même instinct : un fichier de model que vous possédez se comporte comme du stockage à froid ; une clé API se comporte comme un compte d'échange.
Nous nous tenons sur les épaules des gens qui font ce travail — DeepSeek-AI et les groupes académiques qui publient en ouvert, les auteurs de quants chez Unsloth, les mainteneurs de llama.cpp et d'Ollama, et tous ceux qui livrent des weights ouverts. Rien de cela n'est à nous et nous ne le revendiquerions pas. Notre travail est de le traduire pour les plebs : de vous dire honnêtement ce qu'un chiffre de 1.96x-par-rapport-à-la-base-interne signifie, ce qui tourne sur votre RTX 3090 et ce qui a besoin d'un serveur, et où la possession bat vraiment la commodité. Si vous voulez voir comment cela se relie au tableau plus large de l'auto-garde — Bitcoin, mesh, Nostr, IA locale — commencez au hub souveraineté, et si vous pesez si votre matériel de minage peut faire double emploi, notre analyse des ASIC Bitcoin vs GPU pour le calcul IA est l'endroit pour commencer.
Questions fréquentes
DualPath est-il un nouveau model d'IA DeepSeek que je peux télécharger ?
Non. DualPath (arXiv 2602.21548) est un système d'inference-serving — de l'infrastructure de centre de données pour exécuter des models efficacement — pas un model. Il n'y a pas de weights DualPath à télécharger. Les models que vous pouvez télécharger sont des sorties séparées comme DeepSeek-V3.2 et l'aperçu V4, tous sous licence MIT.
À quel point DualPath est-il vraiment plus rapide ?
DeepSeek rapporte jusqu'à 1.87x de débit hors ligne et une moyenne de 1.96x de débit en ligne, sans violations de SLO (promesse de latence). La mise en garde importante : les deux chiffres sont mesurés par rapport au cadre interne non modifié de DeepSeek, appelé “Basic,” pas par rapport à une base externe ou publique. C'est donc un gain d'ingénierie authentique sur leur pile, pas une prétention sur la comparaison avec ce que vous exécutez.
Qu'est-ce qu'un KV-cache, et pourquoi crée-t-il un goulot d'étranglement pour l'inference ?
Le KV-cache est la mémoire de travail du model — les vecteurs clé/valeur qu'il stocke pour chaque token afin de ne pas devoir relire toute la conversation à chaque étape. Dans les sessions d'agents multi-tours de longue durée, le cache grossit énormément et est écrit vers et lu depuis un stockage distribué. À l'échelle, déplacer ce cache devient la partie lente, si bien que le débit est limité par l'E/S de stockage plutôt que par le calcul GPU.
Puis-je exécuter DualPath sur ma machine maison ?
Non. DualPath tourne sur des clusters de GPU NVIDIA Hopper (8 par nœud, NIC dual 400 Gbps, InfiniBand/RDMA, stockage SSD distribué), s'étendant à plus d'un millier de GPU — jusqu'à environ 1,152. C'est une optimisation de serving à l'échelle d'une flotte. La partie exécutable à la maison de l'écosystème, ce sont les weights ouverts quantifiés et distillés, exécutés via Ollama, llama.cpp, ou vLLM.
DualPath a-t-il quoi que ce soit à voir avec DeepSeek-V4 ?
Seulement comme partie du même arc de recherche ouverte. L'article DualPath a été évalué sur DeepSeek-V3.2 (indiqué comme 660B), un 27B interne réduit, et Qwen2.5-32B — il ne mentionne ni V4, ni son attention CSA/HCA, ni les chiffres d'efficacité de V4. V4 (sorti et mis en open source le 24 avril 2026) est une sortie de model séparée. Nous les présentons ensemble parce que les deux sont des travaux ouverts qui poussent le coût de l'IA ouverte vers le bas, pas parce que l'un a produit les résultats de l'autre.
Si les models sont à weights ouverts, pourquoi toute cette recherche de centre de données compte-t-elle pour la souveraineté ?
Parce que les weights ouverts ne valent la peine d'être possédés que si l'écosystème ouvert plus large reste capable. Une recherche de serving publique, de grade frontière, comme DualPath est la preuve que le côté ouvert de l'IA fait un travail de systèmes sérieux en ouvert — ce qui maintient les models ouverts compétitifs face aux fermés loués. Le gain de souveraineté, c'est la combinaison : recherche ouverte plus weights ouverts sous licence MIT que vous pouvez télécharger, auditer et exécuter sans aucune possibilité de révocation.
Que peut réellement exécuter une personne ordinaire à la place ?
Les models denses distillés R1 sont le palier réaliste : 7B et 8B tiennent sur un RTX 3060 (~6–8GB), 14B sur un RTX 4070 (~12–16GB), 32B sur un RTX 3090 ou 4090 (~24GB), et 70B sur double 3090 ou 64GB+ Apple Silicon (~40–48GB), tous à Q4_K_M. Pour une mise en place étape par étape, voir notre guide sur exécuter DeepSeek localement au Canada et notre calculateur VRAM de LLM local.



