Passer au contenu

Bitcoin accepté au paiement  |  Expédié depuis Montréal, QC, Canada  |  Soutien expert depuis 2016

Possédez votre puissance de calcul : la pile d’IA locale auto-souveraine du bitcoiner
Bitcoin × IA

Possédez votre puissance de calcul : la pile d’IA locale auto-souveraine du bitcoiner

· D-Central · ⏱ 13 min de lecture

Pourquoi « posséder son compute » compte maintenant

Vous possédez déjà votre argent. Vous détenez vos clés, vous faites tourner votre node, et vous avez depuis longtemps cessé de demander la permission à une plateforme d’échange. Cet instinct — la possession plutôt que la confiance — est toute la raison d’être de Bitcoin. L’argument ici est simple : le même instinct s’applique désormais un cran plus haut, à la machine qui fait votre réflexion. Possédez votre compute comme vous possédez vos clés.

L’intelligence artificielle de frontière, c’est de l’intelligence centralisée. Chaque prompt envoyé à un model hébergé est comptabilisé. Chaque réponse est journalisée. Chaque model siège dans une juridiction sur laquelle on peut faire pression, et chaque clé API est un kill switch que quelqu’un d’autre détient. Une mise à jour des conditions d’utilisation est une réécriture unilatérale de ce que vous avez le droit de demander à voix haute. C’est le système de banques correspondantes de la cognition, et un Bitcoiner sait déjà dans ses os pourquoi louer une chose n’est pas la même chose que la détenir.

Deux formes de souveraineté sont en jeu. La souveraineté des données signifie que le texte que vous donnez à un model ne quitte jamais du matériel que vous contrôlez — pas d’egress, pas de télémétrie, pas de journalisation vers un endpoint qui répond à une assignation. La souveraineté algorithmique signifie que le model qui génère vos tokens tourne contre des weights que vous possédez, sur un runner que vous pouvez lire, qui fonctionnera encore le jour où le labo qui l’a entraîné sera acquis, fermé ou mis sous pression. Les weights, une fois publiés, ne peuvent pas être dépubliés. C’est la même propriété de finalité qui rend une transaction Bitcoin signée irréversible : une fois les nombres sortis, ils sont sortis.

Pour bien cadrer la portée : c’est une sauvegarde de l’intelligence louée, pas un remplacement de Bitcoin. Les models de frontière hébergés sont pratiques et, pour certaines tâches, encore meilleurs — plus honnêtement là-dessus plus bas. L’IA locale est la couche que vous gardez pour que, lorsque la version louée est comptabilisée, censurée ou simplement disparue, vous ayez encore une machine qui fonctionne. Bitcoin reste l’ancre. Le compute local est la plus récente sauvegarde que nous maintenons, de la même façon qu’un réseau maillé sauvegarde Internet et que vos propres kWh sauvegardent le réseau électrique.

La pile locale d’IA auto-souveraine

La pile a trois couches, et chacune se mappe proprement sur du matériel que vous comprenez déjà. Il n’y a pas de boîte magique ici. Vous l’assemblez comme vous assemblez un rig de minage : le matériel en bas, l’artefact que vous flashez au milieu, l’interface depuis laquelle vous opérez en haut.

Matériel — le silicium que vous possédez. L’inference est une charge de travail taillée pour le GPU. La contrainte, c’est la VRAM, pas le compute brut, parce que les weights du model doivent tenir en mémoire pour tourner vite. Une Nvidia RTX 3090 d’occasion avec 24 GB de VRAM, héritée de l’ère du minage Ethereum, est la pièce de matériel d’inference la plus rentable qu’un pleb puisse posséder. Une en fait tourner un model mid-size capable ; deux en font tourner un grand. Un CPU moderne avec assez de RAM système fera aussi tourner de plus petits models, lentement — acceptable pour des batch jobs, pénible pour le chat en direct. Le point, c’est que le silicium est quelque chose que vous avez acheté, racké, et que vous pouvez débrancher.

Model — les weights que vous possédez. Un model est un fichier : des milliards de paramètres en virgule flottante entraînés par quelqu’un avec un très gros cluster, publiés au téléchargement. Pensez-y comme vous pensez à une image de firmware de mineur — un artefact compilé que vous flashez sur du matériel que vous contrôlez. Les familles open-weight comme Llama de Meta, Gemma de Google, Qwen d’Alibaba, les models de Mistral et les publications de DeepSeek vivent sur votre système de fichiers et n’appellent pas la maison. La quantization est le bouton de compression qui rend ça à l’échelle pleb : un model à 70 milliards de paramètres veut ~140 GB en pleine précision mais tient dans environ 40 GB en 4-bit, avec un coût en qualité que vous pouvez mesurer.

Interface — la couche depuis laquelle vous opérez. Un runner charge les weights et sert l’inference ; une UI de chat s’assied par-dessus pour que vous ne tapiez pas dans un terminal toute la journée. Le runner expose une API ; l’UI lui parle sur votre LAN. Rien dans cette chaîne n’exige l’Internet public une fois les fichiers sur le disque.

Ce que vous faites réellement tourner

Voici l’outillage réel et nommé — les projets open-source qui font fonctionner l’inference locale aujourd’hui. Rien de tout cela n’est le travail de D-Central, et ça compte : cette pile appartient à la communauté open-weight, et nous en sommes des utilisateurs, pas des auteurs.

Ollama est le point de départ de la plupart des opérateurs. Il enveloppe le llama.cpp de Georgi Gerganov — le runner de référence C++ bare-metal — dans un daemon avec un CLI sensé et un registre de models. C’est à llama.cpp à peu près ce que faire tourner bitcoind est pour quelqu’un qui veut juste un node en ligne sans compiler des flags à la main. Installez-le, lancez ollama pull sur un model, et vous avez de l’inference. Si vous voulez régler vous-même la quantization et le batching, descendez directement à llama.cpp. Si vous êtes d’abord GUI et sur Mac, LM Studio est l’option bureau. Ce ne sont pas des concurrents ; ce sont des portes différentes vers la même pièce.

Un model à vraiment utiliser. Pour le chat général et le raisonnement, commencez avec Llama de Meta ou Gemma de Google dans une taille qui tient dans votre VRAM — les variantes plus petites de Gemma et Llama suffisent pour remplacer la plupart de l’usage de chatbots hébergés pour la plupart des gens, et les plus grandes referment davantage l’écart. Pour le code, la ligne Qwen Coder d’Alibaba est la réponse actuelle à l’échelle pleb et tourne sur une seule 3090 à une quantization raisonnable. Pour la transcription, le Whisper d’OpenAI tourne sur CPU si vous êtes patient et sur GPU si vous ne l’êtes pas — et c’est la raison pour laquelle vous ne payez plus jamais un service de transcription.

Une UI par-dessus. Open WebUI est l’interface de chat self-hosted sur laquelle la plupart des opérateurs atterrissent. Elle pointe vers votre instance Ollama et ressemble aux chatbots hébergés que vous connaissez déjà, sauf que le trafic ne quitte jamais votre réseau. Accédez-y sur votre LAN, ou via un mesh chiffré comme Tailscale si vous la voulez depuis votre téléphone sans ouvrir de port sur le monde.

MCP — le tissu conjonctif. Le Model Context Protocol est un standard ouvert pour laisser un model local atteindre des outils et des données — vos fichiers, un index de recherche, un script — via une interface définie plutôt qu’une intégration codée en dur. C’est la partie qui transforme un chatbot en quelque chose qui peut réellement faire du travail contre vos propres systèmes, et parce que c’est ouvert, vous pouvez lire exactement ce qu’il touche. La communauté possède aussi cette couche.

Nous n’avons entraîné aucun de ces models. Nous n’avons écrit aucun de ces runners. La pile repose sur les épaules de Meta, Google, Alibaba, Mistral, DeepSeek, Gerganov, l’équipe Ollama, l’équipe LM Studio, le Whisper publié ouvertement par OpenAI, et les milliers de contributeurs anonymes sur Hugging Face. Le crédit là où il est dû : ça fonctionne parce qu’ils ont fait la partie difficile et l’ont donné.

Où Bitcoin et Lightning s’insèrent

Posséder son argent et posséder son compute, c’est le même geste fait deux fois. Le Bitcoiner qui a refusé de détenir des pièces sur une plateforme d’échange, refusé de faire confiance à un node hébergé, et refusé de laisser un tiers terminer son TLS est la même personne qui ne va pas être ravi de nourrir chaque pensée à un endpoint de journalisation. Le réflexe se transfère exactement.

L’infrastructure se transfère aussi. L’inference souveraine a besoin de vraie puissance sur un circuit dédié, de maîtrise du PSU, de gestion thermique, d’espace en rack et d’aisance sous Linux — la pile exacte qu’un mineur à domicile fait déjà tourner dans son Hashcenter, notre terme pour une installation de compute optimisée autour d’une charge de travail souveraine sous propriété individuelle ou de petit groupe. Un garage avec un rack de GPU retirés faisant tourner un model open-weight est un Hashcenter, comme l’est un hangar plein d’ASIC. Les nuits froides, vous basculez les joules vers la charge de travail que vous voulez ; la puissance que vous injectez ressort en chaleur de toute façon, et la chaleur finit dans votre maison.

Lightning referme la boucle économique. Quand vous n’utilisez pas votre propre compute, le même rig peut vendre de l’inference contre des sats via Lightning — règlement comptabilisé, sans confiance, pay-per-token, sans processeur de paiement au milieu. L’argent qu’on possède finance et monétise le compute qu’on possède. Le Bitcoiner n’est pas en train de boulonner l’IA sur une vie sans rapport ; il étend une pile de souveraineté qu’il fait déjà tourner vers une couche adjacente de plus.

Les compromis honnêtes

Nous ne prétendrons pas que la pile locale est strictement meilleure. Elle ne l’est pas, et la vendre ainsi serait le geste corporatif que nous évitons. Voici le bilan honnête.

Il y a un vrai écart de capacité face à la frontière. Les plus grands models hébergés des labos bien capitalisés sont, aujourd’hui, plus capables que ce que vous pouvez faire tourner à la maison — connaissances plus larges, context utilisable plus long, raisonnement plus fort sur les tâches les plus dures. Les publications open-weight ne cessent de réduire cet écart et ont déjà rejoint la frontière sur une bonne part du travail quotidien, mais sur les problèmes vraiment durs les models hébergés gagnent encore. Si vous avez besoin de la meilleure réponse absolue à une question de grade frontière, la machine louée est parfois le bon outil. La souveraineté a un coût, et prétendre le contraire insulte votre intelligence.

Il y a un coût initial. Un GPU d’occasion, un PSU platinum qui ne fléchira pas sous une charge transitoire, de la RAM système, du stockage rapide et un circuit de réserve, c’est de l’argent réel qui sort avant de générer un seul token. L’option hébergée, c’est des cents par requête sans mise de capital. Vous échangez un loyer récurrent contre une propriété unique — le même échange qu’acheter un mineur plutôt que louer un contrat de hashrate, et le calcul dépend de combien vous l’utilisez vraiment.

Il y a une charge d’opérateur. Vous possédez maintenant la disponibilité. Pas de SLA, parce que l’opérateur et le bénéficiaire sont la même personne. Vous le patchez, vous le refroidissez, vous déboguez le kernel panic à 2 h du matin. Pour un pleb qui maintient déjà des mineurs, c’est un travail familier et pas un frein décisif. Pour quelqu’un qui veut un appareil clé en main, c’est de la friction. Nous n’allons pas l’habiller autrement.

Le résumé honnête : l’IA locale est une sauvegarde et une couverture de souveraineté, excellente pour la majorité des tâches quotidiennes, qui tourne sur du matériel et une enveloppe thermique que vous possédez déjà en bonne partie — et pas un remplacement magique de la frontière sur les problèmes les plus durs. Gardez Bitcoin comme ancre et traitez le compute local comme la couche que vous contrôlez quand la version louée est retirée.

Comment commencer petit

Vous n’avez pas besoin d’un rig quad-GPU pour débuter. Le plus petit premier pas honnête, c’est une soirée de travail :

  1. Installez un runner. Mettez Ollama sur une machine que vous possédez déjà — même un portable avec un GPU décent, ou une boîte CPU si vous êtes patient. Une commande met le daemon en marche.
  2. Tirez un petit model. Prenez une petite variante Gemma ou Llama qui tient dans votre VRAM. Ce sera assez bon pour sentir la différence entre un model sur votre disque et un model sur le serveur de quelqu’un d’autre.
  3. Parlez-lui d’abord dans le terminal. Confirmez que ça fonctionne, mesurez vos tokens par seconde, et prenez le pouls de ce que votre matériel peut faire avant de dépenser quoi que ce soit.
  4. Ajoutez une UI quand vous en voulez une. Montez Open WebUI pointé vers votre runner pour que le reste du foyer puisse l’utiliser comme un chatbot normal — sauf que le trafic reste sur votre LAN.
  5. Montez en charge dans votre Hashcenter seulement si l’usage le justifie. Si vous vous retrouvez à y recourir chaque jour, ajoutez alors une 3090 d’occasion, un vrai PSU et un circuit 20 ampères de réserve — la marge existe probablement déjà à côté de vos mineurs.

C’est toute la rampe d’accès. Aucun achat requis pour commencer, aucun verrouillage, aucun compte. Des weights sur le disque, un runner au démarrage, et une soirée.

Où aller ensuite : lisez le dossier plus large pour l’IA souveraine sur /ai/, voyez comment ça s’inscrit dans la pile de souveraineté pleb plus large, et lisez l’argument plus long dans le manifeste Mining Hackers. L’éthique open-source derrière tout cela est la même qui anime notre travail de firmware sur DCENT_OS — et si vous vous procurez le matériel pour faire tourner tout cela, la boutique est là où vit le silicium. Une note sur cette éthique, dite clairement : DCENT_OS est cité ici purement comme exemple de l’instinct open-source. C’est du firmware de minage. Il ne fait pas tourner la pile IA, et aucun produit D-Central ne fait tourner votre inference. Votre compute tourne sur un GPU ou un CPU que vous possédez — c’est tout le point.

FAQ

Quelle est la façon la moins chère de commencer à faire tourner l’IA en local?

Installez Ollama sur une machine que vous possédez déjà et tirez un petit model open-weight comme une variante compacte de Gemma ou Llama. Si vous avez un GPU de jeu avec 8–12 GB de VRAM, vous pouvez faire tourner un model utile ce soir pour le coût d’une soirée. Vous n’avez besoin d’acheter du matériel dédié — un GPU 24 GB d’occasion, un vrai PSU, un circuit de réserve — que lorsque votre usage le justifie.

L’IA locale est-elle aussi bonne que ChatGPT ou Claude?

Honnêtement, pas sur les tâches les plus dures. Les plus grands models de frontière hébergés restent plus capables sur le raisonnement le plus coriace et les connaissances les plus larges. Mais les models open-weight rejoignent déjà la frontière sur une grande part du travail quotidien, et ils tournent entièrement sur du matériel que vous possédez sans journalisation, sans comptabilisation et sans kill switch. Traitez l’IA locale comme une sauvegarde souveraine qui gère la plupart de ce dont vous avez besoin, pas comme un remplacement strict de la frontière.

D-Central fabrique-t-elle un produit IA ou une boîte qui fait tourner les models?

Non. D-Central est une entreprise de matériel et de firmware de minage Bitcoin. Nous ne vendons pas d’appareil IA, et aucun produit D-Central ne fait tourner votre inference. Tout ce qui est décrit ici tourne sur des outils open-source — Ollama, llama.cpp, models open-weight, MCP — sur un GPU ou un CPU que vous possédez. Nous citons DCENT_OS uniquement comme exemple de la même éthique open-source, pas comme partie de la pile IA.

Puis-je faire tourner l’IA sur mes mineurs ASIC?

Non — un ASIC est conçu pour le hachage SHA-256 du minage Bitcoin et ne peut pas faire tourner un model de langage. L’inference est une charge de travail taillée pour le GPU. Ce qui se transfère, c’est l’installation : la puissance, les circuits dédiés, la conception thermique, les racks et l’aisance sous Linux dans votre Hashcenter. Boulonnez un rack de GPU sur cette enveloppe et vous avez une configuration dual-workload qui peut hasher ou faire de l’inference depuis la même pièce.

Comment Bitcoin ou Lightning se relient-ils au fait de faire tourner sa propre IA?

Posséder son compute, c’est le même geste que posséder ses clés, un cran plus haut — la possession plutôt que la confiance. Bitcoin reste l’ancre ; l’IA locale est une couche de souveraineté supplémentaire que vous contrôlez. En pratique, Lightning vous laisse vendre l’inference de réserve contre des sats via un canal sans confiance, pay-per-token, quand vous n’utilisez pas le rig vous-même, de sorte que le même matériel qui couvre votre souveraineté peut aussi rapporter.

Mining Profitability Calculator Calculate your mining revenue, electricity costs, and net profit with live Bitcoin data.
Try the Calculator

D-Central

Bitcoin Mining Experts Since 2016

Réparation ASIC Bitaxe Pioneer Open-Source Mining Chaufferettes Home Mining

D-Central Technologies est une entreprise canadienne de minage Bitcoin qui rend la technologie minière de niveau institutionnel accessible aux mineurs à domicile. Des milliers de mineurs réparés, 350+ produits expédiés du Canada.

About D-Central →

Articles connexes

Start Mining Smarter

Whether you are heating your home with sats, building a Bitaxe, or scaling up — D-Central has the hardware, repairs, and expertise you need.

Browse Products Talk to a Mining Expert