Passer au contenu

Bitcoin accepté au paiement  |  Expédié depuis Montréal, QC, Canada  |  Soutien expert depuis 2016

Ollama, c’est la partie facile — posséder la puissance et la chaleur en dessous, c’est la partie souveraine
Auto-hébergement IA

Ollama, c’est la partie facile — posséder la puissance et la chaleur en dessous, c’est la partie souveraine

· D-Central · ⏱ 14 min de lecture

Vous pouvez avoir un grand modèle de langage local qui répond aux prompts sur votre propre matériel en environ cinq minutes. Ollama a rendu cela vrai pour les gens ordinaires, et le mérite est dû : l’équipe Ollama a enveloppé llama.cpp — le moteur d’inference que Georgi Gerganov a donné au monde — dans une installation en une ligne et un registre de models propre. Le téléchargement se termine, vous tapez ollama run, et un model qui aurait été à la fine pointe il y a quelques années commence à vous répondre. Pas de clé API. Pas de rate limit. Aucun prompt expédié vers le pipeline de journaux d’un hyperscaler.

Cette partie est vraiment facile. C’est aussi la partie où tous les guides s’arrêtent.

La question souveraine commence au moment où vous décidez que cette boîte doit rester allumée. Un model que vous pouvez invoquer en cinq minutes est un jouet. Un model qui est toujours là — qui répond à 3 h du matin, indexe vos notes, rédige en arrière-plan — c’est de l’infrastructure. Et une infrastructure qui tourne vingt-quatre heures sur vingt-quatre a une facture d’électricité, une charge thermique et un problème de refroidissement en dessous. Ce « en dessous », c’est la partie que les tutoriels d’installation sautent, et c’est justement la chose exacte que les mineurs Bitcoin comprennent depuis une décennie.

C’est une couche de plus de décentralisation. Votre nœud valide le Bitcoin sur votre propre métal. Vos canaux Lightning acheminent de la valeur sur votre propre métal. Posséder votre pile d’inference ne compte comme souveraineté que si vous possédez aussi les watts et la chaleur qu’elle produit — pas seulement les weights sur le disque.


Ollama en cinq minutes (la partie vraiment facile)

Nous n’allons pas réenseigner l’installation ici — nous l’avons déjà écrite, étape par étape, dans Installer Ollama et lancer votre premier LLM local en 10 minutes. La version courte, pour qu’on soit tous au même point :

# Linux
curl -fsSL https://ollama.com/install.sh | sh

# then pull a model and talk to it
ollama run llama3.1:8b

macOS et Windows ont un installateur normal. Sur les trois, vous vous retrouvez avec un CLI ollama et un service en arrière-plan qui écoute sur localhost:11434. Tirez un model, lancez-le, c’est fait. Si vous voulez comparer Ollama aux alternatives avant de vous engager, nous l’avons fait dans LM Studio vs Ollama vs llama.cpp.

C’est la partie qui mérite les éloges qu’elle reçoit. C’est vraiment cinq minutes. Le problème, c’est que « ça tourne » et « ça tourne de façon durable, toute la journée, dans une pièce où vous vivez aussi » sont deux affirmations très différentes — et seule la première figure dans la doc.


La partie que les guides sautent : la consommation 24/7

Voici le changement de mentalité. Quand vous lancez Ollama pour répondre à une question, le GPU monte en charge pendant quelques secondes puis redescend au ralenti. Faites-le tourner un après-midi et votre compteur d’électricité le remarque à peine. Mais tout l’intérêt du self-hosting, c’est que la chose est à vous et qu’elle est toujours allumée. Au moment où vous décidez de faire tourner Ollama 24/7 — comme un service que vos autres outils appellent, comme un assistant privé qui ne dort jamais — vous vous engagez à alimenter une boîte en continu.

Une boîte toujours allumée consomme de l’énergie selon trois régimes, et la facture est dominée par le plus banal :

  • Idle : le service est debout, aucun prompt en cours. Un rig GPU grand public tourne au ralenti quelque part dans les basses dizaines de watts pour la carte, plus ce que tire le reste de la machine (CPU, RAM, disques, overhead du PSU). C’est la majeure partie de vos heures.
  • Inference : un prompt génère des tokens. Le GPU grimpe vers sa puissance de carte nominale pendant la durée de la réponse — quelques secondes à quelques minutes — puis redescend.
  • Charge soutenue : tâches par lots, un agent en boucle, plusieurs utilisateurs, ou un model qui garde la carte occupée. C’est là que vous approchez réellement le TDP de la carte pendant de longues périodes.

Pour un assistant mono-utilisateur, vous passez la vaste majorité de la journée en idle, avec de brèves pointes d’inference. C’est une bonne nouvelle pour la facture et une mauvaise pour quiconque a dimensionné son setup uniquement sur la puissance de pointe. La façon honnête d’estimer une boîte d’IA locale 24/7, c’est : baseline surtout en idle × 24 heures, plus un petit ajout d’inference. Pas le TDP de pointe × 24.

L’instinct du mineur est le bon ici. Un mineur Bitcoin ne demande pas « à quelle vitesse peut-il aller pendant une seconde? » — il demande « qu’est-ce qu’il tire, en watts, heure après heure, et qu’est-ce que ça coûte à mon tarif du kWh? » Appliquez la même question à votre boîte d’IA et vous la dimensionnerez honnêtement. Watts × heures × votre prix de l’électricité est le seul chiffre qui compte, et c’est celui que le guide d’installation ne mentionne jamais.


VRAM vs wattage vs chaleur (les chiffres honnêtes)

Les gens confondent trois limites différentes, et c’est dans cette confusion que l’argent se gaspille. Ce n’est pas la même contrainte.

  • La VRAM décide de ce que vous pouvez faire tourner. C’est un mur dur : si les weights du model (après quantization) plus son context ne tiennent pas en mémoire vidéo, soit il ne charge pas, soit il déborde en RAM système et rampe. Comme règle de pouce approximative, en date de 2026, une carte de 8 GB fait tourner confortablement des models 7B–8B en quantization 4 bits; 12–16 GB atteignent le 13B; 24 GB (une RTX 3090 d’occasion est le sweet spot bien connu des plebs) gère des models de classe 30B ou des 70B fortement quantifiés. Traitez ces repères comme des points de départ, pas des garanties — le niveau de quantization, la longueur du context et le model spécifique déplacent tous la ligne.
  • Le wattage décide de ce que ça coûte. La VRAM est gratuite à rester pleine; les watts, c’est ce que vous payez. La puissance de carte (TDP) est le plafond, pas la moyenne. Deux cartes avec une VRAM identique peuvent avoir une consommation et une efficacité par token très différentes.
  • La chaleur, c’est le wattage reformulé. C’est la partie que presque personne ne dit à voix haute : essentiellement chaque watt que tire votre GPU ressort en chaleur. Une carte qui tire 300 W en charge soutenue, c’est un radiateur d’appoint de 300 W pointé vers votre bureau. Il n’y a pas de magie — la puissance électrique entrante égale la chaleur sortante. Ce n’est pas un défaut; pour un mineur, c’est tout le modèle d’affaires. Mais cela signifie que l’empreinte thermique de votre boîte d’IA égale son empreinte électrique, et vous devez mettre cette chaleur quelque part.

Nous restons volontairement prudents sur les détails de wattage parce qu’ils bougent à chaque génération de GPU, chaque pilote et chaque sortie de model. Le principe, lui, ne bouge pas : la VRAM est un mur, les watts sont la facture, et les watts deviennent de la chaleur. Quiconque vous cite un chiffre 24/7 précis sans connaître votre carte, votre model et votre tarif du kWh devine. Dimensionnez sur votre propre matériel, mesurez au mur avec un wattmètre, et vous connaîtrez la vérité en une journée.


Refroidir une boîte d’IA locale (ce que les mineurs savent déjà)

Une fois que vous acceptez que les watts deviennent de la chaleur, le refroidissement cesse d’être une arrière-pensée et devient une contrainte de conception — et c’est le terrain de jeu de quiconque a déjà fait tourner du matériel de minage. Les leçons se transfèrent presque une pour une :

  • Le flux d’air bat la vitesse brute des ventilateurs. Un chemin d’admission-à-évacuation clair à travers le boîtier compte plus que des ventilateurs plus bruyants. Les cartes qui recirculent leur propre évacuation chaude se limitent (throttle), et un GPU en throttle vous donne moins de tokens par seconde pour les mêmes watts.
  • La température ambiante est votre plafond. Une boîte dans un placard chaud tourne plus chaud, se limite plus tôt et vieillit plus vite. Les mineurs sont obsédés par la température de l’air d’admission pour exactement cette raison; votre 3090 s’en soucie tout autant.
  • La poussière est le tueur lent. Un flux d’air continu aspire la poussière dans les dissipateurs. Une boîte qui tourne 24/7 a besoin de la même discipline de nettoyage périodique qu’un mineur donne à une hashboard.
  • Le bruit est réel. Un GPU en charge soutenue monte en régime. Ce n’est nulle part près du rugissement de réacteur d’un ASIC, mais si la boîte vit dans la pièce où vous travaillez, planifiez en conséquence. Beaucoup de plebs finissent par déplacer le rig au sous-sol, au garage ou dans un local technique — le même endroit où les mineurs vivent déjà.

Rien de tout cela n’est exotique. C’est la discipline banale, durement acquise, de faire tourner du matériel en continu, et le monde du minage Bitcoin en a une décennie. Si vous avez déjà réglé l’admission d’un mineur ou chassé un throttle thermique, vous savez déjà comment garder une boîte d’IA locale en santé. Si ce n’est pas le cas, le playbook de refroidissement de la communauté minière est la meilleure formation gratuite disponible.


Où va la chaleur (autant la réutiliser)

Voici le recadrage qui transforme un coût en actif. Ces 300 W de chaleur que votre boîte d’IA rejette ne sont pas du gaspillage — c’est de la chaleur que vous paieriez autrement une fournaise pour produire. Dans un climat froid (et le Canada est un climat froid une bonne partie de l’année), une boîte qui tourne 24/7 dans un espace occupé fait double emploi : répondre à vos prompts et réchauffer la pièce. L’électricité dépensée pour l’inference compense l’électricité que vous auriez dépensée pour le chauffage.

C’est exactement la logique derrière chauffer avec un mineur Bitcoin plutôt qu’avec un radiateur électrique idiot : un radiateur d’appoint résistif transforme un watt en un watt de chaleur et rien d’autre; un mineur transforme ce même watt en chaleur plus de la preuve de travail. Une boîte d’IA locale le transforme en chaleur plus des tokens. Dans les deux cas, vous obtenez du calcul utile comme sous-produit d’un chauffage que vous alliez faire de toute façon.

La mise en garde — et nous vous donnerons toujours la mise en garde — est saisonnière. La chaleur gratuite est un cadeau en janvier et un passif en juillet. En été, la même chaleur que vous accueilliez combat maintenant votre climatisation, et vous payez deux fois. Les mineurs qui font tourner des setups de réutilisation de chaleur depuis des années connaissent ce rythme par cœur : s’appuyer sur la chaleur en hiver, déplacer la boîte là où elle peut rejeter la chaleur à l’extérieur (ou simplement tourner plus léger) en été. La position honnête n’est pas « chauffage gratuit pour toujours » — c’est « la chaleur est réelle, planifiez autour des saisons, et dans un hiver canadien elle a une vraie valeur. »


L’option Hashcenter (installation facilitée, présentée honnêtement)

Peut-être avez-vous lu tout ce qui précède et conclu que faire tourner une boîte gourmande en énergie, qui rejette de la chaleur et fait tourner des ventilateurs dans votre maison n’est pas pour vous — du moins pas la version lourde. C’est un choix légitime, et c’est la raison pour laquelle l’hébergement existe dans le monde du minage Bitcoin en premier lieu. Tout le monde ne veut pas un radiateur industriel dans la pièce d’amis.

D-Central exploite des installations Hashcenter, et nous pouvons faciliter l’installation de matériel dans cet environnement. Soyons précis sur ce que cela signifie et ce que cela ne signifie pas :

  • Cela signifie que nous vous aidons à faire monter en rack, alimenter et refroidir de l’équipement dans un espace conçu pour du matériel en continu, à fort tirage et à forte chaleur — le genre d’environnement où une boîte 24/7 a sa place, conçu par des gens qui le font pour le minage depuis des années.
  • Cela ne signifie pas un accord de niveau de service, une garantie de disponibilité, ou une promesse de prix par kilowatt. Nous ne faisons pas ces affirmations, et vous devriez vous méfier de quiconque dans cet espace les sort à la légère. Nous présentons ce que nous offrons comme une installation facilitée, clairement, parce que c’est la description honnête.

Un point technique qui fait trébucher les gens, et qui compte : un mineur ASIC n’est pas du silicium d’IA. Les puces d’un mineur Bitcoin sont conçues pour calculer des hachages SHA-256 et littéralement rien d’autre — elles ne peuvent pas faire tourner un modèle de langage, et un modèle de langage ne peut pas tourner sur elles. Si vous voulez de l’IA locale, il vous faut une boîte GPU; si vous voulez miner du Bitcoin, il vous faut un mineur. Ce sont des machines séparées qui se trouvent partager les mêmes problèmes durs : l’alimentation continue et la chaleur rejetée. Un Hashcenter est bon pour résoudre ces problèmes, c’est pourquoi un rig GPU d’IA et un mineur peuvent vivre dans la même pièce même si le silicium qui fait le travail est complètement différent.

Si cet environnement correspond à la façon dont vous voulez faire tourner les choses, la page Hashcenter / hébergement est l’endroit pour démarrer la conversation. Si vous préférez garder la boîte à la maison et les watts sous votre propre toit, c’est le chemin le plus souverain et nous le respectons — c’est tout le point du self-hosting.


Où cela s’inscrit

Ollama vous a amené à la partie facile : un model sur votre propre métal en cinq minutes. La partie souveraine, c’est tout ce qu’il y a en dessous — les watts que vous lui donnez, la chaleur qu’elle rejette, et où vont les deux. Ce n’est pas un problème logiciel. C’est un problème d’énergie et de matériel, et c’est celui que les mineurs Bitcoin résolvent au grand jour depuis une décennie.

Si vous êtes plus tôt dans le parcours, commencez par notre hub d’IA self-hosted pour le côté logiciel, et lisez la pièce maîtresse — Peut-on vraiment faire tourner de l’IA sur un mineur Bitcoin? La réponse honnête — pour exactement pourquoi le silicium ASIC et le silicium d’IA sont des animaux différents. Pour le portrait plus large de posséder sa propre infrastructure, le hub de souveraineté relie le nœud, les canaux, et maintenant la boîte d’inference en une seule histoire. Et si vous êtes prêt à sourcer le matériel pour faire n’importe laquelle de ces choses, la boutique est là où vit le métal.


FAQ

Quelles sont les vraies exigences matérielles pour faire tourner Ollama?

Pour démarrer : une machine avec au moins 8 GB de RAM. L’inference CPU seule fonctionne mais est lente. Pour une expérience utilisable, vous voulez un GPU — et le chiffre limitant est la VRAM, pas la vitesse brute du GPU. Comme guide approximatif en date de 2026, 8 GB de VRAM font tourner confortablement des models 7B–8B en quantization 4 bits, 12–16 GB atteignent le 13B, et 24 GB gèrent des models de classe 30B ou des 70B fortement quantifiés. Ce sont des points de départ; la quantization, la longueur du context et le model spécifique déplacent tous la ligne, alors dimensionnez par rapport à votre propre matériel.

Combien d’énergie un LLM local utilise-t-il vraiment en 24/7?

Bien moins que ce que suggérerait le TDP de pointe du GPU, parce qu’un assistant mono-utilisateur passe la plupart de ses heures en idle avec de brèves pointes d’inference — pas cloué à pleine charge. L’estimation honnête est le tirage baseline surtout en idle × 24 heures, plus un petit ajout pour l’inference, multiplié par votre tarif d’électricité. Nous ne citerons pas un seul chiffre magique parce que cela dépend entièrement de votre carte, de votre model et de votre prix du kWh. Mettez un wattmètre sur la prise murale et vous connaîtrez votre vrai chiffre en une journée.

Faire tourner Ollama produit-il une chaleur notable?

Oui — essentiellement chaque watt que tire le GPU ressort en chaleur. Une carte qui tire quelques centaines de watts en charge soutenue est l’équivalent thermique d’un petit radiateur d’appoint. Dans un climat froid, c’est une fonctionnalité : la boîte réchauffe la pièce pendant qu’elle travaille. En été, elle combat votre climatisation. Planifiez pour les saisons, exactement comme le fait un mineur qui fait tourner un setup de réutilisation de chaleur.

Puis-je simplement faire tourner de l’IA sur mon mineur Bitcoin pour économiser du matériel?

Non. Les puces d’un mineur ASIC calculent des hachages SHA-256 et rien d’autre — elles ne peuvent physiquement pas faire tourner un modèle de langage. L’IA locale a besoin d’un GPU; le minage Bitcoin a besoin d’un ASIC. Ce sont des machines séparées qui partagent les deux mêmes problèmes durs : la consommation électrique continue et la chaleur rejetée. Notre pièce maîtresse, Peut-on vraiment faire tourner de l’IA sur un mineur Bitcoin?, explique exactement pourquoi le silicium ne se croise pas.

Et si je ne veux pas d’une boîte chaude et bruyante qui tourne dans ma maison?

C’est un choix raisonnable, et c’est pourquoi l’hébergement existe. D-Central exploite des installations Hashcenter et peut faciliter l’installation de matériel dans un environnement conçu pour l’alimentation continue et la chaleur importante. Pour être clair, c’est une installation facilitée — pas une garantie de disponibilité, un SLA, ni une promesse de prix par kilowatt. Si cela correspond à la façon dont vous voulez faire tourner les choses, commencez à la page Hashcenter / hébergement.


Le mérite là où il est dû : Ollama est le travail de son équipe et de ses contributeurs, construit par-dessus llama.cpp de Georgi Gerganov et de la communauté open source. La contribution de D-Central, c’est la partie banale et durable en dessous — l’alimentation, le refroidissement et la chaleur — parce que c’est la partie qui transforme une démo de cinq minutes en quelque chose que vous possédez vraiment.

Mining Profitability Calculator Calculate your mining revenue, electricity costs, and net profit with live Bitcoin data.
Try the Calculator

D-Central

Bitcoin Mining Experts Since 2016

Réparation ASIC Bitaxe Pioneer Open-Source Mining Chaufferettes Home Mining

D-Central Technologies est une entreprise canadienne de minage Bitcoin qui rend la technologie minière de niveau institutionnel accessible aux mineurs à domicile. Des milliers de mineurs réparés, 350+ produits expédiés du Canada.

About D-Central →

Articles connexes

Start Mining Smarter

Whether you are heating your home with sats, building a Bitaxe, or scaling up — D-Central has the hardware, repairs, and expertise you need.

Browse Products Talk to a Mining Expert