Si vous exploitez un mineur Bitcoin, vous opérez déjà (ou pouvez mettre en place en un clin d’œil) une brique d’infrastructure que la plupart des gens paient une startup pour louer : un Lightning node capable de régler des paiements instantanément, à l’échelle mondiale, pour des fractions de cent. Toute la conversation autour de L402, le protocole de paywall natif Lightning, a porté sur le côté achat — un agent IA qui paie par requête. Presque personne ne parle de l’autre moitié : vous pouvez être celui qui vend. La même boîte qui hashe et chauffe votre pièce peut aussi monter une API mesurée et facturer des sats par appel.
TL;DR — la réponse courte
Vous pouvez placer un LLM local derrière un paywall Lightning et laisser n’importe qui sur Internet payer par appel, sans inscription, sans clé API, sans compte. La pile de référence est Ollama → un endpoint FastAPI /generate → Aperture (le reverse proxy L402) → votre propre Lightning node. L’honnêteté critique : l’inference s’exécute sur un GPU ou un CPU que vous possédez — jamais sur l’ASIC SHA-256. Votre Antminer hashe le Bitcoin; un GPU séparé fait la réflexion; votre Lightning node encaisse les sats. Un opérateur de mineurs a déjà l’électricité, le refroidissement et le node — c’est précisément pourquoi cette boucle est plus facile à fermer dans votre sous-sol que dans un centre de données.
La moitié manquante de l’histoire L402
L402 est un protocole ouvert de Lightning Labs — l’équipe derrière lnd — qui boulonne les paiements directement sur la plomberie du web. Il réutilise le code de statut HTTP longtemps oublié 402 Payment Required : un serveur remet au client un invoice Lightning plus un jeton d’authentification (un macaroon), le client paie l’invoice via Lightning, et le preimage du paiement devient la preuve qui déverrouille la ressource. Pas de Stripe, pas de formulaire d’inscription, pas de minimum mensuel. Payez, obtenez le preimage, faites votre appel. C’est tout.
Lightning Labs a conçu et mis en open source Aperture précisément pour cela : c’est un reverse proxy conscient de L402 qui se place devant n’importe quelle API backend, émet le défi 402, vérifie le paiement Lightning, puis laisse passer la requête. Rendons à César ce qui lui appartient — le protocole, le proxy et tout le modèle de paiement par appel sont leur travail. Nous ne faisons que souligner le cas d’usage que l’écosystème continue d’ignorer.
Parce que presque tous les tutoriels L402 sont écrits depuis le fauteuil du consommateur : « voici comment votre agent autonome paie une API en Bitcoin. » Utile, mais cela laisse le côté offre grand ouvert. Qui fait tourner l’endpoint mesuré que l’agent paie? Dans une boucle souveraine, la réponse devrait être un autre pleb, pas un hyperscaler. Si vous babysittez déjà des mineurs, vous êtes plus près d’être ce fournisseur que presque n’importe qui d’autre.
D’abord, le mur de la précision : votre ASIC ne peut pas faire d’inference
Tuons le fantasme avant qu’il ne vous coûte de l’argent. Un ASIC SHA-256 — la puce à l’intérieur d’un Antminer — est du silicium à fonction fixe. Il fait exactement une chose : calculer des double-hashes SHA-256 aussi vite que la physique le permet. Il n’a aucune unité de calcul généraliste, pas de mathématique à virgule flottante, pas de cœurs tensoriels, et pas de mémoire utilisable pour les poids d’un model. Vous ne pouvez pas charger Llama sur un BM1387 ou un BM1368. Ce n’est pas un GPU lent; c’est une puce qui ne peut physiquement pas exécuter les opérations qu’un réseau de neurones exige. Nous avons écrit un article entier sur pourquoi c’est vrai — voir pourquoi les mineurs Bitcoin devraient ignorer le battage IA et rester sur le SHA-256.
Donc quand les gens disent « les mineurs basculent vers l’IA », ils ne reconvertissent pas les ASIC. Ils réutilisent les trois choses autour des ASIC qui sont vraiment coûteuses et difficiles à obtenir : des contrats d’électricité bon marché, un refroidissement industriel, et de l’immobilier autorisé. Les puces sont mises au rebut ou revendues; le bâtiment accueille des GPU. La même logique s’applique chez vous à petite échelle : votre mineur vous a appris à injecter des kilowatts dans une pièce et à en extraire la chaleur. Ce muscle opérationnel durement acquis est l’actif, pas la puce de hash.
L’inference dans tout cet article s’exécute sur un GPU ou un CPU que vous possédez — une carte grand public, une carte de station de travail reconditionnée, même un CPU costaud pour les petits models. L’ASIC reste dans son couloir à hasher le Bitcoin. Le Lightning node règle les paiements. Trois jobs, trois pièces de matériel. Les confondre, c’est construire quelque chose qui ne fonctionne pas.
La pile de référence : Ollama → FastAPI → Aperture → votre node
Voici l’architecture honnête et minimale pour vendre de l’inference via Lightning. Chaque composant est open source et tourne sur du matériel que vous contrôlez.
- Ollama — le runtime de model local. Il charge un model à poids ouverts (Llama, Mistral, Qwen, ce qui rentre dans votre VRAM) sur votre GPU et expose une API de génération locale simple. C’est la partie qui fait vraiment la réflexion, sur votre silicium, avec votre électricité. Rien ne quitte la boîte.
- Endpoint FastAPI
/generate— une mince enveloppe Python que vous écrivez, qui prend un prompt, le transmet à Ollama et renvoie la complétion. C’est votre API : vous décidez de la forme de la requête, du model, des limites de tokens, des plafonds de débit. C’est peut-être quarante lignes de code. - Aperture (le reverse proxy L402) — le proxy de Lightning Labs se place devant votre endpoint FastAPI. Quand une requête non payée arrive, Aperture répond avec
402 Payment Required, un invoice Lightning et un macaroon. Il ne transmet la requête à votre route/generatequ’après que l’invoice est payé et que le preimage est validé. - Votre Lightning node —
lnd(ou un node compatible) génère les invoices qu’Aperture distribue et reçoit les sats. C’est la pièce qu’un opérateur de mineurs fait déjà très probablement tourner, ou qu’il peut monter en une soirée sur la même machine qui surveille déjà les rigs.
Une requête circule ainsi : un client (le script d’un humain, ou un agent autonome) frappe votre URL publique → Aperture renvoie un 402 avec un invoice → le client paie via Lightning → le client réessaie avec le preimage → Aperture vérifie et transmet à FastAPI → FastAPI demande la complétion à Ollama → les tokens reviennent. L’appelant n’a jamais créé de compte. Vous n’avez jamais touché à son identité. L’argent et les données ont bougé en un aller-retour.
Tarification par appel, en sats, sans intermédiaire
Parce que L402 émet un invoice frais par requête, vous pouvez tarifer selon le coût réel du travail. Un prix forfaitaire par appel est le plus simple. Mais comme vous contrôlez la couche FastAPI, vous pouvez aussi mesurer sur la sortie : compter les tokens que le model a produits et fixer l’invoice en conséquence, de sorte qu’une réponse d’une ligne coûte moins qu’un essai de mille tokens. Vous pouvez facturer plus pour un plus gros model et moins pour un tout petit, le tout depuis le même node.
Nous refusons délibérément de citer un chiffre. Ce que vous pouvez gagner par appel dépend de votre model, de votre électricité, de votre carte, et de ce que le marché accepte — et quiconque vous promet un rendement devine. Le cadrage honnête est simplement ceci : chaque appel payé rapporte des sats, réglés instantanément, sans plateforme qui prélève une commission et sans rétrofacturations. Que cela se traduise en revenu réel, c’est votre calcul à faire, sur votre matériel, avec le prix de votre électricité. Nous ne prétendrons pas le connaître à votre place.
Une note de coût vraiment honnête : si vous self-hostez le node, il n’y a pas de frais par transaction qui partent vers un processeur de paiement. C’est une propriété factuelle de faire tourner votre propre Lightning node — pas un argument de vente sur les économies, simplement le fonctionnement des rails quand vous les possédez.
Quelle boîte fait quoi (la partie que la plupart des guides floutent)
Répétons-le, parce que c’est la différence entre une configuration qui marche et une qui confond tout :
- L’ASIC hashe. Votre Antminer continue de miner du Bitcoin. Il gagne des récompenses de bloc, pas des frais d’inference. Il ne voit jamais un seul token. Il est à fonction fixe et en est fier.
- Le GPU (ou le CPU) fait l’inference. Une machine généraliste séparée que vous possédez fait tourner Ollama et produit la sortie IA. C’est la seule chose qui fait de l’IA. Si vous ne possédez pas de GPU capable, vous n’avez pas d’entreprise d’inference — vous avez un Lightning node et un plan.
- Le Lightning node règle. Il émet les invoices et encaisse les sats. Il peut vivre sur la même machine basse consommation qui surveille déjà vos mineurs.
- La chaleur est un bonus, pas le produit. L’ASIC comme le GPU déversent presque tous leurs watts dans votre pièce sous forme de chaleur. C’est la même histoire de chaleur fatale que nous couvrons dans notre travail sur chauffer votre maison avec l’inference, pas seulement avec le hashing — un sujet qui mérite sa propre lecture.
Pourquoi un opérateur de mineurs est unique pour cela
Monter une API publique payante est normalement une galère : il vous faut de l’électricité fiable et bon marché, un endroit où déverser la chaleur, et une relation de paiement avec un processeur qui finira par demander votre pièce d’identité et vos coordonnées bancaires. Un mineur Bitcoin a déjà résolu les deux premiers points et a explicitement rejeté le troisième.
- L’électricité et le refroidissement sont déjà gérés. Vous avez dimensionné un circuit, vous gérez le flux d’air, vous connaissez votre prix du kWh par cœur. Ajouter un GPU dans une pièce qui mange déjà quelques milliers de watts est une erreur d’arrondi sur le plan opérationnel.
- Vous pensez déjà en sats. Un Lightning node n’est pas un accessoire exotique pour vous — c’est la couche de règlement naturelle pour quelqu’un qui détient et déplace déjà du Bitcoin. Le rail de paiement que vos concurrents de location d’IA doivent apprendre est votre terrain de jeu.
- Vous possédez toute la pile. Pas de facture de GPU cloud qui peut décupler du jour au lendemain, pas de fournisseur d’API qui peut vous déplatformer, pas de model derrière les conditions d’utilisation de quelqu’un d’autre. C’est la logique de souveraineté qui traverse tout ce que nous construisons — la même raison pour laquelle nous investissons dans un firmware open source comme DCENT_OS, où vous possédez et auditez le code aussi du côté minage de la pièce.
C’est une sauvegarde de plus dans un monde qui ne cesse de se centraliser. Le Bitcoin est la sauvegarde de la finance fiat. Le calcul self-hosted est la sauvegarde de l’intelligence louée et surveillée. Un node qui vend de l’inference contre des sats se situe exactement là où ces deux sauvegardes se chevauchent : votre argent, votre model, votre matériel, votre pièce. Nous cartographions toute cette pile sur notre hub souveraineté — c’est la couche calcul, conçue pour se payer elle-même.
Note de bas de page : qu’est-ce qui porte les paquets si le FAI coupe?
Une API payante n’est souveraine qu’à la mesure du réseau sur lequel elle répond. Si votre seul chemin vers Internet est un unique FAI qui peut brider, journaliser ou vous couper, vous avez décentralisé l’argent et le calcul mais laissé la connectivité en location. C’est pourquoi le réseautage maillé fait partie de la même conversation — un mesh communautaire est la sauvegarde d’Internet comme le Bitcoin est la sauvegarde de la banque. Nous ne prétendrons pas que vous servirez une API d’inference à fort trafic sur un lien mesh aujourd’hui; ce n’est pas la prétention. Le point, c’est que la version résiliente de cette boucle voudra tôt ou tard une connectivité résiliente en dessous, et cette couche existe dans la pile de souveraineté aux côtés de l’argent et du calcul. Montez le paywall maintenant; sachez que la sauvegarde réseau fait partie du même projet.
Sur les épaules des géants
Rien de tout cela n’est à notre crédit. Lightning Labs a conçu L402 et livré Aperture en open source. Le projet Ollama a rendu l’exécution de models locaux véritablement simple. Les équipes de models à poids ouverts ont mis des models capables entre vos mains sans licence à louer. Notre contribution est étroite et honnête : nous sommes les Bitcoin mining hackers qui soulignent que les gens qui font déjà tourner des kilowatts et des Lightning nodes sont assis du côté offre d’un marché dont tout le monde d’autre s’affaire à construire le côté demande. Nous n’avons pas inventé les rails. Nous avons juste remarqué que votre sous-sol est déjà à moitié câblé pour eux. Et quand vous voulez une couche de découverte au-dessus du paywall, les Nostr data vending machines (NIP-90) sont le marché émergent où exactement ce type de calcul payé s’achète et se vend.
Questions fréquemment posées
L’inference s’exécute-t-elle sur mon ASIC Bitcoin?
Non. Un ASIC SHA-256 est du silicium à fonction fixe qui ne peut calculer que des hashes Bitcoin — il ne peut physiquement pas faire tourner un réseau de neurones. L’inference s’exécute sur un GPU ou un CPU séparé que vous possédez. L’ASIC continue de miner; le GPU fait l’IA; le Lightning node encaisse les sats. Trois jobs différents sur trois pièces de matériel différentes.
Qu’est-ce que L402?
L402 est un protocole ouvert de Lightning Labs qui utilise le code de statut HTTP 402 Payment Required pour conditionner n’importe quelle ressource web à un paiement Lightning. Le serveur renvoie un invoice et un jeton d’authentification; le client paie via Lightning; le preimage du paiement déverrouille la ressource. Cela permet des API pay-per-call sans inscription, sans compte et sans carte de crédit.
Qu’est-ce qu’Aperture?
Aperture est le reverse proxy open source, conscient de L402, de Lightning Labs. Vous le placez devant n’importe quelle API backend — dans ce cas votre endpoint LLM local — et il gère l’émission du défi 402, la génération de l’invoice Lightning, la vérification du paiement, et le transfert de la requête payée vers votre service.
Combien puis-je gagner en vendant de l’inference via Lightning?
Cela dépend entièrement de votre model, de votre GPU, du prix de votre électricité et de la demande — alors nous ne citerons pas de chiffre, car quiconque le fait devine. Chaque appel payé rapporte des sats réglés instantanément sans qu’un processeur prélève une commission, mais que cela se traduise en revenu réel, c’est un calcul que vous faites sur votre propre matériel et vos coûts d’électricité.
Dois-je faire tourner mon propre Lightning node?
Pour encaisser les paiements nativement et garder la garde de vos sats, oui — la pile de référence utilise votre propre node (comme lnd) pour émettre les invoices et recevoir les fonds. L’avantage du self-hosting est direct : il n’y a pas de processeur de paiement entre vous et vos clients, et aucun frais par transaction qui quitte votre poche. Si vous faites déjà tourner un mineur, vous avez probablement une machine qui peut héberger le node aux côtés de votre monitoring.
Est-ce un schéma pour s’enrichir vite?
Non. C’est une façon de faire faire à du matériel que vous possédez déjà un travail utile et payé sur un rail de paiement souverain. Cela récompense les gens qui ont déjà de l’électricité bon marché, du refroidissement et un GPU — ce qui décrit beaucoup de mineurs Bitcoin. Le pitch honnête, c’est la souveraineté et l’optionalité, pas un rendement.
Si vous voulez le tableau plus large — posséder votre argent, votre calcul, votre firmware et votre connectivité comme une pile de sauvegardes contre un monde qui se centralise — commencez par notre hub souveraineté et l’aperçu calcul souverain pour les plebs. Si vous construisez le côté minage de cette pièce et voulez posséder le firmware autant que le node, rencontrez DCENT_OS, notre firmware Antminer open source en beta publique. Et si vous avez besoin du matériel pour faire tourner un node, parcourez la boutique. Pas de vente agressive — juste les pièces de la boucle que nous construisons et utilisons nous-mêmes.




