Passer au contenu
Petite équipe, gros carnet, aucune commande abandonnée. Nos réponses sont plus lentes qu’on le voudrait. Lire notre mise à jour → Aucune commande abandonnée. Mise à jour → 📬 Vérifiez vos indésirables — c’est souvent là que nos réponses aboutissent. On répond, promis. Mise à jour → 📬 Vérifiez vos indésirables. Mise à jour →
Remplacer une IA cloud bannie par un LLM local : le plan d’un après-midi
Auto-hébergement IA

Remplacer une IA cloud bannie par un LLM local : le plan d’un après-midi

· D-Central · ⏱ 13 min de lecture

Si votre flux de travail s’est effondré à 5 h 21 un jeudi parce que quelqu’un dans un autre pays a signé une directive, la solution n’est pas un meilleur fournisseur. C’est aucun fournisseur. Le 12 juin, une directive américaine de contrôle des exportations a forcé Anthropic à désactiver Claude Fable 5 et Mythos 5 pour les ressortissants étrangers; les sessions en cours sont silencieusement retombées sur Opus 4.8 en plein milieu d’une tâche. Aucune page de panne, aucun avertissement — juste un model différent qui répondait, et pour beaucoup de gens, un flux de travail qui se comportait soudainement autrement que celui autour duquel ils avaient bâti leur semaine.

C’est la partie peu glamour. Celle où vous arrêtez de lire sur la souveraineté et téléchargez vraiment un model qui tourne sur une machine que vous pouvez débrancher physiquement. Il ne sera pas aussi intelligent que le model de frontière que vous avez perdu. Il ne vous sera jamais non plus retiré, et pour une quantité surprenante de vrai travail, ce compromis est le bon. Voici comment en mettre un en place en un après-midi — et nous serons honnêtes sur les 80 % que les tutoriels en une commande passent sous silence.

Points clés

  • Le téléchargement, c’est les 20 % faciles. Une commande fait parler un model; les 80 % restants — context, prompts, retrieval, vitesse, confidentialité — décident si vous continuez vraiment à l’utiliser.
  • Choisissez le travail avant le GPU. Le clavardage et la rédaction, un agent de codage, et la recherche documentaire sur vos propres fichiers pointent chacun vers un model différent et une quantité de mémoire différente.
  • La VRAM, c’est tout le jeu. Un model 7–8B tourne sur ~8GB; un model 30–32B veut ~24GB; un 70B veut ~48GB. La quantization, c’est ce qui rend ça abordable.
  • Une RTX 3090 d’occasion (24GB) reste le meilleur rapport dollars-par-VRAM que vous puissiez acheter, et l’Apple Silicon avec beaucoup de mémoire unifiée est une option réelle et silencieuse.
  • Traitez le model local comme une sauvegarde qu’on ne peut pas révoquer. Gardez-le installé même si vous vivez dans le cloud au quotidien — pour que la prochaine directive ne puisse pas anéantir votre semaine.

1. Choisissez d’abord votre niveau de besoin

La plupart des gens choisissent un model selon le battage médiatique, puis se demandent pourquoi leur portable fond ou pourquoi les réponses sont molles. Faites l’inverse. Décidez à quoi la machine est destinée, et le model et le matériel découlent presque automatiquement de cette décision. Il y a trois niveaux honnêtes :

  • Clavardage et rédaction. Brouillons, révision, résumés, remue-méninges, réécriture de ce courriel maladroit. C’est le niveau le plus accessible — les petits models y excellent vraiment, et vous pouvez le faire tourner sur du matériel que vous possédez peut-être déjà.
  • Un agent de codage. Complétion de code, refactorisations, un assistant qui lit votre dépôt et propose des changements. Ça demande plus de capacité et plus de mémoire, et c’est le niveau que la bascule du 12 juin a le plus frappé.
  • Documents et retrieval (RAG). Poser des questions sur vos propres contrats, manuels, notes ou base de code. Le model compte moins ici que la plomberie autour — comment vous découpez, indexez et injectez vos fichiers.

Soyez impitoyable. Si 90 % de votre usage est le premier niveau, n’achetez pas une machine de classe 70B pour vous sentir souverain. Adaptez l’outil au travail et vous dépenserez moins, tournerez plus vite, et garderez vraiment l’habitude.

2. La réalité matérielle, sans fantaisie

Voici la partie que personne ne met en avant parce qu’elle vend moins de rêves : les LLM locaux sont limités par la mémoire. Les weights du model doivent tenir dans la mémoire rapide — VRAM sur un GPU, ou mémoire unifiée sur un Mac — sinon ça rampe. La bonne nouvelle, c’est que la quantization (compresser ces weights, typiquement en 4 bits / « Q4 ») réduit le besoin de façon spectaculaire pour un coût de qualité seulement modeste. Le Q4, c’est ce qui transforme « a besoin d’un serveur » en « tourne dans votre sous-sol ».

Taille du model Mémoire approx. (Q4) Exemple de matériel À quoi ça sert
7–8B ~8 GB Un GPU modeste, un Mac avec 16GB, ou un mini-PC AMD Strix Halo / Ryzen AI Max Clavardage, rédaction, résumés, aide légère au codage
13–14B ~12 GB Un GPU milieu de gamme, ou Apple Silicon avec de la marge Meilleur raisonnement, brouillons et révisions plus fiables
30–32B ~24 GB Une RTX 5090, ou une RTX 3090 24GB d’occasion (toujours le meilleur $/VRAM sur le marché) Travail général sérieux et un assistant de codage capable
70B ~48 GB Deux RTX 3090, une RTX PRO 6000, ou Apple Silicon avec 128GB de mémoire unifiée Le plus près qu’une machine maison puisse s’approcher d’une « sensation de frontière »
Grand MoE (p. ex. gpt-oss-120b) ~80 GB Un seul GPU d’environ 80GB Capacité de gros model là où vous pouvez le faire tenir

Quelques notes honnêtes sur l’achat. Vous n’avez pas besoin de silicium neuf. Une RTX 3090 d’occasion ou reconditionnée avec 24GB reste le choix pragmatique du commun des mortels — elle frappe bien au-dessus de son prix pour l’inference locale, et les 24GB comptent plus que la vitesse brute. L’Apple Silicon est l’option outsider : la mémoire unifiée permet à un Mac Studio de tenir des models qui exigeraient plusieurs GPU grand public, il consomme peu, et il est silencieux. Et les nouveaux mini-PC AMD Strix Halo / Ryzen AI Max rendent le niveau d’entrée réellement accessible. Peu importe votre choix, la machine n’est que la moitié de l’histoire — l’alimentation et la chaleur sont la partie que les tutoriels ne mentionnent pas, et elles vous mordront sur tout ce qui dépasse une boîte de hobby. Pour l’argument plus large « pourquoi votre sous-sol bat une stratégie nationale de GPU », nous avons détaillé le dossier matériel en entier.

3. Faire tourner un model (la partie facile)

C’est les 20 % que tout le monde montre, alors allons-y vite et rendons crédit à ceux qui l’ont rendu possible. Les outils open-source ici sont excellents, et aucun n’est le nôtre.

  1. Installez Ollama. C’est la rampe d’accès la plus simple — installez-le, puis une seule commande tire un model et lance le clavardage. Si vous préférez une application graphique soignée plutôt qu’un terminal, LM Studio fait le même travail avec une interface graphique et un navigateur de models.
  2. Tirez un model qui correspond à votre niveau. Commencez petit. Un model 7–8B prouve que tout le pipeline fonctionne avant de vous engager dans quelque chose de plus lourd.
  3. Parlez-lui. C’est tout — vous avez maintenant un model privé qui répond sur votre propre matériel.

Sous le capot, la plupart de tout ça tourne sur llama.cpp, le moteur qui a rendu l’inference CPU/GPU efficace et la quantization pratique pour le reste d’entre nous. Quand vous dépassez le clavardage mono-utilisateur et devez servir une équipe ou une application, vLLM est le palier supérieur pour le serving à haut débit. Crédit où crédit est dû : Ollama, LM Studio, llama.cpp et vLLM sont la raison pour laquelle tout ça prend un après-midi plutôt qu’une subvention de recherche.

Pour les models eux-mêmes, ces familles open-weight sont de solides points de départ — choisissez selon le travail, pas selon le classement :

  • Qwen3 — un excellent choix polyvalent qui code aussi bien; un défaut sensé pour la plupart des gens.
  • Mistral 3 — efficace et capable, un excellent ajustement pour les niveaux intermédiaires.
  • Gemma 4 — solide pour le clavardage et la rédaction sur du matériel plus petit.
  • DeepSeek — forte lignée en raisonnement et en codage.
  • gpt-oss — models open-weight incluant la grande variante MoE si vous avez la mémoire pour.

Pour être clair sur ce que c’est : capable, gratuit, à vous. Aucun d’eux ne va surpasser un model de frontière actuel, et nous ne prétendrons pas le contraire. Ce n’est pas le point. Le point, c’est qu’ils vous rendent des comptes à vous.

4. Les 80 % difficiles (là où la plupart des guides s’arrêtent)

Voici la partie honnête. La raison pour laquelle les gens téléchargent un model local, le testent dix minutes, puis reviennent au cloud n’est pas que le model est mauvais. C’est que le model arrive nu — sans context, sans instructions, sans accès à vos fichiers — et ils comparent ça à un produit cloud qui a des années de finition autour. Le model, c’est 20 %. Voici les 80 % :

  • Gestion du context. Les models locaux ont une fenêtre de context finie, et en bourrer trop les ralentit jusqu’à l’arrêt ou leur fait oublier le début. Apprenez quelle est la fenêtre de votre model et nourrissez-la délibérément.
  • Un system prompt sensé. Un bon system prompt est la mise à niveau la moins chère que vous ferez jamais. Dites au model qui il est, comment formater, quoi refuser, et sur quoi vous travaillez. Les mêmes weights passent de « bof » à « vraiment utile » rien que sur la force de ça.
  • Utilisation d’outils. Un model qui peut appeler des outils — exécuter du code, chercher, frapper une API — vaut bien plus qu’un qui se contente de parler. C’est là que les configurations locales commencent à ressembler à un vrai assistant plutôt qu’à un chatbot.
  • Retrieval sur vos propres fichiers (RAG). C’est la fonctionnalité tueuse pour la souveraineté. Indexez vos documents localement et laissez le model répondre à partir d’eux, sans que rien ne quitte votre machine. C’est aussi la pièce la plus pointilleuse — le découpage, les embeddings et la qualité du retrieval font ou défont le résultat.
  • Le garder rapide. Le niveau de quantization, la longueur de context, les réglages de batch, et le fait que le model tienne entièrement en VRAM décident tous de votre vitesse. Les vitesses varient énormément selon la configuration, alors traitez tout chiffre de tokens par seconde que vous lisez — y compris un approximatif « se sent instantané sur une 3090 pour un model 8B » — comme illustratif, pas comme une promesse.
  • Le garder privé. Toute la raison pour laquelle vous êtes ici. Confirmez que rien ne rappelle à la maison, faites-le tourner sur une machine que vous contrôlez, et décidez délibérément quand (si jamais) vous tendez la main vers le cloud.

Les traitements plus approfondis vivent dans les pièces compagnons — la réalité alimentation-et-chaleur de faire tourner ça 24 h/24 et le stack local d’IA auto-souveraine complet. Lisez-les avant de conclure que votre premier après-midi a été un échec. Ce n’était pas le cas; vous n’aviez simplement pas encore fait les 80 %.

5. Remplacer un agent de codage en particulier

La bascule du 12 juin a frappé les flux de travail de codage le plus fort, parce que c’est là que les gens avaient branché un model de frontière précis profondément dans leur éditeur et leurs habitudes. La bonne nouvelle : vous pouvez faire tourner un agent de codage hors ligne.

Le schéma est simple — pointez votre éditeur ou agent vers un model local au lieu d’un point de terminaison cloud. Beaucoup d’outils de codage acceptent une API locale compatible OpenAI, que Ollama et vLLM exposent tous les deux, alors vous changez le point de terminaison et gardez votre flux de travail. Un model 30–32B sur une carte 24GB est le point idéal ici : assez capable pour de vraies refactorisations et du raisonnement, assez petit pour tourner à la maison.

Que cédez-vous par rapport à un model de frontière? Soyez lucide : moins de raisonnement brut sur des problèmes multi-fichiers tordus, une fenêtre de context plus petite, et vous ferez plus du pilotage vous-même. Ce que vous gagnez : un assistant de codage qui fonctionne dans un avion, dans un labo air-gapped, ou pendant le prochain coup de fouet réglementaire — et qui n’envoie jamais votre code propriétaire à personne. Le guide complet, y compris la configuration air-gapped, est ici : faire tourner des agents de codage hors ligne avec des models locaux.

6. Continuité : la sauvegarde qu’on ne peut pas révoquer

Même si vous aimez votre model cloud et l’utilisez tous les jours, installez quand même le local. Pensez-y comme vous pensez à un générateur ou à un portefeuille matériel : ce n’est pas votre véhicule du quotidien, c’est ce qui signifie qu’une seule décision ailleurs ne peut pas anéantir votre semaine.

C’est de la reprise après sinistre, pure et simple. Le 12 juin a été un exercice d’incendie devenu réel. Les gens qui l’ont balayé d’un haussement d’épaules étaient ceux qui avaient déjà un model sur une machine dans la pièce d’à côté. Tirez un model maintenant, écrivez votre system prompt maintenant, indexez vos fichiers maintenant — pendant que c’est calme — pour que la prochaine fois qu’une directive atterrit, votre bascule soit « passer au local » plutôt que « perdre une semaine à comprendre ça sous pression ». C’est tout l’instinct bitcoiner appliqué au compute : ne faites pas confiance à un service que vous ne pouvez pas faire tourner vous-même.

7. Limites honnêtes, reformulées

Nous n’allons pas surévaluer ça. Il y a du vrai travail où vous tendrez encore la main vers une API de frontière : le raisonnement le plus dur, les contexts les plus longs, le multimodal de pointe, les moments où vous avez besoin de la meilleure réponse absolue et où les données ne sont pas sensibles. C’est correct — utilisez le bon outil.

Faites-le simplement les yeux ouverts. Le moment où vous envoyez un prompt à une API cloud, vos données quittent votre machine et vivent selon les conditions de quelqu’un d’autre, la juridiction de quelqu’un d’autre, et les changements de politique de quelqu’un d’autre. La discipline, c’est de choisir ça consciemment pour les cas qui le justifient, plutôt que d’y recourir par défaut pour tout — y compris les 70 % du travail qu’un model local aurait traités en privé et gratuitement. La souveraineté, ce n’est pas ne jamais toucher le cloud; c’est ne jamais en être prisonnier.

8. Où aller ensuite — et quand demander de l’aide

Si vous êtes du genre à construire vous-même, vous avez tout ce qu’il faut : choisissez votre niveau, achetez la VRAM, installez Ollama, tirez un model, et commencez à travailler les 80 %. Commencez par le hub IA pour le reste des playbooks, et lisez pourquoi ça compte pour les Canadiens en particulier si vous voulez le tableau plus large derrière le 12 juin.

Il y a une ligne, cependant, où ça cesse d’être un projet de fin de semaine. Quand l’IA locale devient critique pour l’entreprise — une disponibilité qui compte, des données réglementées ou sensibles, une équipe qui en dépend, la conformité en jeu — c’est là que « assez bon, ça marche à peu près » cesse d’être assez bon. Si vous préférez ne pas sourcer les pièces, combattre les pilotes et peaufiner le stack vous-même, nous le concevrons et le construirons sur mesure pour vous, ou vous pouvez acheter l’une de nos boîtes Sovereign AI et la recevoir déjà en marche. Même philosophie, moins d’après-midi.

Quelle est la façon la plus simple de faire tourner un LLM local?

Installez Ollama, puis tirez un model avec une seule commande — vous clavarderez en quelques minutes. Si vous préférez une application graphique avec un navigateur de models intégré, LM Studio fait la même chose avec une interface graphique. Les deux reposent sur llama.cpp, le moteur open-source qui rend l’inference locale efficace possible. Commencez avec un petit model 7–8B pour confirmer que tout fonctionne avant d’aller plus gros.

De combien de VRAM ai-je vraiment besoin?

Ça évolue avec la taille du model en quantization Q4 : environ 8GB pour un model 7–8B, ~12GB pour 13–14B, ~24GB pour 30–32B, et ~48GB pour un 70B. Une RTX 3090 d’occasion (24GB) est le meilleur achat dollars-par-VRAM pour la plupart des gens, et l’Apple Silicon avec une grande mémoire unifiée peut tenir des models qui exigeraient autrement plusieurs GPU. Adaptez la mémoire à votre niveau de travail plutôt que d’acheter la plus grosse carte possible.

Un model local est-il assez bon pour remplacer ChatGPT ou Claude?

Pour beaucoup de vrai travail — rédaction, révision, résumés, Q&R documentaire, et un assistant de codage capable — oui. Pour le raisonnement le plus dur, les contexts les plus longs, et la qualité absolue de haut de gamme, un model de frontière gagne encore, et nous ne prétendrons pas le contraire. Le cadrage honnête : un model local n’est pas plus intelligent, il est à vous — on ne peut pas le révoquer, et pour le gros des tâches du quotidien, ce compromis en vaut la peine.

Puis-je le faire tourner entièrement hors ligne / air-gapped?

Oui. Une fois les weights du model téléchargés, rien n’a besoin d’Internet — vous pouvez tirer la prise et continuer à travailler. C’est tout le point : un model sur une machine que vous contrôlez physiquement, avec vos fichiers indexés localement via retrieval pour que les données sensibles ne quittent jamais la machine. C’est aussi exactement comment vous faites tourner un agent de codage dans un environnement air-gapped.


Vous pouvez le faire aujourd’hui. Installez Ollama, tirez un model 7–8B, et écrivez-vous un vrai system prompt cet après-midi — puis travaillez les 80 % à votre rythme. Et si ça devient critique pour l’entreprise, ou si vous préférez simplement sauter la construction, parlez-nous d’une configuration d’IA souveraine construite sur mesure ou parcourez les boîtes Sovereign AI et faites-en livrer une déjà en marche. Dans les deux cas, le but est le même : un model capable sur du matériel que vous pouvez débrancher — une couche de plus décentralisée.

Mining Profitability Calculator Calculate your mining revenue, electricity costs, and net profit with live Bitcoin data.
Try the Calculator

D-Central

Experts en minage Bitcoin depuis 2016

Réparation ASIC Pionnier Bitaxe Minage open source Chaufferettes Home Mining

D-Central Technologies est une entreprise canadienne de minage Bitcoin qui rend la technologie minière de niveau institutionnel accessible aux mineurs à domicile. Des milliers de mineurs réparés, 490+ produits expédiés du Canada.

À propos de D-Central →

Articles connexes

Auto-hébergement IA

Le guide du pleb pour l’IA auto-hébergée

L’IA auto-hébergée n’est pas aussi simple qu’ouvrir ChatGPT — mais pour les plebs qui font déjà tourner des nœuds et des mineurs, la courbe d’apprentissage fait la moitié de ce qu’elle a l’air. Voici la vue d’ensemble avant d’installer quoi que ce soit.

Auto-hébergement IA

LM Studio vs Ollama vs llama.cpp : quel runner pour les plebs ?

Trois excellents runners open source. Trois types de plebs différents. llama.cpp est la fondation bâtie par Gerganov. Ollama l enveloppe pour la simplicité d un démon. LM Studio l enveloppe dans une interface graphique soignée. Voici le guide de décision en 15 minutes.

Minez plus intelligemment

Que vous chauffiez votre maison avec des sats, assembliez un Bitaxe ou passiez à l'échelle supérieure — D-Central a le matériel, les réparations et l'expertise qu'il vous faut.

Parcourir les produits Parler à un expert en minage