Passer au contenu

Bitcoin accepté au paiement  |  Expédié depuis Montréal, QC, Canada  |  Soutien expert depuis 2016

DeepSeek, Qwen, Mistral, Gemma ou Llama : quel modèle open-weight un pleb devrait-il auto-héberger ?
IA

DeepSeek, Qwen, Mistral, Gemma ou Llama : quel modèle open-weight un pleb devrait-il auto-héberger ?

· D-Central · ⏱ 11 min de lecture

Vous savez déjà comment lancer un model. La partie difficile en 2026, c’est de choisir lequel. La scène open-weight est passée de curiosité à véritable arsenal : DeepSeek, Qwen, Mistral, Gemma et Llama livrent tous des weights que vous pouvez télécharger, inspecter et exécuter sur votre propre silicium — sans compte, sans télémétrie et sans kill switch. Pour un Bitcoiner, c’est tout l’enjeu. On ne custody pas ses propres clés pour ensuite louer son raisonnement à une corporation qui journalise chaque prompt. Posséder ses weights, c’est une couche de plus de décentralisation — vos données, votre calcul, vos algorithmes, de bout en bout.

Voici la couche de décision au-dessus du runner. Si vous n’avez pas encore choisi vos outils, commencez par installer Ollama et lancer votre premier LLM local en 10 minutes ou comparez les moteurs dans LM Studio vs Ollama vs llama.cpp. Ce guide répond à la question suivante : selon votre VRAM et ce que vous voulez vraiment faire, quelle famille de open weights mérite le téléchargement ? On classe par ouverture, classe de taille et adéquation à la tâche — pas par les chiffres de benchmark du cycle de hype, qui vieillissent mal et survivent rarement au contact de votre propre matériel.

Ce que « open weight » signifie vraiment (et pourquoi ça compte pour un pleb)

« Open weight » n’est pas la même chose qu’« open source ». La plupart de ces models publient les paramètres entraînés — les weights — sous une licence qui vous permet de les télécharger et de les exécuter en local. Beaucoup moins publient l’ensemble des données de training, le code d’entraînement et le pipeline qui permettraient de les reproduire à partir de zéro. Pour l’auto-hébergement, ce sont les weights dont vous avez besoin : une fois sur votre disque, le model tourne hors ligne, pour toujours, peu importe ce que fait ensuite le fournisseur.

Mais la licence compte tout de même. Certains weights sortent sous des licences permissives standards (Apache 2.0, MIT) qui imposent presque aucune condition. D’autres arrivent sous des licences communautaires sur mesure avec des restrictions d’usage, des politiques d’usage acceptable, ou des clauses qui s’activent au-delà d’un certain nombre d’utilisateurs. Rien de tout cela n’affecte un pleb qui fait tourner un model sur une machine à la maison, mais ça façonne à quel point le model est vraiment « à vous ». Si la souveraineté est l’objectif, un model que vous pouvez exécuter, pour lequel vous pouvez forker l’outillage environnant, et qui ne rapatrie jamais de données vers l’extérieur, c’est le plancher — et les cinq familles ci-dessous le franchissent toutes.

Une mise en garde honnête d’emblée : nous ne citons volontairement pas les scores des classements. Les rangs des benchmark bougent chaque mois, les fournisseurs optimisent pour les tests, et le seul benchmark qui compte, c’est si le model est bon à votre tâche sur votre machine. Classez d’abord par licence, classe de taille et adéquation à la tâche. Ensuite, téléchargez deux finalistes et essayez-les sur vos vrais prompts.

Les cinq familles, en termes simples

Chacune de celles-ci est une famille, pas un seul model — elles se livrent en plusieurs tailles de paramètres pour que vous puissiez assortir le model à votre matériel. Voici comment penser chacune d’elles.

  • Llama (Meta) — Le point de départ par défaut pour la plupart des plebs. L’écosystème le plus mature : presque chaque runner, fine-tune et tutoriel suppose l’existence de weights de la famille Llama. Publié sous une licence communautaire plutôt que pleinement permissive, mais trivialement exécutable à la maison. Si vous voulez le chemin de moindre résistance et la plus grosse pile de fine-tunes communautaires, commencez ici.
  • Qwen (Alibaba) — Solide polyvalent avec une gamme de tailles inhabituellement large, des models minuscules qui tiennent sur un téléphone jusqu’aux grands qui exigent de la VRAM sérieuse. Couverture multilingue particulièrement bonne et variantes de coding solides. Plusieurs tailles sortent sous Apache 2.0, ce qu’il y a de plus permissif. Un favori fréquent quand on veut une seule famille qui s’échelonne sur tous ses appareils.
  • DeepSeek — S’est fait un nom avec des sorties axées raisonnement et coding. Les plus grands models DeepSeek sont bien trop gros pour un GPU maison, mais la famille livre aussi des variantes distillées plus petites qui amènent une part de ce goût du raisonnement jusqu’au matériel grand public. Tournez-vous vers DeepSeek quand vous voulez spécifiquement du raisonnement étape par étape ou du code, et choisissez une taille qui tient vraiment dans votre boîte.
  • Mistral — L’option européenne lean. Mistral s’est bâti une réputation sur des models petits, rapides et capables qui frappent au-dessus de leur nombre de paramètres — y compris des sorties sous Apache 2.0. Excellent quand la VRAM est serrée et que vous voulez des tokens rapides sans l’impression d’avoir estropié le model. Un choix naturel pour une carte 8GB ou un nœud qui fait aussi d’autres jobs.
  • Gemma (Google) — La ligne open-weight de Google, conçue pour bien tourner sur du matériel modeste et offerte en tailles véritablement petites aux côtés des plus grandes. Bonne qualité polyvalente avec un accent sur la sécurité et l’efficacité. Un défaut sensé pour une boîte always-on basse consommation qui doit être polie et fiable plutôt que maximalement capable.

Assortissez le model à votre VRAM, pas à votre ego

Le facteur le plus déterminant pour ce qui tourne bien, c’est le poids du model une fois chargé — et ça dépend de son nombre de paramètres et de sa quantization. La quantization compacte les weights pour qu’ils tiennent en moins de mémoire ; le compromis, c’est une petite perte de qualité. Si ces termes sont nouveaux, lisez notre guide pleb sur GGUF, Q4, Q8 et fp16 — c’est le compagnon de ce billet et il explique exactement comment un quant 4 bits laisse un plus gros model se faufiler sur une plus petite carte.

Le model mental approximatif : un model quantisé a besoin d’environ autant de gigaoctets de VRAM que son nombre de paramètres en milliards à 4 bits, plus une marge pour le context. Donc un model 7-8B en Q4 vit confortablement sur 8GB ; un 13-14B veut plus d’air ; et 30B et plus, c’est le territoire workstation ou multi-GPU. Traitez le tableau ci-dessous comme une carte de départ, puis confirmez sur votre propre matériel — le déchargement en RAM système, la longueur de context et votre runner déplacent tous les poteaux.

Votre matériel Classe de taille pratique Familles sensées à essayer en premier Idéal pour
8GB VRAM (ex. carte milieu de gamme plus ancienne) ~3B-8B en Q4 Mistral, Gemma (petit), Qwen (petit), Llama (petit) Conversation, résumé, rédaction, codage léger
12-16GB VRAM ~8B-14B en Q4-Q5 Qwen, Llama, DeepSeek distill, Mistral Assistant général, codage décent, raisonnement
24GB VRAM (ex. RTX 3090 d’occasion) ~14B-32B en Q4 Qwen, DeepSeek distill, Llama, Mistral Raisonnement/code plus forts, context long, agents
Multi-GPU / station de travail 32B-70B+ Llama (grand), Qwen (grand), DeepSeek (grand) Raisonnement lourd, qualité locale quasi-frontière
CPU seulement / SBC ~1B-3B en Q4 Gemma (minuscule), Qwen (minuscule), Llama (minuscule) Aides toujours actives, lecture de journaux, tâches légères

La carte 24GB d’occasion reste le point idéal pour de l’inference maison sérieuse — voyez pourquoi dans la RTX 3090 d’occasion pour les LLM en 2026. Elle ouvre la bande 14B-32B où les models locaux commencent à se sentir vraiment utiles plutôt que simplement impressionnants.

Choisissez selon ce que vous faites vraiment

Le matériel fixe le plafond ; votre tâche choisit la famille à l’intérieur. Quelques règles de pouce honnêtes :

  • Vous voulez un assistant quotidien général. Commencez par Llama ou Qwen à la plus grande taille que votre carte gère. L’écosystème mature signifie plus de fine-tunes et moins d’aspérités.
  • Vous codez ou voulez du raisonnement étape par étape. Essayez une variante DeepSeek raisonnement/coding ou un Qwen coder dans votre classe de taille. Les models réglés pour le raisonnement pensent à voix haute, ce qui coûte des tokens mais paie sur le travail à forte logique.
  • La VRAM est serrée et les tokens par seconde comptent. Mistral et les petits Gemma sont les champions lean — rapides, capables, et ils laissent de la marge pour que le model partage une boîte qui fait aussi tourner votre nœud ou surveille vos rigs.
  • Vous avez besoin d’une aide always-on basse consommation. Un minuscule Gemma ou Qwen sur une petite boîte peut lire des logs de mineur, résumer des alertes, ou brancher une automatisation maison sans qu’un GPU gourmand tourne toute la journée.
  • Vous travaillez dans plusieurs langues. La couverture multilingue de Qwen est une raison fréquente pour laquelle les plebs hors de l’anglosphère s’y tournent en premier.

Peu importe votre choix, la partie « le faire tourner en local » est une discipline à part. Ollama, c’est la partie facile — posséder la puissance et la chaleur en dessous, c’est la partie souveraine, et c’est là que l’état d’esprit du minage Bitcoin se transfère directement. Vous savez déjà penser en watts, en refroidissement et en uptime.

Pourquoi c’est aussi le combat d’une compagnie de minage Bitcoin

C’est une question juste de savoir pourquoi une boutique d’ASIC montréalais a des opinions sur les language models. La réponse, c’est que les deux mondes tournent sur le même principe : ne confiez pas à un dépositaire de faire pour vous ce que vous pouvez faire vous-même. Nous construisons du firmwareDCENT_OS, un firmware open-source visant le matériel Antminer industriel, bâti en Rust et sur les épaules de Braiins OS+, VNish et LuxOS — précisément pour que les mineurs possèdent le code qui fait tourner leurs machines au lieu de le relouer avec des frais de dev obligatoires. Auto-héberger un model open-weight, c’est le même geste dans un autre domaine : posséder les weights, posséder l’inference, posséder la trace de données. Une couche de plus de décentralisation.

Si vous construisez le tableau complet — sats, hashpower, et maintenant le calcul sous un même toit — notre hub AI souverain et la section plus large souveraineté cartographient le reste de la pile. Et si vous voulez un premier projet concret, brancher un model local sur votre nœud en est un excellent : lancez un agent sur votre nœud Bitcoin au lieu de louer un VPS.

Un flux de sélection simple

Ne sur-réfléchissez pas. Voici tout le processus :

  1. Connaissez votre VRAM. Ça fixe votre classe de taille d’après le tableau ci-dessus.
  2. Nommez votre tâche principale. Chat quotidien, coding, raisonnement, multilingue, ou aide always-on.
  3. Présélectionnez deux familles. Un défaut sûr (Llama ou Qwen) et un spécialiste (DeepSeek pour raisonnement/code, Mistral pour la vitesse lean, Gemma pour la basse consommation).
  4. Téléchargez les deux au bon quant. Q4 est le défaut maison habituel ; montez si vous avez de la marge, descendez seulement si vous devez.
  5. Testez sur vos vrais prompts. Pas les benchmarks — votre vrai travail. Gardez celui qui est meilleur pour vous et supprimez l’autre.

C’est tout. La beauté des open weights, c’est que changer ne coûte que de l’espace disque et un téléchargement. Vous n’êtes jamais verrouillé.

Foire aux questions

Quel est le meilleur LLM local pour 8GB de VRAM?

Restez dans la classe ~3B-8B en quantization 4 bits. Un petit Mistral, un petit Gemma, ou un petit Qwen ou Llama tournent tous confortablement et gèrent bien le chat, le résumé et le coding léger. Téléchargez-en deux et gardez celui qui est meilleur sur vos tâches réelles — aucun ne se battra avec votre carte.

Open weight, est-ce la même chose qu’open source?

Non. Open weight signifie que les paramètres entraînés sont publiés pour que vous puissiez télécharger et exécuter le model en local. Open source signifierait en plus que les données d’entraînement, le code et le pipeline sont assez publics pour le reproduire à partir de zéro — ce qui est plus rare. Pour l’auto-hébergement, vous vous souciez surtout des weights et des termes de licence ; les cinq familles ici sont exécutables à la maison hors ligne.

DeepSeek vs Qwen vs Llama — lequel choisir?

Pour un assistant quotidien général, Llama ou Qwen sont les défauts sûrs grâce à des écosystèmes matures. Pour le raisonnement ou le coding, une variante DeepSeek (dans une taille qui tient dans votre matériel) vaut l’essai. Qwen se démarque aussi pour le travail multilingue et sa large gamme de tailles. Choisissez selon la tâche et la VRAM, puis testez les deux sur vos propres prompts.

Ai-je vraiment besoin d’un GPU?

Pas nécessairement. Les minuscules models 1B-3B des familles Gemma, Qwen ou Llama tournent sur CPU ou une petite carte assez bien pour des aides always-on — lecture de logs, résumé, automatisation simple. Vous échangez vitesse et capacité contre basse consommation et absence de GPU, ce qui est souvent exactement le bon compromis pour un assistant en arrière-plan.

L’essentiel

Il n’y a pas de « meilleur LLM local » unique en 2026 — il y a le meilleur pour votre VRAM et votre tâche, et ça change quand de nouveaux weights tombent. La compétence durable, c’est le processus de sélection : assortir la taille au matériel, la famille à la tâche, télécharger deux finalistes, et les juger sur votre propre travail plutôt que sur le classement de quelqu’un d’autre. Chaque model ici est à vous dès qu’il est sur votre disque.

Cet ethos — posséder la chose qui fait tourner votre pile — est exactement ce que nous construisons en firmware. Si vous faites tourner du matériel Antminer et voulez un firmware open-source avec une cible de frais de dev obligatoires à 0 %, rejoignez la liste d’attente de la beta publique DCENT_OS. Même combat, couche différente : vos clés, vos weights, votre code.

Outil de comparaison de mineurs Compare any two miners head-to-head — specs, profitability, and home mining suitability.
Try the Calculator

D-Central

Bitcoin Mining Experts Since 2016

Réparation ASIC Bitaxe Pioneer Open-Source Mining Chaufferettes Home Mining

D-Central Technologies est une entreprise canadienne de minage Bitcoin qui rend la technologie minière de niveau institutionnel accessible aux mineurs à domicile. Des milliers de mineurs réparés, 350+ produits expédiés du Canada.

About D-Central →

Articles connexes

IA

RTX 3090 usagée pour LLM en 2026 : toujours reine ?

24 Go de VRAM à 600–800 $ d occasion. Pour les LLM sous 70B paramètres en quantifications Q4–Q5, la RTX 3090 reste le standard pleb en 2026. Voici le face-à-face contre 4090, 5090, P40 et A5000, plus la liste d achat.

Auto-hébergement IA

LM Studio vs Ollama vs llama.cpp : quel runner pour les plebs ?

Trois excellents runners open source. Trois types de plebs différents. llama.cpp est la fondation bâtie par Gerganov. Ollama l enveloppe pour la simplicité d un démon. LM Studio l enveloppe dans une interface graphique soignée. Voici le guide de décision en 15 minutes.

Start Mining Smarter

Whether you are heating your home with sats, building a Bitaxe, or scaling up — D-Central has the hardware, repairs, and expertise you need.

Browse Products Talk to a Mining Expert