Jeu de données ouvert · CC BY 4.0 · Données ouvertes D-Central
Base de données des modèles LLM locaux
Un index lisible par machine de 33 grands modèles de langage à poids ouverts que vous pouvez exécuter localement — sans faire transiter vos données par des fournisseurs infonuagiques américains. Chaque fiche couvre le nombre de paramètres, la fenêtre de contexte, la licence, la VRAM approximative en Q4 / Q8 / FP16 et l’étiquette de téléchargement Ollama. Conçu pour les ingénieurs, les chercheurs et les opérateurs canadiens soucieux de souveraineté qui doivent évaluer les modèles en fonction de leur matériel avant de télécharger 40 GB.
Pourquoi exécuter un grand modèle de langage localement ?
Lorsque vous interrogez une API d’IA hébergée, vos requêtes, vos documents et vos réponses transitent vers des serveurs détenus par des entreprises technologiques américaines, où ils sont traités. Ces serveurs relèvent du CLOUD Act, qui permet aux autorités américaines d’exiger la divulgation des données stockées, peu importe où se trouve le serveur — y compris des données canadiennes hébergées sur une infrastructure appartenant à des sociétés américaines. Pour les organisations qui traitent des données clients sensibles, de la propriété intellectuelle ou des renseignements réglementés, il s’agit d’un risque important.
Les modèles à poids ouverts auto-hébergés éliminent entièrement cette exposition : vos requêtes et vos réponses ne quittent jamais votre propre matériel. Les modèles de cette base de données sont tous à poids ouverts et auto-hébergeables. Chaque ligne porte cloud_act_free_if_selfhosted = true.
Ce jeu de données accompagne le guide LLM local au Canada de D-Central ainsi que le service Consultation en souveraineté de l’IA. Il constitue une strate d’une initiative de données ouvertes plus vaste — la même philosophie qui anime l’infrastructure ouverte de minage de Bitcoin anime l’infrastructure ouverte d’IA : la décentralisation n’est pas une fonctionnalité, c’est l’architecture.
Crédit : Ces modèles existent grâce aux chercheurs et aux organisations qui ouvrent leurs travaux. D-Central les indexe ; nous ne les créons pas. Nous avançons sur les épaules de Meta AI, de l’équipe Alibaba / Qwen, de Google DeepMind, de Mistral AI, de Microsoft, de DeepSeek AI, d’Allen AI, de Cohere et de HuggingFace — qui ont tous publié des poids ouverts rendant l’IA auto-hébergée possible.
Comment lire ce tableau
- Paramètres (B) : Nombre total de paramètres, en milliards. Pour les modèles MoE, la colonne des paramètres actifs indique combien sont utilisés à chaque passe avant (ce qui détermine la vitesse d’inférence).
- Contexte (K) : Fenêtre de contexte native, en milliers de jetons. Certains modèles peuvent l’étendre au moyen de la mise à l’échelle RoPE ou de YaRN — la spécification native est indiquée ; consultez la fiche du modèle pour les options de contexte étendu.
- VRAM Q4 / Q8 / FP16 : Mémoire GPU approximative en GB à chaque niveau de quantification. Le Q4 (4 bits) permet d’exécuter de plus gros modèles sur des GPU grand public ; le Q8 est quasi sans perte ; le FP16 est en pleine précision. Les chiffres sont recoupés avec les tailles indiquées par la bibliothèque Ollama lorsqu’elles sont disponibles, puis calculés selon la formule standard (paramètres × bits / 8 × ~1.15 de surcharge). L’utilisation réelle augmente avec la longueur du contexte — il s’agit d’estimations de charge de base à contexte au repos.
- Commercial : Indique si la licence permet explicitement un usage commercial sans entente distincte. Les entrées marquées ✗ (CC-BY-NC) exigent une licence commerciale distincte auprès du développeur.
- Étiquette Ollama : Exécutez
ollama pull <tag>pour télécharger. Ollama applique la quantification Q4_K_M par défaut, à moins que vous ne précisiez un suffixe d’étiquette. - Libre du CLOUD Act : Toujours ✓ pour les déploiements auto-hébergés — vos données restent sur votre matériel.
Le paysage des LLM à poids ouverts évolue rapidement. De nouveaux modèles, de nouvelles versions et des mises à jour de licence apparaissent fréquemment. Considérez ceci comme un point de départ et vérifiez la fiche canonique du modèle avant tout déploiement en production.
Index des modèles LLM à poids ouverts
| Modèle | Famille | Paramètres (B) | Actifs (B) | Contexte (K) | Licence | Commercial | VRAM Q4 (GB) | VRAM Q8 (GB) | VRAM FP16 (GB) | Étiquette Ollama | Modalité | Libre du CLOUD Act |
|---|
Les chiffres de VRAM sont des estimations approximatives — poids de base du modèle uniquement, sans cache KV actif. Vérifiés par rapport aux tailles de fichiers de la bibliothèque Ollama lorsque indiqué. Triez selon n’importe quel en-tête de colonne.
Aide-mémoire VRAM — quel GPU peut exécuter quoi
| GPU / Matériel | VRAM | Plafond pratique en Q4 | Exemples de modèles qui tiennent |
|---|---|---|---|
| RTX 3060 / 4060 | 8 GB – 12 GB | ~12 GB Q4 | Phi-3.5 mini (2.2 GB), SmolLM2 1.7B (1.8 GB), Mistral Nemo 12B (7.1 GB), Gemma 3 12B (7.5 GB) |
| RTX 3090 / 4090 | 24 GB | ~22 GB Q4 | Tous les précédents + Qwen2.5 32B (19 GB), Qwen3 30B-A3B (19 GB), Gemma 4 31B (20 GB) |
| RTX 6000 Ada / A6000 Ada | 48 GB | ~45 GB Q4 | Tous les modèles 32B + Llama 3.1/3.3 70B (43 GB), DeepSeek-R1-Distill-Llama-70B (43 GB) |
| 2× RTX 3090 / 4090 (répartition tensorielle) | 48 GB combinés | ~45 GB Q4 | Comme la A6000 Ada ; llama.cpp et Ollama prennent en charge la répartition tensorielle multi-GPU |
| H100 80 GB / A100 80 GB | 80 GB | ~75 GB Q4 | Tous les modèles 70B en Q8 ; Qwen2.5 72B (44 GB Q4, 75 GB Q8) |
| Apple M3 Ultra (192 GB unifiés) | 192 GB | ~180 GB Q4 | Command R+ 104B (59 GB Q4), Llama 3.1 405B (245 GB Q4 — nécessite un Mac de 256 GB+ ou plusieurs H100) |
Les chiffres de VRAM sont approximatifs. La longueur du contexte et la taille des lots ajoutent une surcharge de cache KV au-delà de la taille des poids de base du modèle. Ollama tente automatiquement une répartition tensorielle multi-GPU au besoin. Pour la planification d’une infrastructure d’IA souveraine, consultez Consultation en souveraineté de l’IA.
Résumé des licences des modèles à poids ouverts
Tous les modèles à poids ouverts ne sont pas ouverts à l’usage commercial. Ce tableau associe les types de licence présents dans ce jeu de données aux droits pratiques de déploiement. Ceci est fourni à titre informatif et ne constitue pas un avis juridique — lisez la licence complète et consultez un avocat pour les déploiements réglementés.
| Licence | Usage commercial | Attribution requise | Restriction MAU / seuil | Modèles dans ce jeu de données |
|---|---|---|---|---|
| Apache 2.0 | ✓ Entièrement permis | Avis de licence seulement | Aucune | Qwen2.5 (≤32B), Qwen3 (tous), Gemma 4, Mistral 7B / Nemo, Mixtral 8x7B, OLMo 2, SmolLM2 |
| MIT | ✓ Entièrement permis | Avis de licence seulement | Aucune | Phi-3.5 mini, Phi-4, DeepSeek-R1-Distill-Qwen-7B/14B/32B |
| Llama Community License (3.1 / 3.2 / 3.3) | ✓ Permis (conditions applicables) | « Built with Llama » dans le produit | >700M MAU nécessite l’autorisation de Meta | Llama 3.1, Llama 3.2, Llama 3.3, DeepSeek-R1-Distill-Llama-70B |
| Tongyi Qianwen License | ✓ Permis (conditions applicables) | « Built with Qwen » dans le produit | >100M MAU nécessite l’autorisation d’Alibaba | Qwen2.5 72B |
| Google Gemma Terms | ✓ Permis (conditions applicables) | Politique d’utilisation précisée | Usages interdits énumérés ; aucun plafond de MAU | Gemma 3 (4B, 12B, 27B) |
| CC-BY-NC-4.0 | ✗ Non commercial seulement | Attribution requise | Licence commerciale distincte auprès de Cohere | Command R 35B, Command R+ 104B |
Foire aux questions
Qu’est-ce qu’un grand modèle de langage à poids ouverts ?
Un LLM à poids ouverts (grand modèle de langage) est un modèle d’IA dont les poids entraînés (les paramètres numériques qui encodent ses connaissances) sont publiés et téléchargeables publiquement. Contrairement aux modèles fermés comme GPT-4 ou Claude — accessibles uniquement au moyen d’API détenues par leurs développeurs — les modèles à poids ouverts peuvent s’exécuter sur votre propre matériel sans aucun appel d’API, abonnement ou transmission de données vers un serveur tiers. « À poids ouverts » se distingue d’« à code source ouvert » : les poids sont libres de téléchargement, mais le code d’entraînement et les données d’entraînement peuvent être publiés ou non. OLMo 2 (Allen AI) est actuellement la famille la plus complètement ouverte, publiant les poids, les données d’entraînement, le code d’entraînement et les points de contrôle intermédiaires sous licence Apache 2.0.
Pourquoi le CLOUD Act est-il important pour l’IA au Canada ?
Le CLOUD (Clarifying Lawful Overseas Use of Data) Act américain de 2018 permet aux autorités américaines de contraindre les entreprises technologiques dont le siège social est aux États-Unis à remettre des données stockées sur des serveurs n’importe où dans le monde, y compris au Canada. Lorsque des organisations canadiennes utilisent des API d’IA hébergées par des entreprises américaines (OpenAI, Anthropic, Google, Microsoft Azure), leurs requêtes et les réponses générées peuvent être assujetties à cette obligation. Exécuter un modèle à poids ouverts sur votre propre matériel sous contrôle canadien signifie qu’aucune entreprise américaine n’a la garde de vos données, ce qui élimine cette exposition. Cela est particulièrement pertinent pour les cabinets d’avocats, les organisations de santé, les institutions financières et les organismes gouvernementaux qui traitent des renseignements sensibles. Remarque : ceci est fourni à titre informatif et ne constitue pas un avis juridique — consultez un avocat spécialisé en protection de la vie privée pour votre contexte réglementaire précis.
Que signifie la quantification Q4 / Q8 / FP16 ?
La quantification réduit la précision (largeur en bits) utilisée pour stocker chaque paramètre du modèle, en échangeant une faible perte de qualité contre des besoins en mémoire nettement réduits. Le FP16 (virgule flottante 16 bits) est en pleine précision — le plus exact, mais il exige le plus de VRAM (environ 2 GB par milliard de paramètres). Le Q8 (quantification entière 8 bits) réduit de moitié la mémoire, à environ 1 GB par milliard de paramètres, avec une perte de qualité minime. Le Q4_K_M (quantification 4 bits avec traitement en précision mixte) la réduit encore de moitié, à environ 0.5–0.6 GB par milliard de paramètres, avec une réduction de qualité faible mais mesurable sur les tâches exigeantes. Pour la plupart des tâches de conversation, de rédaction et de programmation, le Q4_K_M est en pratique indiscernable du FP16. Ollama applique le Q4_K_M par défaut lorsque vous exécutez ollama pull <model> sans étiquette de quantification.
Qu’est-ce qu’Ollama et comment l’utiliser ?
Ollama est un outil à code source ouvert (licence MIT) qui rend l’exécution de LLM à poids ouverts sur macOS, Linux et Windows aussi simple qu’une seule commande. Il gère le téléchargement des modèles, le choix de la quantification, le déchargement GPU/CPU et expose une API REST locale compatible avec le format de l’API OpenAI. Pour exécuter un modèle : installez Ollama à partir d’ollama.com, puis exécutez ollama run llama3.1:8b (par exemple) dans un terminal. La colonne Étiquette Ollama de ce jeu de données vous donne la chaîne exacte à transmettre à ollama pull ou ollama run. Ollama n’est pas la seule façon d’exécuter ces modèles — llama.cpp, LM Studio, vLLM et text-generation-webui sont des solutions de rechange populaires.
Par quel modèle devrais-je commencer pour un déploiement local ?
La réponse dépend de votre matériel et de votre cas d’usage. Pour un GPU de 6–8 GB : Phi-3.5 mini 3.8B (2.2 GB Q4, MIT, contexte 128K) ou Mistral Nemo 12B (7.1 GB Q4, Apache 2.0, contexte 128K) sont d’excellents points de départ. Pour un GPU de 24 GB : Qwen2.5 32B ou Qwen3 30B-A3B (MoE, vitesse d’inférence d’un modèle 3B). Pour un modèle de classe 70B sur plusieurs GPU ou une carte de 48 GB : Llama 3.3 70B ou DeepSeek-R1-Distill-Llama-70B pour les tâches à forte charge de raisonnement. Pour une liberté de licence commerciale maximale : les modèles Apache 2.0 (Qwen3, Gemma 4, OLMo 2, les modèles de Mistral AI) comportent le moins de restrictions. Pour une configuration entièrement auto-hébergée de minage de Bitcoin / souveraineté de l’IA, la Consultation en souveraineté de l’IA de D-Central peut vous aider à concevoir la bonne pile.
Qu’est-ce qu’un modèle à mélange d’experts (MoE) et comment influe-t-il sur la VRAM ?
Un modèle à mélange d’experts (MoE) partitionne ses paramètres en « experts » — des sous-réseaux spécialisés pour différentes entrées. Pour chaque jeton, un routeur ne sélectionne qu’un petit sous-ensemble d’experts à activer (p. ex. 2 sur 8). Cela signifie que le modèle peut avoir bien plus de paramètres au total qu’un modèle dense standard tout en utilisant autant de calcul par jeton qu’un modèle plus petit. Le hic : tous les poids des experts doivent être chargés simultanément dans la VRAM, même si la plupart sont inactifs à un moment donné. Ainsi, Mixtral 8x7B (46.7B de paramètres au total, 12.9B actifs) infère à la vitesse d’un modèle 13B, mais nécessite ~26 GB de VRAM en Q4. De même, Qwen3 30B-A3B nécessite ~19 GB de VRAM, mais infère aussi vite qu’un modèle 3B. Les modèles MoE sont excellents pour les déploiements sensibles à la latence où vous disposez de suffisamment de VRAM.
Les modèles comme Command R sont-ils utilisables commercialement ?
Non — Command R (35B) et Command R+ (104B) de Cohere sont publiés sous CC-BY-NC-4.0, qui interdit l’usage commercial sans licence distincte de Cohere. Les deux sont marqués d’un ✗ dans la colonne « Commercial » de ce jeu de données. Si vous avez besoin d’un modèle sous licence commerciale dans la gamme 35B+, envisagez Qwen2.5 32B (Apache 2.0), Qwen3 32B (Apache 2.0) ou Llama 3.1 70B (Llama Community License, usage commercial permis). Lisez toujours le texte complet de la licence avant tout déploiement en production. Ce jeu de données est informatif et ne constitue pas un avis juridique.
À quelle fréquence ce jeu de données est-il mis à jour ?
Le jeu de données est constitué et vérifié manuellement par rapport aux fiches de modèles de Hugging Face et à la bibliothèque Ollama. La version actuelle couvre les modèles à jour en juin 2026. Le domaine des LLM à poids ouverts évolue rapidement — de nouvelles familles de modèles, des versions mises à jour et des changements de licence apparaissent fréquemment. Nous mettons à jour cette base de données lors de sorties majeures. L’API REST à /wp-json/dc/v1/local-llm-models reflète toujours la version actuelle. Si vous repérez une erreur ou une omission, le jeu de données est disponible sous CC BY 4.0 — citez D-Central et proposez des corrections. Dernière vérification : juin 2026.
Citer ce jeu de données
Ce jeu de données est publié sous licence Creative Commons Attribution 4.0 International (CC BY 4.0). Vous êtes libre de le partager, de l’adapter et de l’utiliser commercialement — avec attribution.
D-Central Technologies. (2026). Local LLM Model Database [Jeu de données]. D-Central Open Data. https://d-central.tech/data/local-llm-model-database/ — CC BY 4.0. À jour en juin 2026 ; vérifiez à la source.
@dataset{dcentral2026llmdb,
title = {Local LLM Model Database},
author = {{D-Central Technologies}},
year = {2026},
month = {June},
url = {https://d-central.tech/data/local-llm-model-database/},
license = {CC BY 4.0},
note = {Open-weight LLM index: parameters, context window, VRAM,
license, Ollama tag. As of June 2026; verify at source.}
}
- API REST :
/wp-json/dc/v1/local-llm-models - CSV :
/data/local-llm-model-database.csv - JSON :
/data/local-llm-model-database.json
Note sur l’attribution : Les modèles indexés ici sont publiés par leurs développeurs respectifs (Meta, l’équipe Alibaba/Qwen, Google DeepMind, Mistral AI, Microsoft, DeepSeek AI, Allen AI, Cohere, HuggingFace). D-Central fournit cet index sous CC BY 4.0 ; les modèles eux-mêmes demeurent sous leurs propres licences indiquées dans chaque fiche.
Produits, réparations et guides connexes
- hub IA auto-hébergée pour Bitcoiners
- guide des plebs pour l’IA auto-hébergée
- installer Ollama en 10 minutes
- LM Studio vs Ollama vs llama.cpp
- connecter l’IA locale à Home Assistant et Obsidian
- dépannage de l’IA auto-hébergée
- convertir du matériel de minage en hashcenter IA
- classements des modèles d’IA locale
Dernière révision: 27 juillet 2026.
