Compatibilité GPU / LLM local (tient-il dans la VRAM ?)
Quel LLM local votre GPU peut-il faire tourner ? Ce jeu de données croise les GPU avec les LLM locaux ouverts et calcule si chaque modèle tient dans la VRAM en Q4, Q8 et FP16 — avec la marge, une quantification recommandée et une colonne tenant compte du cache KV en contexte réel. Les noms de GPU, modèles et chiffres restent en anglais, source unique.
Réponse rapide
Ce jeu de données croise 30 GPU avec 63 LLM locaux ouverts (1890 fiches de compatibilité), en calculant si chaque modèle tient dans la VRAM en Q4, Q8 et FP16 — avec la marge et une quantification recommandée. Utilisez-le pour répondre à « quel LLM local mon GPU peut-il faire tourner ? » avant d'acheter du matériel ou de télécharger un modèle.
Le jeu de données porte maintenant deux colonnes de compatibilité par paire : poids seuls (q4/q8_fits) et une fits_at_context tenant compte du cache KV, qui ajoute le cache d'attention FP16 à un contexte de stress de 32 768 jetons (plafonné à la fenêtre native de chaque modèle) plus une marge d'exécution d'environ 1 Go. Une carte peut réussir en poids seuls et échouer en contexte réel — un GPU de 24 Go contient les poids Q4 de Qwen3-32B (20 Go) mais manque de mémoire vers 29 Go une fois 32k de cache KV ajouté. Vérifiez fits_at_context avant de provisionner. Libre de téléchargement (CSV/JSON) et interrogeable par API sous CC BY 4.0.
Télécharger le CSV Télécharger le JSON API REST →
| GPU | VRAM | Modèles compatibles (Q4) | Q8 | FP16 | Plus grand exécutable (poids seuls) | Modèle résidentiel recommandé (Q8) |
|---|---|---|---|---|---|---|
| Apple M4 Max (40-core GPU, up to 128 GB) | 128 GB | 53 / 63 | 50 | 43 | Qwen3.5 122B-A10B (MoE) | Command R+ 104B |
| Apple M3 Max (40-core GPU, up to 128 GB) | 128 GB | 53 / 63 | 50 | 43 | Qwen3.5 122B-A10B (MoE) | Command R+ 104B |
| NVIDIA H100 SXM 80 GB | 80 GB | 52 / 63 | 47 | 41 | gpt-oss-120b | Llama 3.3 Nemotron Super 49B v1.5 |
| NVIDIA A100 SXM4 80 GB | 80 GB | 52 / 63 | 47 | 41 | gpt-oss-120b | Llama 3.3 Nemotron Super 49B v1.5 |
| Apple M4 Pro (20-core GPU, up to 64 GB) | 64 GB | 51 / 63 | 43 | 32 | GLM-4.5-Air | Llama 3.3 Nemotron Super 49B v1.5 |
| NVIDIA L40S 48 GB | 48 GB | 49 / 63 | 42 | 25 | Hunyuan-A13B-Instruct | Qwen3.5 35B-A3B (MoE) |
| NVIDIA RTX A6000 (Ampere) 48 GB | 48 GB | 49 / 63 | 42 | 25 | Hunyuan-A13B-Instruct | Qwen3.5 35B-A3B (MoE) |
| NVIDIA GeForce RTX 5090 | 32 GB | 44 / 63 | 31 | 24 | Llama 3.3 Nemotron Super 49B v1.5 | Gemma 3 27B Instruct |
| NVIDIA L4 24 GB | 24 GB | 42 / 63 | 25 | 16 | Qwen3.5 35B-A3B (MoE) | Phi-4 14B Instruct |
| NVIDIA GeForce RTX 4090 | 24 GB | 42 / 63 | 25 | 16 | Qwen3.5 35B-A3B (MoE) | Phi-4 14B Instruct |
| NVIDIA GeForce RTX 3090 | 24 GB | 42 / 63 | 25 | 16 | Qwen3.5 35B-A3B (MoE) | Phi-4 14B Instruct |
| AMD Radeon RX 7900 XTX | 24 GB | 42 / 63 | 25 | 16 | Qwen3.5 35B-A3B (MoE) | Phi-4 14B Instruct |
| AMD Radeon RX 7900 XT | 20 GB | 39 / 63 | 24 | 15 | Command R 35B (08-2024) | Phi-4 14B Instruct |
| NVIDIA GeForce RTX 5080 | 16 GB | 26 / 63 | 24 | 10 | gpt-oss-20b | OLMo 2 13B Instruct |
| NVIDIA GeForce RTX 4080 Super | 16 GB | 26 / 63 | 24 | 10 | gpt-oss-20b | OLMo 2 13B Instruct |
| NVIDIA GeForce RTX 4080 | 16 GB | 26 / 63 | 24 | 10 | gpt-oss-20b | OLMo 2 13B Instruct |
| NVIDIA GeForce RTX 4070 Ti Super | 16 GB | 26 / 63 | 24 | 10 | gpt-oss-20b | OLMo 2 13B Instruct |
| AMD Radeon RX 7800 XT | 16 GB | 26 / 63 | 24 | 10 | gpt-oss-20b | OLMo 2 13B Instruct |
| Intel Arc A770 16 GB | 16 GB | 26 / 63 | 24 | 10 | gpt-oss-20b | OLMo 2 13B Instruct |
| NVIDIA GeForce RTX 4060 Ti 16 GB | 16 GB | 26 / 63 | 24 | 10 | gpt-oss-20b | OLMo 2 13B Instruct |
| AMD Radeon RX 6900 XT | 16 GB | 26 / 63 | 24 | 10 | gpt-oss-20b | OLMo 2 13B Instruct |
| NVIDIA GeForce RTX 4070 Super | 12 GB | 25 / 63 | 16 | 6 | Phi-4 14B Instruct | NVIDIA Nemotron Nano 9B v2 |
| AMD Radeon RX 7700 XT | 12 GB | 25 / 63 | 16 | 6 | Phi-4 14B Instruct | NVIDIA Nemotron Nano 9B v2 |
| NVIDIA GeForce RTX 4070 | 12 GB | 25 / 63 | 16 | 6 | Phi-4 14B Instruct | NVIDIA Nemotron Nano 9B v2 |
| NVIDIA GeForce RTX 3080 12 GB | 12 GB | 25 / 63 | 16 | 6 | Phi-4 14B Instruct | NVIDIA Nemotron Nano 9B v2 |
| Intel Arc B580 12 GB | 12 GB | 25 / 63 | 16 | 6 | Phi-4 14B Instruct | NVIDIA Nemotron Nano 9B v2 |
| NVIDIA GeForce RTX 4060 Ti 8 GB | 8 GB | 19 / 63 | 10 | 5 | Gemma 3 12B Instruct | Gemma 3 4B Instruct |
| NVIDIA GeForce RTX 4060 | 8 GB | 19 / 63 | 10 | 5 | Gemma 3 12B Instruct | Gemma 3 4B Instruct |
| AMD Radeon RX 7600 | 8 GB | 19 / 63 | 10 | 5 | Gemma 3 12B Instruct | Gemma 3 4B Instruct |
| NVIDIA GeForce RTX 3070 | 8 GB | 19 / 63 | 10 | 5 | Gemma 3 12B Instruct | Gemma 3 4B Instruct |
Méthode : Un modèle « tient » (poids seuls) lorsque la VRAM du GPU est au moins égale à l'empreinte des poids du modèle à cette quantification. La qualité classe la marge : serré (<1,15× les poids — poids seuls, peu de place pour le contexte), bon (<1,6×), ample (≥1,6×). Les colonnes fits_at_context du jeu de données vont plus loin : elles ajoutent le cache KV FP16 à un contexte de stress de 32 768 jetons (plafonné à la fenêtre native de chaque modèle) plus une marge d'exécution d'environ 1 Go, le cache KV étant calculé à partir de l'architecture publiée de chaque modèle (2 × couches × kv_heads × head_dim × 2 octets par jeton). Les modèles dont la géométrie d'attention n'est pas vérifiée ou est non standard sont marqués unknown-architecture et rapportent un KV nul plutôt qu'une estimation. Données sources : la base de données AI-GPU et la base de données de LLM locaux.
Vérifiez fits_at_context avant de provisionner. Ce jeu de données ouvert (CC BY 4.0) fait partie du catalogue de données ouvertes de D-Central.
Produits, réparations et guides connexes
- hub IA auto-hébergée pour Bitcoiners
- guide des plebs pour l’IA auto-hébergée
- installer Ollama en 10 minutes
- LM Studio vs Ollama vs llama.cpp
- connecter l’IA locale à Home Assistant et Obsidian
- dépannage de l’IA auto-hébergée
- convertir du matériel de minage en hashcenter IA
- classements des modèles d’IA locale
Dernière révision: 27 juillet 2026.
