Passer au contenu

Bitcoin accepté au paiement  |  Expédié depuis Montréal, QC, Canada  |  Soutien expert depuis 2016

Compatibilité GPU / LLM local (tient-il dans la VRAM ?)

Quel LLM local votre GPU peut-il faire tourner ? Ce jeu de données croise les GPU avec les LLM locaux ouverts et calcule si chaque modèle tient dans la VRAM en Q4, Q8 et FP16 — avec la marge, une quantification recommandée et une colonne tenant compte du cache KV en contexte réel. Les noms de GPU, modèles et chiffres restent en anglais, source unique.

Réponse rapide

Ce jeu de données croise 30 GPU avec 63 LLM locaux ouverts (1890 fiches de compatibilité), en calculant si chaque modèle tient dans la VRAM en Q4, Q8 et FP16 — avec la marge et une quantification recommandée. Utilisez-le pour répondre à « quel LLM local mon GPU peut-il faire tourner ? » avant d'acheter du matériel ou de télécharger un modèle.

Le jeu de données porte maintenant deux colonnes de compatibilité par paire : poids seuls (q4/q8_fits) et une fits_at_context tenant compte du cache KV, qui ajoute le cache d'attention FP16 à un contexte de stress de 32 768 jetons (plafonné à la fenêtre native de chaque modèle) plus une marge d'exécution d'environ 1 Go. Une carte peut réussir en poids seuls et échouer en contexte réel — un GPU de 24 Go contient les poids Q4 de Qwen3-32B (20 Go) mais manque de mémoire vers 29 Go une fois 32k de cache KV ajouté. Vérifiez fits_at_context avant de provisionner. Libre de téléchargement (CSV/JSON) et interrogeable par API sous CC BY 4.0.

Télécharger le CSV Télécharger le JSON API REST →

GPUVRAMModèles compatibles (Q4)Q8FP16Plus grand exécutable (poids seuls)Modèle résidentiel recommandé (Q8)
Apple M4 Max (40-core GPU, up to 128 GB)128 GB53 / 635043Qwen3.5 122B-A10B (MoE)Command R+ 104B
Apple M3 Max (40-core GPU, up to 128 GB)128 GB53 / 635043Qwen3.5 122B-A10B (MoE)Command R+ 104B
NVIDIA H100 SXM 80 GB80 GB52 / 634741gpt-oss-120bLlama 3.3 Nemotron Super 49B v1.5
NVIDIA A100 SXM4 80 GB80 GB52 / 634741gpt-oss-120bLlama 3.3 Nemotron Super 49B v1.5
Apple M4 Pro (20-core GPU, up to 64 GB)64 GB51 / 634332GLM-4.5-AirLlama 3.3 Nemotron Super 49B v1.5
NVIDIA L40S 48 GB48 GB49 / 634225Hunyuan-A13B-InstructQwen3.5 35B-A3B (MoE)
NVIDIA RTX A6000 (Ampere) 48 GB48 GB49 / 634225Hunyuan-A13B-InstructQwen3.5 35B-A3B (MoE)
NVIDIA GeForce RTX 509032 GB44 / 633124Llama 3.3 Nemotron Super 49B v1.5Gemma 3 27B Instruct
NVIDIA L4 24 GB24 GB42 / 632516Qwen3.5 35B-A3B (MoE)Phi-4 14B Instruct
NVIDIA GeForce RTX 409024 GB42 / 632516Qwen3.5 35B-A3B (MoE)Phi-4 14B Instruct
NVIDIA GeForce RTX 309024 GB42 / 632516Qwen3.5 35B-A3B (MoE)Phi-4 14B Instruct
AMD Radeon RX 7900 XTX24 GB42 / 632516Qwen3.5 35B-A3B (MoE)Phi-4 14B Instruct
AMD Radeon RX 7900 XT20 GB39 / 632415Command R 35B (08-2024)Phi-4 14B Instruct
NVIDIA GeForce RTX 508016 GB26 / 632410gpt-oss-20bOLMo 2 13B Instruct
NVIDIA GeForce RTX 4080 Super16 GB26 / 632410gpt-oss-20bOLMo 2 13B Instruct
NVIDIA GeForce RTX 408016 GB26 / 632410gpt-oss-20bOLMo 2 13B Instruct
NVIDIA GeForce RTX 4070 Ti Super16 GB26 / 632410gpt-oss-20bOLMo 2 13B Instruct
AMD Radeon RX 7800 XT16 GB26 / 632410gpt-oss-20bOLMo 2 13B Instruct
Intel Arc A770 16 GB16 GB26 / 632410gpt-oss-20bOLMo 2 13B Instruct
NVIDIA GeForce RTX 4060 Ti 16 GB16 GB26 / 632410gpt-oss-20bOLMo 2 13B Instruct
AMD Radeon RX 6900 XT16 GB26 / 632410gpt-oss-20bOLMo 2 13B Instruct
NVIDIA GeForce RTX 4070 Super12 GB25 / 63166Phi-4 14B InstructNVIDIA Nemotron Nano 9B v2
AMD Radeon RX 7700 XT12 GB25 / 63166Phi-4 14B InstructNVIDIA Nemotron Nano 9B v2
NVIDIA GeForce RTX 407012 GB25 / 63166Phi-4 14B InstructNVIDIA Nemotron Nano 9B v2
NVIDIA GeForce RTX 3080 12 GB12 GB25 / 63166Phi-4 14B InstructNVIDIA Nemotron Nano 9B v2
Intel Arc B580 12 GB12 GB25 / 63166Phi-4 14B InstructNVIDIA Nemotron Nano 9B v2
NVIDIA GeForce RTX 4060 Ti 8 GB8 GB19 / 63105Gemma 3 12B InstructGemma 3 4B Instruct
NVIDIA GeForce RTX 40608 GB19 / 63105Gemma 3 12B InstructGemma 3 4B Instruct
AMD Radeon RX 76008 GB19 / 63105Gemma 3 12B InstructGemma 3 4B Instruct
NVIDIA GeForce RTX 30708 GB19 / 63105Gemma 3 12B InstructGemma 3 4B Instruct

Méthode : Un modèle « tient » (poids seuls) lorsque la VRAM du GPU est au moins égale à l'empreinte des poids du modèle à cette quantification. La qualité classe la marge : serré (<1,15× les poids — poids seuls, peu de place pour le contexte), bon (<1,6×), ample (≥1,6×). Les colonnes fits_at_context du jeu de données vont plus loin : elles ajoutent le cache KV FP16 à un contexte de stress de 32 768 jetons (plafonné à la fenêtre native de chaque modèle) plus une marge d'exécution d'environ 1 Go, le cache KV étant calculé à partir de l'architecture publiée de chaque modèle (2 × couches × kv_heads × head_dim × 2 octets par jeton). Les modèles dont la géométrie d'attention n'est pas vérifiée ou est non standard sont marqués unknown-architecture et rapportent un KV nul plutôt qu'une estimation. Données sources : la base de données AI-GPU et la base de données de LLM locaux.

Vérifiez fits_at_context avant de provisionner. Ce jeu de données ouvert (CC BY 4.0) fait partie du catalogue de données ouvertes de D-Central.