Base de données GPU pour l’IA et l’inférence locale
La base de données GPU IA de D-Central est une référence gratuite et citable regroupant 30 fiches de GPU et d’accélérateurs — les chiffres qui comptent réellement pour exécuter un grand modèle de langage en local : VRAM en GB, bande passante mémoire, TFLOPS FP16, TOPS INT8, TDP et un palier d’inférence en langage clair. Les données proviennent directement des pages produit et fiches techniques officielles de NVIDIA, AMD, Apple et Intel, recoupées avec la TechPowerUp GPU Database. Publiée sous licence CC BY 4.0 ; vérifiez à la source avant toute décision d’achat.
À retenir pour l’IA locale : Pour la génération de tokens d’un LLM en flux unique, la bande passante mémoire est le goulot d’étranglement dominant — et non les TFLOPS de calcul. Une carte offrant plus de GB/s générera des tokens plus rapidement même si sa valeur FP16 paraît plus faible. La quantité de VRAM détermine quels modèles tiennent sans délestage vers le CPU. Les TFLOPS FP16/INT8 comptent surtout pour l’inférence par lots et la vitesse de traitement des invites.
Guide des paliers d’inférence
- Palier 1 Centre de données — entreprise / infonuagique uniquement ; non déployable à domicile
- Palier 2 Prosommateur — serveur IA domestique sérieux ; exécute des modèles 70B+ quantifiés
- Palier 3 Compétent — modèles 13B–34B sans difficulté ; excellent usage domestique
- Palier 4 Milieu de gamme — modèles 7B–13B ; usage domestique raisonnable
- Palier 5 Entrée de gamme — limite de 7B ; VRAM ou bande passante limitée
Spécifications des GPU et accélérateurs
| GPU / Accélérateur | Fabricant | VRAM GB | Type de VRAM | Bande passante GB/s | FP16 TFLOPS | INT8 TOPS | TDP W | Palier |
|---|---|---|---|---|---|---|---|---|
| NVIDIA H100 SXM 80 GBHopper (GH100) · HBM3 | NVIDIA | 80 | HBM3 | 3 350 | 1 979 | 3 958 | 700 | 1 |
| GPU d’inférence de pointe ; FP16 dense sur cœurs tensoriels, fiche technique officielle NVIDIA. Infonuagique/entreprise uniquement. Crédit : NVIDIA Corporation — nvidia.com/en-us/data-center/h100/ | ||||||||
| NVIDIA A100 SXM4 80 GBAmpere DC (GA100) · HBM2e | NVIDIA | 80 | HBM2e | 2 000 | 312 | 624 | 400 | 1 |
| FP16 dense sur cœurs tensoriels, fiche technique NVIDIA A100. Disponible d’occasion sur le marché secondaire. Crédit : NVIDIA Corporation — nvidia.com/en-us/data-center/a100/ | ||||||||
| NVIDIA L40S 48 GBAda Lovelace (AD102) · GDDR6 | NVIDIA | 48 | GDDR6 | 864 | ~183 ⓘ | ~366 ⓘ | 350 | 1 |
| 48 GB permet le 70B en FP16. FP16/INT8 = estimations tensorielles denses ; les fiches techniques NVIDIA indiquent la valeur creuse (sparse) (~2× la dense). Crédit : NVIDIA Corporation — nvidia.com/en-us/data-center/l40s/ | ||||||||
| NVIDIA L4 24 GBAda Lovelace (AD104) · GDDR6 | NVIDIA | 24 | GDDR6 | 300 | ~121 ⓘ | 242 | 72 | 2 |
| Champion de l’efficacité : TDP de 72 W, format PCIe à profil bas, 24 GB. INT8 = 242 TOPS confirmé par NVIDIA. FP16 dérivé comme INT8/2. Crédit : NVIDIA Corporation — nvidia.com/en-us/data-center/l4/ | ||||||||
| NVIDIA RTX A6000 (Ampere) 48 GBAmpere (GA102) · GDDR6 | NVIDIA | 48 | GDDR6 | 768 | 155 | ~310 ⓘ | 300 | 2 |
| FP16 = 154.83 TFLOPS dense sur cœurs tensoriels, fiche technique officielle NVIDIA. 48 GB + NVLink (96 GB en configuration double carte). Disponible d’occasion. Crédit : NVIDIA Corporation — nvidia.com/…/rtx-a6000/ | ||||||||
| NVIDIA GeForce RTX 5090Blackwell (GB202) · GDDR7 | NVIDIA | 32 | GDDR7 | 1 792 | ~210 ⓘ | — | 575 | 2 |
| GPU grand public à la plus haute bande passante (1 792 GB/s, GDDR7). Lancé en janvier 2025. FP16 = estimation shader. NVIDIA ne publie pas les TFLOPS tensoriels des GeForce. Crédit : NVIDIA Corporation — nvidia.com/…/rtx-5090/ | ||||||||
| NVIDIA GeForce RTX 4090Ada Lovelace (AD102) · GDDR6X | NVIDIA | 24 | GDDR6X | 1 008 | 165.2 | 330.3 | 450 | 2 |
| FP16 165.2 et INT8 330.3 TOPS = publiés par NVIDIA (FP16 shader = 2×82.6 FP32). Référence absolue pour l’inférence à domicile. Crédit : NVIDIA Corporation — nvidia.com/…/rtx-4090/ | ||||||||
| Apple M4 Max (GPU 40 cœurs, jusqu’à 128 GB)Apple Silicon M4 · Unified | Apple | 128 ‡ | Unified | 546 | ~18.4 ⓘ | 38 ‡ | — ‡ | 2 |
| ‡ VRAM = mémoire unifiée (pas de bus GDDR). TOPS INT8 = Neural Engine à 16 cœurs (distinct du GPU). TDP non publié par puce. FP16 = estimation tierce du shader GPU. Exécute le 70B en FP16 — fait unique, sans quantification. Crédit : Apple Inc. — apple.com newsroom | ||||||||
| NVIDIA GeForce RTX 3090Ampere (GA102) · GDDR6X | NVIDIA | 24 | GDDR6X | 936 | ~71 ⓘ | ~142 ⓘ | 350 | 3 |
| Meilleur rapport qualité-prix d’occasion pour 24 GB. Confiance FP16 : modérée (les résultats de recherche divergeaient entre 71 et 142 ; nous retenons 71.16 = 2×35.58 FP32, la valeur inférieure/prudente). Crédit : NVIDIA Corporation. | ||||||||
| NVIDIA GeForce RTX 5080Blackwell (GB203) · GDDR7 | NVIDIA | 16 | GDDR7 | 960 | 112.6 | — | 360 | 3 |
| FP16 112.6 TFLOPS = cité de façon constante par plusieurs sources ; Blackwell lancé en janvier 2025. Crédit : NVIDIA Corporation — nvidia.com/…/rtx-5080/ | ||||||||
| NVIDIA GeForce RTX 4080 SuperAda Lovelace (AD103) · GDDR6X | NVIDIA | 16 | GDDR6X | 736 | ~104 ⓘ | — | 320 | 3 |
| Crédit : NVIDIA Corporation — nvidia.com/…/rtx-4080-family/ | ||||||||
| NVIDIA GeForce RTX 4080Ada Lovelace (AD103) · GDDR6X | NVIDIA | 16 | GDDR6X | 717 | ~97.5 ⓘ | — | 320 | 3 |
| FP32 49 TFLOPS confirmé par NVIDIA (« 49 Shader-TFLOPs »). FP16 = 2×. Crédit : NVIDIA Corporation. | ||||||||
| AMD Radeon RX 7900 XTXRDNA 3 (Navi 31) · GDDR6 | AMD | 24 | GDDR6 | 960 | 123 | 123 | 355 | 3 |
| FP16 Matrix (AI Accelerator) = 123 TFLOPS et INT8 Matrix = 123 TOPS selon la page produit officielle d’AMD (RDNA 3 offre le même débit pour les matrices FP16 et INT8). Inférence via ROCm (Linux) ou Vulkan/DirectML. Crédit : AMD — amd.com RX 7900 XTX | ||||||||
| Apple M3 Max (GPU 40 cœurs, jusqu’à 128 GB)Apple Silicon M3 · Unified | Apple | 128 ‡ | Unified | 400 | ~16.4 ⓘ | 18 ‡ | — ‡ | 3 |
| ‡ Mémoire unifiée / Neural Engine — mêmes réserves que le M4 Max. 128 GB permet le 70B Q4 en local. Crédit : Apple Inc. — apple.com M3 newsroom | ||||||||
| NVIDIA GeForce RTX 4070 Ti SuperAda Lovelace (AD103) · GDDR6X | NVIDIA | 16 | GDDR6X | 672 | ~88 ⓘ | — | 285 | 3 |
| Crédit : NVIDIA Corporation — nvidia.com/…/rtx-4070-ti-super/ | ||||||||
| AMD Radeon RX 7900 XTRDNA 3 (Navi 31) · GDDR6 | AMD | 20 | GDDR6 | 800 | 103 | 103 | 315 | 3 |
| FP16 Matrix = 103 TFLOPS, INT8 Matrix = 103 TOPS selon WareDB (tiré des données officielles AMD). Point d’équilibre idéal à 20 GB. Crédit : AMD — amd.com RX 7900 XT | ||||||||
| Apple M4 Pro (GPU 20 cœurs, jusqu’à 64 GB)Apple Silicon M4 · Unified | Apple | 64 ‡ | Unified | 273 | ~9.2 ⓘ | 38 ‡ | — ‡ | 3 |
| ‡ Mêmes réserves Apple. FP16 = estimation à FAIBLE confiance (moitié du M4 Max). 64 GB de mémoire unifiée. Crédit : Apple Inc. — Fiches techniques Apple MBP M4 Pro | ||||||||
| NVIDIA GeForce RTX 4070 SuperAda Lovelace (AD104) · GDDR6X | NVIDIA | 12 | GDDR6X | 504 | ~71 ⓘ | — | 220 | 4 |
| Crédit : NVIDIA Corporation — nvidia.com/…/rtx-4070-super/ | ||||||||
| AMD Radeon RX 7800 XTRDNA 3 (Navi 32) · GDDR6 | AMD | 16 | GDDR6 | 576 | 74.6 | 74.6 | 263 | 4 |
| FP16 Matrix = 74.6 et INT8 Matrix = 74.6 TOPS selon la page produit officielle d’AMD. Milieu de gamme 16 GB. Crédit : AMD — amd.com RX 7800 XT | ||||||||
| Intel Arc A770 16 GBXe-HPG Alchemist (ACM-G10) · GDDR6 | Intel | 16 | GDDR6 | 560 | 39.4 | — | 225 | 4 |
| FP16 39.4 TFLOPS = publié par la page produit officielle d’Intel. 16 GB GDDR6, accélération IA XMX. INT8 non publié pour les Arc grand public. Crédit : Intel Corporation — intel.com Arc A770 specs | ||||||||
| AMD Radeon RX 7700 XTRDNA 3 (Navi 32) · GDDR6 | AMD | 12 | GDDR6 | 432 | 70.3 | 70.3 | 245 | 4 |
| FP16 Matrix = 70.3 TFLOPS selon la page de spécifications officielle d’AMD (108 AI Accelerators). Crédit : AMD — amd.com RX 7700 XT | ||||||||
| NVIDIA GeForce RTX 4070Ada Lovelace (AD104) · GDDR6X | NVIDIA | 12 | GDDR6X | 504 | ~58.5 ⓘ | — | 200 | 4 |
| Crédit : NVIDIA Corporation — nvidia.com/…/rtx-4070/ | ||||||||
| NVIDIA GeForce RTX 4060 Ti 16 GBAda Lovelace (AD106) · GDDR6 | NVIDIA | 16 | GDDR6 | 288 | ~44 ⓘ | — | 165 | 4 |
| Principal atout : 16 GB ; la bande passante de 288 GB/s constitue un goulot d’étranglement (génération de tokens ~3× plus lente que la RTX 4090 malgré la même VRAM). Crédit : NVIDIA Corporation. | ||||||||
| NVIDIA GeForce RTX 3080 12 GBAmpere (GA102) · GDDR6X | NVIDIA | 12 | GDDR6X | 912 | ~61 ⓘ | — | 350 | 4 |
| La bande passante de 912 GB/s en fait un générateur de tokens rapide malgré « seulement » 12 GB. Bon rapport qualité-prix d’occasion. Crédit : NVIDIA Corporation. | ||||||||
| AMD Radeon RX 6900 XTRDNA 2 (Navi 21) · GDDR6 | AMD | 16 | GDDR6 | 512 | ~46 ⓘ | — | 300 | 4 |
| RDNA 2 — pas d’AI Accelerators dédiés. FP16 = estimation shader. 16 GB à bon prix d’occasion. Prise en charge ROCm pour cette génération plus ancienne. Crédit : AMD — amd.com RX 6900 XT | ||||||||
| Intel Arc B580 12 GBXe2-HPG Battlemage (BMG-G21) · GDDR6 | Intel | 12 | GDDR6 | 456 | 27.3 | — | 190 | 4 |
| FP16 27.34 TFLOPS = page produit officielle d’Intel. Lancement à 249 $ US (décembre 2024). 160 moteurs XMX pour l’accélération matricielle. INT8 non publié. Crédit : Intel Corporation — intel.com Arc B580 specs | ||||||||
| NVIDIA GeForce RTX 4060 Ti 8 GBAda Lovelace (AD106) · GDDR6 | NVIDIA | 8 | GDDR6 | 288 | ~44 ⓘ | — | 160 | 5 |
| Puissance de calcul identique à la variante 16 GB. La VRAM de 8 GB est la contrainte déterminante pour l’IA. Préférez 16 GB pour le travail d’IA. Crédit : NVIDIA Corporation. | ||||||||
| NVIDIA GeForce RTX 4060Ada Lovelace (AD107) · GDDR6 | NVIDIA | 8 | GDDR6 | 272 | ~30 ⓘ | — | 115 | 5 |
| TDP remarquable de 115 W. 8 GB limite au 7B Q4. Bon point d’entrée. Crédit : NVIDIA Corporation — nvidia.com/…/rtx-4060/ | ||||||||
| AMD Radeon RX 7600RDNA 3 (Navi 33) · GDDR6 | AMD | 8 | GDDR6 | 288 | ~42.8 ⓘ | ~42.8 ⓘ | 165 | 5 |
| Entrée de gamme RDNA 3 à 8 GB. 64 AI Accelerators. FP16/INT8 tirés des données d’architecture RDNA 3 via gpupoet (pas directement de la page produit amd.com — confiance modérée). Crédit : AMD — amd.com RX 7600 | ||||||||
| NVIDIA GeForce RTX 3070Ampere (GA104) · GDDR6 | NVIDIA | 8 | GDDR6 | 448 | ~40.6 ⓘ | — | 220 | 5 |
| Largement disponible d’occasion à bas prix. 8 GB limite au 7B Q4. Meilleure bande passante que la RTX 4060 8 GB malgré la même catégorie de VRAM. Crédit : NVIDIA Corporation. | ||||||||
ⓘ = valeur estimée (non confirmée directement à partir de la page de spécifications officielle). ‡ = réserve Apple Silicon applicable (mémoire unifiée / Neural Engine / TDP non publié par puce). Consultez les notes par ligne et la page Méthodologie. Pour un accès lisible par machine, utilisez l’API REST.
Foire aux questions
- Quel GPU est le meilleur pour exécuter des LLM locaux à la maison ?
- Pour la plupart des utilisateurs à domicile, la NVIDIA GeForce RTX 4090 (24 GB, 1 008 GB/s) est le meilleur choix en carte unique — elle dispose de la VRAM pour exécuter des modèles 34B en FP16 et de la bande passante pour générer des tokens rapidement. Si le budget est la contrainte, la RTX 3090 offre presque autant de VRAM et de bande passante à un prix d’occasion bien inférieur. Apple Silicon (le M4 Max avec 128 GB de mémoire unifiée) est la seule plateforme capable d’exécuter des modèles 70B en pleine précision FP16 sans un GPU dédié coûtant plus cher qu’une voiture.
- Pourquoi la bande passante mémoire compte-t-elle plus que les TFLOPS de calcul pour l’IA locale ?
- L’inférence LLM moderne en mode flux unique est limitée par la bande passante mémoire, et non par la puissance de calcul. Le GPU doit transférer l’intégralité des poids du modèle depuis la VRAM pour chaque token généré. Une carte offrant plus de GB/s générera des tokens plus rapidement même si sa valeur FP16 paraît plus faible. Les TFLOPS de calcul comptent davantage pour le traitement des invites à long contexte (préremplissage) et l’inférence par lots, où l’intensité arithmétique augmente.
- Puis-je utiliser un GPU AMD pour l’IA locale ?
- Oui. Les GPU AMD RDNA 3 fonctionnent avec ROCm sous Linux pour des cadriciels comme PyTorch et llama.cpp (dorsale ROCm/HIP). Sous Windows, les dorsales Vulkan et DirectML sont accessibles via llama.cpp et Ollama. La RX 7900 XTX (24 GB) et la RX 7900 XT (20 GB) rivalisent avec les options NVIDIA en débit d’inférence, avec les mêmes performances matricielles FP16/INT8 de l’AI Accelerator. L’outillage ROCm s’améliore, mais n’est pas encore aussi fluide que le CUDA de NVIDIA.
- Qu’en est-il des GPU Intel Arc ?
- Les GPU Intel Arc (A770 16 GB, B580 12 GB) constituent une option économique viable, en particulier l’A770 16 GB. Ils utilisent les moteurs matriciels XMX d’Intel pour l’accélération FP16/INT8 et sont pris en charge via IPEX-LLM, OpenVINO et la dorsale SYCL de llama.cpp. CUDA n’est pas disponible. La maturité de l’écosystème est inférieure à celle de NVIDIA ou d’AMD ROCm.
- Que signifie « TOPS INT8 » et pourquoi cette valeur manque-t-elle pour de nombreuses cartes ?
- Les TOPS INT8 (téra-opérations par seconde en précision entière 8 bits) mesurent la vitesse à laquelle un GPU peut exécuter l’inférence d’un modèle quantifié. NVIDIA ne publie pas les TOPS INT8 pour les cartes grand public GeForce (ils n’apparaissent que sur les fiches techniques pro/centre de données). Lorsqu’ils sont affichés pour des cartes NVIDIA grand public, la valeur est estimée. AMD publie bel et bien les TOPS INT8 de l’AI Accelerator sur ses pages produit pour RDNA 3 — notamment, RDNA 3 offre le même débit pour les opérations matricielles FP16 et INT8.
- Qu’est-ce que la mémoire unifiée (Apple) et comment se compare-t-elle à la VRAM d’un GPU ?
- Apple Silicon utilise une architecture de mémoire unifiée où le même bloc de mémoire physique est partagé entre le CPU, le GPU et le Neural Engine, sans surcharge de transfert sur le bus. La colonne « VRAM GB » pour les entrées Apple de ce tableau reflète la configuration de mémoire unifiée maximale, et non un bloc de VRAM dédié. Autrement dit, un M4 Max doté de 128 GB peut consacrer la totalité des 128 GB aux poids du modèle au besoin — ce qu’aucun GPU discret grand public n’offre. En contrepartie, la bande passante mémoire (546 GB/s pour le M4 Max contre 1 008 GB/s pour la RTX 4090) est plus faible, de sorte que la génération de tokens sur un même modèle est un peu plus lente par watt.
- Quel est le plus petit GPU capable d’exécuter un modèle 13B ?
- Un modèle de 13B paramètres en FP16 requiert environ 26 GB de VRAM (13B × 2 octets). En quantification Q4 (~0.5 octet/paramètre), le 13B tient dans environ 7 GB. Ainsi : une carte de 8 GB de VRAM (RTX 4060, RX 7600) peut exécuter un modèle 13B en quantification Q4, mais pas en FP16. Une carte de 16 GB (RTX 4080, RX 7900 XTX) gère le 13B en FP16 sans difficulté. Une carte de 24 GB gère le 13B en FP16 avec de la marge.
- À quelle fréquence ce jeu de données est-il mis à jour ?
- Le jeu de données a été vérifié pour la dernière fois en juin 2026 par rapport aux pages de spécifications officielles des fabricants. Les spécifications d’un GPU sont stables une fois la carte lancée, mais de nouveaux modèles sortent régulièrement. Nous visons à ajouter de nouvelles entrées et à corriger tout écart dès qu’il est repéré. Consultez
last_verifieddans le CSV/JSON et vérifiez les spécifications clés à la source du fabricant avant tout achat.
Jeux de données et outils connexes
- Mesures de banc d’essai — les mesures de performance ASIC de première main réalisées par D-Central sur notre banc d’essai de Montréal
- Catalogue de données ouvertes — tous les jeux de données ouverts de D-Central avec leurs points d’accès API
- Exécuter des LLM locaux au Canada — guide pour mettre en place une inférence IA privée sur votre propre matériel
- Convergence de l’IA et du minage de Bitcoin — le volet IA de D-Central
- Calcul distribué — infrastructure IA souveraine pour les entreprises canadiennes
- Manuel de terrain du minage de Bitcoin — guides techniques pour le déploiement d’ASIC et l’exploitation de hashcentres
Citer ce jeu de données
Ce jeu de données est publié sous licence Creative Commons Attribution 4.0 International (CC BY 4.0). Vous êtes libre de partager, d’adapter et d’utiliser ces données à toute fin, y compris commerciale, à condition d’en attribuer correctement le crédit.
APA
D-Central Technologies. (2026). AI & Local-Inference GPU Database (v1.0) [Dataset]. https://d-central.tech/data/ai-gpu-database/. CC BY 4.0.
Chicago
D-Central Technologies. “AI & Local-Inference GPU Database.” Version 1.0. Dataset. 2026. https://d-central.tech/data/ai-gpu-database/. CC BY 4.0.
BibTeX@misc{dcentral2026gpudb,
author = {{D-Central Technologies}},
title = {AI & Local-Inference {GPU} Database},
year = {2026},
version = {1.0},
howpublished = {url{https://d-central.tech/data/ai-gpu-database/}},
note = {CC BY 4.0}
}
Téléchargements lisibles par machine : CSV · JSON · API REST
Spécifications tirées des pages produit et fiches techniques officielles de NVIDIA Corporation, AMD (Advanced Micro Devices), Apple Inc. et Intel Corporation ; recoupées avec la TechPowerUp GPU Database et WareDB. À jour en juin 2026 — vérifiez à la source avant toute décision d’achat. Ne constitue pas un conseil financier ou d’achat.
Produits, réparations et guides connexes
- comment D-Central diagnostique les réparations ASIC
- bibliothèque de dépannage ASIC
- manuels ASIC et guides de réparation
- hashboards de remplacement
- cartes de contrôle ASIC
- blocs d’alimentation ASIC
- hashboard de remplacement pour la famille S19
- carte de contrôle de remplacement C52
- bloc d’alimentation APW12 pour S19
- hub du refroidissement par immersion
- guide du refroidissement par immersion à la maison
- mineurs ASIC pour planifier l’immersion
- pièces de refroidissement ASIC
- conduit de ventilation avant l’immersion
- comparer les specs des mineurs dans la base de données
- soutien en réparation ASIC
Dernière révision: 27 juillet 2026.
