Base de données des modèles de génération d’images locaux (diffusion)
Les grands modèles de langage locaux retiennent l’attention, mais une pile d’IA réellement privée peut aussi créer des images — et la génération d’images suit la même règle dure que le reste de la pile souveraine : le modèle que vous pouvez réellement déployer dépend d’abord de sa licence, pas de sa qualité. Le texte-vers-image est un champ de mines juridique, car les deux modèles ouverts les plus impressionnants — FLUX.1 [dev] et Stable Cascade — sont non commerciaux, tout comme le très rapide Sana de NVIDIA. Cette base de données classe 15 familles de modèles de diffusion à poids ouverts et auto-hébergeables selon la sûreté commerciale de la licence d’abord, puis le nombre de paramètres, l’architecture, la VRAM minimale (en pleine précision et quantifiée), la résolution native et la vitesse — afin que vous trouviez le modèle que vous pouvez à la fois faire tourner et déployer légalement. Les données restent en anglais (source unique), fidèles aux fiches de modèles d’origine.
Réponse rapide
Pour générer des images sur votre propre matériel - sans cloud, sans frais par image, sans que vos données quittent votre machine - le modèle que vous pouvez réellement DÉPLOYER est déterminé par sa LICENCE avant sa qualité. Le piège : les deux modèles ouverts les plus impressionnants, FLUX.1 [dev] et Stable Cascade, sont NON COMMERCIAUX, tout comme le très rapide Sana de NVIDIA. Les choix sûrs pour un usage commercial sont FLUX.1 [schnell] (Apache-2.0), Qwen-Image et HiDream-I1 (Apache-2.0 / MIT), le compact Lumina-Image 2.0 (Apache-2.0), et la famille Stable Diffusion sous OpenRAIL / la Community License de Stability (commercial OK sous conditions). La VRAM est l'autre contrainte : Stable Diffusion 1.5 tourne sur 4 Go et SDXL sur 8 Go, mais les modèles FLUX de 12 milliards de paramètres exigent environ 24 Go en pleine précision - ou environ 8 Go avec une quantification GGUF Q4 et le déchargement de l'encodeur de texte.
Triez d'abord par licence, puis par VRAM. Sûr pour le commerce et peu gourmand en VRAM aujourd'hui : SDXL / SD 3.5 (OpenRAIL / Stability Community, moins de 1 M$ US de chiffre d'affaires) et FLUX.1 [schnell] (Apache-2.0). Traitez FLUX.1 [dev], Stable Cascade et Sana comme réservés à un usage personnel / de recherche. Chaque chiffre de VRAM ci-dessous est une estimation pratique - vérifiez la licence exacte du modèle avant de déployer.
Licence : permissif MIT / Apache - usage commercial OK restreint OpenRAIL / plafonné au chiffre d'affaires / inscription - commercial OK sous conditions non commercial impasse pour un produit · Les chiffres de VRAM sont des estimations pratiques (pipeline complet, GPU grand public)
| Modèle | Licence | Paramètres / architecture | VRAM min (fp16 / quantifié) | Résolution native | Vitesse | Meilleur usage |
|---|---|---|---|---|---|---|
| FLUX.1 [schnell]Black Forest Labs | permissifApache-2.0 | 12BRectified-flow transformer (DiT) | 24 GB / 8 GB | 1024x1024 (multi-aspect) | fast | Fast 1-4 step high-quality generation; fully commercial-safe distilled FLUX |
| Apache-2.0 - the model card states it can be used for personal, scientific AND commercial purposes. 12B rectified-flow transformer, 1-4 steps (timestep-distilled). fp16/bf16 ~24 GB; fp8 ~12 GB; GGUF Q4 ~8 GB (down to 8 GB cards with text-encoder CPU offload). T5-XXL text encoder dominates memory. source | ||||||
| HiDream-I1 (Full)HiDream.ai | permissifMIT (transformer weights) | 17B sparse DiT (MoE)Sparse diffusion transformer (mixture-of-experts) | 34 GB / 16 GB | 1024x1024 | slow | State-of-the-art 2025 open quality; MIT-licensed and commercial-friendly |
| Transformer weights are MIT (card: 'Commercial-Friendly', commercial use permitted). 17B sparse (MoE) DiT -> fp16 ~34 GB; GGUF / quantized ~16-24 GB. Distilled HiDream-I1-Dev / -Fast variants cut steps and VRAM. Bundled text encoders include Llama-3.1 (its own community terms); the VAE is Apache-2.0. source | ||||||
| Kandinsky 3.0AI-Forever (Sber) | permissifApache-2.0 | 3B U-Net (+ 8.6B Flan-UL2 text encoder; 12.1B total)U-Net latent diffusion + Flan-UL2 text encoder + MoVQ decoder | 24 GB / 11 GB | 1024x1024 | slow | Fully Apache-licensed; strong Russian / English; large text encoder |
| Apache-2.0 - full commercial use. 3B U-Net, but the 8.6B Flan-UL2 text encoder makes the pipeline ~12.1B total -> high VRAM (offloading / quantization recommended). MoVQ latent decoder (0.27B). source | ||||||
| Lumina-Image 2.0Alpha-VLLM (Shanghai AI Lab) | permissifApache-2.0 | 2B (Next-DiT)Flow-based diffusion transformer (Next-DiT) + Gemma-2 text encoder | 9 GB / 5 GB | 1024x1024 | medium | Compact 2B Apache-licensed flow DiT; efficient commercial-safe alternative to FLUX |
| Apache-2.0 - full commercial use. 2B flow-based (Next-DiT) transformer, 1024px (HF card). Uses a Gemma-2 text encoder. A mid-size open model you can actually ship commercially. source | ||||||
| Qwen-ImageAlibaba / Qwen Team | permissifApache-2.0 | 20B MMDiTMMDiT (multimodal diffusion transformer) | 40 GB / 16 GB | 1328x1328 (multi-aspect) | slow | Flagship 2025 open model; exceptional in-image text rendering (EN + CJK) |
| Apache-2.0 - full commercial use. 20B parameters; released 2025-08-04 (HF card). Large: fp16/bf16 ~40 GB; GGUF / quantized community builds run ~16-24 GB. Native 1:1 at 1328x1328 plus multiple aspect ratios. Best-in-class text-in-image among open models. source | ||||||
| KolorsKuaishou (Kwai-Kolors) | restreintApache-2.0 (commercial use requires vendor registration) | unverified (SDXL-family U-Net + GLM text encoder; not stated on card)U-Net latent diffusion + ChatGLM3 text encoder | 12 GB / 6 GB | 1024x1024 | medium | Strong bilingual (EN/CN) photorealism; SDXL-compatible tooling |
| Weights are Apache-2.0, BUT the model card requires COMMERCIAL users to REGISTER via a questionnaire emailed to the vendor - treat commercial use as conditional. SDXL-family U-Net with a large GLM-based text encoder (raises VRAM vs plain SDXL). Exact parameter count is not stated on the card (marked unverified). source | ||||||
| PixArt-Sigma XL 1024-MSPixArt-alpha (Huawei Noah's Ark Lab) | restreintCreativeML Open RAIL++-M | 0.6B DiTDiffusion transformer (DiT) + T5-XXL text encoder | 9 GB / 4 GB | 1024x1024 (to 4K) | medium | Tiny 0.6B transformer; efficient 1024->4K; weak-hardware-friendly with text-encoder offload |
| 0.6B DiT - the transformer itself is tiny; practical VRAM is dominated by the T5-XXL text encoder (~9.5 GB fp16, ~4 GB fp8/offloaded). Open RAIL++-M: commercial OK with use-based restrictions. Successor to PixArt-alpha. source | ||||||
| Playground v2.5Playground AI | restreintPlayground v2.5 Community License | 2.6B U-Net (SDXL-based; card lists ~3B)U-Net latent diffusion (SDXL architecture) | 8 GB / 6 GB | 1024x1024 | medium | SDXL-compatible weights with improved color and aesthetics |
| SDXL-architecture U-Net with dual CLIP text encoders (HF card: 'Based on Stable Diffusion XL'). Playground v2.5 Community License permits commercial use with conditions (attribution + acceptable-use terms) - review the license text before commercial deployment. Same VRAM profile as SDXL. source | ||||||
| Stable Diffusion 1.5Runway ML / CompVis | restreintCreativeML OpenRAIL-M | 0.9B U-NetU-Net latent diffusion | 4 GB / 2 GB | 512x512 | fast | Lightweight base for fine-tunes / LoRAs; the largest community ecosystem; runs on almost any GPU |
| 0.9B U-Net, 512px native (HF card). OpenRAIL-M permits commercial use but imposes use-based (behavioral) restrictions - read the license. Practical VRAM ~4 GB fp16 (2 GB with low-VRAM/quantized). source | ||||||
| Stable Diffusion 3.5 LargeStability AI | restreintStability AI Community License | 8B MMDiTMMDiT (multimodal diffusion transformer) | 18 GB / 10 GB | 1024x1024 (up to 1 MP) | slow | Highest-quality open Stability model; prompt adherence and typography |
| 8B MMDiT (HF card). Community License: free for commercial use for orgs/individuals under US$1M annual revenue; above that requires a Stability Enterprise License. T5-XXL text encoder drives VRAM; fp8 / GGUF builds run ~10-12 GB. source | ||||||
| Stable Diffusion 3.5 MediumStability AI | restreintStability AI Community License | 2.5B MMDiT-XMMDiT-X (improved multimodal diffusion transformer) | 10 GB / 6 GB | 1024x1024 (trained to 1440) | medium | Consumer-GPU SD3.5; near-Large quality at lower VRAM |
| 2.5B MMDiT-X (HF card metadata rounds to ~2B). Community License (< US$1M revenue commercial-free; Enterprise License above). Stability designed it to run on consumer GPUs (~9.9 GB); multi-resolution training 256-1440px. source | ||||||
| Stable Diffusion XL 1.0 (base + refiner)Stability AI | restreintCreativeML Open RAIL++-M | 2.6B U-Net (~3.5B total pipeline)U-Net latent diffusion (dual text encoders) | 8 GB / 6 GB | 1024x1024 | medium | 1024px workhorse; strong quality-per-VRAM; refiner adds detail; huge tooling ecosystem |
| U-Net is 2.6B params (SDXL paper); full pipeline incl. the two text encoders + VAE is ~3.5B (HF card lists '3B params'). fp16 base ~8 GB min (12 GB comfortable); base+refiner ~12-16 GB; fp8 ~6 GB. Open RAIL++-M: commercial OK with use-based restrictions. source | ||||||
| FLUX.1 [dev]Black Forest Labs | non commercialFLUX.1 [dev] Non-Commercial License | 12BRectified-flow transformer (DiT) | 24 GB / 8 GB | 1024x1024 (multi-aspect) | slow | Best-in-class open image quality for personal / research (guidance-distilled, ~20-50 steps) |
| NON-COMMERCIAL model license - the weights may NOT be used in a commercial product/service (generated OUTPUTS may be used commercially per the license). 12B rectified-flow transformer, ~20-50 steps. Same VRAM as schnell: fp16 ~24 GB, fp8 ~12 GB, GGUF Q4 ~8 GB. FLUX.1 [pro] is API-only (closed weights) and is therefore EXCLUDED from this self-hostable table. source | ||||||
| Sana 1.6B (1024px)NVIDIA + MIT HAN Lab | non commercialNVIDIA Source Code License-NC (NSCL v2) + Gemma terms | 1.6B (1,648M) linear DiTLinear diffusion transformer + DC-AE (32x latent) + Gemma-2 2B text encoder | 9 GB / 5 GB | 1024x1024 (to 4K) | fast | Very fast / efficient (linear attention, 32x compression); research only |
| NON-COMMERCIAL: NVIDIA NSCL v2 governs, research purposes only; the Gemma-2-2B text encoder carries Google Gemma terms. 1.6B linear DiT is unusually efficient - 1024px on modest GPUs, up to 4096px. Few-step sampling. source | ||||||
| Stable Cascade (Wuerstchen v3)Stability AI | non commercialStable Cascade Non-Commercial Community License (stable-cascade-nc-community) | Stage C 3.6B (+ Stage B 1.5B, Stage A 20M)Wuerstchen 3-stage cascade (42x-compressed latent) | 16 GB / 8 GB | 1024x1024 | slow | Research / personal only; very efficient 42:1 latent compression |
| NON-COMMERCIAL: 'stable-cascade-nc-community' license (the 'nc' is explicit on the HF card). Three stages A/B/C; Stage C ships as 1B or 3.6B. High latent compression = fast train/inference, but licensed for research/personal use only. source | ||||||
Données ouvertes (CC BY 4.0) : CSV · JSON · API: /wp-json/dc/v1/image-gen-models
Données conservées en anglais (source unique), vérifiées le 2026-07-26. Les noms de modèles, licences, spécifications et chiffres de VRAM ne sont pas traduits afin de rester fidèles aux fiches de modèles d'origine.
La génération d’images n’est qu’une modalité d’une pile d’IA souveraine et auto-hébergée qui n’envoie jamais vos données vers un nuage américain. Ce jeu de données ouvert (CC BY 4.0) est téléchargeable en CSV et JSON, et fait partie du catalogue de données ouvertes de D-Central.
Produits, réparations et guides connexes
- comment D-Central diagnostique les réparations ASIC
- bibliothèque de dépannage ASIC
- manuels ASIC et guides de réparation
- hashboards de remplacement
- cartes de contrôle ASIC
- blocs d’alimentation ASIC
- hashboard de remplacement pour la famille S19
- carte de contrôle de remplacement C52
- bloc d’alimentation APW12 pour S19
- hub du refroidissement par immersion
- guide du refroidissement par immersion à la maison
- mineurs ASIC pour planifier l’immersion
- pièces de refroidissement ASIC
- conduit de ventilation avant l’immersion
- comparer les specs des mineurs dans la base de données
- soutien en réparation ASIC
Dernière révision: 26 juillet 2026.
