Passer au contenu

Bitcoin accepté au paiement  |  Expédié depuis Montréal, QC, Canada  |  Soutien expert depuis 2016

Base de données des modèles de génération d’images locaux (diffusion)

Les grands modèles de langage locaux retiennent l’attention, mais une pile d’IA réellement privée peut aussi créer des images — et la génération d’images suit la même règle dure que le reste de la pile souveraine : le modèle que vous pouvez réellement déployer dépend d’abord de sa licence, pas de sa qualité. Le texte-vers-image est un champ de mines juridique, car les deux modèles ouverts les plus impressionnants — FLUX.1 [dev] et Stable Cascade — sont non commerciaux, tout comme le très rapide Sana de NVIDIA. Cette base de données classe 15 familles de modèles de diffusion à poids ouverts et auto-hébergeables selon la sûreté commerciale de la licence d’abord, puis le nombre de paramètres, l’architecture, la VRAM minimale (en pleine précision et quantifiée), la résolution native et la vitesse — afin que vous trouviez le modèle que vous pouvez à la fois faire tourner et déployer légalement. Les données restent en anglais (source unique), fidèles aux fiches de modèles d’origine.

Réponse rapide

Pour générer des images sur votre propre matériel - sans cloud, sans frais par image, sans que vos données quittent votre machine - le modèle que vous pouvez réellement DÉPLOYER est déterminé par sa LICENCE avant sa qualité. Le piège : les deux modèles ouverts les plus impressionnants, FLUX.1 [dev] et Stable Cascade, sont NON COMMERCIAUX, tout comme le très rapide Sana de NVIDIA. Les choix sûrs pour un usage commercial sont FLUX.1 [schnell] (Apache-2.0), Qwen-Image et HiDream-I1 (Apache-2.0 / MIT), le compact Lumina-Image 2.0 (Apache-2.0), et la famille Stable Diffusion sous OpenRAIL / la Community License de Stability (commercial OK sous conditions). La VRAM est l'autre contrainte : Stable Diffusion 1.5 tourne sur 4 Go et SDXL sur 8 Go, mais les modèles FLUX de 12 milliards de paramètres exigent environ 24 Go en pleine précision - ou environ 8 Go avec une quantification GGUF Q4 et le déchargement de l'encodeur de texte.

Triez d'abord par licence, puis par VRAM. Sûr pour le commerce et peu gourmand en VRAM aujourd'hui : SDXL / SD 3.5 (OpenRAIL / Stability Community, moins de 1 M$ US de chiffre d'affaires) et FLUX.1 [schnell] (Apache-2.0). Traitez FLUX.1 [dev], Stable Cascade et Sana comme réservés à un usage personnel / de recherche. Chaque chiffre de VRAM ci-dessous est une estimation pratique - vérifiez la licence exacte du modèle avant de déployer.

Licence : permissif MIT / Apache - usage commercial OK   restreint OpenRAIL / plafonné au chiffre d'affaires / inscription - commercial OK sous conditions   non commercial impasse pour un produit   ·   Les chiffres de VRAM sont des estimations pratiques (pipeline complet, GPU grand public)

ModèleLicenceParamètres / architectureVRAM min
(fp16 / quantifié)
Résolution nativeVitesseMeilleur usage
FLUX.1 [schnell]Black Forest Labs permissifApache-2.0 12BRectified-flow transformer (DiT) 24 GB / 8 GB 1024x1024 (multi-aspect) fast Fast 1-4 step high-quality generation; fully commercial-safe distilled FLUX
Apache-2.0 - the model card states it can be used for personal, scientific AND commercial purposes. 12B rectified-flow transformer, 1-4 steps (timestep-distilled). fp16/bf16 ~24 GB; fp8 ~12 GB; GGUF Q4 ~8 GB (down to 8 GB cards with text-encoder CPU offload). T5-XXL text encoder dominates memory. source
HiDream-I1 (Full)HiDream.ai permissifMIT (transformer weights) 17B sparse DiT (MoE)Sparse diffusion transformer (mixture-of-experts) 34 GB / 16 GB 1024x1024 slow State-of-the-art 2025 open quality; MIT-licensed and commercial-friendly
Transformer weights are MIT (card: 'Commercial-Friendly', commercial use permitted). 17B sparse (MoE) DiT -> fp16 ~34 GB; GGUF / quantized ~16-24 GB. Distilled HiDream-I1-Dev / -Fast variants cut steps and VRAM. Bundled text encoders include Llama-3.1 (its own community terms); the VAE is Apache-2.0. source
Kandinsky 3.0AI-Forever (Sber) permissifApache-2.0 3B U-Net (+ 8.6B Flan-UL2 text encoder; 12.1B total)U-Net latent diffusion + Flan-UL2 text encoder + MoVQ decoder 24 GB / 11 GB 1024x1024 slow Fully Apache-licensed; strong Russian / English; large text encoder
Apache-2.0 - full commercial use. 3B U-Net, but the 8.6B Flan-UL2 text encoder makes the pipeline ~12.1B total -> high VRAM (offloading / quantization recommended). MoVQ latent decoder (0.27B). source
Lumina-Image 2.0Alpha-VLLM (Shanghai AI Lab) permissifApache-2.0 2B (Next-DiT)Flow-based diffusion transformer (Next-DiT) + Gemma-2 text encoder 9 GB / 5 GB 1024x1024 medium Compact 2B Apache-licensed flow DiT; efficient commercial-safe alternative to FLUX
Apache-2.0 - full commercial use. 2B flow-based (Next-DiT) transformer, 1024px (HF card). Uses a Gemma-2 text encoder. A mid-size open model you can actually ship commercially. source
Qwen-ImageAlibaba / Qwen Team permissifApache-2.0 20B MMDiTMMDiT (multimodal diffusion transformer) 40 GB / 16 GB 1328x1328 (multi-aspect) slow Flagship 2025 open model; exceptional in-image text rendering (EN + CJK)
Apache-2.0 - full commercial use. 20B parameters; released 2025-08-04 (HF card). Large: fp16/bf16 ~40 GB; GGUF / quantized community builds run ~16-24 GB. Native 1:1 at 1328x1328 plus multiple aspect ratios. Best-in-class text-in-image among open models. source
KolorsKuaishou (Kwai-Kolors) restreintApache-2.0 (commercial use requires vendor registration) unverified (SDXL-family U-Net + GLM text encoder; not stated on card)U-Net latent diffusion + ChatGLM3 text encoder 12 GB / 6 GB 1024x1024 medium Strong bilingual (EN/CN) photorealism; SDXL-compatible tooling
Weights are Apache-2.0, BUT the model card requires COMMERCIAL users to REGISTER via a questionnaire emailed to the vendor - treat commercial use as conditional. SDXL-family U-Net with a large GLM-based text encoder (raises VRAM vs plain SDXL). Exact parameter count is not stated on the card (marked unverified). source
PixArt-Sigma XL 1024-MSPixArt-alpha (Huawei Noah's Ark Lab) restreintCreativeML Open RAIL++-M 0.6B DiTDiffusion transformer (DiT) + T5-XXL text encoder 9 GB / 4 GB 1024x1024 (to 4K) medium Tiny 0.6B transformer; efficient 1024->4K; weak-hardware-friendly with text-encoder offload
0.6B DiT - the transformer itself is tiny; practical VRAM is dominated by the T5-XXL text encoder (~9.5 GB fp16, ~4 GB fp8/offloaded). Open RAIL++-M: commercial OK with use-based restrictions. Successor to PixArt-alpha. source
Playground v2.5Playground AI restreintPlayground v2.5 Community License 2.6B U-Net (SDXL-based; card lists ~3B)U-Net latent diffusion (SDXL architecture) 8 GB / 6 GB 1024x1024 medium SDXL-compatible weights with improved color and aesthetics
SDXL-architecture U-Net with dual CLIP text encoders (HF card: 'Based on Stable Diffusion XL'). Playground v2.5 Community License permits commercial use with conditions (attribution + acceptable-use terms) - review the license text before commercial deployment. Same VRAM profile as SDXL. source
Stable Diffusion 1.5Runway ML / CompVis restreintCreativeML OpenRAIL-M 0.9B U-NetU-Net latent diffusion 4 GB / 2 GB 512x512 fast Lightweight base for fine-tunes / LoRAs; the largest community ecosystem; runs on almost any GPU
0.9B U-Net, 512px native (HF card). OpenRAIL-M permits commercial use but imposes use-based (behavioral) restrictions - read the license. Practical VRAM ~4 GB fp16 (2 GB with low-VRAM/quantized). source
Stable Diffusion 3.5 LargeStability AI restreintStability AI Community License 8B MMDiTMMDiT (multimodal diffusion transformer) 18 GB / 10 GB 1024x1024 (up to 1 MP) slow Highest-quality open Stability model; prompt adherence and typography
8B MMDiT (HF card). Community License: free for commercial use for orgs/individuals under US$1M annual revenue; above that requires a Stability Enterprise License. T5-XXL text encoder drives VRAM; fp8 / GGUF builds run ~10-12 GB. source
Stable Diffusion 3.5 MediumStability AI restreintStability AI Community License 2.5B MMDiT-XMMDiT-X (improved multimodal diffusion transformer) 10 GB / 6 GB 1024x1024 (trained to 1440) medium Consumer-GPU SD3.5; near-Large quality at lower VRAM
2.5B MMDiT-X (HF card metadata rounds to ~2B). Community License (< US$1M revenue commercial-free; Enterprise License above). Stability designed it to run on consumer GPUs (~9.9 GB); multi-resolution training 256-1440px. source
Stable Diffusion XL 1.0 (base + refiner)Stability AI restreintCreativeML Open RAIL++-M 2.6B U-Net (~3.5B total pipeline)U-Net latent diffusion (dual text encoders) 8 GB / 6 GB 1024x1024 medium 1024px workhorse; strong quality-per-VRAM; refiner adds detail; huge tooling ecosystem
U-Net is 2.6B params (SDXL paper); full pipeline incl. the two text encoders + VAE is ~3.5B (HF card lists '3B params'). fp16 base ~8 GB min (12 GB comfortable); base+refiner ~12-16 GB; fp8 ~6 GB. Open RAIL++-M: commercial OK with use-based restrictions. source
FLUX.1 [dev]Black Forest Labs non commercialFLUX.1 [dev] Non-Commercial License 12BRectified-flow transformer (DiT) 24 GB / 8 GB 1024x1024 (multi-aspect) slow Best-in-class open image quality for personal / research (guidance-distilled, ~20-50 steps)
NON-COMMERCIAL model license - the weights may NOT be used in a commercial product/service (generated OUTPUTS may be used commercially per the license). 12B rectified-flow transformer, ~20-50 steps. Same VRAM as schnell: fp16 ~24 GB, fp8 ~12 GB, GGUF Q4 ~8 GB. FLUX.1 [pro] is API-only (closed weights) and is therefore EXCLUDED from this self-hostable table. source
Sana 1.6B (1024px)NVIDIA + MIT HAN Lab non commercialNVIDIA Source Code License-NC (NSCL v2) + Gemma terms 1.6B (1,648M) linear DiTLinear diffusion transformer + DC-AE (32x latent) + Gemma-2 2B text encoder 9 GB / 5 GB 1024x1024 (to 4K) fast Very fast / efficient (linear attention, 32x compression); research only
NON-COMMERCIAL: NVIDIA NSCL v2 governs, research purposes only; the Gemma-2-2B text encoder carries Google Gemma terms. 1.6B linear DiT is unusually efficient - 1024px on modest GPUs, up to 4096px. Few-step sampling. source
Stable Cascade (Wuerstchen v3)Stability AI non commercialStable Cascade Non-Commercial Community License (stable-cascade-nc-community) Stage C 3.6B (+ Stage B 1.5B, Stage A 20M)Wuerstchen 3-stage cascade (42x-compressed latent) 16 GB / 8 GB 1024x1024 slow Research / personal only; very efficient 42:1 latent compression
NON-COMMERCIAL: 'stable-cascade-nc-community' license (the 'nc' is explicit on the HF card). Three stages A/B/C; Stage C ships as 1B or 3.6B. High latent compression = fast train/inference, but licensed for research/personal use only. source

Données ouvertes (CC BY 4.0) : CSV · JSON · API: /wp-json/dc/v1/image-gen-models

Données conservées en anglais (source unique), vérifiées le 2026-07-26. Les noms de modèles, licences, spécifications et chiffres de VRAM ne sont pas traduits afin de rester fidèles aux fiches de modèles d'origine.

La génération d’images n’est qu’une modalité d’une pile d’IA souveraine et auto-hébergée qui n’envoie jamais vos données vers un nuage américain. Ce jeu de données ouvert (CC BY 4.0) est téléchargeable en CSV et JSON, et fait partie du catalogue de données ouvertes de D-Central.