Passer au contenu

Bitcoin accepté au paiement  |  Expédié depuis Montréal, QC, Canada  |  Soutien expert depuis 2016

Référence de qualité de quantification GGUF

Quel quant GGUF devriez-vous utiliser ? La quantification GGUF réduit un LLM local en stockant chaque poids sur moins de bits — le compromis est la taille de fichier et la VRAM contre la qualité. Cette référence liste chaque type de quant GGUF par son nombre exact de bits par poids, sa famille de quant et un palier de qualité, afin que vous en choisissiez un qui à la fois tient dans votre VRAM et reste précis. CSV/JSON gratuits + API REST sous CC BY 4.0. Les données restent en anglais (source unique), fidèles aux descriptions du HuggingFace Hub et de llama.cpp.

Réponse rapide

La quantification GGUF réduit un LLM local en stockant chaque poids sur moins de bits — le compromis est la taille de fichier et la VRAM contre la qualité de sortie. Cette référence liste 19 types de quant GGUF selon leur nombre exact de bits par poids, leur famille (flottants pleine précision, K-quants, I-quants à matrice d'importance et anciens types « round-to-nearest ») et un palier de qualité, afin que vous choisissiez un quant qui À LA FOIS tient dans votre VRAM et reste précis. Règle générale : Q4_K_M (~4,8 bpw) est le choix par défaut recommandé ; utilisez Q5_K_M ou Q6_K quand vous avez de la VRAM à revendre ; Q8_0 est pratiquement sans perte ; et sous ~3 bpw, préférez les I-quants à matrice d'importance, seulement sur de grands modèles.

Q4_K_M est le juste milieu pour la plupart des modèles locaux. Sous ~3 bpw, les I-quants à matrice d'importance (IQ3 / IQ2) conservent plus de qualité par bit et sont à réserver aux grands modèles ; Q6_K et Q8_0 sont quasi sans perte quand la VRAM le permet. Combinez ceci aux données GPU/modèle de VRAM de D-Central pour confirmer qu'un quant à la fois TIENT et reste précis.

Télécharger le CSV Télécharger le JSON API REST →

Type de quantFamilleBits/poidsQualitéNotes
F32Floating point32ReferenceFull single precision; the unquantized training baseline. Rarely used for local inference (huge files).
F16Floating point16ReferenceHalf precision; the near-lossless inference baseline that quants are measured against.
BF16Floating point16ReferenceBrain-float 16; same size as F16 with a wider exponent range; a common training/inference format.
Q8_0Legacy8.5Near-lossless8-bit round-to-nearest; virtually indistinguishable from F16. Large files; a safe maximum-quality quant.
Q6_KK-quant6.5625Excellent6-bit K-quant; near-indistinguishable from F16 in most evaluations. The top choice when VRAM allows.
Q5_KK-quant5.5Very goodBase 5-bit K-quant. Q5_K_M (a Q5_K/Q6_K tensor mix) is a high-quality pick for modest extra size.
Q4_KK-quant4.5GoodBase 4-bit K-quant. Q4_K_M (a Q4_K/Q6_K mix, ~4.8 bpw effective) is the recommended default for most local models.
Q4_0Legacy4.5MediumLegacy round-to-nearest 4-bit; superseded by Q4_K_M, which is higher quality at similar size.
IQ4_XSI-quant4.25GoodImportance-matrix 4-bit; excellent quality-per-bit, often matching Q4_K_S at a smaller size. Slower on some CPUs.
IQ4_NLI-quant4.25GoodImportance-matrix 4-bit non-linear; similar size to IQ4_XS, tuned for non-linear weight distributions.
IQ3_SI-quant3.44MediumImportance-matrix 3-bit; better quality-per-bit than Q3_K at a comparable size.
Q3_KK-quant3.4375Medium-lowBase 3-bit K-quant (Q3_K_S/M/L are tensor mixes around this). Visible quality loss on smaller models.
IQ3_XXSI-quant3.06Low-mediumImportance-matrix 3-bit, very small; best reserved for larger models.
Q2_KK-quant2.625LowSmallest K-quant; noticeable quality loss. Use only for tight VRAM on large (30B+) models.
IQ2_SI-quant2.5LowImportance-matrix 2-bit; preserves more quality per bit than Q2_K. Large models only.
IQ2_XSI-quant2.31Very lowImportance-matrix 2-bit, extra small; viable only on very large models.
IQ2_XXSI-quant2.06Very lowImportance-matrix 2-bit, smallest practical 2-bit; large models only, with real quality loss.
IQ1_MI-quant1.75LowestImportance-matrix 1-bit; extreme compression, only usable on the largest (70B+) models.
IQ1_SI-quant1.56LowestImportance-matrix 1-bit, smallest; experimental, heavy quality loss, 70B+ only.

Cette page couvre les types de quant à l'intérieur d'un fichier GGUF. Pour la couche au-dessus — GGUF face à MLX, EXL3, GPTQ, AWQ, FP8 et bitsandbytes, et lequel votre matériel veut réellement — voir la comparaison des formats de quantification. Source : les descriptions des types de quantification GGUF dans la documentation du HuggingFace Hub et les descriptions de quant de llama.cpp. Glossaire connexe : quantification, GGUF, perplexité. Outils : compatibilité VRAM GPU/modèle, calculateur de VRAM, base de données de modèles LLM locaux, calculateur de coût d'inférence.

Ce jeu de données ouvert (CC BY 4.0) fait partie du catalogue de données ouvertes de D-Central. Règle générale : Q4_K_M est le juste milieu ; sous ~3 bpw, préférez les I-quants à matrice d’importance sur de grands modèles.