Formats de quantification des LLM : GGUF, AWQ, GPTQ, FP8 et NF4

Traduction automatique Cet article a été traduit automatiquement depuis la version originale en anglais.

GGUF, AWQ, GPTQ, FP8 et NF4 ne sont pas cinq formats de fichiers interchangeables. GGUF est un conteneur de modèle et un format de métadonnées couramment utilisé par llama.cpp. AWQ et GPTQ sont des méthodes de quantification post-entraînement. FP8 est un format numérique pris en charge par certains accélérateurs et kernels de serving. NF4 est un type de données sur quatre bits conçu pour des poids suivant une distribution normale, et couramment utilisé pour l’entraînement QLoRA.

Choisissez d’abord le runtime et le matériel. Sélectionnez ensuite une représentation prise en charge par le runtime ciblé pour l’architecture exacte. Mesurez la qualité sur les tâches, la mémoire, le time to first token, le débit et la concurrence avant d’accepter l’artefact de plus petite taille.

Dernière révision : 2026-08-10. La comparaison privilégie la compatibilité avec le runtime, les kernels matériels, l’entraînement par rapport au serving, la provenance de l’artefact, la mémoire, la latence et la perte de qualité mesurée.

Tableau de décision

ObjectifMeilleur point de départVérifications préalables
Inférence locale sur CPU, Metal ou llama.cpp portableGGUF avec une quantification documentéePrise en charge de l’architecture, chat template, comportement du contexte, recette de quantification et révision des sources.
Inférence sur GPU avec quantification calibrée des poidsAWQ ou GPTQMoteur de serving, GPU, largeur en bits, taille des groupes, kernels et architecture du modèle.
Serving sur GPU de centre de données pris en chargeFP8Capacités du matériel, implémentation du runtime, mode de calibration et qualité de bout en bout.
Entraînement parameter-efficient avec poids 4 bits gelésNF4 via bitsandbytesCompute dtype, quantification imbriquée, mémoire de l’optimizer et artefact final fusionné ou d’adaptation.
Prototype Transformers le plus simplebitsandbytes en 8 ou 4 bitsPrise en charge du backend et adéquation entre le chemin du prototype et le serveur de production.

GGUF ne définit pas une quantification unique

Une extension .gguf indique comment les tenseurs et les métadonnées sont empaquetés, et non la précision de chaque tenseur. Des noms tels que Q4_K_M identifient les recettes de quantification de llama.cpp, qui peuvent appliquer des traitements différents selon les groupes de tenseurs. Consignez le checkpoint d’origine, la révision de conversion, la commande de quantification, la matrice d’importance si elle est utilisée, ainsi que les hashes.

AWQ et GPTQ nécessitent un chemin de serving compatible

Les artefacts AWQ et GPTQ utilisent généralement Safetensors ainsi qu’une configuration propre à la méthode. Un modèle peut être téléchargé correctement tout en basculant vers un kernel lent, ou échouer sur une architecture non prise en charge. Consultez la matrice de compatibilité actuelle de Transformers, vLLM ou de la version effective du serveur avant de sélectionner l’artefact.

FP8 et NF4 répondent à des problèmes différents

FP8 est intéressant lorsque l’accélérateur et la pile de serving l’implémentent efficacement. NF4 est principalement associé à l’entraînement d’adapters économe en mémoire via des workflows de type QLoRA. Aucun de ces labels ne garantit la même qualité, la même vitesse ou la même consommation mémoire selon les modèles et le matériel.

Checklist d’évaluation

  • comparez le même checkpoint source et le même jeu de prompts
  • incluez les contextes longs et les requêtes concurrentes
  • mesurez la correction du schema et des tool calls en plus de la perplexité
  • consignez la mémoire maximale du device et de l’hôte
  • vérifiez le time to first token et le débit de génération
  • examinez les segments de qualité rares ou coûteux
  • conservez avec l’artefact la licence, la révision des sources, le convertisseur, la recette et le hash

Pour approfondir

Références