Formatos de cuantización de LLM: GGUF, AWQ, GPTQ, FP8 y NF4
Traducción automática Este artículo se tradujo automáticamente a partir de la versión original en inglés.
GGUF, AWQ, GPTQ, FP8 y NF4 no son cinco formatos de archivo intercambiables. GGUF es un formato de contenedor y metadatos que se usa habitualmente con llama.cpp. AWQ y GPTQ son métodos de post-training quantization. FP8 es un formato numérico utilizado por aceleradores y serving kernels compatibles. NF4 es un tipo de dato de cuatro bits diseñado para pesos con distribución normal, y se usa habitualmente en training con QLoRA.
Elige primero el runtime y el hardware. Después, selecciona una representación compatible con el runtime fijado para esa arquitectura concreta. Haz benchmark de la calidad de las tareas, la memoria, el tiempo hasta el primer token, el throughput y la concurrencia antes de aceptar el artifact de menor tamaño.
Última revisión: 10-08-2026. La comparación prioriza la compatibilidad del runtime, los kernels del hardware, training frente a serving, la procedencia del artifact, la memoria, la latencia y la pérdida de calidad medida.
Tabla de decisión
| Objetivo | Mejor punto de partida | Comprobaciones previas |
|---|---|---|
| Inferencia local con CPU, Metal o llama.cpp portable | GGUF con una cuantización documentada | Compatibilidad de la arquitectura, chat template, comportamiento del contexto, receta de cuantización y revisión del código fuente. |
| Inferencia en GPU con cuantización calibrada de pesos | AWQ o GPTQ | El serving engine, la GPU, el número de bits, el group size, los kernels y la arquitectura del modelo. |
| Serving en GPU de centro de datos compatible | FP8 | Compatibilidad del hardware, implementación del runtime, modo de calibración y calidad end-to-end. |
| Training eficiente en parámetros con pesos congelados de 4 bits | NF4 mediante bitsandbytes | Compute dtype, nested quantization, memoria del optimizador y artifact final fusionado o del adaptador. |
| Prototipo más sencillo con Transformers | bitsandbytes de 8 o 4 bits | Compatibilidad del backend y si el flujo del prototipo coincide con el servidor de producción. |
GGUF no especifica una única cuantización
Una extensión .gguf indica cómo se empaquetan los tensores y los metadatos, no la precisión de todos los tensores. Nombres como Q4_K_M identifican recetas de cuantización de llama.cpp, y esas recetas pueden tratar los grupos de tensores de forma diferente. Registra el checkpoint original, la revisión de la conversión, el comando de cuantización, la matriz de importancia si se ha utilizado y los hashes.
AWQ y GPTQ necesitan un serving path compatible
Los artifacts de AWQ y GPTQ suelen utilizar Safetensors junto con una configuración específica del método. Un modelo puede descargarse correctamente y, aun así, hacer fallback a un kernel lento o fallar con una arquitectura no compatible. Comprueba la matriz de compatibilidad actual de Transformers, vLLM o de la versión real del servidor antes de seleccionar el artifact.
FP8 y NF4 resuelven problemas distintos
FP8 resulta atractivo cuando el acelerador y el stack de serving lo implementan de forma eficiente. NF4 se asocia principalmente al training de adaptadores con un uso eficiente de la memoria mediante flujos de trabajo de estilo QLoRA. Ninguna de las dos etiquetas garantiza la misma calidad, velocidad o uso de memoria en todos los modelos y configuraciones de hardware.
Lista de comprobación de evaluación
- compara el mismo checkpoint de origen y el mismo conjunto de prompts
- incluye contextos largos y solicitudes concurrentes
- mide la corrección del schema y de los tool calls junto con la perplexity
- registra la memoria máxima del dispositivo y del host
- verifica el tiempo hasta el primer token y el throughput de salida
- examina slices de calidad poco frecuentes o de alto coste
- conserva con el artifact la licencia, la revisión del código fuente, el converter, la receta y el hash
Lecturas recomendadas
- Guía de cuantización de modelos explica los algoritmos, la calibración, los kernels y los compromisos de despliegue.
- Variantes de LLM con pesos abiertos distingue entre el papel del checkpoint, la arquitectura, el contenedor, la cuantización, el runtime y el hardware.
- LLMs locales en macOS aplica estas decisiones a Apple Silicon.