Eficiencia y reducción de coste
Los modelos generativos actuales pueden contener miles de millones de parámetros. Entrenarlos, adaptarlos y servirlos requiere memoria para almacenar sus pesos y activaciones, capacidad de cómputo para realizar las operaciones y, en muchos casos, una infraestructura especializada.
No existe una única forma de reducir este coste. En este capítulo veremos tres estrategias complementarias:
- Destilación: entrenar un modelo más pequeño para que reproduzca el comportamiento de otro más capaz.
- LoRA: adaptar un modelo preentrenado actualizando solo un pequeño número de parámetros.
- Cuantización: representar pesos y, en algunos casos, activaciones con menos bits.
Destilación del conocimiento

La destilación del conocimiento (knowledge distillation)[hinton2015distilling] es una técnica de compresión en la que un modelo grande, el profesor (teacher), supervisa el entrenamiento de un modelo más pequeño, el estudiante (student).
El objetivo es aproximar la función que ha aprendido el profesor. Si la transferencia funciona, el estudiante conserva una parte importante de su calidad con menos memoria, menor latencia y un coste de inferencia inferior. Esta compensación resulta útil para desplegar modelos en móviles, dispositivos edge o servicios con muchas peticiones.
Etiquetas duras y objetivos suaves
En un problema de clasificación convencional, una etiqueta dura (hard label) indica únicamente la clase correcta. Para la imagen de un gato, por ejemplo, el vector objetivo podría ser:
para las clases gato, leopardo y perro. En cambio, el profesor puede producir una distribución como . Estas probabilidades contienen información adicional: muestran que, para el profesor, un gato se parece más a un leopardo que a un perro. Hinton et al. denominan a estas relaciones entre clases conocimiento oscuro (dark knowledge).
Los objetivos suaves (soft targets) se obtienen aplicando softmax a los logits (salidas sin normalizar del modelo) con una temperatura :
Cuando se obtiene el softmax habitual. Una temperatura mayor aplana la distribución y hace visibles las probabilidades pequeñas, exponiendo mejor las similitudes aprendidas por el profesor.
Función de pérdida
Sean y las distribuciones suavizadas del profesor y del estudiante. Una formulación habitual combina dos objetivos:
- La pérdida de destilación fuerza al estudiante a aproximar la distribución del profesor. Puede expresarse mediante divergencia de Kullback–Leibler o entropía cruzada.
- La pérdida supervisada compara la predicción del estudiante con la etiqueta real .
El hiperparámetro controla el peso relativo de ambos términos. El factor compensa el cambio de escala de los gradientes producido por la temperatura. No es imprescindible disponer siempre de etiquetas humanas: también se pueden usar datos no etiquetados o ejemplos sintéticos y entrenar únicamente con la supervisión del profesor.
Destilación en modelos generativos
En un LLM se puede destilar conocimiento a distintos niveles:
- Logits: el estudiante aproxima la distribución de probabilidad del siguiente token. Este enfoque requiere poder consultar las salidas del profesor y alinear adecuadamente los vocabularios.
- Secuencias: el profesor genera respuestas que se convierten en datos de entrenamiento para el estudiante. Es especialmente práctico cuando solo se tiene acceso a texto generado.
- Representaciones intermedias: además de la salida, se alinean estados ocultos o mapas de atención cuando las arquitecturas lo permiten.

Este es un ejemplo de destilación a nivel de secuencia: DeepSeek-R1 genera y filtra soluciones, y modelos más pequeños basados en Qwen y Llama aprenden de esas muestras. No están copiando directamente sus logits.
La destilación tiene un coste inicial, hay que ejecutar el profesor y entrenar el estudiante, y puede transmitir sus errores o sesgos. Su utilidad depende de que el ahorro acumulado durante el despliegue compense ese coste y de que la pérdida de calidad sea aceptable.
Low-Rank Adaptation (LoRA)
Low-Rank Adaptation (LoRA)[hu2021lora] es un método de ajuste eficiente en parámetros o PEFT (Parameter-Efficient Fine-Tuning). Permite adaptar un modelo preentrenado sin actualizar todos sus pesos.
En un fine-tuning completo, cada matriz de pesos se modifica mediante una actualización :
Si , entrenar requiere hasta parámetros. LoRA congela y parametriza la actualización como el producto de dos matrices estrechas:
El rango se elige mucho menor que y . En lugar de entrenar valores, solo se entrenan . La hipótesis es que la adaptación necesaria para una tarea vive en un subespacio de dimensión baja.

Durante el paso hacia delante se calcula:
El factor regula la magnitud de la actualización. Habitualmente una de las dos matrices se inicializa a cero, de modo que al comenzar el entrenamiento y el modelo se comporta exactamente como el modelo base.
Ejemplo. Para una matriz cuadrada de tamaño , el fine-tuning completo actualizaría parámetros. Con , LoRA entrena:
Esto representa aproximadamente el de los parámetros de esa matriz. En un Transformer, LoRA suele aplicarse a las proyecciones de atención (query, key, value y output) y, según el presupuesto, también a las capas feed-forward.
Ventajas y limitaciones
- Menos memoria de entrenamiento: se almacenan gradientes y estados del optimizador solo para los adaptadores.
- Artefactos pequeños: para cada tarea se guarda únicamente un adaptador en lugar de una copia completa del modelo.
- Composición y despliegue: se pueden intercambiar adaptadores o fusionar con para evitar operaciones adicionales durante la inferencia.
- Capacidad limitada: un rango demasiado pequeño puede no capturar una adaptación compleja; aumentar mejora la capacidad, pero también el coste y el riesgo de sobreajuste.
Una combinación popular es QLoRA[dettmers2023qlora]: mantiene congelado y cuantizado el modelo base, por ejemplo, a 4 bits, y propaga el gradiente hasta adaptadores LoRA de mayor precisión. Así reduce tanto la memoria del modelo base como la asociada al entrenamiento.
Cuantización
La cuantización aproxima valores continuos de alta precisión mediante un conjunto finito de niveles. En redes neuronales se aplica a los pesos y, opcionalmente, a las activaciones o a la caché KV. Por ejemplo, se pueden representar pesos almacenados en float32 o float16 mediante enteros de 8 o 4 bits.
Reducir el número de bits disminuye el tamaño del modelo y el ancho de banda necesario para mover sus pesos. También puede acelerar las multiplicaciones de matrices y reducir el consumo energético, pero solo si el hardware y los kernels disponibles ejecutan eficientemente ese formato.

Escala y punto cero
En una cuantización afín uniforme, un valor real se transforma en un entero mediante una escala y un punto cero :
Para utilizarlo se reconstruye una aproximación del valor original:
La operación de redondeo hace que no sea exactamente igual a : esa diferencia es el error de cuantización. Elegir bien la escala y la granularidad permite reducirlo:
- Por tensor: todos los valores de un tensor comparten la misma escala. Es sencillo, pero sensible a valores atípicos.
- Por canal: cada canal tiene su propia escala y suele conservar mejor la precisión.
- Por grupo: los pesos se dividen en grupos pequeños, una opción frecuente en LLMs cuantizados a 4 bits.
¿Qué parte del modelo se cuantiza?
- Solo pesos (weight-only): reduce considerablemente la memoria y es común en LLMs. Las activaciones se mantienen en una precisión superior.
- Pesos y activaciones: puede acelerar más el cálculo, pero las activaciones son más difíciles de cuantizar porque cambian con cada entrada y pueden contener valores atípicos.
- Caché KV: en modelos autorregresivos con contextos largos, cuantizar la caché reduce la memoria que crece con el número de tokens procesados.
El ahorro teórico de almacenamiento es fácil de estimar. Para un modelo de 7 mil millones de parámetros, sin contar metadatos, escalas ni otros buffers:
| Formato de los pesos | Memoria aproximada |
|---|---|
float32 (32 bits) | 28 GB |
float16 / bfloat16 (16 bits) | 14 GB |
int8 (8 bits) | 7 GB |
| 4 bits | 3.5 GB |
PTQ y QAT
Hay dos momentos principales en los que se puede introducir la cuantización:
- Post-Training Quantization (PTQ): se cuantiza un modelo ya entrenado. Es rápida y puede requerir solo un pequeño conjunto de calibración para estimar escalas. Métodos como GPTQ[frantar2022gptq] corrigen parte del error al cuantizar LLMs peso a peso o por bloques.
- Quantization-Aware Training (QAT): durante el entrenamiento se simulan las operaciones de cuantización para que el modelo aprenda a tolerar el error[jacob2017quantization]. Suele preservar mejor la calidad a precisiones agresivas, pero requiere reentrenamiento.
Cuantizar siempre introduce una compensación entre tamaño, velocidad y calidad. Las capas no tienen la misma sensibilidad y, en ocasiones, conviene mantener algunas en mayor precisión. Además, un modelo cuatro veces más pequeño no será necesariamente cuatro veces más rápido: la latencia puede estar dominada por la generación secuencial, la transferencia de datos o la falta de soporte nativo para el formato elegido.
Cómo elegir una técnica
| Objetivo principal | Técnica | Qué se reduce | Principal contrapartida |
|---|---|---|---|
| Crear un modelo pequeño para servir muchas veces | Destilación | Parámetros y cómputo de inferencia | Entrenar un estudiante y asumir cierta pérdida de calidad |
| Adaptar un modelo con poco presupuesto | LoRA | Parámetros entrenables y estados del optimizador | El modelo base sigue siendo necesario |
| Cargar o ejecutar un modelo con menos memoria | Cuantización | Bits por peso y, opcionalmente, por activación | Error numérico y dependencia del hardware |
| Adaptar un modelo que apenas cabe en memoria | QLoRA | Memoria del modelo base y del fine-tuning | Entrenamiento más complejo y operaciones de cuantización |
Estas técnicas se pueden encadenar. Por ejemplo, se puede destilar un modelo grande, adaptar el estudiante con LoRA y cuantizar el resultado para desplegarlo. La configuración adecuada no se decide solo por el número de parámetros: debe evaluarse con métricas de calidad, memoria máxima, latencia, rendimiento por lote, energía y coste total.
No son las únicas estrategias posibles. La poda y la esparsidad eliminan pesos o conexiones; las arquitecturas eficientes reducen las operaciones necesarias; y, durante el despliegue, técnicas como el batching, el caching o la decodificación especulativa mejoran el uso del hardware. Sin embargo, destilación, LoRA y cuantización actúan sobre partes distintas del problema y forman una buena base para entender la eficiencia de los modelos generativos.