Ruta ampliada · Corrige la carrera por el tamaño: a cómputo fijo, los modelos de la época estaban infraentrenados en datos.
Nivel: L4 · Motor: scaling_laws · Notebook: P19_scaling_laws.ipynb
· Anexo: complejidad y coste
· Anexo matemático: complejidad, coste y escalado
| Campo | Valor |
|---|---|
| Título original | Training Compute-Optimal Large Language Models |
| Autoría | Jordan Hoffmann, Sebastian Borgeaud, Arthur Mensch y otros (DeepMind) |
| Año | 2022 |
| Venue | arXiv:2203.15556 · NeurIPS 2022 |
| Fuente primaria | arXiv:2203.15556 |
| Acceso | Abierto |
| Fecha de consulta | 2026-08-16 |
Tras GPT-3, la industria interpretó las leyes de escalado de Kaplan et
al. (2020) como una consigna simple: más parámetros. Los modelos de los dos años siguientes
crecieron un orden de magnitud en N mientras el número de tokens de entrenamiento D se
mantenía prácticamente igual.
La pregunta que nadie había resuelto bien es distinta y más útil: dado un presupuesto fijo de cómputo, ¿cuánto conviene gastar en parámetros y cuánto en datos? Sin esa respuesta, cada laboratorio elegía por intuición y por marketing.
Medirlo. Los autores entrenan cientos de modelos variando N y D a lo largo de un rango
amplio de presupuestos, ajustan una forma paramétrica a la pérdida y resuelven el problema de
optimización con restricción de cómputo.
La conclusión: para minimizar la pérdida a cómputo fijo, N y D deben escalarse
aproximadamente en la misma proporción. Los modelos grandes de la época habían gastado
demasiado en parámetros y demasiado poco en tokens.
Y lo demuestran con la prueba más contundente posible: entrenan un modelo considerablemente más pequeño con muchos más tokens, al mismo cómputo, y supera a los grandes.
Un presupuesto fijo para montar una biblioteca: puedes comprar muchas estanterías y pocos libros, o pocas estanterías y muchos libros. Ninguno de los dos extremos es óptimo, y durante años el sector compró estanterías.
Dónde deja de funcionar la analogía: las estanterías vacías no perjudican; los parámetros infraentrenados sí consumen cómputo de entrenamiento y de inferencia para siempre.
Forma paramétrica ajustada empíricamente:
L(N, D) = E + A/N^α + B/D^β
E = error irreducible (la entropía del propio lenguaje)
A/N^α = lo que se compra con parámetros
B/D^β = lo que se compra con datos
Restricción de presupuesto (aproximación estándar de FLOPs de entrenamiento):
C ≈ 6·N·D
Problema: minimizar L(N, D) sujeto a 6ND = C
Sustituyendo D = C/(6N) y derivando respecto de N, la condición de óptimo iguala las
contribuciones marginales de ambos términos. El resultado es una razón óptima de tokens por
parámetro que depende de α y β, no del presupuesto.
Los valores ajustados de
E,A,B,αyβestán en el artículo. El motor de este eje usa constantes didácticas para que la curva tenga la forma correcta: la forma es lo transferible, los números concretos hay que leerlos en la fuente.
Tip
Puente matemático. Esta sección da por sabido lo siguiente. Si algo no te suena, léelo primero: está explicado una sola vez, en un solo sitio, y sirve para todas las fichas.
| Dónde | Qué necesitas de ahí |
|---|---|
| A05 §4 · FLOPs de entrenamiento: la regla de 6ND | la regla de 6ND: el presupuesto de cómputo que se reparte |
| A05 §5 · Escalado: dónde gastar el presupuesto | dónde gastarlo, que es exactamente la pregunta del paper |
flowchart TD
C["💰 presupuesto fijo<br/>C ≈ 6ND FLOPs"] --> S{"¿cómo se reparte?"}
S -->|"N grande, D pequeño"| A["🏗️ modelo enorme<br/>infraentrenado"]
S -->|"N y D equilibrados"| B["✅ cómputo óptimo"]
S -->|"N pequeño, D enorme"| D["📚 modelo pequeño<br/>saturado"]
A --> LA["pérdida alta"]
B --> LB["pérdida MÍNIMA"]
D --> LD["pérdida alta"]
LB --> INF["⚠️ pero el óptimo de ENTRENAMIENTO<br/>no es el óptimo de INFERENCIA"]
- Los tres enfoques independientes con los que estiman el óptimo. Que tres métodos distintos converjan es lo que hace creíble el resultado: no es un ajuste afortunado.
- El experimento de validación: entrenar el modelo predicho como óptimo y comprobar que supera a los mayores de la época al mismo cómputo.
- La discusión sobre disponibilidad de datos: si
Ddebe crecer conN, el cuello de botella se desplaza al corpus. Ese punto envejeció muy bien. - Las limitaciones que los autores declaran: rango de ajuste, arquitectura concreta, y que la ley describe pérdida de preentrenamiento, no capacidad en tareas.
Cientos de modelos entrenados en un rango amplio de presupuestos, tres estimaciones independientes del exponente óptimo, y una validación empírica entrenando el modelo predicho.
Los tamaños concretos, la razón óptima de tokens por parámetro y los resultados por benchmark están en las tablas del artículo. Verificarlos allí: es un paper donde los números concretos se citan mal con mucha frecuencia.
La miniatura de este eje reproduce el razonamiento, no los valores: a cómputo idéntico, la
mejor y la peor asignación difieren claramente en pérdida, y al duplicar el presupuesto crecen
N y D a la vez.
- Reorientó la industria: los modelos posteriores se entrenan con muchos más tokens por parámetro que antes de 2022.
- Convirtió los datos en el recurso escaso y disparó el trabajo sobre curación, filtrado, repetición controlada de épocas y datos sintéticos.
- Introdujo en la práctica la distinción entre óptimo de entrenamiento y óptimo de despliegue: si un modelo se sirve a millones de peticiones, conviene entrenar uno más pequeño por debajo del óptimo de Chinchilla y darle aún más datos.
- Es un ejemplo de manual de cómo una medición cuidadosa refuta una intuición dominante.
- Describe pérdida de preentrenamiento, no capacidad, utilidad ni seguridad.
- Rango de ajuste acotado: extrapolar varios órdenes de magnitud fuera de él no está justificado por el paper.
- Ignora el coste de inferencia, que hoy suele dominar el coste total del ciclo de vida.
C ≈ 6NDes una aproximación que depende de la arquitectura y del régimen.- Supone datos abundantes y de calidad uniforme: repetir épocas o mezclar calidades cambia la ecuación.
- No cubre arquitecturas dispersas: un modelo de mezcla de expertos tiene una relación distinta entre parámetros y cómputo.
| Error | Corrección |
|---|---|
| «Chinchilla dice que 20 tokens por parámetro es la regla» | Es una razón derivada de exponentes ajustados en un rango concreto y con una arquitectura concreta. Citarla como constante universal es sobregeneralizar. |
| «Menor pérdida = mejor modelo para mi tarea» | La ley predice pérdida de preentrenamiento. La utilidad en tu tarea es otra medición. |
| «El óptimo de entrenamiento es el modelo que hay que desplegar» | Si vas a servir mucho, conviene un modelo más pequeño y más entrenado. |
| «Kaplan se equivocó» | Kaplan et al. midieron algo real con un protocolo distinto. Chinchilla corrige el reparto óptimo, no invalida el marco. |
| «Ya no hace falta escalar parámetros» | Hace falta escalar ambos. El resultado es sobre el reparto, no sobre parar. |
- P10 GPT-3 (2020) — el modelo cuyo régimen de entrenamiento se cuestiona.
- Kaplan et al. (2020) — las leyes de escalado que este trabajo corrige. arXiv:2001.08361
- P08 Transformer (2017) — la arquitectura sobre la que se mide.
- P21 Mixtral (2024) — cambia la relación entre capacidad y cómputo, y por tanto la forma del problema.
- P22 DeepSeek-R1 (2025) — mueve el cómputo al momento de la inferencia, una variable que esta ley no modela.
- Snell et al. (2024) — escalar cómputo en inferencia puede rendir más que escalar parámetros. arXiv:2408.03314
- Trabajo sobre calidad y repetición de datos (2023+) — la consecuencia directa de volver escaso el corpus.
Qué implementa: la forma paramétrica, la comparación de asignaciones a cómputo idéntico, el desplazamiento del óptimo al crecer el presupuesto y una comparación entre coste de entrenamiento y de inferencia.
Qué NO implementa: ningún entrenamiento. Y sus constantes son didácticas, no las ajustadas en el paper — el notebook lo declara en su salida.
ai-evolution paper-lab P19 --seed 7| Nivel | Actividad |
|---|---|
| Recordar | Escribe L(N, D) y explica qué representa cada término. |
| Explicar | Explica por qué E no se puede reducir con más cómputo. |
| Aplicar | Con la restricción 6ND = C, calcula la pérdida de tres asignaciones y ordénalas. |
| Analizar | Deriva la condición de óptimo sustituyendo D = C/(6N) y anulando la derivada. |
| Evaluar | Un equipo cita «20 tokens por parámetro» como ley universal. Formula dos objeciones. |
| Crear | Extiende el análisis añadiendo un término de coste de inferencia y resuelve el nuevo óptimo. |
- ¿Qué se mantiene constante al comparar asignaciones, y por qué es imprescindible?
- ¿Qué significa
Ey por qué no baja al escalar? - ¿Por qué tres métodos independientes hacen más creíble el resultado?
- ¿Qué recurso pasa a ser escaso como consecuencia de este paper?
- ¿Por qué el óptimo de entrenamiento no es el óptimo de despliegue?
- ¿Qué no predice esta ley?
- ¿Por qué una arquitectura dispersa rompe la forma del problema?
- El cómputo
C. Sin fijarlo, comparar modelos es comparar presupuestos, no decisiones de diseño. - El error irreducible: la incertidumbre intrínseca del lenguaje. Ningún modelo puede predecir
perfectamente el siguiente token, y
Ees esa cota. - Porque reduce la probabilidad de que el resultado sea un artefacto del método de ajuste. La convergencia de estimaciones independientes es evidencia; un solo ajuste es una hipótesis.
- Los datos. Si
Ddebe crecer conN, el corpus de calidad se vuelve el cuello de botella. - Porque el coste de inferencia es proporcional a
Ny se paga en cada petición, mientras que el de entrenamiento se paga una vez. Con volumen alto, conviene un modelo menor. - Capacidades concretas, utilidad, seguridad, comportamiento fuera de distribución, ni el resultado en tareas específicas.
- Porque en un modelo disperso los parámetros totales y el cómputo por token dejan de ser
proporcionales:
C ≈ 6NDya no se sostiene con la mismaN.
- Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. NeurIPS 2022. arXiv:2203.15556 · consultado 2026-08-16.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361 · consultado 2026-08-16.
- Snell, C., Lee, J., Xu, K. y Kumar, A. (2024). Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. arXiv:2408.03314 · consultado 2026-08-16.
⬅️ Anterior: P18 CLIP · 📇 Índice · 📝 Evaluación · 🏫 Clase 074 · Objetivos de preentrenamiento · ➡️ Siguiente: P20 Mamba