Modelos Fundacionales

En el capítulo anterior vimos cómo se puede entrenar un Transformer de forma autorregresiva. Dada una secuencia de tokens, el modelo aprende a predecir el siguiente. Esta es una forma de aprendizaje auto-supervisado. En este tipo de paradigma si entrenamos un modelo suficientemente expresivo con una tarea general y una colección amplia de datos, las representaciones que aprende pueden reutilizarse para resolver problemas que no estaban definidos explícitamente durante el entrenamiento.
Este cambio de perspectiva, de entrenar un modelo para cada tarea a preentrenar una base que pueda adaptarse a muchas tareas, es el origen de los modelos fundacionales.
Self-supervised learning
Imagina que queremos clasificar la opinión de una reseña como positiva o negativa. Tradicionalmente, lo que se hacía era construir un dataset de pares , donde es el texto e su etiqueta, y a partir de ahí entrenar un modelo para aproximar .
Imagina ahora que en lugar de clasificar en positivo/negativo queremos asignar entre una y cinco estrellas → habría que volver a re-etiquetar todos los datos. Cada problema necesitaría nuevas etiquetas y, habitualmente, un nuevo proceso de entrenamiento.
Esta estrategia funciona pero:
- Las etiquetas son costosas: requieren anotadores y criterios consistentes.
- El conocimiento queda fragmentado: cada modelo aprende solo aquello que necesita para resolver su tarea.
- La reutilización es limitada: un cambio en las categorías o en el dominio puede obligar a etiquetar datos y entrenar de nuevo.
El problema no es el aprendizaje supervisado en sí. Las etiquetas humanas siguen siendo imprescindibles. El problema es utilizar grandes cantidades de supervisión específica para aprender desde cero todo lo que cada tarea comparte con las demás.
El aprendizaje auto-supervisado tiene una historia anterior al entrenamiento moderno a escala, pero la disponibilidad de grandes colecciones de texto, imágenes, audio y vídeo aceleró su adopción. No significa entrenar sin señal de supervisión: los targets se construyen a partir de los propios datos en lugar de anotarse manualmente.
La transición no ocurrió de un día para otro ni eliminó el aprendizaje supervisado. Fue una acumulación de ideas:
- Modelos específicos: una arquitectura y un dataset etiquetado para cada tarea.
- Transfer learning: reutilizar características aprendidas en un problema grande.
- Preentrenamiento self-supervised: aprender la mayor parte de los parámetros con datos sin anotaciones manuales.
- Preentrenamiento a escala: aumentar conjuntamente la diversidad de los datos, la capacidad del modelo y la computación.
- Adaptación general: usar fine-tuning, prompting o aprendizaje en contexto para abordar muchas tareas desde una misma base.
En procesamiento del lenguaje, modelos como BERT[devlin2018bert] mostraron que un encoder preentrenado sobre texto sin etiquetar podía adaptarse con pocas modificaciones a numerosas tareas. Por otro lado, la familia GPT mostró que escalar decoders autoregresivos permitía reutilizar un mismo modelo mediante ejemplos o instrucciones escritas directamente en el contexto.
Qué es un modelo fundacional
El término foundation model se popularizó para describir modelos entrenados sobre datos amplios y a gran escala que pueden adaptarse a un rango extenso de tareas posteriores[bommasani2021foundation].
La palabra fundacional no implica que el modelo esté terminado ni que sea universal. Simplemente describe una base incompleta sobre la que se construyen sistemas posteriores.
Podemos pensar en cuatro ingredientes:
- Datos amplios: cubren muchos conceptos, contextos o modalidades.
- Objetivo general: no está ligado a una única etiqueta o aplicación.
- Arquitectura escalable: puede absorber más datos y capacidad sin rediseñarse para cada tarea.
- Adaptabilidad: sus representaciones o predicciones se pueden reutilizar en nuevos problemas.
Los LLMs son, por tanto, un tipo de modelo fundacional, pero también existen modelos fundacionales de visión, audio, vídeo, biología o sistemas multimodales.
Relevancia del Transformer
El self-supervised learning es anterior al Transformer y no exige utilizar esta arquitectura. CPC[oord2018representation], por ejemplo, se presentó como una estrategia aplicable a imágenes, voz, texto y aprendizaje por refuerzo. Sin embargo, el Transformer reunió varias propiedades especialmente adecuadas para el preentrenamiento a escala:
- Paralelización durante el entrenamiento.
- Dependencias de largo alcance mediante self-attention.
- Puede adaptarse a distintas modalidades, tokens de texto, patches de imagen, fragmentos de audio, secuencias multimodales...
- La misma estructura básica es escalable aumentando capas, dimensión, datos y cómputo.
Encoders y decoders
En el Transformer original[vaswani2017attention] se utilizaban ambos, el encoder para construir una representación contextual de la secuencia de entrada y el decoder para generar la secuencia de salida. Las variantes modernas pueden conservar ambos componentes o utilizar solo uno de ellos.
Encoder-only
En un encoder, cada token puede atender normalmente a todos los demás tokens de la entrada. La representación de una palabra puede utilizar tanto las palabras anteriores como las posteriores:
Esta visibilidad bidireccional produce representaciones contextuales muy útiles para:
- clasificación y regresión
- extracción de información
- búsqueda semántica
- segmentación o detección en imágenes
- construcción de embeddings para otras redes
BERT[devlin2018bert] es un ejemplo claro de esto.
Decoder-only
En un decoder causal, cada posición solo puede utilizarse a sí misma y las posiciones anteriores:
Esta restricción permite interpretar la salida como una distribución sobre el siguiente token y generar una secuencia paso a paso. Es la configuración natural de los modelos de lenguaje.
Es importante destacar que un decoder no está limitado a «escribir texto» sino que sus estados internos también contienen representaciones útiles. Sin embargo, su configuración de entrenamiento y uso está especialmente alineada con la generación abierta.
Encoder-decoder
El encoder procesa una entrada completa y el decoder genera una salida condicionada a ella:
Esta separación es natural cuando entrada y salida cumplen papeles distintos como en traducción, resumen, descripción de una imagen o conversión entre modalidades.
Otras composiciones
Los modelos fundacionales no siempre encajan en esas tres configuraciones clásicas. Por ejemplo, CLIP[radford2021clip] utiliza un dual encoder para procesar por separado dos modalidades y proyectar sus representaciones a un espacio común, en este caso imágenes y texto. Otro ejemplo es JEPA, donde puede utilizarse una arquitectura context encoder + target encoder + predictor para predecir una representación objetivo.
Pre-training tasks
Hasta ahora hemos hablado de self-supervised learning de forma general, pero solo describe de dónde procede la supervisión. Sin embargo, existen diferentes paradigmas. Para compararlos es útil plantearse qué información recibe el modelo y qué debe predecir.

Aprendizaje autorregresivo
Como vimos en el capítulo anterior, un modelo autorregresivo factoriza la probabilidad conjunta de una secuencia:
Su función de pérdida habitual es la entropía cruzada entre el siguiente elemento real y la distribución predicha:
Cada posición actúa como un nuevo target y el objetivo coincide con el procedimiento de generación, lo que convierte al decoder causal en un modelo generativo directo.
Masked modeling
Otra posibilidad consiste en ocultar o corromper una parte de la entrada y pedir al modelo que la reconstruya. Si es el conjunto de posiciones enmascaradas:
En masked language modeling (MLM), el encoder observa el contexto situado a ambos lados del hueco:
«El jugador [MASK] sus cartas» → «mostró».
BERT utiliza este objetivo para preentrenar un encoder que después puede adaptarse a tareas supervisadas.
La misma idea se puede llevar a otras modalidades. En imagen se suele utilizar Masked Autoencoders (MAE), que consisten en eliminar una proporción alta de patches, procesar únicamente los visibles con un encoder y utilizar un decoder para reconstruir los píxeles ausentes[he2021mae]. Al terminar el preentrenamiento se descarta el decoder y se conserva el encoder como modelo fundacional.
Aprendizaje contrastivo
En lugar de reconstruir el dato, se puede enseñar al modelo qué samples deberían tener representaciones similares.
Se suele partir de una muestra , a partir de la cual se generan dos vistas relacionadas y . En una imagen podrían ser dos recortes con cambios de color; en un sistema multimodal podrían ser una fotografía y su descripción. Luego se pasan por un encoder que transforma cada vista en un embedding:
Una pérdida contrastiva acerca el par positivo y lo separa de representaciones correspondientes a otras muestras. Una forma habitual es InfoNCE[oord2018cpc]:
donde es una temperatura y suele ser la similitud coseno.
Se enseña al encoder qué cambios debe ignorar y qué relaciones debe conservar. SimCLR[chen2020simclr], por ejemplo, considera positivas dos transformaciones de la misma imagen. CLIP alinea imágenes y textos correspondientes para construir un espacio compartido entre modalidades.

La elección de las vistas es crucial. Si dos transformaciones se consideran equivalentes, el modelo aprenderá a ser invariante a sus diferencias. Una transformación mal elegida puede eliminar precisamente la propiedad semántica que hace que dos imágenes tengan algo en común.
Contrastive Predictive Coding (CPC)
CPC[oord2018cpc] combina predicción temporal, representaciones latentes y aprendizaje contrastivo.
Primero, un encoder transforma cada observación en una representación . Después, un modelo autorregresivo resume el pasado en un vector de contexto :
A partir de , el modelo debe identificar la representación futura correcta frente a varias muestras negativas. No intenta reconstruir nada sino que conserva la información que permite distinguir el futuro real de alternativas plausibles.
CPC ocupa una posición interesante entre varias familias:
- es autorregresivo porque resume el pasado para anticipar el futuro,
- es contrastivo porque distingue targets positivos de negativos,
- es predictivo en el espacio latente porque el objetivo es una representación, no la observación completa.

De observaciones a representaciones
Reconstruir datos de alta dimensionalidad puede ser innecesariamente difícil. Para completar una imagen, un modelo podría tener que decidir la textura exacta de una pared o la posición de cada hoja de un árbol. Son detalles difíciles de predecir y quizá irrelevantes si después queremos reconocer objetos o comprender una escena.
Podemos expresar la diferencia de forma esquemática:
La segunda opción permite que el target omita detalles impredecibles y conserve propiedades más abstractas. Esta es la motivación principal de las Joint-Embedding Predictive Architectures.
JEPA
Las Joint-Embedding Predictive Architectures (JEPA)[lecun2022path] fueron impulsadas por Yann LeCun dentro de una propuesta más amplia para construir máquinas capaces de aprender modelos internos del mundo. Primero estudiaremos JEPA como método de preentrenamiento y después conectaremos esas representaciones con agentes, planificación y world models.
Una receta habitual: I-JEPA
JEPA no es una red concreta, sino una familia de arquitecturas y objetivos. Una receta habitual, utilizada por I-JEPA, contiene tres componentes:
- Un Context Encoder transforma la parte observada en una representación latente .
- Un Target Encoder transforma otra vista relacionada en la representación objetivo .
- Un Predictor utiliza y alguna información sobre la relación entre ambas vistas para estimar .
De forma esquemática:
donde describe qué target se quiere predecir, mide la distancia entre representaciones y indica que el gradiente no actualiza el target encoder. En I-JEPA, sus pesos se actualizan como una media móvil del context encoder. Este mecanismo no define toda la familia: LeJEPA, por ejemplo, elimina el teacher, el stop-gradient y el predictor separado.
En esta receta, ambos encoders observan vistas relacionadas del mismo dato. El target encoder y el predictor son componentes auxiliares y pueden descartarse después; para tareas posteriores se conserva el context encoder.
En formulaciones conceptuales de JEPA y en algunos modelos temporales, una variable latente adicional puede representar varios futuros compatibles. No todos los modelos I-JEPA o V-JEPA implementan esa variable. Cuando existe un predictor dinámico útil, puede conservarse para anticipar la evolución del estado latente.
Veamos un ejemplo más concreto.
I-JEPA: aprender de regiones de una imagen
I-JEPA[assran2023ijepa] (Image-based JEPA) lleva este principio al aprendizaje visual. A partir de una misma imagen construye:
- un bloque de contexto, formado por patches visibles y espacialmente distribuidos,
- varios bloques objetivo, correspondientes a regiones que el context encoder no puede observar,
- una codificación de la posición de cada bloque objetivo.
El context encoder procesa únicamente los patches visibles. El target encoder calcula las representaciones de los bloques objetivo y el predictor intenta recuperarlas a partir del contexto y de su posición. No reconstruye los píxeles originales sino que predice los embeddings que el target encoder habría producido para esas regiones.

El patrón de masking es importante. Si los targets son demasiado pequeños, el modelo puede resolver la tarea utilizando texturas locales; si el contexto contiene poca información, el target resulta imposible de anticipar. I-JEPA utiliza bloques objetivo relativamente grandes para favorecer propiedades semánticas y un contexto distribuido que proporcione información suficiente sobre la escena.
V-JEPA: De imágenes a vídeo
En V-JEPA[bardes2024vjepa], las vistas relacionadas proceden de un vídeo y el masking se extiende al espacio y al tiempo. El modelo predice las representaciones de regiones espacio-temporales ocultas a partir del vídeo visible. Esto obliga al encoder a capturar tanto la apariencia como el movimiento, sin reconstruir píxeles, utilizar texto, recurrir a ejemplos negativos o partir de un encoder de imágenes preentrenado.
El problema del colapso
Durante el entrenamiento existe una solución inútil pero que minimizaría el error, que consiste en que todos los inputs produzcan exactamente el mismo embedding. En ese caso, el predictor acertaría siempre sin aprender nada sobre los datos:
Esto se denomina colapso completo, pero existe una variante más sutil: los embeddings pueden ser diferentes y, aun así, concentrar casi toda su variabilidad en unas pocas dimensiones. En ese colapso dimensional, el modelo desaprovecha gran parte del espacio latente y produce representaciones pobres para tareas posteriores.
Los métodos de joint embedding necesitan impedir estos problemas. Los enfoques contrastivos lo hacen separando ejemplos negativos. Otros métodos utilizan normalización, términos que fuerzan varianza y decorrelación, un target encoder actualizado lentamente o stop-gradient.
I-JEPA utiliza dos mecanismos relacionados:
- El gradiente de la pérdida actualiza el context encoder y el predictor, pero no el target encoder.
- Los parámetros del target encoder siguen una media móvil exponencial de los parámetros del context encoder. El target cambia lentamente y proporciona una referencia más estable.
Estos mecanismos funcionan, pero introducen decisiones de diseño: velocidad de la media móvil, asimetría entre ramas, predictor y estrategia de masking. Gran parte de la investigación en joint embeddings se ha centrado en encontrar recetas que eviten el colapso sin deteriorar la calidad de las representaciones. Este es precisamente el problema que intenta abordar LeJEPA.
LeJEPA
LeJEPA[balestriero2025lejepa] (Latent-Euclidean JEPA) es una formulación propuesta por Randall Balestriero y Yann LeCun que intenta reemplazar esas recetas heurísticas por un criterio explícito sobre cómo debe organizarse el espacio latente.
LeJEPA parte de dos requisitos mínimos:
- Predictibilidad: las representaciones de vistas relacionadas deben permitir predecirse entre sí.
- No degeneración: los embeddings deben ocupar el espacio latente de una forma adecuada para tareas posteriores.
El primer requisito proporciona invariancia: dos vistas relacionadas de la misma muestra deberían conservar la misma información semántica. Por sí solo, sin embargo, admite que todas las vistas y todas las muestras se representen mediante un mismo punto. El segundo requisito debe descartar tanto el colapso completo como el dimensional.
Los autores analizan qué distribución de embeddings reduciría, bajo las hipótesis de su marco teórico, el riesgo esperado de una familia amplia de tareas posteriores. Su resultado propone como objetivo una gaussiana isotrópica.
Esta geometría evita que todos los puntos coincidan, que algunas dimensiones permanezcan constantes o que la información se concentre en un subespacio pequeño. Pedir únicamente media cero y covarianza identidad no controla, sin embargo, toda la forma de la distribución ya que distribuciones muy distintas pueden compartir esos dos primeros momentos.
SIGReg
Comprobar y regularizar directamente una distribución de cientos o miles de dimensiones sería muy costoso. Sketched Isotropic Gaussian Regularization (SIGReg) reduce el problema a múltiples comprobaciones unidimensionales.
Para cada dirección aleatoria unitaria , se proyecta el embedding:
Si sigue una gaussiana isotrópica, cualquier proyección debe seguir una gaussiana unidimensional . SIGReg muestrea varias direcciones, compara la distribución empírica de esas proyecciones con la gaussiana objetivo y vuelve a muestrear direcciones durante el entrenamiento. Así puede detectar una dirección colapsada sin construir o comparar explícitamente densidades de alta dimensión.
La implementación propuesta utiliza un test basado en funciones características, relacionado con el estadístico de Epps–Pulley. Esta elección proporciona gradientes acotados y un coste que crece linealmente con el número de muestras, lo que permite aplicar la regularización a embeddings y modelos grandes.
La pérdida de LeJEPA
Sea la representación de la vista de la muestra . LeJEPA construye un centro a partir de las vistas globales. Para una muestra concreta , la siguiente expresión es la pérdida predictiva por muestra:
Esta ecuación simplificada acerca las vistas de una misma muestra. La formulación completa promedia ese término sobre las muestras del batch y aplica SIGReg por separado a cada vista, utilizando los embeddings de todo el batch:[balestriero2025lejepa-formulation]
Los dos términos ejercen fuerzas complementarias:
- El promedio de acerca las vistas de cada muestra y elimina variaciones irrelevantes.
- SIGReg organiza, para cada vista, las representaciones de las muestras del batch y evita que terminen en el mismo punto o subespacio.
El único hiperparámetro específico de la combinación es , que regula el equilibrio entre predictibilidad y diversidad.
Qué simplifica
Al impedir el colapso mediante un objetivo explícito sobre la distribución, la receta recomendada de LeJEPA puede utilizar un mismo encoder para las distintas vistas y prescindir de varios componentes habituales como:
- ejemplos negativos y grandes colas de muestras
- redes teacher-student y su calendario de media móvil
- stop-gradient
- un predictor usado exclusivamente para evitar el colapso
- prototipos o dimensiones de salida especiales
Otra propiedad práctica es que la pérdida de entrenamiento reportada por los autores se correlaciona con la calidad de las representaciones medida mediante linear probing. En muchos métodos self-supervised una pérdida menor no implica necesariamente un encoder mejor, lo que obliga a entrenar evaluaciones supervisadas durante el desarrollo. Si esta relación se mantiene en nuevos dominios, permitiría seleccionar modelos sin depender de etiquetas.

World models
Habíamos empezado la sección de JEPA comentando que estas arquitecturas fueron impulsadas como parte de una propuesta para construir máquinas capaces de aprender modelos internos del mundo. Esta idea conecta directamente con los world models.
Un world model es un modelo aprendido de la dinámica de un entorno: dada una representación de su estado actual, predice cómo puede evolucionar. Si existe un agente que interviene en el entorno, la predicción debe depender también de la acción que este ejecuta.
De forma simplificada, contiene dos piezas:
- Un encoder de estado transforma la observación (o el historial reciente) en un estado latente .
- Un modelo de transición predice el siguiente estado a partir del actual y de la acción :
Dependiendo de la aplicación, el world model también puede predecir recompensas, eventos o una distribución de estados futuros en lugar de un único estado.
Qué aporta JEPA
Un world model necesita un espacio de estados que retenga aquello que determina la evolución del entorno. Los modelos fundacionales obtenidos mediante JEPA proporcionan precisamente un punto de partida para construirlo.
Sin embargo, un encoder preentrenado no es todavía un world model. Para aprender dinámica hacen falta datos temporalmente ordenados y un predictor de transición. Las acciones son necesarias cuando queremos un modelo condicionado a la intervención de un agente y utilizarlo para control.
Esta relación puede resumirse así:
Simulación y planificación
Una vez aprendido, el world model puede utilizarse como un simulador latente. Si disponemos de un estado objetivo , podemos:
- Codificar la observación actual como y el objetivo como .
- Proponer varias secuencias de acciones.
- Desplegar sus consecuencias en el espacio latente mediante .
- Medir qué estado final predicho queda más cerca de .
- Ejecutar la mejor acción y volver a planificar con la nueva observación.
El sistema simula únicamente las variables latentes necesarias para comparar sus consecuencias. Esto puede resultar mucho más eficiente que generar observaciones completas y evita dedicar capacidad a detalles irrelevantes para la decisión.
En un brazo robótico, por ejemplo, puede codificar la posición de un vaso y del brazo, la apertura de la pinza, las relaciones espaciales y los posibles contactos. El world model permite ensayar movimientos de la pinza antes de ejecutarlos físicamente. También puede utilizarse como simulador para entrenar políticas, generar trayectorias hipotéticas o evaluar si una acción podría provocar una colisión.
V-JEPA 2[assran2025vjepa2] es un ejemplo de esta transición. Tras el preentrenamiento visual, su variante V-JEPA 2-AC incorpora trayectorias robóticas con acciones para aprender la dinámica . El predictor se utiliza después para planificar tareas de alcanzar, coger y colocar objetos a partir de un objetivo visual.

Comparativa
| Paradigma | Qué se oculta o relaciona | Target | Espacio del objetivo | Cómo evita una solución trivial | Arquitectura |
|---|---|---|---|---|---|
| Autorregresivo | El futuro | Siguiente elemento | Datos | Debe explicar el token real | Decoder |
| Masked modeling | Partes de la entrada | Tokens o píxeles ocultos | Espacio de observación | Debe reconstruir el contenido real | Encoder o encoder-decoder |
| Contrastivo | Dos vistas relacionadas | Par correcto | Latente | Negativos o distribución del batch | Encoder |
| CPC | Futuro de la secuencia | Representación futura correcta | Latente | Negativos contrastivos | Encoder predictivo |
| JEPA | Región ausente o futura | Representación del target | Latente | Teacher, stop-gradient u otros mecanismos | Encoder |
| LeJEPA | Vistas de contexto y target | Representación + geometría regularizada | Latente | SIGReg | Encoder |
*Ojo, esta tabla no describe categorías completamente excluyentes.
Downstream tasks
El resultado del self-supervised learning no es un asistente, un clasificador o un sistema de búsqueda. Es una base sobre la que construir un sistema útil. Para ello, hay diferentes opciones:
Linear probing
Se congela el encoder y se entrena una capa lineal sobre sus representaciones con un dataset etiquetado. Es una forma habitual de medir cuánta información accesible contiene el embedding sin modificar el modelo preentrenado.
Fine-tuning
Se continúa el entrenamiento de todos o parte de los parámetros con ejemplos de la tarea final. Suele proporcionar más capacidad de adaptación, pero requiere almacenar y actualizar un modelo grande.
Adaptación eficiente
Métodos como LoRA[hu2021lora] actualizan una cantidad reducida de parámetros y mantienen congelada la mayor parte del modelo base. Los veremos en el siguiente capítulo.
Prompting e in-context learning
En un modelo generativo, la propia entrada puede describir la tarea e incluir ejemplos. El modelo adapta su comportamiento a través del contexto sin que sus parámetros cambien:
Clasifica la reseña como positiva o negativa. Reseña: «La historia es lenta, pero los personajes son magníficos».
Este mecanismo reduce la necesidad de crear una cabeza de salida distinta para cada tarea: muchas aplicaciones pueden expresarse mediante una interfaz común de texto o tokens.
Post-training y alineamiento
Los LLMs preentrenados únicamente para predecir el siguiente token no se comportan automáticamente como asistentes. Después del preentrenamiento se utilizan datos de instrucciones, demostraciones y preferencias para mejorar su capacidad de seguir peticiones.
Aquí aparecen técnicas como:
- Supervised fine-tuning (SFT) sobre pares de instrucción y respuesta.
- RLHF[ouyang2022instructgpt], que utiliza preferencias humanas para entrenar una señal de recompensa y optimizar el modelo.
- Métodos de optimización directa de preferencias, como DPO[rafailov2023dpo].
Estas técnicas pertenecen al post-training. No son paradigmas self-supervised comparables con MLM, CPC o JEPA, porque utilizan supervisión adicional para modificar el comportamiento de una base ya preentrenada.
