Modelos Fundacionales

Ciclo de preentrenamiento, adaptación y uso de un modelo fundacional

En el capítulo anterior vimos cómo se puede entrenar un Transformer de forma autorregresiva. Dada una secuencia de tokens, el modelo aprende a predecir el siguiente. Esta es una forma de aprendizaje auto-supervisado. En este tipo de paradigma si entrenamos un modelo suficientemente expresivo con una tarea general y una colección amplia de datos, las representaciones que aprende pueden reutilizarse para resolver problemas que no estaban definidos explícitamente durante el entrenamiento.

Este cambio de perspectiva, de entrenar un modelo para cada tarea a preentrenar una base que pueda adaptarse a muchas tareas, es el origen de los modelos fundacionales.

Self-supervised learning

Imagina que queremos clasificar la opinión de una reseña como positiva o negativa. Tradicionalmente, lo que se hacía era construir un dataset de pares (x,y)(x,y), donde xx es el texto e yy su etiqueta, y a partir de ahí entrenar un modelo para aproximar p(yx)p(y\mid x).

Imagina ahora que en lugar de clasificar en positivo/negativo queremos asignar entre una y cinco estrellas → habría que volver a re-etiquetar todos los datos. Cada problema necesitaría nuevas etiquetas y, habitualmente, un nuevo proceso de entrenamiento.

Esta estrategia funciona pero:

  • Las etiquetas son costosas: requieren anotadores y criterios consistentes.
  • El conocimiento queda fragmentado: cada modelo aprende solo aquello que necesita para resolver su tarea.
  • La reutilización es limitada: un cambio en las categorías o en el dominio puede obligar a etiquetar datos y entrenar de nuevo.

El problema no es el aprendizaje supervisado en sí. Las etiquetas humanas siguen siendo imprescindibles. El problema es utilizar grandes cantidades de supervisión específica para aprender desde cero todo lo que cada tarea comparte con las demás.

El aprendizaje auto-supervisado tiene una historia anterior al entrenamiento moderno a escala, pero la disponibilidad de grandes colecciones de texto, imágenes, audio y vídeo aceleró su adopción. No significa entrenar sin señal de supervisión: los targets se construyen a partir de los propios datos en lugar de anotarse manualmente.

La transición no ocurrió de un día para otro ni eliminó el aprendizaje supervisado. Fue una acumulación de ideas:

  1. Modelos específicos: una arquitectura y un dataset etiquetado para cada tarea.
  2. Transfer learning: reutilizar características aprendidas en un problema grande.
  3. Preentrenamiento self-supervised: aprender la mayor parte de los parámetros con datos sin anotaciones manuales.
  4. Preentrenamiento a escala: aumentar conjuntamente la diversidad de los datos, la capacidad del modelo y la computación.
  5. Adaptación general: usar fine-tuning, prompting o aprendizaje en contexto para abordar muchas tareas desde una misma base.

En procesamiento del lenguaje, modelos como BERT[devlin2018bert] mostraron que un encoder preentrenado sobre texto sin etiquetar podía adaptarse con pocas modificaciones a numerosas tareas. Por otro lado, la familia GPT mostró que escalar decoders autoregresivos permitía reutilizar un mismo modelo mediante ejemplos o instrucciones escritas directamente en el contexto.

Qué es un modelo fundacional

El término foundation model se popularizó para describir modelos entrenados sobre datos amplios y a gran escala que pueden adaptarse a un rango extenso de tareas posteriores[bommasani2021foundation].

La palabra fundacional no implica que el modelo esté terminado ni que sea universal. Simplemente describe una base incompleta sobre la que se construyen sistemas posteriores.

Podemos pensar en cuatro ingredientes:

  1. Datos amplios: cubren muchos conceptos, contextos o modalidades.
  2. Objetivo general: no está ligado a una única etiqueta o aplicación.
  3. Arquitectura escalable: puede absorber más datos y capacidad sin rediseñarse para cada tarea.
  4. Adaptabilidad: sus representaciones o predicciones se pueden reutilizar en nuevos problemas.

Los LLMs son, por tanto, un tipo de modelo fundacional, pero también existen modelos fundacionales de visión, audio, vídeo, biología o sistemas multimodales.

Relevancia del Transformer

El self-supervised learning es anterior al Transformer y no exige utilizar esta arquitectura. CPC[oord2018representation], por ejemplo, se presentó como una estrategia aplicable a imágenes, voz, texto y aprendizaje por refuerzo. Sin embargo, el Transformer reunió varias propiedades especialmente adecuadas para el preentrenamiento a escala:

  • Paralelización durante el entrenamiento.
  • Dependencias de largo alcance mediante self-attention.
  • Puede adaptarse a distintas modalidades, tokens de texto, patches de imagen, fragmentos de audio, secuencias multimodales...
  • La misma estructura básica es escalable aumentando capas, dimensión, datos y cómputo.

Encoders y decoders

En el Transformer original[vaswani2017attention] se utilizaban ambos, el encoder para construir una representación contextual de la secuencia de entrada y el decoder para generar la secuencia de salida. Las variantes modernas pueden conservar ambos componentes o utilizar solo uno de ellos.

Encoder-only

En un encoder, cada token puede atender normalmente a todos los demás tokens de la entrada. La representación de una palabra puede utilizar tanto las palabras anteriores como las posteriores:

ht=fθ(x1,,xT)h_t = f_\theta(x_1,\ldots,x_T)

Esta visibilidad bidireccional produce representaciones contextuales muy útiles para:

  • clasificación y regresión
  • extracción de información
  • búsqueda semántica
  • segmentación o detección en imágenes
  • construcción de embeddings para otras redes

BERT[devlin2018bert] es un ejemplo claro de esto.

Decoder-only

En un decoder causal, cada posición solo puede utilizarse a sí misma y las posiciones anteriores:

ht=fθ(x1,,xt)h_t = f_\theta(x_1,\ldots,x_t)

Esta restricción permite interpretar la salida como una distribución sobre el siguiente token y generar una secuencia paso a paso. Es la configuración natural de los modelos de lenguaje.

Es importante destacar que un decoder no está limitado a «escribir texto» sino que sus estados internos también contienen representaciones útiles. Sin embargo, su configuración de entrenamiento y uso está especialmente alineada con la generación abierta.

Encoder-decoder

El encoder procesa una entrada completa y el decoder genera una salida condicionada a ella:

p(yx)=t=1Typ(yty<t,Enc(x))p(y\mid x)=\prod_{t=1}^{T_y}p(y_t\mid y_{<t},\operatorname{Enc}(x))

Esta separación es natural cuando entrada y salida cumplen papeles distintos como en traducción, resumen, descripción de una imagen o conversión entre modalidades.

Otras composiciones

Los modelos fundacionales no siempre encajan en esas tres configuraciones clásicas. Por ejemplo, CLIP[radford2021clip] utiliza un dual encoder para procesar por separado dos modalidades y proyectar sus representaciones a un espacio común, en este caso imágenes y texto. Otro ejemplo es JEPA, donde puede utilizarse una arquitectura context encoder + target encoder + predictor para predecir una representación objetivo.

Pre-training tasks

Hasta ahora hemos hablado de self-supervised learning de forma general, pero solo describe de dónde procede la supervisión. Sin embargo, existen diferentes paradigmas. Para compararlos es útil plantearse qué información recibe el modelo y qué debe predecir.

Comparación de objetivos autorregresivo, enmascarado, contrastivo y predictivo

Aprendizaje autorregresivo

Como vimos en el capítulo anterior, un modelo autorregresivo factoriza la probabilidad conjunta de una secuencia:

p(x1,,xT)=t=1Tp(xtx<t)p(x_1,\ldots,x_T)=\prod_{t=1}^{T}p(x_t\mid x_{<t})

Su función de pérdida habitual es la entropía cruzada entre el siguiente elemento real y la distribución predicha:

LAR=t=1Tlogpθ(xtx<t)\mathcal{L}_{AR}=-\sum_{t=1}^{T}\log p_\theta(x_t\mid x_{<t})

Cada posición actúa como un nuevo target y el objetivo coincide con el procedimiento de generación, lo que convierte al decoder causal en un modelo generativo directo.

Masked modeling

Otra posibilidad consiste en ocultar o corromper una parte de la entrada y pedir al modelo que la reconstruya. Si MM es el conjunto de posiciones enmascaradas:

Lmask=iMlogpθ(xixM)\mathcal{L}_{mask}=-\sum_{i\in M}\log p_\theta(x_i\mid x_{\setminus M})

En masked language modeling (MLM), el encoder observa el contexto situado a ambos lados del hueco:

«El jugador [MASK] sus cartas» → «mostró».

BERT utiliza este objetivo para preentrenar un encoder que después puede adaptarse a tareas supervisadas.

La misma idea se puede llevar a otras modalidades. En imagen se suele utilizar Masked Autoencoders (MAE), que consisten en eliminar una proporción alta de patches, procesar únicamente los visibles con un encoder y utilizar un decoder para reconstruir los píxeles ausentes[he2021mae]. Al terminar el preentrenamiento se descarta el decoder y se conserva el encoder como modelo fundacional.

Aprendizaje contrastivo

En lugar de reconstruir el dato, se puede enseñar al modelo qué samples deberían tener representaciones similares.

Se suele partir de una muestra xx, a partir de la cual se generan dos vistas relacionadas x~i\tilde{x}_i y x~j\tilde{x}_j. En una imagen podrían ser dos recortes con cambios de color; en un sistema multimodal podrían ser una fotografía y su descripción. Luego se pasan por un encoder que transforma cada vista en un embedding:

zi=gθ(x~i),zj=gθ(x~j)z_i=g_\theta(\tilde{x}_i), \qquad z_j=g_\theta(\tilde{x}_j)

Una pérdida contrastiva acerca el par positivo (zi,zj)(z_i,z_j) y lo separa de representaciones correspondientes a otras muestras. Una forma habitual es InfoNCE[oord2018cpc]:

Li=logexp(sim(zi,zj)/τ)kiexp(sim(zi,zk)/τ),\mathcal{L}_i=-\log \frac{\exp(\operatorname{sim}(z_i,z_j)/\tau)} {\sum_{k\neq i}\exp(\operatorname{sim}(z_i,z_k)/\tau)},

donde τ\tau es una temperatura y sim\operatorname{sim} suele ser la similitud coseno.

Se enseña al encoder qué cambios debe ignorar y qué relaciones debe conservar. SimCLR[chen2020simclr], por ejemplo, considera positivas dos transformaciones de la misma imagen. CLIP alinea imágenes y textos correspondientes para construir un espacio compartido entre modalidades.

Aprendizaje contrastivo de dos vistas de una misma observación

La elección de las vistas es crucial. Si dos transformaciones se consideran equivalentes, el modelo aprenderá a ser invariante a sus diferencias. Una transformación mal elegida puede eliminar precisamente la propiedad semántica que hace que dos imágenes tengan algo en común.

Contrastive Predictive Coding (CPC)

CPC[oord2018cpc] combina predicción temporal, representaciones latentes y aprendizaje contrastivo.

Primero, un encoder transforma cada observación en una representación ztz_t. Después, un modelo autorregresivo resume el pasado en un vector de contexto ctc_t:

zt=genc(xt),ct=gar(zt)z_t=g_{enc}(x_t), \qquad c_t=g_{ar}(z_{\leq t})

A partir de ctc_t, el modelo debe identificar la representación futura correcta zt+kz_{t+k} frente a varias muestras negativas. No intenta reconstruir nada sino que conserva la información que permite distinguir el futuro real de alternativas plausibles.

CPC ocupa una posición interesante entre varias familias:

  • es autorregresivo porque resume el pasado para anticipar el futuro,
  • es contrastivo porque distingue targets positivos de negativos,
  • es predictivo en el espacio latente porque el objetivo es una representación, no la observación completa.
Contrastive Predictive Coding aplicado a una secuencia de representaciones

De observaciones a representaciones

Reconstruir datos de alta dimensionalidad puede ser innecesariamente difícil. Para completar una imagen, un modelo podría tener que decidir la textura exacta de una pared o la posición de cada hoja de un árbol. Son detalles difíciles de predecir y quizá irrelevantes si después queremos reconocer objetos o comprender una escena.

Podemos expresar la diferencia de forma esquemática:

contextodato ausenteespacio de datos\underbrace{\mathrm{contexto}\rightarrow\mathrm{dato\ ausente}}_{\mathrm{espacio\ de\ datos}} contextoembedding objetivoespacio latente\underbrace{\mathrm{contexto}\rightarrow\mathrm{embedding\ objetivo}}_{\mathrm{espacio\ latente}}

La segunda opción permite que el target omita detalles impredecibles y conserve propiedades más abstractas. Esta es la motivación principal de las Joint-Embedding Predictive Architectures.

JEPA

Las Joint-Embedding Predictive Architectures (JEPA)[lecun2022path] fueron impulsadas por Yann LeCun dentro de una propuesta más amplia para construir máquinas capaces de aprender modelos internos del mundo. Primero estudiaremos JEPA como método de preentrenamiento y después conectaremos esas representaciones con agentes, planificación y world models.

Una receta habitual: I-JEPA

JEPA no es una red concreta, sino una familia de arquitecturas y objetivos. Una receta habitual, utilizada por I-JEPA, contiene tres componentes:

  1. Un Context Encoder transforma la parte observada xx en una representación latente sxs_x.
  2. Un Target Encoder transforma otra vista relacionada yy en la representación objetivo sys_y.
  3. Un Predictor utiliza sxs_x y alguna información sobre la relación entre ambas vistas para estimar sys_y.

De forma esquemática:

sx=fθ(x),sy=fθˉ(y),s_x=f_\theta(x), \qquad s_y=f_{\bar\theta}(y), s^y=pϕ(sx,c),LJEPA=D ⁣(s^y,sg(sy)),\hat{s}_y=p_\phi(s_x,c), \qquad \mathcal{L}_{JEPA}=D\!\left(\hat{s}_y,\operatorname{sg}(s_y)\right),

donde cc describe qué target se quiere predecir, DD mide la distancia entre representaciones y sg\operatorname{sg} indica que el gradiente no actualiza el target encoder. En I-JEPA, sus pesos se actualizan como una media móvil del context encoder. Este mecanismo no define toda la familia: LeJEPA, por ejemplo, elimina el teacher, el stop-gradient y el predictor separado.

En esta receta, ambos encoders observan vistas relacionadas del mismo dato. El target encoder y el predictor son componentes auxiliares y pueden descartarse después; para tareas posteriores se conserva el context encoder.

En formulaciones conceptuales de JEPA y en algunos modelos temporales, una variable latente adicional puede representar varios futuros compatibles. No todos los modelos I-JEPA o V-JEPA implementan esa variable. Cuando existe un predictor dinámico útil, puede conservarse para anticipar la evolución del estado latente.

Veamos un ejemplo más concreto.

I-JEPA: aprender de regiones de una imagen

I-JEPA[assran2023ijepa] (Image-based JEPA) lleva este principio al aprendizaje visual. A partir de una misma imagen construye:

  • un bloque de contexto, formado por patches visibles y espacialmente distribuidos,
  • varios bloques objetivo, correspondientes a regiones que el context encoder no puede observar,
  • una codificación de la posición de cada bloque objetivo.

El context encoder procesa únicamente los patches visibles. El target encoder calcula las representaciones de los bloques objetivo y el predictor intenta recuperarlas a partir del contexto y de su posición. No reconstruye los píxeles originales sino que predice los embeddings que el target encoder habría producido para esas regiones.

Arquitectura JEPA con encoder de contexto, encoder objetivo y predictor

El patrón de masking es importante. Si los targets son demasiado pequeños, el modelo puede resolver la tarea utilizando texturas locales; si el contexto contiene poca información, el target resulta imposible de anticipar. I-JEPA utiliza bloques objetivo relativamente grandes para favorecer propiedades semánticas y un contexto distribuido que proporcione información suficiente sobre la escena.

V-JEPA: De imágenes a vídeo

En V-JEPA[bardes2024vjepa], las vistas relacionadas proceden de un vídeo y el masking se extiende al espacio y al tiempo. El modelo predice las representaciones de regiones espacio-temporales ocultas a partir del vídeo visible. Esto obliga al encoder a capturar tanto la apariencia como el movimiento, sin reconstruir píxeles, utilizar texto, recurrir a ejemplos negativos o partir de un encoder de imágenes preentrenado.

El problema del colapso

Durante el entrenamiento existe una solución inútil pero que minimizaría el error, que consiste en que todos los inputs produzcan exactamente el mismo embedding. En ese caso, el predictor acertaría siempre sin aprender nada sobre los datos:

f(x)=cxf(x)=c \quad \forall x

Esto se denomina colapso completo, pero existe una variante más sutil: los embeddings pueden ser diferentes y, aun así, concentrar casi toda su variabilidad en unas pocas dimensiones. En ese colapso dimensional, el modelo desaprovecha gran parte del espacio latente y produce representaciones pobres para tareas posteriores.

Los métodos de joint embedding necesitan impedir estos problemas. Los enfoques contrastivos lo hacen separando ejemplos negativos. Otros métodos utilizan normalización, términos que fuerzan varianza y decorrelación, un target encoder actualizado lentamente o stop-gradient.

I-JEPA utiliza dos mecanismos relacionados:

  • El gradiente de la pérdida actualiza el context encoder y el predictor, pero no el target encoder.
  • Los parámetros del target encoder siguen una media móvil exponencial de los parámetros del context encoder. El target cambia lentamente y proporciona una referencia más estable.

Estos mecanismos funcionan, pero introducen decisiones de diseño: velocidad de la media móvil, asimetría entre ramas, predictor y estrategia de masking. Gran parte de la investigación en joint embeddings se ha centrado en encontrar recetas que eviten el colapso sin deteriorar la calidad de las representaciones. Este es precisamente el problema que intenta abordar LeJEPA.

LeJEPA

LeJEPA[balestriero2025lejepa] (Latent-Euclidean JEPA) es una formulación propuesta por Randall Balestriero y Yann LeCun que intenta reemplazar esas recetas heurísticas por un criterio explícito sobre cómo debe organizarse el espacio latente.

LeJEPA parte de dos requisitos mínimos:

  1. Predictibilidad: las representaciones de vistas relacionadas deben permitir predecirse entre sí.
  2. No degeneración: los embeddings deben ocupar el espacio latente de una forma adecuada para tareas posteriores.

El primer requisito proporciona invariancia: dos vistas relacionadas de la misma muestra deberían conservar la misma información semántica. Por sí solo, sin embargo, admite que todas las vistas y todas las muestras se representen mediante un mismo punto. El segundo requisito debe descartar tanto el colapso completo como el dimensional.

Los autores analizan qué distribución de embeddings reduciría, bajo las hipótesis de su marco teórico, el riesgo esperado de una familia amplia de tareas posteriores. Su resultado propone como objetivo una gaussiana isotrópica.

Esta geometría evita que todos los puntos coincidan, que algunas dimensiones permanezcan constantes o que la información se concentre en un subespacio pequeño. Pedir únicamente media cero y covarianza identidad no controla, sin embargo, toda la forma de la distribución ya que distribuciones muy distintas pueden compartir esos dos primeros momentos.

SIGReg

Comprobar y regularizar directamente una distribución de cientos o miles de dimensiones sería muy costoso. Sketched Isotropic Gaussian Regularization (SIGReg) reduce el problema a múltiples comprobaciones unidimensionales.

Para cada dirección aleatoria unitaria ama_m, se proyecta el embedding:

um=amzu_m=a_m^\top z

Si zz sigue una gaussiana isotrópica, cualquier proyección umu_m debe seguir una gaussiana unidimensional N(0,1)\mathcal{N}(0,1). SIGReg muestrea varias direcciones, compara la distribución empírica de esas proyecciones con la gaussiana objetivo y vuelve a muestrear direcciones durante el entrenamiento. Así puede detectar una dirección colapsada sin construir o comparar explícitamente densidades de alta dimensión.

La implementación propuesta utiliza un test basado en funciones características, relacionado con el estadístico de Epps–Pulley. Esta elección proporciona gradientes acotados y un coste que crece linealmente con el número de muestras, lo que permite aplicar la regularización a embeddings y modelos grandes.

La pérdida de LeJEPA

Sea zn,vz_{n,v} la representación de la vista vv de la muestra nn. LeJEPA construye un centro μn\mu_n a partir de las VgV_g vistas globales. Para una muestra concreta nn, la siguiente expresión es la pérdida predictiva por muestra:

μn=1Vgv=1Vgzn,v,Lpred(n)=1Vv=1Vzn,vμn22\mu_n=\frac{1}{V_g}\sum_{v=1}^{V_g}z_{n,v}, \qquad \mathcal{L}_{pred}^{(n)} =\frac{1}{V}\sum_{v=1}^{V}\lVert z_{n,v}-\mu_n\rVert_2^2

Esta ecuación simplificada acerca las vistas de una misma muestra. La formulación completa promedia ese término sobre las BB muestras del batch y aplica SIGReg por separado a cada vista, utilizando los embeddings de todo el batch:[balestriero2025lejepa-formulation]

LLeJEPA=1λBn=1BLpred(n)+λVv=1VSIGReg ⁣({zn,v}n=1B)\mathcal{L}_{LeJEPA} = \frac{1-\lambda}{B}\sum_{n=1}^{B}\mathcal{L}_{pred}^{(n)} + \frac{\lambda}{V}\sum_{v=1}^{V} \operatorname{SIGReg}\!\left(\{z_{n,v}\}_{n=1}^{B}\right)

Los dos términos ejercen fuerzas complementarias:

  • El promedio de Lpred(n)\mathcal{L}_{pred}^{(n)} acerca las vistas de cada muestra y elimina variaciones irrelevantes.
  • SIGReg organiza, para cada vista, las representaciones de las muestras del batch y evita que terminen en el mismo punto o subespacio.

El único hiperparámetro específico de la combinación es λ\lambda, que regula el equilibrio entre predictibilidad y diversidad.

Qué simplifica

Al impedir el colapso mediante un objetivo explícito sobre la distribución, la receta recomendada de LeJEPA puede utilizar un mismo encoder para las distintas vistas y prescindir de varios componentes habituales como:

  • ejemplos negativos y grandes colas de muestras
  • redes teacher-student y su calendario de media móvil
  • stop-gradient
  • un predictor usado exclusivamente para evitar el colapso
  • prototipos o dimensiones de salida especiales

Otra propiedad práctica es que la pérdida de entrenamiento reportada por los autores se correlaciona con la calidad de las representaciones medida mediante linear probing. En muchos métodos self-supervised una pérdida menor no implica necesariamente un encoder mejor, lo que obliga a entrenar evaluaciones supervisadas durante el desarrollo. Si esta relación se mantiene en nuevos dominios, permitiría seleccionar modelos sin depender de etiquetas.

Regularización estadística del espacio de representaciones en LeJEPA

World models

Habíamos empezado la sección de JEPA comentando que estas arquitecturas fueron impulsadas como parte de una propuesta para construir máquinas capaces de aprender modelos internos del mundo. Esta idea conecta directamente con los world models.

Un world model es un modelo aprendido de la dinámica de un entorno: dada una representación de su estado actual, predice cómo puede evolucionar. Si existe un agente que interviene en el entorno, la predicción debe depender también de la acción que este ejecuta.

De forma simplificada, contiene dos piezas:

  1. Un encoder de estado transforma la observación xtx_t (o el historial reciente) en un estado latente ztz_t.
  2. Un modelo de transición predice el siguiente estado a partir del actual y de la acción ata_t:
zt=Eθ(xt),z^t+1=Fϕ(zt,at)z_t=E_\theta(x_{\leq t}), \qquad \hat{z}_{t+1}=F_\phi(z_t,a_t)

Dependiendo de la aplicación, el world model también puede predecir recompensas, eventos o una distribución de estados futuros en lugar de un único estado.

Qué aporta JEPA

Un world model necesita un espacio de estados que retenga aquello que determina la evolución del entorno. Los modelos fundacionales obtenidos mediante JEPA proporcionan precisamente un punto de partida para construirlo.

Sin embargo, un encoder preentrenado no es todavía un world model. Para aprender dinámica hacen falta datos temporalmente ordenados y un predictor de transición. Las acciones son necesarias cuando queremos un modelo condicionado a la intervención de un agente y utilizarlo para control.

Esta relación puede resumirse así:

Eθmodelo fundacional JEPA+Fϕ(zt,at)dinamica del entorno=world model latentesimulador interno\underbrace{E_\theta}_{\text{modelo fundacional JEPA}} + \underbrace{F_\phi(z_t,a_t)}_{\text{dinamica del entorno}} = \underbrace{\text{world model latente}}_{\text{simulador interno}}

Simulación y planificación

Una vez aprendido, el world model puede utilizarse como un simulador latente. Si disponemos de un estado objetivo zgz_g, podemos:

  1. Codificar la observación actual como ztz_t y el objetivo como zgz_g.
  2. Proponer varias secuencias de acciones.
  3. Desplegar sus consecuencias en el espacio latente mediante FϕF_\phi.
  4. Medir qué estado final predicho queda más cerca de zgz_g.
  5. Ejecutar la mejor acción y volver a planificar con la nueva observación.

El sistema simula únicamente las variables latentes necesarias para comparar sus consecuencias. Esto puede resultar mucho más eficiente que generar observaciones completas y evita dedicar capacidad a detalles irrelevantes para la decisión.

En un brazo robótico, por ejemplo, ztz_t puede codificar la posición de un vaso y del brazo, la apertura de la pinza, las relaciones espaciales y los posibles contactos. El world model permite ensayar movimientos de la pinza antes de ejecutarlos físicamente. También puede utilizarse como simulador para entrenar políticas, generar trayectorias hipotéticas o evaluar si una acción podría provocar una colisión.

V-JEPA 2[assran2025vjepa2] es un ejemplo de esta transición. Tras el preentrenamiento visual, su variante V-JEPA 2-AC incorpora trayectorias robóticas con acciones para aprender la dinámica Fϕ(zt,at)F_\phi(z_t,a_t). El predictor se utiliza después para planificar tareas de alcanzar, coger y colocar objetos a partir de un objetivo visual.

Modelo del mundo que predice estados futuros en el espacio de representación

Comparativa

ParadigmaQué se oculta o relacionaTargetEspacio del objetivoCómo evita una solución trivialArquitectura
AutorregresivoEl futuroSiguiente elementoDatosDebe explicar el token realDecoder
Masked modelingPartes de la entradaTokens o píxeles ocultosEspacio de observaciónDebe reconstruir el contenido realEncoder o encoder-decoder
ContrastivoDos vistas relacionadasPar correctoLatenteNegativos o distribución del batchEncoder
CPCFuturo de la secuenciaRepresentación futura correctaLatenteNegativos contrastivosEncoder predictivo
JEPARegión ausente o futuraRepresentación del targetLatenteTeacher, stop-gradient u otros mecanismosEncoder
LeJEPAVistas de contexto y targetRepresentación + geometría regularizadaLatenteSIGRegEncoder

*Ojo, esta tabla no describe categorías completamente excluyentes.

Downstream tasks

El resultado del self-supervised learning no es un asistente, un clasificador o un sistema de búsqueda. Es una base sobre la que construir un sistema útil. Para ello, hay diferentes opciones:

Linear probing

Se congela el encoder y se entrena una capa lineal sobre sus representaciones con un dataset etiquetado. Es una forma habitual de medir cuánta información accesible contiene el embedding sin modificar el modelo preentrenado.

Fine-tuning

Se continúa el entrenamiento de todos o parte de los parámetros con ejemplos de la tarea final. Suele proporcionar más capacidad de adaptación, pero requiere almacenar y actualizar un modelo grande.

Adaptación eficiente

Métodos como LoRA[hu2021lora] actualizan una cantidad reducida de parámetros y mantienen congelada la mayor parte del modelo base. Los veremos en el siguiente capítulo.

Prompting e in-context learning

En un modelo generativo, la propia entrada puede describir la tarea e incluir ejemplos. El modelo adapta su comportamiento a través del contexto sin que sus parámetros cambien:

Clasifica la reseña como positiva o negativa. Reseña: «La historia es lenta, pero los personajes son magníficos».

Este mecanismo reduce la necesidad de crear una cabeza de salida distinta para cada tarea: muchas aplicaciones pueden expresarse mediante una interfaz común de texto o tokens.

Post-training y alineamiento

Los LLMs preentrenados únicamente para predecir el siguiente token no se comportan automáticamente como asistentes. Después del preentrenamiento se utilizan datos de instrucciones, demostraciones y preferencias para mejorar su capacidad de seguir peticiones.

Aquí aparecen técnicas como:

  • Supervised fine-tuning (SFT) sobre pares de instrucción y respuesta.
  • RLHF[ouyang2022instructgpt], que utiliza preferencias humanas para entrenar una señal de recompensa y optimizar el modelo.
  • Métodos de optimización directa de preferencias, como DPO[rafailov2023dpo].

Estas técnicas pertenecen al post-training. No son paradigmas self-supervised comparables con MLM, CPC o JEPA, porque utilizan supervisión adicional para modificar el comportamiento de una base ya preentrenada.

Ciclo de vida de un modelo fundacional desde el preentrenamiento hasta el despliegue