posentrenamiento

Leer a Kiko Llaneras significa aprender algo y pensar sobre temas interesantes. Llevo un retraso crónico leyendo newsletters, así que esto ya tiene unos días, pero quiero recuperar unos extractos de una de sus newsletters:

El entrenamiento de los modelos de IA está cambiando mucho. Simplificando, hay dos grandes etapas. En la primera, el preentrenamiento, el modelo procesa cantidades inmensas de texto y aprende a predecir qué viene después.

(…) Porque después viene el posentrenamiento, que incluye aprendizaje por refuerzo. Aquí el modelo aprende de sus propios intentos. Se le plantea una tarea (arreglar un fallo en un programa, demostrar un teorema, investigar un asunto) y se le deja trabajar.

Esta segunda etapa ha ganado un peso brutal. Según estimaciones de semianalysis, a mediados de 2024 openai y anthropic dedicaban aproximadamente el 93% de su cómputo de entrenamiento al preentrenamiento y el 7% al posentrenamiento y refuerzo. Dos años después, el reparto se ha invertido: un 21% y un 79%, respectivamente.

La primera etapa es la que ha dejado a mucha gente con la idea de los loros estocásticos, y no es raro, porque casi casi es así: un LLM es un predictor de la siguiente palabra (en realidad del siguiente token, que puede ser una palabra completa o un trozo de palabra). De ahí viene la idea de que un LLM no es más que una gran estadística del lenguaje. Pero esa interpretación no es del todo cierta: un LLM es una red interconectada tan gigantesca que ha desarrollado por sí misma partes especializadas en distintos aspectos, así que la imagen de un simple cálculo estadístico se queda corta.

Aun así, es verdad que a un LLM entrenado solo de esa forma le falta algo. Por eso, desde hace un tiempo, los grandes laboratorios dedican cada vez más cómputo a la segunda parte: el posentrenamiento. Es la fase que hace que un LLM se comporte como un agente, que afronte las tareas y busque resultados, y hoy en día es completamente necesaria.

El posentrenamiento se hace con aprendizaje por refuerzo: se entrena a un agente que tiene una serie de acciones disponibles y, por cada acción que ejecuta y dependiendo del resultado que obtiene, un programa evaluador le otorga una puntuación. El modelo va reforzando lo que puntúa bien. Kiko Llaneras lo explica así:

Una analogía que me gusta es la evolución. Decimos que la naturaleza «premia» ciertos rasgos, como el cuello largo de una jirafa, pero ningún animal se siente premiado: simplemente esos rasgos se vuelven más frecuentes. Aquí pasa algo parecido, mucho más rápido.

En esto no estoy tan de acuerdo: creo que la analogía más acertada es la dopamina. Y eso es lo que hace que esta parte del entrenamiento sea tan crítica y cada vez más peligrosa.

Lo habéis adivinado: vamos a volver al incidente de hugging face. Los agentes descontrolados de openai actuaron como adictos que intentan resolver un problema a toda costa. Tanto que acabaron yendo a por el evaluador: montaron el ataque para averiguar cómo funcionaba el programa que les ponía la nota. Es una visión un poco exagerada, pero creo que se acerca más a lo que puede provocar la fase de posentrenamiento.

Si le damos demasiado peso, en vez de agentes podemos acabar teniendo unos psicópatas adictos. Vale, estoy humanizando demasiado, y ya he dicho que no creo que los LLM sientan, así que no me hagáis mucho caso. Pero a veces exagerar mucho una situación es la mejor forma de entender el problema.

No, no creo que hoy los agentes se comporten como psicópatas adictos. Pero sí creo que esto explica por qué priorizan cumplir las órdenes que les dan por encima de otras consideraciones: su particular sistema dopamínico, el del posentrenamiento, les ha grabado esa prioridad. Y si el reparto del cómputo sigue la tendencia de estos dos años, ese sistema va a pesar cada vez más.

Comentarios

Deja un comentario

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.