Leer a Kiko Llaneras significa aprender algo y pensar sobre temas interesantes. Llevo un retraso crónico leyendo newsletters, así que esto ya tiene unos días, pero quiero recuperar unos extractos de una de sus newsletters:
El entrenamiento de los modelos de IA está cambiando mucho. Simplificando, hay dos grandes etapas. En la primera, el preentrenamiento, el modelo procesa cantidades inmensas de texto y aprende a predecir qué viene después.
(…) Porque después viene el posentrenamiento, que incluye aprendizaje por refuerzo. Aquí el modelo aprende de sus propios intentos. Se le plantea una tarea (arreglar un fallo en un programa, demostrar un teorema, investigar un asunto) y se le deja trabajar.
Esta segunda etapa ha ganado un peso brutal. Según estimaciones de semianalysis, a mediados de 2024 openai y anthropic dedicaban aproximadamente el 93% de su cómputo de entrenamiento al preentrenamiento y el 7% al posentrenamiento y refuerzo. Dos años después, el reparto se ha invertido: un 21% y un 79%, respectivamente.
(más…)