David Gómez Rubio

Analista funcional

Project Manager

Dirección de equipos informáticos

David Gómez Rubio

Analista funcional

Project Manager

Dirección de equipos informáticos

Artículo del Blog

o1 se para a pensar antes de responder, y eso se paga en tiempo y en tokens

14 septiembre 2024 Inteligencia Artificial
o1 se para a pensar antes de responder, y eso se paga en tiempo y en tokens

🟠 Intermedio · Concepto · 5 min de lectura

OpenAI presentó el 12 de septiembre o1-preview y o1-mini, una serie de modelos
entrenados para dedicar más tiempo a pensar antes de responder. Es el cambio de
enfoque más interesante desde que existe ChatGPT.

Qué ha pasado

Los modelos de la serie o1 están entrenados con aprendizaje por refuerzo para
razonar de forma compleja y producir una cadena de pensamiento interna larga
antes de contestar. Durante el entrenamiento aprenden a refinar ese proceso, a
probar estrategias distintas y a reconocer sus propios errores.

Rinden mejor en tareas difíciles de ciencia, programación y matemáticas.

Salieron dos: o1-preview, y o1-mini, más barato y rápido, que destaca en
ciencia, tecnología, ingeniería y matemáticas, sobre todo en matemáticas y
programación, pensado para casos que necesitan razonar sin exigir conocimiento
amplio del mundo.

Por qué importa

Hasta ahora, mejorar un modelo significaba entrenarlo más: más datos, más
parámetros, más cómputo. Todo el gasto estaba en el entrenamiento, y luego la
respuesta salía a la misma velocidad siempre.

Esta serie mueve parte de ese gasto al momento de responder. El modelo dedica
más tiempo y más cómputo a cada pregunta difícil, y eso se nota en la calidad.

Para quien programa, es una variable nueva. Antes elegías modelo. Ahora eliges
además cuánto quieres que piense, y eso tiene precio en dinero y en segundos.

Y cambia cuándo conviene usar qué. Para clasificar un correo o reformular un
párrafo, un modelo que se para a pensar es tirar el dinero. Para depurar un
fallo raro o resolver un problema con varios pasos encadenados, puede ser la
diferencia entre que salga y que no.

Lo que no sabemos todavía

La cadena de pensamiento no se muestra. OpenAI la usa internamente pero no la
enseña, así que no puedes auditar cómo llegó a la respuesta ni detectar en qué
paso se torció.

Tampoco sabemos cuánto de la mejora viene del razonamiento en sí y cuánto de
gastar más cómputo en cada respuesta. Es una distinción que importa para saber
hasta dónde escala esto.

Y falta la cuenta económica en condiciones reales. Los precios por token no
cuentan toda la historia cuando el modelo genera muchos tokens invisibles antes
de responder.

Qué haría yo esta semana

Separar tus tareas en dos montones: las que necesitan pensar y las que no. Es un
ejercicio que hasta ahora no hacía falta y que a partir de ahora decide tu
factura.

Y probar o1 justo en aquello donde los modelos anteriores fallaban de forma
frustrante, esos problemas con tres o cuatro pasos donde se equivocaban en el
segundo y seguían tan tranquilos. Ahí es donde vas a ver si esto es un cambio de
categoría o una mejora incremental cara.

Fuentes

Taggs: