David Gómez Rubio

Analista funcional

Project Manager

Dirección de equipos informáticos

David Gómez Rubio

Analista funcional

Project Manager

Dirección de equipos informáticos

Artículo del Blog

Sora genera un minuto de vídeo coherente, y ahí está justo el problema

17 febrero 2024 Inteligencia Artificial
Sora genera un minuto de vídeo coherente, y ahí está justo el problema

🟢 Básico · Nuevo · 4 min de lectura

OpenAI presentó Sora el 15 de febrero junto a un artículo con un título que
dice más que el modelo: los modelos de generación de vídeo como simuladores del
mundo.

Qué ha pasado

Sora es capaz de generar un minuto de vídeo de alta fidelidad manteniendo la
calidad visual y la fidelidad a lo que se le ha pedido.

Por dentro son modelos de difusión condicionados por texto, entrenados a la vez
sobre vídeos e imágenes de duraciones, resoluciones y proporciones variables,
con una arquitectura de tipo transformer que opera sobre fragmentos de
espacio-tiempo.

OpenAI afirma que el modelo no solo entiende lo que se le ha pedido, sino cómo
existen esas cosas en el mundo físico, y que puede crear varios planos dentro de
un mismo vídeo manteniendo los personajes y el estilo visual.

De momento solo tienen acceso los equipos de evaluación de riesgos.

Por qué importa

El minuto es el dato. Los modelos anteriores producían tres o cuatro segundos
en los que un caballo podía cambiar de número de patas sin que nadie se
enterase. Un minuto coherente exige que el sistema mantenga una representación
estable de lo que hay en la escena mientras el tiempo pasa.

Esa es la parte interesante, y es la que justifica lo de simuladores del mundo.
Para que un objeto siga siendo el mismo objeto al salir y volver a entrar en el
plano, el modelo tiene que haber aprendido algo parecido a la permanencia.

Aprendido de mirar vídeos, sin que nadie se lo explicara.

Lo que no sabemos todavía

Casi todo, y conviene decirlo alto porque los vídeos son espectaculares.

No se puede probar. Lo que hemos visto son ejemplos elegidos por quien lo ha
construido, y en generación de vídeo la distancia entre el mejor resultado y el
resultado medio es enorme. Nadie ha enseñado los descartes.

Tampoco sabemos cuántos intentos hay detrás de cada clip, ni con qué material se
ha entrenado, ni cuánto cuesta generar ese minuto.

Y lo de simulador del mundo es una afirmación grande. Que un sistema mantenga
la coherencia visual durante un minuto no demuestra que tenga un modelo de la
física; demuestra que produce vídeo que a nosotros nos parece coherente durante
un minuto. Puede que acabe siendo lo mismo. Hoy no lo sabemos.

Qué haría yo esta semana

Nada, y creo que es la respuesta correcta. No hay nada que integrar ni que
probar.

Lo que sí haría es fijarme en cómo se cuenta esto, porque es un ejemplar
perfecto de un patrón que vamos a ver mucho: capacidad impresionante, acceso
restringido, resultados sin auditar y una afirmación teórica ambiciosa en el
título. Ninguna de esas cuatro cosas está mal por separado. Juntas exigen leer
con cuidado.

Fuentes

Taggs: