David Gómez Rubio

Analista funcional

Project Manager

Dirección de equipos informáticos

David Gómez Rubio

Analista funcional

Project Manager

Dirección de equipos informáticos

Artículo del Blog

Una red que dibuja lo que le pides: DALL·E y CLIP

7 enero 2021 Inteligencia Artificial
Una red que dibuja lo que le pides: DALL·E y CLIP

🟢 Básico · Nuevo · 4 min de lectura

El 5 de enero OpenAI presentó dos sistemas el mismo día. Uno ha acaparado los
titulares porque dibuja. El otro es probablemente el que más va a cambiar cómo
trabajamos con imágenes.

Qué ha pasado

DALL·E es una red neuronal que crea imágenes a partir de una descripción
escrita. Es una versión de GPT-3 con 12.000 millones de parámetros, entrenada
sobre pares de texto e imagen en lugar de solo texto. Le pides «un sillón con
forma de aguacate» y te lo dibuja, sin haber visto nunca uno.

Lo llamativo no es que copie, es que combina. Genera versiones antropomórficas
de animales y objetos, junta conceptos que no tienen relación entre sí de
maneras plausibles, dibuja texto dentro de la imagen y aplica transformaciones
a imágenes que ya existen.

El mismo día OpenAI publicó CLIP, y este sí lo liberó. CLIP aprende conceptos
visuales a partir de supervisión en lenguaje natural, es decir, aprende a
relacionar imágenes con las frases que las describen sin que nadie le haya
etiquetado categorías a mano.

Los dos trabajan juntos: CLIP se usa para reordenar las muestras que produce
DALL·E y quedarse con las que mejor encajan con lo que se pidió.

Por qué importa

Durante años, enseñar a un ordenador a reconocer algo en una imagen exigía un
conjunto de datos etiquetado a mano, categoría por categoría. Si querías
distinguir treinta razas de perro, alguien tenía que etiquetar miles de fotos
de perros.

CLIP rompe esa dependencia. Aprende de pares de imagen y texto tal como existen
en internet, y luego se le puede pedir que clasifique cosas para las que no fue
entrenado explícitamente, describiéndoselas con palabras. Eso cambia la
economía de cualquier proyecto de visión artificial con datos propios y sin
presupuesto de anotación, que son casi todos.

DALL·E apunta a otro sitio. Si un modelo de lenguaje puede generar texto
coherente, y el mismo tipo de arquitectura puede generar imágenes coherentes,
la pregunta que queda abierta es qué otras cosas se dejan generar así.

Lo que no sabemos todavía

DALL·E no está disponible. Hay una demostración interactiva y un artículo, pero
no se puede probar, y una demostración escogida por sus autores enseña lo que
funciona, no lo que falla.

Tampoco está claro qué pasa con los derechos de las imágenes con las que se ha
entrenado, ni cómo se comporta el sistema cuando se le pide algo que no debería
dibujar. Son preguntas que hoy no tienen respuesta pública.

Y queda la duda de siempre con estos anuncios: cuánto de lo que se ve es el
modelo y cuánto es el filtrado posterior. Que CLIP se use para reordenar las
muestras es un dato honesto de OpenAI, y también un recordatorio de que lo que
enseñan no es la primera salida del modelo, es la mejor de un montón.

Qué haría yo esta semana

Mirar CLIP, no DALL·E. Está publicado, se puede descargar y se puede probar
contra un problema propio esta misma tarde. Si tienes un conjunto de imágenes
sin etiquetar y una idea razonable de qué categorías quieres, merece media
hora de experimento.

DALL·E es fascinante y no puedes hacer nada con él todavía. CLIP es menos
espectacular y lo puedes usar hoy.

Fuentes

Taggs: