David Gómez Rubio

Analista funcional

Project Manager

Dirección de equipos informáticos

David Gómez Rubio

Analista funcional

Project Manager

Dirección de equipos informáticos

Artículo del Blog

Whisper: transcripción decente, con licencia MIT y sin pedir permiso

23 septiembre 2022 Inteligencia Artificial
Whisper: transcripción decente, con licencia MIT y sin pedir permiso

🟠 Intermedio · Práctico · 5 min de lectura

OpenAI publicó el 21 de septiembre Whisper, un sistema de reconocimiento
automático del habla. La noticia no es la calidad, que ya es buena. Es la
licencia.

Qué ha pasado

Whisper se ha entrenado con 680.000 horas de audio multilingüe y multitarea
recogido de la web. Esa escala y esa variedad le dan robustez frente a acentos,
ruido de fondo y lenguaje técnico, y le permiten transcribir en varios idiomas
y traducir desde ellos al inglés.

La arquitectura es sencilla y directa: un Transformer codificador y
decodificador, de extremo a extremo.

Medido sin ajuste previo sobre conjuntos de datos muy variados, Whisper comete
un 50% menos de errores que los modelos especializados con los que se compara.

Y el detalle que importa: el código y los pesos se publican bajo licencia MIT.

Por qué importa

Hasta ahora, poner transcripción decente en un proyecto significaba una de dos
cosas. O pagabas por servicio a un proveedor en la nube, con su coste por
minuto y sus condiciones, o te conformabas con la calidad regular de las
alternativas libres.

Whisper rompe esa disyuntiva. Licencia MIT quiere decir que puedes usarlo en un
producto comercial, modificarlo y distribuirlo sin pedirle permiso a nadie.
Combinado con que se ejecuta en local, elimina de un golpe el coste por minuto
y el problema de mandar audio de terceros a un servidor ajeno.

Ese segundo punto es más importante de lo que parece. Si transcribes reuniones,
consultas médicas o llamadas de clientes, poder hacerlo sin que el audio salga
de tu infraestructura cambia qué proyectos son viables legalmente.

Y lo del 50% menos de errores tiene una letra pequeña favorable: está medido
sin ajuste previo, es decir, sin entrenarlo para cada conjunto de datos
concreto. Eso es justo lo que necesita quien lo va a usar contra su propio
audio, que nunca se parece al del laboratorio.

Lo que no sabemos todavía

Cómo se comporta en castellano con audio malo de verdad. Los resultados
publicados son multilingües, pero la media de muchos idiomas no dice cómo va a
ir con una grabación con acento andaluz, dos personas hablando a la vez y un
aire acondicionado de fondo. Eso hay que medirlo con audio propio.

Tampoco está claro el coste de ejecución para volúmenes grandes. Que sea
gratis en licencia no significa que sea barato en cómputo, y esa cuenta hay que
echarla antes de prometerle nada a nadie.

Qué haría yo esta semana

Probarlo contra tus peores grabaciones, no contra las mejores. Coge el audio
que hoy no puedes transcribir bien y pásaselo. Si lo resuelve, tienes un
proyecto nuevo que ayer no era viable.

Y si trabajas con audio sujeto a protección de datos, este es el momento de
replantear lo que descartaste por no poder mandarlo fuera.

Fuentes

Taggs: