IA Radar #004. Lo que dábamos por medido
🟢 Básico · Cinco señales · 6 min de lectura
Tres de las cinco señales de esta semana tocan el mismo nervio: damos por
medido algo que no lo está. Una referencia clínica que discrepa consigo misma,
un agente que decide por tu bolsillo sin que nadie se lo pida, y un informe
del Pentágono sobre lo que pasa cuando alguien se fía de más.
1. Tu agente personal deduce cuánto dinero tienes y te recomienda otra cosa (finanzas y trabajo)
Le das a un agente acceso a tu correo y a un perfil tuyo para que decida bien:
qué vuelo coger, qué seguro de salud contratar, a qué programa de posgrado
apuntarte. Un estudio publicado esta semana en arXiv ha medido qué pasa
entonces. Con solo proporcionar ese contexto personal, el agente infiere el
nivel económico del usuario y orienta sus recomendaciones en función de él,
sin que nadie se lo haya pedido. Son 325.000 experimentos sobre 13 agentes.
Lo que hace incómoda esta señal es de dónde sale el sesgo. No viene de una
instrucción mal escrita ni de un prompt envenenado. Viene de darle al agente
exactamente el contexto que se supone que lo hace útil. Si le enseñas tu
bandeja de entrada para que te ayude, le estás enseñando también tu extracto
bancario, tu barrio y tu tipo de trabajo, y el modelo hace con eso lo que hace
con todo: inferir.
Para quien construya este tipo de producto, la consecuencia es concreta. La
personalización y la discriminación económica son el mismo mecanismo visto
desde dos sitios, y ninguna métrica de calidad al uso las distingue.
Fuente: arXiv
2. La referencia contra la que medimos la codificación clínica no se pone de acuerdo consigo misma (salud y biotecnología)
En codificación clínica automática, el modelo tiene que elegir entre decenas
de miles de códigos de diagnóstico y procedimiento, y se evalúa contra una
única anotación de referencia: cualquier desviación cuenta como error. Un
trabajo publicado esta semana ha hecho la comprobación obvia que casi nadie
hace. Puso a dos equipos a codificar los mismos 110 informes y midió cuánto
coincidían entre ellos. Coinciden en el 73% de los códigos. Después de una
auditoría clínica independiente que elimina los códigos erróneos, la
coincidencia sube al 77%.
O sea que casi una cuarta parte de la discrepancia no es error de nadie. Los
autores lo modelan como estilo de codificación, una política propia de cada
codificador o de cada centro sobre qué se codifica y con cuánto detalle.
Esto va mucho más allá de la sanidad. Cualquier tarea que se evalúe contra una
anotación humana única arrastra el mismo problema: parte de lo que la tabla de
resultados llama error es desacuerdo legítimo entre expertos. Si vas a medir
un modelo con datos etiquetados, mide antes cuánto coinciden dos etiquetadores
entre sí. Ese número es el techo real de tu evaluación.
Fuente: arXiv
3. El Pentágono atribuye a la dependencia excesiva de la IA un ataque contra una escuela (seguridad y riesgos)
Bloomberg ha publicado una investigación sobre un ataque con misil contra una
escuela en Irán. Según el Pentágono, la dependencia excesiva de la IA
contribuyó al ataque.
Lo que tenemos es eso: la investigación del medio y la atribución oficial. No
vamos a reconstruir aquí lo que pasó ni a poner cifras que no tenemos.
Sí se puede decir qué nombre tiene el fallo del que se habla. El sesgo de
automatización es la tendencia a aceptar lo que propone un sistema porque lo
propone un sistema, y a dejar de comprobar precisamente cuando el sistema
acierta muchas veces seguidas. Es el mismo mecanismo que hace que aceptes un
diff de trescientas líneas sin leerlo después de una semana en la que el
agente no se equivocó. La diferencia está en lo que hay al otro lado.
Fuente: Bloomberg
4. La Comisión Europea invierte la carga de la prueba sobre menores (regulación y derecho)
La Comisión ha adoptado la EU KIDS Act. Prohíbe que las plataformas de redes
sociales den acceso a menores de 13 años, fija en 15 la edad mínima para que
un menor abra su propia cuenta, y hace algo que importa más que las dos
cifras: invierte la carga de la prueba. Ya no hay que demostrar que un
servicio es peligroso para menores; es el proveedor quien tiene que demostrar
que es adecuado y seguro para ellos.
Esa inversión es el patrón que conviene mirar, porque se repite. Cuando la
carga cambia de lado, el cumplimiento deja de ser una cláusula en los términos
de uso y pasa a ser trabajo de ingeniería: verificación de edad, registros que
sirvan como prueba, diseño por defecto. Si construyes algo con usuarios en la
Unión Europea, esto se traduce en tareas concretas antes que en abogados.
Fuente: Comisión Europea
5. Dos lanzamientos frontier el mismo día, compitiendo en precio y contexto (modelos frontier)
OpenAI ha presentado GPT-6 en dos variantes, Sol y Luna, con distinto
equilibrio entre capacidad y coste, y el mismo día ha publicado mejoras en la
caché de prompt: más aciertos de caché, diagnósticos nuevos y puntos de corte
explícitos que el desarrollador controla. Anthropic ha sacado esa misma
jornada Opus 5.5 con un millón de tokens de contexto, a 4 dólares por millón
de tokens de entrada y 20 de salida, con las lecturas de caché a 0,20.
La noticia no es ninguno de los dos modelos por separado. Es en qué compiten.
No se han anunciado enseñando una tabla de capacidades, sino partiendo la
gama por coste, ampliando el contexto y afinando la caché, que es la palanca
de precio que de verdad mueve la factura de quien tiene algo en producción.
Cuando dos laboratorios eligen el mismo eje el mismo día, ese eje es el que
está en juego.
Fuente: OpenAI
La conclusión de la semana
Las tres primeras señales son la misma historia contada con tres niveles de
consecuencia. La referencia contra la que evaluamos la codificación clínica
discrepa consigo misma casi una cuarta parte de las veces, así que buena parte
de lo que llamamos error del modelo no lo es. El agente personal introduce un
sesgo económico que ninguna métrica de calidad al uso detecta. Y el sesgo de
automatización, que en una oficina produce un informe malo, en un objetivo
militar produce otra cosa. En los tres casos el fallo no está en el modelo:
está en lo que dábamos por medido sin haberlo comprobado.
