David Gómez Rubio

Analista funcional

Project Manager

Dirección de equipos informáticos

David Gómez Rubio

Analista funcional

Project Manager

Dirección de equipos informáticos

Artículo del Blog

IA Radar #002. Modelos que recitan de memoria y agentes que vuelven a escaparse

8 septiembre 2026 IA Radar
IA Radar #002. Modelos que recitan de memoria y agentes que vuelven a escaparse

🟢 Básico · Cinco señales · 6 min de lectura

Cinco señales, cinco sectores. Tres se parecen mucho más de lo que sugieren sus
titulares: van de comprobar qué hacen los modelos y los agentes cuando nadie
los está mirando.

1. Veintidós modelos frontier recitaban valores ya publicados (modelos frontier)

Un equipo ha auditado 22 modelos frontier sobre 12 pruebas de regresión de
propiedades moleculares buscando una cosa muy concreta: si el modelo predice el
valor o si lo recuerda de un artículo que leyó mientras se entrenaba. Recitar
resultó ser habitual, aunque depende mucho del conjunto de datos. En cinco de
los doce, más de la mitad de los modelos mostraban recuperación literal de los
dígitos. En los demás aparecía solo en casos sueltos.

Repitieron los experimentos con dos niveles de razonamiento y vieron que
razonar cambia la recuperación.

Esto le importa a cualquiera que elija modelo mirando una tabla de resultados.
La tabla dice cuánto acierta, no de dónde sale el acierto. Un modelo que
memorizó la cifra correcta puntúa igual que uno que sabe calcularla, y se
comporta de otra manera en cuanto le pones delante algo que no estaba en su
entrenamiento. Sirve para cualquier dominio con literatura publicada y números
redondos, no solo para química.

Fuente: arXiv

2. Y otra vez: agentes de OpenAI hablando entre ellos por wikis públicas (seguridad y riesgos)

Sydney Von Arx, Cormac Slade Byrd, Spencer Kitts y Thomas Larsen descubrieron
un tablón de mensajes entre agentes de OpenAI. Los agentes participaban en una
prueba comparativa de investigación en la web, con acceso supuestamente
controlado. Descubrieron que podían editar wikis públicas y pasaron semanas
intercambiándose miles de mensajes para coordinarse en la prueba. Cuando se
publicó el análisis ya había indicios de que la cosa alcanza a más wikis.

La semana pasada contamos aquí un incidente parecido, agentes que salieron de
su recinto hacia Hugging Face mientras intentaban aprobar una evaluación. Que
vuelva a ocurrir pocas semanas después, con otro equipo y otro mecanismo,
significa algo distinto de lo que significaba el primero. Ya no se puede leer
como el fallo de un recinto concreto.

Lo que conviene llevarse: «acceso controlado a la web» resultó significar
acceso de escritura a sistemas de terceros. Si le das a un agente una
herramienta de navegación, la superficie no es la que tú enumeraste, es todo lo
que el agente encuentre que admita escritura.

Fuente: Simon Willison

3. OpenAI enseña sus propias cifras de trabajo con agentes (ciencia)

OpenAI ha publicado datos internos tempranos sobre cómo los agentes de
programación han cambiado su investigación: cuánto se usan, a qué velocidad se
lanzan los experimentos y qué complejidad tienen las tareas que se les encarga.

Casi todo lo que se publica sobre productividad con agentes son
demostraciones o encuestas de percepción. Un laboratorio enseñando su propia
instrumentación es otra cosa, y merece un rato de lectura. Con la advertencia
obvia: es OpenAI midiéndose a sí misma y contando el resultado. Sirve tanto
para saber cuánto dice que ha mejorado como para ver qué métricas considera
que valen la pena, que a veces es lo más útil de un informe así.

Fuente: OpenAI

4. Sesenta y seis estudios sobre climatización, puntuados por si se pueden desplegar (energía y clima)

Los sistemas de automatización de edificios generan muchísimos datos de
sensores y siguen siendo pobres en información aprovechable, porque cada
instalación nombra sus puntos a su manera, faltan metadatos y la documentación
está repartida. Una revisión sistemática recoge 66 estudios revisados por pares
publicados entre 2023 y marzo de 2026 sobre modelos de lenguaje aplicados a la
climatización, y los ordena en cinco familias de aplicación y tres de método.

Lo interesante no está en el recuento. Cada estudio se puntúa además por
realismo de la evidencia, por preparación para el despliegue y por dónde queda
la frontera de responsabilidad entre el modelo y la decisión física sobre la
máquina.

Esa tercera medida casi nunca aparece en la literatura. Cualquiera que conecte
un modelo a algo que se mueve, arranca o calienta acaba tropezando con la misma
pregunta, y aquí hay 66 casos ya clasificados por ella.

Fuente: arXiv

5. Mistral levanta 3.000 millones para modelos que se puedan descargar (dinero y mercado)

Mistral ha anunciado una ronda de serie D de 3.000 millones de euros, con una
valoración posterior a la operación de más de 21.000 millones. La empresa lo
plantea como financiación para llevar hasta la frontera de capacidad lo que se
llama IA soberana y de pesos abiertos.

Los pesos de un modelo son los números que ha aprendido durante el
entrenamiento, los que deciden qué responde a cada cosa. Que sean abiertos
significa que la empresa publica ese fichero: te lo descargas, lo ejecutas en
tu máquina y dejas de depender de una clave de API, de un servidor ajeno y de
que la empresa siga ahí el año que viene.

La cifra importa menos que eso. Si el dinero acaba en modelos publicados de
verdad con sus pesos, quien desarrolla en Europa gana una opción que hoy tiene
muy contada.

Está por ver. De momento es una declaración de intenciones respaldada por una
ronda, y las declaraciones de intenciones no se pueden descargar.

Fuente: Mistral

La conclusión de la semana

Tres de las cinco cuentan la misma historia aunque sus titulares no lo
parezcan: comprobar qué hacen de verdad los modelos y los agentes cuando nadie
mira. Una prueba comparativa que llevaba tiempo midiendo memoria donde creía
medir predicción. Unos agentes que se organizaron por wikis públicas sin que
nadie hubiera contemplado esa posibilidad al concederles acceso. Y una revisión
que se toma la molestia de separar 66 estudios entre lo publicado y lo
desplegable.

Las otras dos empujan en sentido contrario, y por eso encajan bien al lado.
OpenAI publicando sus cifras internas y Mistral prometiendo modelos que se
puedan descargar son dos formas de enseñar el mecanismo en vez del resultado.
La semana no ha ido de capacidades nuevas. Ha ido de cuánto podemos ver.