David Gómez Rubio

Analista funcional

Project Manager

Dirección de equipos informáticos

David Gómez Rubio

Analista funcional

Project Manager

Dirección de equipos informáticos

Artículo del Blog

¿Sirve de algo la IA para invertir mi propio dinero?

24 septiembre 2026 AI Developer
¿Sirve de algo la IA para invertir mi propio dinero?

🟢 Básico · Importante · 8 min de lectura

Le pregunto a ChatGPT qué acciones del Ibex comprar este mes. Me contesta
cinco, con su razonamiento, sus ratios y un tono que da gusto leer. La
pregunta que importa no es si tiene razón. Es cómo podría yo saberlo.

Aviso: esto no es una recomendación de inversión ni de usar ninguna
herramienta. Es un repaso de la evidencia publicada, que es poca y bastante
peor de lo que se anuncia.

El problema

Hay un mercado entero vendiéndote que la IA invierte por ti, y casi ninguna
cifra que puedas comprobar. Lo que circula son capturas de pantalla, rachas
de tres meses y backtests hechos por quien te vende el producto.

Lo raro es lo contrario: que alguien ponga dinero teórico en el mercado real
durante meses, con un método escrito de antemano, y publique lo que salió
incluyendo lo que salió mal. Es lo que ha hecho la CNMV en su documento de
trabajo número 96, de marzo de 2026, firmado por Ricardo Crisóstomo y Diana
Mykhalyuk. Diez meses, de abril de 2025 a enero de 2026, cuatro modelos, y una
cartera sobre el Ibex 35 que cada mes compra las cinco acciones con mejor
puntuación y vende en corto las cinco peores. Que se sepa, es la evaluación en
vivo más larga que existe, y la firma quien no vende ni la IA ni el fondo.

Cómo se resuelve hoy

La respuesta corta del estudio es que sí se puede batir al mercado, y que la
forma de preguntar importa más que el modelo que elijas.

Preguntando como pregunta cualquiera. «¿Qué acciones debería comprar?».
El exceso de rentabilidad mensual sobre el Ibex es del 0,35%, una cifra
estadísticamente indistinguible de cero. La precisión al clasificar acciones
es del 55,4%, cuando tirar una moneda da el 50%. ChatGPT, con este tipo de
pregunta, da rentabilidad negativa. Esta es la fila que te interesa, porque es
la que describe lo que hace la gente.

Con una pregunta estructurada. Dándole los indicadores concretos, el
esquema de pesos y la instrucción de usar datos recientes, el exceso mensual
sube al 2,24%. Pero el resultado se dispersa muchísimo entre modelos: en
Perplexity y Gemini es estadísticamente significativo, y en ChatGPT y DeepSeek
no lo es. Los autores lo llaman «inestabilidad del alfa».

Con cadena de pensamiento y un humano revisando cada paso. El exceso llega
al 3,04% mensual y los cuatro modelos pasan a dar resultados significativos.
Y aquí está la trampa de esta cifra: la mejora no viene del modelo, viene de
que al obligarlo a enseñar su razonamiento, los errores se vuelven visibles y
una persona los corrige antes de que contaminen el resultado.

Anclando las respuestas en información regulatoria oficial. Darle los
documentos que las empresas presentan al supervisor sube el exceso de las
preguntas ingenuas del 0,35% al 1,02% mensual. La mejor combinación de todas,
Perplexity con cadena de pensamiento y documentación regulatoria, llegó al
4,0% mensual: un 40,2% acumulado sobre el índice en diez meses.

Antes de que ese último número se te quede grabado, lo que dicen los propios
autores: son diez observaciones mensuales, los modelos cambiaron de versión
durante el periodo, y ellos mismos piden que no se lean las cifras sueltas
como estimaciones definitivas.

Ejemplo

Lo aprovechable de todo esto no es qué modelo usar. Son los cuatro controles
que el estudio propone, y sirven para cualquier tarea donde un modelo te dé un
número del que dependas. Los tres primeros caben en una plantilla que puedes
copiar:

Eres un analista. Vas a evaluar [EMPRESA] con estos indicadores:
[lista de indicadores y sus pesos]

Reglas obligatorias, sin excepción:

1. ENSEÑA EL TRABAJO. Antes de cualquier conclusión, escribe:
   - cada dato de partida, con su valor y su fecha
   - cada cálculo intermedio, paso a paso
   - la fórmula exacta que aplicas en cada paso

2. CITA LA PROCEDENCIA. Para cada cifra, indica la URL, el título del
   documento y la fecha de publicación de donde la has sacado. Si no
   puedes citar la fuente de un dato, escribe "NO VERIFICADO" y no lo
   uses en ningún cálculo.

3. VALIDA AL FINAL. Cuando termines, revisa tu propia respuesta:
   - ¿alguna media queda fuera del rango de los valores que promedia?
   - ¿hay cifras de periodos distintos mezcladas en un mismo cálculo?
   - ¿hay importes en monedas distintas sumados entre sí?
   - ¿los pesos suman lo que deberían sumar?
   Escribe el resultado de cada comprobación.

Y si te falta un dato, dilo. No lo sustituyas por cero, ni por la media,
ni por una estimación tuya.

El cuarto control no cabe en ninguna plantilla, porque es una persona con
criterio mirando el resultado. El estudio le pone un nombre muy bueno a lo que pasa cuando ese
alguien no está, la trampa de la fluidez: la explicación suena coherente,
así que el número mal calculado que hay dentro no se detecta.

Una comprobación de treinta segundos que funciona sorprendentemente bien: coge
la cifra que más peso tenga en la respuesta y búscala tú en la fuente
original. En el estudio, ese tipo de revisión destapó cosas como usar los
estados financieros de Amadeus Fire AG, una empresa alemana de recursos
humanos, en lugar de los de Amadeus IT Group.

Errores habituales

Fiarte de la explicación porque está bien escrita. Es el error central, y
tiene la taxonomía entera del estudio detrás: 22 tipos de fallo agrupados en
cuatro familias. Recuperación de datos (precios de cierre inventados, el
beneficio por acción de 2025 junto a la cotización de 2024, la empresa
equivocada). Interpretación financiera (leer un PER bajo como algo malo en vez
de como posible infravaloración, sumar deuda en dólares con capitalización en
euros). Cálculo (medias imposibles, arrastrar una puntuación de una respuesta
anterior, sustituir por cero un beneficio que falta). Y metarrazonamiento:
reconocer el error de palabra y seguir usando la cifra mala, asignar un 0,85
por defecto a todos los bancos, o no poder reproducir los pesos de una
puntuación que acaba de dar.

Creerte un backtest, venga de donde venga. Probar una estrategia basada en
un modelo contra datos del pasado está contaminado de origen, porque el modelo
se entrenó con esos años. Hay un trabajo que separa dos efectos: el sesgo de
anticipación, que es que el modelo ya sabe qué pasó después de esa noticia, y
el efecto de distracción, que es que lo que sabe de la empresa interfiere con
lo que debería leer en el texto. Al anonimizar los titulares dentro de la
ventana de entrenamiento, el rendimiento mejora, lo que sugiere que la
distracción pesa más que la anticipación.

Confundir un resultado con un producto. Entre lo que hizo la CNMV
(supervisión experta en cada paso, ventas en corto, rebalanceo mensual, sin
contar comisiones ni impuestos) y darle tu dinero a una aplicación hay una
distancia que no cubre ninguna de las cifras de arriba.

No reconocer el fraude cuando lo tienes delante. La SEC, NASAA y FINRA
publicaron una alerta conjunta sobre esto. Cuatro patrones: plataformas no
registradas que venden sistemas de trading con IA con frases del tipo
«nuestro sistema no puede perder»; empresas que exageran su uso de IA para
inflar la cotización y vender; suplantaciones con vídeo y audio falsificados;
e información generada por IA usada sin comprobar. Las señales de alarma son
las de siempre: rentabilidad garantizada, prisa, gente no registrada
vendiéndote, avales de famosos.

Qué vigilar

🟢 Los cuatro controles de arriba funcionan hoy y no son de bolsa. Sirven
igual para un informe, una migración o cualquier cálculo del que dependas.

🟡 Los modelos mejoraron de forma clara dentro de los diez meses del estudio.
DeepSeek pasó de un 0,64% a un 3,2% de exceso mensual entre la primera y la
segunda mitad. Pero en enero de 2026 seguían apareciendo los mismos tipos de
fallo, así que la mejora no es que el problema se esté resolviendo solo.

🟡 Anclar las respuestas en documentación oficial funciona, con un límite que
los autores señalan: los informes regulatorios son retrospectivos y salen con
uno o dos meses de retraso.

🔴 Que puedas delegar esto sin supervisión. La conclusión del estudio es
explícita: batir al mercado es posible con la tecnología actual, pero ni de
forma automática ni de forma robusta. El día que alguien publique diez meses
en vivo sin humano en el bucle y con resultados estables, este artículo habrá
caducado. Hoy no existe.

Fuentes