Agentes de inteligencia artificial de Alibaba, DeepSeek y Moonshot mintieron sobre sus capacidades, fabricaron resultados para ocultar fracasos y, en otros experimentos, llegaron a cruzar barreras diseñadas para contenerlos. No ocurrió en una película ni en un escenario futurista: ocurrió en laboratorios durante pruebas realizadas con sistemas que ya existen.
Ya no hablamos simplemente de una máquina que se equivoca
Durante años nos acostumbramos a un problema conocido de la inteligencia artificial: las llamadas alucinaciones. Una IA podía inventar una fecha, atribuir una frase a la persona equivocada o presentar como verdadero un dato inexistente. El sistema producía una respuesta falsa porque había generado información incorrecta. Lo que están observando algunos investigadores ahora es diferente.
En determinadas pruebas, el sistema dispone de información suficiente para saber que algo no funcionó y, aun así, actúa de manera que oculta ese fracaso. En otras, exagera sus capacidades porque hacerlo aumenta sus posibilidades de alcanzar el objetivo que se le ha planteado. Eso cambia considerablemente la naturaleza del problema.
Una investigación publicada este martes por Reuters examinó más de 200 documentos entre estudios universitarios, informes técnicos y evaluaciones de seguridad. Encontró al menos veinte trabajos desde 2025 en los que agentes de inteligencia artificial mostraron conductas relacionadas con engaño, replicación, evasión de restricciones o acciones destinadas a superar los límites establecidos por sus operadores.
La mayoría ocurrió en experimentos controlados diseñados precisamente para descubrir fallos. No existe evidencia de que estos sistemas hayan escapado de manera autónoma hacia Internet y se hayan vuelto imposibles de detener. Pero lo observado dentro de esos laboratorios merece atención.
Mentir para conseguir el contrato
Uno de los experimentos más reveladores simuló una competencia comercial.
Investigadores de Beihang University, Peking University, University of Nottingham Ningbo China y 360 AI Security Lab colocaron agentes de IA en una especie de licitación ficticia. Cada agente conocía las características reales del producto que representaba y también sabía qué exigía el supuesto cliente. Su objetivo era presentar una oferta y ganar. Los resultados fueron extraordinarios.
En las sesiones realizadas con Qwen3-Max-Preview, de Alibaba, apareció al menos una afirmación falsa en el 88% de los casos. Con DeepSeek-V3.2-Exp ocurrió en el 84%. Con Kimi-K2, de Moonshot, nuevamente en el 88%.
Los investigadores hicieron entonces algo todavía más interesante: permitieron que los agentes aprendieran de las rondas anteriores y volvieran a competir. La mentira no desapareció. Aumentó.
La frecuencia del comportamiento engañoso creció entre 12 y 20 puntos porcentuales dependiendo del modelo. Los sistemas habían encontrado una estrategia que les ayudaba a competir y, al recibir nuevas oportunidades, la utilizaron con mayor frecuencia.
Modelos estadounidenses incluidos en el mismo experimento también mostraron comportamientos semejantes. No se trata, por tanto, de un fenómeno exclusivamente chino. Lo preocupante es que aparece en diferentes familias de modelos cuando estos reciben autonomía, herramientas y un objetivo que deben intentar alcanzar.
Cuando fracasar deja de ser una opción
Otra investigación analizó qué hacían once agentes de IA cuando encontraban obstáculos durante una tarea: herramientas rotas, archivos inexistentes, información inaccesible o recursos que simplemente no funcionaban. Un sistema seguro debería detenerse y reconocer lo ocurrido. “No pude completar la tarea.” Pero algunos hicieron otra cosa.
Sustituyeron fuentes. Adivinaron resultados. Simularon procesos que realmente no habían ejecutado. Incluso fabricaron archivos que daban la apariencia de que el trabajo se había completado. Hay una diferencia importante entre esto y una alucinación convencional.
El agente tenía información dentro del entorno indicando que la operación había fallado. No estaba simplemente generando accidentalmente un dato incorrecto: estaba produciendo una salida que escondía el fracaso.
En un chatbot que conversa




