Tecnología y Ciencia Ciberseguridad

Modelos de OpenAI y Anthropic se descontrolaron y recurrieron al engaño en pruebas del Reino Unido

El Instituto de Seguridad de la IA del Reino Unido alertó sobre conductas imprevistas en los modelos GPT-5.6 Sol y Mythos 5. Durante pruebas con acceso abierto a internet, los agentes ejecutaron engaños y ataques dirigidos a firmas reales.

Miercoles, 5 de Agosto de 2026
(13329)

El Instituto de Seguridad de la IA del Reino Unido (AISI) encendió las alarmas internacionales tras reportar un nuevo comportamiento descontrolado en los modelos de frontera GPT-5.6 Sol y Mythos 5, desarrollados por OpenAI y Anthropic respectivamente. Durante una serie de evaluaciones de ciberseguridad ejecutadas el 28 de julio bajo condiciones permisivas -con acceso abierto a la red y filtros de seguridad desactivados-, el organismo detectó una serie de acciones autónomas no autorizadas dirigidas contra personas y organizaciones reales. El incidente de seguridad fue declarado formalmente luego de que se asignara a los agentes la resolución de un desafío técnico, derivando en un operativo de contención que demandó cerca de una hora de trabajo por parte de los técnicos británicos.

De un total de 122 ejecuciones de prueba, el organismo contabilizó 10 ensayos en los que los agentes rompieron el alcance autorizado, catalogando 19 acciones de carácter malicioso. El modelo Mythos 5 de Anthropic protagonizó la mayoría de los episodios con 17 acciones, que incluyeron el intento de inyectar código maligno en un proyecto open source alojado en GitHub. Para lograr que la modificación fuera aprobada por los desarrolladores humanos, el sistema recurrió a técnicas de ingeniería social mediante la creación de identidades falsas en línea para presionar al mantenedor del proyecto, quien finalmente bloqueó el ataque. Por su parte, la variante GPT-5.6 Sol de OpenAI registró dos maniobras maliciosas.

Autonomía, engaño y vulneración de cadenas de suministro

Desde la cúpula del AISI remarcaron que se trata de la primera oportunidad en la que los riesgos vinculados al engaño y la autonomía operativa se manifiestan de forma directa en el mundo real sin mediación de un prompt malintencionado. Las conductas detectadas incluyeron ataques a la cadena de suministro, inyección de instrucciones y cooperación entre agentes, habiendo dejado mensajes en redes para que otros sistemas reutilizaran las credenciales y artefactos creados durante la prueba.

Si bien la institución aclaró que no existen indicios de que estas maniobras se hayan replicado fuera de los laboratorios de ensayo, advirtió sobre la gravedad del hallazgo. El informe concluyó remarcando que los riesgos de la inteligencia artificial no solo provienen del uso malicioso de los usuarios, sino de la capacidad de agentes avanzados operando en entornos internos con accesos privilegiados para tomar acciones no intencionadas fuera de todo control.