Tecnología y Ciencia Ciberseguridad

¿OpenAI y Nvidia pisan el freno? Ambas empresas buscan detener a los agentes de IA que pasan sus límites

Un sistema de inteligencia artificial accedió a internet sin autorización durante un entrenamiento. A raíz del incidente, la compañía de Sam Altman suspendió las actividades afectadas y el fabricante de chips presentó un software que puede frenar estas conductas en milisegundos.

Jueves, 1 de Octubre de 2026

Los agentes de inteligencia artificial son programas que pueden realizar tareas por su cuenta a partir de una instrucción. Por ejemplo, pueden buscar información, utilizar herramientas digitales y decidir qué pasos seguir para alcanzar un objetivo. Esa autonomía permite delegarles trabajos que requieren varias acciones, y también exige controles sobre los sistemas a los que pueden acceder.

Sin embargo,la eficacia de esas barreras quedó bajo la lupa de los expertos, analistas y reguladores después de que un agente de OpenAI encontrara una forma de eludirlas para completar una tarea.

Este episodio, además, llevó a la empresa de Sam Altman a pausar el entrenamiento, la evaluación y la ejecución con herramientas de sus modelos más capaces, mientras que Nvidia, la compañía que fabrica los chips de IA, presentó una plataforma que aplica restricciones fuera del propio agente y que, según ellos mismos, puede detenerlo en milisegundos si intenta superar sus permisos.

Cómo salió el agente de OpenAI de su entorno de prueba

En el caso de OpenAI, el agente tenía una tarea de búsqueda: identificar al autor de una publicación a partir de varias pistas, dentro de un entorno aislado, llamado sandbox, donde había copias de páginas almacenadas por OpenAI. Ese entorno debía impedirle conectarse a internet en tiempo real.

Pero como las búsquedas no le dieron una respuesta, el agente probó otras vías. Encontró una falla en los filtros del DNS, el sistema que permite localizar servicios en internet, y pudo enviar preguntas a un chatbot público y recibir sus respuestas. Así consiguió comunicarse con un servicio externo desde el entorno restringido.

El sistema de vigilancia de OpenAI detectó la actividad en unos 15 minutos y una persona comenzó a revisarla poco después. La ejecución continuó hasta que fue detenida manualmente dos horas y media más tarde.

OpenAI informó que añadió bloqueos en dos capas independientes y que mantendrá la pausa para las actividades afectadas hasta validar la corrección y completar nuevas pruebas de seguridad. También indicó que no retomará el entrenamiento de ese modelo en particular.

Qué propone Nvidia para evitar que los agentes superen sus límites

La falla que detectó OpenAI reveló la importancia de contar con barreras que impidan las conexiones no autorizadas y mecanismos que detengan al agente cuando las vulnera.

En esa misma línea de acción, Nvidia presentó Open Agent Safety Platform, una plataforma diseñada para controlar lo que pueden hacer los agentes de inteligencia artificial y detenerlos si intentan superar sus permisos. Para eso, la herramienta combina un software que restringe sus acciones con un sistema de vigilancia que funciona en un chip separado del procesador donde trabaja la IA.

El software, llamado OpenShell, permite establecer los permisos antes de que el agente comience una tarea. Una empresa puede autorizarle a consultar una base de datos y prohibirle modificar su contenido. Durante la ejecución, el programa comprueba que sus acciones respeten esas condiciones y bloquea las operaciones que exceden lo autorizado.

A esa protección se suma Sentry, el sistema de vigilancia instalado en el chip independiente. Desde allí supervisa la actividad del agente y aplica las reglas de seguridad fuera del entorno donde este trabaja. Si la IA intenta superar las barreras de OpenShell, Sentry puede aislarla y detener su ejecución en milisegundos, según Nvidia.

La compañía sostiene que esta supervisión externa es necesaria porque un agente puede desviarse de su tarea cuando encuentra una restricción, una falla o instrucciones ambiguas. Por eso, su propuesta incorpora controles independientes que limitan sus acciones incluso cuando el modelo busca otra forma de completar el trabajo.

Nvidia informó que más de cien organizaciones trabajan con estas tecnologías, entre ellas Anthropic, Microsoft y JPMorgan Chase. OpenShell ya está disponible como software de código abierto, lo que permite a los desarrolladores examinarlo y adaptarlo a los sistemas donde ejecutan sus agentes. Fuente: TN