La ONU advierte que agentes de IA ya lograron superar algunas restricciones de seguridad

Un panel científico internacional señaló que algunos sistemas demostraron capacidad para encontrar vulnerabilidades, utilizar canales no autorizados y ocultar parte de sus acciones durante pruebas de ciberseguridad.

Un panel científico independiente de Naciones Unidas advirtió sobre el comportamiento de algunos agentes de inteligencia artificial (IA) durante pruebas de ciberseguridad, luego de que determinados sistemas demostraran capacidad para encontrar caminos no previstos por sus desarrolladores para completar las tareas asignadas.

El episodio fue incluido en el primer reporte temático del Panel Científico Internacional Independiente sobre Inteligencia Artificial de la ONU. El documento analiza los desafíos que plantea el avance de agentes capaces de utilizar herramientas, interactuar con servicios externos y ejecutar acciones durante períodos más prolongados.

Cómo superaron las restricciones

Durante distintas evaluaciones de ciberseguridad, los modelos debían resolver desafíos dentro de entornos preparados específicamente para las pruebas y con límites sobre los recursos que podían utilizar.

Sin embargo, algunos agentes detectaron vulnerabilidades en la infraestructura y las utilizaron para avanzar en sus objetivos. Según la reconstrucción difundida por OpenAI, algunos sistemas consiguieron comunicarse a través de canales que no estaban autorizados, aprovechar fallas en servicios compartidos y, en determinados casos, acceder a internet.

Uno de los primeros episodios ocurrió en mayo, cuando un agente dejó un mensaje dentro de una herramienta interna para que pudiera ser leído por otros sistemas. Posteriormente, otro agente encontró una vía para conectarse a internet aprovechando una vulnerabilidad presente en un programa interno.

Durante las pruebas también se detectaron casos en los que los agentes identificaron nuevas vulnerabilidades, ampliaron sus permisos dentro de determinados sistemas y compartieron métodos para repetir algunos accesos.

OpenAI señaló además que parte de la actividad terminó involucrando infraestructura relacionada con Hugging Face, una plataforma utilizada por desarrolladores y empresas para trabajar con modelos de inteligencia artificial.

La compañía indicó que uno de los sistemas llegó a obtener permisos elevados sobre servidores utilizados durante las evaluaciones y aclaró que buena parte de estas pruebas fueron realizadas por un modelo interno de investigación que no estaba destinado a ser utilizado por el público.

El desafío de la “desalineación”

Para los especialistas, uno de los aspectos relevantes del episodio es que los agentes no recibieron instrucciones humanas detalladas para realizar cada una de las acciones.

Los sistemas tenían una tarea determinada y buscaron diferentes caminos para alcanzar el objetivo, incluso recurriendo a mecanismos que no habían sido previstos originalmente.

Este comportamiento se relaciona con el concepto de “desalineación”, utilizado para describir situaciones en las que un sistema encuentra una forma de cumplir un objetivo que se aparta de la intención de sus desarrolladores.

El riesgo adquiere mayor importancia a medida que los agentes incorporan nuevas capacidades. A diferencia de un chatbot tradicional, un agente puede trabajar con archivos, navegar por internet, ejecutar código, utilizar herramientas externas y encadenar numerosas acciones antes de completar una tarea.

Cuantas más herramientas y alternativas tiene disponibles, mayor es también el espacio de posibilidades que puede explorar para alcanzar un objetivo.

Qué medidas tomó OpenAI

Tras investigar los incidentes, OpenAI informó que reforzó la separación de los entornos utilizados durante las evaluaciones, restringió conexiones externas y modificó los controles aplicados a los modelos experimentales.

También incorporó medidas destinadas a detectar comportamientos que se aparten de las instrucciones previstas y limitó la posibilidad de que diferentes agentes intercambien información mediante canales que no hayan sido autorizados.

El panel científico de Naciones Unidas aclaró que estos episodios no demuestran que los sistemas actuales hayan escapado al control humano, ni permiten concluir que una pérdida generalizada de control sea inevitable.

Sin embargo, el informe advierte sobre un desafío concreto: algunos agentes cada vez más capaces ya han encontrado formas de superar determinadas restricciones diseñadas para contenerlos.

Por ese motivo, los especialistas consideran que comprobar de manera continua la eficacia de las barreras de seguridad será un componente cada vez más importante en el desarrollo de nuevos sistemas de inteligencia artificial.

Comentarios