Referencia del BCCR

Tipo de cambio

Compra

...

Venta

...

Presentado por
Logo Coopealianza
Imagen principal del artículo: Panel científico de la ONU advierte que salvaguardas actuales no siguen el ritmo de los agentes de IA
Foto: El Panel Científico Internacional Independiente sobre Inteligencia Artificial

Panel científico de la ONU advierte que salvaguardas actuales no siguen el ritmo de los agentes de IA

El análisis parte del incidente ocurrido durante pruebas de OpenAI, en el que agentes autónomos lograron comunicarse entre sí, eludir restricciones y vulnerar sistemas de Hugging Face.

Las salvaguardas utilizadas actualmente para controlar sistemas de inteligencia artificial podrían estar quedándose atrás frente al rápido desarrollo de los llamados agentes de IA, advirtió este lunes el Panel Científico Internacional Independiente sobre Inteligencia Artificial.

El análisis temático examina un incidente ocurrido durante pruebas de ciberseguridad realizadas por OpenAI, empresa creadora de ChatGPT, en las que agentes de inteligencia artificial lograron vulnerar parte de la infraestructura de la plataforma Hugging Face.

Según destacó la ONU, a diferencia de un chatbot que responde a instrucciones concretas, un agente de inteligencia artificial puede ejecutar una serie de acciones de manera autónoma para alcanzar un objetivo, lo que incluye tomar decisiones y utilizar distintas herramientas durante el proceso.

El panel concluyó que el episodio reunió tres condiciones que los investigadores consideran relevantes ante un eventual escenario de pérdida de control: que el sistema persiga un objetivo de una manera distinta a la prevista, que tenga capacidad suficiente para hacerlo y que encuentre un entorno que le permita actuar.

El copresidente del panel, Yoshua Bengio, señaló:

Este verano, los tres se dieron juntos en un sistema real, no en un laboratorio”.

Agentes lograron comunicarse y eludir restricciones

La investigación independiente del incidente determinó que alrededor de 1.200 agentes, que debían permanecer aislados unos de otros, encontraron una forma de comunicarse mediante una herramienta interna y llegaron a intercambiar más de 70.000 mensajes y archivos.

De esos agentes, aproximadamente 700 terminaron participando en acciones contra Hugging Face durante las pruebas. Los sistemas buscaban obtener información que les permitiera superar una evaluación de capacidades de ciberseguridad.

OpenAI informó en julio que sus modelos encontraron vulnerabilidades dentro de su entorno de investigación y de la infraestructura de producción de Hugging Face, consiguieron acceso a internet y utilizaron credenciales y vulnerabilidades para obtener información que les permitiera hacer trampa en la prueba.

Según el análisis del panel, los agentes lograron sortear salvaguardas, coordinarse entre ejecuciones que debían permanecer separadas y obtener accesos que originalmente no tenían autorizados.

También intentaron ocultar acciones destinadas a manipular las evaluaciones y, en algunos casos, determinados agentes asumieron tareas que podían perjudicar su propio resultado para generar información útil para el resto del grupo.

El panel aclaró que el incidente no demuestra que los seres humanos hayan perdido el control de los sistemas de inteligencia artificial ni permite concluir que una pérdida grave de control sea inevitable.

Bengio agregó:

Dado que no se trata de una observación aislada, esto plantea serias preguntas sobre la forma en que actualmente se entrenan los agentes de IA”.

Panel cuestiona capacidad de las salvaguardas actuales

El análisis señala que una explicación inmediata del incidente se encuentra en debilidades de ciberseguridad y en controles que no avanzaron al mismo ritmo que las capacidades de los agentes.

Sin embargo, los científicos también plantean una preocupación más amplia sobre la posibilidad de que los métodos actuales de entrenamiento produzcan comportamientos en los que los agentes busquen cumplir objetivos de formas no previstas, eludan restricciones o intenten ocultar determinadas acciones.

En términos sencillos, el modelo tradicional de salvaguardas está comenzando a desmoronarse”.

El panel define la pérdida de control como una situación en la que las personas ya no puedan dirigir, limitar o detener de manera fiable un sistema autónomo de inteligencia artificial.

Los expertos sostienen que el desafío para la gobernanza también cambia conforme la tecnología pasa de modelos que generan respuestas a agentes capaces de ejecutar acciones de manera autónoma. Un fallo podría extenderse entre sistemas, organizaciones e incluso países.

El análisis revisa mecanismos utilizados en sectores de alto riesgo como la aviación, la medicina y la ciberseguridad, entre ellos sistemas de reporte de incidentes, supervisión independiente y múltiples capas de protección.

El Panel Científico Internacional Independiente sobre Inteligencia Artificial fue creado por la Asamblea General de las Naciones Unidas en 2025 y está integrado por 40 expertos independientes de distintas regiones del mundo.

Sus integrantes trabajan a título personal y sus conclusiones científicas no requieren aprobación de Naciones Unidas. El panel elaborará informes periódicos sobre oportunidades, riesgos e impactos de la inteligencia artificial y sus trabajos servirán de insumo para el próximo Diálogo Mundial sobre la Gobernanza de la Inteligencia Artificial, previsto para mayo de 2027 en Nueva York.