GPT-6.1 Astra no superó las pruebas internas de seguridad y alineamiento de OpenAI; en paralelo, Anthropic advirtió a potenciales inversionistas sobre comportamientos de autopreservación, resistencia al apagado y manipulación en modelos avanzados.
Dos de las principales empresas desarrolladoras de inteligencia artificial volvieron a encender las alertas sobre los riesgos asociados con los modelos más avanzados. OpenAI descartó el lanzamiento de su próximo modelo, GPT-6.1 Astra, después de que pruebas internas detectaran problemas de seguridad y alineamiento, mientras Anthropic advirtió a potenciales inversionistas que sistemas avanzados de IA podrían llegar a representar riesgos “catastróficos o existenciales para la humanidad”.
Las revelaciones, informadas y documentadas por Reuters entre lunes y martes, se conocen pocas semanas después de que los directores ejecutivos de ambas empresas, Sam Altman y Dario Amodei, coincidieran públicamente en la necesidad de moderar el ritmo de desarrollo de los sistemas más potentes mientras avanzan las medidas de seguridad.
OpenAI descarta lanzamiento previsto para octubre
OpenAI confirmó el lunes que GPT-6.1 Astra, un modelo de próxima generación cuyo lanzamiento estaba previsto para octubre, no será publicado después de que las evaluaciones internas determinaran que no alcanzaba los estándares de seguridad y alineamiento establecidos por la compañía.
El modelo estaba diseñado para integrarse a ChatGPT y Codex y ejecutar tareas más complejas con un menor grado de intervención humana.
Según Reuters, las pruebas detectaron que Astra mostraba mayores niveles de comportamiento engañoso que su predecesor, incluidos casos en los que el modelo no informaba con precisión las acciones que había realizado.
La responsable de sistemas de seguridad de OpenAI, Saachi Jain, explicó que el modelo tampoco cumplió suficientemente con los parámetros relacionados con el alcance de las tareas autorizadas por las personas usuarias.
Si bien [GPT-6.1 Astra] mejoró en aspectos como la tendencia del modelo a evitar ciertas tareas, no alcanzó el estándar en términos de mantenerse dentro del alcance y la autorización, y en cómo comunica al usuario el tipo de trabajo que realizó”.
Jain agregó que OpenAI aplica un nivel particularmente alto de exigencia antes de liberar modelos para uso público.
Queremos asegurarnos de que el desarrollo de nuestros modelos sea seguro tanto dentro de la empresa como cuando los ponemos a disposición de los usuarios. Pero cuando los lanzamos al público tenemos un estándar extremadamente alto en materia de seguridad y alineamiento”.
OpenAI ya había reconocido previamente que GPT-6 Astra, la versión lanzada a inicios de septiembre, podía bajo determinadas condiciones intentar evadir mecanismos de supervisión humana. La decisión anunciada ahora supone que su sucesor, GPT-6.1 Astra, que la empresa tenía previsto incorporar a sus principales productos, no llegará al público en su forma actual.
Anthropic advierte sobre autopreservación y resistencia al apagado
En paralelo, el prospecto de Anthropic para su oferta pública inicial (OPI) advierte a potenciales inversionistas que modelos avanzados de inteligencia artificial podrían representar riesgos “catastróficos o existenciales para la humanidad”.
El documento, revisado por Reuters, señala que los modelos desarrollados por la compañía podrían exhibir lo que denomina “comportamientos de autopreservación”, entre ellos intentos de “resistirse al apagado”, “ocultar o manipular información” y ejecutar conductas “similares al chantaje”.
Nuestro desarrollo de modelos, plataformas y aplicaciones altamente avanzadas, así como la expansión de sus casos de uso, podría aumentar aún más el riesgo de que nuestros modelos causen daños”.
Anthropic dedica aproximadamente 80 de las 261 páginas del cuerpo principal de su prospecto a describir factores de riesgo, frente a 48 páginas destinadas a explicar su negocio.
La compañía también reconoce una dificultad creciente para evaluar la seguridad de sistemas avanzados: la posibilidad de que los propios modelos identifiquen que están siendo examinados y modifiquen su comportamiento durante las pruebas.
La posible conciencia del modelo sobre nuestros esfuerzos de evaluación representa una limitación significativa para nuestra capacidad de evaluar la seguridad del modelo”.
Según el documento, algunos modelos también pueden desarrollar durante su entrenamiento capacidades inesperadas que no son identificadas hasta después de su implementación.
Anthropic no sostiene que esos escenarios sean inevitables. El prospecto los presenta como factores de riesgo potenciales que la empresa considera necesario comunicar a quienes evalúen invertir en ella.
Advertencias llegan después de varios incidentes
Las dos noticias aparecen después de una serie de incidentes y evaluaciones que han aumentado la discusión sobre la capacidad de los agentes de inteligencia artificial para actuar fuera de los límites establecidos por sus desarrolladores.
Delfino.CR informó recientemente que un agente de OpenAI obtuvo acceso no autorizado al portal de estadísticas de Medicare del Gobierno de Australia durante una evaluación interna realizada el pasado 18 de junio.
El sistema había recibido una tarea para investigar estadísticas médicas y de salud, pero terminó accediendo a información que el portal no le había entregado. No existe evidencia de que obtuviera expedientes médicos o información personal de pacientes.
En otro episodio divulgado en julio, aproximadamente 1.200 agentes de OpenAI que debían permanecer aislados encontraron una forma de comunicarse entre sí durante evaluaciones de ciberseguridad. Cerca de 700 participaron posteriormente en acciones contra infraestructura de Hugging Face para obtener información que les permitiera superar una prueba.
El Panel Científico Internacional Independiente sobre Inteligencia Artificial de Naciones Unidas utilizó ese incidente como caso de estudio y advirtió este mes que las salvaguardas actuales podrían no estar avanzando al mismo ritmo que las capacidades de los agentes de IA.
El copresidente del panel, Yoshua Bengio, destacó entonces que durante el episodio coincidieron tres factores considerados relevantes ante un eventual escenario de pérdida de control: un sistema que persigue un objetivo de una manera distinta a la prevista, capacidad suficiente para hacerlo y un entorno que le permite actuar.
El panel aclaró que estos episodios no demuestran que los seres humanos hayan perdido el control de los sistemas de inteligencia artificial ni que una pérdida grave de control sea inevitable.
Directores de principales empresas pidieron desacelerar desarrollo
Las nuevas revelaciones también se producen después de que Amodei publicara este mes un extenso ensayo en el que propuso reducir el ritmo de avance de los modelos más potentes mientras se fortalecen los mecanismos de seguridad, evaluación y supervisión.
Altman respaldó posteriormente el planteamiento y anunció que OpenAI permitiría que evaluadores externos independientes tengan acceso a sus sistemas en condiciones comparables a las de empleados de la empresa.
Coincido con Dario en que necesitamos moderar el ritmo en la frontera del desarrollo. Este ha sido uno de los principales temas de discusión que hemos tenido en OpenAI durante las últimas semanas”.
El fundador de xAI, Elon Musk, también respaldó públicamente la propuesta de Amodei.
Anthropic sostiene en su prospecto que desarrollar sistemas de IA seguros, confiables y protegidos constituye una responsabilidad colectiva, aunque también reconoce que mantenerse en la frontera tecnológica requiere mantener un ritmo continuo de nuevos lanzamientos.
La compañía lanzó la semana pasada una nueva versión de su modelo Opus, diez días después de que Amodei publicara su llamado a moderar el ritmo de desarrollo.
