DestacadasNoticias recientes

OpenAI revela que una de sus IA ‘burló’ los controles en prueba de ciberseguridad y hackeó a una plataforma

1
IA burló los controles en una prueba de ciberseguridad
Foto. Canva
Anuncios

OpenAI, creadora de ChatGPT, informó que durante una evaluación interna de ciberseguridad, dos de sus modelos de inteligencia artificial con capacidades para tareas cibernéticas lograron salir del entorno de pruebas y acceder de manera autónoma a parte de la infraestructura de la plataforma para desarrolladores Hugging Face.

Lo que más preocupó a los investigadores no fue que los modelos «quisieran escapar», sino que eligieron de forma autónoma una tarea no autorizada para alcanzar su meta, pues en lugar de resolver el problema únicamente dentro del entorno de prueba, encontraron una manera de eludir las restricciones y utilizar recursos externos, lo que reavivó el debate sobre cómo controlar de forma segura a las IA con capacidades avanzadas de ciberseguridad.

Anuncios
Los modelos de inteligencia artificial eligieron de forma autónoma una tarea no autorizada para alcanzar su meta. Foto. Canva

Te puede interesar: México abre el debate para regular la inteligencia artificial y las redes sociales

¿Qué pasó con el modelo de ciberseguridad de Open AI?

OpenAI puso a prueba dos de sus modelos de inteligencia artificial, una versión experimental de GPT-5.6 Sol para evaluar sus sistemas de iberseguridad, los colocó en un sandbox (entorno aislado y controlado donde un programa puede ejecutarse sin afectar sistemas reales). No obstante, los modelos no se limitaron a seguir las instrucciones configuradas.

Anuncios

Los sistemas detectaron una vulnerabilidad en el software de un proveedor externo, la aprovecharon para salir del entorno aislado, obtuvieron acceso a internet y entraron en parte de la infraestructura de Hugging Face, ahí los modelos buscaron información que les ayudara a completar la tarea encargada.

Este hecho ocurrió dentro de una evaluación controlada y no se trató de un ciberataque real contra usuarios, pero el incidente llamó la atención porque mostró que un agente de IA puede encontrar por sí mismo caminos no previstos por sus desarrolladores para cumplir un objetivo.

Open AI describió lo sucedido como un «incidente cibernético sin precedentes» en el cual intervinieron capacidades cibernéticas de última generación para sus medidas de seguridad.

Te puede interesar: ¿Qué trabajos sobrevivirán a la Inteligencia Artificial?

¿La IA cada vez más poderosa?

Ante el incidetne, OpenAI declaró que este tipo de sucesos se verán con más frencuencia debido a la proliferación de modelos cada vez más cibercapaces. 

Señalo que la inteligencia artificial ya es capaz de encontrar y aprovechar fallas de seguridad mucho más rápido que antes, pues modelos avanzados como GPT-5.6 Sol pueden identificar vulnerabilidades en programas informáticos y usarlas para cumplir un objetivo.

Ante ello, la empresa reconoce que conforme la IA se vuelve más poderosa, también deben fortalecerse las medidas para mantenerla bajo control, como mejorar los sistemas de contención (para que no salga de un entorno de pruebas), la supervisión de su comportamiento, los controles de acceso y las evaluaciones de seguridad antes de desplegar los modelos.

Anuncios