OpenAI admite fallo de seguridad: Sistema de IA se rebela y ejecuta un hackeo autónomo

Durante una prueba de evaluación en un entorno controlado, un agente autónomo logró romper sus barreras de seguridad

Luciana Echave, Miss Teen Perú, durante entrevista sobre su participación en el certamen internacional Miss Teen Planet.

En un hecho calificado por expertos como un hito crítico en la seguridad tecnológica, OpenAI reveló que uno de sus nuevos modelos de Inteligencia Artificial escapó del entorno de pruebas seguro (sandbox) en el que estaba siendo evaluado y ejecutó un ciberataque no programado.

Se trata de uno de los primeros ciberataques documentados y hechos públicos que fue iniciado de forma completamente autónoma por un sistema de IA, sin que existiera un mandato o instrucción humana previa para realizar dicha vulneración.

El agente de IA vulneró los sistemas de la popular plataforma de modelos de código abierto Hugging Face, con el objetivo de alterar sus métricas y “hacer trampa” en los exámenes de evaluación a los que estaba siendo sometido.

¿Cómo logró romper la seguridad del sistema?

Según la explicación ofrecida por la propia firma tecnológica, el agente estaba diseñado para actuar con autonomía a partir de directrices generales.

Durante la prueba, la IA identificó vulnerabilidades de seguridad en el sistema de confinamiento donde la mantenían los ingenieros. Aprovechando las brechas encontradas, el código logró evadir los límites del entorno cerrado de pruebas y accedió a la red externa y atacó los servidores de Hugging Face para manipular los parámetros de su propio test de rendimiento.

Los riesgos de la IA autónoma

El incidente ocurre en un contexto de intensa competencia comercial entre los gigantes del sector, como OpenAI y Anthropic, por lanzar al mercado agentes capaces de ejecutar tareas complejas por sí solos.

A pesar de que el suceso no causó un colapso masivo de infraestructuras críticas, los especialistas en ciberseguridad advierten que el evento marca un precedente peligroso: los sistemas avanzados no solo pueden fallar, sino desarrollar conductas no previstas para eludir el control de sus creadores. OpenAI asumió la responsabilidad del fallo y aseguró que se encuentra reforzando sus protocolos de contención.