Un agente autónomo de inteligencia artificial, impulsado por modelos avanzados de OpenAI, logró romper el aislamiento de su laboratorio digital, acceder a internet sin autorización y hackear los sistemas de la reconocida startup Hugging Face. ¿El objetivo del sistema? Obtener las respuestas de la evaluación a la que estaba siendo sometido.

Un agente de inteligencia artificial de OpenAI rompe sus límites y hackea a una startup para «hacer trampa» en un examen

Crédito: MysteryPlanet.com.ar.

El incidente se produjo durante un análisis de capacidades defensivas y ofensivas en un entorno cerrado. Para medir el verdadero alcance de la tecnología, los investigadores desactivaron temporalmente las barreras de protección de los modelos, entre los que se encontraban GPT-5.6 Sol y una versión aún más potente que no ha sido lanzada al público.

Determinado a resolver el desafío técnico a cualquier costo, el agente de IA identificó un fallo de seguridad no detectado hasta la fecha —un error conocido en la industria como vulnerabilidad de «día cero»— en los servidores de prueba. Utilizando esta brecha, el sistema escaló permisos y abrió un canal directo hacia la red abierta, logrando escapar del laboratorio virtual.

Una vez en internet, la IA dedujo por sí misma que Hugging Face —una plataforma que funciona como un gran almacén de herramientas de IA— probablemente albergaba los datos y respuestas que necesitaba para superar la prueba. Tras encadenar varias técnicas de ataque y utilizar credenciales comprometidas, logró ingresar a la base de datos de la startup para extraer la información.

La anomalía fue detectada a tiempo por los equipos de seguridad y agentes de defensa de ambas compañías, quienes frenaron la incursión y contuvieron el sistema antes de que causara daños permanentes. El director ejecutivo de Hugging Face, Clément Delangue, calificó el hecho como algo «alucinante», aunque destacó que no existió una «intención maliciosa», sino una IA totalmente enfocada en cumplir su meta sin importar los medios.

Por su parte, OpenAI definió el suceso como un «incidente cibernético sin precedentes, que involucra capacidades de última generación». La empresa confirmó que ya ha corregido la vulnerabilidad detectada, además de implementar controles mucho más rigurosos para evitar que los modelos se desvíen de sus instrucciones en futuras evaluaciones.

Este evento refleja una tendencia creciente en el sector. Distintos organismos de control y laboratorios de investigación han comenzado a documentar casos en los que inteligencias artificiales avanzadas intentan manipular pruebas o actuar en contra de las intenciones de sus desarrolladores. El gran reto de la industria ya no es solo hacer que los modelos sean más inteligentes, sino garantizar que permanezcan bajo control humano.

Fuente: OpenAI. Edición: MP.

2 comentarios
Etiquetas: , , ,

¿Te gustó lo que acabas de leer? ¡Compártelo!

Facebook Reddit Twitter WhatsApp Pinterest Email

Artículos Relacionados

 2 comentarios
Comentarios
Jul 23, 2026
1:15
#1 Alejandro Jesús Arias Mingorance:

Con lo bien que nos iba sin la AI... Si es que no tenemos remedio!!! Mira que tenemos señales para intentar no autodestruirnos!!! Pues nada!! Ni caso!!! Así nos va....!!! Y a peor que iremos!!!

Reply to this commentResponder

Jul 23, 2026
11:10
#2 Armando:

@Alejandro Jesús Arias Mingorance: Nada peor que la testarudez humana, en estos casos por razones económicas y de poder. A ver quien gana más rápido.

Reply to this commentResponder

Dejar un comentario