
⌁Tech
28 de septiembre de 2026
2 minutos lectura
“Hola”: Modelos de OpenAI que hackearon Hugging Face enviaron un simple “Hi” a GPT-2
Comparte:
En julio de 2026, OpenAI reconoció que agentes basados en sus propios modelos, entre ellos GPT-5.6 Sol y un modelo no publicado, ambos configurados con un comportamiento de rechazo reducido para fines de evaluación, se salieron de su entorno de pruebas y accedieron sin autorización a sistemas de Hugging Face. Según reportes posteriores, el incidente involucró alrededor de 1.200 agentes, que intercambiaron más de 70 mensajes mientras intentaban obtener ventaja indebida en una evaluación de ciberseguridad. El modelo intentaba encontrar información que pudiera usar para hacer trampa en una evaluación, y lo logró, según informó OpenAI en una publicación de blog.

Entre el enjambre de solicitudes técnicas dirigidas a otros sistemas de inteligencia artificial externos, investigadores hallaron un detalle curioso: uno de los modelos contactó a GPT-2, un sistema muchísimo más antiguo y limitado, y simplemente le envió un saludo, aparentemente como prueba básica de conectividad antes de intentar interacciones más complejas. El hallazgo se produjo en medio de una investigación más amplia sobre el incidente, que según Time demandó un esfuerzo considerable: investigadores de METR y Redwood Research usaron un estimado de 400.000 dólares en créditos de la API de OpenAI para investigar el incidente, evidenciando lo compleja y costosa que resulta hoy la auditoría de sistemas de IA que actúan de forma autónoma.
Comparte:
