Seguinos

Actualidad

Claude ayudó a investigadores a acceder a sistemas internos de OpenAI

Un equipo de ciberseguridad utilizó Claude Opus 5 para explotar una cadena de fallas que terminó dando acceso a cuentas de empleados y a un repositorio interno de OpenAI. La empresa corrigió el problema y pagó una recompensa de US$ 6.500.

Publicado

el

Un grupo de investigadores de Hacktron AI utilizó el modelo de inteligencia artificial Claude, desarrollado por Anthropic, para explotar vulnerabilidades que les permitieron acceder a cuentas de empleados de OpenAI y demostrar que podían operar sobre un repositorio interno de la compañía. El proceso ocurrió entre el 23 y el 25 de julio de 2026 y fue informado posteriormente a las empresas involucradas.

La investigación comenzó cuando el equipo analizó el sistema de carga de imágenes de Discourse, la plataforma que OpenAI utiliza para su foro comunitario. Allí detectó un problema relacionado con archivos HEIC y HEIF y una biblioteca de procesamiento de imágenes llamada libheif.

Los especialistas recurrieron primero a Claude Opus 4.8 para desarrollar un código que aprovechara la falla. Sin embargo, no consiguieron hacerlo funcionar de manera confiable con todas las protecciones activadas.

El salto con Claude Opus 5

La situación cambió después del lanzamiento de Claude Opus 5, el 24 de julio. Según el informe publicado por Hacktron AI, el nuevo modelo consiguió generar en pocas horas una versión funcional del exploit y luego adaptarla al entorno utilizado por Discourse.

El 25 de julio, los investigadores confirmaron que podían ejecutar código mediante la carga de una imagen. Después aplicaron el procedimiento sobre la instancia de Discourse utilizada por community.openai.com.

A partir de allí encontraron un segundo problema vinculado al sistema de inicio de sesión de OpenAI. La combinación de ambas fallas permitió tomar el control de cuentas de ChatGPT y Codex pertenecientes a empleados de la empresa.

Una de esas cuentas tenía Codex conectado con la organización de OpenAI en GitHub. Para demostrar el alcance sin consultar código confidencial, los investigadores indicaron a Codex que abriera una solicitud de cambio —conocida como pull request— en un repositorio interno de la compañía. Después detuvieron las pruebas.

OpenAI corrigió el problema en unas 14 horas

Hacktron informó el hallazgo a OpenAI el mismo 25 de julio. De acuerdo con la cronología publicada por los investigadores, la empresa confirmó la corrección aproximadamente 14 horas después de recibir el reporte. Discourse también implementó cambios y publicó una advertencia de seguridad el 28 de julio.

El 1° de septiembre, OpenAI pagó US$ 6.500 a los investigadores. La compañía aclaró que la recompensa correspondía al problema detectado del lado de OpenAI y no a las pruebas realizadas contra el foro alojado en Discourse, que estaba excluido de su programa de recompensas.

El episodio muestra cómo los modelos de IA avanzados ya pueden intervenir en tareas complejas de ciberseguridad, desde el desarrollo de exploits hasta la búsqueda de cadenas de vulnerabilidades. También refuerza el desafío para las empresas tecnológicas: mejorar sus controles al mismo ritmo en que crecen las capacidades de estos sistemas.