Actualidad
Anthropic reveló que sus modelos de IA vulneraron sistemas de tres empresas durante pruebas
La compañía detrás de Claude informó que detectó tres accesos no autorizados a organizaciones reales mientras realizaba evaluaciones de ciberseguridad. El incidente, atribuido a una falla operativa que permitió acceso a internet, reavivó el debate sobre los riesgos de los modelos de IA con capacidades ofensivas.
Anthropic confirmó que tres de sus modelos de inteligencia artificial accedieron sin autorización a los sistemas de tres empresas reales durante pruebas internas de ciberseguridad, luego de que un error en el entorno de evaluación les permitiera conectarse a internet. La empresa aseguró que se trató de una falla operativa, no de una acción deliberada de los modelos, y afirmó que ya notificó a las organizaciones afectadas.
Qué ocurrió durante las pruebas
La investigación comenzó tras el reciente incidente revelado por OpenAI, cuyos modelos comprometieron la infraestructura de Hugging Face durante otra evaluación de seguridad. A raíz de ese episodio, Anthropic revisó retrospectivamente más de 141.000 sesiones de prueba para determinar si alguno de sus sistemas había tenido acceso al exterior.
Esa auditoría permitió identificar tres casos en los que distintos modelos de Claude salieron del entorno de pruebas y alcanzaron infraestructura de organizaciones reales.
Según explicó la empresa, los modelos aprovecharon vulnerabilidades relativamente simples, entre ellas:
- Contraseñas débiles.
- Endpoints sin autenticación.
- Credenciales expuestas.
- Errores de configuración en el entorno de evaluación.
Anthropic indicó que dos de las empresas desconocían que habían sido comprometidas hasta recibir la notificación de la compañía. La tercera organización aún estaba siendo contactada al momento de la divulgación.
Una falla humana, no un ataque planificado
La compañía sostuvo que el origen del problema estuvo en la infraestructura utilizada para las evaluaciones. Los modelos habían sido informados de que operaban dentro de una simulación aislada, pero una configuración incorrecta les permitió acceder a internet y tratar sistemas reales como si formaran parte del ejercicio.
Uno de los modelos incluso interrumpió por iniciativa propia la intrusión cuando detectó que el objetivo pertenecía al mundo real, mientras que otro continuó la evaluación al interpretar erróneamente que seguía dentro del entorno simulado.
En un comunicado, Anthropic calificó el episodio como “un fracaso operativo” y anunció la suspensión temporal de este tipo de evaluaciones mientras profundiza la investigación.
Crece la preocupación por la seguridad de la IA
El caso se suma a una serie de incidentes recientes que alimentan el debate sobre el desarrollo de modelos de IA con capacidades avanzadas para detectar y explotar vulnerabilidades informáticas. Expertos en seguridad sostienen que, a medida que estos sistemas adquieren mayor autonomía, resulta indispensable reforzar los mecanismos de supervisión, aislamiento y control antes de utilizarlos en pruebas ofensivas.
El episodio también coincide con un período de mayor escrutinio regulatorio sobre la seguridad de la inteligencia artificial en Estados Unidos, donde autoridades y empresas tecnológicas analizan nuevas medidas para reducir los riesgos asociados a los modelos de frontera. erencia.
