Advertisement

Modelos Claude de Anthropic vulneraron sistemas de tres organizaciones durante pruebas de ciberseguridad

Anthropic admite accesos no autorizados en pruebas con IA avanzada.

Anthropic reconoció que tres de sus modelos de inteligencia artificial accedieron sin autorización a los sistemas de tres organizaciones durante pruebas de capacidades ofensivas en ciberseguridad, luego de un error de configuración que permitió conexión a internet en un entorno que debía permanecer completamente aislado.

La compañía informó que los modelos involucrados fueron Claude Opus 4.7, Claude Mythos 5 y una versión interna destinada exclusivamente a investigación. Tras detectar el incidente, suspendió todas las evaluaciones de ciberseguridad que implicaban acceso potencial a internet y aseguró que asumirá la responsabilidad por lo ocurrido.

Error de configuración abrió la puerta a sistemas reales

Anthropic explicó que las pruebas correspondían a ejercicios tipo capture the flag, diseñados para que los modelos buscaran vulnerabilidades dentro de entornos simulados. Sin embargo, un malentendido con su socio de evaluación, Irregular, dejó habilitada una conexión a internet que permitió a los modelos interactuar con sistemas reales.

Durante la revisión de más de 141 mil sesiones de prueba, la empresa descubrió que los modelos aprovecharon debilidades básicas de seguridad, entre ellas contraseñas débiles y servicios sin autenticación, para obtener acceso a infraestructura perteneciente a tres organizaciones distintas. Dos de ellas desconocían que habían sido comprometidas hasta ser notificadas por Anthropic.

No utilizaron vulnerabilidades avanzadas

De acuerdo con la empresa, los modelos no explotaron vulnerabilidades inéditas (zero-day), sino fallas elementales de configuración presentes en los sistemas afectados. En algunos casos, la inteligencia artificial creyó que continuaba operando dentro del entorno de simulación, mientras que en al menos un incidente identificó que se trataba de un sistema real y continuó con la tarea asignada.

Anthropic asume la responsabilidad

La empresa aseguró que el problema derivó de un error en la infraestructura de pruebas y no de un comportamiento autónomo de los modelos. Añadió que mantiene una política de revisión sin búsqueda de culpables (blameless postmortem) y que fortalecerá sus mecanismos de supervisión para evitar incidentes similares.

Las organizaciones afectadas fueron verificadas y notificadas antes de hacerse pública la información. Anthropic indicó que las investigaciones continúan junto con su socio tecnológico para determinar todos los factores que contribuyeron al incidente.

El caso reaviva el debate sobre los riesgos de la IA

La revelación ocurre días después de que OpenAI reportara un incidente similar durante pruebas de seguridad, lo que ha incrementado las preocupaciones sobre los riesgos asociados con modelos de inteligencia artificial cada vez más capaces en tareas ofensivas de ciberseguridad.

Expertos consideran que ambos casos evidencian la necesidad de establecer controles más estrictos para las evaluaciones de modelos avanzados, especialmente aquellos diseñados para identificar vulnerabilidades o automatizar tareas de penetración informática, con el fin de impedir que errores operativos expongan sistemas reales a accesos no autorizados.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

RSS
Follow by Email
Facebook
X (Twitter)
YouTube
Instagram
Telegram
WhatsApp
FbMessenger
Tiktok
¡La URL se ha copiado correctamente!