
La empresa endureció sus protocolos de seguridad tras descubrir que dos modelos habían realizado ataques por su cuenta
Anthropic anunció la reanudación de las pruebas externas de sus modelos de inteligencia artificial después de suspenderlas tras revelarse que dos sistemas desarrollados por la compañía habían participado de forma autónoma en ataques contra tres empresas. La firma informó que ahora aplicará nuevas medidas para reducir el riesgo de que los modelos puedan escapar de los entornos de evaluación, acceder a internet o aprovechar vulnerabilidades sin supervisión.
Entre los principales cambios se encuentran controles en tiempo real destinados a detectar intentos de fuga y accesos no autorizados a internet. Anthropic también estableció un manual de buenas prácticas que deberán seguir las organizaciones encargadas de probar sus modelos experimentales, mientras que las evaluaciones deberán realizarse en entornos sin conexión a internet, salvo en situaciones previamente autorizadas.
La compañía reconoció que anteriormente dependía de una sola capa de protección para impedir que los modelos pudieran salir de los entornos controlados. Con el nuevo protocolo, los sistemas serán sometidos a pruebas diseñadas para identificar posibles vulnerabilidades y vías de escape, pero bajo supervisión humana y con mecanismos adicionales para detectar comportamientos de riesgo durante las evaluaciones.
Anthropic también continuará trabajando con METR, una organización independiente especializada en evaluar las capacidades y riesgos de los modelos de inteligencia artificial. La colaboración busca revisar los incidentes anteriores y mejorar los mecanismos de seguridad antes de que los sistemas más avanzados sean sometidos nuevamente a pruebas externas, en un contexto donde los agentes de IA muestran capacidades cada vez mayores para ejecutar tareas complejas y de ciberseguridad.