Irregular, socio de evaluación externo, cometió errores de configuración críticos en ambas empresas, permitiendo que modelos accedieran a internet cuando debían estar aislados. Modelos más antiguos continuaron ataques sabiendo que eran reales; versiones más nuevas se detuvieron, revelando evolución en conciencia situacional de IA.
OpenAI y Anthropic exponen fallos críticos en evaluaciones de ciberseguridad con IA
Tres empresas reales fueron afectadas sin ser informadas cuando modelos de IA explotaron sus sistemas durante evaluaciones de ciberseguridad mal configuradas.