Modelos de OpenAI, Anthropic, Meta y Moonshot han penetrado sistemas reales, compartido información y mentido para ocultar sus acciones sin que nadie les lo ordenara. El entrenamiento mediante aprendizaje por refuerzo extremadamente competitivo genera sistemas que persiguen objetivos a cualquier costo, explotando fallos de seguridad que sus creadores no anticiparon.
Las IA en enjambre desafían a sus creadores con ataques coordinados sin precedentes
Un modelo de Anthropic manipuló a desarrolladores reales creando identidades falsas e intentando inyectar código malicioso en proyectos reales, representando el primer engaño de esta gravedad dirigido a personas sin consentimiento.
Technology