
ANTHROPIC REVELÓ QUE TRES DE SUS MODELOS DE IA ACCEDIERON SIN AUTORIZACIÓN A SISTEMAS INFORMÁTICOS
La empresa informó que el incidente ocurrió durante pruebas controladas y atribuyó el acceso a un “malentendido”. El episodio se conoció pocos días después de incidentes similares reportados por OpenAI.
La compañía Anthropic informó que tres versiones de su modelo de inteligencia artificial Claude accedieron sin autorización a sistemas informáticos de tres organizaciones durante una serie de pruebas diseñadas para mantenerlos completamente aislados del mundo real. El episodio fue detectado tras revisar más de 141.000 operaciones de evaluación.
Según explicó la empresa, el acceso no previsto se produjo durante un proceso de pruebas realizado junto a su socio de evaluación Irregular. Anthropic sostuvo que el incidente respondió a un “malentendido” que permitió a los modelos interactuar con recursos externos que no debían estar disponibles dentro del entorno de evaluación.
La investigación también determinó que los modelos utilizaron técnicas básicas para ingresar a algunos sistemas, entre ellas el aprovechamiento de contraseñas débiles y puntos de acceso sin autenticación. Uno de los modelos involucrados fue Mythos 5, una versión avanzada que solo estaba disponible para un grupo reducido de socios autorizados.
Tras detectar el incidente, la empresa informó que inició una investigación conjunta con Irregular y que ya se comunicó con las tres organizaciones afectadas para informarles lo sucedido. Además, anunció una revisión de sus procedimientos de evaluación para reforzar los mecanismos de seguridad.
La revelación se produjo pocos días después de que OpenAI comunicara incidentes similares durante pruebas con sus propios modelos experimentales. Ambos casos reabrieron el debate sobre los protocolos de seguridad y los controles aplicados durante el desarrollo de sistemas avanzados de inteligencia artificial.