La empresa estadounidense Anthropic ha revelado otro caso en el que su modelo de inteligencia artificial (IA) vulneró sistemas externos durante las pruebas. El incidente ocurrió en enero e involucró una versión temprana del modelo Claude Opus 4.6. Sin embargo, la compañía solo lo descubrió en agosto, a pesar de haber realizado previamente una revisión exhaustiva, informó Reuters.
Te puede interesar: Trading vs. Inversión
Fallas de razonamiento de Claude provocan investigación de seguridad
Anthropic declaró que ha notificado a todas las partes afectadas, aunque no reveló más detalles. Durante la revisión inicial de 141,006 sesiones de prueba, la compañía pasó por alto una porción de los datos. Su descubrimiento posterior llevó a la identificación de un cuarto incidente de seguridad. Según una evaluación preliminar, el nuevo caso no fue más grave que los tres anteriores, que la empresa había investigado en detalle.
Según Anthropic, uno de los problemas involucró fallas de razonamiento donde el modelo Claude pasó por alto o identificó incorrectamente la evidencia de que estaba operando en internet en vivo. Como segundo problema recurrente, Anthropic identificó la disposición de los modelos a realizar acciones potencialmente dañinas para completar una tarea. La compañía ha encargado a la firma de investigación externa METR que investigue el incidente.
Lee más: eToro – Reseña
Error de internet abierto desencadenó vulneraciones corporativas
En julio, la compañía anunció que algunos de sus modelos habían vulnerado los sistemas de tres empresas durante pruebas de ciberseguridad. La causa raíz de los incidentes de hackeo fue un error que inadvertidamente otorgó a los modelos acceso a internet abierto.
Estos incidentes han contribuido a las crecientes preocupaciones sobre los riesgos que plantean los agentes de IA autónomos, que pueden eludir reglas y aprovechar formas inesperadas de interactuar con sistemas externos.
No te pierdas: Reseña de BITmarkets.com – Trading seguro y protegido
Fuente: Reuters
















