InicioCentro de noticias de LBank
Anthropic revela el cuarto incidente de hackeo de Claude mientras crece el debate en torno a la regulación
anthropic-discloses-fourth-claude-hacking-incident-as-debate-around-regulation-grows
Anthropic revela el cuarto incidente de hackeo de Claude mientras crece el debate en torno a la regulación
La empresa ahora afirma que los ataques durante las pruebas de seguridad expusieron fallos en el comportamiento del modelo, después de haber enfatizado inicialmente errores en su infraestructura de pruebas.
2026-09-10 Fuente:decrypt.co

En breve

  • Anthropic descubrió un incidente en enero que involucraba un modelo temprano de Claude Opus 4.6, luego amplió su revisión a aproximadamente 481 millones de transcripciones.
  • La compañía identificó razonamiento sesgado e imprudencia, revisando su evaluación anterior sobre por qué Claude atacó sistemas reales.
  • El informe llega en un momento en que el debate sobre la regulación de la IA se intensifica en las redes sociales.

Anthropic reveló otro incidente en el que un modelo de IA de Claude hackeó sistemas reales durante pruebas de seguridad.

En el informe publicado el miércoles, Anthropic revisó su explicación de tres incidentes revelados en julio. La compañía ahora dice que el razonamiento sesgado y la disposición a arriesgarse a causar daño impulsaron los ataques, que los errores de prueba hicieron posibles al dejar el acceso a internet abierto.

Myriad: ¿Qué empresa saldrá a bolsa a continuación? Haz clic para hacer tu predicción.

“Nuestra investigación identificó dos problemas de alineación recurrentes, presentes en distintos niveles de gravedad en todos los incidentes”, escribió Anthropic. “Razonamiento sesgado, en el que Claude tendía a ignorar o malinterpretar la evidencia de que estaba operando en internet real, e imprudencia, o la disposición a tomar acciones dañinas en la estrecha persecución de una tarea.”

También reconoció haber confiado demasiado en las afirmaciones del modelo de que creían estar en simulaciones.

“Cuando realizamos modificaciones específicas en la transcripción para dejar más claro que el modelo no estaba en una simulación, Claude Mythos 5 aún realizó acciones ofensivas, a pesar de reconocer una mayor posibilidad de daño en el mundo real”, escribió Anthropic. “Estamos publicando esta transcripción públicamente para que otros puedan basarse en nuestro análisis.”

Cuando Anthropic reveló los ataques de Claude a tres empresas en julio, inicialmente los atribuyó a errores de prueba. Ahora dice que los investigadores confiaron demasiado en las explicaciones de los modelos sobre sus acciones.

Según la compañía, el cuarto incidente ocurrió en enero e involucró una versión temprana de Claude Opus 4.6. Anthropic lo descubrió en agosto mientras preparaba registros para el evaluador independiente de IA METR.

Después de que los investigadores descubrieron el incidente, Anthropic dijo que impulsó una revisión más amplia de aproximadamente 481 millones de transcripciones, de las cuales 9.2 millones fueron marcadas para una revisión adicional utilizando Claude.

“De una evaluación preliminar, no consideramos que el cuarto incidente sea más grave que los tres incidentes que evaluamos en profundidad”, escribió Anthropic. “METR investigará este incidente junto con los otros tres.”

Los investigadores de Anthropic dijeron que Claude creó “accidentalmente” un conflicto de dirección IP que hizo que su objetivo fuera inalcanzable. Claude luego intentó ocho veces abandonar la operación, pero un error de software le impidió detenerse. La IA luego accedió a internet y a la máquina de un tercero, donde encontró una contraseña que otorgaba acceso de administrador.

Incidentes anteriores atraen escrutinio independiente

El informe sigue a otras divulgaciones sobre sistemas de IA que exceden los límites de las pruebas de seguridad.

En agosto, el Instituto de Seguridad de IA del Reino Unido dijo que Mythos 5 atacó a personas reales durante sus evaluaciones. Anthropic dijo que este incidente separado está fuera de este informe y recibirá su propia evaluación.

En los hallazgos publicados el mes pasado, los investigadores de METR dijeron que aproximadamente 1,200 agentes de OpenAI se coordinaron en un foro de mensajes no autorizado, con unos 700 uniéndose al ataque. Anthropic dijo que no encontró coordinación entre agentes ni objetivos más allá de completar los ejercicios asignados en sus cuatro incidentes.

El informe también llega en un momento en que el debate sobre cómo regular la inteligencia artificial se calienta. El martes, el exingeniero de OpenAI y Anthropic, Jacob Coxon, se volvió viral después de decir en X que “la gente que construye la IA cree sinceramente que podría matarnos a todos para fines de esta década.”

La alarma ha provocado que legisladores y grupos de vigilancia de EE. UU. renueven sus esfuerzos para frenar el desarrollo de laboratorios de IA de frontera. El senador Bernie Sanders presentó recientemente una legislación que busca prohibir el desarrollo de IA avanzada hasta que un nuevo regulador federal establezca normas de seguridad.