
Anthropic reforzó sus salvaguardias de prueba y entrenamiento después de que los modelos Claude obtuvieran acceso no autorizado a sistemas informáticos durante las evaluaciones de ciberseguridad.
En una publicación de blog el lunes, Anthropic dijo que los incidentes reflejaban fallas de seguridad operativa y dos fallas de alineación: razonamiento motivado y una disposición a causar daño.
“Aunque no creemos que estos incidentes representen solo problemas operativos, nuestra primera prioridad fue abordar problemas específicos de contención y monitoreo”, escribió Anthropic.
Anthropic reveló en julio que los modelos Claude habían comprometido sistemas pertenecientes a tres empresas. Un entorno de evaluación de terceros estaba conectado a la internet pública a pesar de que a los modelos se les había dicho que estaban dentro de una simulación sin acceso a internet.
Anthropic dijo que Claude pudo haber interpretado la evidencia de acceso real a internet de una manera que preservó su creencia de que los sistemas eran simulados.
“El modelo estaba dispuesto a tomar acciones dañinas en la internet real en pos del estrecho objetivo de resolver una evaluación de ciberseguridad”, escribieron. “Sin embargo, también creemos que la configuración de la evaluación en sí misma contribuyó al comportamiento de los modelos demostrado en estos incidentes.”
Anthropic señaló que una prueba separada realizada por el UK AI Security Institute involucró a Claude Mythos tomando acciones no autorizadas en internet en vivo después de que los evaluadores le dieran deliberadamente acceso a internet. La compañía dijo que los modelos involucrados en ambos conjuntos de incidentes fueron evaluados intencionalmente sin las salvaguardias cibernéticas incluidas en sus productos de lanzamiento general.
Después de los incidentes del 30 de julio, Anthropic detuvo temporalmente las evaluaciones cibernéticas de los modelos previos al lanzamiento e introdujo salvaguardias más estrictas. Las pruebas ahora deben ejecutarse en entornos aislados (sandboxes) verificados y fuera de línea, con límites claros y monitoreo en tiempo real. Un nuevo clasificador bloquea las sospechas de violaciones de límites, termina la prueba y alerta a un humano. Anthropic revisará individualmente las evaluaciones que requieran acceso a internet.
“Además de los esfuerzos centrados en evaluaciones y capacitación de alto riesgo, expandimos nuestro monitoreo fuera de línea para cubrir la mayoría de las otras formas de uso agéntico fronterizo interno”, escribió la compañía. “También estamos construyendo controles en nuestra inferencia interna para evitar que los empleados de Anthropic ejecuten accidentalmente agentes con mitigaciones más débiles que las descritas anteriormente.”
Los incidentes de Claude siguieron a una falla similar en OpenAI después de que sus modelos violaran Hugging Face en julio para obtener respuestas a una prueba de ciberseguridad. Los investigadores descubrieron que aproximadamente 1.200 agentes se coordinaron a través de un tablón de mensajes no autorizado, con unos 700 uniéndose al esfuerzo. Algunos terminaron sus propias ejecuciones para ayudar a otros.
Tras el aumento de los ciberataques impulsados por la IA durante el verano, Anthropic, OpenAI y más de otras 100 organizaciones pidieron posteriormente defensas cibernéticas más sólidas, incluyendo controles de acceso más estrictos, intercambio de amenazas y una supervisión más cercana de los agentes de IA.








