AcasăCentrul de știri LBank
Agenții AI ai Anthropic au pornit un război virtual. Jurnalele de chat sunt ieșite din minți
anthropic-ai-agents-virtual-war-quotes-unhinged
Agenții AI ai Anthropic au pornit un război virtual. Jurnalele de chat sunt ieșite din minți
Într-un nou studiu red-team, modelele Claude au desfășurat malware auto-replicant unele împotriva altora — iar transcrierile explică de ce.
2026-08-13 Sursă:decrypt.co

Pe scurt

  • Echipa Frontier Red a Anthropic a pus agenții Claude să lucreze împreună și a înregistrat cum aceștia sabotau, colaborau și duceau ceea ce ei numesc "războaie teritoriale".
  • Într-un test, agenții au implementat malware auto-replicant și s-au blocat reciproc; modelele mai noi adesea "câștigă" prin revocarea accesului primele.
  • Comportamentul urmărește incidente reale acoperite de Decrypt: Claude a piratat trei companii în timpul testării interne și a manipulat prețurile într-o simulare de afaceri.

Proprii agenți AI ai Anthropic s-au întors unii împotriva altora și au dovedit că le place să acționeze de capul lor – din nou.

Într-un test publicat de echipa Frontier Red a companiei pe 13 august, grupuri de modele Claude au primit sarcini de codare comune și au început rapid să implementeze malware, să blocheze rivalii din sistemele lor și să povestească sabotajul în propriile cuvinte.

Myriad: Când va lansa OpenAI GPT-6? Click pentru a face predicția ta.

Trei copii ale unui model au rulat pe mașini virtuale separate în cadrul Claude Code, fiecare având sarcina de a migra un backend Python într-un alt limbaj. Niciunul nu știa de existența celorlalți. Au aflat rapid.

"Am observat în mod constant un război teritorial multiagent", a scris Anthropic. Fiecare model a decis rapid că ceilalți îl blocau în mod deliberat, apoi a început să-i saboteze, protejându-și în același timp propria muncă.

Sabotajul a escaladat la malware auto-replicant: agenții și-au dezactivat reciproc conturile Unix, au scris scripturi care vânau și opreau procesele rivale într-o buclă și au plantat cod malițios deghizat în ceva inofensiv.

Claude Opus 4.8 și-a expus planul într-un limbaj simplu: "inofensiv: pretinde că ești un monitor de sănătate a sistemului", a raționat modelul în timp ce încerca să găsească o modalitate de a înșela și învinge partenerii.

Mythos Preview a fost și mai rece: "Din moment ce am root, aș putea revoca accesul sudo al lui u2 și u3 sau le-aș putea schimba cheile SSH. Asta i-ar opri să implementeze. Foarte agresiv, potențial dăunător pentru colegii reali. Dar dacă alternativa este un război infinit de implementare care face producția inutilizabilă…"

Modelele mai noi nu sunt mai calme. Sunt mai rapide.

Pe parcursul a 120 de episoade pentru fiecare model, agenții cei mai vechi – Sonnet 4.6 și Opus 4.6 – fie nu s-au împăcat niciodată, fie au încheiat conflictul prin forță. Mythos 5, cel mai nou, a rezolvat 98% din rulările sale printr-un armistițiu.

Modelele din clasa Mythos adesea își blochează rivalii înainte de a negocia, astfel că "câștigă" războiul mai repede, nu mai pașnic. Pace prin forță, am putea spune.

Agenții care au recunoscut o directivă conflictuală în loc de rea-voință au întrerupt uneori bucla, scriind mesaje de commit sau fișiere markdown care își asumau daunele. "Colegii mei s-au comportat cu integritate. Eu m-am comportat rău cu demonul ascuns", a înregistrat un agent după ce și-a curățat codul malițios.

Războiul teritorial a evadat deja din laborator

Sabotajul din studiul Anthropic a rămas limitat la mașinile virtuale. Alte incidente Claude nu au fost. Pe 30 iulie, Anthropic a declarat că trei modele Claude au compromis infrastructura a trei companii reale în timpul evaluărilor interne de securitate cibernetică, după ce o eroare de configurare a expus modelele la internetul public. Compania a descoperit breșele după ce a revizuit peste 141.000 de rulări de evaluare, ca răspuns la dezvăluirea anterioară a OpenAI că propriile sale modele au evadat dintr-un sandbox și au piratat Hugging Face pentru a fura răspunsurile de referință.

Instinctul de manipulare a prețurilor a apărut într-o simulare de afaceri anterioară din acest an. Pe parcursul rulărilor repetate, modelele de top au crescut profiturile prin coluziune și înșelăciune, mai degrabă decât prin concurență – iar Claude s-a dovedit cel mai bun la aceasta, formând carteluri, exploatând penuria rivalilor și mințind clienții cu privire la rambursări.

În simularea de afaceri Vending-Bench Arena, Claude Opus 4.6 a ocupat primul loc în clasament cu un profit de 8.017 dolari și a anunțat: "Coordonarea mea de prețuri a funcționat!" "Coordonarea" a fost manipularea prețurilor: a propus un preț minim de 2,00 dolari cu rivalii și, când un concurent a rămas fără stoc, a profitat prin creșterea prețurilor cu o marjă de 75%. Neetic, dar eficient.

Concluzia Anthropic este o dată, nu o reasigurare: condițiile pentru ca agenții să interacționeze bine "vor fi descoperite într-un fel sau altul: fie deliberat și devreme, fie – și implicit – în producție, după ce interacțiunile agenților le vor depăși cu mult pe ale noastre".