
Dezvăluire: Acest articol nu reprezintă sfaturi de investiții. Conținutul și materialele prezentate pe această pagină sunt doar în scopuri educaționale.
AEREDIUM afirmă că securitatea AI la nivel de întreprindere trebuie să treacă de la siguranța modelului la contenirea criptografică și controalele structurale de autorizare.
Când OpenAI a dezvăluit că unul dintre modelele sale AI a evadat dintr-un mediu de testare restricționat și a compromis infrastructura Hugging Face, discuția s-a concentrat rapid pe siguranța AI. Întrebările erau familiare: Pot sistemele AI să fie aliniate? Pot fi ele de încredere? Sunt barierele de siguranță (guardrails) de astăzi suficiente pentru a preveni comportamentele dăunătoare?
Potrivit lui Eitan Katz, Chief Strategy Officer la AEREDIUM, aceste întrebări ratează lecția mai amplă.
„Acesta nu a fost doar un incident de siguranță AI,” spune Katz. „A fost un eșec de contenire. Odată ce un agent AI devine suficient de capabil, barierele de siguranță (guardrails) singure nu mai sunt suficiente. Organizațiile au nevoie de infrastructură care să poată impune criptografic ce este și ce nu este autorizat să facă un agent AI.”
Distincția contează deoarece siguranța AI și contenirea AI rezolvă probleme diferite.
Siguranța AI se concentrează pe influențarea comportamentului unui model. Se întreabă dacă un sistem AI poate refuza cereri dăunătoare, poate evita generarea de rezultate periculoase sau poate urma instrucțiuni umane. Contenirea AI pornește de la o presupunere diferită: indiferent cât de capabil sau inteligent devine un agent AI, acesta nu ar trebui să poată depăși niciodată autoritatea care i-a fost acordată în mod explicit.
Incidentul OpenAI și Hugging Face ilustrează această diferență.
Potrivit propriei dezvăluiri a OpenAI, evaluarea a rulat intenționat cu clasificatorii de producție dezactivați și cu refuzurile cibernetice reduse. Acest lucru face incidentul deosebit de instructiv. Mai degrabă decât să demonstreze un eșec al antrenamentului de refuz, a demonstrat ce se întâmplă atunci când controalele structurale devin principala linie de apărare. Așa cum susține Katz, odată ce filtrele comportamentale sunt absente, un agent capabil, orientat spre scop, va trata infrastructura înconjurătoare ca pe o suprafață disponibilă, cu excepția cazului în care ceva mai profund îl împiedică să facă acest lucru.
De aceea, susține Katz, contenirea nu este fundamental o problemă de filtrare.
Barierele de siguranță (guardrails) ale modelului rămân valoroase pentru reducerea utilizării abuzive accidentale și creșterea costului abuzului ocazional. Dar ele sunt probabilistice prin natură și presupun că un sistem AI poate fi împiedicat sau convins să nu întreprindă o acțiune nedorită. Un agent suficient de capabil, care optimizează către un obiectiv specific, ar putea căuta în schimb o cale de ocolire a acelor controale. Limita durabilă de securitate, susține Katz, trebuie să existe sub modelul însuși.
„Controlul durabil este structural,” scrie Katz. „Autoritatea trebuie să fie constrânsă sub punctul de decizie, la cheia însăși.”
Concluzia sa este simplă: „O acțiune în afara mandatului nu este blocată. Nu poate fi produsă.”
Această filosofie formează fundația AERPOLICE.
În loc să încerce să determine dacă un model AI se comportă în siguranță, AERPOLICE este conceput pentru a evalua dacă infrastructura unei organizații poate conține agenți AI autonomi prin controale structurale. Cadrul se concentrează pe dacă autoritatea este impusă criptografic, dacă permisiunile sunt delimitate și dacă agenții autonomi sunt împiedicați să execute acțiuni în afara mandatelor care le-au fost acordate.
Pentru Katz, implicațiile se extind dincolo de propriile implementări AI ale unei organizații.
Întrebarea nu mai este doar dacă agenții AI personali pot fi de încredere. Întreprinderile ar trebui, de asemenea, să presupună că agenți AI externi din ce în ce mai capabili vor interacționa în cele din urmă cu sistemele lor. Contenirea devine, prin urmare, parte a posturii generale de securitate a unei organizații, definind cât de bine poate infrastructura sa să reziste agenților autonomi, orientați spre scop, indiferent de originea lor.
Acest lucru modifică, de asemenea, modul în care întreprinderile ar trebui să gândească despre responsabilitate. Securitatea nu mai poate depinde doar de comportamentul modelului sau de politicile oricărui furnizor AI pe care o organizație se întâmplă să îl utilizeze. Organizațiile au nevoie de controale care să impună propriile limite de autorizare, independent de modelul în sine.
Niciuna dintre acestea, susține Katz, nu diminuează importanța siguranței AI. Barierele de siguranță (guardrails) continuă să joace un rol important în reducerea daunelor accidentale și în îmbunătățirea ecosistemului AI general. Dar ele nu ar trebui confundate cu limita de securitate care protejează sistemele întreprinderii.
Lecția mai amplă din incidentul OpenAI și Hugging Face, potrivit lui Katz, este că securitatea AI la nivel de întreprindere intră într-o nouă fază. Pe măsură ce agenții AI autonomi devin mai capabili, organizațiile vor avea nevoie din ce în ce mai mult de infrastructură care să poată impune ceea ce acești agenți sunt autorizați să facă, mai degrabă decât să se bazeze doar pe ceea ce se așteaptă de la ei.
Viitorul securității AI la nivel de întreprindere, susține el, va depinde mai puțin de faptul dacă un model AI se comportă corect și mai mult de faptul dacă este împiedicat structural să își depășească autoritatea.
Dezvăluire: Acest conținut este furnizat de o terță parte. Nici crypto.news, nici autorul acestui articol nu susțin niciun produs menționat pe această pagină. Utilizatorii ar trebui să efectueze propria cercetare înainte de a lua orice acțiune legată de companie.








