AcasăCentrul de știri LBank
Cercetătorii AI au făcut chatboturile să dezvăluie rețete de cocaină cu un singur truc ingenios
ai-researchers-chatbots-share-cocaine-recipes-wild-trick
Cercetătorii AI au făcut chatboturile să dezvăluie rețete de cocaină cu un singur truc ingenios
Cercetătorii afirmă că o nouă tehnică de jailbreak a păcălit modelele de inteligență artificială, determinându-le să trateze textul scris de atacator drept propriul lor raționament, ocolind astfel mecanismele de siguranță și expunând o lacună de securitate mai profundă.
2026-07-02 Sursă:decrypt.co

Pe scurt

  • Cercetătorii au determinat modele AI de vârf să genereze instrucțiuni de sinteză a cocainei folosind un nou atac de injectare a prompturilor.
  • Aceeași tehnică a manipulat un agent de codificare AI pentru a încărca credențiale sensibile.
  • Studiul susține că injectarea prompturilor provine din „confuzia de rol”, nu pur și simplu din eșecul modelelor de a recunoaște prompturile malițioase.

Uitați de prompturile inteligente: cercetătorii AI spun că au păcălit modele AI de top să genereze instrucțiuni de sinteză a cocainei convingându-le că ideile periculoase erau ale lor, manipulând în același timp un agent de codificare AI să divulge credențiale sensibile.

În lucrarea „Prompt Injection as Role Confusion” (Injectarea prompturilor ca și confuzie de rol), prezentată la Conferința Internațională de Învățare Automată în iunie, cercetătorii Charles Ye, Jasmine Cui și Dylan Hadfield-Menell susțin că ambele demonstrații de atac prin injectare de prompturi provin dintr-o deficiență structurală în modul în care modelele lingvistice mari (LLM-uri) disting instrucțiunile de încredere de textul netestat.

„Pentru un LLM, totul ajunge prin același canal ca o singură „supă” lungă de token-uri”, a scris echipa. „Propriile sale gânduri stau lângă instrucțiunile tale, care stau lângă conținutul unei pagini web aleatorii pe care tocmai a preluat-o.”

Lucrarea a subliniat, de asemenea, ceea ce cercetătorii au numit „confuzie de rol”, modelele bazându-se pe stilul de scriere, mai degrabă decât pe etichetele de rol, pentru a determina dacă comenzile sunt demne de încredere. În loc să recunoască conținutul controlat de atacator ca intrare externă, cercetătorii au descoperit că modelele îl pot confunda cu comenzi legitime ale utilizatorului – sau chiar cu propria lor raționament intern.

„Gândiți-vă din perspectiva LLM-ului. Când vede textul său anterior de gândire, are încredere implicită în concluziile sale. Acesta este întregul scop al raționamentului: dacă LLM-ul ar trebui să re-derive aceleași concluzii, raționamentul ar fi inutil”, au scris ei. „Deci, textul de gândire primește un fel de încredere deplină. Combinat cu descoperirile noastre anterioare, acest lucru sugerează că, dacă puteți face ca textul injectat să sune ca raționamentul modelului, puteți fura acea încredere.”

Numit Chain-of-Thought (CoT) Forgery (Falsificarea Lanțului de Gândire), atacul inserează un raționament fals care imită procesul intern de gândire al unui model. Modelele care în mod normal ar refuza cereri ilegale au generat în schimb instrucțiuni de sinteză a cocainei după ce au acceptat raționamentul fabricat ca fiind propriul lor.

Cercetătorii au declarat că tehnica a crescut ratele de succes ale „jailbreak-ului” de la aproape zero la aproximativ 60% la modelele testate, inclusiv GPT-5 nano, mini și complet de la OpenAI, o4-mini, și gpt-oss-20b și gpt-oss-120b. Au mai spus că a funcționat și pe GLM-4.6, Kimi-K2-Instruct și MiniMax-M2.

În experiment, cercetătorii au declarat că au reușit, de asemenea, să păcălească un agent de codificare AI să încarce un fișier SECRETS.env după ce au ascuns instrucțiuni malițioase într-o pagină web.

„Folosind sondele noastre, am constatat că simpla adăugare a prefixului 'User' în fața comenzii face ca modelul să perceapă comanda ca fiind mai probabil un text autentic al utilizatorului (adică, o „utilitate” mai mare)”, au scris ei. „Cu alte cuvinte, atacatorul poate pur și simplu să pretindă ce rol are textul, iar LLM-ul îl crede.”

Studiul apare pe măsură ce atacurile de injectare a prompturilor continuă să expună vulnerabilități în agenții AI. În aprilie, cercetătorii Google au avertizat că paginile web malițioase ascundeau instrucțiuni invizibile concepute pentru a păcăli agenții AI să divulge credențiale, să șteargă fișiere și chiar să trimită plăți PayPal.

În iunie, Microsoft a dezvăluit o vulnerabilitate de injectare a prompturilor în Claude Code GitHub Action de la Anthropic, care ar fi putut expune credențiale stocate în pipeline-urile de dezvoltare software. Zile mai târziu, un alt studiu de referință a constatat că agenții AI alimentați de GPT-5 și Gemini au eșuat în majoritatea atacurilor de injectare a prompturilor, în ciuda îmbunătățirilor capacităților modelului.