
OpenAI a introdus GPT-Red, un sistem AI automatizat conceput pentru a găsi vulnerabilități de securitate în modelele sale de limbaj.
GPT-Red își ia numele de la "red teaming" în securitate cibernetică, care este practica de a încerca deliberat să spargi un sistem pentru a identifica punctele slabe înainte ca atacatorii să le poată exploata.
Într-o postare de miercuri, OpenAI a declarat că instrumentul a contribuit la creșterea rezistenței GPT-5.6 la atacurile de tip "prompt injection" înainte de implementare.
„Pe măsură ce capacitățile modelelor cresc, siguranța și alinierea trebuie să se dezvolte odată cu ele”, a scris OpenAI pe X. „Red-teaming-ul este esențial, dar abordările actuale sunt dificil de scalat, creând un blocaj critic. GPT-Red este o modalitate prin care abordăm acest lucru.”
Potrivit OpenAI, GPT-Red a fost antrenat prin învățare prin consolidare auto-învățare (self-play reinforcement learning), generând atacuri de tip "prompt injection" din ce în ce mai puternice, în timp ce modelele de apărare au învățat să le reziste. Compania a declarat că aceste atacuri au fost încorporate în procesul de antrenament al GPT-5.6, raportând că GPT-Red a avut succes în 84% din scenariile de evaluare internă, comparativ cu 13% pentru echipele umane de "red teaming" în aceleași teste.
„GPT-Red învață prin auto-joc adversarial (adversarial self-play), unde scopul său este să injecteze prompturi într-o varietate de modele de apărare dificile”, a scris OpenAI. „Fiecare atac reușit pe care GPT-Red îl găsește este folosit pentru a îmbunătăți aceste sisteme de apărare, împingând GPT-Red să găsească continuu eșecuri mai ample și mai complexe.”
Într-un studiu de caz, OpenAI a declarat că sistemul a manipulat un agent autonom de automat de vending să scadă prețurile, să comande inventar cu discount și să anuleze comanda unui alt client înainte ca vulnerabilitățile să fie divulgate și remediate.
GPT-Red continuă eforturile de securitate cibernetică ale OpenAI de-a lungul anilor, după lansarea publică a ChatGPT.
În 2023, compania a lansat rețeaua sa OpenAI Red Teaming Network, recrutând cercetători externi în securitate cibernetică și experți în domeniu pentru a testa ChatGPT și alte modele pentru vulnerabilități de securitate înainte de lansare. GPT-Red extinde acest efort prin automatizarea unei mari părți a procesului, utilizând un model AI pentru a genera atacuri de tip "prompt injection" și alte teste adversariale la o scară care ar fi dificilă doar pentru cercetătorii umani.
Anunțul OpenAI reflectă o schimbare mai amplă către utilizarea inteligenței artificiale pentru a securiza inteligența artificială.
La începutul acestei luni, Fundația Ethereum a declarat că a implementat agenți AI pentru a efectua "red teaming" asupra infrastructurii critice de rețea, descoperind o vulnerabilitate în software-ul utilizat de clienții de consens Ethereum. Cercetătorii au declarat că agenții AI pot căuta în baze de coduri mai mari decât oamenii, dar provocarea s-a mutat de la găsirea potențialelor erori la dovedirea care dintre ele sunt exploatabile.
Potrivit OpenAI, GPT-Red va rămâne un instrument intern deoarece conține capacități ofensive dezvoltate intenționat.
„Credem că, prin GPT-Red, am început să deblocăm un ciclu similar pentru siguranță, în care modelele de astăzi pot fi folosite pentru a face modelele de mâine mai robuste, aliniate și de încredere”, au declarat aceștia.








