PangunaLBank News Center
Gumagamit ang OpenAI ng AI Red Team para palakasin ang GPT-5.6 laban sa Prompt Injection Attacks
openai-ai-red-team-strengthen-gpt-5-6-prompt-injection-attacks
Gumagamit ang OpenAI ng AI Red Team para palakasin ang GPT-5.6 laban sa Prompt Injection Attacks
Sinabi ng OpenAI na ang bago nitong awtomatikong red-teaming na modelo, ang GPT-Red, ay nakatuklas ng mga kahinaan na ginamit upang gawing mas matatag ang GPT-5.6 laban sa mga atake ng prompt injection.
2026-07-15 Pinagmulan:decrypt.co

Sa maikli

  • Ipinakilala ng OpenAI ang GPT-Red, isang awtomatikong sistema ng AI na idinisenyo upang makahanap ng mga kahinaan sa mga modelong GPT bago ilabas.
  • Sinabi ng kumpanya na ginamit ang GPT-Red upang sanayin ang GPT-5.6, na nagpapababa ng mga pagkabigo sa isa sa pinakamahirap nitong benchmark ng prompt injection.
  • Ang sistema ay inilaan upang umakma sa mga human red teamer, third-party na pagsusuri, at iba pang mga panukala sa kaligtasan ng AI.

Ipinakilala ng OpenAI ang GPT-Red, isang awtomatikong sistema ng AI na idinisenyo upang makahanap ng mga kahinaan sa seguridad sa mga modelo ng wika nito.

Ang GPT-Red ay kinuha ang pangalan nito mula sa cybersecurity red teaming, na siyang pagsasanay ng sadyang pagtatangka na sirain ang isang sistema upang tukuyin ang mga kahinaan bago pa man magamit ito ng mga umaatake.

Sa isang post nitong Miyerkules, sinabi ng OpenAI na ang tool ay nakatulong na gawing mas lumalaban ang GPT-5.6 sa mga pag-atake ng prompt injection bago ito i-deploy.

“Habang lumalaki ang kakayahan ng modelo, ang kaligtasan at pagkakahanay ay dapat ding lumawak,” isinulat ng OpenAI sa X. “Mahalaga ang red-teaming, ngunit ang mga kasalukuyang pamamaraan ay mahirap sukatin, na lumilikha ng isang kritikal na bottleneck. Ang GPT‑Red ay isang paraan na tinutugunan namin ito.”

Ayon sa OpenAI, ang GPT-Red ay sinanay sa pamamagitan ng self-play reinforcement learning, na bumubuo ng patuloy na lumalakas na pag-atake ng prompt injection habang natututo ang mga modelong tagapagtanggol na labanan ang mga ito. Sinabi ng kumpanya na ang mga pag-atakeng iyon ay isinama sa proseso ng pagsasanay ng GPT-5.6, na nag-ulat na nagtagumpay ang GPT-Red sa 84% ng panloob na mga senaryo ng pagsusuri, kumpara sa 13% para sa mga human red teamer sa parehong mga pagsubok.

“Ang GPT‑Red ay natututo sa pamamagitan ng adversarial self-play, kung saan ang layunin nito ay mag-prompt inject sa iba't ibang mapaghamong modelong tagapagtanggol,” isinulat ng OpenAI. “Bawat matagumpay na pag-atake na nakikita ng GPT-Red ay ginagamit upang mapabuti ang mga tagapagtanggol na ito, na nagtutulak sa GPT‑Red na patuloy na makahanap ng mas malawak at mas kumplikadong mga pagkabigo.”

Sa isang case study, sinabi ng OpenAI na minanipula ng sistema ang isang autonomous na ahente ng vending machine upang magpababa ng presyo, mag-order ng diskwentong imbentaryo, at kanselahin ang order ng ibang customer bago pa man naibunyag at natugunan ang mga kahinaan.

Sinusundan ng GPT-Red ang mga taon ng pagsisikap sa cybersecurity ng OpenAI matapos ang pampublikong paglulunsad ng ChatGPT.

Noong 2023, inilunsad ng kumpanya ang OpenAI Red Teaming Network nito, na kumukuha ng mga panlabas na mananaliksik sa cybersecurity at eksperto sa domain upang suriin ang ChatGPT at iba pang modelo para sa mga depekto sa seguridad bago ilabas. Pinapalawak ng GPT-Red ang pagsisikap na iyon sa pamamagitan ng pag-a-automate ng malaking bahagi ng proseso, gamit ang isang modelo ng AI upang bumuo ng mga pag-atake ng prompt injection at iba pang adversarial na pagsubok sa isang sukat na magiging mahirap para sa mga tao na mananaliksik lamang.

Ang anunsyo ng OpenAI ay nagpapakita ng mas malawak na pagbabago patungo sa paggamit ng AI upang masiguro ang AI.

Mas maaga ngayong buwan, sinabi ng Ethereum Foundation na nag-deploy ito ng mga ahente ng AI upang i-red-team ang kritikal na imprastraktura ng network, na natuklasan ang isang kahinaan sa software na ginagamit ng mga kliyente ng konsensus ng Ethereum. Sinabi ng mga mananaliksik na ang mga ahente ng AI ay maaaring maghanap sa mas malalaking codebase kaysa sa mga tao, ngunit ang hamon ay lumipat mula sa paghahanap ng potensyal na bug patungo sa pagpapatunay kung alin ang maaaring samantalahin.

Ayon sa OpenAI, ang GPT-Red ay mananatiling panloob na tool dahil naglalaman ito ng sadyang binuo na mga kakayahang opensiba.

“Naniniwala kami sa GPT-Red na nasimulan namin ang pagbubukas ng katulad na flywheel para sa kaligtasan, kung saan ang mga modelo ngayon ay maaaring gamitin upang gawing mas matatag, nakahanay, at mapagkakatiwalaan ang mga modelo sa hinaharap,” anila.