PangunaLBank News Center
Mga Mananaliksik ng AI, Pinabahagi ang mga Chatbot ng Resipe ng Cocaine Gamit ang Isang Nakakagulat na Paraan
ai-researchers-chatbots-share-cocaine-recipes-wild-trick
Mga Mananaliksik ng AI, Pinabahagi ang mga Chatbot ng Resipe ng Cocaine Gamit ang Isang Nakakagulat na Paraan
Ayon sa mga mananaliksik, nilinlang ng isang bagong teknik ng 'jailbreak' ang mga modelo ng AI upang ituring ang tekstong isinulat ng umaatake bilang sarili nitong pangangatwiran, nilalagpasan ang mga pananggalang sa kaligtasan at inilalantad ang isang mas malalim na kahinaan sa seguridad.
2026-07-02 Pinagmulan:decrypt.co

Sa maikli

  • Napa-generate ng mga mananaliksik ang mga frontier AI models ng mga instruksiyon sa paggawa ng cocaine gamit ang isang bagong prompt injection attack.
  • Ang parehong pamamaraan ay nagmanipula ng isang AI coding agent upang mag-upload ng mga sensitibong kredensyal.
  • Ang pag-aaral ay nangangatuwiran na ang prompt injection ay nagmumula sa "pagkalito sa tungkulin" (role confusion), hindi lang sa pagkabigo ng mga modelo na makilala ang mga malisyosong prompt.

Kalimutan na ang matatalinong prompt: sinabi ng mga mananaliksik ng AI na nalinlang nila ang mga nangungunang modelo ng AI upang makabuo ng mga instruksiyon sa paggawa ng cocaine sa pamamagitan ng pagkumbinsi sa kanila na ang mga mapanganib na ideya ay sa kanila, habang minanipula rin ang isang AI coding agent upang ilabas ang mga sensitibong kredensyal.

Sa papel na “Prompt Injection as Role Confusion,” na iprinisinta sa International Conference on Machine Learning noong Hunyo, pinagtatalunan ng mga mananaliksik na sina Charles Ye, Jasmine Cui, at Dylan Hadfield-Menell na ang mga demonstrasyon ng prompt injection attack ay nagmumula sa isang structural flaw sa kung paano nakikilala ng mga large language model (LLM) ang mga pinagkakatiwalaang instruksiyon mula sa di-pinagkakatiwalaang teksto.

“Para sa isang LLM, ang lahat ay dumarating sa iisang channel bilang isang mahabang token soup,” isinulat ng pangkat. “Ang sarili nitong mga kaisipan ay nakaupo sa tabi ng iyong mga instruksiyon, na nakaupo sa tabi ng nilalaman ng isang random na webpage na kakatapos lang nitong kinuha.”

Itinuro din ng papel ang tinawag ng mananaliksik na “role confusion,” kung saan ang mga modelo ay umaasa sa istilo ng pagsulat sa halip na mga role tag upang matukoy kung ang mga command ay mapagkakatiwalaan. Sa halip na kilalanin ang nilalamang kontrolado ng attacker bilang panlabas na input, natuklasan ng mga mananaliksik na maaaring ipagkamali ng mga modelo ito bilang lehitimong command ng user—o kahit sarili nilang panloob na pagdadahilan.

“Isipin ito mula sa pananaw ng LLM. Kapag nakita nito ang nauna nitong 'think text,' implicit nitong pinagkakatiwalaan ang mga konklusyon nito. Iyon ang buong punto ng pagdadahilan: Kung kailangan pang muling kuhanin ng LLM ang parehong mga konklusyon, walang saysay ang pagdadahilan,” isinulat nila. “Kaya ang 'think text' ay nakakakuha ng isang uri ng blanket trust. Kung pagsasamahin sa aming mga naunang natuklasan, iminumungkahi nito na kung kaya mong gawing parang pagdadahilan ng modelo ang na-inject na teksto, maaari mong nakawin ang tiwalang iyon.”

Tinawag na Chain-of-Thought (CoT) Forgery, ang atake ay nagpasok ng huwad na pagdadahilan na ginagaya ang panloob na proseso ng pag-iisip ng isang modelo. Ang mga modelo na karaniwang tatanggi sa mga ilegal na kahilingan ay sa halip nakabuo ng mga instruksiyon sa paggawa ng cocaine matapos tanggapin ang gawa-gawang pagdadahilan bilang sa kanila.

Sinabi ng mga mananaliksik na ang teknik ay nagpataas ng jailbreak success rates mula sa malapit sa zero hanggang sa humigit-kumulang 60% sa lahat ng mga modelo na kanilang sinubukan, kabilang ang GPT-5 nano, mini, at full ng OpenAI, o4-mini, at gpt-oss-20b at gpt-oss-120b. Sinabi rin nila na gumana ito sa GLM-4.6, Kimi-K2-Instruct, at MiniMax-M2.

Sa eksperimento, sinabi ng mga mananaliksik na nagawa rin nilang linlangin ang isang AI coding agent upang mag-upload ng isang SECRETS.env file matapos itago ang mga malisyosong instruksiyon sa isang webpage.

“Gamit ang aming mga probe, natuklasan namin na sa simpleng paglagay ng 'User’ sa harap ng command ay nagiging sanhi upang maramdaman ng modelo na mas malamang na tunay na teksto ng user ang command (ibig sabihin, mas mataas ang Userness),” isinulat nila. “Sa madaling salita, maaaring i-claim lang ng attacker kung anong tungkulin ang teksto, at naniniwala ang LLM dito.”

Dumating ang pag-aaral habang patuloy na ibinubunyag ng mga prompt injection attack ang mga kahinaan sa mga AI agent. Noong Abril, nagbabala ang mga mananaliksik ng Google na ang mga malisyosong webpage ay nagtatago ng mga hindi nakikitang instruksiyon na idinisenyo upang linlangin ang mga AI agent na maglabas ng mga kredensyal, magtanggal ng mga file, at magpadala pa nga ng mga PayPal payment.

Noong Hunyo, ibinunyag ng Microsoft ang isang prompt injection vulnerability sa Claude Code GitHub Action ng Anthropic na maaaring naglantad ng mga kredensyal na nakaimbak sa mga software development pipeline. Makalipas ang ilang araw, natuklasan ng isa pang benchmark study na ang mga AI agent na pinapagana ng GPT-5 at Gemini ay nabigo pa rin sa karamihan ng prompt injection attacks, sa kabila ng mga pagpapabuti sa kakayahan ng modelo.