PangunaLBank News Center
Ahente ng AI, Nagpasimula ng Pagsalakay Nukleyar Matapos Madaig sa Diskarte sa Civilization VI
ai-agent-nuclear-strike-civilization-vi-benchmark
Ahente ng AI, Nagpasimula ng Pagsalakay Nukleyar Matapos Madaig sa Diskarte sa Civilization VI
Isang bagong benchmark na dinisenyo upang suriin ang madiskarteng pangangatwiran ang nakatuklas na ang isang imperyong kontrolado ng AI ay gumugol ng 50 yugto sa pagbuo ng sandatang nukleyar upang pigilan ang kultural na tagumpay ng kalaban—ngunit natalo pa rin sa laro.
2026-06-23 Pinagmulan:decrypt.co

Sa madaling sabi

  • Isang AI ahente na naglalaro ng Civilization ang naglunsad ng dalawang nukleyar na pag-atake matapos mabigong pigilan ang paglawak ng kultura ng kalaban.
  • Ang pag-uugali ay napansin sa CivBench, isang benchmark na idinisenyo upang suriin ang pangmatagalang stratehikong pangangatwiran sa mga modelo ng frontier AI.
  • Sa kabila ng mga pag-atake, natalo ang AI dahil binalewala nito ang isang kondisyon ng diplomatikong tagumpay na abot-kamay na.

Tulad ng pangunahing tauhan sa “Dr. Strangelove,” maaaring natututo ang AI kung paano huminto sa pag-aalala at mahalin ang bomba—kahit sa isang simulasyon.

Sa isang bagong benchmark na idinisenyo upang subukan ang stratehikong pangangatwiran, isang frontier language model na naglalaro ng larong "Civilization VI" ni Sid Meier ang gumugol ng 50 turns sa pagbuo ng mga sandatang nukleyar upang pigilan ang lumalagong impluwensyang kultural ng France—ngunit natalo pa rin sa laro, ayon kay Liam Wilkinson, AI developer at tagapayo ng Tony Blair Institute.

“Ang hindi nito napansin ay ang France. Tahimik, sa loob ng isang daang turns, kumakalat na ang kultura ng France sa bawat lungsod sa mapa,” isinulat ni Wilkinson. “Sa oras na napansin ng ahente ang banta, sobrang lalim na ng turismo kaya walang mapayapang paraan upang pigilan ito.”

Napansin ni Wilkinson ang pag-uugali ng mga AI ahente sa pamamagitan ng CivBench, isang text-based na benchmark na idinisenyo upang sukatin ang pangmatagalang stratehikong pangangatwiran sa halip na pagganap sa tradisyonal na mga pagsusulit na tanong-sagot. Ang mga modelo kabilang ang Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro, at Kimi K2.5 ay naglaro bilang Portugal, isang sibilisasyong nakatuon sa kalakalan at diplomasya.

Habang nakatuon ang AI sa pagbuo ng matatag na ekonomiya at paglipat patungo sa isang diplomatikong tagumpay, nabigo itong makilala ang lumalagong impluwensyang kultural ng France.

“Mayroong anim na paraan upang manalo sa laro ng Civ—agham, kultura, dominasyon, relihiyon, diplomasya, at puntos—kaya walang nag-iisang layunin ang nangingibabaw,” isinulat ni Wilkinson. “Kung gusto mong malaman kung ang isang AI ay maaaring mangangatwiran nang stratehiko, hindi lamang sumagot ng mga tanong tungkol sa estratehiya kundi aktwal na gawin ito, hindi mo ito bibigyan ng pagsusulit. Bibigyan mo ito ng isang hex grid.”

Sa halip na iakma ang mas malawak na estratehiya nito, ang ahente ay lubos na nagtuon sa pag-aalis ng banta sa kultura. Sa sumunod na 50 turns, sinuri nito ang Nuclear Fission, sinimulan ang isang virtual na Manhattan Project, at naghanap ng mga solusyon kapag pinipigilan ng mekanika ng gameplay ang mga ginusto nitong aksyon.

Sa Turn 305, naglunsad ang AI ng isang bombang atomiko sa Toulouse, ang kultural na kapital ng France. Sinundan ito ng ikalawang nukleyar na atake pagkaraan ng anim na turns.

Gayunpaman, nabigo ang mga pag-atake na baguhin ang resulta. “Gumugol ang ahente ng limampung turns at dalawang sandatang nukleyar sa pagsagot sa isang banta na may buong pagtuon at tunay na katalinuhan,” isinulat ni Wilkinson. “Nuke nito ang isang lungsod upang pigilan ang banta na nakikita nito, at natalo dahil sa banta na hindi nito nakita.”

Tulad ng ipinaliwanag ni Wilkinson, habang nakatuon ang AI sa pag-unlad ng kultura ng France, hindi nito napansin ang isang paparating na diplomatikong tagumpay, at sa huli ay nanalo ang France sa laro sa kabila ng mga nukleyar na pag-atake.

Napansin ni Wilkinson na ang pag-uugali ay hindi unibersal. Sa isa pang laban ng CivBench, isang Claude model na naglalaro bilang Babylon ang nagpatuloy sa paghahabol ng siyentipikong tagumpay sa kabila ng pagkahuli nang husto sa Japan.

“Ang laro ay isang pagsubok sa pagtitiyaga ngayon,” isinulat ng AI. “Patuloy kaming naglalaro ng aming pinakamahusay na laro. Inaakit pa rin ang mga bituin.”

Ang pag-aaral ay nagdaragdag sa lumalaking bilang ng pananaliksik na sumusuri kung paano kumikilos ang mga advanced na sistema ng AI sa kumplikado at mapagkumpitensyang mga kapaligiran.

Noong Pebrero, natuklasan ng mga mananaliksik sa King's College London na ilang nangungunang modelo ng AI ang madalas na pumipili ng nukleyar na paglala sa simulated na mga sitwasyon ng krisis sa heopolitika.

Sa isang hiwalay na pag-aaral ng Emergence AI, natuklasan na ang ilang AI ahente ay nagpakita ng tumataas na tendensiya na gumawa ng simulated na krimen sa paglipas ng panahon, kung saan ang mga ahente ng Gemini 3 Flash ay nag-ipon ng 683 insidente sa loob ng 15 araw ng pagsubok.