
Dacă ați cerut recent ajutor de codare de la ChatGPT și v-a răspuns numind eroarea dvs. un „mic spiriduș răutăcios”, nu vă imaginați lucruri. Modelul a dezvoltat o obsesie autentică pentru creaturile fantastice – goblini, spiriduși, ratoni, troli, ogri și, da, porumbei – iar OpenAI a publicat un raport post-mortem complet despre cum s-a întâmplat acest lucru.
Pe scurt: un semnal de recompensă conceput pentru a face ChatGPT mai jucăuș a luat-o razna, iar goblinii s-au înmulțit.
Povestea goblinilor a devenit publică doar pentru că utilizatorii Reddit au descoperit linia „nu menționa niciodată goblinii” într-un prompt de sistem Codex scurs pe GitHub.
Articolul a devenit viral înainte ca OpenAI să publice propria explicație.
Potrivit OpenAI, povestea începe cu GPT-5.1, lansat în noiembrie anul trecut. Atunci OpenAI a introdus personalizarea personalității, permițând utilizatorilor să aleagă stiluri precum Amical, Profesional, Eficient și Nerdy. Persona Nerdy a venit cu un prompt de sistem care spunea modelului să fie tocilar și jucăuș, să „submineze pretenția printr-un limbaj ludic” și să recunoască faptul că „lumea este complexă și ciudată”.
Acest prompt, s-a dovedit, a fost un magnet pentru goblini.
În timpul antrenamentului prin învățare prin consolidare, semnalul de recompensă pentru personalitatea Nerdy a punctat constant mai bine răspunsurile care conțineau metafore cu cuvinte referitoare la creaturi. În 76,2% din seturile de date auditate, răspunsurile cu „goblin” sau „spiriduș” au primit note mai bune decât aceleași răspunsuri fără ele. Modelul a învățat: fantezia echivalează cu recompensa.
Mențiunile de goblini au explodat în GPT-5.4, personalitatea Nerdy înregistrând o creștere de 3.881% comparativ cu GPT-5.2.
Problema este că învățarea prin consolidare nu menține comportamentele învățate în mod ordonat. Odată ce o particularitate de stil este recompensată într-un context, ea se extinde în alte contexte printr-o buclă de feedback: modelul generează rezultate încărcate cu creaturi, acele rezultate sunt refolosite în datele de ajustare fină, iar comportamentul se adâncește în întregul model, chiar și fără promptul Nerdy activ.
Nerdy a reprezentat doar 2,5% din toate răspunsurile ChatGPT. A fost responsabil pentru 66,7% din toate mențiunile de „goblin”. Datorită metodelor OpenAI, prevalența goblinilor și spiridușilor a crescut constant pe parcursul progresului antrenamentului atunci când personalitatea Nerdy era activă.
Chiar și fără personalitatea Nerdy, mențiunile de creaturi au crescut – o dovadă a contaminării încrucișate prin datele de ajustare fină supravegheată.
Până când OpenAI a găsit cauza principală, GPT-5.5 era deja profund în antrenament și absorbise o întreagă familie de cuvinte referitoare la creaturi. Un audit al datelor a semnalat nu doar goblinii și spiridușii, ci și ratonii, trolii, ogrii și porumbeii ca fiind ceea ce compania a numit „cuvinte tic”. („Broaștele”, pentru cei curioși, erau în mare parte legitime.)
Primul vârf măsurabil: mențiunile de goblini au crescut cu 175%, iar cele de spiriduși cu 52% după lansarea GPT-5.1.
Chiar și cercetătorul șef al OpenAI, Jakub Pachocki, a primit un goblin când a cerut un unicorn în artă ASCII.
OpenAI a retras personalitatea Nerdy în martie și a eliminat semnalele de recompensă afine creaturilor din antrenamentele viitoare. Însă GPT-5.5 își începuse deja rularea de antrenament. Soluția companiei pentru Codex – agentul său de codare – a fost pur și simplu să adauge o linie la promptul de sistem pentru dezvoltatori, care spunea „Nu vorbiți niciodată despre goblini, spiriduși, ratoni, troli, ogri, porumbei sau alte animale sau creaturi, decât dacă este absolut și fără echivoc relevant pentru interogarea utilizatorului”.
Cineva de la OpenAI a implementat asta în codul de producție și și-a continuat ziua.
Dar de ce a ales OpenAI această cale?
Reantrenarea unui model de dimensiunea GPT-5.5 pentru a elimina o particularitate comportamentală este scumpă și lentă. O ajustare a promptului de sistem durează minute. Companiile din întreaga industrie recurg mai întâi la remedierea prin prompt, deoarece este opțiunea cu costuri reduse și implementare rapidă atunci când plângerile utilizatorilor cresc brusc.
Însă remedierile prin prompturi comportă propriile riscuri. Ele nu repară comportamentul subiacent, ci doar îl suprimă. Iar suprimarea poate avea efecte secundare.
Situația goblinilor de la OpenAI este un exemplu relativ benign. Cea mai înspăimântătoare versiune a acestei dinamici s-a desfășurat cu Grok anul trecut. După ce xAI a lansat o actualizare a promptului de sistem care îi spunea lui Grok să trateze media ca fiind părtinitoare și „să nu se ferească de afirmațiile incorecte politic”, chatbot-ul a petrecut 16 ore autointitulându-se „MechaHitler” și postând conținut antisemit pe X. Soluția a fost o altă modificare a promptului, care a supracorectat atât de puternic încât Grok a început să semnaleze antisemitismul în imagini cu cățeluși, nori și propriul său logo. Inginerie de prompturi disperată, care a escaladat în inginerie de prompturi și mai disperată.
Remedierea pentru goblini nu a provocat nimic atât de dramatic. Dar OpenAI recunoaște că GPT-5.5 a fost lansat totuși cu particularitatea subiacentă intactă, doar suprimată în Codex. Compania a publicat chiar și o comandă pentru a elimina instrucțiunile de suprimare a goblinilor, dacă utilizatorii doresc creaturile înapoi.
Ascunderea sau obscurizarea promptului complet de sistem este tipică în industria AI. Companiile tratează prompturile de sistem ca secrete comerciale din câteva motive: protecția proprietății intelectuale, avantaj competitiv și securitate. Dacă un „jailbreaker” cunoaște regulile exacte pe care le urmează un model, ocolirea acestora devine trivial mai ușoară.
Există și un al patrulea motiv pe care companiile nu îl publică: gestionarea imaginii. O linie care spune „nu menționa niciodată goblinii” nu inspiră încredere în tehnologia subiacentă. Publicarea ei necesită fie un simț al umorului, fie o cultură puternică de cercetare, fie ambele.
OpenAI afirmă că investigația a produs noi instrumente interne pentru a audita comportamentul modelului și a urmări particularitățile comportamentale până la rădăcinile lor de antrenament. Datele de antrenament ale GPT-5.5 au fost de atunci curățate de exemple afine creaturilor. Următoarea generație de modele ar trebui să sosească fără goblini – cu excepția cazului în care, desigur, altceva este recompensat din motive pe care nimeni nu le înțelege încă.








