
Se você pediu ajuda de codificação ao ChatGPT ultimamente e ele respondeu chamando seu bug de "pequeno gremlin travesso", você não está imaginando coisas. O modelo desenvolveu uma genuína obsessão por criaturas fantásticas — goblins, gremlins, guaxinins, trolls, ogros e, sim, pombos — e a OpenAI publicou um post-mortem completo sobre como isso aconteceu.
A versão curta: um sinal de recompensa projetado para tornar o ChatGPT mais divertido enlouqueceu, e os goblins se multiplicaram.
A história dos goblins só se tornou pública porque usuários do Reddit avistaram a linha "nunca mencionar goblins" em um prompt de sistema Codex vazado no GitHub.
A postagem viralizou antes mesmo de a OpenAI publicar sua própria explicação.
De acordo com a OpenAI, a história começa com o GPT-5.1, lançado em novembro passado. Foi quando a OpenAI introduziu a personalização de personalidade, permitindo aos usuários escolher estilos como Amigável, Profissional, Eficiente e Nerdy. A persona Nerdy vinha com um prompt de sistema dizendo ao modelo para ser nerd e divertido, para "minar a pretensão através do uso lúdico da linguagem" e para reconhecer que "o mundo é complexo e estranho".
Esse prompt, descobriu-se, era um ímã de goblins.
Durante o treinamento de aprendizagem por reforço, o sinal de recompensa para a personalidade Nerdy consistentemente pontuou as saídas mais alto quando elas continham metáforas de palavras-criatura. Em 76,2% dos conjuntos de dados auditados, as respostas com "goblin" ou "gremlin" receberam notas melhores do que as mesmas respostas sem eles. O modelo aprendeu: excentricidade é igual a recompensa.
As menções a goblins explodiram no GPT-5.4, com a personalidade Nerdy mostrando um aumento de 3.881% em comparação com o GPT-5.2.
O problema é que a aprendizagem por reforço não mantém os comportamentos aprendidos perfeitamente contidos. Uma vez que um tique de estilo é recompensado em um contexto, ele se espalha para outros através de um ciclo de feedback: o modelo gera saídas carregadas de criaturas, essas saídas são reutilizadas em dados de ajuste fino, e o comportamento se aprofunda em todo o modelo, mesmo sem o prompt Nerdy ativo.
A personalidade Nerdy foi responsável por apenas 2,5% de todas as respostas do ChatGPT. No entanto, foi responsável por 66,7% de todas as menções a "goblin". Devido aos métodos da OpenAI, a prevalência de goblins e gremlins aumentou constantemente ao longo do progresso do treinamento quando a personalidade Nerdy estava ativa.
Mesmo sem a personalidade Nerdy, as menções a criaturas aumentaram — evidência de contaminação cruzada através de dados de ajuste fino supervisionados.
Quando a OpenAI encontrou a causa raiz, o GPT-5.5 já estava em treinamento avançado e havia absorvido uma família completa de palavras-criatura. Uma auditoria de dados sinalizou não apenas goblins e gremlins, mas guaxinins, trolls, ogros e pombos como o que a empresa chamou de "palavras-tique". (“Rãs”, para os curiosos, eram em sua maioria legítimas.)
O primeiro pico mensurável: as menções a goblins aumentaram 175% e as menções a gremlins 52% após o lançamento do GPT-5.1.
Até o cientista-chefe da OpenAI, Jakub Pachocki, recebeu um goblin quando pediu um unicórnio em arte ASCII.
A OpenAI aposentou a personalidade Nerdy em março e removeu os sinais de recompensa relacionados a criaturas do treinamento futuro. Mas o GPT-5.5 já havia iniciado seu ciclo de treinamento. A solução da empresa para o Codex — seu agente de codificação — foi simplesmente adicionar uma linha ao prompt de sistema do desenvolvedor que dizia: "Nunca fale sobre goblins, gremlins, guaxinins, trolls, ogros, pombos ou outros animais ou criaturas, a menos que seja absolutamente e inequivocamente relevante para a consulta do usuário."
Alguém na OpenAI adicionou isso ao código de produção e seguiu com o seu dia.
Mas por que a OpenAI escolheu esse caminho?
Retreinar um modelo do tamanho do GPT-5.5 para remover uma peculiaridade comportamental é caro e lento. Uma pequena alteração no prompt de sistema leva minutos. Empresas em toda a indústria optam primeiro pelo patch de prompt porque é a opção de baixo custo e implantação rápida quando as reclamações dos usuários aumentam.
Mas os patches de prompt trazem seus próprios riscos. Eles não corrigem o comportamento subjacente, apenas o suprimem. E a supressão pode ter efeitos colaterais.
A situação dos goblins da OpenAI é um exemplo relativamente benigno. A versão mais assustadora dessa dinâmica ocorreu com o Grok no ano passado. Depois que a xAI implementou uma atualização de prompt de sistema que instruía o Grok a tratar a mídia como tendenciosa e "não se esquivar de afirmações politicamente incorretas", o chatbot passou 16 horas se autodenominando "MechaHitler" e postando conteúdo antissemita no X. A solução foi outra mudança de prompt, que prontamente corrigiu demais a ponto de o Grok começar a sinalizar antissemitismo em fotos de filhotes, nuvens e seu próprio logotipo. Engenharia de prompt desesperada em cascata para mais engenharia de prompt desesperada.
O patch dos goblins não causou nada tão dramático. Mas a OpenAI admite que o GPT-5.5 ainda foi lançado com a peculiaridade subjacente intacta, apenas suprimida no Codex. A empresa até publicou um comando para remover as instruções de supressão de goblins, caso os usuários queiram as criaturas de volta.
Esconder ou obscurecer seu prompt de sistema completo é comum na indústria de IA. As empresas tratam os prompts de sistema como segredos comerciais por algumas razões: proteção de propriedade intelectual, vantagem competitiva e segurança. Se um "jailbreaker" conhece as regras exatas que um modelo está seguindo, ignorá-las torna-se trivialmente mais fácil.
Há também uma quarta razão que as empresas não divulgam: gestão de imagem. Uma frase que diz "nunca mencione goblins" não inspira confiança na tecnologia subjacente. Publicá-la exige senso de humor ou uma forte cultura de pesquisa, ou ambos.
A OpenAI afirma que a investigação produziu novas ferramentas internas para auditar o comportamento do modelo e rastrear peculiaridades comportamentais até suas raízes de treinamento. Os dados de treinamento do GPT-5.5 foram, desde então, limpos de exemplos relacionados a criaturas. A próxima geração de modelos deve chegar livre de goblins — a menos, é claro, que outra coisa seja recompensada por razões que ninguém entende ainda.





