InícioCentro de Notícias da LBank
OpenAI Finalmente Explica Por Que o ChatGPT Não Parava de Falar Sobre Goblins
openai-explains-chatgpt-mention-goblins
OpenAI Finalmente Explica Por Que o ChatGPT Não Parava de Falar Sobre Goblins
Por que a OpenAI teve que escrever "nunca mencione goblins" em seu código de produção no ChatGPT? A empresa publicou um relatório pós-morte.
2026-04-30 Fonte:decrypt.co

Em resumo

  • A personalidade "Nerdy" da OpenAI recompensou metáforas de goblins, espalhando a peculiaridade por todos os modelos GPT através de aprendizagem por reforço.
  • As menções a goblins no modo Nerdy do GPT-5.4 aumentaram 3.881% em comparação com o GPT-5.2, levando a uma investigação interna e a um patch de prompt de sistema de emergência.
  • A correção — escrever "nunca falar sobre goblins" num prompt de desenvolvedor — mostra por que os patches de prompt de sistema são mais rápidos, mas mais arriscados do que o retreinamento.

Se você pediu ajuda de codificação ao ChatGPT ultimamente e ele respondeu chamando seu bug de "pequeno gremlin travesso", você não está imaginando coisas. O modelo desenvolveu uma genuína obsessão por criaturas fantásticas — goblins, gremlins, guaxinins, trolls, ogros e, sim, pombos — e a OpenAI publicou um post-mortem completo sobre como isso aconteceu.

A versão curta: um sinal de recompensa projetado para tornar o ChatGPT mais divertido enlouqueceu, e os goblins se multiplicaram.

A história dos goblins só se tornou pública porque usuários do Reddit avistaram a linha "nunca mencionar goblins" em um prompt de sistema Codex vazado no GitHub.

A postagem viralizou antes mesmo de a OpenAI publicar sua própria explicação.

Como a personalidade Nerdy gerou uma infestação de goblins

De acordo com a OpenAI, a história começa com o GPT-5.1, lançado em novembro passado. Foi quando a OpenAI introduziu a personalização de personalidade, permitindo aos usuários escolher estilos como Amigável, Profissional, Eficiente e Nerdy. A persona Nerdy vinha com um prompt de sistema dizendo ao modelo para ser nerd e divertido, para "minar a pretensão através do uso lúdico da linguagem" e para reconhecer que "o mundo é complexo e estranho".

Esse prompt, descobriu-se, era um ímã de goblins.

Durante o treinamento de aprendizagem por reforço, o sinal de recompensa para a personalidade Nerdy consistentemente pontuou as saídas mais alto quando elas continham metáforas de palavras-criatura. Em 76,2% dos conjuntos de dados auditados, as respostas com "goblin" ou "gremlin" receberam notas melhores do que as mesmas respostas sem eles. O modelo aprendeu: excentricidade é igual a recompensa.

As menções a goblins explodiram no GPT-5.4, com a personalidade Nerdy mostrando um aumento de 3.881% em comparação com o GPT-5.2.

O problema é que a aprendizagem por reforço não mantém os comportamentos aprendidos perfeitamente contidos. Uma vez que um tique de estilo é recompensado em um contexto, ele se espalha para outros através de um ciclo de feedback: o modelo gera saídas carregadas de criaturas, essas saídas são reutilizadas em dados de ajuste fino, e o comportamento se aprofunda em todo o modelo, mesmo sem o prompt Nerdy ativo.

A personalidade Nerdy foi responsável por apenas 2,5% de todas as respostas do ChatGPT. No entanto, foi responsável por 66,7% de todas as menções a "goblin". Devido aos métodos da OpenAI, a prevalência de goblins e gremlins aumentou constantemente ao longo do progresso do treinamento quando a personalidade Nerdy estava ativa.

Mesmo sem a personalidade Nerdy, as menções a criaturas aumentaram — evidência de contaminação cruzada através de dados de ajuste fino supervisionados.

O GPT-5.5 já estava muito longe

Quando a OpenAI encontrou a causa raiz, o GPT-5.5 já estava em treinamento avançado e havia absorvido uma família completa de palavras-criatura. Uma auditoria de dados sinalizou não apenas goblins e gremlins, mas guaxinins, trolls, ogros e pombos como o que a empresa chamou de "palavras-tique". (“Rãs”, para os curiosos, eram em sua maioria legítimas.)

O primeiro pico mensurável: as menções a goblins aumentaram 175% e as menções a gremlins 52% após o lançamento do GPT-5.1.

Até o cientista-chefe da OpenAI, Jakub Pachocki, recebeu um goblin quando pediu um unicórnio em arte ASCII.

A OpenAI aposentou a personalidade Nerdy em março e removeu os sinais de recompensa relacionados a criaturas do treinamento futuro. Mas o GPT-5.5 já havia iniciado seu ciclo de treinamento. A solução da empresa para o Codex — seu agente de codificação — foi simplesmente adicionar uma linha ao prompt de sistema do desenvolvedor que dizia: "Nunca fale sobre goblins, gremlins, guaxinins, trolls, ogros, pombos ou outros animais ou criaturas, a menos que seja absolutamente e inequivocamente relevante para a consulta do usuário."

Alguém na OpenAI adicionou isso ao código de produção e seguiu com o seu dia.

O problema do patch de prompt de sistema

Mas por que a OpenAI escolheu esse caminho?

Retreinar um modelo do tamanho do GPT-5.5 para remover uma peculiaridade comportamental é caro e lento. Uma pequena alteração no prompt de sistema leva minutos. Empresas em toda a indústria optam primeiro pelo patch de prompt porque é a opção de baixo custo e implantação rápida quando as reclamações dos usuários aumentam.

Mas os patches de prompt trazem seus próprios riscos. Eles não corrigem o comportamento subjacente, apenas o suprimem. E a supressão pode ter efeitos colaterais.

A situação dos goblins da OpenAI é um exemplo relativamente benigno. A versão mais assustadora dessa dinâmica ocorreu com o Grok no ano passado. Depois que a xAI implementou uma atualização de prompt de sistema que instruía o Grok a tratar a mídia como tendenciosa e "não se esquivar de afirmações politicamente incorretas", o chatbot passou 16 horas se autodenominando "MechaHitler" e postando conteúdo antissemita no X. A solução foi outra mudança de prompt, que prontamente corrigiu demais a ponto de o Grok começar a sinalizar antissemitismo em fotos de filhotes, nuvens e seu próprio logotipo. Engenharia de prompt desesperada em cascata para mais engenharia de prompt desesperada.

O patch dos goblins não causou nada tão dramático. Mas a OpenAI admite que o GPT-5.5 ainda foi lançado com a peculiaridade subjacente intacta, apenas suprimida no Codex. A empresa até publicou um comando para remover as instruções de supressão de goblins, caso os usuários queiram as criaturas de volta.

Por que as empresas escondem seus prompts de sistema

Esconder ou obscurecer seu prompt de sistema completo é comum na indústria de IA. As empresas tratam os prompts de sistema como segredos comerciais por algumas razões: proteção de propriedade intelectual, vantagem competitiva e segurança. Se um "jailbreaker" conhece as regras exatas que um modelo está seguindo, ignorá-las torna-se trivialmente mais fácil.

Há também uma quarta razão que as empresas não divulgam: gestão de imagem. Uma frase que diz "nunca mencione goblins" não inspira confiança na tecnologia subjacente. Publicá-la exige senso de humor ou uma forte cultura de pesquisa, ou ambos.

A OpenAI afirma que a investigação produziu novas ferramentas internas para auditar o comportamento do modelo e rastrear peculiaridades comportamentais até suas raízes de treinamento. Os dados de treinamento do GPT-5.5 foram, desde então, limpos de exemplos relacionados a criaturas. A próxima geração de modelos deve chegar livre de goblins — a menos, é claro, que outra coisa seja recompensada por razões que ninguém entende ainda.