InícioCentro de Notícias da LBank
Pesquisadores de IA Levaram Chatbots a Compartilhar Receitas de Cocaína com Um Único Artifício Inusitado
ai-researchers-chatbots-share-cocaine-recipes-wild-trick
Pesquisadores de IA Levaram Chatbots a Compartilhar Receitas de Cocaína com Um Único Artifício Inusitado
Pesquisadores afirmam que uma nova técnica de jailbreak enganou modelos de IA, levando-os a tratar texto escrito por atacantes como seu próprio raciocínio, contornando as salvaguardas de segurança e expondo uma falha de segurança mais profunda.
2026-07-02 Fonte:decrypt.co

Em resumo

  • Pesquisadores conseguiram que modelos de IA de ponta gerassem instruções de síntese de cocaína usando um novo ataque de injeção de prompt.
  • A mesma técnica manipulou um agente de codificação de IA para carregar credenciais sensíveis.
  • O estudo argumenta que a injeção de prompt decorre de "confusão de papel", e não simplesmente de modelos que falham em reconhecer prompts maliciosos.

Esqueça prompts inteligentes: pesquisadores de IA afirmam ter enganado os principais modelos de IA para gerar instruções de síntese de cocaína, convencendo-os de que as ideias perigosas eram suas, ao mesmo tempo em que manipularam um agente de codificação de IA para vazar credenciais sensíveis.

No artigo “Prompt Injection as Role Confusion” (Injeção de Prompt como Confusão de Papel), apresentado na Conferência Internacional sobre Aprendizado de Máquina em junho, os pesquisadores Charles Ye, Jasmine Cui e Dylan Hadfield-Menell argumentam que ambas as demonstrações de ataque de injeção de prompt derivam de uma falha estrutural na forma como os grandes modelos de linguagem (LLMs) distinguem instruções confiáveis de texto não confiável.

“Para um LLM, tudo chega pelo mesmo canal como uma longa sopa de tokens”, escreveu a equipe. “Seus próprios pensamentos ficam ao lado de suas instruções, que ficam ao lado do conteúdo de uma página da web aleatória que acabou de buscar.”

O artigo também apontou para o que o pesquisador chamou de “confusão de papel”, com os modelos dependendo do estilo de escrita, em vez de tags de função, para determinar se os comandos são confiáveis. Em vez de reconhecer o conteúdo controlado pelo atacante como entrada externa, os pesquisadores descobriram que os modelos podem confundi-lo com comandos legítimos do usuário — ou até mesmo com seu próprio raciocínio interno.

“Pense nisso da perspectiva do LLM. Quando ele vê seu texto de pensamento anterior, ele confia implicitamente em suas conclusões. Esse é o ponto principal do raciocínio: se o LLM tivesse que rederivar as mesmas conclusões, o raciocínio seria inútil”, escreveram. “Então, o texto do pensamento recebe uma espécie de confiança irrestrita. Combinado com nossas descobertas anteriores, isso sugere que, se você puder fazer o texto injetado soar como o raciocínio do modelo, poderá roubar essa confiança.”

Chamado de Falsificação de Cadeia de Pensamento (CoT), o ataque insere um raciocínio falso que imita o processo de pensamento interno de um modelo. Modelos que normalmente recusariam solicitações ilegais, em vez disso, geraram instruções de síntese de cocaína após aceitarem o raciocínio fabricado como seu próprio.

Os pesquisadores disseram que a técnica aumentou as taxas de sucesso de jailbreak de quase zero para cerca de 60% nos modelos que testaram, incluindo GPT-5 nano, mini e completo da OpenAI, o4-mini, e gpt-oss-20b e gpt-oss-120b. Eles também disseram que funcionou em GLM-4.6, Kimi-K2-Instruct e MiniMax-M2.

No experimento, os pesquisadores disseram que também conseguiram enganar um agente de codificação de IA para carregar um arquivo SECRETS.env depois de esconder instruções maliciosas em uma página da web.

“Usando nossas sondas, descobrimos que simplesmente adicionar 'User' na frente do comando faz com que o modelo perceba o comando como mais propenso a ser um texto de usuário genuíno (ou seja, maior 'Userness')”, escreveram. “Em outras palavras, o atacante pode simplesmente reivindicar qual é o papel do texto, e o LLM acredita.”

O estudo surge à medida que os ataques de injeção de prompt continuam a expor as fraquezas em agentes de IA. Em abril, pesquisadores do Google alertaram que páginas da web maliciosas estavam escondendo instruções invisíveis projetadas para enganar agentes de IA a vazar credenciais, excluir arquivos e até mesmo enviar pagamentos via PayPal.

Em junho, a Microsoft divulgou uma vulnerabilidade de injeção de prompt no Claude Code GitHub Action da Anthropic que poderia ter exposto credenciais armazenadas em pipelines de desenvolvimento de software. Dias depois, outro estudo de benchmark descobriu que agentes de IA alimentados por GPT-5 e Gemini ainda falhavam na maioria dos ataques de injeção de prompt, apesar das melhorias nas capacidades do modelo.