InícioCentro de Notícias da LBank
OpenAI Usa Equipe Vermelha de IA para Fortalecer GPT-5.6 Contra Ataques de Injeção de Prompt
openai-ai-red-team-strengthen-gpt-5-6-prompt-injection-attacks
OpenAI Usa Equipe Vermelha de IA para Fortalecer GPT-5.6 Contra Ataques de Injeção de Prompt
A OpenAI disse que seu novo modelo automatizado de red-teaming, o GPT-Red, descobriu vulnerabilidades que foram usadas para tornar o GPT-5.6 mais resistente a ataques de injeção de prompt.
2026-07-15 Fonte:decrypt.co

Em resumo

  • A OpenAI introduziu o GPT-Red, um sistema de IA automatizado concebido para encontrar vulnerabilidades em modelos GPT antes do lançamento.
  • A empresa afirmou que o GPT-Red foi usado para treinar o GPT-5.6, reduzindo falhas num dos seus mais difíceis benchmarks de injeção de prompt.
  • O sistema destina-se a complementar equipas de "red team" humanas, testes de terceiros e outras medidas de segurança de IA.

A OpenAI apresentou o GPT-Red, um sistema de IA automatizado concebido para encontrar vulnerabilidades de segurança nos seus modelos de linguagem.

O GPT-Red recebe o seu nome do "red teaming" em cibersegurança, que é a prática de tentar deliberadamente quebrar um sistema para identificar pontos fracos antes que os atacantes possam explorá-los.

Numa publicação de quarta-feira, a OpenAI afirmou que a ferramenta ajudou a tornar o GPT-5.6 mais resistente a ataques de injeção de prompt antes da sua implementação.

“À medida que as capacidades dos modelos crescem, a segurança e o alinhamento devem acompanhar,” escreveu a OpenAI no X. “O red-teaming é essencial, mas as abordagens atuais são difíceis de escalar, criando um gargalo crítico. O GPT‑Red é uma forma de abordarmos isso.”

De acordo com a OpenAI, o GPT-Red foi treinado através de aprendizagem por reforço de auto-jogo, gerando ataques de injeção de prompt progressivamente mais fortes enquanto os modelos defensores aprendiam a resistir a eles. A empresa afirmou que esses ataques foram incorporados ao processo de treinamento do GPT-5.6, relatando que o GPT-Red obteve sucesso em 84% dos cenários de avaliação interna, em comparação com 13% para as equipas de "red team" humanas nos mesmos testes.

“O GPT‑Red aprende através de auto-jogo adversário, onde o seu objetivo é injetar prompts numa variedade de modelos defensores desafiadores,” escreveu a OpenAI. “Cada ataque bem-sucedido que o GPT-Red encontra é usado para melhorar esses defensores, impulsionando o GPT‑Red a encontrar continuamente falhas mais amplas e complexas.”

Num estudo de caso, a OpenAI afirmou que o sistema manipulou um agente autónomo de máquina de venda automática para baixar preços, encomendar inventário com desconto e cancelar o pedido de outro cliente antes que as vulnerabilidades fossem divulgadas e resolvidas.

O GPT-Red surge após anos de esforços de cibersegurança por parte da OpenAI, após o lançamento público do ChatGPT.

Em 2023, a empresa lançou a sua Rede de Red Teaming da OpenAI, recrutando investigadores de cibersegurança externos e especialistas de domínio para testar o ChatGPT e outros modelos em busca de falhas de segurança antes do lançamento. O GPT-Red expande esse esforço ao automatizar grande parte do processo, usando um modelo de IA para gerar ataques de injeção de prompt e outros testes adversários numa escala que seria difícil para apenas investigadores humanos.

O anúncio da OpenAI reflete uma mudança mais ampla em direção ao uso de IA para proteger a IA.

No início deste mês, a Fundação Ethereum disse ter implementado agentes de IA para realizar red-teaming em infraestruturas de rede críticas, descobrindo uma vulnerabilidade no software usado por clientes de consenso Ethereum. Os investigadores afirmaram que os agentes de IA podem pesquisar bases de código maiores do que os humanos, mas o desafio mudou de encontrar potenciais bugs para provar quais são exploráveis.

De acordo com a OpenAI, o GPT-Red permanecerá uma ferramenta interna porque contém capacidades ofensivas desenvolvidas intencionalmente.

“Acreditamos que com o GPT-Red começámos a desbloquear um ciclo semelhante para a segurança, onde os modelos de hoje podem ser usados para tornar os modelos de amanhã mais robustos, alinhados e confiáveis,” disseram.