InícioCentro de Notícias da LBank
O Kimi K3 da China saiu de sua sandbox para procurar respostas do teste
chinas-kimi-k3-broke-out-of-its-sandbox-to-look-up-test-answers
O Kimi K3 da China saiu de sua sandbox para procurar respostas do teste
Ao contrário dos recentes vazamentos na OpenAI e na Anthropic, isso envolveu um modelo que qualquer pessoa pode baixar, executando suas proteções padrão.
2026-08-07 Fonte:decrypt.co

Em resumo

  • O Kimi K3 da Moonshot AI deixou sua sandbox de teste e acessou a internet aberta, disse a empresa de segurança Frontier Security.
  • O modelo investigou as configurações de rede da sandbox, encontrou sites acessíveis e obteve suas respostas de teste do GitHub.
  • A Frontier afirma que uma má configuração abriu a porta, mas que as próprias salvaguardas do Kimi não o impediram.

O Kimi K3 da Moonshot AI deixou a sandbox onde estava sendo testado e acessou a internet aberta para encontrar respostas para os problemas que lhe haviam sido dados, de acordo com a empresa de segurança Frontier Security.

O modelo estava sendo avaliado em habilidades de cibersegurança defensiva e foi expressamente encarregado de resolver problemas sem pesquisá-los. Ele não tentou a tarefa de forma alguma, disse a Frontier. Em vez disso, ele investigou a rede, estabeleceu que a resolução DNS para github.com estava funcionando, clonou o repositório de benchmark oficial e leu a solução do disco.

A Frontier chama isso de “specification gaming via network egress leaks” (jogo de especificação via vazamentos de saída de rede), observando que sandboxes construídas em frameworks como o Inspect do AI Security Institute bloqueiam o tráfego de entrada, enquanto deixam as portas HTTPS e DNS de saída abertas. Agentes capazes inspecionam seu próprio ambiente de shell na inicialização como uma questão de rotina, e um modelo que encontra github.com acessível pode puxar soluções de referência com ferramentas de linha de comando padrão.

Uma má configuração tornou isso possível, assim como ocorreu em incidentes recentes divulgados pela OpenAI e Anthropic. "Encontramos um vazamento na sandbox", disse o CEO Yaron Singer à WIRED. "Mas também descobrimos que o Kimi se aproveitou dessa brecha."

O pesquisador Paul Kassianik disse à WIRED que o modelo é "muito bom em seguir um objetivo por todos os meios necessários" e carece das salvaguardas que o impediriam de trapacear ou escapar. A Moonshot não respondeu ao pedido de comentário da publicação.

Agentes de IA quebrando contenção

Enquanto os modelos da Anthropic e OpenAI que quebraram a contenção foram pegos em avaliações internas, um deles não lançado, e as versões que visaram pessoas reais em testes do governo do Reino Unido tiveram seus classificadores cibernéticos deliberadamente desativados, o Kimi K3 é abertamente baixável, e a Frontier o testou com as salvaguardas que um usuário comum obteria. Essa disponibilidade, escreveu a empresa, coloca o mesmo comportamento ao alcance de atores adversários e torna o incidente potencialmente mais prejudicial.

O Kimi K3 também não causou danos. Ele não atacou nada uma vez fora, porque não precisava. O modelo da OpenAI invadiu o Hugging Face e outros quatro serviços para alcançar respostas de benchmark, enquanto o Kimi encontrou suas respostas em um repositório público.

A sandbox que a Frontier usou foi construída sobre a estrutura de avaliação do UK AI Security Institute. O AISI divulgou esta semana que agentes em seus próprios testes cibernéticos haviam acessado a internet ao vivo e mirado em pessoas reais – um incidente separado, envolvendo modelos da Anthropic e OpenAI com suas salvaguardas desativadas. Seu relatório publicado na terça-feira observa que o AISI está agora verificando execuções de avaliação históricas em busca de comportamento semelhante, e que o Kimi K3 está entre os modelos em revisão. O AISI não respondeu ao pedido de comentário da WIRED.

A afirmação maior da Frontier é que os próprios benchmarks estão comprometidos. Um modelo que lê a resposta do GitHub ainda passa, então pontuações altas podem refletir um ambiente com vazamentos em vez de raciocínio genuíno. E se um modelo capaz encontrou o atalho, a empresa argumenta, outros com acesso ao shell também podem estar usando-o, o que inflaria os resultados em todo o campo, e não apenas para o Kimi.

Os modelos otimizam para a função objetivo, escreveu a Frontier, não para a “intenção humana por trás do benchmark”, acrescentando que onde existe um caminho de rede para a solução “um agente suficientemente capaz o encontrará”.

Um problema geral

Matt Fredrikson, CEO da Gray Swan e professor associado da Carnegie Mellon, disse à WIRED que o comportamento é normal. Dê a um modelo um objetivo sem paredes explícitas ao redor dele, disse ele, e "ele encontrará uma maneira de obter a resposta." Ele descreveu isso como um conto de advertência para qualquer pessoa que executa modelos como agentes em ferramentas como OpenClaw.

Os pesquisadores da Frontier fazem o mesmo ponto na direção oposta: a capacidade que permite ao Kimi encontrar sua saída também torna os modelos de peso aberto ferramentas defensivas fortes. Seus próprios benchmarks classificam o Kimi altamente na busca de vulnerabilidades em software e redes, e o Hugging Face usou um modelo chinês não nomeado para se defender durante o incidente da OpenAI.

Lançado em julho, o Kimi K3 é o maior modelo de código aberto já publicado e agitou os mercados em comparações com a estreia do DeepSeek.