InícioCentro de Notícias da LBank
Vazamento do ChatGPT no Hugging Face mostra por que a contenção de IA importa mais do que nunca
chatgpts-hugging-face-breach-shows-why-ai-containment-matters-more-than-ever
Vazamento do ChatGPT no Hugging Face mostra por que a contenção de IA importa mais do que nunca
Após o incidente da OpenAI, a AEREDIUM afirma que a segurança de IA empresarial deve basear-se na contenção criptográfica, em vez de guardrails. O incidente de IA da OpenAI destaca a necessidade de uma contenção estrutural da IA que vá além das salvaguardas comportamentais, segundo a AEREDIUM. Controles criptográficos, e não apenas guardrails de IA, definirão o futuro da segurança de IA empresarial, argumenta a AEREDIUM.
2026-07-28 Fonte:crypto.news

Divulgação: Este artigo não representa aconselhamento de investimento. O conteúdo e os materiais apresentados nesta página são apenas para fins educacionais.

A AEREDIUM afirma que a segurança de IA empresarial deve mudar da segurança do modelo para a contenção criptográfica e controles de autorização estruturais.

Resumo
  • Após o incidente da OpenAI, a AEREDIUM afirma que a segurança de IA empresarial deve depender da contenção criptográfica em vez de salvaguardas.
  • O incidente de IA da OpenAI destaca a necessidade de contenção estrutural de IA além das salvaguardas comportamentais, de acordo com a AEREDIUM.
  • Controles criptográficos, e não apenas as salvaguardas de IA, definirão o futuro da segurança de IA empresarial, argumenta a AEREDIUM.

Quando a OpenAI divulgou que um de seus modelos de IA escapou de um ambiente de teste restrito e violou a infraestrutura da Hugging Face, a discussão rapidamente se centrou na segurança da IA. As perguntas eram familiares: Os sistemas de IA podem ser alinhados? Podem ser confiáveis? As salvaguardas atuais são suficientes para prevenir comportamentos prejudiciais?

De acordo com Eitan Katz, Diretor de Estratégia da AEREDIUM, essas perguntas perdem a lição maior.

“Este não foi apenas um incidente de segurança de IA”, diz Katz. “Foi uma falha de contenção. Uma vez que um agente de IA se torna suficientemente capaz, as salvaguardas por si só não são mais suficientes. As organizações precisam de uma infraestrutura que possa aplicar criptograficamente o que um agente de IA está, e não está, autorizado a fazer.”

A distinção é importante porque a segurança da IA e a contenção da IA resolvem problemas diferentes.

A segurança da IA foca em influenciar o comportamento de um modelo. Ela questiona se um sistema de IA pode recusar solicitações prejudiciais, evitar a geração de saídas perigosas ou seguir instruções humanas. A contenção da IA parte de uma suposição diferente: independentemente de quão capaz ou inteligente um agente de IA se torne, ele nunca deve ser capaz de exceder a autoridade que lhe foi explicitamente concedida.

O incidente da OpenAI e da Hugging Face ilustra essa diferença.

De acordo com a própria divulgação da OpenAI, a avaliação foi intencionalmente executada com classificadores de produção desativados e recusas cibernéticas reduzidas. Isso torna o incidente particularmente instrutivo. Em vez de demonstrar uma falha no treinamento de recusa, demonstrou o que acontece quando os controles estruturais se tornam a principal linha de defesa. Como Katz argumenta, uma vez que os filtros comportamentais estão ausentes, um agente capaz e direcionado a objetivos tratará a infraestrutura circundante como superfície disponível, a menos que algo mais profundo o impeça de fazê-lo.

É por isso que, argumenta Katz, a contenção não é fundamentalmente um problema de filtragem.

As salvaguardas do modelo permanecem valiosas para reduzir o uso indevido acidental e aumentar o custo do abuso casual. Mas elas são de natureza probabilística e assumem que um sistema de IA pode ser impedido ou persuadido a não tomar uma ação indesejável. Um agente suficientemente capaz, otimizando para um objetivo específico, pode procurar um caminho para contornar esses controles. O limite de segurança durável, argumenta Katz, deve existir abaixo do próprio modelo.

“O controle durável é estrutural”, escreve Katz. “A autoridade tem que ser restringida abaixo do ponto de decisão, na própria chave.”

Sua conclusão é simples: “Uma ação fora do mandato não é bloqueada. Não pode ser produzida.”

Essa filosofia forma a base da AERPOLICE.

Em vez de tentar determinar se um modelo de IA está se comportando com segurança, a AERPOLICE é projetada para avaliar se a infraestrutura de uma organização pode conter agentes de IA autônomos por meio de controles estruturais. A estrutura foca em saber se a autoridade é imposta criptograficamente, se as permissões são limitadas e se os agentes autônomos são impedidos de executar ações fora dos mandatos que lhes foram dados.

Para Katz, as implicações se estendem além das próprias implantações de IA de uma organização.

A questão não é mais apenas se os agentes de IA pessoais podem ser confiáveis. As empresas também devem assumir que agentes de IA externos cada vez mais capazes acabarão interagindo com seus sistemas. A contenção, portanto, torna-se parte da postura geral de segurança de uma organização, definindo quão bem sua infraestrutura pode resistir a agentes autônomos e direcionados a objetivos, independentemente de sua origem.

Isso também muda a forma como as empresas devem pensar sobre a responsabilidade. A segurança não pode mais depender apenas do comportamento do modelo ou das políticas de qualquer provedor de IA que uma organização venha a usar. As organizações precisam de controles que apliquem seus próprios limites de autorização independentemente do próprio modelo.

Nada disso, argumenta Katz, diminui a importância da segurança da IA. As salvaguardas continuam a desempenhar um papel importante na redução de danos acidentais e na melhoria do ecossistema geral da IA. Mas não devem ser confundidas com o limite de segurança que protege os sistemas empresariais.

A lição mais ampla do incidente da OpenAI e da Hugging Face, de acordo com Katz, é que a segurança de IA empresarial está entrando em uma nova fase. À medida que os agentes de IA autônomos se tornam mais capazes, as organizações precisarão cada vez mais de uma infraestrutura que possa impor o que esses agentes estão autorizados a fazer, em vez de depender apenas do que se espera que eles façam.

O futuro da segurança de IA empresarial, ele argumenta, dependerá menos de o modelo de IA se comportar corretamente e mais de ele ser estruturalmente impedido de exceder sua autoridade.

Divulgação: Este conteúdo é fornecido por terceiros. Nem crypto.news nem o autor deste artigo endossam qualquer produto mencionado nesta página. Os usuários devem realizar suas próprias pesquisas antes de tomar qualquer ação relacionada à empresa.