InícioCentro de Notícias da LBank
Z.AI da China Lança o GLM-5.2: Um Modelo Que Rivaliza Com o Claude Opus—Usando Zero Chips Nvidia
china-z-ai-glm-5-2-model-rivals-claude-opus
Z.AI da China Lança o GLM-5.2: Um Modelo Que Rivaliza Com o Claude Opus—Usando Zero Chips Nvidia
O GLM-5.2 da Z.ai fica a 1% do Claude Opus 4.8 em benchmarks de codificação de longo prazo, roda inteiramente em silício Huawei e é até 82% mais barato por token do que os modelos fronteira ocidentais.
2026-06-18 Fonte:decrypt.co

Em resumo

  • O GLM-5.2 fica apenas 1% atrás do Claude Opus 4.8 no FrontierSWE—um benchmark que mede projetos de engenharia autônoma de várias horas—enquanto supera o GPT-5.5 no mesmo teste. Ele é distribuído sob uma licença MIT sem restrições regionais.
  • O modelo foi construído inteiramente com chips Huawei Ascend, sem nenhum hardware NVIDIA envolvido.
  • A Unsloth AI já lançou quantizações GGUF de 2 bits que reduzem o modelo de 1,51TB para 238GB. Você ainda precisará de 256GB de RAM ou VRAM—mas, nesse ponto, você poderá executá-lo.

A Z.ai lançou o GLM-5.2 em 16 de junho, prometendo desempenhos de alto nível, superando seu já avançado GLM 5.1.

O laboratório com sede em Pequim, que está na Lista de Entidades dos EUA desde janeiro de 2025, parece estar se beneficiando das crescentes preocupações com a abordagem dos Estados Unidos à IA. Na última semana, a proibição do Anthropic Fable e o lançamento deste novo modelo ajudaram a impulsionar as ações da zAI em 90%, levando-as a um novo recorde histórico.

O GLM 5.2 tem os números para justificar o alarido.

No FrontierSWE—um benchmark que avalia se um agente de IA consegue concluir projetos técnicos abertos medidos em horas, cobrindo otimização de sistemas, construção de código em larga escala e pesquisa de ML aplicada, pontuado pela taxa de dominância—o GLM-5.2 atingiu 74.4 contra 75.1 do Claude Opus 4.8. Ele superou o GPT-5.5 com 72.6. No SWE-bench Pro, que testa a resolução autônoma de problemas reais do GitHub pontuados como taxa de aprovação, o GLM-5.2 marcou 62.1 contra 58.6 do GPT-5.5—e superou seu predecessor GLM-5.1 de 58.4 por uma ampla margem.

O salto de qualidade o torna o melhor modelo de código aberto até o momento no Índice de Inteligência de Análise Artificial, que agrega os resultados de 9 pontuações diferentes para avaliar a qualidade geral de um modelo de IA. Os benchmarks da OpenRouter o colocam na mesma categoria do agora banido Claude Fable 5.

O hardware utilizado para alcançar este feito é outra parte interessante da história. O GLM-5.2 foi treinado em chips Huawei Ascend—sem Nvidia em nenhuma parte do processo. Emad Mostaque, fundador da Stability AI, estimou os custos totais de treinamento em cerca de US$ 25 milhões, 80% disso em pós-treinamento, o que o tornaria extremamente barato em comparação com seus concorrentes.

Como Decrypt relatou no início deste ano, a Z.ai já estava treinando modelos de imagem nos servidores Ascend Atlas da Huawei sem um único chip americano. O GLM-5.2 leva essa infraestrutura adiante—um modelo de mistura de especialistas com 744 bilhões de parâmetros com uma janela de contexto genuína de 1 milhão de tokens, cinco vezes o limite de 200 mil do GLM-5.1, e uma licença MIT que significa que nenhuma diretriz governamental pode desativar o acesso.

Tokens são os fragmentos de texto que um modelo pode ler e gerar, enquanto Parâmetros são o número de configurações e valores internos que determinam como um modelo processa informações e gera respostas.

Para quem é e quanto custa

Para desenvolvedores, a janela de contexto é a mudança operacional. Navegação de repositório completo, refatoração de múltiplos arquivos e longos pipelines agentivos que antes exigiam segmentação tornam-se fluxos de trabalho de chamada única. Os preços da API são de US$ 1,40 por milhão de tokens de entrada e US$ 4,40 por milhão de saída—contra US$ 5 de entrada e US$ 25 de saída do Claude Opus 4.8. O Plano de Codificação começa em cerca de US$ 18 por mês e funciona diretamente dentro do Claude Code, Cline, Kilo Code e a maioria dos ambientes agentivos populares.

A implantação local também é tecnicamente possível. A Unsloth AI lançou quantizações GGUF de 2 bits que comprimem o modelo de 1,51TB para 238GB, mantendo aproximadamente 82% de precisão.

Não se empolgue muito, porém. Isso ainda significa que ele exige 256GB de memória unificada ou uma combinação correspondente de RAM/VRAM—um Mac Studio M4 Ultra com capacidade máxima ou uma workstation com uma GPU de médio porte e 256GB de RAM do sistema com descarregamento de mistura de especialistas. Ainda é muito dinheiro, mas pelo menos algo que você pode comprar e executar em sua casa se realmente quiser.

Fizemos um teste rápido, pedindo ao GLM-5.2 para construir nosso jogo padrão que mistura mecânicas de digitação com um jogo de tiro. A interface não era a mais bonita—outros modelos geraram interfaces com uma aparência mais polida, mas a experiência foi a mais variada: diferentes cenários em ondas, tipos de inimigos que mudavam, chefes aparecendo mais tarde na jogada.

Ele gerou estados de jogo mais diversos do que qualquer outra coisa que testamos para a mesma tarefa em uma configuração de zero-shot.

Se você quiser jogar, ele está disponível em nosso perfil do Itch.io.

Essa variação aponta para onde o GLM-5.2 faz mais sentido econômico. Para fluxos de trabalho de geração multi-shot e pipelines agentivos onde a diversidade de saída importa mais do que o polimento, a matemática nos níveis de preço de código aberto é difícil de argumentar. Para as tarefas sustentadas mais difíceis—SWE-Marathon, onde ele pontua 13.0 contra 26.0 do Opus 4.8—a lacuna para a fronteira fechada ainda é real, e de 13 pontos.

Os pesos de código aberto estão disponíveis no HuggingFace sob a licença MIT. Os pesos quantizados também estão disponíveis no HuggingFace. Os assinantes do GLM Coding Plan podem mudar agora com a string do modelo GLM-5.2, e ele também está disponível para testes gratuitos na z.AI com algumas restrições de uso.