InícioCentro de Notícias da LBank
O Novo Grok 4.5 Foi Lançado. Elon Musk Afirma Que Ele Compete Com o Claude Opus do Ano Passado
grok-4-5-elon-musk-claude-opus
O Novo Grok 4.5 Foi Lançado. Elon Musk Afirma Que Ele Compete Com o Claude Opus do Ano Passado
O novo modelo de codificação da SpaceXAI é mais barato e mais rápido que os modelos carro-chefe da Anthropic e da OpenAI — e, segundo o próprio Musk, está pelo menos uma geração atrás deles.
2026-07-08 Fonte:decrypt.co

Em resumo

  • A SpaceXAI lançou o Grok 4.5 em 8 de julho a US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de saída, menos da metade do preço de modelos comparáveis da Anthropic e da OpenAI.
  • Elon Musk publicou no X que o modelo é "aproximadamente comparável ao Opus 4.7", o antigo carro-chefe da Anthropic, agora substituído pelo Opus 4.8, enquanto exaltava a velocidade e o custo em detrimento do desempenho em benchmarks.
  • O Grok 4.5 ainda não está disponível na UE; a SpaceXAI afirma que o acesso europeu é esperado para meados de julho.

A SpaceXAI de Elon Musk lançou o Grok 4.5 na quarta-feira, seu primeiro modelo público desde que a fusão SpaceX-xAI foi concluída em fevereiro e o acordo pendente de US$ 60 bilhões da SpaceX para adquirir a Cursor. Ele visa programadores, engenheiros e o que a empresa chama de "trabalhadores do conhecimento" — uma categoria que aparentemente abrange desde desenvolvedores de software a advogados que revisam contratos e equipes financeiras que criam modelos no Excel.

A proposta da empresa não é que seja o melhor modelo. É que é barato, pelo menos para um modelo ocidental. O Grok 4.5 custa US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de saída. O Claude Opus 4.8, principal carro-chefe da Anthropic, custa US$ 5 de entrada e US$ 25 de saída. O GPT 5.6 Sol, o novo modelo de ponta da OpenAI que também foi lançado na quarta-feira, está precificado em US$ 5 de entrada e US$ 30 de saída.

Musk publicou no X e esclareceu onde seu novo modelo realmente se encaixa. Ele o chamou de "aproximadamente comparável ao Opus 4.7, mas muito mais rápido". O Opus 4.7 é o carro-chefe anterior da Anthropic; o Opus 4.8 o sucedeu desde então. O Claude Fable 5 é agora a oferta de ponta da Anthropic.

Ele enquadrou isso como uma troca deliberada: velocidade e custo em vez de capacidade bruta, com engenheiros da Tesla e da SpaceX como prova de utilidade no mundo real.

O que os benchmarks realmente mostram

A SpaceXAI publicou quatro resultados de benchmark no lançamento, e o panorama é misto. O DeepSWE 1.1 mede a confiabilidade com que uma IA pode resolver bugs de software reais enviados por desenvolvedores, usando uma configuração de teste padronizada para que os modelos possam ser comparados de forma justa, pontuados pela porcentagem de problemas corrigidos. O Grok 4.5 obteve 53%, atrás do Claude Opus 4.8 com 59% e do GPT 5.5 com 67%. O Claude Fable 5, modelo de ponta da Anthropic, liderou o gráfico com 70%.

No SWE Bench Pro, outro benchmark que mede uma coleção de problemas de engenharia de software pontuados pela taxa de resolução, o Grok 4.5 registrou 64,7%, o suficiente para superar os 58,6% do GPT 5.5 nesse teste específico. O Opus 4.8 ainda lidera com 69,2%, e o Fable 5 está em 80,4%.

Os benchmarks da empresa comparam-se com o GPT 5.5, e não com o GPT 5.6, porque este último também foi lançado na quarta-feira, horas após o anúncio do Grok 4.5.

A SpaceXAI treinou o Grok 4.5 em colaboração com a recém-adquirida Cursor AI em dezenas de milhares de GPUs Nvidia GB300 dentro do Colossus, o supercomputador de Memphis com capacidade total em mais de 200.000 GPUs. Os laboratórios cujos modelos estão acima dele nos mesmos benchmarks não possuem nada parecido com esse hardware. O modelo que surgiu é competitivo, apenas não é o primeiro.

Esse padrão tem seguido o Grok em vários lançamentos. A SpaceXAI tem aparecido consistentemente com uma computação enorme e pontuações em terceiro lugar. O que mudou com o Grok 4.5 foram os preços e o sinal de treinamento.

Onde a justificativa realmente se sustenta

O melhor argumento não é o desempenho bruto; é a matemática da eficiência. Em tarefas do SWE Bench Pro, o Grok 4.5 usou uma média de 15.954 tokens de saída para completar cada trabalho. O Opus 4.8 queimou 67.020 tokens para o mesmo trabalho, uma diferença de 4,2 vezes.

Para equipes que executam IA em volume, essa diferença se traduz em economias reais, além do preço por token já mais baixo. Mesmo com o Grok 4.5 pontuando tão baixo nos benchmarks de qualidade, tokens mais baratos e maior eficiência de uso permitem mais iterações sem gastar tanto.

O modelo também opera a 80 tokens por segundo, o que o coloca na categoria de modelos rápidos. O Grok 4.5 foi treinado com dados de sessão de desenvolvedores da Cursor, incluindo rastreamentos de depuração e edições de código reais, em vez de repositórios estáticos. Como Musk admitiu em tribunal, as práticas de treinamento da xAI já foram alvo de escrutínio; desta vez, o pipeline passa por uma plataforma que a SpaceX está em processo de compra total.

Para desenvolvedores que executam tarefas de codificação de alto volume, a matemática funciona: capacidade aproximadamente de Opus 4.7 com 60% menos por token de entrada. Para quem busca a fronteira, o Claude Fable 5 lidera todas as categorias que a SpaceXAI escolheu publicar. Nosso teste rápido usando o Grok construído no Hermes foi decepcionante para escrita criativa e aceitável para uma tarefa de codificação simples.

O modelo está disponível via API, no Hermes e no Grok construído com meio milhão de tokens de contexto (um pouco menos de 400.000 palavras). Usuários europeus terão que esperar antes de usá-lo; a SpaceXAI diz que o Grok 4.5 chegará à UE em meados de julho.