
A Anthropic lançou o Claude Opus 5.5 na terça-feira, o primeiro modelo do que a empresa está chamando de sua família Claude 5.5. A Anthropic diz que o novo modelo entrega desempenho no nível do Claude Fable 5.1, seu carro-chefe mais caro, na maioria das tarefas.
O diferencial é que o modelo custa 20% menos para operar do que o Opus 5, o modelo que ele substitui, e é 60% mais barato do que o Fable 5.1, a oferta mais avançada da empresa.
Ao que tudo indica, o modelo é muito capaz. É o modelo mais avançado tanto em versão (5.5 contra 5.1 do Fable) quanto em família (Opus é o maior modelo disponível publicamente, seguido por Sonnet, com Haiku sendo o menor).
A Anthropic admite que a diferença entre Fable e Opus é menor do que as pontuações de benchmark sugerem, mas o fato de estar disponível publicamente em plano e ser mais barato por token faz dele a escolha óbvia para a maioria dos usuários do Claude.
O Opus 5 foi lançado em julho com preço mais baixo e desempenho superior ao Fable 5 na maioria dos benchmarks, e o Fable 5.1 chegou no início de setembro e reverteu esse cenário, superando o Opus 5 em todos os benchmarks publicados pela Anthropic.
O Opus 5.5 reduz essa diferença novamente, desta vez no preço, e não nas pontuações brutas. A Lovable, uma plataforma para desenvolvedores que submeteu o Opus 5 aos seus próprios testes de programação em julho, disse em um comunicado compartilhado pela Anthropic que o modelo anterior era “mais estável, com muito menos variação de execução para execução” do que o que veio antes — o mesmo argumento de eficiência que a Anthropic volta a usar agora.
O Opus 5.5 também é o primeiro modelo lançado pela Anthropic desde que o CEO Dario Amodei publicou um ensaio pedindo que a indústria desacelerasse, argumentando que os ganhos de capacidade da IA estão superando os testes de segurança destinados a mantê-los sob controle. “Precisamos desacelerar o ritmo com que melhoramos as capacidades dos modelos de IA”, escreveu Amodei no início deste mês.
A Anthropic mede grande parte desse progresso por meio da programação agêntica — trabalho realizado por um agente de IA, um modelo que executa ações em múltiplas etapas por conta própria, em vez de apenas responder a um único prompt.
No Terminal-Bench 4.0, que testa se um agente consegue concluir tarefas profissionais complexas dentro de uma interface de linha de comando e pontua o resultado como percentual de tarefas concluídas, o Opus 5.5 alcançou 66,4%, à frente dos 55,8% do Fable 5.1 e dos 57,9% do GPT-6 Astra. Já o FrontierCode, que verifica se as mudanças de código feitas por um agente realmente seriam incorporadas em um pipeline de engenharia real usando a mesma métrica de taxa de aprovação, atribuiu ao Opus 5.5 uma pontuação de 54,4%, contra 50,3% do Fable 5.1.
No GDPval-AA v2.1, que avalia trabalho profissional do mundo real em 44 ocupações usando Elo — o mesmo sistema de ranking no estilo do xadrez usado para medir habilidade relativa, e não uma porcentagem fixa — o Opus 5.5 marcou 1846, contra 1735 do Fable 5.1 e 1708 do Opus 5.
Ainda assim, o Opus 5.5 não lidera em tudo. No AutomationBench, um benchmark desenvolvido pela Zapier que mede se um agente consegue executar um fluxo de trabalho empresarial completo do início ao fim sem ajuda humana, os 41,4% do GPT-6 Astra superam por pouco os 40,0% do Opus 5.5.
No Terminal-Bench-Science 0.1, que testa pesquisa científica agêntica realizada em um ambiente de linha de comando usando o mesmo método de taxa de aprovação, os 64,6% do Astra superam os 58,7% do Opus 5.5 por uma margem mais ampla.
O maior argumento de venda, porém, é o custo. Os tokens de entrada — os blocos de texto que um modelo lê e escreve, cobrados por milhão — agora custam US$ 4 para o Opus 5.5, versus US$ 5 para o Opus 5, e os tokens de saída caem de US$ 25 para US$ 20. As leituras de cache, que significam reutilizar contexto que o modelo já processou em vez de processá-lo novamente do zero e que respondem por grande parte do custo em longas sessões de programação agêntica, caem 60%, para US$ 0,20 por milhão de tokens.
Como o Opus 5.5 iguala os modelos de classe Mythos da Anthropic — a camada mais restrita da empresa, reservada para pesquisadores verificados de cibersegurança e biologia — nessas duas capacidades, ele é lançado com as mesmas salvaguardas do Fable 5.1.
A maioria das tarefas de cibersegurança é automaticamente redirecionada para o Opus 4.8 mais antigo, algo de que muitos devs e usuários já reclamaram anteriormente.
O Opus 5.5 já está disponível em todas as plataformas da Anthropic, incluindo Amazon Web Services, Google Cloud e Microsoft Azure. O Sonnet 5.5 e o Haiku 5.5 chegarão nas próximas semanas, segundo a Anthropic, levando os mesmos cortes de preço para o restante da linha.








