Novo modelo da Anthropic lidera ranking independente contra GPT-6 Astra e Claude Fable 5.1, enquanto os números divulgados pelas próprias empresas não batem entre si
Em três semanas de setembro, Anthropic e OpenAI lançaram meia dúzia de modelos e reescreveram a tabela de preços da IA corporativa
, Redator
16 min
•
24 set 2026
•
Atualizado: 24 set 2026
newsletter
Start Seu dia:
A Newsletter do AGORA!
O modelo de inteligência artificial mais bem colocado no principal ranking independente do setor custa menos da metade do que cobram seus rivais diretos. O Claude Opus 5.5, lançado pela Anthropic em 22 de setembro, assumiu a liderança do Intelligence Index da Artificial Analysis com 58 pontos, cinco à frente do GPT-6 Astra, da OpenAI, e do Claude Fable 5.1, o modelo mais potente da própria Anthropic aberto ao público. O preço é de US$ 4 por milhão de tokens de entrada e US$ 20 por milhão de saída, 2,5 vezes menos que os US$ 10 e US$ 50 cobrados pelos dois concorrentes. (Para saber mais)
Por que isso importa: a conta da IA de fronteira ficou mais barata e mais difícil de ler na mesma semana. Para quem aprova orçamento, a pergunta deixa de ser se a empresa consegue pagar pelo melhor modelo. Passa a ser se ela sabe medir o que está comprando e se tem processos prontos para colocar essa capacidade para trabalhar.
Entre as linhas: o mesmo ciclo de lançamentos que derrubou preços expôs um problema antigo dos rankings. Anthropic e OpenAI publicam números diferentes para os mesmos modelos, nos mesmos testes. Quem decide olhando só a tabela da página de lançamento está decidindo com números escolhidos por quem vende.
O Opus 5.5 cobra 20% menos por token que o Opus 5, lançado em julho a US$ 5 e US$ 25. A leitura de cache, item que pesa em agentes que consultam os mesmos documentos dezenas de vezes, caiu 60%, de US$ 0,50 para US$ 0,20 por milhão de tokens. A Anthropic afirma que a soma de preço menor com menos tokens gastos por tarefa deixa o modelo 40% mais barato que o antecessor em cargas típicas, com geração de texto mais de 30% mais rápida. (Anthropic)
| Modelo | Lançamento | Preço por milhão de tokens (entrada / saída) | Intelligence Index (Artificial Analysis) |
|---|---|---|---|
| Claude Opus 5.5 | 22/9/2026 | US$ 4 / US$ 20 | 58 |
| GPT-6 Astra | 3/9/2026 | US$ 10 / US$ 50 | 53 |
| Claude Fable 5.1 | 1/9/2026 | US$ 10 / US$ 50 | 53 |
Zoom out: o corte da Anthropic faz parte de um movimento maior. No mesmo 22 de setembro, cerca de 90 minutos depois do anúncio do Opus 5.5, a OpenAI lançou o GPT-6 Sol, a US$ 2 e US$ 10, e o GPT-6 Luna, a US$ 0,10 e US$ 0,50. (TechCrunch) Um porta-voz disse à VentureBeat que os novos valores são permanentes, e não uma promoção. (VentureBeat)
Os dados de gasto corporativo confirmam a direção. O preço efetivo médio pago pelas empresas da base da Ramp, fintech americana de gestão de despesas, chegou a US$ 0,68 por milhão de tokens em setembro, queda de 41% desde o pico de março. No mesmo levantamento, a fatia de tokens consumida por modelos de fronteira recuou de 53% para 45%, porque as empresas passaram a impor modelos padrão mais baratos para toda a companhia. (Ramp AI Index)
Três forças explicam a queda. A primeira é concorrência em ritmo de semanas: Fable 5.1 em 1º de setembro, GPT-6 Astra no dia 3, Opus 5.5 no dia 22. A segunda é eficiência de engenharia, já que a Anthropic diz que o novo modelo exige menos computação para ser servido. A terceira é financeira. A Bloomberg enquadrou o lançamento como parte da preparação da Anthropic para a abertura de capital, momento em que crescimento de receita e margem passam a ser medidos com lupa. (Bloomberg)
Sim, mas: o Opus 5.5 é o primeiro da linha Opus a sair com as salvaguardas do tier Fable. Pedidos de cibersegurança são redirecionados ao Opus 4.8 e os de biologia ao Opus 5, e o modo de raciocínio não pode mais ser desligado. Empresas de segurança digital e de ciências da vida precisam passar pelos programas de verificação da Anthropic para ter uso pleno.
Depende de quem mede. E essa é a informação mais subestimada do mês.
No Terminal-Bench 4.0, teste de tarefas de programação em terminal, a Anthropic reporta 66,4% para o Opus 5.5 no esforço xhigh. A Artificial Analysis rodou o mesmo teste por conta própria e encontrou 59,6%, resultado que coloca o modelo no nível do GPT-6 Astra, e não sete pontos à frente. A própria tabela da Anthropic compara seu modelo com números do Astra informados pela OpenAI, obtidos em outra configuração. (Artificial Analysis)
O caso mais revelador envolve um modelo que nem é o protagonista. No FrontierCode, o Opus 5 aparece com 48,0% na tabela da Anthropic e com 53,4% na tabela da OpenAI. Mesmo modelo, mesmo teste, 5,4 pontos de diferença entre as duas fontes. (Anthropic e OpenAI)
Do lado da OpenAI, os números também se moveram depois de publicados. A Fortune documentou que a empresa alterou métricas do Astra dias após o lançamento: a taxa de alucinação informada passou de 4,2% para 2% e voltou a 4,2%. (Fortune) O resultado mais citado do Astra, 99,9% no ARC-AGI-3, depende do adaptador da própria OpenAI. Com o método padrão do ARC Prize, organização que mantém o teste, a nota cai para 62,7%. (The Next Web)
A Anthropic admite o problema na página de lançamento. A empresa escreve que, nesses níveis de capacidade, as margens de benchmark se tornaram um guia menos confiável das diferenças no mundo real, e que no uso interno a distância entre o Opus 5.5 e o Fable 5.1 é menor do que os números sugerem.
Os números que resistem ao filtro: mesmo na tabela da Anthropic, o Astra vence em automação de fluxos (41,4% contra 40,0% no AutomationBench) e em tarefas científicas (64,6% contra 58,7% no Terminal-Bench-Science). O Opus 5.5 leva vantagem clara em trabalho do conhecimento, com 1.846 pontos no GDPval-AA, índice que a Artificial Analysis confirmou de forma independente, contra 1.542 do Astra.
Para ler qualquer ranking daqui em diante, três perguntas bastam. Quem mediu? Em que configuração de esforço? E a que custo por tarefa? A terceira é a que quase ninguém faz.
O modelo mais barato por token pode sair mais caro por tarefa. O Opus 5.5 é um bom exemplo disso.
No esforço máximo, o Opus 5.5 gasta cerca de 119 mil tokens de saída para cada tarefa do índice da Artificial Analysis. O Opus 5 gastava perto de 73 mil, o Fable 5.1 usa 78 mil e o GPT-6 Astra, cerca de 27 mil. O resultado é que, apesar do token 20% mais barato, o custo por tarefa do Opus 5.5 no esforço máximo ficou no mesmo patamar do Opus 5. O desconto foi consumido pelo apetite do modelo quando ele pensa mais. (Artificial Analysis)
A alavanca de verdade é o nível de esforço, uma configuração que a maioria das empresas deixa no padrão. Na medição da Artificial Analysis, o Opus 5.5 vai de 42 pontos a US$ 0,55 por tarefa, no esforço baixo, a 58 pontos a US$ 5,98, no máximo. São 11 vezes mais custo para 16 pontos de índice. Em muitos processos, o nível intermediário resolve.
A Deloitte relatou um caso nessa linha, publicado pela Anthropic: no menor nível de esforço, o Opus 5.5 identificou 72% dos bugs conhecidos nas revisões de código da consultoria, contra 56% do Opus 5 em esforço alto.
A consequência para o orçamento é direta. O modelo deixou de ser o item mais caro e mais difícil de um projeto de IA. Escolher a configuração certa, desenhar o processo em que o agente vai operar e medir o resultado por tarefa passaram a pesar mais que a escolha do fornecedor.
1. Trocar o padrão antes de trocar de fornecedor. Quem já usa o Opus 5 pode migrar para o Opus 5.5 nas mesmas nuvens (AWS, Google Cloud e Microsoft Azure) e pagar menos pelo mesmo trabalho. O Fable 5.1 fica reservado para os casos em que o time já comprovou vantagem com testes próprios.
2. Medir por tarefa, em mais de um nível de esforço. Rodar o mesmo processo real em esforço baixo, médio e alto e comparar qualidade e custo lado a lado. A diferença de 11 vezes entre os extremos, medida pela Artificial Analysis, mostra quanto dinheiro fica na mesa quando ninguém mexe nessa configuração.
3. Montar a própria régua. Separar tarefas reais da operação, como análise de contrato, proposta comercial, conciliação financeira e resposta a cliente, e testar os modelos candidatos nelas. Rankings públicos servem para montar a lista curta. A decisão sai do teste interno.
4. Rotear por complexidade e manter um plano B. Volume alto vai para modelos baratos, como o GPT-6 Luna a US$ 0,10 por milhão de tokens de entrada, e a fronteira fica para a exceção. Ter um segundo fornecedor configurado também é gestão de risco. Entre 12 de junho e 1º de julho, uma diretiva de controle de exportação dos EUA tirou o Fable 5 do ar para clientes de todo o mundo. (Anthropic)
5. Levar a economia para a implementação. Se o custo do modelo cai, o gargalo passa a ser processo, time e método. Para empresas menores, que decidem mais rápido, é a janela para testar agentes que meses atrás não fechavam a conta. É a lógica do AI Action, programa de implementação guiada da StartSe: a empresa passa por um assessment, recebe um plano de ataque com três soluções prioritárias e implementa com o próprio time em 100 dias, a partir de uma curadoria de mais de 100 soluções distribuídas em sete áreas do negócio, do comercial ao financeiro.
O que vem por aí:
Setembro transformou a inteligência de fronteira em insumo com preço em queda e placar em disputa. O que segue escasso é a capacidade de transformar esse insumo em processo funcionando dentro da empresa. Para quem quer sair da comparação de rankings e entrar em 2027 com agentes rodando na operação, o caminho que a StartSe desenhou para isso é o AI Action.
Gostou deste conteúdo? Deixa que a gente te avisa quando surgirem assuntos relacionados!
Leia o próximo artigo
newsletter
Start Seu dia:
A Newsletter do AGORA!