Sou Aluno
Formações
Imersões Internacionais
Global MBAs
Eventos
AI Tools
Artigos
Sobre Nós
Para Empresas
Consultoria
Inovação

Claude Opus 5.5 derruba preço da IA de ponta

Novo modelo da Anthropic lidera ranking independente contra GPT-6 Astra e Claude Fable 5.1, enquanto os números divulgados pelas próprias empresas não batem entre si

Claude Opus 5.5 derruba preço da IA de ponta

Em três semanas de setembro, Anthropic e OpenAI lançaram meia dúzia de modelos e reescreveram a tabela de preços da IA corporativa

Redação StartSe

, Redator

16 min

•

24 set 2026

•

Atualizado: 24 set 2026

newsletter

Start Seu dia:
A Newsletter do AGORA!

O modelo de inteligência artificial mais bem colocado no principal ranking independente do setor custa menos da metade do que cobram seus rivais diretos. O Claude Opus 5.5, lançado pela Anthropic em 22 de setembro, assumiu a liderança do Intelligence Index da Artificial Analysis com 58 pontos, cinco à frente do GPT-6 Astra, da OpenAI, e do Claude Fable 5.1, o modelo mais potente da própria Anthropic aberto ao público. O preço é de US$ 4 por milhão de tokens de entrada e US$ 20 por milhão de saída, 2,5 vezes menos que os US$ 10 e US$ 50 cobrados pelos dois concorrentes. (Para saber mais)

Por que isso importa: a conta da IA de fronteira ficou mais barata e mais difícil de ler na mesma semana. Para quem aprova orçamento, a pergunta deixa de ser se a empresa consegue pagar pelo melhor modelo. Passa a ser se ela sabe medir o que está comprando e se tem processos prontos para colocar essa capacidade para trabalhar.

Entre as linhas: o mesmo ciclo de lançamentos que derrubou preços expôs um problema antigo dos rankings. Anthropic e OpenAI publicam números diferentes para os mesmos modelos, nos mesmos testes. Quem decide olhando só a tabela da página de lançamento está decidindo com números escolhidos por quem vende.

Quanto custa o Claude Opus 5.5 e por que o preço caiu?

O Opus 5.5 cobra 20% menos por token que o Opus 5, lançado em julho a US$ 5 e US$ 25. A leitura de cache, item que pesa em agentes que consultam os mesmos documentos dezenas de vezes, caiu 60%, de US$ 0,50 para US$ 0,20 por milhão de tokens. A Anthropic afirma que a soma de preço menor com menos tokens gastos por tarefa deixa o modelo 40% mais barato que o antecessor em cargas típicas, com geração de texto mais de 30% mais rápida. (Anthropic)

ModeloLançamentoPreço por milhão de tokens (entrada / saída)Intelligence Index (Artificial Analysis)
Claude Opus 5.522/9/2026US$ 4 / US$ 2058
GPT-6 Astra3/9/2026US$ 10 / US$ 5053
Claude Fable 5.11/9/2026US$ 10 / US$ 5053

Zoom out: o corte da Anthropic faz parte de um movimento maior. No mesmo 22 de setembro, cerca de 90 minutos depois do anúncio do Opus 5.5, a OpenAI lançou o GPT-6 Sol, a US$ 2 e US$ 10, e o GPT-6 Luna, a US$ 0,10 e US$ 0,50. (TechCrunch) Um porta-voz disse à VentureBeat que os novos valores são permanentes, e não uma promoção. (VentureBeat)

Os dados de gasto corporativo confirmam a direção. O preço efetivo médio pago pelas empresas da base da Ramp, fintech americana de gestão de despesas, chegou a US$ 0,68 por milhão de tokens em setembro, queda de 41% desde o pico de março. No mesmo levantamento, a fatia de tokens consumida por modelos de fronteira recuou de 53% para 45%, porque as empresas passaram a impor modelos padrão mais baratos para toda a companhia. (Ramp AI Index)

Três forças explicam a queda. A primeira é concorrência em ritmo de semanas: Fable 5.1 em 1º de setembro, GPT-6 Astra no dia 3, Opus 5.5 no dia 22. A segunda é eficiência de engenharia, já que a Anthropic diz que o novo modelo exige menos computação para ser servido. A terceira é financeira. A Bloomberg enquadrou o lançamento como parte da preparação da Anthropic para a abertura de capital, momento em que crescimento de receita e margem passam a ser medidos com lupa. (Bloomberg)

Sim, mas: o Opus 5.5 é o primeiro da linha Opus a sair com as salvaguardas do tier Fable. Pedidos de cibersegurança são redirecionados ao Opus 4.8 e os de biologia ao Opus 5, e o modo de raciocínio não pode mais ser desligado. Empresas de segurança digital e de ciências da vida precisam passar pelos programas de verificação da Anthropic para ter uso pleno.

Claude Opus 5.5, GPT-6 Astra ou Fable 5.1: quem lidera de verdade?

Depende de quem mede. E essa é a informação mais subestimada do mês.

No Terminal-Bench 4.0, teste de tarefas de programação em terminal, a Anthropic reporta 66,4% para o Opus 5.5 no esforço xhigh. A Artificial Analysis rodou o mesmo teste por conta própria e encontrou 59,6%, resultado que coloca o modelo no nível do GPT-6 Astra, e não sete pontos à frente. A própria tabela da Anthropic compara seu modelo com números do Astra informados pela OpenAI, obtidos em outra configuração. (Artificial Analysis)

O caso mais revelador envolve um modelo que nem é o protagonista. No FrontierCode, o Opus 5 aparece com 48,0% na tabela da Anthropic e com 53,4% na tabela da OpenAI. Mesmo modelo, mesmo teste, 5,4 pontos de diferença entre as duas fontes. (Anthropic e OpenAI)

Do lado da OpenAI, os números também se moveram depois de publicados. A Fortune documentou que a empresa alterou métricas do Astra dias após o lançamento: a taxa de alucinação informada passou de 4,2% para 2% e voltou a 4,2%. (Fortune) O resultado mais citado do Astra, 99,9% no ARC-AGI-3, depende do adaptador da própria OpenAI. Com o método padrão do ARC Prize, organização que mantém o teste, a nota cai para 62,7%. (The Next Web)

A Anthropic admite o problema na página de lançamento. A empresa escreve que, nesses níveis de capacidade, as margens de benchmark se tornaram um guia menos confiável das diferenças no mundo real, e que no uso interno a distância entre o Opus 5.5 e o Fable 5.1 é menor do que os números sugerem.

Os números que resistem ao filtro: mesmo na tabela da Anthropic, o Astra vence em automação de fluxos (41,4% contra 40,0% no AutomationBench) e em tarefas científicas (64,6% contra 58,7% no Terminal-Bench-Science). O Opus 5.5 leva vantagem clara em trabalho do conhecimento, com 1.846 pontos no GDPval-AA, índice que a Artificial Analysis confirmou de forma independente, contra 1.542 do Astra.

Para ler qualquer ranking daqui em diante, três perguntas bastam. Quem mediu? Em que configuração de esforço? E a que custo por tarefa? A terceira é a que quase ninguém faz.

Por que o preço por token engana o orçamento de IA?

O modelo mais barato por token pode sair mais caro por tarefa. O Opus 5.5 é um bom exemplo disso.

No esforço máximo, o Opus 5.5 gasta cerca de 119 mil tokens de saída para cada tarefa do índice da Artificial Analysis. O Opus 5 gastava perto de 73 mil, o Fable 5.1 usa 78 mil e o GPT-6 Astra, cerca de 27 mil. O resultado é que, apesar do token 20% mais barato, o custo por tarefa do Opus 5.5 no esforço máximo ficou no mesmo patamar do Opus 5. O desconto foi consumido pelo apetite do modelo quando ele pensa mais. (Artificial Analysis)

A alavanca de verdade é o nível de esforço, uma configuração que a maioria das empresas deixa no padrão. Na medição da Artificial Analysis, o Opus 5.5 vai de 42 pontos a US$ 0,55 por tarefa, no esforço baixo, a 58 pontos a US$ 5,98, no máximo. São 11 vezes mais custo para 16 pontos de índice. Em muitos processos, o nível intermediário resolve.

A Deloitte relatou um caso nessa linha, publicado pela Anthropic: no menor nível de esforço, o Opus 5.5 identificou 72% dos bugs conhecidos nas revisões de código da consultoria, contra 56% do Opus 5 em esforço alto.

A consequência para o orçamento é direta. O modelo deixou de ser o item mais caro e mais difícil de um projeto de IA. Escolher a configuração certa, desenhar o processo em que o agente vai operar e medir o resultado por tarefa passaram a pesar mais que a escolha do fornecedor.

O que fazer com a IA de fronteira mais barata?

1. Trocar o padrão antes de trocar de fornecedor. Quem já usa o Opus 5 pode migrar para o Opus 5.5 nas mesmas nuvens (AWS, Google Cloud e Microsoft Azure) e pagar menos pelo mesmo trabalho. O Fable 5.1 fica reservado para os casos em que o time já comprovou vantagem com testes próprios.

2. Medir por tarefa, em mais de um nível de esforço. Rodar o mesmo processo real em esforço baixo, médio e alto e comparar qualidade e custo lado a lado. A diferença de 11 vezes entre os extremos, medida pela Artificial Analysis, mostra quanto dinheiro fica na mesa quando ninguém mexe nessa configuração.

3. Montar a própria régua. Separar tarefas reais da operação, como análise de contrato, proposta comercial, conciliação financeira e resposta a cliente, e testar os modelos candidatos nelas. Rankings públicos servem para montar a lista curta. A decisão sai do teste interno.

4. Rotear por complexidade e manter um plano B. Volume alto vai para modelos baratos, como o GPT-6 Luna a US$ 0,10 por milhão de tokens de entrada, e a fronteira fica para a exceção. Ter um segundo fornecedor configurado também é gestão de risco. Entre 12 de junho e 1º de julho, uma diretiva de controle de exportação dos EUA tirou o Fable 5 do ar para clientes de todo o mundo. (Anthropic)

5. Levar a economia para a implementação. Se o custo do modelo cai, o gargalo passa a ser processo, time e método. Para empresas menores, que decidem mais rápido, é a janela para testar agentes que meses atrás não fechavam a conta. É a lógica do AI Action, programa de implementação guiada da StartSe: a empresa passa por um assessment, recebe um plano de ataque com três soluções prioritárias e implementa com o próprio time em 100 dias, a partir de uma curadoria de mais de 100 soluções distribuídas em sete áreas do negócio, do comercial ao financeiro.

Quais sinais acompanhar até o fim de 2026?

O que vem por aí:

  • Sonnet 5.5 e Haiku 5.5. A Anthropic prometeu os dois modelos para as próximas semanas, o que deve levar a mesma eficiência para os tiers usados em alto volume.
  • A resposta do Astra. O topo de linha da OpenAI segue a US$ 10 e US$ 50, agora 2,5 vezes mais caro que o líder do ranking independente. Um corte de preço seria o próximo movimento lógico da disputa.
  • Replicação independente. Os números do Opus 5.5 ainda estão sendo refeitos por avaliadores externos. Qualquer comparação publicada sem dizer quem mediu merece desconfiança.
  • O próximo Ramp AI Index. Vai mostrar se o preço menor devolve participação aos modelos de fronteira ou se as empresas mantêm o padrão barato.

Setembro transformou a inteligência de fronteira em insumo com preço em queda e placar em disputa. O que segue escasso é a capacidade de transformar esse insumo em processo funcionando dentro da empresa. Para quem quer sair da comparação de rankings e entrar em 2027 com agentes rodando na operação, o caminho que a StartSe desenhou para isso é o AI Action.

Gostou deste conteúdo? Deixa que a gente te avisa quando surgirem assuntos relacionados!

Imagem de fundo do produto: Imersão São Paulo - Edição IA | StartSe

Assuntos relacionados

Imagem de perfil do redator

Leia o próximo artigo

newsletter

Start Seu dia:
A Newsletter do AGORA!