A régua de comparação saiu do preço por token e foi para o custo por tarefa concluída. Nessa conta, a diferença contra os americanos passou de 100 vezes.
China lança novos modelos de IA, com desempenho semelhante aos melhores modelos americanos e uma fração do custo. Quando Tokens se tornam um passivo grande nas empresas, esse número muda a equação inteira
, Redator
11 min
•
5 ago 2026
•
Atualizado: 5 ago 2026
newsletter
Start Seu dia:
A Newsletter do AGORA!
A Artificial Analysis estimou o custo médio do DeepSeek V4-Flash em 3 centavos de dólar por teste, contra 86 centavos do Kimi K3, US$1,86 do GPT-5.6 Sol da OpenAI e US$3,15 do Claude Fable 5 da Anthropic, segundo apuração da Reuters.
Por que isso importa: a métrica mudou. O custo por tarefa considera quanto dado o modelo precisa processar e gerar para concluir o trabalho, o que expõe modelos de preço de tabela baixo que consomem muito mais passos para chegar à resposta. Contratos de IA negociados em dólar por milhão de tokens compararam a coisa errada.
A DeepSeek não lançou modelo novo. A arquitetura do V4-Flash liberado em 31 de julho é idêntica à do preview: 284 bilhões de parâmetros totais, cerca de 13 bilhões ativos por token, 1 milhão de tokens de contexto. Só o post-training mudou. No benchmark DeepSWE, o preview marcava 7,3 e a build retreinada marca 54,4, um salto de sete vezes com zero novo parâmetro, zero nova arquitetura e zero mudança no custo de inferência. O preço seguiu em US$0,14 na entrada e US$0,28 na saída, conforme levantamento da Memeburn.
Esse é o dado que importa, e não o preço.
Capacidade descolou de capex. Se um único ciclo de post-training faz um modelo de orçamento superar o próprio flagship da casa, tamanho de modelo deixou de ser fosso competitivo. O prêmio que laboratórios americanos cobram por capacidade de fronteira passou a depender de uma vantagem replicável em semanas, não em anos.
A Alibaba entrou na mesma semana com a lógica oposta e efeito equivalente. O Qwen3.8-Max é um mixture-of-experts de 2,4 trilhões de parâmetros que ativa cerca de 95 bilhões por inferência, o que segundo a InfoWorld sustenta um preço de US$2 por milhão de tokens de entrada e US$6 de saída, contra US$15 e US$75 do Fable 5. Doze vezes menos na saída, com 1 milhão de tokens de janela.
Aqui a história fica menos confortável. O Intelligence Index da Artificial Analysis colocou o V4-Flash em 50 de 100, empatado com o Gemini 3.6 Flash e um ponto abaixo do Muse Spark 1.1 da Meta e do GLM-5.2. O Kimi K3 marcou 57. Claude Opus 5, Fable 5 e GPT-5.6 ficaram nove pontos ou mais acima.
Cem vezes mais barato, nove pontos abaixo. As duas coisas saem do mesmo relatório.
O caso da Alibaba repete o padrão em outra escala. O Qwen3.8-Max estreou em 4º na Frontend Code Arena com 1.668 pontos, atrás do Claude Opus 5 em esforço máximo, com 1.705, e do Kimi K3, com 1.676, empatado com o Opus 5 em esforço alto. Na Vision Arena ficou em 2º com 1.305, treze pontos atrás do Fable 5, de acordo com os dados publicados pela Arena.ai. No ranking de texto, cai para o 5º lugar.
Na tabela divulgada pela própria Alibaba, o resultado inverte onde mais pesa. O Fable 5 marca 80,0 no SWE-Pro contra 67,7 do Qwen, e 88,8 no FrontierSWE contra 73,5, segundo compilação do BeInCrypto. Engenharia de software de núcleo, o trabalho que sustenta produto em produção, segue com vantagem larga do lado americano.
O desconto tem endereço. Ele mora em código de frontend, em tarefa multimodal, em chamada rotineira de alto volume. Não mora em refatoração de sistema crítico.
A Alibaba não está vendendo chatbot barato. Está vendendo agente de horizonte longo. O Qwen3.8-Max passou 16 dias construindo a ferramenta de linha de comando oh-my-cli, acumulando 265 commits, 127 pull requests e 151 issues até 30 de julho sem intervenção humana. Em outro teste, recebeu um paper de raciocínio em LLM e nenhum código inicial: em cerca de cinco dias e 125 horas de compute, escreveu 7.600 linhas, rodou 33 treinos em GPU, reproduziu os seis resultados principais e testou 18 ideias próprias, conforme o The Decoder.
Ressalva necessária: essas demonstrações foram produzidas pela empresa e não foram replicadas de forma ampla por avaliadores independentes.
A direção, ainda assim, desloca a unidade de compra. Quando o entregável passa a ser tarefa concluída em vez de resposta gerada, orçamento de IA sai da linha de licença e entra na linha de operação.
A distância virou meses. Modelos chineses respondem por cerca de 61% dos tokens processados no OpenRouter em meados de 2026, a família Qwen passou de 1 bilhão de downloads e é base de aproximadamente 40% dos novos modelos derivados no Hugging Face. O CAISI do NIST calculou o DeepSeek V4 Pro cerca de oito meses atrás da fronteira em maio, e em julho julgou o GLM-5.2 comparável a um modelo americano lançado seis meses antes, conforme análise do escritório Sheppard Mullin. Contratos longos de fornecimento com preço travado precificam um ativo que deprecia mais rápido que o próprio contrato.
O passivo não aparece na tabela de preços. A NDAA do ano fiscal 2026 obriga o Departamento de Defesa americano a excluir IA da DeepSeek ou da High-Flyer de seus sistemas e proíbe contratados de usá-la. A Zhipu AI, dona do GLM, está na Entity List desde janeiro de 2025 com presunção de negação. Empresas com operação, cliente ou contrato nos Estados Unidos carregam exposição legal que o custo por tarefa não mede.
A arbitragem favorece o menor. Geração de código rotineira, escrita de teste, análise de log e primeira passada de agente saem cem vezes mais barato sem perda relevante de qualidade. Companhias menores migram esse tipo de roteamento em uma semana. Estruturas de grande porte levam um trimestre para aprovar a mesma mudança, o que transforma velocidade de decisão em vantagem de custo.
A Alibaba confirmou que os pesos abertos do Qwen3.8-Max saem na próxima semana, junto com um segundo checkpoint, o Qwen3.8-27B. O 27B é o dimensionado para hardware de GPU on-premise comum. A distinção decide quem consegue rodar algo internamente: em precisão de 4 bits, o Max exige cerca de 1,2 TB só para armazenar os pesos, e nem um servidor de oito placas H200 com 1.128 GB de VRAM consegue carregá-lo.
A DeepSeek também anunciou preço dobrado em horário de pico, das 9h às 12h e das 14h às 18h no horário de Pequim, sem data de vigência definida. Pipelines de agente dimensionados a 3 centavos por tarefa dependem do fuso em que rodam.
A empresa prepara ainda o V4-Pro, versão mais capaz sem data anunciada, e fontes afirmam que a companhia se organiza para um possível IPO.
Para ir mais fundo: Reuters sobre o custo por tarefa · benchmarks da Arena.ai · análise de risco de export control
Gostou deste conteúdo? Deixa que a gente te avisa quando surgirem assuntos relacionados!
Leia o próximo artigo
newsletter
Start Seu dia:
A Newsletter do AGORA!