CAV Inovação Fale conosco
Blog › IA

IA dos EUA e da China: benchmarks, custos e poder global

Uma comparação técnica e sem slogans entre modelos de fronteira dos EUA e da China: o que benchmarks medem, custos de treino divulgados, infraestrutura necessária e como a disputa geopolítica molda as narrativas.

CI
CAV Inovação
8 de out. de 2026
13 min de leitura
Fileiras de racks com servidores e aceleradores de IA em um data center.

Atualizado em outubro de 2026. Comparar inteligência artificial dos Estados Unidos e da China exige separar três perguntas: qual modelo obteve melhor resultado em uma avaliação, quanto custou treiná-lo e quanto custa servi-lo. Essas respostas não são intercambiáveis. Rankings medem tarefas diferentes, laboratórios raramente divulgam o custo total e uma demonstração de eficiência não prova que um país venceu uma corrida tecnológica.

Neste artigo, “treino” inclui pré-treinamento e otimização posterior. “Inferência” é o uso do modelo para responder a cada solicitação. O custo integral ainda pode incluir pesquisa, dados, experimentos descartados, salários, energia, rede e desenvolvimento do produto. Mantemos essas fronteiras explícitas para evitar falsa precisão.

O que os benchmarks mostram?

Um benchmark é um conjunto de tarefas com uma regra de pontuação. Pode avaliar matemática, programação, conhecimento científico, preferência humana ou execução com ferramentas. O resultado vale para uma configuração: versão do modelo, prompt, ferramentas, orçamento de tokens, número de tentativas e conjunto de testes. Mudar esses fatores pode alterar o placar.

O Artificial Analysis Intelligence Index v4.3, publicado em 7 de setembro de 2026, agrega dez avaliações. Naquela fotografia, Claude Fable 5.1 e GPT-6 Astra aparecem com 53 pontos. Entre modelos chineses de pesos abertos, GLM-5.3 Flash registra 42, Qwen3.8 2.4T A95B registra 40 e DeepSeek V4 Pro 0813 registra 36. São notas daquele índice e das configurações indicadas, não uma medida universal de inteligência. Veja resultados e metodologia do índice.

Outra lente é o Arena Elo, baseado em preferências de pessoas ao comparar respostas. O Stanford AI Index 2026 registra, em março de 2026, Anthropic em 1.503, xAI em 1.495, Google em 1.494 e OpenAI em 1.481. Alibaba aparece em 1.449 e DeepSeek em 1.424. O relatório calcula vantagem de 2,7% para o modelo líder dos EUA sobre o líder chinês. A distância variou e os dois lados já alternaram posições no topo.

Essas observações não se contradizem. As datas, amostras e regras são diferentes. Arena mede preferência em conversas; o índice combina avaliações de raciocínio, programação e trabalho com ferramentas. Não se deve misturar as pontuações nem apresentá-las como placar definitivo entre países.

Limites que mudam a leitura

  • Contaminação: perguntas podem aparecer nos dados de treino e inflar resultados.
  • Saturação: quando muitos modelos alcançam o teto da prova, ela perde poder de distinção.
  • Protocolo: ferramentas, tentativas e esforço de raciocínio afetam a nota.
  • Incerteza: diferenças pequenas podem estar dentro da variação estatística.
  • Preferência não é verdade: votos humanos não garantem precisão factual.

O Stanford HAI observa que benchmarks ficam para trás das capacidades dos modelos e cita taxas de questões inválidas de até 42% em avaliações amplamente usadas. Também alerta que a posição em arenas pode refletir adaptação à plataforma. A pergunta prática, portanto, não é “qual IA ganhou?”, mas “qual modelo resolve esta tarefa com este custo, taxa de erro, latência e governança?”.

Quanto custa treinar cada IA?

Para a maioria dos modelos líderes atuais, o custo total de treino não foi divulgado em formato auditável e comparável. OpenAI, Anthropic, Google, Alibaba, Z.ai e DeepSeek não publicam uma conta completa equivalente para cada modelo recente. Ausência de dado não deve ser preenchida com rumor, preço de API ou orçamento de data center.

O exemplo público mais citado é o DeepSeek-V3. Seu relatório técnico informa 2,788 milhões de horas de GPU H800 para pré-treinamento, extensão de contexto e pós-treinamento. Os autores calculam US$ 5,576 milhões com a hipótese de aluguel de US$ 2 por hora de H800. O treino usou 14,8 trilhões de tokens. A conta exclui pesquisa anterior e experimentos de ablação de arquitetura, algoritmos e dados. Ela não é o custo integral da empresa, do produto ou do serviço em produção. É uma estimativa da execução oficial sob premissas declaradas, não uma fatura auditada de todo o desenvolvimento.

Esse valor é do V3, não do DeepSeek V4 nem de OpenAI, Anthropic, Google, Alibaba ou Z.ai. O centro de transparência da DeepSeek lista V4 e V3.2 com documentos técnicos, mas não oferece um custo total comparável ao publicado para V3. Não há base verificável para atribuir um valor em dólares a cada concorrente.

A Epoch AI analisou até 45 modelos de fronteira e estimou crescimento de 2,4 vezes ao ano no custo amortizado de hardware e energia da execução final entre 2016 e 2024. Em estudos detalhados de alguns modelos anteriores, hardware representou 47% a 67% do custo de desenvolvimento estimado; salários de pesquisa, 29% a 49%. Esses intervalos dependem do método e da amostra. Não são preços oficiais de modelos de 2026.

Resumo do que sabemos sobre custos

  • DeepSeek-V3: US$ 5,576 milhões calculados pelos autores para a execução descrita, com preço hipotético de aluguel H800; pesquisa prévia e ablações ficam fora.
  • DeepSeek V4, Qwen3.8, GLM-5.3 e Kimi K3: custo integral comparável não divulgado nas fontes citadas.
  • GPT-6 Astra, Claude Fable 5.1 e modelos Gemini de fronteira: não há custo total de desenvolvimento auditável publicado pelos fornecedores.
  • Estimativas de terceiros: dependem de hardware presumido, duração, energia e amortização; devem ser chamadas de estimativas.

Preço de API é outra métrica. Ele reflete cache, volume, margem, subsídio e estratégia comercial, além do custo de servir solicitações. Não revela quanto custou treinar o modelo.

Quais recursos técnicos são necessários?

Treinar um modelo de fronteira requer aceleradores especializados, como GPUs ou TPUs, memória de alta largura de banda, armazenamento para grandes corpora, rede rápida entre servidores, energia estável, refrigeração e software distribuído. Também exige dados curados, controle de licenças, avaliação, engenheiros de sistemas e equipes de pesquisa.

Em treinamento distribuído, aceleradores trocam gradientes e estados. A rede e o particionamento podem limitar o rendimento, mesmo com milhares de chips. Precisão reduzida, como FP8, mistura de especialistas e atenção esparsa podem economizar tempo e memória, mas exigem kernels e validação cuidadosos. Para o pré-treino do V3, a DeepSeek relata um cluster de 2.048 H800. É a descrição daquele projeto, não uma receita mínima universal.

Arquiteturas Mixture of Experts ajudam a explicar por que total de parâmetros não equivale ao cálculo de cada token. A ficha oficial do DeepSeek V3.2 informa 671 bilhões de parâmetros totais, dos quais 37 bilhões são ativados por token, e contexto de 128 mil tokens. Os 37 bilhões indicam os parâmetros usados em cada passagem; não significam que todo o modelo caiba na memória de uma placa. Servir pesos completos ainda exige armazenar e distribuir o conjunto necessário. Quantização reduz memória, com possíveis perdas; contexto longo aumenta a memória de atenção, especialmente com muitas sessões simultâneas.

Inferência difere do treino. Modelos menores e versões quantizadas podem rodar em estações de trabalho com memória suficiente. Modelos MoE de centenas de bilhões de parâmetros, contexto longo, baixa latência e alto volume tendem a exigir vários aceleradores ou serviço hospedado. A necessidade depende da quantização, do motor, da concorrência e da velocidade desejada. O próprio relatório do V3 observa que a unidade recomendada para implantação eficiente é relativamente grande e pode pesar para equipes pequenas.

Quatro camadas de infraestrutura

  1. Treino: aceleradores, rede, memória, dados, energia, refrigeração e orquestração.
  2. Pós-treino: exemplos, ajuste supervisionado, preferências ou reforço, verificadores e testes de segurança.
  3. Inferência: memória para pesos e contexto, capacidade de serviço, cache e redundância.
  4. Operação: monitoramento, proteção de dados, segurança, atualização e controle de custos.

Como a geopolítica molda a disputa?

A competição é técnica, econômica e política. Nos Estados Unidos, controles de exportação são apresentados como medidas de segurança nacional para limitar acesso a chips usados em aplicações militares e de inteligência. Em maio de 2025, o Bureau of Industry and Security descreveu requisitos de licença para certas transações envolvendo circuitos avançados e treinamento de modelos para usuários sujeitos a controles. A regra muda com o tempo: em janeiro de 2026, o BIS informou que pedidos para Nvidia H200 e AMD MI325X destinados a clientes chineses seriam avaliados caso a caso, sob condições. Portanto, “bloqueio total” é simplificação; produto, usuário final, data e licença importam.

A estratégia chinesa também aparece em documentos oficiais. A iniciativa “AI Plus” do Conselho de Estado prioriza integração de IA em ciência, indústria, consumo, serviços públicos e governança, além de capacidade computacional, dados, modelos e código aberto. O plano chinês de governança global apresenta IA como bem público internacional e defende cooperação e acesso para o Sul Global.

As narrativas disputam legitimidade. Washington destaca segurança, uso militar, proteção tecnológica e controle de capacidade. Pequim enfatiza autossuficiência, aplicação industrial, abertura e acesso global. Ambas selecionam argumentos favoráveis. Restrições a chips podem reduzir acesso no curto prazo e também estimular investimento doméstico e otimização. Pesos abertos ampliam acesso, mas não tornam automaticamente o sistema seguro, barato de operar ou plenamente transparente. “Aberto” pode significar pesos disponíveis sem revelar dados, etapas de treino ou decisões de segurança.

Investimento privado também não representa toda a capacidade nacional. O Stanford AI Index 2026 estima US$ 285,9 bilhões de investimento privado em IA nos Estados Unidos em 2025 e US$ 12,4 bilhões na China. O relatório ressalva que o número privado provavelmente subestima o esforço chinês, pois não captura por completo fundos de orientação governamental. Tratar esses valores como gasto nacional total levaria a uma conclusão enganosa.

Como uma empresa deve comparar modelos?

Para uma empresa, nacionalidade do laboratório ou posição geral em um ranking não substitui teste com tarefas reais. Meça conclusão, erros graves, revisão humana, custo por tarefa concluída, latência, privacidade, retenção, estabilidade e dependência do fornecedor. Fixe prompts, versões e critérios para tornar o teste reproduzível.

  • Separe busca, redação, programação, extração e raciocínio; um placar único esconde diferenças.
  • Use amostras próprias e evite dados pessoais desnecessários.
  • Calcule custo por resultado correto, não só por milhão de tokens.
  • Compare API e pesos abertos sob critérios equivalentes.
  • Verifique licença, região de processamento, retenção, segurança e capacidade da equipe.

Para aplicações empresariais, veja também os serviços de inteligência artificial da CAV. Comece pelo risco e pelo caso de uso, crie avaliação reproduzível e depois decida entre API, implantação privada ou modelo local.

Roteiro prático para um teste justo

Uma empresa não precisa de um supercomputador para saber qual modelo atende melhor ao seu caso. Precisa de uma boa amostra de tarefas e de um jeito justo de medir cada resposta. O teste deve imitar o uso real. Não use só perguntas de demonstração escolhidas pelo fornecedor.

Primeiro, escreva o que a pessoa quer fazer. Por exemplo: resumir um contrato, achar um dado em uma planilha ou responder a uma dúvida de cliente. Depois, reúna exemplos que não tragam dados pessoais sem necessidade. Marque qual seria uma boa resposta. Inclua casos fáceis, casos comuns e casos que podem levar a erro.

Rode o mesmo pedido em cada modelo. Use a mesma fonte, as mesmas regras e o mesmo limite de tempo. Guarde a versão do modelo e a data do teste. Se um sistema puder buscar na web ou usar uma planilha, dê a mesma ferramenta a todos. Um modelo sem acesso a uma fonte não deve ser comparado a outro que a consultou.

Conte respostas certas, respostas erradas e casos que pedem revisão humana. Um erro em um texto de marketing pode ser leve. Um erro em uma conta, uma regra ou um dado de cliente pode ter alto custo. Dê peso maior aos erros que podem causar dano. A média simples pode esconder esse risco.

Meça o custo para concluir o trabalho, não só o preço de cada chamada. Some o tempo de quem revisa, o uso de busca, as novas tentativas e o tempo de espera. Se a tarefa levar cinco minutos de revisão em vez de vinte, essa queda pode valer mais que um preço menor por token. Se o modelo erra mais e exige refazer o trabalho, a opção barata pode sair cara.

Repita o teste em mais de um dia. Serviços de nuvem podem mudar de versão, carga e limite. Use um grupo de tarefas que não tenha sido enviado antes ao fornecedor. Isso ajuda a reduzir o risco de uma prova decorada. Guarde os dados do teste para que outra pessoa possa repetir a conta.

Por fim, escolha com base no nível de risco aceito. Uma tarefa simples pode usar um modelo rápido e barato. Um caso que afeta dinheiro, saúde, lei ou acesso deve ter fonte clara, registro e revisão humana. Nem todo trabalho precisa do modelo mais caro. Nem todo ganho de nota justifica trocar de sistema.

“excluding the costs associated with prior research and ablation experiments on architectures, algorithms, or data.”

DeepSeek, relatório técnico do V3

Conclusão

Os dados mostram competição próxima no topo, não equivalência absoluta nem uma vitória nacional definitiva. Em março de 2026, Stanford mediu diferença pequena entre líderes dos EUA e da China no Arena. Em setembro, um índice independente colocou modelos americanos à frente no agregado publicado, enquanto sistemas chineses de pesos abertos seguiram competitivos em várias tarefas. Data e método são parte do resultado.

Também não existe uma tabela confiável do preço integral de treino de cada grande IA atual. O caso V3 é útil porque deixa premissas e exclusões explícitas. Ele não prova que todo modelo de fronteira custe cerca de US$ 5,6 milhões. A leitura sólida combina benchmark contextualizado, custos com escopo claro, requisitos de operação e escrutínio das narrativas políticas.

Perguntas frequentes

Qual IA lidera os benchmarks em 2026?

Depende da avaliação. No Artificial Analysis Intelligence Index v4.3, Claude Fable 5.1 e GPT-6 Astra registram 53 pontos. Stanford HAI usa Arena Elo e outra fotografia. Um resultado isolado não mede toda a capacidade do modelo.

Quanto custou treinar o DeepSeek V3?

O relatório calcula US$ 5,576 milhões para 2,788 milhões de horas de GPU H800, usando aluguel hipotético de US$ 2 por hora. Exclui pesquisa prévia e ablações; não é o custo integral de desenvolvimento e operação.

Quanto custou treinar GPT-6 Astra ou Claude Fable 5.1?

Os fornecedores não divulgaram um total auditável e comparável para esses modelos. Estimativas externas devem declarar hardware, duração, energia, salários e experimentos incluídos.

Consigo executar um modelo grande em um computador pessoal?

Modelos menores e versões quantizadas podem rodar localmente se houver memória suficiente. Modelos com centenas de bilhões de parâmetros e contexto longo normalmente exigem vários aceleradores ou serviço hospedado.

Modelos chineses são sempre mais baratos?

Não. Preço de API não informa custo de treino nem custo total de propriedade. Hospedagem própria inclui hardware, energia, manutenção, equipe e segurança. Compare custo por tarefa correta.

Pesos abertos significam transparência total?

Não. Pesos disponíveis facilitam baixar e operar o modelo, conforme sua licença, mas não revelam necessariamente dados, custos, avaliações ou decisões de segurança. Leia a documentação da versão.

Fontes e metodologia

Os números são fotografias publicadas por cada fonte, não resultados recalculados pela CAV. Custos ausentes foram identificados como não divulgados. Documentos governamentais são apresentados como posições oficiais, não como avaliações independentes.

Tags:inteligência artificialbenchmarksDeepSeekChinaEstados Unidoscusto de treinamentoGPUsgeopolítica
CI
CAV Inovação
Equipe CAV Inovação, especialistas em sistemas de IA, dados e marketing aplicados a negócios reais.

Leia também