Em agosto de 2026, a OpenRouter teria processado 25T de tokens por semana em mais de 400 modelos de IA, ante 5T seis meses antes. O custo de alternar entre modelos caía mais rápido do que o custo de saber se a troca havia funcionado. Os roteadores tornaram a substituição rotineira justamente quando os agentes levaram o sucesso para além dos preços por token e dos rankings.
Principais pontos
- A OpenRouter teria processado 25 trilhões de tokens por semana em mais de 400 modelos em agosto de 2026, ante 5 trilhões seis meses antes.
- O DeepSeek V4-Flash é listado a US$ 0.14 por milhão de tokens de entrada e US$ 0.28 por milhão de tokens de saída.
- A Artificial Analysis estimou custos por teste de benchmark de US$ 0.03 para o DeepSeek V4-Flash, US$ 0.86 para o Kimi K3 e US$ 1.86 para o GPT-5.6 Sol.
- O DeepSeek V4-Flash marcou 50 no Artificial Analysis Intelligence Index, 10 pontos acima de sua prévia de abril.
- A Alibaba disse que divulgaria os pesos do Qwen3.8-Max de 2.4 trilhões de parâmetros e do Qwen3.8-27B.
No início desta trajetória de 18 meses, a concorrência entre modelos ainda cabia em uma única escala. A Alibaba lançou o Qwen2.5-Max afirmando que ele superava o GPT-4o, o DeepSeek-V3 e o Llama-3.1-405B em quase todos os aspectos. A pergunta óbvia era qual laboratório havia construído o modelo mais capaz.
Desde então, empresas que adotam IA corporativa começaram a rotear cargas de trabalho entre fornecedores, e a competição entre modelos se espalhou para o próprio sistema de medição. Benchmarks, preços de tabela por token, licenças de pesos abertos e avaliações de tarefas de agentes revelam, cada um, uma propriedade real, mas parcial.
Uma tarifa por token para antes de o trabalho terminar
A Alibaba cobra US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída pelo Qwen3.8-Max. A Moonshot AI cobra US$ 3 e US$ 15 pelo Kimi K3. O DeepSeek V4-Flash fica muito abaixo, a US$ 0.14 por milhão de tokens de entrada e US$ 0.28 por milhão de tokens de saída.
Para uma equipe de compras, a conta relevante termina em um resultado aceito. Um modelo pode produzir uma resposta mais longa, acionar mais ferramentas, falhar em uma ação externa, repetir a solicitação ou enviar o resultado para um revisor humano. Uma tarifa baixa ainda pode gerar um fluxo de trabalho caro; uma tarifa mais alta pode ser econômica quando o modelo conclui o trabalho de forma confiável, com menos saída e supervisão.
A Artificial Analysis começou a reportar o custo por teste de benchmark, aproximando os preços do trabalho concluído. Estimou que o DeepSeek V4-Flash custava US$ 0.03 por teste, ante US$ 0.86 para o Kimi K3 e US$ 1.86 para o GPT-5.6 Sol. Uma conta por teste é mais útil do que uma tarifa por token porque o avaliador fornece um denominador comum. O teste ainda exclui a pilha de ferramentas, os critérios de aceitação, a política de escalonamento e a carga de revisão de uma empresa, mas mede uma parcela maior da jornada.
OpenAI e Anthropic teriam projetado custos de inferência superiores à metade da receita, de modo que cada ganho de eficiência no atendimento afeta a economia do fornecedor antes de chegar ao cliente. Suas projeções ajudam a explicar por que a economia da inferência molda cada vez mais o desenho de produtos, as tabelas de preços e a segmentação de modelos. Os compradores ainda precisam medir qual sistema conclui o trabalho.
Um único ranking esconde a divergência útil
O DeepSeek V4 Flash marcou 50 no Artificial Analysis Intelligence Index, igualando o Gemini 3.6 Flash e avançando 10 pontos em relação à sua prévia de abril. Essa pontuação coloca o modelo em um grupo sério de comparação e permite que compradores eliminem candidatos claramente mais fracos sem avaliar cada lançamento do zero.
O Kimi K3 liderou o Frontend Code Arena, enquanto marcou 88.3 no Terminal Bench 2.1, logo atrás do GPT-5.6 Sol, com 88.8. Esses rankings não invalidam a pontuação do DeepSeek no índice. Programação de front-end e trabalho em terminal recompensam comportamentos diferentes, enquanto um índice composto de inteligência pondera ainda mais capacidades em um único número.
Equipes de pesquisa buscam desempenho de ponta em benchmarks porque um teste comum torna o progresso legível. Responsáveis pela produção buscam inferência rápida, latência previsível, interpretabilidade e resultados que satisfaçam diferentes partes interessadas. Os dois grupos podem avaliar corretamente o mesmo modelo e ainda chegar a conclusões diferentes porque têm funções objetivo distintas.
É aqui que se abre a lacuna entre avaliação e contratação. Uma pontuação geral pode filtrar candidatos. A ordem de compra ainda depende de saber se uma vantagem de um ponto em programação importa mais do que tempo de resposta, controle de implantação, recuperação de falhas ou aceitação humana. O benchmark responde à pergunta formulada por seu criador; a contratação responde à pergunta que o negócio tem.
Pesos abertos precificam um controle que APIs não podem vender
Um cliente de API compra acesso ao sistema em operação de um fornecedor. Um cliente de pesos abertos adquire outro conjunto de opções: onde o modelo roda, quem o adapta, qual infraestrutura o hospeda e com que facilidade a organização pode se afastar do fornecedor original.
A Alibaba disse que divulgaria os pesos do Qwen3.8-Max de 2.4 trilhões de parâmetros e do Qwen3.8-27B após publicar comparações de benchmark com o Kimi K3. A Alibaba já havia lançado o Qwen3.6-27B como um modelo denso de pesos abertos e disse que o modelo menor superava um antecessor Qwen muito maior nos principais benchmarks de programação. O plano da OpenAI, em 2025, para seu primeiro modelo de linguagem de pesos abertos desde o GPT-2 mostrou que até um fornecedor proprietário líder queria essa opção.
Um modelo hospedado internamente torna o comprador responsável pela implantação, capacidade, atualizações e avaliação. APIs gerenciadas podem custar menos no total ou entregar melhores resultados mensurados.
Desenvolvedores, provedores de nuvem e fornecedores podem tratar um modelo de pesos abertos amplamente adotado como uma base neutra, criar integrações em torno dele e preservar a portabilidade entre provedores de infraestrutura. Para compradores, o controle da implantação se torna uma dimensão separada de contratação, ao lado de capacidade e preço.
Roteadores transformam a contratação em um ciclo operacional
Um roteador rompe a premissa de que um modelo precisa vencer em todas as solicitações. Ele pode enviar trabalho rotineiro para um modelo mais barato, trabalho especializado para um modelo adequado ao domínio e trabalho de alto risco para uma rota com controles mais rigorosos de confiabilidade ou revisão. A organização pode mudar a rota quando tarifas, modelos ou requisitos mudam.
No volume da OpenRouter, a seleção de modelos se torna infraestrutura de produção, com regras de roteamento moldando custos e falhas em operação.
Empresas dos EUA enviaram quase 60% de seu uso de tokens na OpenRouter para modelos chineses. Uma decisão de política, indisponibilidade de fornecedor ou mudança de preço que afetasse esses modelos alteraria sistemas em funcionamento, não implantações futuras hipotéticas.
A Meta chegou à mesma conclusão arquitetural a partir de sua própria estrutura de custos. A incubadora interna da empresa está desenvolvendo o Switchboard para enviar algumas tarefas de programação a modelos de menor custo, em vez de pagar preços de modelos de ponta por cada solicitação. A OpenRouter atende muitos desenvolvedores; a Meta quer um plano de controle interno. Ambas estão segmentando cargas de trabalho.
O roteamento também cria uma conta própria. Uma equipe de roteamento precisa avaliar cada modelo elegível, observar cada rota, governar o acesso a modelos e dados, manter alternativas de contingência e detectar mudanças de desempenho. Uma empresa com cargas de trabalho mal segmentadas pode adicionar complexidade sem economizar dinheiro ou melhorar a confiabilidade. A economia de múltiplos modelos só melhora quando o operador consegue distinguir as solicitações e confiar nas medições usadas para movê-las.
Agentes estendem a conta para além da resposta
Um agente raciocina sobre um objetivo e age por meio de sistemas externos. Seu resultado depende de mais do que a primeira resposta do modelo. O agente precisa selecionar ferramentas, passar estado entre etapas, recuperar-se de erros e parar quando o trabalho satisfaz uma condição definida.
Um benchmark de prompt e resposta pode testar um componente desse sistema. Ele não pode estabelecer se a sequência completa foi concluída corretamente. A OpenAI reconheceu a distinção quando adicionou sandboxing nativo e um harness in-distribution ao seu Agents SDK para testar modelos em tarefas de longo horizonte. O harness permite que operadores observem o comportamento na implantação, em vez de inferi-lo a partir de um model card.
Pontos de controle humanos pertencem ao mesmo limite de contabilização. Uma organização pode exigir que uma pessoa aprove uma ação relevante, inspecione evidências de suporte ou resolva um resultado ambíguo. Esses controles fornecem responsabilização na implantação, mas os funcionários ainda gastam tempo para operá-los. Um cálculo de contratação que exclui o trabalho de revisão faz o modelo parecer mais barato ao deslocar parte de seu custo para outro departamento.
Um fluxo de trabalho pode usar modelos diferentes para planejamento, execução e verificação. Cada transferência acrescenta outro ponto onde latência, custo de ferramentas, perda de estado ou falha podem entrar. O operador precisa avaliar o sistema montado ao longo do fluxo de trabalho, em vez de calcular a média das pontuações dos componentes e esperar que a aritmética desenvolva julgamento.
Um registro de cargas de trabalho torna toda alegação falsificável
Uma definição estável de concluído permite que um comprador compare rotas sem resolver uma definição universal de inteligência. O comprador pode transformar um fluxo de trabalho delimitado em uma unidade auditável registrando as mesmas medidas para cada rota.
| Medida | O que o comprador registra | Por que isso muda a economia |
|---|---|---|
| Sucesso da tarefa | Taxa de aprovação em um teste de aceitação específico da carga de trabalho | Resultados que falham ou não podem ser usados deixam de contar como trabalho barato |
| Latência de ponta a ponta | Tempo da solicitação à conclusão aceita, incluindo ferramentas e revisão | Um modelo rápido não pode esconder um fluxo de trabalho lento |
| Custo totalmente carregado | Custos de entrada, saída, ferramentas, implantação e infraestrutura | Rotas por API e hospedadas internamente se tornam comparáveis dentro de um mesmo limite |
| Repetições e escalonamento | Tentativas repetidas, rotas alternativas e transferências para pessoas | Os custos de confiabilidade aparecem no mesmo registro que as economias por token |
| Revisão humana | Tempo do revisor, frequência de aprovação e motivo da intervenção | A supervisão se torna um custo operacional, em vez de uma externalidade |
| Proveniência | Versão do modelo, rota, ferramentas, entradas e histórico de decisões | Operadores podem reproduzir, auditar e contestar resultados relevantes |
Uma Pilha de Contratação de Modelos madura atribui a cada ator uma responsabilidade mensurável. Fornecedores publicam tarifas, termos de implantação e evidências de benchmark. Roteadores registram qual modelo tratou uma solicitação e o que a rota consumiu. Compradores definem testes de aceitação, orçamentos de latência, limites de escalonamento e políticas de revisão. Cada ator continua responsável por suas próprias alegações.
O registro também cria memória institucional. Um comprador pode comparar uma nova versão com as rotas que já opera, preservar as evidências por trás de uma troca e reverter a mudança se o desempenho da carga de trabalho se deteriorar. A equipe de compras mantém uma definição estável de valor quando um laboratório publica um novo ranking.
Perguntas frequentes
A OpenRouter foi adquirida pela Stripe?
Nenhuma aquisição confirmada aparece nas evidências fornecidas. Reportagens de julho de 2026 descreveram uma oferta ou conversas em torno de US$ 10 bilhões; separadamente, a PitchBook informou que a OpenRouter havia sido avaliada em US$ 1.3 bilhão em maio.
“Pesos abertos” significa o mesmo que “código aberto”?
Não necessariamente. O texto estabelece que compradores podem obter e implantar os pesos dos modelos, mas não especifica se a licença concede direitos mais amplos de código aberto sobre código, dados de treinamento, modificação ou redistribuição.
A participação de quase 60% dos modelos chineses representa todo o mercado de IA dos EUA?
Não. O número cobre o uso de tokens por empresas dos EUA na OpenRouter, não todo o consumo corporativo de IA nos EUA nem implantações fora dessa plataforma.
Com que frequência um comprador deve atualizar seu registro de cargas de trabalho?
O texto não estabelece uma cadência fixa. Sua lógica operacional implica reavaliação quando mudam uma versão de modelo, tarifa, regra de roteamento, requisito de negócio ou o desempenho observado da carga de trabalho.
Os pesos do Qwen3.8 já estão disponíveis?
O texto relata o compromisso da Alibaba de divulgá-los, não uma divulgação concluída ou uma data de disponibilidade. Os compradores ainda precisariam verificar a publicação e os termos de licenciamento antes de planejar a implantação.
Na escala da OpenRouter, outro modelo está sempre ao alcance. O ativo duradouro é o registro do comprador sobre qual rota concluiu qual trabalho, sob quais controles e a que custo totalmente carregado.