Inferência de IA está ficando mais barata, mas isso pode tornar a IA mais cara.

A inferência de IA está entrando em um reset de preços, mas modelos mais baratos podem não significar IA mais barata

Last Updated:
Inferência de IA está ficando mais barata, mas isso pode tornar a IA mais cara.
Google News

Get our latest news first. Add us as your Preferred Source on Google and tap "Star" to prioritize our updates.

  • Os preços da inferência de IA estão despencando enquanto os provedores de modelos disputam liderança em custos.
  • Os aumentos de preço do DeepSeek mostram que a corrida para o fundo pode já estar se revertendo.
  • IA mais barata poderia gerar mais uso, transferindo valor dos modelos para chips e infraestrutura.

A próxima batalha da indústria de IA não é sobre quem tem o modelo mais inteligente. É sobre quem consegue executar uma tarefa com o menor custo. Essa mudança ficou evidente este mês, quando laboratórios americanos cortaram os preços para conter rivais chineses mais baratos, apenas para o mais barato desses concorrentes, a DeepSeek, se virar e aumentar suas próprias taxas.

Por que o Custo, Não Apenas a Capacidade, Agora Decide o Mercado

Modelos chineses de peso aberto têm dominado silenciosamente. Relatórios deste ano mostram que provedores chineses agora lidam com mais da metade de todo o tráfego roteado para os EUA no OpenRouter, a plataforma que muitos desenvolvedores usam para comparar e acessar modelos, um aumento em relação a cerca de um décimo lugar no ano anterior.

A proposta é simples: desempenho quase de fronteira por uma fração do preço. Essa pressão forçou a OpenAI a agir.

Em 30 de julho, foi reduzida a precificação de entrada para o GPT-5.6 Luna em 80%, de $1 para $0,20 por milhão de tokens, com a precificação de output caindo de $6 para $1,20. Dados citados por Jefferies da Silicon Data mostram que os custos médios de inferência empresarial caíram de cerca de $2,04 por milhão de tokens no final de maio para cerca de $1,16-$1,18 em agosto, um mínimo anual.

A reviravolta de DeepSeek

Enquanto isso, a empresa que iniciou a guerra de preços acabou de aumentar muito os próprios preços. A partir de 16 a 17 de agosto, a DeepSeek introduziu o faturamento em horários de pico e fora de pico para seus modelos V4-Pro e V4-Flash, com aumentos que variam de 50% a mais de 1.100%, dependendo do modelo e do horário do dia.

A produção do V4-Pro salta de $0,87 para $3,96 por milhão de tokens no pico (9h às 12h e 14h às 18h, horário de Pequim), ou $1,98 fora do horário de pico. A produção do V4-Flash sobe de $0,28 para $1,32 no pico, e para $0,66 fora do pico.

A DeepSeek afirma que a mudança visa distribuir a demanda de forma mais equilibrada em sua infraestrutura. Mesmo após o aumento, suas taxas permanecem abaixo de muitas rivais, mas a diferença com o modelo Luna descontado da OpenAI diminuiu drasticamente e, em algumas comparações de horários de pico, desapareceu completamente.

O Ângulo do Paradoxo de Jevons

A queda dos preços não significa necessariamente a queda das notas. Quando cada tarefa fica drasticamente mais barata, torna-se econômico rodar muito mais delas: agentes em múltiplas etapas, fluxos de trabalho automatizados e processos que antes não valiam a pena automatizar.

Analistas já observaram que cargas de trabalho agentes, que encadeiam dezenas de chamadas, antes impraticáveis, agora são mais baratas do que uma única chamada semanas antes. Esse é o paradoxo clássico de Jevons: ganhos de eficiência podem expandir o consumo total mais rápido do que reduzem o preço por unidade. Em outras palavras, os gastos em IA corporativa podem continuar aumentando mesmo com a queda do custo por tarefa.

Quem Realmente Perde

Se a inferência continuar se movendo para a precificação de commodities, os desenvolvedores de modelos competindo pela produção bruta enfrentam a maior pressão, especialmente com OpenAI e Anthropic buscando IPOs com avaliações próximas a 1 trilhão de dólares. Margens menores em tokens tornam essas avaliações mais difíceis de justificar apenas por meio de vendas de modelos.

A infraestrutura parece mais isolada. Mais tarefas, agentes e chamadas de inferência ainda exigem chips, capacidade de nuvem e data centers, independentemente de quem vencer a guerra de preços.

Relacionado: Gemini 3.7 Flash pode fazer da cripto o campo de testes definitivo para agentes de IA

Disclaimer: The information presented in this article is for informational and educational purposes only. The article does not constitute financial advice or advice of any kind. Coin Edition is not responsible for any losses incurred as a result of the utilization of content, products, or services mentioned. Readers are advised to exercise caution before taking any action related to the company.