- Les prix d’inférence de l’IA chutent alors que les prestataires modèles se disputent le leadership des coûts.
- Les hausses de prix de DeepSeek montrent que la course vers le bas pourrait déjà s’inverser.
- Une IA moins chère pourrait augmenter l’utilisation, transférant la valeur des modèles vers les puces et les infrastructures.
La prochaine bataille de l’industrie de l’IA ne porte pas sur celui qui a le modèle le plus intelligent. Il s’agit de savoir qui peut gérer une tâche le moins cher. Ce changement est devenu évident ce mois-ci, lorsque les laboratoires américains ont drastiquement baissé les prix pour repousser des rivaux chinois moins chers, pour que le plus bon marché de ces rivaux, DeepSeek, ne remonte ses propres tarifs.
Pourquoi le coût, et non seulement la capacité, décide désormais du marché
Les modèles chinois à poids ouvert prennent discrètement le dessus. Des rapports de cette année montrent que les fournisseurs chinois gèrent désormais plus de la moitié de tout le trafic acheminé vers les États-Unis sur OpenRouter, la plateforme utilisée par de nombreux développeurs pour comparer et accéder aux modèles, contre environ un dixième un an plus tôt.
Le pitch est simple : une performance quasi de frontière à une fraction du prix. Cette pression a forcé OpenAI à agir.
Le 30 juillet, il a réduit le prix des entrées pour GPT-5.6 Luna de 80 %, passant de 1 $ à 0,20 $ par million de tokens, avec une baisse des prix de sortie de 6 $ à 1,20 $. Les données citées par Jefferies provenant de Silicon Data montrent que les coûts moyens d’inférence des entreprises sont passés d’environ 2,04 $ par million de jetons fin mai à environ 1,16 à 1,18 $ en août, un minimum annuel.
Le revirement de DeepSeek
Pendant ce temps, l’entreprise qui a lancé la guerre des prix vient d’augmenter considérablement ses propres prix. À partir du 16 au 17 août, DeepSeek a introduit la facturation en heures de pointe et en hors-pointe pour ses modèles V4-Pro et V4-Flash, avec des augmentations allant de 50 % à plus de 1 100 % selon le modèle et l’heure de la journée.
La production de la V4-Pro passe de 0,87 $ à 3,96 $ par million de jetons aux heures de pointe (9h-12h et de 14h-18h, heure de Pékin), soit 1,98 $ hors pointe. La production V4-Flash passe de 0,28 $ à 1,32 $ au pic, puis à 0,66 $ hors pointe.
DeepSeek affirme que ce changement vise à répartir la demande plus équitablement dans son infrastructure. Même après la hausse, ses taux restent inférieurs à ceux de nombreux rivaux, mais l’écart avec le modèle Luna à rabais d’OpenAI s’est nettement réduit, et dans certaines comparaisons aux heures de pointe, a complètement disparu.
L’angle du paradoxe de Jevons
La baisse des prix ne signifie pas nécessairement la baisse des factures. Quand chaque tâche devient considérablement moins chère, il devient économique d’en faire beaucoup plus : des agents à plusieurs étapes, des flux de travail automatisés et des processus qui ne valaient pas la peine d’être automatisés auparavant.
Les analystes ont déjà noté que les charges de travail agents enchaînant des dizaines d’appels, autrefois peu pratiques, sont désormais moins coûteuses qu’un seul appel quelques semaines plus tôt. C’est le paradoxe classique de Jevons : les gains d’efficacité peuvent augmenter la consommation totale plus rapidement qu’ils ne réduisent le prix par unité. En d’autres termes, les dépenses en IA des entreprises pourraient continuer à augmenter même si le coût par tâche diminue.
Qui perd réellement
Si l’inférence continue de se tourner vers la tarification des matières premières, les développeurs de modèles en concurrence sur la production brute sont les plus contraints, surtout alors qu’OpenAI et Anthropic poursuivent des IPO à des valorisations proches de 1 000 milliards de dollars. Des marges de jetons plus faibles rendent ces valorisations plus difficiles à justifier uniquement par des ventes modèles.
Les infrastructures semblent plus isolées. De plus en plus de tâches, d’agents et d’appels d’inférence nécessitent toujours des puces, de la capacité cloud et des centres de données, quel que soit le gagnant de la guerre des prix.
En lien : Gemini 3.7 Flash pourrait faire de la crypto le terrain d’essai ultime pour les agents IA
Disclaimer: The information presented in this article is for informational and educational purposes only. The article does not constitute financial advice or advice of any kind. Coin Edition is not responsible for any losses incurred as a result of the utilization of content, products, or services mentioned. Readers are advised to exercise caution before taking any action related to the company.