Retour au blog
7 min read

L'IA de pointe vient encore de baisser de prix. Refaites vos calculs.

Claude Opus 5, baisses de prix chez Google et Kimi K3 : l'IA de pointe coûte encore moins cher. Ce que cela change pour les PME européennes.

L'IA de pointe vient encore de baisser de prix. Refaites vos calculs.

Le vendredi 24 juillet, Anthropic a lancé Claude Opus 5 à 5 dollars par million de tokens en entrée et 25 dollars en sortie — selon les mots de l'entreprise, une intelligence proche de son modèle phare Fable 5, pour moitié moins cher. Trois jours plus tôt, Google avait à peu près divisé par deux le tarif de sa gamme Gemini Flash. Deux jours plus tard, le chinois Moonshot AI mettait en ligne le plus grand modèle à poids ouverts jamais construit, téléchargeable par tous. Si vous avez chiffré un projet d'IA pour votre entreprise il y a un an et l'avez rangé dans un tiroir parce que les chiffres ne passaient pas, ce devis est périmé.

Une semaine, trois signaux de prix

Anthropic. Claude Opus 5 est arrivé le 24 juillet au même tarif que l'Opus 4.8 qu'il remplace, mais avec nettement plus de capacités — selon Axios, il s'approche du haut de gamme Fable 5 sur de nombreuses tâches, pour la moitié de son prix. C'est le quatrième modèle Claude 5 en moins de deux mois ; il devient le modèle par défaut des abonnés Claude Max et propose un réglage d'« effort » qui échange un peu de qualité contre une facture bien plus légère sur les tâches courantes.

Google. Le 21 juillet, Gemini 3.6 Flash est sorti avec un tarif de lancement de 0,75 dollar par million de tokens en entrée et 3,75 dollars en sortie — une fraction des 1,50 et 9 dollars que facturait Gemini 3.5 Flash à son lancement en mai. Le détail compte : Google précise que ce tarif de lancement expire le 31 décembre 2026, puis double.

Moonshot AI. Quelques jours après le lancement d'Opus, Moonshot a publié les poids de Kimi K3 sur Hugging Face : 2 800 milliards de paramètres, une fenêtre de contexte d'un million de tokens et une licence MIT modifiée qui autorise l'usage commercial gratuit pour la quasi-totalité des entreprises. La presse spécialisée l'a largement qualifié de plus grand modèle à poids ouverts de l'histoire. Vous ne le ferez sans doute jamais tourner vous-même — l'auto-hébergement exige environ 1,5 téraoctet de stockage — mais son existence maintient la pression sur les grilles tarifaires de tous les autres.

Ajoutez GPT-5.6 d'OpenAI, sorti le 9 juillet en trois déclinaisons, et le tableau est clair. Ce n'est pas un fournisseur qui fait une promotion : c'est tout le marché qui révise ses prix, encore une fois.

La courbe derrière les gros titres

L'AI Index de Stanford a suivi ce que coûte un niveau de capacité fixe — l'équivalent du ChatGPT d'origine — et a constaté que le prix est passé de 20 dollars par million de tokens en novembre 2022 à 0,07 dollar en octobre 2024. Une division par 280 en moins de deux ans. Le même rapport note que, selon la tâche, les prix d'inférence des LLM baissent de 9 à 900 fois par an, et l'institut de recherche Epoch AI estime la baisse à environ 40 fois par an à qualité équivalente à GPT-4. La concurrence fait une partie du travail : le chinois DeepSeek facture son modèle de raisonnement R1 à 0,55 dollar en entrée et 2,19 dollars en sortie par million de tokens, une fraction de ce que coûtaient les modèles occidentaux comparables un an plus tôt.

La direction est à sens unique, mais pas chaque étiquette de prix. Le tarif de lancement à durée limitée de Google rappelle que « pas cher » signifie parfois « pas cher jusqu'en janvier ». Le résumé honnête : une capacité donnée devient spectaculairement moins chère avec le temps, pendant que les fournisseurs trouvent sans cesse de nouvelles choses, plus chères, à vendre tout en haut.

Ce qui devient rentable

Un million de tokens représente environ 750 000 mots. Aux prix de la mi-2026, des projets qui semblaient extravagants en 2025 deviennent des arrondis.

Vos e-mails clients, pré-rédigés. Imaginons que votre boutique en ligne à Lyon traite 2 000 messages clients par mois, et qu'un modèle lise environ 600 tokens et en écrive 400 par réponse. Cela fait 1,2 million de tokens en entrée et 0,8 million en sortie : environ 26 dollars par mois sur un modèle de pointe comme Opus 5, et moins de 4 dollars sur Gemini 3.6 Flash. Le goulot d'étranglement n'est plus la facture du modèle — c'est le raccordement à votre boîte mail et la décision de ce qu'il a le droit d'envoyer.

Des fiches produits en trois langues. Réécrire 500 descriptions de produits en français, allemand et néerlandais représente de l'ordre de 600 000 tokens en sortie — quelques dollars sur un modèle économique, peut-être 15 à 20 dollars sur un modèle de pointe. Il y a un an, ce travail en qualité maximale était une ligne budgétaire ; c'est désormais le prix d'une tournée de cafés.

Réunions et appels. Résumer chaque appel commercial et chaque visite de chantier — des heures de transcription par semaine — coûte quelques centimes aux tarifs Flash. Les tâches à fort volume et à faible enjeu sont exactement là où l'effondrement des prix mord en premier.

Abonnement ou API ?

Pour une petite entreprise, le partage est simple. Les humains prennent un abonnement. Une formule autour de 20 euros par mois vous donne, à vous et à votre équipe, une interface de discussion, la gestion de fichiers et les modèles les plus récents, avec une facture prévisible — pour un usage interactif quotidien, c'est presque toujours la meilleure affaire. Les logiciels passent par l'API. Dès qu'une tâche tourne sans humain dans la boucle — rédiger des réponses, classer des commandes, résumer des appels — on paie au token. Comme le montrent les calculs ci-dessus, les volumes typiques d'une PME s'y chiffrent désormais en quelques euros par mois. Beaucoup d'entreprises combinent judicieusement les deux : un abonnement pour le dirigeant, une clé API derrière un flux automatisé.

Ne vous mariez pas avec un fournisseur

Quatre modèles Claude 5 en moins de deux mois, selon Axios. Deux mouvements de prix chez Google en un seul été. Un modèle ouvert record venu de Pékin entre les deux. Sur un marché où l'on se dépasse toutes les quelques semaines, l'erreur coûteuse est de câbler votre entreprise sur le modèle et la grille tarifaire d'un seul fournisseur. Documentez vos prompts et vos instructions dans un endroit portable, préférez les outils qui permettent de changer de modèle sous-jacent, et remettez vos charges de travail en concurrence chaque trimestre, comme vous le feriez pour un contrat d'énergie. Et ne bâtissez jamais un business case sur un tarif de lancement dont la date d'expiration est publiée.

Quand la baisse des prix ne change rien

La chute du prix des tokens ne corrige qu'une seule ligne du budget d'un projet. L'intégration, le nettoyage de vos données et les heures que votre équipe passe à changer ses habitudes coûtent généralement plus cher que le modèle ne coûtera jamais — et rien de tout cela n'a baissé en juillet. Si une tâche n'a pas de volume — une poignée de devis par semaine — l'économie se compte en centimes, et le bon outil est l'abonnement à 20 euros que vous avez peut-être déjà. Si un pilote a échoué l'an dernier pour des raisons de qualité, une baisse de prix ne résout rien : retestez la capacité. Et vos devoirs RGPD — quelles données quittent vos systèmes, sous quel accord — sont identiques à tous les niveaux de prix.

Ce que la vague de juillet change vraiment, c'est la liste des idées qui méritent un essai : votre présélection d'il y a un an a été chiffrée sur un marché qui n'existe plus. Si vous voulez déterminer où l'IA a réellement sa place dans votre entreprise avant de dépenser quoi que ce soit, le Scan de Maturité IA de Cresly confronte vos processus à ce que savent faire les modèles actuels — à des prix qui, depuis ce mois-ci, valent la moitié de ce que vous imaginiez sans doute.

AI pricingClaude Opus 5Geminiopen-weight modelsSMEAPI costs
C
The Cresly Team
AI Studio for European Businesses