Op vrijdag 24 juli bracht Anthropic Claude Opus 5 uit, geprijsd op 5 dollar per miljoen input-tokens en 25 dollar per miljoen output — in de woorden van het bedrijf zelf: bijna de intelligentie van topmodel Fable 5, voor de helft van de prijs. Drie dagen eerder had Google het prijskaartje van zijn Gemini Flash-lijn ruwweg gehalveerd. Twee dagen later zette het Chinese Moonshot AI het grootste open-weight model ooit online, voor iedereen te downloaden. Heb je vorig jaar een AI-project voor je bedrijf doorgerekend en in de la gelegd omdat de cijfers niet klopten? Dan is die offerte nu achterhaald.
Eén week, drie prijssignalen
Anthropic. Claude Opus 5 verscheen op 24 juli tegen hetzelfde tarief als voorganger Opus 4.8, maar met duidelijk meer capaciteiten — volgens Axios benadert het op veel taken Anthropics topmodel Fable 5, voor de helft van diens prijs. Het is het vierde Claude 5-model in nog geen twee maanden, het wordt de standaard voor Claude Max-abonnees, en het heeft een "effort"-knop die een beetje kwaliteit inruilt voor een fors lagere rekening bij routinewerk.
Google. Op 21 juli verscheen Gemini 3.6 Flash met een introductieprijs van 0,75 dollar per miljoen input-tokens en 3,75 dollar per miljoen output — een fractie van de 1,50 en 9 dollar die Gemini 3.5 Flash bij de lancering in mei rekende. De kleine lettertjes doen ertoe: volgens Google loopt het introductietarief af op 31 december 2026, waarna het verdubbelt.
Moonshot AI. Enkele dagen na de Opus-lancering zette Moonshot de weights van Kimi K3 op Hugging Face: 2,8 biljoen parameters, een contextvenster van een miljoen tokens en een aangepaste MIT-licentie die gratis commercieel gebruik toestaat voor vrijwel elk gewoon bedrijf. De vakpers noemde het breed het grootste open-weight model uit de geschiedenis. Zelf draaien zul je het waarschijnlijk nooit — zelf hosten vraagt zo'n 1,5 terabyte opslag — maar alleen al het bestaan ervan houdt de druk op ieders prijslijst.
Tel daar OpenAI's GPT-5.6 bij op, uitgebracht op 9 juli in drie varianten, en het patroon is duidelijk. Dit is niet één leverancier met een actie. Dit is de hele markt die opnieuw zijn prijzen bijstelt.
De curve achter de krantenkoppen
Stanfords AI Index volgde wat een vast capaciteitsniveau kost — prestaties vergelijkbaar met de originele ChatGPT — en zag de prijs dalen van 20 dollar per miljoen tokens in november 2022 naar 0,07 dollar in oktober 2024. Een deling door 280 in nog geen twee jaar. Hetzelfde rapport merkt op dat inferentieprijzen van taalmodellen, afhankelijk van de taak, jaarlijks 9 tot 900 keer dalen; onderzoeksgroep Epoch AI schat de daling op zo'n 40 keer per jaar bij GPT-4-kwaliteit. Concurrentie doet een deel van het werk: het Chinese DeepSeek rekent voor zijn redeneermodel R1 0,55 dollar input en 2,19 dollar output per miljoen tokens — een fractie van wat westerse redeneermodellen een jaar eerder kostten.
De richting staat vast, maar losse prijskaartjes niet. Googles aflopende introductietarief is een herinnering dat "goedkoop" soms "goedkoop tot januari" betekent. De eerlijke samenvatting: elk gegeven capaciteitsniveau wordt spectaculair goedkoper, terwijl leveranciers bovenin steeds nieuwe, duurdere dingen blijven verkopen.
Wat nu wél uit kan
Een miljoen tokens is grofweg 750.000 woorden. Tegen de prijzen van medio 2026 worden projecten die in 2025 buitensporig leken, afrondingsverschillen.
Klantmails, voorgeschreven. Stel: je webshop in Gent beantwoordt 2.000 klantberichten per maand, en een model leest per antwoord zo'n 600 tokens en schrijft er 400. Dat is 1,2 miljoen input- en 0,8 miljoen output-tokens: ongeveer 26 dollar per maand op een topmodel als Opus 5, en minder dan 4 dollar op Gemini 3.6 Flash. De bottleneck is niet langer de modelrekening — het is de koppeling met je inbox en de vraag wat het model zelfstandig mag versturen.
Productteksten in drie talen. 500 productbeschrijvingen herschrijven in het Frans, Duits en Nederlands is in de orde van 600.000 output-tokens — een paar dollar op een budgetmodel, misschien 15 tot 20 dollar op een topmodel. Een jaar geleden was diezelfde klus op topkwaliteit een begrotingspost; nu is het een rondje koffie.
Vergaderingen en telefoontjes. Elk verkoopgesprek en werfbezoek samenvatten — uren transcript per week — kost centen tegen Flash-tarieven. Taken met veel volume en weinig risico: precies daar bijt de prijsdaling het eerst.
Abonnement of API?
Voor een klein bedrijf is de verdeling simpel. Mensen nemen een abonnement. Een vast plan van rond de 20 euro per maand geeft jou en je team een chatinterface, bestandsverwerking en de nieuwste modellen, met een voorspelbare factuur — voor dagelijks interactief gebruik is dat vrijwel altijd de betere deal. Software gebruikt de API. Zodra een taak zonder mens in de lus draait — antwoorden opstellen, bestellingen labelen, gesprekken samenvatten — betaal je per token. Zoals de sommen hierboven laten zien, kosten typische mkb-volumes daar nu enkele euro's per maand. Veel bedrijven combineren verstandig beide: één abonnement voor de zaakvoerder, één API-sleutel achter één geautomatiseerde workflow.
Trouw niet met één leverancier
Vier Claude 5-modellen in minder dan twee maanden, aldus Axios. Twee prijsbewegingen bij Google in één zomer. Daartussenin een recordmodel met open weights uit Peking. In een markt waar men elkaar om de paar weken voorbijsteekt, is de dure fout je bedrijf vast te klinken aan het model en de prijslijst van één aanbieder. Documenteer je prompts en instructies op een overdraagbare plek, kies tools waarmee je het onderliggende model kunt wisselen, en vraag elk kwartaal opnieuw offertes op voor je werklast — zoals je ook met een energiecontract zou doen. En bouw nooit een businesscase op een introductietarief met een gepubliceerde einddatum.
Wanneer goedkoper niets oplost
Dalende tokenprijzen repareren precies één regel van een projectbudget. Integratiewerk, het opschonen van je data en de uren die je team steekt in anders werken, kosten doorgaans meer dan het model ooit zal doen — en daar is in juli niets goedkoper aan geworden. Heeft een taak geen volume — een handvol offertes per week — dan tellen de besparingen in centen, en is het juiste gereedschap dat abonnement van 20 euro dat je misschien al hebt. Strandde je pilot vorig jaar op kwaliteit, dan lost een prijsverlaging niets op: test de capaciteit opnieuw. En je AVG-huiswerk — welke data je systemen verlaten, onder welke overeenkomst — is op elk prijsniveau identiek.
Wat de prijsgolf van juli echt verandert, is welke ideeën een test waard zijn: je shortlist van een jaar geleden was doorgerekend op een markt die niet meer bestaat. Wil je uitzoeken waar AI werkelijk past in jouw bedrijf voordat je ook maar iets uitgeeft, dan brengt de AI Readiness Scan van Cresly je processen in kaart tegenover wat de huidige modellen kunnen — tegen prijzen die sinds deze maand de helft zijn van wat je waarschijnlijk aannam.