Bedrijven kiezen bij taalmodellen steeds vaker per taak het model dat het best past. De wedloop draait namelijk steeds minder om de vraag wie het krachtigste systeem heeft, en steeds meer om welk model bij een specifieke opdracht de beste mix biedt van kwaliteit, snelheid, prijs en controle.
Dat zie je direct terug op de factuur. De prijs per token is weliswaar gedaald, maar bij grootschalig gebruik lopen de totale maandkosten juist op tot in de miljoenen, vooral omdat moderne agents per opdracht veel meer tokens verbruiken dan eenvoudige chattoepassingen.
De markt voor taalmodellen is dus allang meer dan een prestigestrijd. Alleen al daarom loont het om dit goed te volgen.
Het gaat hier ook niet om één model dat alles wint. Waar het om draait, is hoe je als bedrijf inkoopt en hoe je verzoeken routeert. Die verschuiving in de markt betekent concreet:
- voor klantenservicebots, samenvattingstools en interne zoekassistenten heb je vaak geen topscore op een benchmark nodig, zolang een kleiner model hetzelfde werk snel, betrouwbaar en goedkoper kan afhandelen
- daarmee verandert ook het inkoopcriterium: niet meer “het grootste model wint”, maar “het juiste model voor de juiste taak”, zolang een systeem voorspelbaar presteert en binnen budget blijft
- een topmodel trainen is ook simpelweg veel duurder: OpenAI’s GPT-4 kostte meer dan 100 miljoen om te ontwikkelen, terwijl kleinere taalmodellen voor minder dan 10 miljoen gebouwd kunnen worden
- ook tijdens het gebruik lopen de verschillen flink op: een verzoek op een compact model als Mistral 7B kan meer dan 200 keer goedkoper zijn dan op OpenAI’s GPT-4
- verwerk je honderdduizenden of miljoenen verzoeken per dag, dan tellen zulke prijsverschillen meteen zwaar mee en neemt de druk toe om niet voor elke taak hetzelfde zware model in te zetten
- daarom bouwen steeds meer bedrijven een architectuur met meerdere modellen naast elkaar, waarbij automatische routing iedere opdracht naar het model stuurt dat op dat moment het meest geschikt en het meest kostenefficiënt is
- een simpele classificatievraag kan prima naar een klein model, terwijl een complexe analyse juist naar een zwaarder systeem gaat
De echte concurrentiestrijd verschuift daarmee naar uitvoering en efficiëntie. Wie bruikbare resultaten het goedkoopst en het efficiëntst kan leveren, bouwt een voorsprong op. Daardoor worden orchestration, infrastructuur, governance en optimalisatie belangrijker dan alleen de ruwe kracht van een model.
Gartner verwacht bovendien dat enterprise-applicaties snel meer van dit soort gespecialiseerde agents krijgen: eind 2026 zou ongeveer 40% van de enterprise-applicaties ermee werken, tegenover minder dan 5% begin 2025. Intussen loopt de prijsdruk verder op.
Open modellen en goedkopere alternatieven, zoals Meta’s Llama en Alibaba’s Qwen, zijn inmiddels allebei meer dan 1 miljard keer gedownload. Tegelijk schuiven goedkopere Chinese systemen snel op richting de Amerikaanse koplopers. Voor standaardoutput wordt het daardoor steeds lastiger om hoge tarieven te blijven vragen.
Samen versterkt dat de beweging naar software op maat, in plaats van zoveel mogelijk schaal. Onderzoek laat zien dat de modelgrootte die nodig is om een bepaalde benchmark te halen tussen 2022 en 2024 met een factor 142 is gedaald. Met andere woorden: kleiner kan steeds vaker hetzelfde werk aan.
Palo Alto Networks-topman Nikesh Arora zei het scherp: tokenprijzen moeten mogelijk nog eens tot 90% dalen voordat grootschalige adoptie echt doorzet. Voor leveranciers is de boodschap helder. De markt beloont niet langer automatisch het grootste model, maar vooral degene die bruikbare output het efficiëntst weet te leveren.