Alle artikelen / AI-modellen · 28 januari 2025 · 6 min leestijd
Is DeepSeek de hype waard?
DeepSeek R1 activeert voor elke taak slechts 37 miljard van zijn 671 miljard parameters. Wat deze doorbraak in efficiëntie werkelijk betekent voor bedrijven die met AI bouwen, en waarom het de economie ervan volledig verandert.
Geschreven door Engineeringteam van SIEL AI · Gepubliceerd 28 januari 2025

Een paar maanden geleden schreven we dat de volgende winst bij LLM's van slimmere modellen zou komen, niet van grotere. DeepSeek R1 is nu de perfecte bevestiging van dat standpunt. Hun doorbraak is niet alleen indrukwekkend. Hij verandert hoe we over efficiëntie denken.
Efficiëntie ontmoet intelligentie
Op het eerste gezicht lijkt DeepSeek R1 met zijn 671 miljard parameters gewoon het zoveelste enorme model. Maar hier zit de twist: voor elke afzonderlijke taak activeert het slechts 37 miljard parameters. Dat wordt mogelijk gemaakt door zijn Mixture-of-Experts-systeem. In plaats van het hele model op elk probleem los te laten, werkt het als een zeer efficiënt team van specialisten en stuurt het taken dynamisch naar de meest relevante expert binnen het model.
Het resultaat is een uitzonderlijke kostenefficiëntie. Inputtokens kosten $0,55 per miljoen, outputtokens $2,19 per miljoen. De operationele kosten van DeepSeek liggen ruwweg 95% lager dan het huidige aanbod van OpenAI. Dit is geen kleine verbetering. Het verandert de economie van AI-deployments fundamenteel.
Open en toegankelijk
Wat DeepSeek echt onderscheidt, is de toewijding aan openheid. De code van het model is open source onder een MIT-licentie. Iedereen kan erbij, kan hem aanpassen en erop voortbouwen. In een sector die vaak bekritiseerd wordt om haar ondoorzichtigheid is dit een gedurfde stap die innovatie zal versnellen.
Hoe ze het gebouwd hebben
Het trainingsproces van DeepSeek R1 is een masterclass in optimalisatie, naar verluidt gerealiseerd voor minder dan $6 miljoen. Hun aanpak in vier stappen: beginnen met een voorgetraind basismodel, reinforcement learning gebruiken om redeneervaardigheden te ontwikkelen, de output opschonen met supervised fine-tuning, en dan nog een RL-ronde toepassen gericht op wiskunde, logica en programmeren. Ten slotte distilleren ze deze capaciteiten in compacte versies van 1,5B tot 70B parameters, waardoor geavanceerd redeneren toegankelijk wordt op alledaagse hardware.
Wat dit betekent voor bedrijven
Voor start-ups en kleinere bedrijven verandert dit de rekensom. Concurrerende prestaties tegen ruwweg 5% van de gebruikelijke modelkosten brengen werk binnen bereik dat eerder simpelweg niet te financieren was. Voor grotere organisaties telt de besparing minder als toegang en meer als ruimte om verschillende dingen te proberen voordat er één werkt.
Het praktische gevolg dat we in klantwerk zien, is dat de modelkeuze niet langer de dure beslissing is. Zodra inferentie goedkoop is, verschuiven de kosten en het risico allebei naar alles rond het model: de data waarin u het verankert, de vangrails die u eromheen zet en de workflow waarin u het inbouwt.
De uitdagingen
Het gaat niet allemaal van een leien dakje. Twee belangrijke hindernissen springen eruit: vertrouwen en veiligheid in hun modellen waarborgen, en omgaan met beperkingen in hardwaretoegang door exportcontroles. De complexiteit rond censuur voegt nog een laag toe. Maar deze beperkingen zouden juist meer innovatie kunnen aanjagen. DeepSeek heeft al bewezen dat uitdagingen tot doorbraken kunnen leiden.
De hype waard?
Op basis van onze praktijkbeoordeling is DeepSeek R1 de echte deal. Maar misschien niet om de redenen die de krantenkoppen halen. De werkelijke betekenis ligt niet in benchmarkscores, maar in hoe het fundamentele aannames over het trainen van LLM's ter discussie stelt. De vraag is niet of deze aanpak werkt. Dat heeft DeepSeek al bewezen. De vraag is hoe snel andere aanbieders en bedrijven zich aanpassen.
Vaste prijs, afgesproken voordat we beginnen. Een senior engineer antwoordt binnen twee werkdagen.