Alle Beiträge / KI-Modelle · 28. Januar 2025 · 6 min Lesezeit
Ist DeepSeek den Hype wert?
DeepSeek R1 aktiviert für jede Aufgabe nur 37 Milliarden seiner 671 Milliarden Parameter. Was dieser Effizienzdurchbruch für Unternehmen, die mit KI bauen, tatsächlich bedeutet, und warum er die Wirtschaftlichkeit komplett verändert.
Geschrieben von Engineering-Team von SIEL AI · Veröffentlicht 28. Januar 2025

Vor ein paar Monaten haben wir geschrieben, dass die nächsten Fortschritte bei LLMs von klügeren Modellen kommen würden, nicht von größeren. DeepSeek R1 ist jetzt die perfekte Bestätigung dieser Sichtweise. Ihr Durchbruch ist nicht nur beeindruckend. Er verändert grundlegend, wie wir über Effizienz denken.
Effizienz trifft Intelligenz
Auf den ersten Blick wirkt DeepSeek R1 mit seinen 671 Milliarden Parametern wie ein weiteres riesiges Modell. Aber hier kommt die Wendung: Für jede einzelne Aufgabe aktiviert es nur 37 Milliarden Parameter. Möglich macht das sein Mixture-of-Experts-System. Statt das gesamte Modell auf jedes Problem loszulassen, arbeitet es wie ein hocheffizientes Team von Spezialisten und leitet Aufgaben dynamisch an den passendsten Experten innerhalb des Modells weiter.
Das Ergebnis ist eine außergewöhnliche Kosteneffizienz. Input-Tokens kosten 0,55 $ pro Million, Output-Tokens 2,19 $ pro Million. Die Betriebskosten von DeepSeek liegen rund 95 % unter denen der aktuellen Angebote von OpenAI. Das ist keine kleine Verbesserung. Es verändert die Wirtschaftlichkeit von KI-Deployments von Grund auf.
Offen und zugänglich
Was DeepSeek wirklich abhebt, ist das Bekenntnis zur Offenheit. Der Code des Modells ist Open Source unter einer MIT-Lizenz. Jeder kann darauf zugreifen, ihn verändern und darauf aufbauen. In einer Branche, die oft für ihre Intransparenz kritisiert wird, ist das ein mutiger Schritt, der Innovation beschleunigen wird.
Wie sie es gebaut haben
Der Trainingsprozess von DeepSeek R1 ist ein Lehrstück in Optimierung, Berichten zufolge für unter 6 Millionen $ umgesetzt. Ihr vierstufiger Ansatz: mit einem vortrainierten Basismodell starten, per Reinforcement Learning Reasoning-Fähigkeiten entwickeln, die Ausgaben mit Supervised Fine-Tuning bereinigen und dann eine weitere RL-Runde mit Fokus auf Mathematik, Logik und Programmierung anschließen. Zum Schluss destillieren sie diese Fähigkeiten in kompakte Versionen von 1,5B bis 70B Parametern, wodurch fortgeschrittenes Reasoning auf Alltagshardware zugänglich wird.
Was das für Unternehmen bedeutet
Für Start-ups und kleinere Unternehmen verändert das die Rechnung. Konkurrenzfähige Leistung zu rund 5 % der üblichen Modellkosten macht Arbeit erreichbar, die vorher schlicht nicht finanzierbar war. Für größere Organisationen zählt die Ersparnis weniger als Zugang, sondern als Spielraum, mehrere Dinge auszuprobieren, bevor eines davon funktioniert.
Die praktische Konsequenz, die wir in der Kundenarbeit sehen: Die Modellwahl ist nicht länger die teure Entscheidung. Sobald Inferenz günstig ist, wandern Kosten und Risiko in alles rund um das Modell: die Daten, in denen Sie es verankern, die Leitplanken, die Sie ihm setzen, und den Workflow, in den Sie es einbinden.
Die Herausforderungen
Es läuft nicht alles glatt. Zwei zentrale Hürden stechen heraus: Vertrauen und Sicherheit in den Modellen sicherzustellen und mit den Beschränkungen beim Hardwarezugang durch Exportkontrollen umzugehen. Die Komplexität rund um Zensur kommt als weitere Ebene hinzu. Aber diese Einschränkungen könnten tatsächlich noch mehr Innovation antreiben. DeepSeek hat bereits bewiesen, dass Herausforderungen Durchbrüche auslösen können.
Den Hype wert?
Nach unserer praktischen Bewertung ist DeepSeek R1 das Echte. Aber vielleicht nicht aus den Gründen, die Schlagzeilen machen. Seine eigentliche Bedeutung liegt nicht in Benchmark-Werten, sondern darin, wie es grundlegende Annahmen über das Training von LLMs infrage stellt. Die Frage ist nicht, ob dieser Ansatz funktioniert. Das hat DeepSeek bereits bewiesen. Die Frage ist, wie schnell andere Anbieter und Unternehmen sich anpassen.
Festpreis, vereinbart bevor wir anfangen. Ein Senior Engineer antwortet innerhalb von zwei Werktagen.