Zurück
Kevin Riedl

9 Min Lesezeit · 25. Juni 2026
Zuletzt geprüft

Weiter
Entsteht auf deinem Gerät, ohne Instagram-Verbindung. Den Beitragslink kopieren wir für deinen Link-Sticker.

Beste Open-Weight-LLMs 2026: DeepSeek vs Qwen vs Kimi vs GLM vs Llama

Es gibt kein universell bestes Open-Weight-Modell. Am 2. September 2026 bietet DeepSeek V4 zwei sehr große MIT-lizenzierte Tiers, Qwen3.8 einen multimodalen 27B-Checkpoint unter Apache 2.0 und ein 2,4T-Sparse-Modell unter eigener Max-Lizenz, Kimi K3 native Multimodalität mit einem 1M-Token-Fenster unter eigener Lizenz, GLM-5.3 langes Coding unter einer neuen permissiven eigenen Lizenz und Llama 4 breites Tooling, aber keine multimodalen Lizenzrechte für EU-basierte Entwickler.

"Open Weight" bedeutet nur, dass die Gewichte heruntergeladen werden können. Es garantiert weder eine von der Open Source Initiative anerkannte Lizenz noch niedrige Hardwarekosten, identisches Verhalten von Hosting und Self-Hosting oder brauchbare Qualität am maximal beworbenen Kontext. Erstelle die Shortlist nach exaktem Checkpoint und Lizenz und teste dann deine Aufgaben.

Engineering-Perspektive, kein Vendor-Pitch. Wir haben offizielle Model Cards, Repositories und Lizenztexte am 2. September 2026 geprüft. Benchmark-Tabellen der Anbieter sind nützliche Release-Evidenz, aber unterschiedliche Harnesses und Einstellungen ergeben keinen neutralen Sieger.

Brauchst du eine Shortlist für Tasks, EU-Grenzen und GPU-Budget?

 Modelle für meinen Workload auswählen

Was unterscheidet die aktuellen Familien?

  • DeepSeek V4. Die aktuellen offiziellen Repositories enthalten V4 Flash-0731 und V4 Pro-0813. Beide sind MIT-lizenziert. Die ursprüngliche V4-Model-Card dokumentiert 1M Kontext und Sparse-Architekturen; die datierten Checkpoints ersetzen die Preview-Versionen.
  • Qwen3.8. Alibabas offizielle Qwen3.8-Collection umfasst ein multimodales 27B-Modell und ein Sparse-Modell mit 2,4T Gesamt- und 95B aktiven Parametern. Die 27B-Card nennt 262.144 native Tokens, eine Erweiterung auf 1M mit YaRN und Apache 2.0. Der 2,4T-Checkpoint nutzt die Qwen3.8-Max-Lizenz mit Bedingungen für sehr große Produkte sowie große MaaS- oder KI-Arbeitsassistenten-Anbieter. Die Erweiterung ist eine Serving-Konfiguration, kein Qualitätsnachweis bei 1M.
  • Kimi K3. Moonshots Model Card nennt 2,8T Gesamt- und 104B aktive Parameter, native Text-, Bild- und Videoeingabe sowie 1M Kontext. Die Kimi-K3-Lizenz ergänzt Bedingungen für große Model-as-a-Service-Anbieter und sehr große kommerzielle Produkte, nimmt interne Nutzung aber von diesen Zusatzbedingungen aus.
  • GLM-5.3. Z.ai veröffentlichte GLM-5.3 nach GLM-5.2. Es nutzt dasselbe 753B-Basismodell, wird mit bis zu 1M Kontext evaluiert und ändert das Post-Training für Coding und lange Aufgaben. Die GLM-5.3-Lizenz ist permissiv, aber nicht als MIT ausgewiesen. Die frühere MIT-Aussage gilt daher nicht für den aktuellen Checkpoint.
  • Llama 4. Metas Model Card nennt für Scout 109B Gesamt- und 17B aktive Parameter bei 10M Kontext, für Maverick 400B Gesamt- und 17B aktive Parameter bei 1M. Die Use Policy gewährt EU-ansässigen Personen und Unternehmen mit Hauptsitz in der EU keine multimodalen Rechte. Endnutzer eines Produkts, das die Modelle integriert, sind ausdrücklich ausgenommen.

Soofi S gehört in eine andere Kategorie. Unser Soofi-S-Käufercheck trennt öffentliche Evidenz von Release-Plänen. Unser Kimi-K3-API-Review behandelt Moonshots gehosteten Dienst als separate Beschaffungsentscheidung gegenüber den herunterladbaren Gewichten.

Größe, Kontext, Lizenz und Deployment

FamilieAktueller Beispiel-CheckpointVeröffentlichte GrößeKontextGewichtslizenzDeployment-Folge
DeepSeekV4 Flash-0731 / Pro-0813304B / 1,7T gesamtV4-Familie: 1MMITGroßes Multi-GPU-Deployment; exaktes Gewichtsformat kalkulieren
QwenQwen3.8-27B / 2.4T-A95B27B dense / 2,4T gesamt, 95B aktiv27B: 262.144 nativ, auf 1M erweiterbarApache 2.0 / Qwen3.8-Max-Lizenz27B ist deutlich leichter; 2,4T ist Cluster-Größe
KimiKimi K32,8T gesamt / 104B aktiv1MKimi-K3-LizenzCluster-Größe plus Lizenzprüfung
GLMGLM-5.3753B gesamt1MGLM-5.3-LizenzErnsthaftes Multi-GPU- oder experimentelles Offload-Serving
LlamaLlama 4 Scout / Maverick109B / 17B aktiv; 400B / 17B aktiv10M / 1MLlama-4-Community-LizenzEU-Entwicklerbeschränkung zuerst klären

Das sind maximale Kontextangaben, keine Qualitätsgarantien. Lange Sequenzen erhöhen den KV-Cache-Bedarf und können die Parallelität senken. Quantisierung verändert Speicherbedarf und mitunter die Ausgabequalität. Leite ohne Angaben zu Präzision, Runtime, Kontext, Batchgröße und Redundanz keine feste GPU-Zahl aus Parametern ab.

Welche Familie solltest du für Coding und Agents testen?

Die Primärquellen stützen eine Shortlist, kein universelles Ranking. Die Cards von DeepSeek Flash-0731, Qwen3.8, Kimi K3 und GLM-5.3 veröffentlichen Coding- und Agent-Benchmarks, nutzen aber unterschiedliche Harnesses, Reasoning-Einstellungen, Task-Versionen und teils interne Tests. Vergleiche Zahlen nur bei gleichem Task, Split, Harness, Toolzugang und Scoring.

  • Überschaubares multimodales Self-Hosting: Starte mit Qwen3.8-27B, wenn Apache 2.0, 27B-Größe und 262K nativer Kontext passen.
  • Große Coding- oder Tool-Evals: Teste DeepSeek V4 Flash-0731, GLM-5.3 und Kimi K3 auf Task-Abschluss, Recovery, Latenz und gesamte Serving-Kosten.
  • Sehr langer Kontext: Teste Retrieval und Task-Abschluss bei deinen echten Längen. 1M oder 10M sagt nur, welche Eingabe akzeptiert wird.
  • Llama 4 in der EU: Lass die Rechtslage prüfen, bevor Entwickler die multimodalen Gewichte laden oder deployen. Die Endnutzer-Ausnahme ist keine Entwicklerlizenz.
Kevin Riedl

"Eine Model Card sagt dir, was du unter welcher Lizenz testen kannst. Dein eigener Eval sagt dir, was du ausliefern solltest. Halte diese Entscheidungen getrennt."

Kannst du diese Modelle in der EU self-hosten?

DeepSeek V4 und Qwen3.8-27B nutzen permissive Standardlizenzen. Qwen3.8-2.4T-A95B, GLM-5.3 und Kimi K3 gewähren breite Rechte unter modellspezifischen Texten mit separat zu prüfenden Bedingungen. Llama 4 ist der Ausreißer: Die Policy verweigert EU-basierten Entwicklern multimodale Rechte, enthält aber eine Ausnahme für Endnutzer integrierender Produkte.

Self-Hosting kann Inferenz in einer EU-kontrollierten Umgebung halten, beweist aber nicht automatisch DSGVO-Konformität. Erforderlich bleiben Rechtsgrundlage, Datenminimierung, Löschfristen, Zugriffskontrollen, Auftragsverarbeiter- und Transferprüfung, Logging-Regeln und Incident-Prozess. Ein Hosted Endpoint ist wegen serviceabhängigem Datenstandort und Vertrag getrennt zu bewerten.

Ein belastbarer Auswahlprozess

  1. Nenne den exakten Checkpoint. Familiennamen verdecken Unterschiede bei Gewichten, Modalitäten, Kontext und Lizenz.
  2. Kläre Lizenz und Jurisdiktion. Dokumentiere die Lizenzrevision und hole bei folgenreichen Deployments Rechtsrat ein.
  3. Kalkuliere die echte Serving-Konfiguration. Berücksichtige Präzision, Kontext, Parallelität, Runtime-Overhead, Redundanz und Netzwerktopologie.
  4. Fahre denselben privaten Eval. Nutze repräsentative Aufgaben, stabile Prompts, gleichen Toolzugang und klare Pass-Kriterien für mindestens zwei Kandidaten.
  5. Pinne und überwache. Dokumentiere Gewichtsrevision, Tokenizer, Runtime, Quantisierung und Sicherheitskonfiguration.

Warum der Eval-Harness zählt

Öffentliche Benchmarks können durch Kontamination, Overfitting und Harness-Effekte verzerrt sein. Vor allem sind sie nicht dein Workload. Einige Dutzend repräsentative Aufgaben mit klaren Pass-Kriterien zeigen Fehler, die ein Gesamt-Score verdeckt. Miss Task-Abschluss, Latenz, Kosten, Toolfehler, Long-Context-Retrieval und Recovery.

Fazit

Am 2. September 2026 umfasst der aktuelle Vergleich DeepSeek V4 mit den datierten 0731- und 0813-Checkpoints, Qwen3.8, Kimi K3, GLM-5.3 und Llama 4. Qwen3.8-27B ist der zugänglichste benannte Checkpoint dieser Auswahl; die größten Qwen-, DeepSeek-, Kimi- und GLM-Tiers erfordern Cluster-Planung. Qwen3.8-Max, Kimi und GLM nutzen modellspezifische Lizenzen, und Llama 4s EU-Beschränkung für multimodale Entwickler bleibt entscheidend.

Wähle den kleinsten rechtlich deploybaren Checkpoint, der deinen Eval besteht. Kontextlänge ist eine zu validierende Grenze, Anbieter-Benchmarks sind Release-Evidenz statt neutrales Ranking, und Hosted APIs sind andere Compliance-Produkte als herunterladbare Gewichte.

Hilfe für KI in Produktion

Du baust ein KI-Produkt und machst dir Sorgen um Inference-Kosten, Architektur oder Production Readiness? Wavect hilft Gründern, KI-Prototypen in zuverlässige Produktionssysteme zu verwandeln.

Passender Service:

Postfach, ohne Lärm

Folge der Arbeit, die für dich zählt

Du bekommst eine kurze E-Mail, wenn wir etwas Neues veröffentlichen. Folge dem ganzen Blog oder nur den Themen, die dich interessieren.

Was möchtest du erhalten?
Themen auswählen

Kostenlos, Double-Opt-in, ohne Tracking-Pixel.

Zurück
Kevin Riedl

9 Min Lesezeit · 25. Juni 2026
Zuletzt geprüft

Weiter

Erhalte die nächste Feldnotiz zu AI und Agents

Eine kurze E-Mail, wenn wir veröffentlichen. Ohne Tracking-Pixel und ohne Postfachfüller.

Kostenlos, Double-Opt-in, ohne Tracking-Pixel.