In diesem Beitrag
Open-Weight-LLMs 2026: DeepSeek, Qwen, Kimi, GLM, Llama und Muse
Es gibt kein universell bestes Open-Weight-Modell. Diese Auswahl wurde am 5. Oktober 2026 geprüft. Sie umfasst DeepSeek V4, die sehr unterschiedlichen Qwen3.8-Größen und Lizenzen, Kimi K3, GLM-5.3, Llama 4 und Metas Muse Glimmer-30B. Für lokale Agent-Evaluierungen auf einer Workstation vergleiche Qwen3.8-27B mit Muse Glimmer-30B. Die EU-Entwicklerbeschränkung von Llama 4 für multimodale Modelle gilt nicht automatisch für Muses separate Apache-2.0-Veröffentlichung.
"Open Weight" bedeutet nur, dass die Gewichte heruntergeladen werden können. Es garantiert weder eine von der Open Source Initiative anerkannte Lizenz noch niedrige Hardwarekosten, identisches Verhalten von Hosting und Self-Hosting oder brauchbare Qualität am maximal beworbenen Kontext. Erstelle die Shortlist nach exaktem Checkpoint und Lizenz und teste dann deine Aufgaben.
Dies ist eine geprüfte Kaufauswahl, kein Anspruch auf eine vollständige Liste aller neuesten Modelle. Die genannten Checkpoints und Lizenzquellen wurden am 5. Oktober 2026 geprüft; das zuvor fehlende Muse Glimmer wurde ergänzt. Anbieter-Benchmarks dokumentieren deren eigene Testkonfiguration, kein neutrales Gesamtranking oder einen Wavect-Test.
Brauchst du eine Shortlist für Tasks, EU-Grenzen und GPU-Budget?
Modelle für meinen Workload auswählenWas unterscheidet die aktuellen Familien?
- DeepSeek V4. Die aktuellen offiziellen Repositories enthalten V4 Flash-0731 und V4 Pro-0813. Beide sind MIT-lizenziert. Die ursprüngliche V4-Model-Card dokumentiert 1M Kontext und Sparse-Architekturen; die datierten Checkpoints ersetzen die Preview-Versionen.
- Qwen3.8. Alibabas offizielle Qwen3.8-Collection umfasst ein multimodales 27B-Modell und ein Sparse-Modell mit 2,4T Gesamt- und 95B aktiven Parametern. Die 27B-Card nennt 262.144 native Tokens, eine Erweiterung auf 1M mit YaRN und Apache 2.0. Der 2,4T-Checkpoint nutzt die Qwen3.8-Max-Lizenz mit Bedingungen für sehr große Produkte sowie große MaaS- oder KI-Arbeitsassistenten-Anbieter. Die Erweiterung ist eine Serving-Konfiguration, kein Qualitätsnachweis bei 1M.
- Kimi K3. Moonshots Model Card nennt 2,8T Gesamt- und 104B aktive Parameter, native Text-, Bild- und Videoeingabe sowie 1M Kontext. Die Kimi-K3-Lizenz ergänzt Bedingungen für große Model-as-a-Service-Anbieter und sehr große kommerzielle Produkte, nimmt interne Nutzung aber von diesen Zusatzbedingungen aus.
- GLM-5.3. Z.ai veröffentlichte GLM-5.3 nach GLM-5.2. Es nutzt dasselbe 753B-Basismodell, wird mit bis zu 1M Kontext evaluiert und ändert das Post-Training für Coding und lange Aufgaben. Die GLM-5.3-Lizenz ist permissiv, aber nicht als MIT ausgewiesen. Die frühere MIT-Aussage gilt daher nicht für den aktuellen Checkpoint.
- Llama 4. Metas Model Card nennt für Scout 109B Gesamt- und 17B aktive Parameter bei 10M Kontext, für Maverick 400B Gesamt- und 17B aktive Parameter bei 1M. Die Use Policy gewährt EU-ansässigen Personen und Unternehmen mit Hauptsitz in der EU keine multimodalen Rechte. Endnutzer eines Produkts, das die Modelle integriert, sind ausdrücklich ausgenommen.
- Muse Glimmer-30B. Metas offizielle Modellkarte nennt eine Veröffentlichung im August 2026 unter Apache 2.0, rund 29,6 Milliarden Gesamtparameter inklusive Wahrnehmungsencoder, Text- und Bildeingaben, Textausgabe und 131.072+ Kontexttoken. Das Modell zielt auf lokale Agent-Abläufe. Modell und Lizenz sind von Llama 4 getrennt; dessen Beschränkung wurde damit nicht aufgehoben.
Soofi S gehört in eine andere Kategorie. Unser Soofi-S-Käufercheck trennt öffentliche Evidenz von Release-Plänen. Unser Kimi-K3-API-Review behandelt Moonshots gehosteten Dienst als separate Beschaffungsentscheidung gegenüber den herunterladbaren Gewichten.
Größe, Kontext, Lizenz und Deployment
| Familie | Aktueller Beispiel-Checkpoint | Veröffentlichte Größe | Kontext | Gewichtslizenz | Deployment-Folge |
|---|---|---|---|---|---|
| DeepSeek | V4 Flash-0731 / Pro-0813 | 304B / 1,7T gesamt | V4-Familie: 1M | MIT | Großes Multi-GPU-Deployment; exaktes Gewichtsformat kalkulieren |
| Qwen | Qwen3.8-27B / 2.4T-A95B | 27B dense / 2,4T gesamt, 95B aktiv | 27B: 262.144 nativ, auf 1M erweiterbar | Apache 2.0 / Qwen3.8-Max-Lizenz | 27B ist deutlich leichter; 2,4T ist Cluster-Größe |
| Kimi | Kimi K3 | 2,8T gesamt / 104B aktiv | 1M | Kimi-K3-Lizenz | Cluster-Größe plus Lizenzprüfung |
| GLM | GLM-5.3 | 753B gesamt | 1M | GLM-5.3-Lizenz | Ernsthaftes Multi-GPU- oder experimentelles Offload-Serving |
| Llama | Llama 4 Scout / Maverick | 109B / 17B aktiv; 400B / 17B aktiv | 10M / 1M | Llama-4-Community-Lizenz | EU-Entwicklerbeschränkung zuerst klären |
| Muse | Muse Glimmer-30B | Rund 29,6 Mrd. insgesamt, dicht | 131,072+ | Apache 2.0 | Lokaler Agent-Kandidat; Quantisierung, Encoder und KV-Cache gemeinsam kalkulieren |
Das sind maximale Kontextangaben, keine Qualitätsgarantien. Lange Sequenzen erhöhen den KV-Cache-Bedarf und können die Parallelität senken. Quantisierung verändert Speicherbedarf und mitunter die Ausgabequalität. Leite ohne Angaben zu Präzision, Runtime, Kontext, Batchgröße und Redundanz keine feste GPU-Zahl aus Parametern ab.
Workstation-Kandidaten von Cluster-Betrieb trennen
Qwen3.8-27B und Muse Glimmer-30B haben andere Betriebsanforderungen als Checkpoints mit Billionen Parametern. Meta nennt 24 GB beziehungsweise 32 GB als Zielkonfigurationen für quantisierte Muse-Pakete und 64 GB für volle Präzision. Das sind Anbieterziele für bestimmte Konfigurationen, keine Zusage für jede Laufzeit, Kontextlänge oder parallele Last. Plane Reserven für KV-Cache, Bilder, einen möglichen Drafter und die Anwendung ein. Der Leitfaden für lokale Muse-Glimmer-Agenten behandelt die konkreten Pakete und Tests, statt diese Detailprüfung hier zu verdoppeln.
Welche Familie solltest du für Coding und Agents testen?
Die Primärquellen stützen eine Shortlist, kein universelles Ranking. Die Cards von DeepSeek Flash-0731, Qwen3.8, Kimi K3 und GLM-5.3 veröffentlichen Coding- und Agent-Benchmarks, nutzen aber unterschiedliche Harnesses, Reasoning-Einstellungen, Task-Versionen und teils interne Tests. Vergleiche Zahlen nur bei gleichem Task, Split, Harness, Toolzugang und Scoring.
- Für einen multimodalen Workstation-Agenten: Qwen3.8-27B und Muse Glimmer-30B direkt vergleichen. Beide konkreten Checkpoints verwenden Apache 2.0, unterscheiden sich aber bei Kontext, Werkzeugnutzung, Quantisierung und Laufzeitunterstützung.
- Große Coding- oder Tool-Evals: Teste DeepSeek V4 Flash-0731, GLM-5.3 und Kimi K3 auf Task-Abschluss, Recovery, Latenz und gesamte Serving-Kosten.
- Sehr langer Kontext: Teste Retrieval und Task-Abschluss bei deinen echten Längen. 1M oder 10M sagt nur, welche Eingabe akzeptiert wird.
- Llama 4 in der EU: Lass die Rechtslage prüfen, bevor Entwickler die multimodalen Gewichte laden oder deployen. Die Endnutzer-Ausnahme ist keine Entwicklerlizenz.

"Eine Model Card sagt dir, was du unter welcher Lizenz testen kannst. Dein eigener Eval sagt dir, was du ausliefern solltest. Halte diese Entscheidungen getrennt."
Kannst du diese Modelle in der EU self-hosten?
DeepSeek V4, Qwen3.8-27B und Muse Glimmer-30B nutzen für die genannten Gewichte permissive Standardlizenzen. Qwen3.8-2.4T-A95B, GLM-5.3 und Kimi K3 haben separat zu prüfende Modelllizenzen. Die multimodale Llama-4-Richtlinie schließt Entwicklerrechte für die bezeichneten EU-Nutzer aus und nimmt Endnutzer eines integrierenden Produkts aus. Diese Llama-Regel ist nicht Muses Lizenz. Keine Gewichtelizenz belegt für sich DSGVO-Konformität.
Self-Hosting kann Inferenz in einer EU-kontrollierten Umgebung halten, beweist aber nicht automatisch DSGVO-Konformität. Erforderlich bleiben Rechtsgrundlage, Datenminimierung, Löschfristen, Zugriffskontrollen, Auftragsverarbeiter- und Transferprüfung, Logging-Regeln und Incident-Prozess. Ein Hosted Endpoint ist wegen serviceabhängigem Datenstandort und Vertrag getrennt zu bewerten.
Ein belastbarer Auswahlprozess
- Nenne den exakten Checkpoint. Familiennamen verdecken Unterschiede bei Gewichten, Modalitäten, Kontext und Lizenz.
- Kläre Lizenz und Jurisdiktion. Dokumentiere die Lizenzrevision und hole bei folgenreichen Deployments Rechtsrat ein.
- Kalkuliere die echte Serving-Konfiguration. Berücksichtige Präzision, Kontext, Parallelität, Runtime-Overhead, Redundanz und Netzwerktopologie.
- Fahre denselben privaten Eval. Nutze repräsentative Aufgaben, stabile Prompts, gleichen Toolzugang und klare Pass-Kriterien für mindestens zwei Kandidaten.
- Pinne und überwache. Dokumentiere Gewichtsrevision, Tokenizer, Runtime, Quantisierung und Sicherheitskonfiguration.
Warum der Eval-Harness zählt
Öffentliche Benchmarks können durch Kontamination, Overfitting und Harness-Effekte verzerrt sein. Vor allem sind sie nicht dein Workload. Einige Dutzend repräsentative Aufgaben mit klaren Pass-Kriterien zeigen Fehler, die ein Gesamt-Score verdeckt. Miss Task-Abschluss, Latenz, Kosten, Toolfehler, Long-Context-Retrieval und Recovery.
Häufige Fragen
Gilt Metas EU-Beschränkung für Llama 4 auch für Muse Glimmer?
Welche Modelle sollte ein kleines Team zuerst lokal testen?
Ist das längste beworbene Kontextfenster am besten?
Sind das Wavect-Benchmark-Ergebnisse?
Fazit
Die Auswahl für Oktober 2026 trennt jetzt Workstation-tauglich zu prüfende Qwen3.8-27B und Muse Glimmer-30B von deutlich größeren Checkpoints. Lizenzen bleiben checkpointbezogen, besonders bei Muse gegenüber Llama 4. Wähle die kleinste rechtlich einsetzbare Konfiguration, die deine Abnahmetests besteht, und bewerte gehostete APIs getrennt von herunterladbaren Gewichten.