Tencent Hy4 Preview im Test: Lohnt sich das 1M-Kontextmodell?
Ja, Tencent Hy4 preview lohnt sich für einen kontrollierten Coding-Agent-Pilot, wenn lange Kontexte, mehrstufige Tool-Aufrufe oder wiederholtes Repository-Retrieval die Arbeit bremsen. Als Standard für jeden Produktionsworkflow ist das Modell noch zu früh. Es ist sehr groß, Self-Hosting ist ein Rechenzentrumsprojekt und Tencent nennt Überdenken sowie unnötig langes Überprüfen als bekannte Grenzen.
Tencent veröffentlichte Hy4 preview am 28. August 2026 mit 770 Milliarden Backbone-Parametern, 49 Milliarden aktiven Parametern pro Token und mehr als einer Million Token Kontext. Die offizielle Tencent-Ankündigung nennt WorkBuddy, CodeBuddy, Tencent Cloud TokenHub und OpenRouter als Zugangswege. Zum Start kündigte Tencent zwei Wochen kostenlosen Zugang über WorkBuddy und CodeBuddy an.
Dieser Review wurde am 1. September 2026 geprüft. Er beantwortet nur eine Frage: Soll ein Softwareteam Hy4 preview für lang laufende Coding-Aufgaben testen? Für die marktweite Auswahl bleibt unser Open-Weight-LLM-Vergleich zuständig. Die Architekturentscheidung zwischen Retrieval, Tuning und großem Kontext gehört in den RAG-vs-Fine-Tuning-vs-Long-Context-Leitfaden.
Hy4 preview in 60 Sekunden
| Frage | Geprüfte Antwort | Bedeutung für Käufer |
|---|---|---|
| Was ist Hy4? | Ein MoE-Sprachmodell mit 770B Gesamt- und 49B aktiven Parametern | Sparse Aktivierung, aber kein kleiner 49B-Checkpoint |
| Wie viel Kontext? | 1.048.576 Token im Serving-Rezept | Große Kapazität, aber keine Garantie für zuverlässigen Recall |
| Welche Lizenz? | Gewichte und Code unter Apache 2.0 | Kommerzielle Nutzung und Self-Hosting sind nach normaler Rechtsprüfung möglich |
| Tool-Aufrufe? | Ja, offizielle vLLM- und SGLang-Rezepte enthalten Tool- und Reasoning-Parser | Der eigene Harness bleibt für Rechte und Recovery verantwortlich |
| API-Preis? | 0,834 US-Dollar Input, 2,501 US-Dollar Output, 0,042 US-Dollar Cache-Hit je 1 Mio. Token | Cache-Wiederverwendung kann lange Prompts wirtschaftlicher machen |
| Self-Hosting? | Offizielle Anleitung für 8 B300 oder 16 B200 GPUs | Hosted Evaluation kommt vor Hardwarebeschaffung |
Sie brauchen einen neutralen Hy4-Pilot mit echten Repository-Aufgaben, Kostenkontrolle und Acceptance Gates?
Zwei-Wochen-Pilot planenWas ist Tencent Hy4 preview?
Hy4 preview ist das Sparse-Mixture-of-Experts-Flaggschiff des Tencent Hy Teams für Coding, Office, Analyse, Spiele und Forschung. Die offizielle Hugging-Face-Model-Card dokumentiert 78 Backbone-Layer. Der erste nutzt ein Dense-FFN, die übrigen 77 enthalten je 256 Routing-Experten und einen Shared Expert. Pro Token werden acht Routing-Experten plus der Shared Expert aktiviert.
Die 770B beziehen sich auf den Backbone. Ein nativer Multi-Token-Prediction-Layer ergänzt 10B Gesamtparameter und 0,7B aktive Parameter für Speculative Decoding. Deshalb zeigen einige Verzeichnisse 780B. Gated DeepSeek Sparse Attention, IndexCache über mehrere Layer und identity Hyper-Connections sollen lange Inputs sowie anhaltendes Reasoning effizienter machen.
Gewichte, FP8-Variante, Fine-Tuning-Code, Deployment-Anleitung und Lizenz liegen im offiziellen Hy4-Repository von Tencent. Das ist relevante Offenheit. Es macht ein 770B-Modell noch nicht zum Laptop-Download.
Was zeigte unser WorkBuddy-Coding-Test?
Wir baten Hy4 preview in WorkBuddy, ein vollständig interaktives Benchmark-Dashboard für KI-Modelle zu bauen. Relevant war nicht nur das HTML. Das Modell schrieb die Kernlogik, baute Headless-Harnesses, prüfte JavaScript gegen ein Stub-DOM und testete Filter sowie Randfälle der Kostensimulation vor der Übergabe.
Das ist ein positives Feldsignal, aber kein unabhängiger Benchmark. Ein gelungenes Dashboard beweist weder eine allgemeine Erfolgsrate noch Sicherheit oder Wirtschaftlichkeit. Es begründet eine klare Pilot-Hypothese: Hy4 kann wertvoll sein, wenn ein Agent Anforderungen, Implementierungsstand, Tests und Tool-Ausgaben über einen langen Lauf konsistent halten muss.
Wie stark sind die Hy4-Benchmarks?
Tencent ließ 163 interne Fachleute Ergebnisse zu 203 Engineering-Aufgaben blind bewerten. Hy4 erreichte durchschnittlich 2,99 von 4 Punkten, GLM-5.3 kam auf 2,92 und Kimi K3 auf 2,94. Gegen GLM-5.3 nennt Tencent 46,8 Prozent Siege, 12,8 Prozent Unentschieden und 40,4 Prozent Niederlagen. Gegen Kimi K3 waren es 51,2 Prozent Siege, 7,9 Prozent Unentschieden und 40,9 Prozent Niederlagen.
| Signal | Veröffentlichter Wert | Was er stützt | Was er nicht beweist |
|---|---|---|---|
| Tencent-Expertenevaluation | 2,99/4 bei 203 Aufgaben | Wettbewerbsfähigkeit im Tencent-Aufgabensatz | Unabhängige Überlegenheit oder Erfolg im eigenen Repository |
| SWE-bench Pro | 65,7 | Starke Issue-Lösung im verwendeten Harness | Wartbarkeit, Latenz oder Sicherheit in Produktion |
| DeepSWE | 64,3 | Potenzial für Coding-Agenten | Zuverlässiges Verständnis bei einer Million Token |
| SWE-bench Multilingual | 82,9 | Vielversprechendes mehrsprachiges Coding | Gleiche Qualität in allen Sprachen und Frameworks |
Diese Werte rechtfertigen eine Evaluation, keine Migration. Harness, Tools, Kontext, Hardware, Retry-Policy und Scoring unterscheiden sich. Zudem ist Hy4 ein Preview und kann sich beim Serving noch verändern.
Bedeutet 1M Kontext, dass Hy4 eine ganze Codebasis erinnert?
Nein. Eine Million Token sind Input-Kapazität, keine Memory- oder Genauigkeitsgarantie. Das Fenster kann zerstörerisches Chunking reduzieren und größere Zusammenhänge sichtbar machen. Es garantiert nicht, dass ein Detail in der Mitte die richtige Änderung beeinflusst oder dass jedes gesendete Token seinen Preis wert ist.
Die LongCodeBench-Studie zeigte bei früheren Modellen starke Qualitätsverluste mit wachsendem Code-Kontext, obwohl die Modelle lange Fenster unterstützten. Hy4 erschien später und wurde nicht getestet. Die Studie stützt die Testmethode, nicht eine Aussage über Hy4.
Geben Sie dem Agenten Repository-Map, klare Task-Grenzen, Hinweise auf geänderte Dateien, Acceptance Tests und knappe Evidenz. Unser Artikel Coding-Agenten brauchen Kontext, nicht nur Intelligenz erklärt die Methode.
Hosted API oder Self-Hosting?
Die meisten Teams sollten mit WorkBuddy, CodeBuddy, TokenHub, OpenRouter oder einem anderen geprüften Hosted-Angebot beginnen. Tencent nennt 0,834 US-Dollar je Million Input-Token, 2,501 US-Dollar für Output und 0,042 US-Dollar für Cache-Hits. Prüfen Sie Preis, Region, Retention, Durchsatz, Kontextlimit und Tool-Support beim tatsächlich gewählten Anbieter.
Das offizielle vLLM-Rezept nennt 16 NVIDIA B200 oder 8 B300 GPUs. vLLM und SGLang stellen einen OpenAI-kompatiblen Endpoint, FP8-Gewichte sowie eigene Hy4-Parser für Reasoning und Tool Calls bereit. Das passt zu Teams mit Erfahrung in verteiltem Inference-Betrieb, nicht zu einem ersten Produktversuch.
| Weg | Geeignet wenn | Hauptrisiko | Entscheidungs-Gate |
|---|---|---|---|
| WorkBuddy oder CodeBuddy | Schnellster End-to-End-Test gesucht | Weniger Kontrolle über Harness und Telemetrie | Beendet das Produkt reale Aufgaben mit prüfbarer Evidenz? |
| Hosted API | Integration, Messung und Tool Calls nötig | Provider-Limits, Datenbedingungen und Serving-Varianz | Schlägt Kosten pro akzeptierter Aufgabe den Bestand? |
| Self-hosted FP8 | Stabiles Volumen, Data Control und GPU-Betrieb vorhanden | Kapital, Auslastung, Netzwerk, Updates und Bereitschaft | Schlägt gemessener TCO eine vertraglich gesicherte API? |
Nutzen Sie unser Break-even-Modell für lokale LLMs und APIs, bevor offene Gewichte zum Hardwarekauf werden. Der richtige Nenner sind akzeptierte Aufgaben, nicht theoretische Token.
Zwei Wochen Pilot für Coding-Agenten
- 20 bis 30 Aufgaben einfrieren: reale Bugs, Navigation, Features, Testreparaturen, lange Dokumente und Tool-Fehler.
- Harness vergleichbar halten: gleiche Commits, Anweisungen, Tools, Zeitlimits und Acceptance Tests.
- Kontext in Stufen testen: kompakt, kuratiert groß und nahe am Maximum. Mehr Input ist nicht automatisch besser.
- Gesamtkosten erfassen: Input, Cache-Hits, Output, Retries, Laufzeit und aktive Review-Minuten.
- Fehler erzwingen: fehlgeschlagene Commands, fehlerhafte Ausgaben, veraltete Dateien und fehlende Abhängigkeiten.
- Sicherheitsgrenzen prüfen: Daten klassifizieren, Rechte und Netzwerk begrenzen, Logs redigieren und riskante Aktionen genehmigen lassen.
- Nach Outcomes entscheiden: nur skalieren, wenn Acceptance, Kosten, Review-Zeit oder Data Control besser werden.
Welche kommerziellen Kennzahlen zählen?
- First-Pass-Acceptance-Rate und Kosten pro akzeptierter Änderung
- Long-Context-Retrieval an mehreren Positionen
- Gültige Tool Calls, Fehler-Recovery und sauberes Stop-Verhalten
- Relevante Tests und korrekte Interpretation von Fehlern
- P50- und P95-Durchlaufzeit inklusive Überdenken
- Sicherheitsausnahmen, Secret Exposure und manuelle Overrides
Wenn nicht ein Modell jede Rolle gewinnt, trennen Sie Routing von diesem Review. Unser Buyer-Guide für Multi-Model-Coding-Agenten ordnet Planung, Umsetzung und unabhängige Prüfung nach gemessener Fähigkeit.
Hilfe für KI in Produktion
Du baust ein KI-Produkt und machst dir Sorgen um Inference-Kosten, Architektur oder Production Readiness? Wavect hilft Gründern, KI-Prototypen in zuverlässige Produktionssysteme zu verwandeln.
Passender Service:
Empfehlung
Testen Sie Hy4, wenn lange Engineering-Läufe ein gemessener Engpass sind und eine reale Baseline existiert. Beginnen Sie hosted, strukturieren Sie Repository-Kontext, messen Sie Cache-Verhalten und lassen Sie Tests statt Selbstvertrauen entscheiden.
Warten Sie, wenn Aufgaben gut in kleinere Fenster passen, verlässliche Tests fehlen oder niemand Provider-Risiko und Agentenrechte besitzt. Self-Hosting ist erst sinnvoll, wenn ein validierter Workload, Data-Control-Bedarf und stabile Auslastung 8 bis 16 Rechenzentrums-GPUs samt Betriebsteam rechtfertigen.
Primärquellen und Aktualitätsgrenze
Architektur, Zugangswege, Preise, interne Evaluation und Startangebot stammen aus Tencents Ankündigung vom 28. August. Spezifikationen, öffentliche Evaluationen, Grenzen und Apache 2.0 kommen aus Model Card und Repository. Das Hardwareprofil stammt von vLLM. LongCodeBench liefert nur die allgemeine Prüfmethode und testete Hy4 nicht. Wavect hat Tencents Benchmark-Suite nicht reproduziert. Preise, Terms und Serving-Limits können sich nach dem 1. September 2026 ändern.
Häufige Fragen zu Tencent Hy4 Preview
Was ist Tencent Hy4 preview?
Unterstützt Hy4 wirklich eine Million Token?
Ist Hy4 preview Open Source?
Was kostet die Hy4-API?
Läuft Hy4 auf einem Laptop oder einer GPU?
Ist Hy4 besser als GLM-5.3 oder Kimi K3?
Was ist das größte Risiko für Coding-Agenten?
Fazit
Hy4 preview verdient Aufmerksamkeit: Tencent verbindet ein außergewöhnlich großes offenes Modell, eine Million Token Kontext, agentenorientierten Tool-Support und aggressive Hosted-Preise. Der WorkBuddy-Dashboard-Test zeigt, dass der Stack Implementierung und Verifikation durch eine relevante Full-Stack-Aufgabe tragen kann.
Die Kaufentscheidung braucht trotzdem eigene Evidenz. Testen Sie reale Repositories, vergleichen Sie akzeptierte Änderungen, bepreisen Sie den ganzen Workflow und halten Sie Tool-Rechte sowie externe Tests unter Kontrolle.
