Zurück
Kevin Riedl

11 min Lesezeit · 1. September 2026
Zuletzt geprüft

Weiter
Entsteht auf deinem Gerät, ohne Instagram-Verbindung. Den Beitragslink kopieren wir für deinen Link-Sticker.

Tencent Hy4 Preview im Test: Lohnt sich das 1M-Kontextmodell?

Ja, Tencent Hy4 preview lohnt sich für einen kontrollierten Coding-Agent-Pilot, wenn lange Kontexte, mehrstufige Tool-Aufrufe oder wiederholtes Repository-Retrieval die Arbeit bremsen. Als Standard für jeden Produktionsworkflow ist das Modell noch zu früh. Es ist sehr groß, Self-Hosting ist ein Rechenzentrumsprojekt und Tencent nennt Überdenken sowie unnötig langes Überprüfen als bekannte Grenzen.

Tencent veröffentlichte Hy4 preview am 28. August 2026 mit 770 Milliarden Backbone-Parametern, 49 Milliarden aktiven Parametern pro Token und mehr als einer Million Token Kontext. Die offizielle Tencent-Ankündigung nennt WorkBuddy, CodeBuddy, Tencent Cloud TokenHub und OpenRouter als Zugangswege. Zum Start kündigte Tencent zwei Wochen kostenlosen Zugang über WorkBuddy und CodeBuddy an.

Dieser Review wurde am 1. September 2026 geprüft. Er beantwortet nur eine Frage: Soll ein Softwareteam Hy4 preview für lang laufende Coding-Aufgaben testen? Für die marktweite Auswahl bleibt unser Open-Weight-LLM-Vergleich zuständig. Die Architekturentscheidung zwischen Retrieval, Tuning und großem Kontext gehört in den RAG-vs-Fine-Tuning-vs-Long-Context-Leitfaden.

Hy4 preview in 60 Sekunden

Buyer-Zusammenfassung, geprüft am 1. September 2026
FrageGeprüfte AntwortBedeutung für Käufer
Was ist Hy4?Ein MoE-Sprachmodell mit 770B Gesamt- und 49B aktiven ParameternSparse Aktivierung, aber kein kleiner 49B-Checkpoint
Wie viel Kontext?1.048.576 Token im Serving-RezeptGroße Kapazität, aber keine Garantie für zuverlässigen Recall
Welche Lizenz?Gewichte und Code unter Apache 2.0Kommerzielle Nutzung und Self-Hosting sind nach normaler Rechtsprüfung möglich
Tool-Aufrufe?Ja, offizielle vLLM- und SGLang-Rezepte enthalten Tool- und Reasoning-ParserDer eigene Harness bleibt für Rechte und Recovery verantwortlich
API-Preis?0,834 US-Dollar Input, 2,501 US-Dollar Output, 0,042 US-Dollar Cache-Hit je 1 Mio. TokenCache-Wiederverwendung kann lange Prompts wirtschaftlicher machen
Self-Hosting?Offizielle Anleitung für 8 B300 oder 16 B200 GPUsHosted Evaluation kommt vor Hardwarebeschaffung

Sie brauchen einen neutralen Hy4-Pilot mit echten Repository-Aufgaben, Kostenkontrolle und Acceptance Gates?

 Zwei-Wochen-Pilot planen

Was ist Tencent Hy4 preview?

Hy4 preview ist das Sparse-Mixture-of-Experts-Flaggschiff des Tencent Hy Teams für Coding, Office, Analyse, Spiele und Forschung. Die offizielle Hugging-Face-Model-Card dokumentiert 78 Backbone-Layer. Der erste nutzt ein Dense-FFN, die übrigen 77 enthalten je 256 Routing-Experten und einen Shared Expert. Pro Token werden acht Routing-Experten plus der Shared Expert aktiviert.

Die 770B beziehen sich auf den Backbone. Ein nativer Multi-Token-Prediction-Layer ergänzt 10B Gesamtparameter und 0,7B aktive Parameter für Speculative Decoding. Deshalb zeigen einige Verzeichnisse 780B. Gated DeepSeek Sparse Attention, IndexCache über mehrere Layer und identity Hyper-Connections sollen lange Inputs sowie anhaltendes Reasoning effizienter machen.

Gewichte, FP8-Variante, Fine-Tuning-Code, Deployment-Anleitung und Lizenz liegen im offiziellen Hy4-Repository von Tencent. Das ist relevante Offenheit. Es macht ein 770B-Modell noch nicht zum Laptop-Download.

Was zeigte unser WorkBuddy-Coding-Test?

Wir baten Hy4 preview in WorkBuddy, ein vollständig interaktives Benchmark-Dashboard für KI-Modelle zu bauen. Relevant war nicht nur das HTML. Das Modell schrieb die Kernlogik, baute Headless-Harnesses, prüfte JavaScript gegen ein Stub-DOM und testete Filter sowie Randfälle der Kostensimulation vor der Übergabe.

Das ist ein positives Feldsignal, aber kein unabhängiger Benchmark. Ein gelungenes Dashboard beweist weder eine allgemeine Erfolgsrate noch Sicherheit oder Wirtschaftlichkeit. Es begründet eine klare Pilot-Hypothese: Hy4 kann wertvoll sein, wenn ein Agent Anforderungen, Implementierungsstand, Tests und Tool-Ausgaben über einen langen Lauf konsistent halten muss.

Wie stark sind die Hy4-Benchmarks?

Tencent ließ 163 interne Fachleute Ergebnisse zu 203 Engineering-Aufgaben blind bewerten. Hy4 erreichte durchschnittlich 2,99 von 4 Punkten, GLM-5.3 kam auf 2,92 und Kimi K3 auf 2,94. Gegen GLM-5.3 nennt Tencent 46,8 Prozent Siege, 12,8 Prozent Unentschieden und 40,4 Prozent Niederlagen. Gegen Kimi K3 waren es 51,2 Prozent Siege, 7,9 Prozent Unentschieden und 40,9 Prozent Niederlagen.

SignalVeröffentlichter WertWas er stütztWas er nicht beweist
Tencent-Expertenevaluation2,99/4 bei 203 AufgabenWettbewerbsfähigkeit im Tencent-AufgabensatzUnabhängige Überlegenheit oder Erfolg im eigenen Repository
SWE-bench Pro65,7Starke Issue-Lösung im verwendeten HarnessWartbarkeit, Latenz oder Sicherheit in Produktion
DeepSWE64,3Potenzial für Coding-AgentenZuverlässiges Verständnis bei einer Million Token
SWE-bench Multilingual82,9Vielversprechendes mehrsprachiges CodingGleiche Qualität in allen Sprachen und Frameworks

Diese Werte rechtfertigen eine Evaluation, keine Migration. Harness, Tools, Kontext, Hardware, Retry-Policy und Scoring unterscheiden sich. Zudem ist Hy4 ein Preview und kann sich beim Serving noch verändern.

Bedeutet 1M Kontext, dass Hy4 eine ganze Codebasis erinnert?

Nein. Eine Million Token sind Input-Kapazität, keine Memory- oder Genauigkeitsgarantie. Das Fenster kann zerstörerisches Chunking reduzieren und größere Zusammenhänge sichtbar machen. Es garantiert nicht, dass ein Detail in der Mitte die richtige Änderung beeinflusst oder dass jedes gesendete Token seinen Preis wert ist.

Die LongCodeBench-Studie zeigte bei früheren Modellen starke Qualitätsverluste mit wachsendem Code-Kontext, obwohl die Modelle lange Fenster unterstützten. Hy4 erschien später und wurde nicht getestet. Die Studie stützt die Testmethode, nicht eine Aussage über Hy4.

Geben Sie dem Agenten Repository-Map, klare Task-Grenzen, Hinweise auf geänderte Dateien, Acceptance Tests und knappe Evidenz. Unser Artikel Coding-Agenten brauchen Kontext, nicht nur Intelligenz erklärt die Methode.

Hosted API oder Self-Hosting?

Die meisten Teams sollten mit WorkBuddy, CodeBuddy, TokenHub, OpenRouter oder einem anderen geprüften Hosted-Angebot beginnen. Tencent nennt 0,834 US-Dollar je Million Input-Token, 2,501 US-Dollar für Output und 0,042 US-Dollar für Cache-Hits. Prüfen Sie Preis, Region, Retention, Durchsatz, Kontextlimit und Tool-Support beim tatsächlich gewählten Anbieter.

Das offizielle vLLM-Rezept nennt 16 NVIDIA B200 oder 8 B300 GPUs. vLLM und SGLang stellen einen OpenAI-kompatiblen Endpoint, FP8-Gewichte sowie eigene Hy4-Parser für Reasoning und Tool Calls bereit. Das passt zu Teams mit Erfahrung in verteiltem Inference-Betrieb, nicht zu einem ersten Produktversuch.

WegGeeignet wennHauptrisikoEntscheidungs-Gate
WorkBuddy oder CodeBuddySchnellster End-to-End-Test gesuchtWeniger Kontrolle über Harness und TelemetrieBeendet das Produkt reale Aufgaben mit prüfbarer Evidenz?
Hosted APIIntegration, Messung und Tool Calls nötigProvider-Limits, Datenbedingungen und Serving-VarianzSchlägt Kosten pro akzeptierter Aufgabe den Bestand?
Self-hosted FP8Stabiles Volumen, Data Control und GPU-Betrieb vorhandenKapital, Auslastung, Netzwerk, Updates und BereitschaftSchlägt gemessener TCO eine vertraglich gesicherte API?

Nutzen Sie unser Break-even-Modell für lokale LLMs und APIs, bevor offene Gewichte zum Hardwarekauf werden. Der richtige Nenner sind akzeptierte Aufgaben, nicht theoretische Token.

Zwei Wochen Pilot für Coding-Agenten

  1. 20 bis 30 Aufgaben einfrieren: reale Bugs, Navigation, Features, Testreparaturen, lange Dokumente und Tool-Fehler.
  2. Harness vergleichbar halten: gleiche Commits, Anweisungen, Tools, Zeitlimits und Acceptance Tests.
  3. Kontext in Stufen testen: kompakt, kuratiert groß und nahe am Maximum. Mehr Input ist nicht automatisch besser.
  4. Gesamtkosten erfassen: Input, Cache-Hits, Output, Retries, Laufzeit und aktive Review-Minuten.
  5. Fehler erzwingen: fehlgeschlagene Commands, fehlerhafte Ausgaben, veraltete Dateien und fehlende Abhängigkeiten.
  6. Sicherheitsgrenzen prüfen: Daten klassifizieren, Rechte und Netzwerk begrenzen, Logs redigieren und riskante Aktionen genehmigen lassen.
  7. Nach Outcomes entscheiden: nur skalieren, wenn Acceptance, Kosten, Review-Zeit oder Data Control besser werden.

Welche kommerziellen Kennzahlen zählen?

  • First-Pass-Acceptance-Rate und Kosten pro akzeptierter Änderung
  • Long-Context-Retrieval an mehreren Positionen
  • Gültige Tool Calls, Fehler-Recovery und sauberes Stop-Verhalten
  • Relevante Tests und korrekte Interpretation von Fehlern
  • P50- und P95-Durchlaufzeit inklusive Überdenken
  • Sicherheitsausnahmen, Secret Exposure und manuelle Overrides

Wenn nicht ein Modell jede Rolle gewinnt, trennen Sie Routing von diesem Review. Unser Buyer-Guide für Multi-Model-Coding-Agenten ordnet Planung, Umsetzung und unabhängige Prüfung nach gemessener Fähigkeit.

Hilfe für KI in Produktion

Du baust ein KI-Produkt und machst dir Sorgen um Inference-Kosten, Architektur oder Production Readiness? Wavect hilft Gründern, KI-Prototypen in zuverlässige Produktionssysteme zu verwandeln.

Passender Service:

Empfehlung

Testen Sie Hy4, wenn lange Engineering-Läufe ein gemessener Engpass sind und eine reale Baseline existiert. Beginnen Sie hosted, strukturieren Sie Repository-Kontext, messen Sie Cache-Verhalten und lassen Sie Tests statt Selbstvertrauen entscheiden.

Warten Sie, wenn Aufgaben gut in kleinere Fenster passen, verlässliche Tests fehlen oder niemand Provider-Risiko und Agentenrechte besitzt. Self-Hosting ist erst sinnvoll, wenn ein validierter Workload, Data-Control-Bedarf und stabile Auslastung 8 bis 16 Rechenzentrums-GPUs samt Betriebsteam rechtfertigen.

Primärquellen und Aktualitätsgrenze

Architektur, Zugangswege, Preise, interne Evaluation und Startangebot stammen aus Tencents Ankündigung vom 28. August. Spezifikationen, öffentliche Evaluationen, Grenzen und Apache 2.0 kommen aus Model Card und Repository. Das Hardwareprofil stammt von vLLM. LongCodeBench liefert nur die allgemeine Prüfmethode und testete Hy4 nicht. Wavect hat Tencents Benchmark-Suite nicht reproduziert. Preise, Terms und Serving-Limits können sich nach dem 1. September 2026 ändern.

Häufige Fragen zu Tencent Hy4 Preview

Was ist Tencent Hy4 preview?
Hy4 preview ist ein Mixture-of-Experts-Sprachmodell des Tencent Hy Teams für Coding, Agentenworkflows, Office, Analyse, Spiele und Forschung. Der Backbone hat 770 Milliarden Gesamtparameter, davon 49 Milliarden aktiv pro Token, plus einen separaten MTP-Layer mit 10 Milliarden Parametern.
Unterstützt Hy4 wirklich eine Million Token?
Ja. Die Model Card nennt 1M Kontext und das vLLM-Rezept 1.048.576 Token. Das ist Kapazität, kein Beweis für korrekten Recall bei maximaler Länge. Testen Sie Retrieval und Task-Erfolg in mehreren Kontextstufen.
Ist Hy4 preview Open Source?
Tencent veröffentlicht Gewichte, FP8-Gewichte, Code, Fine-Tuning-Anleitung und Deployment-Rezepte unter Apache 2.0. Lizenz, Drittkomponenten, Modellverhalten und regulatorische Pflichten brauchen trotzdem eine Produktionsprüfung.
Was kostet die Hy4-API?
Tencent nennt 0,834 US-Dollar je Million Input-Token, 2,501 US-Dollar für Output und 0,042 US-Dollar für Cache-Hits. Bestätigen Sie Live-Preis und Bedingungen beim gewählten Provider.
Läuft Hy4 auf einem Laptop oder einer GPU?
Nicht in der offiziellen vollständigen Konfiguration. Das vLLM-Rezept nennt 16 B200 oder 8 B300 GPUs für FP8. Community-Quantisierungen brauchen eine eigene Qualitäts-, Leistungs- und Lizenzprüfung.
Ist Hy4 besser als GLM-5.3 oder Kimi K3?
In Tencents blinder interner Evaluation lag Hy4 knapp vorn. Die Abstände waren klein und der Test kam vom Anbieter. Entscheiden Sie mit kontrollierten Aufgaben aus den eigenen Repositories, Tools, Sprachen und Acceptance-Kriterien.
Was ist das größte Risiko für Coding-Agenten?
Die größten Risiken sind Kontextkapazität mit zuverlässiger Erinnerung zu verwechseln, unnötiges Reasoning zu bezahlen, Tool Calls ohne externe Kontrollen zu vertrauen und Self-Hosting vor einem wertstiftenden Hosted-Pilot zu beschaffen.

Fazit

Hy4 preview verdient Aufmerksamkeit: Tencent verbindet ein außergewöhnlich großes offenes Modell, eine Million Token Kontext, agentenorientierten Tool-Support und aggressive Hosted-Preise. Der WorkBuddy-Dashboard-Test zeigt, dass der Stack Implementierung und Verifikation durch eine relevante Full-Stack-Aufgabe tragen kann.

Die Kaufentscheidung braucht trotzdem eigene Evidenz. Testen Sie reale Repositories, vergleichen Sie akzeptierte Änderungen, bepreisen Sie den ganzen Workflow und halten Sie Tool-Rechte sowie externe Tests unter Kontrolle.

Hilfe für KI in Produktion

Du baust ein KI-Produkt und machst dir Sorgen um Inference-Kosten, Architektur oder Production Readiness? Wavect hilft Gründern, KI-Prototypen in zuverlässige Produktionssysteme zu verwandeln.

Passender Service:

Postfach, ohne Lärm

Folge der Arbeit, die für dich zählt

Du bekommst eine kurze E-Mail, wenn wir etwas Neues veröffentlichen. Folge dem ganzen Blog oder nur den Themen, die dich interessieren.

Was möchtest du erhalten?
Themen auswählen

Kostenlos, Double-Opt-in, ohne Tracking-Pixel.

Zurück
Kevin Riedl

11 min Lesezeit · 1. September 2026
Zuletzt geprüft

Weiter

Erhalte die nächste Feldnotiz zu AI und Agents

Eine kurze E-Mail, wenn wir veröffentlichen. Ohne Tracking-Pixel und ohne Postfachfüller.

Kostenlos, Double-Opt-in, ohne Tracking-Pixel.