---
title: "Tencent Hy4 Preview: 1M-Kontext, Kosten & Test"
canonical: https://wavect.io/de/blog/tencent-hy4-preview-coding-agent-review/
language: de
description: "Tencent Hy4 preview im Test: 1M-Kontext, Coding-Benchmarks, API-Preis, WorkBuddy und Self-Hosting vor einem Team-Pilot prüfen."
image: "https://wavect.io/img/blog/headers/header_tencent-hy4-preview-coding-agent-review.png"
---

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

11 min Lesezeit · 1. September 2026 Zuletzt geprüft 1. September 2026

[**Weiter**](/de/blog/pagelm-self-hosted-ai-study-platform/)

# Tencent Hy4 Preview im Test: Lohnt sich das 1M-Kontextmodell?

TL;DR

Tencent Hy4 preview ist ein glaubwürdiger Pilotkandidat für lang laufende Coding-Agenten, aber kein automatischer Ersatz für ein bewährtes Produktionsmodell. Tencent nennt 770 Milliarden Backbone-Parameter, 49 Milliarden aktive Parameter pro Token, ein Kontextfenster mit einer Million Token und Apache 2.0. Die interne Evaluation mit 203 Aufgaben lag knapp vor GLM-5.3 und Kimi K3; öffentliche Benchmark-Einträge zeigen starke Coding-Werte. Beides beweist noch keine zuverlässige Codebasis-Retention im eigenen Stack. Hosted Access ist der praktische Startpunkt, denn die offizielle Self-Hosting-Anleitung zielt auf 8 B300 oder 16 B200 GPUs. Teams sollten repräsentative Repository-Aufgaben testen, akzeptierte Änderungen statt Roh-Token messen, Tool-Nutzung und Sicherheit prüfen und das bekannte Überdenken sowie Überprüfen als Kostenrisiko erfassen.

**Ja, Tencent Hy4 preview lohnt sich für einen kontrollierten Coding-Agent-Pilot, wenn lange Kontexte, mehrstufige Tool-Aufrufe oder wiederholtes Repository-Retrieval die Arbeit bremsen.** Als Standard für jeden Produktionsworkflow ist das Modell noch zu früh. Es ist sehr groß, Self-Hosting ist ein Rechenzentrumsprojekt und Tencent nennt Überdenken sowie unnötig langes Überprüfen als bekannte Grenzen.

Tencent veröffentlichte Hy4 preview am 28. August 2026 mit 770 Milliarden Backbone-Parametern, 49 Milliarden aktiven Parametern pro Token und mehr als einer Million Token Kontext. Die [offizielle Tencent-Ankündigung](https://www.tencent.com/tencent-releases-and-open-sources-tencent-hy4-preview/) nennt WorkBuddy, CodeBuddy, Tencent Cloud TokenHub und OpenRouter als Zugangswege. Zum Start kündigte Tencent zwei Wochen kostenlosen Zugang über WorkBuddy und CodeBuddy an.

Dieser Review wurde am **1. September 2026** geprüft. Er beantwortet nur eine Frage: Soll ein Softwareteam Hy4 preview für lang laufende Coding-Aufgaben testen? Für die marktweite Auswahl bleibt unser [Open-Weight-LLM-Vergleich](/de/blog/open-weight-llm-comparison-2026/) zuständig. Die Architekturentscheidung zwischen Retrieval, Tuning und großem Kontext gehört in den [RAG-vs-Fine-Tuning-vs-Long-Context-Leitfaden](/de/blog/rag-vs-finetune-vs-longcontext-2026/).

## Hy4 preview in 60 Sekunden

| Frage | Geprüfte Antwort | Bedeutung für Käufer |
| --- | --- | --- |
| Was ist Hy4? | Ein MoE-Sprachmodell mit 770B Gesamt- und 49B aktiven Parametern | Sparse Aktivierung, aber kein kleiner 49B-Checkpoint |
| Wie viel Kontext? | 1.048.576 Token im Serving-Rezept | Große Kapazität, aber keine Garantie für zuverlässigen Recall |
| Welche Lizenz? | Gewichte und Code unter Apache 2.0 | Kommerzielle Nutzung und Self-Hosting sind nach normaler Rechtsprüfung möglich |
| Tool-Aufrufe? | Ja, offizielle vLLM- und SGLang-Rezepte enthalten Tool- und Reasoning-Parser | Der eigene Harness bleibt für Rechte und Recovery verantwortlich |
| API-Preis? | 0,834 US-Dollar Input, 2,501 US-Dollar Output, 0,042 US-Dollar Cache-Hit je 1 Mio. Token | Cache-Wiederverwendung kann lange Prompts wirtschaftlicher machen |
| Self-Hosting? | Offizielle Anleitung für 8 B300 oder 16 B200 GPUs | Hosted Evaluation kommt vor Hardwarebeschaffung |

## Was ist Tencent Hy4 preview?

**Hy4 preview ist das Sparse-Mixture-of-Experts-Flaggschiff des Tencent Hy Teams für Coding, Office, Analyse, Spiele und Forschung.** Die [offizielle Hugging-Face-Model-Card](https://huggingface.co/tencent/Hy4-preview) dokumentiert 78 Backbone-Layer. Der erste nutzt ein Dense-FFN, die übrigen 77 enthalten je 256 Routing-Experten und einen Shared Expert. Pro Token werden acht Routing-Experten plus der Shared Expert aktiviert.

Die 770B beziehen sich auf den Backbone. Ein nativer Multi-Token-Prediction-Layer ergänzt 10B Gesamtparameter und 0,7B aktive Parameter für Speculative Decoding. Deshalb zeigen einige Verzeichnisse 780B. Gated DeepSeek Sparse Attention, IndexCache über mehrere Layer und identity Hyper-Connections sollen lange Inputs sowie anhaltendes Reasoning effizienter machen.

Gewichte, FP8-Variante, Fine-Tuning-Code, Deployment-Anleitung und Lizenz liegen im [offiziellen Hy4-Repository von Tencent](https://github.com/Tencent-Hunyuan/Hy4-preview). Das ist relevante Offenheit. Es macht ein 770B-Modell noch nicht zum Laptop-Download.

## Was zeigte unser WorkBuddy-Coding-Test?

Wir baten Hy4 preview in [WorkBuddy](https://www.workbuddy.ai/), ein vollständig interaktives Benchmark-Dashboard für KI-Modelle zu bauen. Relevant war nicht nur das HTML. Das Modell schrieb die Kernlogik, baute Headless-Harnesses, prüfte JavaScript gegen ein Stub-DOM und testete Filter sowie Randfälle der Kostensimulation vor der Übergabe.

**Das ist ein positives Feldsignal, aber kein unabhängiger Benchmark.** Ein gelungenes Dashboard beweist weder eine allgemeine Erfolgsrate noch Sicherheit oder Wirtschaftlichkeit. Es begründet eine klare Pilot-Hypothese: Hy4 kann wertvoll sein, wenn ein Agent Anforderungen, Implementierungsstand, Tests und Tool-Ausgaben über einen langen Lauf konsistent halten muss.

## Wie stark sind die Hy4-Benchmarks?

Tencent ließ 163 interne Fachleute Ergebnisse zu 203 Engineering-Aufgaben blind bewerten. Hy4 erreichte durchschnittlich 2,99 von 4 Punkten, GLM-5.3 kam auf 2,92 und Kimi K3 auf 2,94. Gegen GLM-5.3 nennt Tencent 46,8 Prozent Siege, 12,8 Prozent Unentschieden und 40,4 Prozent Niederlagen. Gegen Kimi K3 waren es 51,2 Prozent Siege, 7,9 Prozent Unentschieden und 40,9 Prozent Niederlagen.

| Signal | Veröffentlichter Wert | Was er stützt | Was er nicht beweist |
| --- | --- | --- | --- |
| Tencent-Expertenevaluation | 2,99/4 bei 203 Aufgaben | Wettbewerbsfähigkeit im Tencent-Aufgabensatz | Unabhängige Überlegenheit oder Erfolg im eigenen Repository |
| SWE-bench Pro | 65,7 | Starke Issue-Lösung im verwendeten Harness | Wartbarkeit, Latenz oder Sicherheit in Produktion |
| DeepSWE | 64,3 | Potenzial für Coding-Agenten | Zuverlässiges Verständnis bei einer Million Token |
| SWE-bench Multilingual | 82,9 | Vielversprechendes mehrsprachiges Coding | Gleiche Qualität in allen Sprachen und Frameworks |

Diese Werte rechtfertigen eine Evaluation, keine Migration. Harness, Tools, Kontext, Hardware, Retry-Policy und Scoring unterscheiden sich. Zudem ist Hy4 ein Preview und kann sich beim Serving noch verändern.

## Bedeutet 1M Kontext, dass Hy4 eine ganze Codebasis erinnert?

**Nein. Eine Million Token sind Input-Kapazität, keine Memory- oder Genauigkeitsgarantie.** Das Fenster kann zerstörerisches Chunking reduzieren und größere Zusammenhänge sichtbar machen. Es garantiert nicht, dass ein Detail in der Mitte die richtige Änderung beeinflusst oder dass jedes gesendete Token seinen Preis wert ist.

Die [LongCodeBench-Studie](https://arxiv.org/abs/2505.07897) zeigte bei früheren Modellen starke Qualitätsverluste mit wachsendem Code-Kontext, obwohl die Modelle lange Fenster unterstützten. Hy4 erschien später und wurde nicht getestet. Die Studie stützt die Testmethode, nicht eine Aussage über Hy4.

Geben Sie dem Agenten Repository-Map, klare Task-Grenzen, Hinweise auf geänderte Dateien, Acceptance Tests und knappe Evidenz. Unser Artikel [Coding-Agenten brauchen Kontext, nicht nur Intelligenz](/de/blog/ai-coding-agents-context-not-intelligence/) erklärt die Methode.

## Hosted API oder Self-Hosting?

**Die meisten Teams sollten mit WorkBuddy, CodeBuddy, TokenHub, OpenRouter oder einem anderen geprüften Hosted-Angebot beginnen.** Tencent nennt 0,834 US-Dollar je Million Input-Token, 2,501 US-Dollar für Output und 0,042 US-Dollar für Cache-Hits. Prüfen Sie Preis, Region, Retention, Durchsatz, Kontextlimit und Tool-Support beim tatsächlich gewählten Anbieter.

Das [offizielle vLLM-Rezept](https://recipes.vllm.ai/tencent/Hy4-preview) nennt 16 NVIDIA B200 oder 8 B300 GPUs. vLLM und SGLang stellen einen OpenAI-kompatiblen Endpoint, FP8-Gewichte sowie eigene Hy4-Parser für Reasoning und Tool Calls bereit. Das passt zu Teams mit Erfahrung in verteiltem Inference-Betrieb, nicht zu einem ersten Produktversuch.

| Weg | Geeignet wenn | Hauptrisiko | Entscheidungs-Gate |
| --- | --- | --- | --- |
| WorkBuddy oder CodeBuddy | Schnellster End-to-End-Test gesucht | Weniger Kontrolle über Harness und Telemetrie | Beendet das Produkt reale Aufgaben mit prüfbarer Evidenz? |
| Hosted API | Integration, Messung und Tool Calls nötig | Provider-Limits, Datenbedingungen und Serving-Varianz | Schlägt Kosten pro akzeptierter Aufgabe den Bestand? |
| Self-hosted FP8 | Stabiles Volumen, Data Control und GPU-Betrieb vorhanden | Kapital, Auslastung, Netzwerk, Updates und Bereitschaft | Schlägt gemessener TCO eine vertraglich gesicherte API? |

Nutzen Sie unser [Break-even-Modell für lokale LLMs und APIs](/de/blog/local-models-vs-apis-break-even-eu-2026/), bevor offene Gewichte zum Hardwarekauf werden. Der richtige Nenner sind akzeptierte Aufgaben, nicht theoretische Token.

## Zwei Wochen Pilot für Coding-Agenten

1. **20 bis 30 Aufgaben einfrieren:** reale Bugs, Navigation, Features, Testreparaturen, lange Dokumente und Tool-Fehler.
2. **Harness vergleichbar halten:** gleiche Commits, Anweisungen, Tools, Zeitlimits und Acceptance Tests.
3. **Kontext in Stufen testen:** kompakt, kuratiert groß und nahe am Maximum. Mehr Input ist nicht automatisch besser.
4. **Gesamtkosten erfassen:** Input, Cache-Hits, Output, Retries, Laufzeit und aktive Review-Minuten.
5. **Fehler erzwingen:** fehlgeschlagene Commands, fehlerhafte Ausgaben, veraltete Dateien und fehlende Abhängigkeiten.
6. **Sicherheitsgrenzen prüfen:** Daten klassifizieren, Rechte und Netzwerk begrenzen, Logs redigieren und riskante Aktionen genehmigen lassen.
7. **Nach Outcomes entscheiden:** nur skalieren, wenn Acceptance, Kosten, Review-Zeit oder Data Control besser werden.

## Welche kommerziellen Kennzahlen zählen?

- First-Pass-Acceptance-Rate und Kosten pro akzeptierter Änderung
- Long-Context-Retrieval an mehreren Positionen
- Gültige Tool Calls, Fehler-Recovery und sauberes Stop-Verhalten
- Relevante Tests und korrekte Interpretation von Fehlern
- P50- und P95-Durchlaufzeit inklusive Überdenken
- Sicherheitsausnahmen, Secret Exposure und manuelle Overrides

Wenn nicht ein Modell jede Rolle gewinnt, trennen Sie Routing von diesem Review. Unser [Buyer-Guide für Multi-Model-Coding-Agenten](/de/blog/multi-model-ai-coding-agent-stack-2026/) ordnet Planung, Umsetzung und unabhängige Prüfung nach gemessener Fähigkeit.

## Empfehlung

**Testen Sie Hy4, wenn lange Engineering-Läufe ein gemessener Engpass sind und eine reale Baseline existiert.** Beginnen Sie hosted, strukturieren Sie Repository-Kontext, messen Sie Cache-Verhalten und lassen Sie Tests statt Selbstvertrauen entscheiden.

Warten Sie, wenn Aufgaben gut in kleinere Fenster passen, verlässliche Tests fehlen oder niemand Provider-Risiko und Agentenrechte besitzt. Self-Hosting ist erst sinnvoll, wenn ein validierter Workload, Data-Control-Bedarf und stabile Auslastung 8 bis 16 Rechenzentrums-GPUs samt Betriebsteam rechtfertigen.

## Primärquellen und Aktualitätsgrenze

Architektur, Zugangswege, Preise, interne Evaluation und Startangebot stammen aus Tencents Ankündigung vom 28. August. Spezifikationen, öffentliche Evaluationen, Grenzen und Apache 2.0 kommen aus Model Card und Repository. Das Hardwareprofil stammt von vLLM. LongCodeBench liefert nur die allgemeine Prüfmethode und testete Hy4 nicht. Wavect hat Tencents Benchmark-Suite nicht reproduziert. Preise, Terms und Serving-Limits können sich nach dem 1. September 2026 ändern.

## Häufige Fragen zu Tencent Hy4 Preview

### Was ist Tencent Hy4 preview?

Hy4 preview ist ein Mixture-of-Experts-Sprachmodell des Tencent Hy Teams für Coding, Agentenworkflows, Office, Analyse, Spiele und Forschung. Der Backbone hat 770 Milliarden Gesamtparameter, davon 49 Milliarden aktiv pro Token, plus einen separaten MTP-Layer mit 10 Milliarden Parametern.

### Unterstützt Hy4 wirklich eine Million Token?

Ja. Die Model Card nennt 1M Kontext und das vLLM-Rezept 1.048.576 Token. Das ist Kapazität, kein Beweis für korrekten Recall bei maximaler Länge. Testen Sie Retrieval und Task-Erfolg in mehreren Kontextstufen.

### Ist Hy4 preview Open Source?

Tencent veröffentlicht Gewichte, FP8-Gewichte, Code, Fine-Tuning-Anleitung und Deployment-Rezepte unter Apache 2.0. Lizenz, Drittkomponenten, Modellverhalten und regulatorische Pflichten brauchen trotzdem eine Produktionsprüfung.

### Was kostet die Hy4-API?

Tencent nennt 0,834 US-Dollar je Million Input-Token, 2,501 US-Dollar für Output und 0,042 US-Dollar für Cache-Hits. Bestätigen Sie Live-Preis und Bedingungen beim gewählten Provider.

### Läuft Hy4 auf einem Laptop oder einer GPU?

Nicht in der offiziellen vollständigen Konfiguration. Das vLLM-Rezept nennt 16 B200 oder 8 B300 GPUs für FP8. Community-Quantisierungen brauchen eine eigene Qualitäts-, Leistungs- und Lizenzprüfung.

### Ist Hy4 besser als GLM-5.3 oder Kimi K3?

In Tencents blinder interner Evaluation lag Hy4 knapp vorn. Die Abstände waren klein und der Test kam vom Anbieter. Entscheiden Sie mit kontrollierten Aufgaben aus den eigenen Repositories, Tools, Sprachen und Acceptance-Kriterien.

### Was ist das größte Risiko für Coding-Agenten?

Die größten Risiken sind Kontextkapazität mit zuverlässiger Erinnerung zu verwechseln, unnötiges Reasoning zu bezahlen, Tool Calls ohne externe Kontrollen zu vertrauen und Self-Hosting vor einem wertstiftenden Hosted-Pilot zu beschaffen.

## Fazit

Hy4 preview verdient Aufmerksamkeit: Tencent verbindet ein außergewöhnlich großes offenes Modell, eine Million Token Kontext, agentenorientierten Tool-Support und aggressive Hosted-Preise. Der WorkBuddy-Dashboard-Test zeigt, dass der Stack Implementierung und Verifikation durch eine relevante Full-Stack-Aufgabe tragen kann.

Die Kaufentscheidung braucht trotzdem eigene Evidenz. Testen Sie reale Repositories, vergleichen Sie akzeptierte Änderungen, bepreisen Sie den ganzen Workflow und halten Sie Tool-Rechte sowie externe Tests unter Kontrolle.

## Das könnte dich auch interessieren..

[**Lokale Modelle vs APIs: der EU-Break-even** Berechnen Sie, wann Auslastung, Hardware, Energie, Betrieb und Data Control Self-Hosting rechtfertigen.](/de/blog/local-models-vs-apis-break-even-eu-2026/) [**Multi-Model-Stack für Coding-Agenten** Routen Sie Planung, Umsetzung und Prüfung nach gemessener Fähigkeit statt Modellhype.](/de/blog/multi-model-ai-coding-agent-stack-2026/)

Modelle und Infrastruktur

## In diesem Cluster weiterlesen

Modellauswahl, Inferenzkosten, lokaler Betrieb, Kompression und Serving-Architektur.

[Mit dem Grundlagenartikel starten**LLMs in der EU selbst hosten: Wann sich Open Weights wirklich rechnen**](/de/blog/self-hosting-llms-eu-cost/)

- [PageLM im Check: Selbst hosten und kommerziell nutzen](/de/blog/pagelm-self-hosted-ai-study-platform/)
- [M6 Mac mini vs. M5 Mac Studio für lokale KI: Kaufberatung](/de/blog/mac-mini-m6-vs-mac-studio-m5-local-ai/)
- [FreeToken AI im Test: Frontier-MoE auf Consumer-GPUs?](/de/blog/freetoken-ai-inference-engine-review/)
- [Darkbloom AI Test: Private Inferenz auf freien Macs](/de/blog/darkbloom-ai-private-inference-mac/)
- [Ox Alpha Free: Setup, Datenschutz und Kaufleitfaden](/de/blog/ox-alpha-free-ai-model-guide-2026/)

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

11 min Lesezeit · 1. September 2026 Zuletzt geprüft 1. September 2026

[**Weiter**](/de/blog/pagelm-self-hosted-ai-study-platform/)

## Structured Data

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@id": "https://wavect.io/#organization",
      "@type": [
        "Organization",
        "ProfessionalService",
        "LocalBusiness"
      ],
      "employee": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "founder": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "legalRepresentative": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "name": "Wavect GmbH",
      "subjectOf": {
        "@id": "https://wavect.io/verified-claims.json#dataset",
        "@type": "Dataset",
        "creator": {
          "@id": "https://wavect.io/#organization",
          "@type": [
            "Organization",
            "ProfessionalService",
            "LocalBusiness"
          ]
        },
        "description": "A machine-readable registry of quantitative and qualitative claims published by Wavect, with review dates, localized page appearances and public third-party citations where available.",
        "inLanguage": "en",
        "isAccessibleForFree": true,
        "license": "https://creativecommons.org/licenses/by/4.0/",
        "name": "Wavect verified publication claims",
        "url": "https://wavect.io/verified-claims.json"
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/team/kevin-riedl/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Kevin Riedl",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796365",
        "https://www.linkedin.com/in/wsdt",
        "https://github.com/wsdt"
      ],
      "url": "https://wavect.io/team/kevin-riedl/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/team/christof-jori/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Christof Jori",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796367",
        "https://www.linkedin.com/in/jocr77/",
        "https://github.com/jo-chris"
      ],
      "url": "https://wavect.io/team/christof-jori/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/#website",
      "@type": "WebSite",
      "inLanguage": [
        "en",
        "de",
        "es",
        "zh"
      ],
      "name": "Wavect",
      "potentialAction": {
        "@type": "SearchAction",
        "query-input": "required name=search_term_string",
        "target": {
          "@type": "EntryPoint",
          "urlTemplate": "https://wavect.io/search/?q={search_term_string}"
        }
      },
      "publisher": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/de/blog/tencent-hy4-preview-coding-agent-review/#webpage",
      "@type": "WebPage",
      "dateModified": "2026-09-01",
      "inLanguage": "de",
      "isPartOf": {
        "@id": "https://wavect.io/#website",
        "@type": "WebSite"
      },
      "lastReviewed": "2026-09-01",
      "url": "https://wavect.io/de/blog/tencent-hy4-preview-coding-agent-review/"
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "abstract": "Tencent Hy4 preview ist ein glaubwürdiger Pilotkandidat für lang laufende Coding-Agenten, aber kein automatischer Ersatz für ein bewährtes Produktionsmodell. Tencent nennt 770 Milliarden Backbone-Parameter, 49 Milliarden aktive Parameter pro Token, ein Kontextfenster mit einer Million Token und Apache 2.0. Die interne Evaluation mit 203 Aufgaben lag knapp vor GLM-5.3 und Kimi K3; öffentliche Benchmark-Einträge zeigen starke Coding-Werte. Beides beweist noch keine zuverlässige Codebasis-Retention im eigenen Stack. Hosted Access ist der praktische Startpunkt, denn die offizielle Self-Hosting-Anleitung zielt auf 8 B300 oder 16 B200 GPUs. Teams sollten repräsentative Repository-Aufgaben testen, akzeptierte Änderungen statt Roh-Token messen, Tool-Nutzung und Sicherheit prüfen und das bekannte Überdenken sowie Überprüfen als Kostenrisiko erfassen.",
  "articleBody": " Blog-Übersicht/AI und Agents/Modelle und Infrastruktur Tencent Hy4 Preview im Test: Lohnt sich das 1M-Kontextmodell? TL;DR Tencent Hy4 preview ist ein glaubwürdiger Pilotkandidat für lang laufende Coding-Agenten, aber kein automatischer Ersatz für ein bewährtes Produktionsmodell. Tencent nennt 770 Milliarden Backbone-Parameter, 49 Milliarden aktive Parameter pro Token, ein Kontextfenster mit einer Million Token und Apache 2.0. Die interne Evaluation mit 203 Aufgaben lag knapp vor GLM-5.3 und Kimi K3; öffentliche Benchmark-Einträge zeigen starke Coding-Werte. Beides beweist noch keine zuverlässige Codebasis-Retention im eigenen Stack. Hosted Access ist der praktische Startpunkt, denn die offizielle Self-Hosting-Anleitung zielt auf 8 B300 oder 16 B200 GPUs. Teams sollten repräsentative Repository-Aufgaben testen, akzeptierte Änderungen statt Roh-Token messen, Tool-Nutzung und Sicherheit prüfen und das bekannte Überdenken sowie Überprüfen als Kostenrisiko erfassen. Ja, Tencent Hy4 preview lohnt sich für einen kontrollierten Coding-Agent-Pilot, wenn lange Kontexte, mehrstufige Tool-Aufrufe oder wiederholtes Repository-Retrieval die Arbeit bremsen. Als Standard für jeden Produktionsworkflow ist das Modell noch zu früh. Es ist sehr groß, Self-Hosting ist ein Rechenzentrumsprojekt und Tencent nennt Überdenken sowie unnötig langes Überprüfen als bekannte Grenzen. Tencent veröffentlichte Hy4 preview am 28. August 2026 mit 770 Milliarden Backbone-Parametern, 49 Milliarden aktiven Parametern pro Token und mehr als einer Million Token Kontext. Die offizielle Tencent-Ankündigung nennt WorkBuddy, CodeBuddy, Tencent Cloud TokenHub und OpenRouter als Zugangswege. Zum Start kündigte Tencent zwei Wochen kostenlosen Zugang über WorkBuddy und CodeBuddy an. Dieser Review wurde am 1. September 2026 geprüft. Er beantwortet nur eine Frage: Soll ein Softwareteam Hy4 preview für lang laufende Coding-Aufgaben testen? Für die marktweite Auswahl bleibt unser Open-Weight-LLM-Vergleich zuständig. Die Architekturentscheidung zwischen Retrieval, Tuning und großem Kontext gehört in den RAG-vs-Fine-Tuning-vs-Long-Context-Leitfaden. Hy4 preview in 60 Sekunden Buyer-Zusammenfassung, geprüft am 1. September 2026 FrageGeprüfte AntwortBedeutung für Käufer Was ist Hy4?Ein MoE-Sprachmodell mit 770B Gesamt- und 49B aktiven ParameternSparse Aktivierung, aber kein kleiner 49B-Checkpoint Wie viel Kontext?1.048.576 Token im Serving-RezeptGroße Kapazität, aber keine Garantie für zuverlässigen Recall Welche Lizenz?Gewichte und Code unter Apache 2.0Kommerzielle Nutzung und Self-Hosting sind nach normaler Rechtsprüfung möglich Tool-Aufrufe?Ja, offizielle vLLM- und SGLang-Rezepte enthalten Tool- und Reasoning-ParserDer eigene Harness bleibt für Rechte und Recovery verantwortlich API-Preis?0,834 US-Dollar Input, 2,501 US-Dollar Output, 0,042 US-Dollar Cache-Hit je 1 Mio. TokenCache-Wiederverwendung kann lange Prompts wirtschaftlicher machen Self-Hosting?Offizielle Anleitung für 8 B300 oder 16 B200 GPUsHosted Evaluation kommt vor Hardwarebeschaffung Was ist Tencent Hy4 preview? Hy4 preview ist das Sparse-Mixture-of-Experts-Flaggschiff des Tencent Hy Teams für Coding, Office, Analyse, Spiele und Forschung. Die offizielle Hugging-Face-Model-Card dokumentiert 78 Backbone-Layer. Der erste nutzt ein Dense-FFN, die übrigen 77 enthalten je 256 Routing-Experten und einen Shared Expert. Pro Token werden acht Routing-Experten plus der Shared Expert aktiviert. Die 770B beziehen sich auf den Backbone. Ein nativer Multi-Token-Prediction-Layer ergänzt 10B Gesamtparameter und 0,7B aktive Parameter für Speculative Decoding. Deshalb zeigen einige Verzeichnisse 780B. Gated DeepSeek Sparse Attention, IndexCache über mehrere Layer und identity Hyper-Connections sollen lange Inputs sowie anhaltendes Reasoning effizienter machen. Gewichte, FP8-Variante, Fine-Tuning-Code, Deployment-Anleitung und Lizenz liegen im offiziellen Hy4-Repository von Tencent. Das ist relevante Offenheit. Es macht ein 770B-Modell noch nicht zum Laptop-Download. Was zeigte unser WorkBuddy-Coding-Test? Wir baten Hy4 preview in WorkBuddy, ein vollständig interaktives Benchmark-Dashboard für KI-Modelle zu bauen. Relevant war nicht nur das HTML. Das Modell schrieb die Kernlogik, baute Headless-Harnesses, prüfte JavaScript gegen ein Stub-DOM und testete Filter sowie Randfälle der Kostensimulation vor der Übergabe. Das ist ein positives Feldsignal, aber kein unabhängiger Benchmark. Ein gelungenes Dashboard beweist weder eine allgemeine Erfolgsrate noch Sicherheit oder Wirtschaftlichkeit. Es begründet eine klare Pilot-Hypothese: Hy4 kann wertvoll sein, wenn ein Agent Anforderungen, Implementierungsstand, Tests und Tool-Ausgaben über einen langen Lauf konsistent halten muss. Wie stark sind die Hy4-Benchmarks? Tencent ließ 163 interne Fachleute Ergebnisse zu 203 Engineering-Aufgaben blind bewerten. Hy4 erreichte durchschnittlich 2,99 von 4 Punkten, GLM-5.3 kam auf 2,92 und Kimi K3 auf 2,94. Gegen GLM-5.3 nennt",
  "articleSection": "KI-Modelle",
  "author": {
    "@id": "https://wavect.io/team/kevin-riedl/#person",
    "@type": "Person",
    "name": "Kevin Riedl",
    "sameAs": [
      "https://www.wikidata.org/wiki/Q139796365",
      "https://www.linkedin.com/in/wsdt",
      "https://github.com/wsdt"
    ],
    "url": "https://wavect.io/team/kevin-riedl/"
  },
  "citation": [
    {
      "@type": "WebPage",
      "name": "offizielle Tencent-Ankündigung",
      "url": "https://www.tencent.com/tencent-releases-and-open-sources-tencent-hy4-preview/"
    },
    {
      "@type": "WebPage",
      "name": "offizielle Hugging-Face-Model-Card",
      "url": "https://huggingface.co/tencent/Hy4-preview"
    },
    {
      "@type": "WebPage",
      "name": "offiziellen Hy4-Repository von Tencent",
      "url": "https://github.com/Tencent-Hunyuan/Hy4-preview"
    },
    {
      "@type": "WebPage",
      "name": "LongCodeBench-Studie",
      "url": "https://arxiv.org/abs/2505.07897"
    },
    {
      "@type": "WebPage",
      "name": "offizielle vLLM-Rezept",
      "url": "https://recipes.vllm.ai/tencent/Hy4-preview"
    }
  ],
  "dateModified": "2026-09-01",
  "datePublished": "2026-09-01",
  "description": "Tencent Hy4 preview ist ein glaubwürdiger Pilotkandidat für lang laufende Coding-Agenten, aber kein automatischer Ersatz für ein bewährtes Produktionsmodell. Tencent nennt 770 Milliarden Backbone-Parameter, 49 Milliarden aktive Parameter pro Token, ein Kontextfenster mit einer Million Token und Apache 2.0. Die interne Evaluation mit 203 Aufgaben lag knapp vor GLM-5.3 und Kimi K3; öffentliche Benchmark-Einträge zeigen starke Coding-Werte. Beides beweist noch keine zuverlässige Codebasis-Retention im eigenen Stack. Hosted Access ist der praktische Startpunkt, denn die offizielle Self-Hosting-Anleitung zielt auf 8 B300 oder 16 B200 GPUs. Teams sollten repräsentative Repository-Aufgaben testen, akzeptierte Änderungen statt Roh-Token messen, Tool-Nutzung und Sicherheit prüfen und das bekannte Überdenken sowie Überprüfen als Kostenrisiko erfassen.",
  "headline": "Tencent Hy4 Preview im Test: Lohnt sich das 1M-Kontextmodell?",
  "image": "https://wavect.io/img/blog/headers/header_tencent-hy4-preview-coding-agent-review.svg",
  "inLanguage": "de",
  "keywords": "KI-Modelle, Coding-Agenten",
  "mainEntityOfPage": {
    "@id": "https://wavect.io/de/blog/tencent-hy4-preview-coding-agent-review/",
    "@type": "WebPage"
  },
  "publisher": {
    "@id": "https://wavect.io/#organization",
    "@type": [
      "Organization",
      "ProfessionalService",
      "LocalBusiness"
    ]
  },
  "url": "https://wavect.io/de/blog/tencent-hy4-preview-coding-agent-review/",
  "wordCount": 1863
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/",
      "name": "Startseite",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/overview/",
      "name": "Blog-Übersicht",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/topics/ai-agents/",
      "name": "AI und Agents",
      "position": 3
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/clusters/models-infrastructure/",
      "name": "Modelle und Infrastruktur",
      "position": 4
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/tencent-hy4-preview-coding-agent-review/",
      "name": "Tencent Hy4 Preview: 1M-Kontext, Kosten & Test | ",
      "position": 5
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Hy4 preview ist ein Mixture-of-Experts-Sprachmodell des Tencent Hy Teams für Coding, Agentenworkflows, Office, Analyse, Spiele und Forschung. Der Backbone hat 770 Milliarden Gesamtparameter, davon 49 Milliarden aktiv pro Token, plus einen separaten MTP-Layer mit 10 Milliarden Parametern."
      },
      "name": "Was ist Tencent Hy4 preview?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Ja. Die Model Card nennt 1M Kontext und das vLLM-Rezept 1.048.576 Token. Das ist Kapazität, kein Beweis für korrekten Recall bei maximaler Länge. Testen Sie Retrieval und Task-Erfolg in mehreren Kontextstufen."
      },
      "name": "Unterstützt Hy4 wirklich eine Million Token?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Tencent veröffentlicht Gewichte, FP8-Gewichte, Code, Fine-Tuning-Anleitung und Deployment-Rezepte unter Apache 2.0. Lizenz, Drittkomponenten, Modellverhalten und regulatorische Pflichten brauchen trotzdem eine Produktionsprüfung."
      },
      "name": "Ist Hy4 preview Open Source?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Tencent nennt 0,834 US-Dollar je Million Input-Token, 2,501 US-Dollar für Output und 0,042 US-Dollar für Cache-Hits. Bestätigen Sie Live-Preis und Bedingungen beim gewählten Provider."
      },
      "name": "Was kostet die Hy4-API?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Nicht in der offiziellen vollständigen Konfiguration. Das vLLM-Rezept nennt 16 B200 oder 8 B300 GPUs für FP8. Community-Quantisierungen brauchen eine eigene Qualitäts-, Leistungs- und Lizenzprüfung."
      },
      "name": "Läuft Hy4 auf einem Laptop oder einer GPU?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "In Tencents blinder interner Evaluation lag Hy4 knapp vorn. Die Abstände waren klein und der Test kam vom Anbieter. Entscheiden Sie mit kontrollierten Aufgaben aus den eigenen Repositories, Tools, Sprachen und Acceptance-Kriterien."
      },
      "name": "Ist Hy4 besser als GLM-5.3 oder Kimi K3?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Die größten Risiken sind Kontextkapazität mit zuverlässiger Erinnerung zu verwechseln, unnötiges Reasoning zu bezahlen, Tool Calls ohne externe Kontrollen zu vertrauen und Self-Hosting vor einem wertstiftenden Hosted-Pilot zu beschaffen."
      },
      "name": "Was ist das größte Risiko für Coding-Agenten?"
    }
  ]
}
```
