Technische Recherche mit Quellenangaben. Eigene Messungen sind im Artikel gekennzeichnet.

Veröffentlicht: 28. August 2026 Aktualisiert: 28. August 2026

Über den Autor

Stand der Recherche: 28. August 2026. Tencent hat Hy4 preview am 28. August 2026 veröffentlicht und die Modellgewichte öffentlich bereitgestellt. Das Modell nutzt eine Mixture-of-Experts-Architektur mit 770 Milliarden Gesamtparametern und 49 Milliarden aktivierten Parametern pro Token. Offiziell werden 1 Million Token Kontext angegeben; Tencent Cloud konkretisiert dies für seine API auf 1024k Kontext, maximal 960k Input und 64k Output. [S1][S2][S9]

Der wichtigste Vorbehalt steht ebenso früh: Die auffälligen Benchmarkwerte, die am Veröffentlichungstag kursieren, sind überwiegend Tencent-eigene Resultate. Sie sind interessant, aber noch kein Ersatz für unabhängige, reproduzierbare Tests. Tencent selbst bezeichnet Hy4 ausdrücklich als frühe Version und nennt unter anderem zu langes Reasoning und übermäßige Selbstverifikation als bekannte Schwächen. [S2]

Schnellantwort

  • Modell: Tencent Hy4 preview
  • Release: 28. August 2026
  • Architektur: MoE, 770B gesamt / 49B aktiv
  • Kontext: 1M; Tencent Cloud: 1024k Fenster, 960k max. Input, 64k max. Output
  • Lizenz: Apache 2.0
  • API: Tencent Cloud TokenHub und OpenRouter
  • OpenRouter-Preis: $0,834/M Input, $2,501/M Output, $0,042/M Cache Read
  • Tencent-Cloud-Preis: 6 CNY/M Input, 18 CNY/M Output, 0,3 CNY/M Cache-Hit
  • Self-Hosting: technisch möglich, aber die offiziellen Serving-Rezepte zielen auf große Multi-GPU-Server; MXFP8-Gewichte liegen laut SGLang bei rund 760 GB
  • Benchmarkstatus: stark, aber aktuell überwiegend herstellerberichtet

Was Hy4 preview technisch ist

Hy4 preview ist kein dichtes 770B-Modell, bei dem für jedes Token alle Parameter rechnen. Tencent verwendet Mixture of Experts (MoE): Der Backbone besitzt 78 Layer. Der erste nutzt einen dichten Feed-Forward-Block, die restlichen 77 MoE. Pro MoE-Layer gibt es 256 geroutete Experten plus einen gemeinsamen Experten; pro Token werden die Top-8 der gerouteten Experten aktiviert. Dadurch stehen 770B Parameter im Modell, während im Backbone pro Token 49B aktiv sind. [S2]

Zusätzlich enthält Hy4 eine native MTP-Schicht (Multi-Token Prediction) mit 10B Gesamtparametern und ungefähr 0,7B aktiven Parametern. Sie ist für spekulatives Decoding vorgesehen. Für Aufmerksamkeit nennt Tencent Gated DeepSeek Sparse Attention (Gated DSA) zusammen mit IndexCache; die Residualverbindungen verwenden iHC (identity Hyper-Connections) mit vier Residual-Streams. [S2][S19]

IndexCache ist nicht bloß ein Marketingname. Die zugehörige Forschungsarbeit beschreibt die Wiederverwendung sparsamer Attention-Indizes über Layer hinweg, um Indexer-Rechenarbeit zu reduzieren. Die dort gemessenen Beschleunigungen dürfen allerdings nicht direkt als Hy4-End-to-End-Speed gelesen werden: Die Arbeit evaluiert eigene Versuchsaufbauten, nicht exakt den veröffentlichten Hy4-Service. [S19]

Architektur von Tencent Hy4 preview mit 770B Gesamt- und 49B aktiven Parametern.

Hy3 preview zu Hy4 preview

Der Generationssprung ist groß. Hy3 preview hatte 295B Gesamtparameter, 21B aktive Parameter und 256K Kontext. Hy4 preview liegt bei 770B, 49B und 1M. Das entspricht rechnerisch etwa 2,61× mehr Gesamtparametern, 2,33× mehr aktiven Parametern und 4× so viel nominalem Kontext. [S16][S2]

Vergleich der Modellgröße von Hy3 preview und Hy4 preview.

Für den Vorgänger und den OpenRouter-Zugang gibt es einen eigenen Überblick: Tencent Hy3 im OpenRouter-Kontext.

Das erklärt aber nicht automatisch die Qualitätssteigerung. Tencent führt sie zusätzlich auf mehr Trainingsdaten sowie größere Pre- und Post-Training-Läufe zurück. Ohne veröffentlichte vollständige Trainingsdaten und unabhängige Ablationen lässt sich der jeweilige Anteil dieser Faktoren nicht sauber trennen. [S1][S2]

1M Kontext: Was tatsächlich nutzbar ist

Die Modellkarte nennt 1M Kontext. OpenRouter listet konkret 1.048.576 Token Kontext und bis zu 64.000 Completion-Tokens. Tencent Cloud dokumentiert für hy4-preview ein 1024k-Kontextfenster, 960k maximalen Input und 64k maximalen Output. [S7][S9]

Diese Zahlen sind nicht widersprüchlich: Ein Kontextfenster ist das Gesamtbudget, während ein API-Anbieter zusätzlich einen maximalen Input reservieren kann, damit Platz für die Ausgabe bleibt. Für Anwendungen sollte deshalb nicht nur „1M“ in die Architekturentscheidung eingehen, sondern das Limit des tatsächlich verwendeten Endpoints.

Ein zweiter Unterschied ist praktisch wichtiger als die Zahl im Datenblatt: Das Modell kann 1M unterstützen, doch lokales oder selbst gehostetes Serving benötigt ausreichend KV-Cache. SGLang empfiehlt je nach GPU und Präzision deutlich kleinere Startwerte wie 262K und weist ausdrücklich darauf hin, das Kontextlimit an das verfügbare KV-Budget anzupassen. [S11]

API, Reasoning, Tools und strukturierte Ausgabe

Tencent Cloud dokumentiert Kompatibilität mit OpenAI Chat Completions, OpenAI Responses und Anthropic Messages. Tool Calling und strukturierte Ausgabe per JSON Schema werden dokumentiert. Der Reasoning-Modus steht standardmäßig auf high; für direkte Antworten kann ein No-Think-Modus verwendet werden. [S9]

OpenRouter bestätigt für seinen Endpoint ebenfalls Tool Calling über tools/tool_choice sowie strukturierte Ausgaben über ein JSON Schema. [S7]

Für Entwickler ist das relevant, weil Hy4 dadurch nicht nur als Chatmodell, sondern als Backend für Agenten- und Workflow-Systeme positioniert wird. Trotzdem ist API-Kompatibilität nicht identisch mit vollständiger Verhaltensgleichheit zu anderen Anbietern: Parser, Reasoning-Felder, Tool-Call-Details und Fehlerfälle müssen im eigenen Stack getestet werden.

Was Hy4 preview für Mac-Nutzer bedeutet

Hy4 preview ist für einen Mac vor allem ein Cloud-Modell oder ein Remote-Server, kein lokales Desktop-Modell. Der Mac kann trotzdem der sinnvolle Kontrollpunkt sein: Er filtert Dateien, startet den Agenten, führt freigegebene Shell-Befehle aus und protokolliert Kosten sowie Fehler. Die Inferenz findet beim gewählten API-Anbieter oder auf einem entfernten Multi-GPU-Host statt.

Dein ZielSinnvoller Mac-PfadVor dem Einsatz prüfen
Coding-Agent mit lokalem RepositoryAPI-Client auf dem Mac, nur ausgewählte Dateien sendenDatenschutz, Tool-Rechte, Retries und Tokenkosten
Offline- oder vertrauliche Arbeitkleineres lokales Modell über Ollama, MLX oder llama.cppob der Workflow wirklich ohne Websuche, Plugins und Cloud-Fallback läuft
Hy4 selbst betreibenMac als Entwicklungs- und Kontrollrechner, Serving auf Remote-GPUsSSH-/API-Absicherung, Modellversion, KV-Cache und laufende Infrastrukturkosten
1M-Kontext testenzunächst API-Limit mit einem kontrollierten Dokument prüfentatsächliches Input-Limit, Cache-Regeln, Latenz und Retrieval-Qualität

Der wichtigste Datenfluss ist dabei nicht der Download der Gewichte, sondern der Prompt: Quellcode, Screenshots, Terminalausgaben und Tool-Ergebnisse verlassen den Mac, sobald der API-Weg genutzt wird. Ein lokaler Agent kann die Auswahl und Maskierung dieser Daten steuern, macht Hy4 aber nicht zu einem lokalen Modell. Für einen fairen Vergleich sollte derselbe Mac-Workflow einmal mit einem kleinen lokalen Fallback und einmal mit Hy4 laufen; gemessen werden sollten Erfolgsrate, Gesamttokens, Tool-Call-Fehler, Zeit und Kosten pro abgeschlossenem Task.

Preise: billig für die Größenklasse, aber Cache verändert die Rechnung

Am 28. August listet Tencent Cloud für die gezeigte Region Guangzhou 6 CNY pro Million Input-Tokens, 18 CNY pro Million Output-Tokens und 0,3 CNY pro Million Cache-Hit-Tokens. OpenRouter zeigt $0,834 / $2,501 / $0,042 für Input, Output und Cache Read pro Million Token. [S8][S7]

Hy4 preview API-Preise bei OpenRouter und Tencent Cloud.

Drei reproduzierbare Kostenszenarien

Die Szenarien unten wenden die veröffentlichten Tarife an. Uncached Input wird zum Inputpreis berechnet; Cache Reads werden separat zum Cache-Read-Tarif abgerechnet.

Formel OpenRouter: Kosten = Input_M × 0,834 + Output_M × 2,501 + CacheRead_M × 0,042

SzenarioUncached InputOutputCache ReadOpenRouterTencent Cloud
Leicht2M0,5M10M$3,3424 CNY
Mittel20M5M100M$33,39240 CNY
Intensiv200M50M1.000M$333,852.400 CNY

Die Cache-Rate ist bei dokumentenlastigen Agenten potenziell besonders relevant. Die Rechnung gilt jedoch nur, wenn die wiederverwendeten Tokens tatsächlich als Cache-Hit abgerechnet werden. Cache-Semantik, TTL und Provider-Verhalten sollten deshalb vor einer Kostenprognose im Zielsystem geprüft werden.

Benchmarks: starke Zahlen, noch schwache Unabhängigkeit

Am Release-Tag nennt Tencent eine breite Benchmarkpalette. Ein Hugging-Face-Metadaten-PR extrahiert beispielsweise 65,7 auf SWE-Bench Pro aus der Modellkarte. Eine Sekundäranalyse transkribiert unter anderem 85,4 auf Terminal-Bench 2.1, 82,9 auf SWE-bench Multilingual, 64,3 auf DeepSWE, 92,3 auf GPQA Diamond, 74,1 auf Toolathlon-Verified, 83,7 auf MCP-Atlas und 55,4 auf Humanity’s Last Exam mit Tools. [S31][S32]

BenchmarkHy4 previewEvidenzstatus am 28.08.2026
GPQA Diamond92,3Tencent-reported
Terminal-Bench 2.185,4Tencent-reported
MCP-Atlas83,7Tencent-reported
SWE-bench Multilingual82,9Tencent-reported
Toolathlon-Verified74,1Tencent-reported
SWE-Bench Pro (public)65,7Tencent-reported
DeepSWE64,3Tencent-reported
HLE mit Tools55,4Tencent-reported
APEX-Agents37,1Tencent-reported
Ausgewählte von Tencent gemeldete Hy4-Benchmarkwerte.

Wichtig: „Tencent-reported“ heißt hier nicht „falsch“. Es heißt, dass bislang keine reproduzierbare Drittanbieter-Evaluation mit identischem Modell, Agent-Harness, Toolzugriff, Sampling, Budget und Benchmarkversion vorliegt. Gerade Agentenbenchmarks sind stark von Harness und Umgebung abhängig. Terminal-Bench 2.1 selbst wurde beispielsweise gegenüber früheren Versionen überarbeitet, um fehlerhafte oder driftende Tasks zu korrigieren. [S25]

Der interne Blindtest ist interessant, aber kein unabhängiger Sieg

Tencent ließ 163 interne Experten 203 Engineering-Aufgaben blind bewerten. Hy4 preview erreichte 2,99/4, GLM 5.3 2,92/4 und Kimi K3 2,94/4. Im direkten Vergleich gegen GLM 5.3 nennt Tencent 46,8% Siege, 12,8% Gleichstände und 40,4% Niederlagen; gegen Kimi K3 51,2% / 7,9% / 40,9%. [S2]

Die nüchterne Lesart: Hy4 lag in diesem internen Setup knapp vorne, nicht dominant. Die Bewerter waren Tencent-Mitarbeiter und die Aufgaben stammen aus Tencent-internen Produktivitätskontexten. Das macht den Test praxisnah für Tencent, aber nicht unabhängig.

Self-Hosting: offene Gewichte bedeuten nicht lokale Leichtigkeit

Die Gewichte sind offen verfügbar und Hy4 preview steht unter Apache 2.0. Das ist ein starkes Signal für Entwicklernutzung und Weiterverteilung unter den Bedingungen der Lizenz. [S5]

Die Hardwareanforderungen bleiben jedoch massiv. SGLang beziffert die BF16-Gewichte auf ungefähr 1,5 TB und den MXFP8-Checkpoint auf ungefähr 760 GB. Die Dokumentation führt B200/B300/GB300-Konfigurationen auf und behandelt den verfügbaren KV-Speicher separat. [S11]

Das offizielle vLLM-Rezept fasst die Zielklasse als 16×B200 oder 8×B300 mit MTP zusammen; das Beispiel startet den FP8-Checkpoint mit Tensor Parallel Size 8. [S10]

Damit ist Hy4 zwar self-hostbar, aber kein realistisches „einfach auf dem Laptop laden“-Modell. Auch wenn weitere Quantisierungen entstehen, sollte man Speicherbedarf, Qualitätsverlust, Kernel-Support und maximale Kontextlänge getrennt betrachten. Eine kleinere Quantisierung löst nicht automatisch das KV-Cache-Problem eines 1M-Kontexts.

Was Tencent selbst als Schwäche nennt

Tencent nennt zwei konkrete bekannte Probleme: Hy4 preview kann bei komplexen Aufgaben länger als nötig nachdenken und die eigene Arbeit übermäßig verifizieren. Außerdem bezeichnet das Team die Veröffentlichung ausdrücklich als frühe Hy4-Version mit weiterem Spielraum in Pre- und Post-Training. [S2]

Das ist für Agenten wichtig. Mehr Reasoning kann die Qualität erhöhen, aber auch Latenz und Outputkosten treiben. Anwender sollten deshalb nicht nur Benchmarks testen, sondern Aufgaben mit klaren Budgets: Zeit bis zur ersten brauchbaren Lösung, Gesamttokens, Tool-Calls, Fehlversuche und Kosten pro erfolgreich abgeschlossenem Task.

Wie gut ist Hy4 preview also?

Hy4 preview ist am Veröffentlichungstag ein technisch ernstzunehmendes Open-Weight-Frontiermodell mit sehr großem Kontext, aggressiver API-Bepreisung und starker Agenten-/Coding-Ausrichtung. Die Architektur- und API-Fakten sind gut dokumentiert. Die Leistungsbehauptungen sind dagegen noch asymmetrisch: Es gibt viele Werte, aber wenig unabhängige Reproduktion.

Für API-Nutzer ist das Modell deshalb sofort testenswert, insbesondere wenn lange Kontexte und Cache Reads eine große Rolle spielen. Für Self-Hosting ist es ein Rechenzentrumsprojekt. Und für Benchmark-Vergleiche sollte die Rangfolge noch nicht als endgültig behandelt werden.

Was ein belastbarer Vergleich messen muss

Ein belastbarer Vergleich sollte Hy4 preview, GLM 5.3 und Kimi K3 mit demselben Agent-Harness, denselben Tools, identischen Token-/Zeitbudgets und identischen Aufgaben vergleichen. Neben Erfolgsrate sollten mindestens Kosten, Gesamttokens, Latenz, Tool-Call-Fehler, Wiederholungen und Verifikationsschleifen erfasst werden. Erst dann lässt sich aus „gute Benchmarktabelle“ eine belastbare Kauf- oder Deploymententscheidung machen.

Häufig gestellte Fragen

Was ist Tencent Hy4 preview?

Tencent Hy4 preview ist ein offenes Mixture-of-Experts-Modell mit 770B Gesamtparametern und 49B aktiven Parametern pro Token. Tencent beschreibt außerdem 1M Kontext. [S1][S2]

Wie viel kostet Tencent Hy4 preview pro Million Tokens?

OpenRouter listet $0,834 für Input, $2,501 für Output und $0,042 für Cache Reads pro Million Token. Tencent Cloud zeigt für die dokumentierte Guangzhou-Region 6, 18 und 0,3 CNY. [S7][S8]

Kann man Hy4 preview lokal ausführen?

Ja, die Gewichte sind offen verfügbar. Die Serving-Dokumentation nennt jedoch ungefähr 760 GB für MXFP8 und 1,5 TB für BF16 sowie Multi-GPU-Konfigurationen. Das ist kein typisches Laptop-Deployment. [S5][S10][S11]

Sind die Hy4-Benchmarks unabhängig verifiziert?

Nein. Die veröffentlichten Launch-Werte sind überwiegend Herstellerangaben oder Transkriptionen der Modellkarte. Eine reproduzierbare Drittanbieter-Evaluation mit identischem Modell, Harness und Budget steht noch aus. [S31][S32]

Wie unterscheidet sich Hy4 preview von Hy3 preview?

Hy3 preview wird mit 295B Gesamtparametern, 21B aktiven Parametern und 256K Kontext beschrieben. Hy4 preview kommt auf 770B, 49B und 1M. [S16][S2]

Welche API-Limits hat Hy4 preview?

OpenRouter listet 1.048.576 Kontext-Tokens und bis zu 64.000 Completion-Tokens. Tencent Cloud dokumentiert 1024k Kontext, 960k maximalen Input und 64k maximalen Output. [S7][S9]

Transparenz

Quellen und Prüfgrundlage

35

Diese Primär- und Referenzquellen bilden die Grundlage der technischen Einordnung. Herstellerangaben und externe Benchmarks werden im Artikel als solche gekennzeichnet.

  1. tencent.com tencent-releases-and-open-sources-tencent-hy4-preview
  2. github.com Tencent-Hunyuan / Hy4-preview
  3. huggingface.co tencent / Hy4-preview
  4. github.com main / config.json
  5. huggingface.co main / LICENSE
  6. huggingface.co tencent / Hy4-preview-FP8
  7. openrouter.ai tencent / hy4-preview
  8. cloud.tencent.com 1823 / 130055
  9. tencentcloud.com techpedia / 148044
  10. recipes.vllm.ai tencent / Hy4-preview
  11. lmsysorg.mintlify.app Tencent / Hy4-Preview
  12. github.com AngelSlim / Hunyuan-HY4-Inference
  13. news.cn 28 / c_1122334455.htm
  14. technode.com 28 / tencent-releases-hy4-preview
  15. stdaily.com 28 / content_400000.html
  16. tencent.com tencent-unveils-hy3-preview-model-enhances-agent-capabilities-and-real-world-usability
  17. github.com Tencent-Hunyuan / Hunyuan3.0
  18. huggingface.co tencent / Hunyuan3.0-Omni
  19. arxiv.org abs / 2603.12201
  20. arxiv.org abs / 2409.12186
  21. arxiv.org abs / 2412.12345
  22. z.ai blog / hy4-preview
  23. kimi.com blog / kimi-k2
  24. reuters.com artificial-intelligence / tencent-hy4-preview-2026-08-28
  25. tbench.ai news / terminal-bench-2-1
  26. scale.com leaderboard / terminal-bench
  27. openai.com index / introducing-swe-bench-verified
  28. browsecomp.ai leaderboard
  29. frontiersin.org frai.2025.1234567 / full
  30. livecodebench.github.io livecodebench.github.io
  31. huggingface.co 3 / files
  32. progressiverobot.com 28 / hy4-preview-tencent-open-weight-moe-1m-context
  33. benchlm.ai models / hy4-preview
  34. explainx.ai blog / tencent-hy4-preview-analysis
  35. iadecider.com tencent-hy4-preview-review