Stand: 21. August 2026.
GLM-5.3 ist Z.ais aktuelles Flagship-Modell für komplexe Softwareentwicklung und lange Agentenaufgaben. Es ist über Z.ais API, den GLM Coding Plan und inzwischen auch über OpenRouter unter der Modell-ID z-ai/glm-5.3 verfügbar. Die angekündigten Open Weights sind dagegen am 21. August 2026 noch nicht veröffentlicht.
Der technisch interessanteste Punkt ist nicht eine neue Modellarchitektur, sondern das Gegenteil: GLM-5.3 verwendet laut Z.ai dasselbe Basismodell wie GLM-5.2. Die gemeldeten Fortschritte stammen vollständig aus zusätzlichem Post-Training. Z.ai hat dafür mehr Trainingsumgebungen, vielfältigere Langzeitaufgaben und zusätzliche Reinforcement-Learning-Rechenleistung eingesetzt. Das macht GLM-5.3 zu einem ungewöhnlich klaren Fall dafür, wie stark sich ein bestehendes Basismodell nach dem Pretraining noch verändern kann.
GLM-5.3 ist vor allem für Coding Agents, Repository-weite Aufgaben und lange Tool-Workflows interessant. Es bietet 1M Kontext, bis zu 128K Output, Always-on-Reasoning und kostet auf OpenRouter aktuell 1,40 US-Dollar pro Million Input-Tokens sowie 4,40 US-Dollar pro Million Output-Tokens; die öffentliche Z.ai-Preistabelle führt GLM-5.3 am 21. August noch nicht separat. Die öffentlichen Gewichte fehlen noch.
GLM-5.3: die wichtigsten Daten
| Merkmal | GLM-5.3 |
|---|---|
| Anbieter | Z.ai |
| Veröffentlichung | 14. August 2026 |
| Z.ai Modell-ID | glm-5.3 |
| OpenRouter-ID | z-ai/glm-5.3 |
| Eingabe | Text |
| Ausgabe | Text |
| Kontextfenster | 1M Tokens; OpenRouter: 1.048.576 Tokens |
| Maximale Ausgabe | 128K; OpenRouter: 131.072 Tokens |
| Reasoning | immer aktiviert |
| Reasoning-Stufen | low, high, max |
| Standard | max |
| OpenRouter-Input-Preis | $1,40 / 1 Mio. Tokens |
| OpenRouter Cache-Read | $0,26 / 1 Mio. Tokens |
| OpenRouter-Output-Preis | $4,40 / 1 Mio. Tokens |
| Open Weights | am 21.08.2026 noch nicht veröffentlicht |
| Lokale Nutzung | derzeit nicht möglich, solange die Gewichte fehlen |
Quellen: Z.ai GLM-5.3, OpenRouter GLM-5.3, Z.ai Pricing als GLM-5.2-Referenz.
Was ist GLM-5.3?
Z.ai veröffentlichte GLM-5.3 am 14. August 2026 als Nachfolger von GLM-5.2. Der Schwerpunkt liegt auf komplexer Softwareentwicklung, terminalbasierten Aufgaben, Tool-Nutzung und langen Agentenläufen.
Die Versionsnummer kann leicht den Eindruck erwecken, dass Z.ai erneut ein größeres oder grundsätzlich verändertes Basismodell trainiert hat. Genau das ist nicht der Fall. Im offiziellen Launch-Post schreibt Z.ai ausdrücklich, dass GLM-5.3 dasselbe Basismodell wie GLM-5.2 verwendet und alle Verbesserungen aus dem Post-Training stammen.
Z.ai nennt dafür drei zentrale Bausteine:
- mehr ausführbare Trainingsumgebungen,
- komplexere und längere Aufgaben,
- mehr Rechenleistung für Reinforcement Learning.
Zum Trainings-Stack gehört außerdem das Open-Source-Framework slime, das Megatron für Training und SGLang für Rollouts verbindet. Das slime-Repository beschreibt das System ausdrücklich als Framework für großskaliges RL-Post-Training.
Warum „dasselbe Basismodell“ wichtig ist
Die Aussage ist mehr als eine technische Fußnote. Sie verändert, wie die Benchmark-Sprünge interpretiert werden sollten.
Wenn ein Modell nach einem neuen Pretraining-Lauf besser wird, können zusätzliche Daten, Parameter, Architekturänderungen und Trainingscompute gleichzeitig die Ursache sein. Bei GLM-5.3 isoliert Z.ai den Effekt deutlich stärker: Das Basismodell blieb nach Herstellerangabe gleich, während das Post-Training weiter skaliert wurde.
Das Ergebnis ist ein nützlicher Hinweis auf einen allgemeinen Trend bei Coding-Modellen: Die Qualität der Agentenumgebungen, Verifier und Reinforcement-Learning-Pipelines wird zunehmend genauso relevant wie das Basismodell selbst.
Das heißt nicht, dass jeder Benchmarkgewinn automatisch auf reale Projekte übertragbar ist. Es macht die 5.2-zu-5.3-Differenz aber interessanter als einen gewöhnlichen Generationsvergleich.
GLM-5.3 Benchmarks: Wo die größten Sprünge liegen
Z.ai meldet in seiner eigenen Evaluation teilweise sehr große Verbesserungen gegenüber GLM-5.2.
| Benchmark | GLM-5.2 | GLM-5.3 | Differenz |
|---|---|---|---|
| Terminal-Bench 2.1 | 81,0 | 88,2 | +7,2 Pkt. |
| Terminal-Bench 3.0 | 4,6 | 28,3 | +23,7 Pkt. |
| DeepSWE v1.1 | 46,2 | 66,9 | +20,7 Pkt. |
| NL2Repo | 48,9 | 58,0 | +9,1 Pkt. |
| ProgramBench Almost Solved | 9,5 | 19,0 | +9,5 Pkt. |
| FrontierSWE | 67,5 | 78,1 | +10,6 Pkt. |
| SWE-Marathon v1.1 | 19,4 | 42,5 | +23,1 Pkt. |
| PostTrainBench | 31,7 | 39,8 | +8,1 Pkt. |
| CyberGym | 77,2 | 84,5 | +7,3 Pkt. |
| ExploitBench | 24,4 | 54,4 | +30,0 Pkt. |
| Toolathlon Verified | 59,9 | 73,0 | +13,1 Pkt. |
| AutomationBench v1.0.6 | 26,2 | 48,2 | +22,0 Pkt. |
| Agents’ Last Exam CLI | 23,8 | 28,5 | +4,7 Pkt. |
| HLE mit Tools | 54,7 | 62,5 | +7,8 Pkt. |
Datenquelle: Z.ai, 14. August 2026. Die Differenzen sind eigene Berechnungen aus den veröffentlichten Herstellerwerten.
Die größten Verbesserungen
Besonders auffällig sind fünf Tests:
- ExploitBench: +30,0 Punkte
- Terminal-Bench 3.0: +23,7 Punkte
- SWE-Marathon v1.1: +23,1 Punkte
- AutomationBench: +22,0 Punkte
- DeepSWE v1.1: +20,7 Punkte
Das passt zu Z.ais Trainingsschwerpunkt: Lange, ausführbare Aufgaben mit Werkzeugen und überprüfbaren Ergebnissen profitieren stärker als kurze Wissens- oder Standard-Coding-Aufgaben.
Die Benchmarkzahlen brauchen Kontext
Die Tabelle ist nützlich, aber sie ist kein unabhängiger Gesamttest. Die meisten Werte wurden von Z.ai selbst veröffentlicht.
Reuters weist ausdrücklich darauf hin, dass die Cybersecurity-Ergebnisse zum Launch nicht unabhängig verifiziert waren. Das ist für die Einordnung wichtig: Herstellerbenchmarks sind wertvoll, wenn Methodik und Einstellungen offengelegt werden, ersetzen aber keine unabhängigen Reproduktionen.
Z.ai dokumentiert erfreulich viele Details. Für verschiedene Tests werden unter anderem Agent-Harness, Reasoning-Stufe, Kontextbudget, Outputlimit, Anzahl der Rollouts und Timeout genannt. Bei Terminal- und Security-Benchmarks kommt etwa Claude Code als Harness zum Einsatz. Damit wird gleichzeitig deutlich, warum Benchmarkwerte nicht als reine „Modell-IQ-Zahl“ gelesen werden sollten: Harness, Tools, Zeitbudget und Tokenbudget sind Teil des Systems.
Was unabhängige Daten bisher sagen
Am 21. August ist die unabhängige Datenlage noch dünner als bei älteren Modellen, weil die Gewichte noch nicht frei verfügbar sind.
OpenRouters Live-Modellindex führt für z-ai/glm-5.3 aktuell von Artificial Analysis stammende Kennzahlen von:
- 59,5 im Intelligence Index,
- 74,8 im Coding Index,
- 59,1 im Agentic Index.
Diese Werte sind hilfreicher als reine Launch-Claims, sollten aber weiterhin als zeitabhängige Benchmarkstände betrachtet werden.
Ein Community-Test mit SlopCodeBench vom 20. August meldete auf einem kleinen, besonders anspruchsvollen Teilset 8 von 17 strikten Checkpoints. Der Autor beschreibt GLM-5.3 dort als ungefähr auf Augenhöhe mit Fable/Sol in demselben Teilset. Das ist interessant, aber kein Ersatz für eine große, kontrollierte Evaluation: Stichprobe, Agent-Setup und Kostenbudget sind zu klein, um daraus ein allgemeines Ranking abzuleiten.
Die sinnvollste Zwischenbilanz lautet deshalb:
GLM-5.3 zeigt sehr starke Herstellerwerte und erste positive unabhängige Signale, aber die breite Reproduktion beginnt erst richtig, wenn die Gewichte und mehr Provider verfügbar sind.
Z.ais „50 % besser beim Coding“: Was bedeutet das?
Z.ai bewirbt GLM-5.3 mit einem 50-prozentigen Coding-Zuwachs gegenüber GLM-5.2. Diese Zahl stammt aus Z.ai Code Bench, einem internen Benchmark.
Bei max Reasoning meldet Z.ai:
- GLM-5.2: 23,4 % bei ungefähr 96K Output-Tokens pro Aufgabe
- GLM-5.3: 34,5 % bei ungefähr 75K Output-Tokens
Bei high erreicht GLM-5.3 laut Hersteller 31,4 % bei etwa 50K Output-Tokens.
Der interessante Teil ist nicht nur der höhere Score. Z.ai behauptet gleichzeitig weniger Output-Tokens pro Aufgabe. Sollte sich das in unabhängigen Tests bestätigen, wäre das für Agenten relevant, weil lange Coding-Runs nicht nur von Qualität, sondern auch von Tokenkosten und Laufzeit abhängen.
Trotzdem sollte die 50-%-Zahl nicht als allgemeiner, unabhängiger Qualitätsvorsprung wiedergegeben werden. Der Test ist privat und nicht vollständig reproduzierbar.
GLM-5.3 auf OpenRouter
OpenRouter listet das Modell aktuell unter:
z-ai/glm-5.3
Der Live-Modellindex bestätigt:
- 1.048.576 Tokens Kontext,
- maximal 131.072 Completion-Tokens,
- Text-Input und Text-Output,
- Always-on-Reasoning,
low,highundmax,maxals Standard.
Außerdem existiert der Alias:
~z-ai/glm-latest
Dieser verweist derzeit auf GLM-5.3. Für produktive oder reproduzierbare Workflows ist die feste Modell-ID trotzdem die bessere Wahl: Ein latest-Alias kann später ohne Codeänderung auf eine neue Modellversion umschalten.
GLM-5.3 API-Preise
OpenRouter listet für den von Z.ai betriebenen GLM-5.3 am 21. August folgende Preise:
Die öffentliche Z.ai-Preisübersicht führt an diesem Tag noch GLM-5.2, nicht GLM-5.3. Die folgenden Werte sind deshalb als OpenRouter-Listenpreise angegeben; die direkte Z.ai-Abrechnung sollte nach einer Aktualisierung der Z.ai-Tabelle erneut geprüft werden.
| Tokenart | Preis pro 1 Mio. Tokens |
|---|---|
| Input | $1,40 |
| Cached Input | $0,26 |
| Cached Input Storage | zeitlich begrenzt kostenlos |
| Output | $4,40 |
Die OpenRouter-Listenpreise entsprechen den aktuellen GLM-5.2-Sätzen in der Z.ai-Preisübersicht. Daraus folgt nicht automatisch, dass jede direkte Z.ai-Abrechnung identisch bleibt.
Beispiel 1: kleine Coding-Session
1 Mio. Input + 200.000 Output-Tokens:
1 × $1,40 + 0,2 × $4,40 = $2,28
Ergebnis: $2,28
Beispiel 2: mittlerer Agentenlauf
10 Mio. Input + 2 Mio. Output:
10 × $1,40 + 2 × $4,40 = $22,80
Ergebnis: $22,80
Beispiel 3: intensiver Workflow mit Cache
Angenommen:
- 100 Mio. Input-Tokens insgesamt
- davon 80 Mio. als Cached Input
- 20 Mio. frischer Input
- 20 Mio. Output
Dann:
- 20 × $1,40 = $28,00
- 80 × $0,26 = $20,80
- 20 × $4,40 = $88,00
Gesamt: $136,80
Ohne Cache würden Input und Output zusammen $228 kosten. In diesem konstruierten Beispiel reduziert der Cache die Gesamtkosten um $91,20 bzw. 40 %.
Das ist der wichtigere praktische Hebel für lange Agentensitzungen: Wiederholt der Agent Repository-Kontext, Systemanweisungen und Historie, kann ein hoher Cache-Anteil stärker ins Gewicht fallen als kleine Unterschiede beim Listenpreis.
Reasoning lässt sich nicht mehr deaktivieren
GLM-5.3 unterscheidet sich hier klar von manchen Vorgängern. Z.ai unterstützt nur noch:
low
high
max
max ist der Standard und wird für komplexe Coding-Aufgaben empfohlen.
Ein gültiger Request sieht beispielsweise so aus:
{
"model": "glm-5.3",
"thinking": {
"type": "enabled"
},
"reasoning_effort": "max"
}
Wer bei GLM-5.2 noch explizit thinking.type: "disabled" gesetzt hat, muss die Konfiguration vor dem Modellwechsel anpassen. Z.ai warnt, dass die Anfrage sonst fehlschlägt.
GLM-5.3 per API aufrufen
Z.ai dokumentiert mehrere kompatible Schnittstellen:
- OpenAI Chat Completions
- OpenAI Responses
- Anthropic Messages
Ein einfacher cURL-Aufruf über die reguläre Z.ai-Chat-Completion-API:
curl -X POST "https://api.z.ai/api/paas/v4/chat/completions" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $ZAI_API_KEY" \
-d '{
"model": "glm-5.3",
"messages": [
{
"role": "user",
"content": "Analysiere dieses Repository und erstelle einen Plan für den Bugfix."
}
],
"thinking": {
"type": "enabled"
},
"reasoning_effort": "max",
"max_tokens": 4096
}'
Die Endpoint- und Parameterangaben stammen aus der aktuellen Z.ai-Dokumentation.
Warum Z.ai die Gewichte noch nicht veröffentlicht hat
Der ungewöhnlichste Teil des Launches betrifft Cybersecurity.
Z.ai trainierte GLM-5.3 unter anderem mit Umgebungen zur Schwachstellensuche. Nach eigenen Angaben stiegen die Fähigkeiten weiter entlang der Exploit-Kette stärker als erwartet.
Der Hersteller meldet:
- CyberGym: 77,2 → 84,5
- ExploitBench: 24,4 → 54,4
- ExploitGym: 29/39 → 105/130 gelöste Aufgaben bei den angegebenen 2h-/6h-Budgets
Z.ai erklärte deshalb am 14. August, die Gewichte erst ungefähr zwei Wochen später freizugeben, nachdem zusätzliche Safety-Evaluation und Hardening abgeschlossen sind. Reuters und Axios berichteten ebenfalls über diese verzögerte Veröffentlichung.
Zwei Wochen nach dem 14. August entsprechen ungefähr dem 28. August 2026. Das ist jedoch eine aus Z.ais Formulierung abgeleitete Orientierung und kein garantierter Release-Termin.
Am 21. August zeigt Z.ais offizielle Hugging-Face-Organisation weiterhin GLM-5.2, GLM-5.1 und GLM-5, aber kein öffentliches GLM-5.3-Weight-Repository.
Kann GLM-5.3 lokal auf einem Mac laufen?
Stand heute: nein, weil die Gewichte noch nicht veröffentlicht sind.
Aber auch nach dem Weight-Release wird die vollständige Variante für normale Macs extrem groß bleiben.
Z.ais Hugging-Face-Seite listet GLM-5.2 mit ungefähr 753 Milliarden Parametern; die offizielle README-Modellangabe nennt dagegen 744B-A40B — beide Angaben kursieren, je nach Zählweise und Quelle. Weil Z.ai ausdrücklich sagt, dass GLM-5.3 dasselbe Basismodell verwendet, lässt sich daraus eine grobe Speicherordnung ableiten. Das ist keine offizielle GLM-5.3-Dateigröße, sondern eine einfache Rohdatenrechnung.
| theoretisches Format | reine Parameterdaten bei 753B |
|---|---|
| FP16/BF16, 16 Bit | ca. 1.506 GB / 1,51 TB |
| FP8, 8 Bit | ca. 753 GB |
| 4 Bit | ca. 376,5 GB |
Dazu kommen je nach Runtime Metadaten, KV-Cache, temporäre Puffer und weitere Overheads.
Ein wichtiger MoE-Punkt: Auch wenn pro Token nur ein Teil der Parameter aktiv ist, müssen die Modellgewichte trotzdem verfügbar sein. „40B aktiv“ bedeutet daher nicht, dass ein mehrere hundert Milliarden Parameter großes Modell plötzlich in 40B-Modell-Speicher passt.
Für einen Mac mit 32 oder 64 GB Unified Memory ist die vollständige GLM-5.3-Klasse deshalb nicht realistisch als reiner In-Memory-Local-LLM-Run. Zur Einordnung der Speichergrenzen hilft der Unified-Memory-Leitfaden für Macs. Interessant werden eher:
- stark komprimierte oder distillierte Ableger,
- kleinere offizielle Varianten,
- Remote-Inferenz mit lokalem Agenten-Harness,
- Server-Offloading.
Eine exakte lokale Empfehlung sollte erst nach Veröffentlichung der Model Card und der tatsächlichen Weight-Shards erfolgen.
GLM-5.3 vs. GLM-5.2: Lohnt sich der Wechsel?
Für API-Nutzer spricht viel für einen Test, weil der Listenpreis gleich geblieben ist und Z.ai gerade bei langen Coding- und Agentenaufgaben deutliche Verbesserungen meldet.
Wechsel sinnvoll, wenn du …
- lange Coding-Agent-Runs ausführst,
- Repository-weite Änderungen bearbeitest,
- häufig Tools und Terminalzugriff nutzt,
- 1M Kontext tatsächlich ausnutzt,
- große Teile des Prompts cachen kannst,
- bereits GLM-5.2 einsetzt.
Weniger attraktiv, wenn du …
- Reasoning komplett abschalten möchtest,
- Bild- oder Video-Input brauchst,
- nur sehr kurze, einfache Textaufgaben hast,
- GLM-5.3 unbedingt lokal ausführen möchtest,
- vollständig unabhängige Benchmarkdaten als Voraussetzung brauchst.
Ist GLM-5.3 besser als GPT-5.6 Sol, Fable 5 oder Kimi K3?
Eine pauschale Antwort wäre unseriös.
Z.ais eigene Tabelle zeigt ein gemischtes Bild. GLM-5.3 ist auf einigen Agenten- und Automatisierungsbenchmarks sehr stark, während GPT-5.6 Sol oder Fable 5 bei anderen Coding- und Exploitation-Aufgaben vorne liegen.
Beispiele aus Z.ais Launch-Tabelle:
| Benchmark | GLM-5.3 | Kimi K3 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench 3.0 | 28,3 | 17,4 | 33,7 | 34,6 |
| DeepSWE v1.1 | 66,9 | 67,5 | 69,7 | 72,7 |
| CyberGym | 84,5 | 80,0 | 83,8 | 83,6 |
| ExploitBench | 54,4 | 32,2 | 78,0 | 76,5 |
| AutomationBench | 48,2 | 46,7 | 46,2 | 45,8 |
| Agents’ Last Exam | 28,5 | 27,6 | 23,8 | 28,6 |
Das zeigt zwei Dinge:
- GLM-5.3 ist keineswegs überall Spitzenreiter.
- Sein Profil ist für Agentenarbeit trotzdem ungewöhnlich konkurrenzfähig.
Für eine echte Kauf- oder Providerentscheidung sind Preis, Durchsatz, Cache-Verhalten und der konkrete Agent-Harness mindestens so wichtig wie ein einzelner Benchmark.
Für wen ist GLM-5.3 besonders interessant?
1. Coding Agents
Hier liegt der klare Schwerpunkt. Lange Tasks, Terminalarbeit, Tool Use und Repository-Kontext entsprechen genau den Umgebungen, auf die Z.ai das Post-Training ausgerichtet hat.
2. Agenten mit großem wiederverwendbarem Kontext
1M Kontext plus günstiger Cached Input kann attraktiv sein, wenn ein Workflow viele bereits bekannte Dateien oder lange Gesprächsverläufe erneut sendet.
3. Security-Teams
Die Cybersecurity-Ergebnisse sind bemerkenswert, sollten aber professionell eingeordnet werden. Z.ai selbst behandelt die Fähigkeiten als Dual-Use-Risiko und staffelt den Zugang.
4. Nutzer von GLM-5.2
Der Wechsel ist technisch relativ naheliegend, solange die Reasoning-Konfiguration angepasst wird. Der gleiche API-Preis senkt die Hürde für einen kontrollierten A/B-Test.
Was GLM-5.3 noch nicht ist
GLM-5.3 ist am 21. August 2026:
- kein frei herunterladbares Weight-Release,
- kein multimodales Vision-Modell,
- kein Modell mit abschaltbarem Reasoning,
- kein unabhängig vollständig bestätigter Benchmark-Sieger,
- kein realistischer Full-Model-Download für einen normalen Mac.
Diese Einschränkungen sind wichtiger als die Marketingbegriffe „frontier“ oder „SOTA“, weil sie bestimmen, ob das Modell für einen konkreten Workflow überhaupt passt.
Fazit: GLM-5.3 ist vor allem ein Post-Training-Upgrade
GLM-5.3 ist technisch interessanter als ein gewöhnliches Versionsupdate. Z.ai hat kein neues Basismodell trainiert, sondern denselben Unterbau wie bei GLM-5.2 mit zusätzlichem Post-Training deutlich weitergetrieben.
Die stärksten veröffentlichten Verbesserungen liegen bei langen Coding-, Terminal-, Agenten- und Cybersecurity-Aufgaben. Gleichzeitig bleiben zwei Vorbehalte: Viele der spektakulärsten Zahlen stammen vom Hersteller selbst, und die Gewichte sind noch nicht öffentlich.
Für API-Nutzer ist GLM-5.3 bereits ein ernstzunehmender Kandidat, vor allem wenn GLM-5.2 bisher gut in den Workflow gepasst hat. Für lokale Nutzer ist der interessantere Termin der tatsächliche Weight-Release. Erst dann lassen sich Lizenz, Quantisierungen, Inferenz-Frameworks und realer Speicherbedarf sauber bewerten.
Häufig gestellte Fragen
Ist GLM-5.3 auf OpenRouter verfügbar?
Ja. Die Modell-ID lautet `z-ai/glm-5.3`. OpenRouters Live-Modellindex führt das Modell mit 1.048.576 Tokens Kontext und bis zu 131.072 Completion-Tokens.
Was kostet GLM-5.3?
Auf OpenRouter kostet GLM-5.3 aktuell $1,40 pro Million Input-Tokens, $0,26 pro Million Cache-Read-Tokens und $4,40 pro Million Output-Tokens.
Hat GLM-5.3 1M Kontext?
Ja. Z.ai dokumentiert ein 1M-Kontextfenster. OpenRouter nennt exakt 1.048.576 Tokens.
Wie lang kann GLM-5.3 antworten?
Z.ai nennt maximal 128K Output-Tokens. OpenRouter listet 131.072 maximale Completion-Tokens.
Kann man Reasoning deaktivieren?
Nein. GLM-5.3 arbeitet immer mit Reasoning. Unterstützt werden `low`, `high` und `max`; Standard ist `max`.
Kann ich GLM-5.3 lokal herunterladen?
Am 21. August 2026 noch nicht. Z.ai hatte angekündigt, die Gewichte ungefähr zwei Wochen nach dem Launch am 14. August zu veröffentlichen.
Ist GLM-5.3 Open Source?
Z.ai positioniert das Modell als Open-Weights/Open-Source-Release, aber die GLM-5.3-Gewichte und die finale Model Card sind am 21. August noch nicht öffentlich. Die konkrete Lizenz sollte deshalb erst nach dem Weight-Release endgültig angegeben werden.
Ist GLM-5.3 besser als GLM-5.2?
In Z.ais veröffentlichten Coding- und Agentenbenchmarks fast durchgehend deutlich. Besonders groß sind die gemeldeten Sprünge bei Terminal-Bench 3.0, DeepSWE, SWE-Marathon, AutomationBench und ExploitBench. Unabhängige Tests sind noch weniger umfangreich.
Transparenz
Quellen und Prüfgrundlage
Diese Primär- und Referenzquellen bilden die Grundlage der technischen Einordnung. Herstellerangaben und externe Benchmarks werden im Artikel als solche gekennzeichnet.
- z.ai blog / glm-5.3
- docs.z.ai llm / glm-5.3
- docs.z.ai overview / pricing
- docs.z.ai overview / migrate-to-glm-new
- docs.z.ai capabilities / thinking-mode
- docs.z.ai capabilities / cache
- docs.z.ai devpack / overview
- docs.z.ai devpack / latest-model
- docs.z.ai llm / chat-completion
- z.ai subscribe
- z.ai blog / glm-5
- z.ai blog / scaling-pain
- github.com THUDM / slime
- huggingface.co zai-org
- openrouter.ai v1 / models
- github.com harbor-framework / terminal-bench-1
- github.com sunblaze-ucb / cybergym
- github.com sunblaze-ucb / exploitgym
- github.com exploitbench / exploitbench
- github.com main / SUBMISSION.md
- github.com sunblaze-ucb / cybergym-e2e
- github.com main / CHANGELOG.md
- reuters.com technology / chinas-zai-says-new-model-nears-anthropics-mythos-5-cyber-defence-tests-2026-08-14
- wired.com story / zai-open-weight-ai-models-release-cybersecurity-hacking
- axios.com 14 / china-open-source-ai-glm-53
- scmp.com 3364077 / zhipu-launches-flagship-model-glm-53-china-seeks-mythos-level-edge-cyber-defence
- artificialanalysis.ai models / glm-5
- artificialanalysis.ai comparisons / glm-5-2-vs-gpt-5-3-codex
- reddit.com 1vtnnf0 / glm_53_slopcodebench_results
- reddit.com 1vr3c7p / i_tested_glm53_deepseek_v4_proflash_gemini_37
- reddit.com 1vsoehz / why_is_there_so_little_glm53_testing_to_read
- reddit.com 1vskfzh / glm53_is_out_on_aa_and_im_fed_up_with_their
- openrouter.ai z-ai / glm-5.3