Technische Recherche mit Quellenangaben. Eigene Messungen sind im Artikel gekennzeichnet.

Veröffentlicht: 21. August 2026 Aktualisiert: 21. August 2026

Über den Autor

Stand: 21. August 2026.

GLM-5.3 ist Z.ais aktuelles Flagship-Modell für komplexe Softwareentwicklung und lange Agentenaufgaben. Es ist über Z.ais API, den GLM Coding Plan und inzwischen auch über OpenRouter unter der Modell-ID z-ai/glm-5.3 verfügbar. Die angekündigten Open Weights sind dagegen am 21. August 2026 noch nicht veröffentlicht.

Der technisch interessanteste Punkt ist nicht eine neue Modellarchitektur, sondern das Gegenteil: GLM-5.3 verwendet laut Z.ai dasselbe Basismodell wie GLM-5.2. Die gemeldeten Fortschritte stammen vollständig aus zusätzlichem Post-Training. Z.ai hat dafür mehr Trainingsumgebungen, vielfältigere Langzeitaufgaben und zusätzliche Reinforcement-Learning-Rechenleistung eingesetzt. Das macht GLM-5.3 zu einem ungewöhnlich klaren Fall dafür, wie stark sich ein bestehendes Basismodell nach dem Pretraining noch verändern kann.

GLM-5.3 ist vor allem für Coding Agents, Repository-weite Aufgaben und lange Tool-Workflows interessant. Es bietet 1M Kontext, bis zu 128K Output, Always-on-Reasoning und kostet auf OpenRouter aktuell 1,40 US-Dollar pro Million Input-Tokens sowie 4,40 US-Dollar pro Million Output-Tokens; die öffentliche Z.ai-Preistabelle führt GLM-5.3 am 21. August noch nicht separat. Die öffentlichen Gewichte fehlen noch.

GLM-5.3: die wichtigsten Daten

MerkmalGLM-5.3
AnbieterZ.ai
Veröffentlichung14. August 2026
Z.ai Modell-IDglm-5.3
OpenRouter-IDz-ai/glm-5.3
EingabeText
AusgabeText
Kontextfenster1M Tokens; OpenRouter: 1.048.576 Tokens
Maximale Ausgabe128K; OpenRouter: 131.072 Tokens
Reasoningimmer aktiviert
Reasoning-Stufenlow, high, max
Standardmax
OpenRouter-Input-Preis$1,40 / 1 Mio. Tokens
OpenRouter Cache-Read$0,26 / 1 Mio. Tokens
OpenRouter-Output-Preis$4,40 / 1 Mio. Tokens
Open Weightsam 21.08.2026 noch nicht veröffentlicht
Lokale Nutzungderzeit nicht möglich, solange die Gewichte fehlen

Quellen: Z.ai GLM-5.3, OpenRouter GLM-5.3, Z.ai Pricing als GLM-5.2-Referenz.

Was ist GLM-5.3?

Z.ai veröffentlichte GLM-5.3 am 14. August 2026 als Nachfolger von GLM-5.2. Der Schwerpunkt liegt auf komplexer Softwareentwicklung, terminalbasierten Aufgaben, Tool-Nutzung und langen Agentenläufen.

Die Versionsnummer kann leicht den Eindruck erwecken, dass Z.ai erneut ein größeres oder grundsätzlich verändertes Basismodell trainiert hat. Genau das ist nicht der Fall. Im offiziellen Launch-Post schreibt Z.ai ausdrücklich, dass GLM-5.3 dasselbe Basismodell wie GLM-5.2 verwendet und alle Verbesserungen aus dem Post-Training stammen.

Z.ai nennt dafür drei zentrale Bausteine:

  • mehr ausführbare Trainingsumgebungen,
  • komplexere und längere Aufgaben,
  • mehr Rechenleistung für Reinforcement Learning.

Zum Trainings-Stack gehört außerdem das Open-Source-Framework slime, das Megatron für Training und SGLang für Rollouts verbindet. Das slime-Repository beschreibt das System ausdrücklich als Framework für großskaliges RL-Post-Training.

Warum „dasselbe Basismodell“ wichtig ist

Die Aussage ist mehr als eine technische Fußnote. Sie verändert, wie die Benchmark-Sprünge interpretiert werden sollten.

Wenn ein Modell nach einem neuen Pretraining-Lauf besser wird, können zusätzliche Daten, Parameter, Architekturänderungen und Trainingscompute gleichzeitig die Ursache sein. Bei GLM-5.3 isoliert Z.ai den Effekt deutlich stärker: Das Basismodell blieb nach Herstellerangabe gleich, während das Post-Training weiter skaliert wurde.

Das Ergebnis ist ein nützlicher Hinweis auf einen allgemeinen Trend bei Coding-Modellen: Die Qualität der Agentenumgebungen, Verifier und Reinforcement-Learning-Pipelines wird zunehmend genauso relevant wie das Basismodell selbst.

Das heißt nicht, dass jeder Benchmarkgewinn automatisch auf reale Projekte übertragbar ist. Es macht die 5.2-zu-5.3-Differenz aber interessanter als einen gewöhnlichen Generationsvergleich.

GLM-5.3 Benchmarks: Wo die größten Sprünge liegen

Z.ai meldet in seiner eigenen Evaluation teilweise sehr große Verbesserungen gegenüber GLM-5.2.

BenchmarkGLM-5.2GLM-5.3Differenz
Terminal-Bench 2.181,088,2+7,2 Pkt.
Terminal-Bench 3.04,628,3+23,7 Pkt.
DeepSWE v1.146,266,9+20,7 Pkt.
NL2Repo48,958,0+9,1 Pkt.
ProgramBench Almost Solved9,519,0+9,5 Pkt.
FrontierSWE67,578,1+10,6 Pkt.
SWE-Marathon v1.119,442,5+23,1 Pkt.
PostTrainBench31,739,8+8,1 Pkt.
CyberGym77,284,5+7,3 Pkt.
ExploitBench24,454,4+30,0 Pkt.
Toolathlon Verified59,973,0+13,1 Pkt.
AutomationBench v1.0.626,248,2+22,0 Pkt.
Agents’ Last Exam CLI23,828,5+4,7 Pkt.
HLE mit Tools54,762,5+7,8 Pkt.

Datenquelle: Z.ai, 14. August 2026. Die Differenzen sind eigene Berechnungen aus den veröffentlichten Herstellerwerten.

Benchmark-Deltas von Z.ai für GLM-5.3 gegenüber GLM-5.2: ExploitBench, Terminal-Bench 3.0, SWE-Marathon, AutomationBench und DeepSWE.

Die größten Verbesserungen

Besonders auffällig sind fünf Tests:

  1. ExploitBench: +30,0 Punkte
  2. Terminal-Bench 3.0: +23,7 Punkte
  3. SWE-Marathon v1.1: +23,1 Punkte
  4. AutomationBench: +22,0 Punkte
  5. DeepSWE v1.1: +20,7 Punkte

Das passt zu Z.ais Trainingsschwerpunkt: Lange, ausführbare Aufgaben mit Werkzeugen und überprüfbaren Ergebnissen profitieren stärker als kurze Wissens- oder Standard-Coding-Aufgaben.

Die Benchmarkzahlen brauchen Kontext

Die Tabelle ist nützlich, aber sie ist kein unabhängiger Gesamttest. Die meisten Werte wurden von Z.ai selbst veröffentlicht.

Reuters weist ausdrücklich darauf hin, dass die Cybersecurity-Ergebnisse zum Launch nicht unabhängig verifiziert waren. Das ist für die Einordnung wichtig: Herstellerbenchmarks sind wertvoll, wenn Methodik und Einstellungen offengelegt werden, ersetzen aber keine unabhängigen Reproduktionen.

Z.ai dokumentiert erfreulich viele Details. Für verschiedene Tests werden unter anderem Agent-Harness, Reasoning-Stufe, Kontextbudget, Outputlimit, Anzahl der Rollouts und Timeout genannt. Bei Terminal- und Security-Benchmarks kommt etwa Claude Code als Harness zum Einsatz. Damit wird gleichzeitig deutlich, warum Benchmarkwerte nicht als reine „Modell-IQ-Zahl“ gelesen werden sollten: Harness, Tools, Zeitbudget und Tokenbudget sind Teil des Systems.

Was unabhängige Daten bisher sagen

Am 21. August ist die unabhängige Datenlage noch dünner als bei älteren Modellen, weil die Gewichte noch nicht frei verfügbar sind.

OpenRouters Live-Modellindex führt für z-ai/glm-5.3 aktuell von Artificial Analysis stammende Kennzahlen von:

  • 59,5 im Intelligence Index,
  • 74,8 im Coding Index,
  • 59,1 im Agentic Index.

Diese Werte sind hilfreicher als reine Launch-Claims, sollten aber weiterhin als zeitabhängige Benchmarkstände betrachtet werden.

Ein Community-Test mit SlopCodeBench vom 20. August meldete auf einem kleinen, besonders anspruchsvollen Teilset 8 von 17 strikten Checkpoints. Der Autor beschreibt GLM-5.3 dort als ungefähr auf Augenhöhe mit Fable/Sol in demselben Teilset. Das ist interessant, aber kein Ersatz für eine große, kontrollierte Evaluation: Stichprobe, Agent-Setup und Kostenbudget sind zu klein, um daraus ein allgemeines Ranking abzuleiten.

Die sinnvollste Zwischenbilanz lautet deshalb:

GLM-5.3 zeigt sehr starke Herstellerwerte und erste positive unabhängige Signale, aber die breite Reproduktion beginnt erst richtig, wenn die Gewichte und mehr Provider verfügbar sind.

Z.ais „50 % besser beim Coding“: Was bedeutet das?

Z.ai bewirbt GLM-5.3 mit einem 50-prozentigen Coding-Zuwachs gegenüber GLM-5.2. Diese Zahl stammt aus Z.ai Code Bench, einem internen Benchmark.

Bei max Reasoning meldet Z.ai:

  • GLM-5.2: 23,4 % bei ungefähr 96K Output-Tokens pro Aufgabe
  • GLM-5.3: 34,5 % bei ungefähr 75K Output-Tokens

Bei high erreicht GLM-5.3 laut Hersteller 31,4 % bei etwa 50K Output-Tokens.

Der interessante Teil ist nicht nur der höhere Score. Z.ai behauptet gleichzeitig weniger Output-Tokens pro Aufgabe. Sollte sich das in unabhängigen Tests bestätigen, wäre das für Agenten relevant, weil lange Coding-Runs nicht nur von Qualität, sondern auch von Tokenkosten und Laufzeit abhängen.

Trotzdem sollte die 50-%-Zahl nicht als allgemeiner, unabhängiger Qualitätsvorsprung wiedergegeben werden. Der Test ist privat und nicht vollständig reproduzierbar.

GLM-5.3 auf OpenRouter

OpenRouter listet das Modell aktuell unter:

z-ai/glm-5.3

Der Live-Modellindex bestätigt:

  • 1.048.576 Tokens Kontext,
  • maximal 131.072 Completion-Tokens,
  • Text-Input und Text-Output,
  • Always-on-Reasoning,
  • low, high und max,
  • max als Standard.

Außerdem existiert der Alias:

~z-ai/glm-latest

Dieser verweist derzeit auf GLM-5.3. Für produktive oder reproduzierbare Workflows ist die feste Modell-ID trotzdem die bessere Wahl: Ein latest-Alias kann später ohne Codeänderung auf eine neue Modellversion umschalten.

Zugangswege zu GLM-5.3 über Z.ai API, OpenRouter und Coding Plan; lokale Gewichte stehen noch aus.

GLM-5.3 API-Preise

OpenRouter listet für den von Z.ai betriebenen GLM-5.3 am 21. August folgende Preise:

Die öffentliche Z.ai-Preisübersicht führt an diesem Tag noch GLM-5.2, nicht GLM-5.3. Die folgenden Werte sind deshalb als OpenRouter-Listenpreise angegeben; die direkte Z.ai-Abrechnung sollte nach einer Aktualisierung der Z.ai-Tabelle erneut geprüft werden.

TokenartPreis pro 1 Mio. Tokens
Input$1,40
Cached Input$0,26
Cached Input Storagezeitlich begrenzt kostenlos
Output$4,40

Die OpenRouter-Listenpreise entsprechen den aktuellen GLM-5.2-Sätzen in der Z.ai-Preisübersicht. Daraus folgt nicht automatisch, dass jede direkte Z.ai-Abrechnung identisch bleibt.

Beispiel 1: kleine Coding-Session

OpenRouter-Listenpreise für GLM-5.3 pro 1 Million Tokens: 1,40 US-Dollar Input, 0,26 Cache-Read und 4,40 Output.

1 Mio. Input + 200.000 Output-Tokens:

1 × $1,40 + 0,2 × $4,40 = $2,28

Ergebnis: $2,28

Beispiel 2: mittlerer Agentenlauf

10 Mio. Input + 2 Mio. Output:

10 × $1,40 + 2 × $4,40 = $22,80

Ergebnis: $22,80

Beispiel 3: intensiver Workflow mit Cache

Angenommen:

  • 100 Mio. Input-Tokens insgesamt
  • davon 80 Mio. als Cached Input
  • 20 Mio. frischer Input
  • 20 Mio. Output

Dann:

  • 20 × $1,40 = $28,00
  • 80 × $0,26 = $20,80
  • 20 × $4,40 = $88,00

Gesamt: $136,80

Ohne Cache würden Input und Output zusammen $228 kosten. In diesem konstruierten Beispiel reduziert der Cache die Gesamtkosten um $91,20 bzw. 40 %.

Das ist der wichtigere praktische Hebel für lange Agentensitzungen: Wiederholt der Agent Repository-Kontext, Systemanweisungen und Historie, kann ein hoher Cache-Anteil stärker ins Gewicht fallen als kleine Unterschiede beim Listenpreis.

Reasoning lässt sich nicht mehr deaktivieren

GLM-5.3 unterscheidet sich hier klar von manchen Vorgängern. Z.ai unterstützt nur noch:

low
high
max

max ist der Standard und wird für komplexe Coding-Aufgaben empfohlen.

Ein gültiger Request sieht beispielsweise so aus:

{
  "model": "glm-5.3",
  "thinking": {
    "type": "enabled"
  },
  "reasoning_effort": "max"
}

Wer bei GLM-5.2 noch explizit thinking.type: "disabled" gesetzt hat, muss die Konfiguration vor dem Modellwechsel anpassen. Z.ai warnt, dass die Anfrage sonst fehlschlägt.

GLM-5.3 per API aufrufen

Z.ai dokumentiert mehrere kompatible Schnittstellen:

  • OpenAI Chat Completions
  • OpenAI Responses
  • Anthropic Messages

Ein einfacher cURL-Aufruf über die reguläre Z.ai-Chat-Completion-API:

curl -X POST "https://api.z.ai/api/paas/v4/chat/completions" \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $ZAI_API_KEY" \
  -d '{
    "model": "glm-5.3",
    "messages": [
      {
        "role": "user",
        "content": "Analysiere dieses Repository und erstelle einen Plan für den Bugfix."
      }
    ],
    "thinking": {
      "type": "enabled"
    },
    "reasoning_effort": "max",
    "max_tokens": 4096
  }'

Die Endpoint- und Parameterangaben stammen aus der aktuellen Z.ai-Dokumentation.

Warum Z.ai die Gewichte noch nicht veröffentlicht hat

Der ungewöhnlichste Teil des Launches betrifft Cybersecurity.

Z.ai trainierte GLM-5.3 unter anderem mit Umgebungen zur Schwachstellensuche. Nach eigenen Angaben stiegen die Fähigkeiten weiter entlang der Exploit-Kette stärker als erwartet.

Der Hersteller meldet:

  • CyberGym: 77,2 → 84,5
  • ExploitBench: 24,4 → 54,4
  • ExploitGym: 29/39 → 105/130 gelöste Aufgaben bei den angegebenen 2h-/6h-Budgets

Z.ai erklärte deshalb am 14. August, die Gewichte erst ungefähr zwei Wochen später freizugeben, nachdem zusätzliche Safety-Evaluation und Hardening abgeschlossen sind. Reuters und Axios berichteten ebenfalls über diese verzögerte Veröffentlichung.

Zwei Wochen nach dem 14. August entsprechen ungefähr dem 28. August 2026. Das ist jedoch eine aus Z.ais Formulierung abgeleitete Orientierung und kein garantierter Release-Termin.

Am 21. August zeigt Z.ais offizielle Hugging-Face-Organisation weiterhin GLM-5.2, GLM-5.1 und GLM-5, aber kein öffentliches GLM-5.3-Weight-Repository.

Zeitleiste für GLM-5.3: Launch am 14. August, geprüfter Status am 21. August und geschätztes Gewichtsfenster um den 28. August.

Kann GLM-5.3 lokal auf einem Mac laufen?

Stand heute: nein, weil die Gewichte noch nicht veröffentlicht sind.

Aber auch nach dem Weight-Release wird die vollständige Variante für normale Macs extrem groß bleiben.

Z.ais Hugging-Face-Seite listet GLM-5.2 mit ungefähr 753 Milliarden Parametern; die offizielle README-Modellangabe nennt dagegen 744B-A40B — beide Angaben kursieren, je nach Zählweise und Quelle. Weil Z.ai ausdrücklich sagt, dass GLM-5.3 dasselbe Basismodell verwendet, lässt sich daraus eine grobe Speicherordnung ableiten. Das ist keine offizielle GLM-5.3-Dateigröße, sondern eine einfache Rohdatenrechnung.

theoretisches Formatreine Parameterdaten bei 753B
FP16/BF16, 16 Bitca. 1.506 GB / 1,51 TB
FP8, 8 Bitca. 753 GB
4 Bitca. 376,5 GB

Dazu kommen je nach Runtime Metadaten, KV-Cache, temporäre Puffer und weitere Overheads.

Ein wichtiger MoE-Punkt: Auch wenn pro Token nur ein Teil der Parameter aktiv ist, müssen die Modellgewichte trotzdem verfügbar sein. „40B aktiv“ bedeutet daher nicht, dass ein mehrere hundert Milliarden Parameter großes Modell plötzlich in 40B-Modell-Speicher passt.

Für einen Mac mit 32 oder 64 GB Unified Memory ist die vollständige GLM-5.3-Klasse deshalb nicht realistisch als reiner In-Memory-Local-LLM-Run. Zur Einordnung der Speichergrenzen hilft der Unified-Memory-Leitfaden für Macs. Interessant werden eher:

  • stark komprimierte oder distillierte Ableger,
  • kleinere offizielle Varianten,
  • Remote-Inferenz mit lokalem Agenten-Harness,
  • Server-Offloading.

Eine exakte lokale Empfehlung sollte erst nach Veröffentlichung der Model Card und der tatsächlichen Weight-Shards erfolgen.

GLM-5.3 vs. GLM-5.2: Lohnt sich der Wechsel?

Für API-Nutzer spricht viel für einen Test, weil der Listenpreis gleich geblieben ist und Z.ai gerade bei langen Coding- und Agentenaufgaben deutliche Verbesserungen meldet.

Wechsel sinnvoll, wenn du …

  • lange Coding-Agent-Runs ausführst,
  • Repository-weite Änderungen bearbeitest,
  • häufig Tools und Terminalzugriff nutzt,
  • 1M Kontext tatsächlich ausnutzt,
  • große Teile des Prompts cachen kannst,
  • bereits GLM-5.2 einsetzt.

Weniger attraktiv, wenn du …

  • Reasoning komplett abschalten möchtest,
  • Bild- oder Video-Input brauchst,
  • nur sehr kurze, einfache Textaufgaben hast,
  • GLM-5.3 unbedingt lokal ausführen möchtest,
  • vollständig unabhängige Benchmarkdaten als Voraussetzung brauchst.

Ist GLM-5.3 besser als GPT-5.6 Sol, Fable 5 oder Kimi K3?

Eine pauschale Antwort wäre unseriös.

Z.ais eigene Tabelle zeigt ein gemischtes Bild. GLM-5.3 ist auf einigen Agenten- und Automatisierungsbenchmarks sehr stark, während GPT-5.6 Sol oder Fable 5 bei anderen Coding- und Exploitation-Aufgaben vorne liegen.

Beispiele aus Z.ais Launch-Tabelle:

BenchmarkGLM-5.3Kimi K3Fable 5GPT-5.6 Sol
Terminal-Bench 3.028,317,433,734,6
DeepSWE v1.166,967,569,772,7
CyberGym84,580,083,883,6
ExploitBench54,432,278,076,5
AutomationBench48,246,746,245,8
Agents’ Last Exam28,527,623,828,6

Das zeigt zwei Dinge:

  1. GLM-5.3 ist keineswegs überall Spitzenreiter.
  2. Sein Profil ist für Agentenarbeit trotzdem ungewöhnlich konkurrenzfähig.

Für eine echte Kauf- oder Providerentscheidung sind Preis, Durchsatz, Cache-Verhalten und der konkrete Agent-Harness mindestens so wichtig wie ein einzelner Benchmark.

Für wen ist GLM-5.3 besonders interessant?

1. Coding Agents

Hier liegt der klare Schwerpunkt. Lange Tasks, Terminalarbeit, Tool Use und Repository-Kontext entsprechen genau den Umgebungen, auf die Z.ai das Post-Training ausgerichtet hat.

2. Agenten mit großem wiederverwendbarem Kontext

1M Kontext plus günstiger Cached Input kann attraktiv sein, wenn ein Workflow viele bereits bekannte Dateien oder lange Gesprächsverläufe erneut sendet.

3. Security-Teams

Die Cybersecurity-Ergebnisse sind bemerkenswert, sollten aber professionell eingeordnet werden. Z.ai selbst behandelt die Fähigkeiten als Dual-Use-Risiko und staffelt den Zugang.

4. Nutzer von GLM-5.2

Der Wechsel ist technisch relativ naheliegend, solange die Reasoning-Konfiguration angepasst wird. Der gleiche API-Preis senkt die Hürde für einen kontrollierten A/B-Test.

Was GLM-5.3 noch nicht ist

GLM-5.3 ist am 21. August 2026:

  • kein frei herunterladbares Weight-Release,
  • kein multimodales Vision-Modell,
  • kein Modell mit abschaltbarem Reasoning,
  • kein unabhängig vollständig bestätigter Benchmark-Sieger,
  • kein realistischer Full-Model-Download für einen normalen Mac.

Diese Einschränkungen sind wichtiger als die Marketingbegriffe „frontier“ oder „SOTA“, weil sie bestimmen, ob das Modell für einen konkreten Workflow überhaupt passt.

Fazit: GLM-5.3 ist vor allem ein Post-Training-Upgrade

GLM-5.3 ist technisch interessanter als ein gewöhnliches Versionsupdate. Z.ai hat kein neues Basismodell trainiert, sondern denselben Unterbau wie bei GLM-5.2 mit zusätzlichem Post-Training deutlich weitergetrieben.

Die stärksten veröffentlichten Verbesserungen liegen bei langen Coding-, Terminal-, Agenten- und Cybersecurity-Aufgaben. Gleichzeitig bleiben zwei Vorbehalte: Viele der spektakulärsten Zahlen stammen vom Hersteller selbst, und die Gewichte sind noch nicht öffentlich.

Für API-Nutzer ist GLM-5.3 bereits ein ernstzunehmender Kandidat, vor allem wenn GLM-5.2 bisher gut in den Workflow gepasst hat. Für lokale Nutzer ist der interessantere Termin der tatsächliche Weight-Release. Erst dann lassen sich Lizenz, Quantisierungen, Inferenz-Frameworks und realer Speicherbedarf sauber bewerten.

Häufig gestellte Fragen

Ist GLM-5.3 auf OpenRouter verfügbar?

Ja. Die Modell-ID lautet `z-ai/glm-5.3`. OpenRouters Live-Modellindex führt das Modell mit 1.048.576 Tokens Kontext und bis zu 131.072 Completion-Tokens.

Was kostet GLM-5.3?

Auf OpenRouter kostet GLM-5.3 aktuell $1,40 pro Million Input-Tokens, $0,26 pro Million Cache-Read-Tokens und $4,40 pro Million Output-Tokens.

Hat GLM-5.3 1M Kontext?

Ja. Z.ai dokumentiert ein 1M-Kontextfenster. OpenRouter nennt exakt 1.048.576 Tokens.

Wie lang kann GLM-5.3 antworten?

Z.ai nennt maximal 128K Output-Tokens. OpenRouter listet 131.072 maximale Completion-Tokens.

Kann man Reasoning deaktivieren?

Nein. GLM-5.3 arbeitet immer mit Reasoning. Unterstützt werden `low`, `high` und `max`; Standard ist `max`.

Kann ich GLM-5.3 lokal herunterladen?

Am 21. August 2026 noch nicht. Z.ai hatte angekündigt, die Gewichte ungefähr zwei Wochen nach dem Launch am 14. August zu veröffentlichen.

Ist GLM-5.3 Open Source?

Z.ai positioniert das Modell als Open-Weights/Open-Source-Release, aber die GLM-5.3-Gewichte und die finale Model Card sind am 21. August noch nicht öffentlich. Die konkrete Lizenz sollte deshalb erst nach dem Weight-Release endgültig angegeben werden.

Ist GLM-5.3 besser als GLM-5.2?

In Z.ais veröffentlichten Coding- und Agentenbenchmarks fast durchgehend deutlich. Besonders groß sind die gemeldeten Sprünge bei Terminal-Bench 3.0, DeepSWE, SWE-Marathon, AutomationBench und ExploitBench. Unabhängige Tests sind noch weniger umfangreich.

Transparenz

Quellen und Prüfgrundlage

33

Diese Primär- und Referenzquellen bilden die Grundlage der technischen Einordnung. Herstellerangaben und externe Benchmarks werden im Artikel als solche gekennzeichnet.

  1. z.ai blog / glm-5.3
  2. docs.z.ai llm / glm-5.3
  3. docs.z.ai overview / pricing
  4. docs.z.ai overview / migrate-to-glm-new
  5. docs.z.ai capabilities / thinking-mode
  6. docs.z.ai capabilities / cache
  7. docs.z.ai devpack / overview
  8. docs.z.ai devpack / latest-model
  9. docs.z.ai llm / chat-completion
  10. z.ai subscribe
  11. z.ai blog / glm-5
  12. z.ai blog / scaling-pain
  13. github.com THUDM / slime
  14. huggingface.co zai-org
  15. openrouter.ai v1 / models
  16. github.com harbor-framework / terminal-bench-1
  17. github.com sunblaze-ucb / cybergym
  18. github.com sunblaze-ucb / exploitgym
  19. github.com exploitbench / exploitbench
  20. github.com main / SUBMISSION.md
  21. github.com sunblaze-ucb / cybergym-e2e
  22. github.com main / CHANGELOG.md
  23. reuters.com technology / chinas-zai-says-new-model-nears-anthropics-mythos-5-cyber-defence-tests-2026-08-14
  24. wired.com story / zai-open-weight-ai-models-release-cybersecurity-hacking
  25. axios.com 14 / china-open-source-ai-glm-53
  26. scmp.com 3364077 / zhipu-launches-flagship-model-glm-53-china-seeks-mythos-level-edge-cyber-defence
  27. artificialanalysis.ai models / glm-5
  28. artificialanalysis.ai comparisons / glm-5-2-vs-gpt-5-3-codex
  29. reddit.com 1vtnnf0 / glm_53_slopcodebench_results
  30. reddit.com 1vr3c7p / i_tested_glm53_deepseek_v4_proflash_gemini_37
  31. reddit.com 1vsoehz / why_is_there_so_little_glm53_testing_to_read
  32. reddit.com 1vskfzh / glm53_is_out_on_aa_and_im_fed_up_with_their
  33. openrouter.ai z-ai / glm-5.3