Technische Recherche mit Quellenangaben. Eigene Messungen sind im Artikel gekennzeichnet.

Veröffentlicht: 4. August 2026 Aktualisiert: 25. August 2026

Über den Autor

Historischer Prüfstand: 3. August 2026. Qwen3.8-Max ist Alibabas neues Max-Flaggschiff mit einer Mixture-of-Experts-Architektur aus 2,4 Billionen Gesamtparametern und 95 Milliarden aktiven Parametern pro Token. QwenCloud nennt ein Kontextfenster von 1 Million Tokens und Preise von 2 US-Dollar pro Million Eingabetokens sowie 6 US-Dollar pro Million Ausgabetokens. Die offenen Gewichte waren für die Folgewoche angekündigt, aber an diesem Prüfstand noch nicht veröffentlicht. Das vollständige Modell ist selbst in einer theoretischen 2-Bit-Darstellung zu groß für den maximal 512 GB großen Unified Memory eines aktuellen Mac Studio.

Aktualisierung: 25. August 2026. Die offizielle Qwen-Organisation listet inzwischen neben dem Qwen3.8-27B-Checkpoint auch den vollständigen Qwen3.8-2.4T-A95B-Checkpoint und eine offizielle FP8-Variante. Die offenen Gewichte der Max-Klasse sind damit öffentlich verfügbar. Der offene 2.4T-Checkpoint ist jedoch text-only, setzt Thinking voraus und unterstützt keine multimodalen Eingaben; die gehostete Qwen3.8-Max-Variante ergänzt Vision, Non-Thinking und integrierte Tools. Die Qwen3.8-Max-Lizenz ist eine eigene Lizenz mit zusätzlichen Bedingungen. Die folgenden Cloud-Zahlen bleiben auf den historischen Snapshot vom 3. August bezogen; die aktuellen regionalen Model-Studio-Preise sind direkt vor der Preistabelle ergänzt.

Qwen3.8-Max Faktencheck mit 2,4T Parametern, API-Preis und Mac-Einordnung

Die wichtigsten Fakten zu Qwen3.8-Max

MerkmalVerifizierter Stand am 3. August 2026
Offizieller NameQwen3.8-Max
Offizielle API-IDqwen3.8-max
ArchitekturMixture of Experts
Parameter2,4 T gesamt; 95 B aktiv pro Token
EingabenText, Bild, Video
AusgabeText
Kontext1M; maximal 991K Input, 131K Output
Thinkinghybrid; separates Input-Limit 983K; max. Reasoning 262K
QwenCloud-Preis$2 Input / $6 Output je 1M Tokens
Cache$0,25 implicit; $2,50 Erstellung; $0,17 Lesen je 1M Tokens
Open weightsveröffentlicht: 2.4T-A95B und FP8; eigene Qwen3.8-Max-Lizenz
Einzelner Macvollständiger Checkpoint praktisch nicht lokal ausführbar

Quellen: Qwen-Launch und QwenCloud-Modellseite.12

Was ist Qwen3.8-Max?

Qwen3.8-Max ist der Produktionsnachfolger des am 19. Juli veröffentlichten qwen3.8-max-preview.1 Alibaba positioniert das Modell für Coding, Agenten, lange Arbeitsabläufe und professionelle „Cowork”-Aufgaben. Die wichtigste Architekturangabe lautet 2,4 Billionen Gesamtparameter, davon 95 Milliarden aktiv pro Token.

Das ist ein entscheidender Unterschied: Bei einem Mixture-of-Experts-Modell wird pro Token nur ein Teil der Experten berechnet. Das senkt den Rechenaufwand gegenüber einem dichten 2,4T-Modell. Es bedeutet aber nicht, dass nur 95 Milliarden Parameter gespeichert werden müssen. Für eine gewöhnliche lokale Inferenz müssen grundsätzlich die Gewichte aller Experten verfügbar sein.

Zeitachse vom Preview-Start bis zum angekündigten Gewichtsrelease

Preview, Produktionsmodell und Open Weights sind drei verschiedene Zustände

  • 19. Juli 2026: qwen3.8-max-preview erscheint in Token Plan und Qoder; die Vorschau darf während der Preview verändert oder später ersetzt werden.
  • 2. August 2026: Qwen kündigt qwen3.8-max an (Ankündigung).134
  • 3. August 2026: Qwen3.8-Max wird offiziell als Produktionsmodell vorgestellt (allgemeine Verfügbarkeit/GA); QwenCloud führt qwen3.8-max als gehostetes Modell, aber noch nicht als offen.12
  • Aktueller Stand, 25. August 2026: Die offiziellen Qwen-Repositories für Qwen3.8-2.4T-A95B5 und Qwen3.8-2.4T-A95B-FP86 sind öffentlich. Die Lizenz ist die eigene Qwen3.8-Max-Lizenz;7 der offene Checkpoint ist text-only und nicht mit der multimodalen Cloud-Variante gleichzusetzen.

Am 3. August war deshalb nur die Formulierung „Open Weights angekündigt“ belastbar; ein bereits verfügbarer Download bei Hugging Face oder ModelScope wäre zu diesem Zeitpunkt nicht belegt gewesen.

Technische Daten und API-Grenzen

QwenCloud dokumentiert Text-, Bild- und Videoeingaben bei Textausgabe. Das nominelle Kontextfenster beträgt 1 Million Tokens.2 Praktisch nennt die Plattform maximal 991K Eingabetokens und 131K Ausgabetokens — beide Limits gelten separat, nicht additiv. Im Thinking-Modus liegt das Input-Limit bei 983K, der maximale Reasoning-Anteil bei 262K.8

Die Plattform nennt außerdem 2 Millionen Tokens pro Minute und 15.000 Requests pro Minute.2 Zu den Funktionen zählen Function Calling, Structured Outputs, Kontext-Cache und Websuche.910 In der Responses API stehen unter anderem Code Interpreter, Web Extractor und Web Search als integrierte Werkzeuge zur Verfügung.

Alibaba dokumentiert OpenAI-kompatible, Anthropic-kompatible und DashScope-Endpunkte in mehreren Regionen, darunter Beijing, Singapore, Tokyo, Frankfurt und Virginia.11 Vor produktiver Nutzung sollten Datenschutz, Datenresidenz, Logging und Vertragsbedingungen für die konkrete Region separat geprüft werden.

Qwen3.8-Max Preise

Aktueller Regionalhinweis (25. August 2026): Die [aktuelle Alibaba-Model-Studio-Seite]12 führt für Frankfurt (Deutschland), USA, Tokio (Japan), Hongkong und Peking derzeit $1,65 Input / $4,951 Output je 1M Tokens auf; der Singapur-Endpunkt und die aktuelle [QwenCloud-Modellseite]2 zeigen weiterhin $2/$6. Die folgende Tabelle bleibt deshalb ausdrücklich ein QwenCloud-/International-Snapshot vom 3. August. Vor produktivem Einsatz Region, Cache-Tarif, Steuern und Vertrag prüfen.

Die QwenCloud-Preise am 3. August 2026 lauten:2

TokenartPreis je 1M Tokens
Normale Eingabe$2,00
Ausgabe$6,00
Implicit-Cache-Eingabe$0,25
Explicit Cache: Erstellung$2,50
Explicit Cache: Lesen$0,17

Quelle: QwenCloud. Preise in USD, vor möglichen Steuern oder Drittanbieteraufschlägen.

Kostenformel

Kosten = Input_M × 2 + Output_M × 6 + ImplicitCache_M × 0,25 + CacheCreate_M × 2,50 + CacheRead_M × 0,17

Drei Nutzungsszenarien

SzenarioAnnahmeEigene RechnungErgebnis
gering1M Input + 0,2M Output1×$2 + 0,2×$6$3,20
mittel20M Input + 5M Output20×$2 + 5×$6$70
intensiv200M Input + 50M Output200×$2 + 50×$6$700

Cache-Hits können wiederholte lange Präfixe stark verbilligen. 100 Millionen implicit gecachte Eingabetokens kosten nach Listenpreis $25 statt $200; die theoretische Differenz beträgt $175. Ob ein Request tatsächlich als Cache-Hit zählt, hängt von den Plattformregeln und identischen Präfixen ab.

Qwen3.8-Max Preise je Million Tokens

Kann Qwen3.8-Max lokal auf einem Mac laufen?

Für die reine Rohgröße gilt:

Gewichtsgröße = Parameterzahl × Bits pro Parameter ÷ 8

DarstellungRohgröße bei 2,4T ParameternPasst in 512 GB?
16 Bit4,8 TBnein
8 Bit2,4 TBnein
4 Bit1,2 TBnein
2 Bit600 GBnein

Diese Rechnung ist bereits optimistisch: Quantisierungsskalen, Metadaten, Runtime-Puffer, Expert-Routing und KV-Cache sind nicht enthalten. Apples größter aktueller Mac Studio lässt sich mit 512 GB Unified Memory konfigurieren.1314 Damit ist der vollständige Qwen3.8-Max-Checkpoint auf einem einzelnen aktuellen Mac nicht praktisch lokal ausführbar, selbst wenn später eine aggressive 2-Bit-Quantisierung erscheint.

Die 95 Milliarden aktiven Parameter helfen beim Rechenaufwand pro Token, nicht bei der grundlegenden Pflicht, den 2,4T-Checkpoint vorzuhalten. Denkbar sind verteilte Systeme, SSD-Offloading oder Expertenstreaming, doch diese sind deutlich langsamer und kein normaler „lokal auf dem Mac”-Workflow.

Für Apple-Silicon-Nutzer bleibt Qwen3.8-27B der naheliegende lokale Qwen3.8-Kandidat.15 Der vollständige 2.4T-Checkpoint ist inzwischen öffentlich, bleibt aber selbst bei theoretischen 2 Bit zu groß für einen einzelnen Mac; Repository-Verfügbarkeit ist daher keine lokale Machbarkeitszusage. Erste Konversionen des 27B-Modells existieren als FP8,16 MLX 4-bit17 und Unsloth-GGUF;18 die tatsächliche Laufzeit auf einem konkreten Mac muss trotzdem noch gemessen werden.

Rohgröße des 2,4T-Modells bei 16 bis 2 Bit im Vergleich zu 512 GB

Wie gut ist Qwen3.8-Max?

Öffentliche Arena-Daten

Im Arena-Bereich „Software & IT Services” stand Qwen3.8-Max mit Datenstand 1. August 2026 vorläufig auf Rang 9.19 Der Score lag bei 1520±16 aus 1.405 Stimmen; die Rangspanne war mit 1 bis 43 breit. Das ist ein starkes Frühindikator-Signal, aber noch keine stabile Rangposition.

Arena misst menschliche Präferenzen in Paarvergleichen. Das ist nützlich für wahrgenommene Antwortqualität, ersetzt jedoch keine reproduzierbaren Tests für Repository-Arbeit, Tool-Zuverlässigkeit, Latenz oder Kosten.

Herstellerbenchmarks und Case Studies

Alibaba veröffentlicht umfangreiche Ergebnisse zu Coding, Dokumenten, Video und langfristigen Agentenaufgaben. Diese Daten sollten als Herstellerangaben bezeichnet werden, bis Prompts, Harnesses, Versionen und unabhängige Replikationen vorliegen. Das interne RecreationBench ist beispielsweise keine allgemein etablierte, unabhängige Benchmark-Suite.

Unabhängiger Praxistest

Ein einzelner Trilogy-AI-Test verglich die Preview mit Kimi K3 auf einer 269-Dateien-Codebasis.4 Beide Modelle kamen zu derselben grundlegenden Integrationsarchitektur und lagen in der Blindbewertung nur drei Punkte auseinander; Kimi war im getesteten Ablauf schneller und tokeneffizienter, Qwen wurde bei Systemgrenzen stärker bewertet. Das ist nützlich, aber nur ein Test gegen einen beweglichen Preview-Endpunkt.

Ist qwen/qwen3.8-max bei OpenRouter verfügbar?

Ja. Der Slug qwen/qwen3.8-max ist seit dem 4. August 2026 im öffentlichen OpenRouter-Katalog gelistet (Release 3. August 2026).20 OpenRouter leitet Anfragen an Alibaba Cloud International weiter und führt denselben Listenpreis von $2/$6 pro 1M Tokens bei 1M Kontext. Damit ist qwen/qwen3.8-max ein bestätigter, zusätzlicher Hosting-Zugang neben QwenCloud beziehungsweise Alibaba Model Studio.

API-Beispiel mit OpenAI-kompatiblem Client

import os
from openai import OpenAI

api_key = os.environ.get("DASHSCOPE_API_KEY")
if not api_key:
    raise RuntimeError("DASHSCOPE_API_KEY is not set")

client = OpenAI(
    api_key=api_key,
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {"role": "user", "content": "Review this architecture and list the top three risks."}
    ],
)

print(response.choices[0].message.content)

Die genaue Base-URL muss zur gewählten Alibaba-Region und zum API-Produkt passen. Für neue Projekte sollte zusätzlich geprüft werden, ob Responses API, Tool-Aufrufe oder ein regionalspezifischer Workspace-Endpunkt benötigt werden.

Praktischer Status

Qwen3.8-Max ist inzwischen sowohl als Cloud-Modell als auch als öffentliches 2.4T-Checkpoint-Repository relevant. Die gehostete Variante kombiniert 95 Milliarden aktive Parameter pro Token, multimodale Eingaben, 1M Kontext und die dokumentierten API-Preise; der offene Checkpoint ist text-only, Thinking-pflichtig und bleibt für einen einzelnen Mac zu groß. Für die lokale Einordnung ist deshalb weiterhin Qwen3.8-27B entscheidend.

Für Mac-Nutzer ist die Entscheidung aktuell klar: Qwen3.8-Max über die Cloud testen; für lokale Nutzung Qwen3.8-27B als ersten Qwen3.8-Kandidaten prüfen. Eine belastbare lokale Bewertung ist erst möglich, wenn unabhängige Quantisierungen sowie reproduzierbare Langkontext- und Agenten-Benchmarks vorliegen.

Quellen

Footnotes

  1. Qwen-Launchankündigung Qwen3.8-Max 2 3 4

  2. QwenCloud-Modellseite (Preise, Limits) 2 3 4 5 6

  3. Reuters zu Alibabas Ankündigung

  4. Trilogy AI: unabhängiger Praxistest 2

  5. HF: Qwen3.8-2.4T-A95B

  6. HF: Qwen3.8-2.4T-A95B-FP8

  7. Qwen3.8-Max-Lizenztext

  8. Alibaba Model Studio: Deep Thinking

  9. Alibaba Model Studio: Context Cache

  10. Alibaba Model Studio: Pricing

  11. Alibaba Model Studio: Modelle

  12. Alibaba Model Studio: Qwen3.8-Max (regionale Preise und Limits)

  13. Apple Newsroom: Mac Studio

  14. Apple: Mac Studio Specs

  15. HF: Qwen3.8-27B

  16. HF: Qwen3.8-27B-FP8

  17. MLX-Community: Qwen3.8-27B-4bit

  18. Unsloth: Qwen3.8-27B GGUF

  19. Arena-Leaderboard Software & IT Services

  20. OpenRouter-Katalog

Häufig gestellte Fragen

Ist Qwen3.8-Max Open Source?

Die Gewichte sind inzwischen öffentlich: Qwen listet den vollständigen [Qwen3.8-2.4T-A95B-Checkpoint](https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B) und eine [FP8-Variante](https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B-FP8). Das Repository verwendet aber die eigene [Qwen3.8-Max-Lizenz](https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B/raw/main/LICENSE), nicht einfach MIT oder Apache. Sie erlaubt breite Nutzung, verlangt bei kommerziellen Produkten ab 100 Millionen monatlich aktiven Nutzern oder 20 Millionen US-Dollar Monatsumsatz eine prominente Modellnennung; für Model-as-a-Service oder AI Work Assistant ab 50 Millionen US-Dollar Umsatz in zwölf Monaten ist eine separate Lizenz nötig. Präziser ist daher: offene Gewichte mit eigener Lizenz, nicht pauschal Open Source.

Kann Qwen3.8-Max auf einem Mac laufen?

Das vollständige 2,4T-Modell ist auf einem einzelnen aktuellen Mac nicht praktikabel. Selbst eine theoretische 2-Bit-Quantisierung bräuchte etwa 600 GB, und der größte Mac Studio bietet 512 GB Unified Memory.

Was kostet die Qwen3.8-Max API?

QwenCloud listet weiterhin $2 pro Million Eingabetokens und $6 pro Million Ausgabetokens. Alibaba Model Studio führt für Deutschland, USA, Japan, Hongkong und Peking aktuell $1,65 Input und $4,951 Output je 1M Tokens. Implicit-Cache-Eingabe kostet $0,25, Explicit-Cache-Erstellung $2,50 und Explicit-Cache-Lesen $0,17 je 1M Tokens; Region und Cache-Tarif vor dem Einsatz prüfen.

Wie groß ist der Download für Qwen3.8-Max?

Der vollständige Checkpoint umfasst 2,4 Billionen Parameter. Rohgrößen: 4,8 TB bei 16 Bit, 2,4 TB bei 8 Bit, 1,2 TB bei 4 Bit und 600 GB bei 2 Bit, jeweils ohne Runtime-Puffer und KV-Cache.

Was bedeutet 95B aktiv?

95 Milliarden ist die Anzahl der Parameter, die pro Token tatsächlich berechnet werden. Das senkt den Rechenaufwand, macht aber den Checkpoint nicht zu einem 95B-Download. Alle 2,4T Parameter müssen gespeichert werden.

Ist `qwen/qwen3.8-max` bei OpenRouter verfügbar?

Der offizielle Alibaba-Modellname ist `qwen3.8-max`. Am 3. August 2026 war der String `qwen/qwen3.8-max` im öffentlichen OpenRouter-Katalog noch nicht auffindbar; seit dem 4. August ist er dort gelistet.