Geprüft am 28. August 2026. Qwen3.8-Flash ist Alibabas neues gehostetes multimodales Flash-Modell mit dem API-Namen qwen3.8-flash. Es verarbeitet Text, Bilder und Video, gibt Text aus und bietet in Alibaba Model Studio einen Kontext von 1.000.000 Tokens. Wichtig: Qwen3.8-Flash ist nicht dasselbe wie Qwen3.8-Flash-Next. Flash-Next ist die parallel veröffentlichte Open-Weight-Architekturvorschau in Richtung Qwen4. Wer Preise, Parameterzahlen, Lizenz und lokale Hardwareanforderungen vermischt, kommt deshalb schnell zu falschen Aussagen. [S01–S06]
Kurzantwort
- Hosted Qwen3.8-Flash: bis zu 991.808 Input-Tokens, 131.072 Output-Tokens und 1.000.000 Tokens Gesamtkontext. Thinking ist standardmäßig aktiv. [S04, S09]
- Multimodal: Text, Bilder und Video als Eingabe; Text als Ausgabe. Function Calling, Structured Output, Prefix Continuation und Context Caching werden unterstützt. [S04, S10]
- Aktueller Originalpreis in Frankfurt/Beijing: 0,8 CNY pro 1 Mio. Input-Tokens und 2,7 CNY pro 1 Mio. Output-Tokens. In Singapore sind es 1,094 bzw. 3,427 CNY. [S04, S06]
- Öffentliche USD-API-Referenz: QwenCloud/OpenRouter listen rund 0,16 US-Dollar pro 1 Mio. Input-Tokens und 0,47 US-Dollar pro 1 Mio. Output-Tokens. [S18, S19]
- Flash-Next: 125B-Parameter-Hauptmodell plus 51B N-Gram-Embedding, 6B aktive Parameter pro Token; Qwen Community License 1.0. Diese Architekturangaben gelten direkt für Flash-Next, nicht automatisch für den gehosteten Produktionsendpunkt. [S02, S36]
- Lokaler Betrieb: prinzipiell über Transformers, llama.cpp, MLX, SGLang, vLLM und Drittanbieter-Quantisierungen möglich, aber das Modell ist groß. Unsloth nennt für eine extreme 1-Bit-Quantisierung etwa 75 GB RAM/Unified Memory. [S02, S22, S37]
Qwen3.8-Flash und Qwen3.8-Flash-Next: der wichtigste Unterschied
Alibaba veröffentlichte am 26. August 2026 zwei eng verwandte Namen. qwen3.8-flash bezeichnet den produktiven Cloud-Endpunkt. Qwen3.8-Flash-Next bezeichnet die offenen Gewichte einer experimentellen Architekturvorschau. Qwen beschreibt Flash-Next ausdrücklich als frühen Blick auf die Architektur, die für Qwen4 vorgesehen ist. [S01, S02, S05]
Diese Trennung hat praktische Folgen:
| Punkt | Qwen3.8-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Hauptrolle | Gehostetes Produktionsmodell | Open-Weight-Architekturpreview |
| API-ID | qwen3.8-flash | je nach Host Qwen/Qwen3.8-Flash-Next |
| Kontext | 1.000.000 Tokens | 262.144 nativ; Erweiterung auf 1M via YaRN laut Qwen |
| Lokale Gewichte | nicht durch den Cloud-Namen beschrieben | ja |
| Architekturparameter | nicht separat als Cloud-Spezifikation veröffentlicht | 125B Hauptmodell + 51B N-Gram; 6B aktiv/Token |
| Lizenz | Cloud-Nutzungsbedingungen | Qwen Community License 1.0 |
| Typischer Einsatz | API, Agenten, Coding, lange Dokumente | Forschung, Self-Hosting, Quantisierung, Inference-Engineering |
Das ist mehr als Namenskosmetik: Die oft zitierte Zahl „125B“ gehört zur Flash-Next-Veröffentlichung. Sie sollte nicht ohne Zusatz als Parameterzahl des gehosteten qwen3.8-flash ausgegeben werden. [S02, S04]
Kontextfenster und Ausgabelimit
Alibaba dokumentiert für das gehostete Modell 1.000.000 Tokens Kontext. Ohne Thinking sind maximal 991.808 Input-Tokens möglich; im Thinking-Modus 983.616. Die maximale Ausgabe liegt jeweils bei 131.072 Tokens, die maximale Thinking-Kette bei 262.144 Tokens. [S04]
Damit zielt das Modell auf Workloads, die nicht nur aus kurzen Chats bestehen: große Repositories, lange Dokumente, agentische Verläufe oder multimodale Eingaben. Ein 1M-Fenster bedeutet allerdings nicht, dass jede Anwendung automatisch sinnvoll eine Million Tokens senden sollte. Latenz, Kosten, Retrieval-Qualität und die Fähigkeit, relevante Details über sehr lange Sequenzen zu nutzen, bleiben separate Fragen.
Aktuelle Preise: Launch-Angabe und heutige Dokumentation unterscheiden sich
Reuters berichtete zum Launch am 26. August von 1 CNY pro Million Input-Tokens und 3 CNY pro Million Output-Tokens. Zwei Tage später weist die aktuelle offizielle Alibaba-Dokumentation für Beijing und Frankfurt bereits 0,8 CNY Input / 2,7 CNY Output aus. Für Singapore gelten 1,094 / 3,427 CNY. [S04, S06, S24]
Das ist ein gutes Beispiel dafür, warum Launch-Artikel bei API-Preisen schnell altern. Für Kauf- oder Kostenentscheidungen sollte die aktuelle regionale Preisseite maßgeblich sein. Für den Vergleich mit dem größeren Modell gibt es im Qwen3.8-Max-Faktencheck eine separate Preis- und Benchmark-Einordnung.
Gegen Qwen3.7-Flash ist 3.8 nicht immer billiger
In Frankfurt/Beijing kostet Qwen3.7-Flash bei Prompts bis 32K Tokens 0,2 CNY Input und 0,8 CNY Output. Damit ist Qwen3.8-Flash in diesem kurzen Bereich 4× so teuer beim Input und 3,375× beim Output. Erst im langen Tier von 256K bis 1M dreht sich die Rechnung: Qwen3.7-Flash kostet dort 1,2/4,8 CNY, Qwen3.8-Flash 0,8/2,7 CNY. Qwen3.8 ist dann rechnerisch 33,3 % günstiger beim Input und 43,75 % günstiger beim Output. [S06]
Redaktionelle Schlussfolgerung: Qwen3.8-Flash ist kein pauschaler Preisnachfolger für jeden kurzen Chat. Der wirtschaftliche Vorteil ist besonders interessant, wenn lange Kontexte, bessere Modellqualität oder Agentenfunktionen tatsächlich genutzt werden.
Drei Kostenbeispiele in US-Dollar
Mit der öffentlich gelisteten QwenCloud/OpenRouter-Referenz von 0,16 Dollar pro Million Input- und 0,47 Dollar pro Million Output-Tokens ergeben sich folgende reinen Tokenkosten. [S18, S19]
| Nutzung | Input/Monat | Output/Monat | Eigene Rechnung |
|---|---|---|---|
| leicht | 10 Mio. | 2 Mio. | $2,54 |
| mittel | 100 Mio. | 20 Mio. | $25,40 |
| intensiv | 1 Mrd. | 200 Mio. | $254,00 |
Formel: (Input-Mio. × 0,16 $) + (Output-Mio. × 0,47 $). Nicht enthalten sind mögliche Provideraufschläge, Tools, Websuche, Speicherung oder wechselnde Rabatte.
Was ändert Flash-Next technisch?
Qwen3.8-Flash-Next kombiniert drei GDN-Schichten mit einer QSA-Schicht in einem wiederkehrenden Muster. SGLang beschreibt 48 Schichten insgesamt: 36 GDN- und 12 QSA-Schichten. QSA steht für Qwen Sparse Attention und soll bei langen Sequenzen nur besonders relevante Kontextbereiche für die teure Attention auswählen. [S02, S21]
Dazu kommen zwei ungewöhnliche Bausteine:
Gated Residual (GR) verbreitert den Residualpfad auf vier Zweige und steuert dynamisch, welche Information gelesen und zurückgeschrieben wird. N-Gram Embedding ergänzt einen großen, hashbasierten Speicher für lokale Tokenmuster. Qwen nennt dafür 51B zusätzliche Embedding-Parameter; SGLang beschreibt, dass diese Tabelle in Host-RAM ausgelagert werden kann, sodass sie nicht dauerhaft GPU-Speicher belegt. [S02, S21]
Das Hauptmodell hat 125B Parameter, während pro Token 6B Parameter aktiviert werden. Qwen vergleicht den Trainingsaufwand mit Qwen3.7-Plus und nennt etwa ein Neuntel der Trainingskosten. Das ist eine Herstellerangabe, keine unabhängig reproduzierte Kostenrechnung. [S02, S24]
Benchmarks: stark, aber Hersteller- und Fremdmessungen trennen
Qwen meldet für Flash-Next unter anderem 62,5 auf SWE-bench Pro, 81,0 auf SWE-bench Multilingual, 73,9 auf CoWorkBench, 91,7 auf GPQA Diamond und 91,9 auf LiveCodeBench v6. Diese Werte zeigen, wo Qwen das Modell positioniert: Coding, Agenten/Office-Aufgaben und allgemeines Reasoning. Sie sind jedoch Herstellerbenchmarks und hängen von Harness, Sampling, Tooling und Prompting ab. [S01]
Eine unabhängige Gegenperspektive liefert Artificial Analysis. Dort erreicht Flash-Next zum Prüfzeitpunkt einen Intelligence Index von 56; für einen getesteten Alibaba-Endpunkt werden etwa 73,4 Output-Tokens/s und 2,98 Sekunden Time-to-First-Token ausgewiesen. Diese Messungen beantworten andere Fragen als Qwens Einzelbenchmarks und sollten nicht zu einer gemeinsamen Rangliste vermischt werden. [S20]
API und Agentenfunktionen
Alibaba dokumentiert OpenAI-kompatible Chat-Completions und Responses sowie eine Anthropic-kompatible Messages API. In Model Studio unterstützt Qwen3.8-Flash Function Calling, Structured Output, Prefix Continuation und Context Caching. Thinking ist beim Modell standardmäßig aktiv. [S04, S07–S09, S12, S17]
Für produktive Anwendungen ist die Region wichtig. In Frankfurt ist Context Caching verfügbar, die integrierte Websuche für dieses Modell laut Modellseite dagegen nicht. Batch Inference ist für Qwen3.8-Flash in Beijing unterstützt, nicht aber in Singapore und Frankfurt; die Batch-Dokumentation setzt außerdem ein 256K-Kontextlimit pro Batch-Anfrage. [S04, S13, S14, S15]
Auch Rate Limits unterscheiden sich: Alibaba nennt für Beijing 30.000 RPM und 5 Mio. TPM, für Singapore 15.000 RPM und 2 Mio. TPM; Frankfurt wird mit 30.000 RPM und 5 Mio. TPM geführt. [S16]
Lässt sich Qwen3.8-Flash lokal auf einem Mac betreiben?
Der Cloud-Endpunkt selbst wird nicht „lokal“ ausgeführt. Dafür ist Flash-Next relevant. Qwens Repository nennt MLX/mlx-vlm ausdrücklich für Apple Silicon und llama.cpp für Text und Vision. [S02] Wenn du zunächst mit einer kleineren lokalen Variante starten willst, ist der Qwen3.8-27B-Guide der realistischere Einstieg.
Das heißt aber nicht, dass ein gewöhnlicher 16- oder 32-GB-Mac das Modell komfortabel lädt. Unsloth gibt für eine aggressive 1-Bit-GGUF-Variante etwa 75 GB RAM oder Unified Memory an. Selbst diese Zahl ist eine Drittanbieterangabe für eine konkrete Quantisierung und kein allgemeines Mindestmaß. [S22, S37] Für die grundlegende Speicherplanung hilft außerdem der Unified-Memory-Guide.
Für typische Macs ist deshalb die Cloud-API realistischer. Lokales Flash-Next wird interessant auf Systemen mit sehr viel Unified Memory/RAM oder mehreren GPUs, wenn Datenschutz, Offline-Betrieb, Forschung oder Inference-Tuning den Aufwand rechtfertigen.
Frühe Local-Inference-Probleme
Zwei Tage nach dem Release ist der lokale Software-Stack naturgemäß noch jung. In SGLang wurde etwa ein Problem gemeldet, bei dem Thinking zusammen mit dem qwen3_coder-Toolparser in einer Token-0-Schleife enden kann. Ein weiterer Report betrifft QSA/SSM-Pfade auf RTX PRO 6000 Blackwell (SM120). [S27, S28]
Auch llama.cpp entwickelt die Unterstützung noch aktiv; am 28. August wurde ein Fehler für den N-Gram-Cache bei spekulativem Decoding dokumentiert. [S29, S30]
Diese Punkte sind keine Belege für Fehler im gehosteten Alibaba-Modell. Sie zeigen vielmehr, dass Self-Hosting direkt nach einem Architekturwechsel mehr Integrationsrisiko trägt.
Lizenz: offen verfügbare Gewichte, aber nicht Apache
Qwen3.8-Flash-Next steht unter Qwen Community License 1.0. Die Lizenz erlaubt grundsätzlich unter anderem Nutzung, Kopieren, Modifizieren, Verteilen, Hosting und Fine-Tuning. Sie enthält jedoch Bedingungen: Ab sehr großer kommerzieller Reichweite ist eine prominente Modellnennung vorgesehen; für bestimmte Model-as-a-Service- und AI-Work-Assistant-Geschäfte verlangt der Text eine separate Lizenz. [S36]
Für ein kommerzielles Produkt ist deshalb der konkrete Lizenztext maßgeblich. „Open weights“ sollte hier nicht mit „Apache-2.0 ohne Sonderbedingungen“ gleichgesetzt werden.
Für wen lohnt sich Qwen3.8-Flash?
Qwen3.8-Flash ist besonders interessant, wenn du lange Kontexte, multimodale Eingaben, Agenten/Tool-Calling und sehr niedrige API-Kosten kombinieren willst. Der Preis ist bei kurzen Eingaben nicht automatisch besser als Qwen3.7-Flash, wird aber bei sehr langen Kontexten deutlich attraktiver.
Flash-Next ist interessanter, wenn du die neue Qwen4-nahe Architektur untersuchen, selbst hosten oder quantisieren willst und ausreichend Speicher sowie Bereitschaft für einen noch schnell reifenden Inference-Stack mitbringst.
Der wichtigste Kauf- oder Implementierungscheck lautet deshalb nicht „Wie gut ist Qwen3.8-Flash?“, sondern: Willst du einen günstigen produktiven Cloud-Endpunkt oder die offene Flash-Next-Architektur selbst betreiben?
Methodik und Stand
Recherche: 28. August 2026. Geprüft wurden 37 Quellen, darunter Alibaba/Qwen-Primärdokumentation, offizielle Repositories und Lizenztexte, Implementierungsquellen, unabhängige Benchmarks, Nachrichtenquellen und frühe Bugreports. Preise und Verfügbarkeit sind zeitkritisch; insbesondere API-Preise sollten vor produktiver Nutzung erneut auf der regionalen Alibaba-Seite geprüft werden.
Häufig gestellte Fragen
Was kostet Qwen3.8-Flash?
In Frankfurt und Beijing nennt Alibaba 0,8 CNY pro 1 Mio. Input-Tokens und 2,7 CNY pro 1 Mio. Output-Tokens. Singapore liegt bei 1,094 beziehungsweise 3,427 CNY; öffentliche USD-Referenzen liegen bei etwa 0,16/0,47 US-Dollar. [S04, S06, S18, S19]
Was ist der Unterschied zwischen Qwen3.8-Flash und Flash-Next?
Qwen3.8-Flash ist der gehostete Produktions-Endpunkt. Qwen3.8-Flash-Next sind offene Gewichte einer Architekturvorschau; die Angaben 125B Hauptmodell, 51B N-Gram und 6B aktiv pro Token gehören zu Flash-Next. [S01, S02, S04]
Wie groß ist das Kontextfenster von Qwen3.8-Flash?
Das gehostete Modell hat 1.000.000 Tokens Gesamtkontext, bis zu 991.808 Input-Tokens ohne Thinking und 131.072 Output-Tokens. Im Thinking-Modus sinkt das maximale Input-Limit auf 983.616 Tokens. [S04]
Ist Qwen3.8-Flash günstiger als Qwen3.7-Flash?
Nicht bei kurzen Prompts: Bis 32K ist Qwen3.8-Flash beim Input rechnerisch viermal teurer. Im Tier 256K–1M ist Qwen3.8-Flash dagegen rund 33,3 Prozent günstiger beim Input und 43,75 Prozent beim Output. [S06]
Kann Qwen3.8-Flash lokal auf einem Mac laufen?
Der gehostete Endpunkt läuft nicht lokal. Für lokale Tests ist Flash-Next relevant; eine konkrete 1-Bit-Quantisierung wird mit etwa 75 GB RAM oder Unified Memory angegeben. 16- oder 32-GB-Macs sind dafür kein realistisches Ziel. [S02, S22, S37]
Ist Qwen3.8-Flash-Next Open Source?
Die Gewichte sind offen verfügbar und stehen unter der Qwen Community License 1.0, nicht unter Apache-2.0. Für kommerzielle Model-as-a-Service- oder AI-Work-Assistant-Angebote verlangt der Lizenztext eine gesonderte Prüfung beziehungsweise Lizenz. [S36]
Transparenz
Quellen und Prüfgrundlage
Diese Primär- und Referenzquellen bilden die Grundlage der technischen Einordnung. Herstellerangaben und externe Benchmarks werden im Artikel als solche gekennzeichnet.
- qwen.ai blog
- github.com QwenLM / Qwen3.8-Flash-Next
- huggingface.co Qwen / Qwen3.8-Flash-Next
- help.aliyun.com model-studio / qwen3-8-flash
- help.aliyun.com model-studio / newly-released-models
- help.aliyun.com model-studio / model-pricing
- help.aliyun.com model-studio / qwen-api-via-openai-chat-completions
- help.aliyun.com model-studio / qwen-api-via-openai-responses
- help.aliyun.com model-studio / deep-thinking
- help.aliyun.com model-studio / visual-reasoning
- help.aliyun.com model-studio / qwen-api-via-dashscope
- help.aliyun.com model-studio / qwen-function-calling
- help.aliyun.com model-studio / context-cache
- help.aliyun.com model-studio / batch-inference
- help.aliyun.com model-studio / web-search
- help.aliyun.com model-studio / rate-limit
- help.aliyun.com model-studio / anthropic-api-messages
- qwencloud.com models / qwen3.8-flash
- openrouter.ai qwen / qwen3.8-flash
- artificialanalysis.ai models / qwen3-8-flash-next
- lmsys.org blog / 2026-08-26-qwen-flash-next
- newreleases.io release / v0.1.804-beta
- ollama.com library / qwen3.8-flash-next
- reuters.com retail-consumer / alibabas-qwen-launches-qwen38-flash-ai-model-with-lower-training-costs-2026-08-26
- kaitchup.substack.com p / qwen38-flash-next-review-benchmarks
- ithome.com 994 / 735.htm
- github.com issues / 36537
- github.com issues / 36701
- github.com issues / 27741
- github.com issues / 27852
- yix.ai blog / qwen3-8-flash
- modelpricewatch.com models / alibaba-qwen3-8-flash
- requesty.ai alibaba / qwen3.8-flash
- ai-model-matrix.com models / qwen-qwen3-8-flash
- superpenguin.ai qwen / qwen3.8-flash
- huggingface.co main / LICENSE
- huggingface.co main / README.md