Technische Recherche mit Quellenangaben. Eigene Messungen sind im Artikel gekennzeichnet.

Veröffentlicht: 28. August 2026 Aktualisiert: 28. August 2026

Über den Autor

Geprüft am 28. August 2026. Qwen3.8-Flash ist Alibabas neues gehostetes multimodales Flash-Modell mit dem API-Namen qwen3.8-flash. Es verarbeitet Text, Bilder und Video, gibt Text aus und bietet in Alibaba Model Studio einen Kontext von 1.000.000 Tokens. Wichtig: Qwen3.8-Flash ist nicht dasselbe wie Qwen3.8-Flash-Next. Flash-Next ist die parallel veröffentlichte Open-Weight-Architekturvorschau in Richtung Qwen4. Wer Preise, Parameterzahlen, Lizenz und lokale Hardwareanforderungen vermischt, kommt deshalb schnell zu falschen Aussagen. [S01–S06]

Kurzantwort

  • Hosted Qwen3.8-Flash: bis zu 991.808 Input-Tokens, 131.072 Output-Tokens und 1.000.000 Tokens Gesamtkontext. Thinking ist standardmäßig aktiv. [S04, S09]
  • Multimodal: Text, Bilder und Video als Eingabe; Text als Ausgabe. Function Calling, Structured Output, Prefix Continuation und Context Caching werden unterstützt. [S04, S10]
  • Aktueller Originalpreis in Frankfurt/Beijing: 0,8 CNY pro 1 Mio. Input-Tokens und 2,7 CNY pro 1 Mio. Output-Tokens. In Singapore sind es 1,094 bzw. 3,427 CNY. [S04, S06]
  • Öffentliche USD-API-Referenz: QwenCloud/OpenRouter listen rund 0,16 US-Dollar pro 1 Mio. Input-Tokens und 0,47 US-Dollar pro 1 Mio. Output-Tokens. [S18, S19]
  • Flash-Next: 125B-Parameter-Hauptmodell plus 51B N-Gram-Embedding, 6B aktive Parameter pro Token; Qwen Community License 1.0. Diese Architekturangaben gelten direkt für Flash-Next, nicht automatisch für den gehosteten Produktionsendpunkt. [S02, S36]
  • Lokaler Betrieb: prinzipiell über Transformers, llama.cpp, MLX, SGLang, vLLM und Drittanbieter-Quantisierungen möglich, aber das Modell ist groß. Unsloth nennt für eine extreme 1-Bit-Quantisierung etwa 75 GB RAM/Unified Memory. [S02, S22, S37]

Qwen3.8-Flash und Qwen3.8-Flash-Next: der wichtigste Unterschied

Alibaba veröffentlichte am 26. August 2026 zwei eng verwandte Namen. qwen3.8-flash bezeichnet den produktiven Cloud-Endpunkt. Qwen3.8-Flash-Next bezeichnet die offenen Gewichte einer experimentellen Architekturvorschau. Qwen beschreibt Flash-Next ausdrücklich als frühen Blick auf die Architektur, die für Qwen4 vorgesehen ist. [S01, S02, S05]

Diese Trennung hat praktische Folgen:

PunktQwen3.8-FlashQwen3.8-Flash-Next
HauptrolleGehostetes ProduktionsmodellOpen-Weight-Architekturpreview
API-IDqwen3.8-flashje nach Host Qwen/Qwen3.8-Flash-Next
Kontext1.000.000 Tokens262.144 nativ; Erweiterung auf 1M via YaRN laut Qwen
Lokale Gewichtenicht durch den Cloud-Namen beschriebenja
Architekturparameternicht separat als Cloud-Spezifikation veröffentlicht125B Hauptmodell + 51B N-Gram; 6B aktiv/Token
LizenzCloud-NutzungsbedingungenQwen Community License 1.0
Typischer EinsatzAPI, Agenten, Coding, lange DokumenteForschung, Self-Hosting, Quantisierung, Inference-Engineering

Das ist mehr als Namenskosmetik: Die oft zitierte Zahl „125B“ gehört zur Flash-Next-Veröffentlichung. Sie sollte nicht ohne Zusatz als Parameterzahl des gehosteten qwen3.8-flash ausgegeben werden. [S02, S04]

Kontextfenster und Ausgabelimit

Alibaba dokumentiert für das gehostete Modell 1.000.000 Tokens Kontext. Ohne Thinking sind maximal 991.808 Input-Tokens möglich; im Thinking-Modus 983.616. Die maximale Ausgabe liegt jeweils bei 131.072 Tokens, die maximale Thinking-Kette bei 262.144 Tokens. [S04]

Damit zielt das Modell auf Workloads, die nicht nur aus kurzen Chats bestehen: große Repositories, lange Dokumente, agentische Verläufe oder multimodale Eingaben. Ein 1M-Fenster bedeutet allerdings nicht, dass jede Anwendung automatisch sinnvoll eine Million Tokens senden sollte. Latenz, Kosten, Retrieval-Qualität und die Fähigkeit, relevante Details über sehr lange Sequenzen zu nutzen, bleiben separate Fragen.

Dokumentierte Kontextlimits: gehostetes Qwen3.8-Flash mit 1.000.000 Tokens versus Flash-Next mit 262.144 nativen Tokens und YaRN-Erweiterung.

Aktuelle Preise: Launch-Angabe und heutige Dokumentation unterscheiden sich

Reuters berichtete zum Launch am 26. August von 1 CNY pro Million Input-Tokens und 3 CNY pro Million Output-Tokens. Zwei Tage später weist die aktuelle offizielle Alibaba-Dokumentation für Beijing und Frankfurt bereits 0,8 CNY Input / 2,7 CNY Output aus. Für Singapore gelten 1,094 / 3,427 CNY. [S04, S06, S24]

Das ist ein gutes Beispiel dafür, warum Launch-Artikel bei API-Preisen schnell altern. Für Kauf- oder Kostenentscheidungen sollte die aktuelle regionale Preisseite maßgeblich sein. Für den Vergleich mit dem größeren Modell gibt es im Qwen3.8-Max-Faktencheck eine separate Preis- und Benchmark-Einordnung.

Gegen Qwen3.7-Flash ist 3.8 nicht immer billiger

In Frankfurt/Beijing kostet Qwen3.7-Flash bei Prompts bis 32K Tokens 0,2 CNY Input und 0,8 CNY Output. Damit ist Qwen3.8-Flash in diesem kurzen Bereich 4× so teuer beim Input und 3,375× beim Output. Erst im langen Tier von 256K bis 1M dreht sich die Rechnung: Qwen3.7-Flash kostet dort 1,2/4,8 CNY, Qwen3.8-Flash 0,8/2,7 CNY. Qwen3.8 ist dann rechnerisch 33,3 % günstiger beim Input und 43,75 % günstiger beim Output. [S06]

Redaktionelle Schlussfolgerung: Qwen3.8-Flash ist kein pauschaler Preisnachfolger für jeden kurzen Chat. Der wirtschaftliche Vorteil ist besonders interessant, wenn lange Kontexte, bessere Modellqualität oder Agentenfunktionen tatsächlich genutzt werden.

API-Preise in Frankfurt und Beijing pro 1 Mio. Tokens: Qwen3.8-Flash gegenüber den Kontext-Tiers von Qwen3.7-Flash.

Drei Kostenbeispiele in US-Dollar

Mit der öffentlich gelisteten QwenCloud/OpenRouter-Referenz von 0,16 Dollar pro Million Input- und 0,47 Dollar pro Million Output-Tokens ergeben sich folgende reinen Tokenkosten. [S18, S19]

NutzungInput/MonatOutput/MonatEigene Rechnung
leicht10 Mio.2 Mio.$2,54
mittel100 Mio.20 Mio.$25,40
intensiv1 Mrd.200 Mio.$254,00

Formel: (Input-Mio. × 0,16 $) + (Output-Mio. × 0,47 $). Nicht enthalten sind mögliche Provideraufschläge, Tools, Websuche, Speicherung oder wechselnde Rabatte.

Was ändert Flash-Next technisch?

Qwen3.8-Flash-Next kombiniert drei GDN-Schichten mit einer QSA-Schicht in einem wiederkehrenden Muster. SGLang beschreibt 48 Schichten insgesamt: 36 GDN- und 12 QSA-Schichten. QSA steht für Qwen Sparse Attention und soll bei langen Sequenzen nur besonders relevante Kontextbereiche für die teure Attention auswählen. [S02, S21]

Dazu kommen zwei ungewöhnliche Bausteine:

Gated Residual (GR) verbreitert den Residualpfad auf vier Zweige und steuert dynamisch, welche Information gelesen und zurückgeschrieben wird. N-Gram Embedding ergänzt einen großen, hashbasierten Speicher für lokale Tokenmuster. Qwen nennt dafür 51B zusätzliche Embedding-Parameter; SGLang beschreibt, dass diese Tabelle in Host-RAM ausgelagert werden kann, sodass sie nicht dauerhaft GPU-Speicher belegt. [S02, S21]

Das Hauptmodell hat 125B Parameter, während pro Token 6B Parameter aktiviert werden. Qwen vergleicht den Trainingsaufwand mit Qwen3.7-Plus und nennt etwa ein Neuntel der Trainingskosten. Das ist eine Herstellerangabe, keine unabhängig reproduzierte Kostenrechnung. [S02, S24]

Schematische Architektur von Qwen3.8-Flash-Next mit 48 Layern, GDN und QSA, 125B-Hauptmodell sowie 51B N-Gram-Embedding.

Benchmarks: stark, aber Hersteller- und Fremdmessungen trennen

Qwen meldet für Flash-Next unter anderem 62,5 auf SWE-bench Pro, 81,0 auf SWE-bench Multilingual, 73,9 auf CoWorkBench, 91,7 auf GPQA Diamond und 91,9 auf LiveCodeBench v6. Diese Werte zeigen, wo Qwen das Modell positioniert: Coding, Agenten/Office-Aufgaben und allgemeines Reasoning. Sie sind jedoch Herstellerbenchmarks und hängen von Harness, Sampling, Tooling und Prompting ab. [S01]

Eine unabhängige Gegenperspektive liefert Artificial Analysis. Dort erreicht Flash-Next zum Prüfzeitpunkt einen Intelligence Index von 56; für einen getesteten Alibaba-Endpunkt werden etwa 73,4 Output-Tokens/s und 2,98 Sekunden Time-to-First-Token ausgewiesen. Diese Messungen beantworten andere Fragen als Qwens Einzelbenchmarks und sollten nicht zu einer gemeinsamen Rangliste vermischt werden. [S20]

Von Qwen berichtete Flash-Next-Benchmarks für SWE-bench Pro, CoWorkBench, GPQA Diamond und LiveCodeBench v6; keine unabhängige Rangliste.

API und Agentenfunktionen

Alibaba dokumentiert OpenAI-kompatible Chat-Completions und Responses sowie eine Anthropic-kompatible Messages API. In Model Studio unterstützt Qwen3.8-Flash Function Calling, Structured Output, Prefix Continuation und Context Caching. Thinking ist beim Modell standardmäßig aktiv. [S04, S07–S09, S12, S17]

Für produktive Anwendungen ist die Region wichtig. In Frankfurt ist Context Caching verfügbar, die integrierte Websuche für dieses Modell laut Modellseite dagegen nicht. Batch Inference ist für Qwen3.8-Flash in Beijing unterstützt, nicht aber in Singapore und Frankfurt; die Batch-Dokumentation setzt außerdem ein 256K-Kontextlimit pro Batch-Anfrage. [S04, S13, S14, S15]

Auch Rate Limits unterscheiden sich: Alibaba nennt für Beijing 30.000 RPM und 5 Mio. TPM, für Singapore 15.000 RPM und 2 Mio. TPM; Frankfurt wird mit 30.000 RPM und 5 Mio. TPM geführt. [S16]

Lässt sich Qwen3.8-Flash lokal auf einem Mac betreiben?

Der Cloud-Endpunkt selbst wird nicht „lokal“ ausgeführt. Dafür ist Flash-Next relevant. Qwens Repository nennt MLX/mlx-vlm ausdrücklich für Apple Silicon und llama.cpp für Text und Vision. [S02] Wenn du zunächst mit einer kleineren lokalen Variante starten willst, ist der Qwen3.8-27B-Guide der realistischere Einstieg.

Das heißt aber nicht, dass ein gewöhnlicher 16- oder 32-GB-Mac das Modell komfortabel lädt. Unsloth gibt für eine aggressive 1-Bit-GGUF-Variante etwa 75 GB RAM oder Unified Memory an. Selbst diese Zahl ist eine Drittanbieterangabe für eine konkrete Quantisierung und kein allgemeines Mindestmaß. [S22, S37] Für die grundlegende Speicherplanung hilft außerdem der Unified-Memory-Guide.

Für typische Macs ist deshalb die Cloud-API realistischer. Lokales Flash-Next wird interessant auf Systemen mit sehr viel Unified Memory/RAM oder mehreren GPUs, wenn Datenschutz, Offline-Betrieb, Forschung oder Inference-Tuning den Aufwand rechtfertigen.

Frühe Local-Inference-Probleme

Zwei Tage nach dem Release ist der lokale Software-Stack naturgemäß noch jung. In SGLang wurde etwa ein Problem gemeldet, bei dem Thinking zusammen mit dem qwen3_coder-Toolparser in einer Token-0-Schleife enden kann. Ein weiterer Report betrifft QSA/SSM-Pfade auf RTX PRO 6000 Blackwell (SM120). [S27, S28]

Auch llama.cpp entwickelt die Unterstützung noch aktiv; am 28. August wurde ein Fehler für den N-Gram-Cache bei spekulativem Decoding dokumentiert. [S29, S30]

Diese Punkte sind keine Belege für Fehler im gehosteten Alibaba-Modell. Sie zeigen vielmehr, dass Self-Hosting direkt nach einem Architekturwechsel mehr Integrationsrisiko trägt.

Lizenz: offen verfügbare Gewichte, aber nicht Apache

Qwen3.8-Flash-Next steht unter Qwen Community License 1.0. Die Lizenz erlaubt grundsätzlich unter anderem Nutzung, Kopieren, Modifizieren, Verteilen, Hosting und Fine-Tuning. Sie enthält jedoch Bedingungen: Ab sehr großer kommerzieller Reichweite ist eine prominente Modellnennung vorgesehen; für bestimmte Model-as-a-Service- und AI-Work-Assistant-Geschäfte verlangt der Text eine separate Lizenz. [S36]

Für ein kommerzielles Produkt ist deshalb der konkrete Lizenztext maßgeblich. „Open weights“ sollte hier nicht mit „Apache-2.0 ohne Sonderbedingungen“ gleichgesetzt werden.

Für wen lohnt sich Qwen3.8-Flash?

Qwen3.8-Flash ist besonders interessant, wenn du lange Kontexte, multimodale Eingaben, Agenten/Tool-Calling und sehr niedrige API-Kosten kombinieren willst. Der Preis ist bei kurzen Eingaben nicht automatisch besser als Qwen3.7-Flash, wird aber bei sehr langen Kontexten deutlich attraktiver.

Flash-Next ist interessanter, wenn du die neue Qwen4-nahe Architektur untersuchen, selbst hosten oder quantisieren willst und ausreichend Speicher sowie Bereitschaft für einen noch schnell reifenden Inference-Stack mitbringst.

Der wichtigste Kauf- oder Implementierungscheck lautet deshalb nicht „Wie gut ist Qwen3.8-Flash?“, sondern: Willst du einen günstigen produktiven Cloud-Endpunkt oder die offene Flash-Next-Architektur selbst betreiben?

Methodik und Stand

Recherche: 28. August 2026. Geprüft wurden 37 Quellen, darunter Alibaba/Qwen-Primärdokumentation, offizielle Repositories und Lizenztexte, Implementierungsquellen, unabhängige Benchmarks, Nachrichtenquellen und frühe Bugreports. Preise und Verfügbarkeit sind zeitkritisch; insbesondere API-Preise sollten vor produktiver Nutzung erneut auf der regionalen Alibaba-Seite geprüft werden.

Häufig gestellte Fragen

Was kostet Qwen3.8-Flash?

In Frankfurt und Beijing nennt Alibaba 0,8 CNY pro 1 Mio. Input-Tokens und 2,7 CNY pro 1 Mio. Output-Tokens. Singapore liegt bei 1,094 beziehungsweise 3,427 CNY; öffentliche USD-Referenzen liegen bei etwa 0,16/0,47 US-Dollar. [S04, S06, S18, S19]

Was ist der Unterschied zwischen Qwen3.8-Flash und Flash-Next?

Qwen3.8-Flash ist der gehostete Produktions-Endpunkt. Qwen3.8-Flash-Next sind offene Gewichte einer Architekturvorschau; die Angaben 125B Hauptmodell, 51B N-Gram und 6B aktiv pro Token gehören zu Flash-Next. [S01, S02, S04]

Wie groß ist das Kontextfenster von Qwen3.8-Flash?

Das gehostete Modell hat 1.000.000 Tokens Gesamtkontext, bis zu 991.808 Input-Tokens ohne Thinking und 131.072 Output-Tokens. Im Thinking-Modus sinkt das maximale Input-Limit auf 983.616 Tokens. [S04]

Ist Qwen3.8-Flash günstiger als Qwen3.7-Flash?

Nicht bei kurzen Prompts: Bis 32K ist Qwen3.8-Flash beim Input rechnerisch viermal teurer. Im Tier 256K–1M ist Qwen3.8-Flash dagegen rund 33,3 Prozent günstiger beim Input und 43,75 Prozent beim Output. [S06]

Kann Qwen3.8-Flash lokal auf einem Mac laufen?

Der gehostete Endpunkt läuft nicht lokal. Für lokale Tests ist Flash-Next relevant; eine konkrete 1-Bit-Quantisierung wird mit etwa 75 GB RAM oder Unified Memory angegeben. 16- oder 32-GB-Macs sind dafür kein realistisches Ziel. [S02, S22, S37]

Ist Qwen3.8-Flash-Next Open Source?

Die Gewichte sind offen verfügbar und stehen unter der Qwen Community License 1.0, nicht unter Apache-2.0. Für kommerzielle Model-as-a-Service- oder AI-Work-Assistant-Angebote verlangt der Lizenztext eine gesonderte Prüfung beziehungsweise Lizenz. [S36]

Transparenz

Quellen und Prüfgrundlage

37

Diese Primär- und Referenzquellen bilden die Grundlage der technischen Einordnung. Herstellerangaben und externe Benchmarks werden im Artikel als solche gekennzeichnet.

  1. qwen.ai blog
  2. github.com QwenLM / Qwen3.8-Flash-Next
  3. huggingface.co Qwen / Qwen3.8-Flash-Next
  4. help.aliyun.com model-studio / qwen3-8-flash
  5. help.aliyun.com model-studio / newly-released-models
  6. help.aliyun.com model-studio / model-pricing
  7. help.aliyun.com model-studio / qwen-api-via-openai-chat-completions
  8. help.aliyun.com model-studio / qwen-api-via-openai-responses
  9. help.aliyun.com model-studio / deep-thinking
  10. help.aliyun.com model-studio / visual-reasoning
  11. help.aliyun.com model-studio / qwen-api-via-dashscope
  12. help.aliyun.com model-studio / qwen-function-calling
  13. help.aliyun.com model-studio / context-cache
  14. help.aliyun.com model-studio / batch-inference
  15. help.aliyun.com model-studio / web-search
  16. help.aliyun.com model-studio / rate-limit
  17. help.aliyun.com model-studio / anthropic-api-messages
  18. qwencloud.com models / qwen3.8-flash
  19. openrouter.ai qwen / qwen3.8-flash
  20. artificialanalysis.ai models / qwen3-8-flash-next
  21. lmsys.org blog / 2026-08-26-qwen-flash-next
  22. newreleases.io release / v0.1.804-beta
  23. ollama.com library / qwen3.8-flash-next
  24. reuters.com retail-consumer / alibabas-qwen-launches-qwen38-flash-ai-model-with-lower-training-costs-2026-08-26
  25. kaitchup.substack.com p / qwen38-flash-next-review-benchmarks
  26. ithome.com 994 / 735.htm
  27. github.com issues / 36537
  28. github.com issues / 36701
  29. github.com issues / 27741
  30. github.com issues / 27852
  31. yix.ai blog / qwen3-8-flash
  32. modelpricewatch.com models / alibaba-qwen3-8-flash
  33. requesty.ai alibaba / qwen3.8-flash
  34. ai-model-matrix.com models / qwen-qwen3-8-flash
  35. superpenguin.ai qwen / qwen3.8-flash
  36. huggingface.co main / LICENSE
  37. huggingface.co main / README.md