Prüfstand: 14. August 2026. Qwen3.8-27B ist kein Gerücht mehr: Unter Qwen/Qwen3.8-27B steht seit heute ein offizieller Checkpoint auf Hugging Face. Die Repo-Metadaten nennen Qwen als Autor, 27.781,4 Millionen Parameter, image-text-to-text, die Architekturkennung qwen3_5 und Apache 2.0. Gleichzeitig sind bereits eine offizielle FP8-Version sowie 4-Bit-, 8-Bit- und BF16-Konvertierungen für MLX und ein GGUF-Paket erschienen. [S1–S6]
Der wichtigste Vorbehalt ist ebenso klar: Der Release ist erst wenige Stunden alt. Die offizielle Model Card enthält inzwischen eine eigene Benchmark-Tabelle und nennt 262.144 Tokens als natives Kontextlimit; eine Erweiterung bis 1.000.000 Tokens wird über RoPE/YaRN-Konfiguration beschrieben. Diese Werte gehören zum herunterladbaren Checkpoint. Die 1M-Angabe des gehosteten Qwen3.8-Angebots ist dagegen eine andere Bereitstellungsoberfläche. Unabhängige Qwen3.8-27B-Mac-Benchmarks und reproduzierbare Laufzeitvergleiche bleiben offen. [S1, S7–S10]
Schnellantwort
Die wichtigsten Launch-Fragen in einem Blick, mit Quelle je Zeile:
| Frage | Stand am 14.08.2026 |
|---|---|
| Gibt es Qwen3.8-27B wirklich? | Ja. Offizieller Qwen-Checkpoint. [S1] |
| Parameter | 27.781,4 Mio. laut Repo-Metadaten. [S1] |
| Open Weight | Ja. |
| Lizenz | Apache 2.0. [S1, S2] |
| Multimodal | Ja, als image-text-to-text gekennzeichnet. [S1] |
| Offizielle FP8-Version | Ja. [S2] |
| MLX für Apple Silicon | Ja: 4 Bit, 8 Bit und BF16 sind bereits vorhanden. [S3–S5] |
| GGUF | Ja, Unsloth hat bereits ein Paket veröffentlicht. [S6] |
| Offizielle Benchmark-Tabelle | Ja, in der Model Card; unabhängige Reproduktion offen. |
| Kontext | 262.144 nativ; bis 1.000.000 mit dokumentierter Erweiterung. |
| oMLX-Kompatibilität | Wahrscheinlich, aber noch direkt zu testen. Die Architekturkennung und MLX-Konvertierungen sprechen dafür; eine Qwen3.8-spezifische oMLX-Freigabe war bei der Prüfung noch nicht indexiert. [S1, S3–S5, S17–S25] |
Qwen3.8-27B ist nicht Qwen3.8-Max-Preview
Das ist die erste Verwechslungsgefahr des Releases. Alibaba hatte am 19. Juli 2026 qwen3.8-max-preview als gehostetes Modell im Token Plan eingeführt. Der Dienst wurde als Qwen3.8-Flaggschiff mit sehr großer Modellskala beworben und ist in QwenCloud mit 1 Million Tokens Kontext gelistet. [S7–S9]
Qwen3.8-27B ist ein anderer Artefakt-Typ: ein herunterladbarer 27B-Checkpoint mit Apache-2.0-Lizenz. Die Kontextlänge oder Benchmarks des Max Preview dürfen daher nicht einfach auf die 27B-Version übertragen werden.
Diese Trennung ist für lokale Nutzer entscheidend: Das Max Preview ist ein Cloud-Service; Qwen3.8-27B kann dagegen selbst gehostet, quantisiert und über lokale Inferenzserver bereitgestellt werden. [S1–S6]
Was ist gegenüber Qwen3.6-27B bereits sicher anders?
Auf Metadatenebene ist die Kontinuität auffällig. Qwen3.6-27B und Qwen3.8-27B werden beide mit rund 27,78 Milliarden Parametern und der Architekturkennung qwen3_5 geführt. [S1, S11] Das bedeutet aber nicht, dass beide Modelle identisch sind. Ein neuer Checkpoint kann Training, Datenmischung, Alignment, Tool-Use-Verhalten und Gewichte stark verändern, obwohl die Grundarchitektur gleich bleibt.
Offizielle Qwen3.8-27B-Resultate sind jetzt in der Model Card sichtbar, aber sie sind vom Anbieter berichtet und kein Ersatz für unabhängige Mac-Läufe. Genau deshalb wäre es unseriös, die bekannten Qwen3.6-27B-Werte – etwa aus SWE-bench oder Terminal-Bench – als Ersatz für Qwen3.8-Resultate zu verwenden. Frühere Reproduktionsberichte zeigen zudem, wie stark der Agent-Harness ein Resultat verschieben kann. Bei Qwen3.6-27B änderten etwa Dateieditierwerkzeuge und Testbedingungen die beobachtete SWE-bench-Pro-Leistung massiv. [S26, S28]
Wie viel Speicher braucht Qwen3.8-27B auf einem Mac?
Für einen ersten Hardware-Check kann man aus der offiziellen Parameterzahl eine theoretische Untergrenze für die reinen Gewichte berechnen.
Formel:
Speicher ≈ Parameter × Bits pro Gewicht ÷ 8
Bei 27,7814 Milliarden Parametern ergibt das:
| Präzision | Reine Gewichtsdaten, theoretisch | Praxis |
|---|---|---|
| BF16 / 16 Bit | ≈ 55.6 GB | plus Runtime, KV-Cache, Aktivierungen und macOS |
| FP8 / 8 Bit | ≈ 27.8 GB | plus Overhead |
| 8-Bit-Quantisierung | ≈ 27.8 GB | ähnlich als grobe Gewichtsschranke |
| 4-Bit-Quantisierung | ≈ 13.9 GB | plus Quantisierungsmetadaten und Runtime |
Das sind berechnete Schätzwerte, keine gemessenen RAM-Werte. Die echte Unified-Memory-Nutzung hängt unter anderem von Quantisierung, Vision-Komponenten, KV-Cache, Kontextlänge, Batchgröße und Runtime ab.
Grobe Mac-Einordnung
- 16 GB Unified Memory: 4 Bit liegt schon zu nah an der theoretischen Gewichtsschranke. Für einen stabilen Agentenbetrieb ist das kein attraktives Ziel.
- 24 GB: 4 Bit ist wesentlich realistischer, aber lange Kontexte und parallele Agenten können den Spielraum schnell auffressen.
- 32 GB: 4 Bit ist die naheliegende Startklasse. Für 8 Bit sind die reinen Gewichte bereits so groß, dass wenig Reserve bleibt.
- 48 GB: 4 Bit bietet viel Headroom; 8 Bit wird deutlich plausibler.
- 64 GB: 8 Bit ist hardwareseitig wesentlich entspannter. BF16 liegt mit rund 55,6 GB reinen Gewichten dagegen immer noch gefährlich nah am gesamten Speicher.
- 96 GB oder mehr: BF16 wird technisch realistischer, ist für normale lokale Nutzung aber meist unnötig teuer.
Diese Einordnung ist absichtlich konservativ. Ein Modell, das gerade eben „lädt“, ist nicht automatisch ein gutes Agenten-Setup.
Welche MLX-Version sollte man zuerst probieren?
Am Release-Tag gibt es bereits mlx-community/Qwen3.8-27B-4bit, -8bit und -bf16. [S3–S5]
Für die meisten Apple-Silicon-Nutzer ist 4 Bit der sinnvollste erste Test: Es reduziert den Gewichtsspeicher theoretisch auf ungefähr 13,9 GB und lässt mehr Unified Memory für KV-Cache, Tools, Browser, Python-Prozesse und den Agent-Harness übrig.
8 Bit ist interessanter, wenn genügend RAM vorhanden ist und du gezielt prüfen willst, ob die höhere Präzision bei deinen Aufgaben einen messbaren Vorteil bringt. Ein pauschales „8 Bit ist deutlich intelligenter“ wäre ohne Qwen3.8-spezifische Vergleichstests nicht belegt.
Und oMLX?
oMLX ist für diesen Release besonders relevant, weil es Qwen3.5-/Qwen3.6-Modelle auf Apple Silicon bereits intensiv unterstützt und auf Agent-Workloads mit Continuous Batching und SSD-Cache zielt. [S17–S25]
Der neue Checkpoint trägt wieder die Architekturkennung qwen3_5, und MLX-Konvertierungen existieren bereits. Das sind gute Kompatibilitätssignale, aber noch kein Beweis, dass alle Pfade heute fehlerfrei funktionieren.
Auf dem Vorgänger gab es in oMLX unter anderem versionsabhängige Themen bei Vision-Fallbacks, Thinking-Parametern, MTP, Quantisierung und Long-Context-Performance. [S21–S25] Deshalb sollte ein sauberer Qwen3.8-27B-Test mindestens fünf Dinge separat prüfen:
- Text-Inferenz über
/v1/chat/completions - Tool Calling über mehrere aufeinanderfolgende Calls
- Vision-Eingabe, falls benötigt
- Kontextwachstum und Speicherverbrauch
- MTP/DFlash nur dann, wenn für Qwen3.8 explizit unterstützt
Nicht einfach die Qwen3.6-DFlash-Konfiguration übernehmen. oMLX dokumentiert für DFlash konkrete Draft-Checkpoints pro Zielmodell; ein Qwen3.8-Draft-Checkpoint ist in der geprüften Dokumentation noch nicht bestätigt. [S19]
Ist Qwen3.8-27B schon besser als Qwen3.6-27B?
Das lässt sich am 14. August 2026 noch nicht seriös beantworten.
Belegt: Qwen hat einen neuen 27B-Checkpoint veröffentlicht, er besitzt dieselbe grobe Parameterklasse und Architekturkennung wie Qwen3.6-27B, und die Infrastruktur rund um FP8, MLX und GGUF ist sofort angelaufen. [S1–S6, S11]
Noch offen: wie sich die offiziellen Model-Card-Werte unter unabhängigen, identischen Bedingungen reproduzieren lassen und ob der neue Checkpoint auf lokalen Macs bei Coding, Tool Use, langem Kontext, Vision, Schreiben, Faktenstabilität oder Agentenrobustheit tatsächlich besser ist – und um wie viel.
Ein sinnvoller Vergleich sollte deshalb identische Bedingungen verwenden:
- identische Quantisierungsklasse,
- identischer Systemprompt,
- identischer Agent-Harness,
- identische Tool-Schemas,
- identisches Kontextbudget,
- identische Testaufgaben,
- gleiche Temperatur/Sampling-Regeln,
- mehrere Wiederholungen bei stochastischen Tests.
Gerade bei Agenten ist der Harness kein Detail. Die Qwen3.6-Reproduktionsberichte zeigen, dass Werkzeuge und Testlogik den Endscore stark verändern können. [S26–S28]
Welche Messungen noch fehlen
Für einen Mac-orientierten Test sind vier Kennzahlen zusätzlich zur offiziellen Model-Card-Tabelle wertvoller als eine einzelne, nicht reproduzierte Leaderboard-Zahl:
1. Decode-Geschwindigkeit
Tokens pro Sekunde bei 4 Bit und 8 Bit auf derselben Apple-Silicon-Hardware.
2. Prefill bei realistischen Kontextgrößen
Nicht nur 1K, sondern beispielsweise 8K, 32K und 64K. oMLX-Vorgängerberichte zeigen, dass Runtime-Versionen Long-Context-Prefill deutlich beeinflussen können. [S22]
3. Peak Unified Memory
Gewichte allein reichen nicht. Entscheidend ist, wie viel Speicher ein echter Agentenlauf inklusive KV-Cache und Tools verbraucht.
4. Agenten-Zuverlässigkeit
Eine kleine, reproduzierbare Suite mit Dateibearbeitung, Shell, Recherche, JSON-Tool-Calls und mehrstufigen Aufgaben wäre aussagekräftiger als ein beliebiges Chat-Beispiel.
Praktischer Status
Qwen3.8-27B ist seit dem 14. August als offizieller Qwen-Checkpoint auf Hugging Face verfügbar. Für lokale Macs ist vor allem die Größenklasse relevant: 4-Bit-MLX, 8-Bit- und BF16-Konvertierungen sowie ein GGUF-Paket sind bereits verfügbar, während unabhängige Mac- und Agententests noch fehlen. [S1–S6]
Ob Qwen3.8-27B Qwen3.6-27B tatsächlich als lokales Agentenmodell ablöst und wie gut sich die offiziellen Resultate reproduzieren lassen, muss ein unabhängiger Vergleich unter identischen Bedingungen zeigen. Bis dahin ist 4-Bit-MLX auf 24–32 GB oder mehr der naheliegendste Startpunkt – als Hardware-Empfehlung aus der Speicherrechnung, nicht als gemessene Qualitätsaussage.
Quellenhinweis
Die Quellenbezeichnungen [S1]–[S35] verweisen auf die folgende Liste. Zeitabhängige Angaben wurden am 14.08.2026 geprüft.
Quellen
[S1] https://huggingface.co/Qwen/Qwen3.8-27B [S2] https://huggingface.co/Qwen/Qwen3.8-27B-FP8 [S3] https://huggingface.co/mlx-community/Qwen3.8-27B-4bit [S4] https://huggingface.co/mlx-community/Qwen3.8-27B-8bit [S5] https://huggingface.co/mlx-community/Qwen3.8-27B-bf16 [S6] https://huggingface.co/unsloth/Qwen3.8-27B-GGUF [S7] https://modelstudio.alibabacloud.com/intl/blog/model-studio-token-plan-individual/ [S8] https://www.alibabacloud.com/help/en/model-studio/token-plan-harness-tool [S9] https://docs.qwencloud.com/developer-guides/getting-started/text-generation-models [S10] https://qwen.readthedocs.io/en/stable/inference/transformers.html [S11] https://huggingface.co/Qwen/Qwen3.6-27B [S12] https://huggingface.co/Qwen/Qwen3.6-27B-FP8 [S13] https://huggingface.co/Qwen/Qwen3.5-27B [S14] https://huggingface.co/Qwen/Qwen3.6-35B-A3B [S15] https://arxiv.org/abs/2505.09388 [S16] https://github.com/QwenLM/Qwen3.6 [S17] https://github.com/jundot/omlx [S18] https://github.com/jundot/omlx/releases [S19] https://github.com/jundot/omlx/blob/main/docs/experimental/dflash_mlx_integration.md [S20] https://github.com/jundot/omlx/discussions/945 [S21] https://github.com/jundot/omlx/issues/1097 [S22] https://github.com/jundot/omlx/issues/2155 [S23] https://github.com/jundot/omlx/issues/1378 [S24] https://github.com/jundot/omlx/issues/1464 [S25] https://github.com/jundot/omlx/issues/1556 [S26] https://github.com/QwenLM/Qwen3.8/issues/179 [S27] https://github.com/QwenLM/Qwen3.8/issues/178 [S28] https://github.com/QwenLM/Qwen3/discussions/1846 [S29] https://github.com/QwenLM/qwen-code/issues/3878 [S30] https://www.airealist.ai/p/qwen-38-soon-is-not-a-date [S31] https://gigazine.net/gsc_news/en/20260721-qwen3-8 [S32] https://www.nxcode.io/resources/news/qwen3-8-benchmarks-coding-agent-evaluation-guide-2026 [S33] https://benchlm.ai/compare/qwen3-5-27b-vs-qwen3-8-max-preview [S34] https://modelfit.io/ [S35] https://aiwiki.ai/wiki/qwen3_6
Häufig gestellte Fragen
Ist Qwen3.8-27B ein offizieller Qwen-Checkpoint?
Ja. Qwen veröffentlicht das Modell unter Qwen/Qwen3.8-27B auf Hugging Face. Die Model Card nennt 27B Parameter, Apache 2.0, Bild- und Videoverständnis sowie 262.144 native Kontexttokens. [S1]
Wie viel Unified Memory braucht Qwen3.8-27B auf dem Mac?
Die reinen Gewichte liegen theoretisch bei etwa 13,9 GB in 4 Bit, 27,8 GB in 8 Bit und 55,6 GB in BF16. Runtime, KV-Cache, Vision und macOS kommen hinzu; 24–32 GB sind deshalb die realistischere Startklasse für 4 Bit. [S1][S3–S5]
Wie groß ist das Kontextfenster?
Die offizielle Model Card nennt 262.144 Tokens nativ. Für bis zu 1.000.000 Tokens beschreibt Qwen eine Erweiterung über RoPE/YaRN-Konfiguration; das ist nicht dasselbe wie ein automatisch verfügbares 1M-Fenster in jeder lokalen Runtime. [S1]
Ist Qwen3.8-27B besser als Qwen3.6-27B?
Die Model Card enthält eine offizielle Vergleichstabelle, aber unabhängige Mac- und Laufzeittests fehlen noch. Für eine belastbare Aussage müssen Quantisierung, Harness, Tool-Schemas, Kontext und Aufgaben identisch sein. [S1][S26–S28]
Läuft Qwen3.8-27B schon mit oMLX?
Die qwen3_5-Architektur und vorhandene MLX-Konvertierungen sind gute Kompatibilitätssignale. Eine Qwen3.8-spezifische oMLX-Freigabe und ein direkter Tool-/Vision-Smoke-Test müssen aber separat bestätigt werden. [S1][S3–S5][S17–S25]