Fable Fusion 711 ist ein Community-GGUF auf Basis von Qwen3.6-27B mit Bildinput, reduzierten Refusals, mehreren Quantisierungsstufen und optionalen Multi-Token-Prediction-Dateien.12
Das Repository bietet reguläre, MTP-, LOW-MTP- und AMD-bezeichnete Dateien sowie separate Projektoren; die Dateiliste ist deshalb für eine Mac-Entscheidung wichtiger als der lange Marketingname.3
Die wichtigste Antwort lautet:
Auf einem Mac mit 32 GB Unified Memory solltest du zuerst die reguläre Q4_K_M-GGUF laden.345
Die 18,0-GB-Datei lässt deutlich mehr Platz als Q5, Q6 oder Q8 für macOS, Runtime-Buffer, KV-Cache und normale Anwendungen. Ein 24-GB-Mac kann das Modell mit stärkerer Quantisierung nutzen. Bei 48 oder 64 GB kannst du gezielter zwischen Modellpräzision, Kontextlänge und Vision abwägen.345
Die optionalen MTP-Dateien sind auf Apple Silicon kein automatisches Upgrade. Behandle sie als Experiment und behalte sie nur, wenn ein kontrollierter Vergleich wirklich einen höheren End-to-End-Durchsatz zeigt.1
Die Antwort in 30 Sekunden
| Dein Mac | Bester Startpunkt | Was du erwarten kannst |
|---|---|---|
| 16 GB | Kleineres Modell wählen | Nur mit starken Kompromissen; keine sinnvolle Alltagswahl |
| 24 GB | Reguläres IQ3_M | Nutzbar mit moderatem Kontext und wenig Hintergrundlast |
| 32 GB | Reguläres Q4_K_M | Beste Gesamtbalance und empfohlener Startpunkt |
| 48 GB | Q5_K_M oder Q6_K | Mehr Qualität und genug Reserve für Kontext oder Vision |
| 64 GB+ | Q6_K oder Q8_0 | Maximale Präzision ist möglich, Q6_K kann trotzdem sinnvoller sein |
Für Bildverarbeitung brauchst du zusätzlich eine passende mmproj-Datei aus demselben Repository. Bei MTP solltest du reguläre und MTP-Version mit identischen Prompts und Einstellungen vergleichen.34
Warum dieses Modell einen genaueren Blick verdient
Das offizielle Qwen3.6-27B-Basismodell ist ein dichtes Vision-Language-Modell mit 27 Milliarden Parametern. Qwen dokumentiert 262.144 Kontexttokens sowie Text- und Bildunterstützung; die Fable-Modellkarte beschreibt ihr Release als Community-Version dieses Checkpoints.671
Dadurch entsteht ein attraktives lokales Paket:
- genug Modellgröße für anspruchsvollere Schreib-, Reasoning- und Dokumentaufgaben;
- Vision über einen separaten multimodalen Projektor;45
- Quantisierungen von ungefähr 11,7 bis 30,2 GB;3
- reguläre und MTP-fähige GGUF-Dateien;3
- Kompatibilität mit llama.cpp und darauf basierenden Apps;14
- Apache-2.0-Kennzeichnung des Repositories.289
Die Bezeichnung muss trotzdem korrekt bleiben: Fable Fusion 711 ist kein offizielles Qwen-Modell. Es ist ein Community-Modell von DavidAU auf Basis des offiziellen Qwen3.6-27B-Checkpoints. Die HF-Metadaten führen das Repository mit Apache-2.0; das sagt nichts über mögliche Rechte an Trainingsdaten oder über jeden einzelnen Einsatzzweck aus.289 Mehr zur Speicherplanung steht im Guide zu Unified Memory auf dem Mac.
Was der ungewöhnlich lange Name bedeutet
Der Repository-Name kombiniert mehrere voneinander unabhängige Eigenschaften:
Qwen3.6-27B: offizielles Basismodell;Fable Fusion: Bezeichnung des Community-Tunings und Merges;711: vom Uploader gemeldeter ARC-Challenge-Wert von 0,711;1UncensoredundHeretic: reduzierte Refusals durch Tuning- und Ablationsverfahren (das Heretic-Werkzeug dokumentiert den Ablationsansatz im eigenen Repository; die zugrunde liegenden Methoden beschreiben unter anderem Arditi et al. und Carleo et al.);101112MTP: optionale Gewichte für Multi-Token Prediction;GGUF: lokales Modellformat für llama.cpp und viele Desktop-Apps.
Die Zahl 711 ist daher keine Versionsnummer, keine Parameterzahl und kein unabhängiges Qualitätsurteil. Sie verweist auf ein veröffentlichtes Evaluationsergebnis, dessen vollständige Reproduktionskonfiguration auf der Modellkarte nicht dokumentiert ist.1
Alle relevanten GGUF-Größen
| Quantisierung | Regulär | MTP | MTP-Aufschlag |
|---|---|---|---|
| IQ2_M | 11,7 GB | 12,1 GB | +0,4 GB |
| IQ3_M | 14,1 GB | 14,5 GB | +0,4 GB |
| IQ4_XS | 16,6 GB | 17,0 GB | +0,4 GB |
| Q4_K_S | 17,1 GB | 17,5 GB | +0,4 GB |
| IQ4_NL | 17,3 GB | 17,8 GB | +0,5 GB |
| Q4_K_M | 18,0 GB | 18,5 GB | +0,5 GB |
| Q5_K_S | 20,2 GB | 20,6 GB | +0,4 GB |
| Q5_K_M | 20,7 GB | 21,2 GB | +0,5 GB |
| Q6_K | 23,6 GB | 24,0 GB | +0,4 GB |
| Q8_0 | 29,8 GB | 30,2 GB | +0,4 GB |
Zusätzlich enthält das Repository AMD-bezeichnete MTP-Varianten, LOW-MTP-Dateien und separate Vision-Projektoren.3 Wichtiger als jede einzelne Zahl ist diese Regel: Dateigröße ist nicht gleich gesamter Speicherverbrauch.
Zum geladenen Modell kommen macOS, Inferenz-Runtime, Compute-Buffer, KV-Cache, temporäre Allokationen, Bild-Embeddings, der multimodale Projektor und alle anderen geöffneten Anwendungen hinzu.45
Welche Quantisierung passt zu deinem Mac?
16 GB: technisch möglich, praktisch die falsche Wahl
Selbst IQ2_M belegt 11,7 GB nur für die Modellgewichte. Nach Betriebssystem, Runtime und KV-Cache bleibt kaum Reserve. Das Modell kann unter aggressiven Einstellungen starten, doch Qualitäts- und Stabilitätsverluste machen ein kleineres Modell zur besseren Alltagslösung.345
24 GB: der realistische Einstieg
Starte mit IQ3_M bei 14,1 GB. Diese Variante lässt mehr Arbeitsspeicher frei als die 4-Bit-Dateien und gibt der Runtime bessere Chancen, stabil zu bleiben.345
Halte den Kontext moderat, schließe speicherintensive Anwendungen und teste zuerst reine Textinferenz. IQ4_XS kann ebenfalls passen, lässt aber weniger Reserve für längere Gespräche und Bildverarbeitung.
32 GB: der starke Standard
Die reguläre Q4_K_M mit 18,0 GB ist der stärkste Standard. Sie bietet ein gutes Qualitätsniveau, ohne so viel Speicher zu verbrauchen, dass normale Mac-Nutzung, moderater Kontext und Runtime-Buffer unangenehm knapp werden.345
Q5_K_M kann ebenfalls passen, doch die zusätzliche Modellpräzision reduziert den Speicher für die Teile des Workloads, die Nutzer tatsächlich spüren: längere Prompts, größere Dokumente, Vision und Systemreaktion.
Eine sinnvolle Startkonfiguration:
- reguläre Q4_K_M;
- 8K oder 16K Kontext;
- zunächst reine Textinferenz;
- nur eine aktive Generation;
- MTP und Vision getrennt testen.
48 GB: Qualität ohne ständige Kompromisse
Q5_K_M und Q6_K werden praktikabel. Jetzt geht es nicht mehr nur darum, ob das Modell passt. Du kannst entscheiden, ob der freie Speicher in höhere Gewichtpräzision, einen größeren KV-Cache, Bildverarbeitung oder parallele Arbeit fließen soll.
Für viele Nutzer fühlt sich Q5_K_M mit großzügiger Reserve besser an als eine größere Datei, die das System nahe ans Limit bringt.
64 GB und mehr: Q8_0 passt, aber Q6_K kann trotzdem gewinnen
Q8_0 mit 29,8 GB ist auf einem 64-GB-Mac realistisch. Automatisch überlegen ist es dadurch nicht. Der sichtbare Qualitätsunterschied zwischen Q6_K und Q8_0 kann bei vielen Prompts gering sein, während Q6_K mehr Speicher für Kontext, Vision und andere Anwendungen lässt.345
Teste beide Varianten mit deinen echten Aufgaben, bevor du die größere Datei behältst.
Die Einordnung oben ist eine konservative Kompatibilitätsschätzung aus den veröffentlichten Dateigrößen und dem zusätzlichen Speicherbedarf lokaler Inferenz. Sie ist kein eigener Geschwindigkeitsbenchmark. Runtime-Version, Kontextlänge, KV-Cache-Typ, Batch-Größe, Vision und Parallelität können das Ergebnis verändern.345 Grundlagen zu Unified Memory erklärt der RAM- und Speicher-Guide für den Mac.
Reguläre GGUF oder MTP?
MTP steht für Multi-Token Prediction. Die Fable-Modellkarte beschreibt dafür separate MTP-GGUFs mit zusätzlichen MTP-Tensoren; ein kompatibler Runtime-Pfad kann diese Vorhersagen als spekulativen Draft verwenden.1
Der Vorbehalt ist entscheidend: Auf Apple Silicon kann MTP auch mehr Speicher verbrauchen, einen zweiten Draft-Kontext erzeugen und seinen Vorteil verlieren, wenn die Akzeptanz sinkt oder die Aufgabe komplexer wird. Ein geschlossenes llama.cpp-Issue dokumentiert einen MTP+Vision-OOM-/Slot-Fehler in einer speziellen Branch und Umgebung mit Qwen3.6-35B-A3B; das ist kein Beleg für jeden aktuellen Mac-Build.13 Die Issue-Threads 23371, 23752, 23577 und 23302 sowie die Diskussion 23738 dokumentieren weitere MTP-, Slot- und Serverfehlerfälle aus der Community.1415161718
Der Uploader empfiehlt bei zwei vorgeschlagenen Token den Wechsel zurück zu regulären GGUFs, wenn die Akzeptanz unter 50 Prozent fällt. Das ist eine Uploader-Heuristik, keine Apple-Silicon-Messung und keine Garantie.1
Ein sinnvoller MTP-Test
Vergleiche reguläre und MTP-Version mit:
- derselben Quantisierung;
- derselben Kontextlänge;
- identischen Sampling-Einstellungen;
- denselben kurzen, langen und mehrstufigen Prompts;
- einer frischen Sitzung pro Durchlauf.
Notiere Time to First Token, Generierungstempo, Akzeptanzrate, Peak Memory, Ausgabequalität und mögliche Wiederholungen oder Fehler. Behalte MTP nur, wenn das Gesamterlebnis besser ist – nicht nur eine einzelne Tokens-pro-Sekunde-Anzeige.
Vision: Warum du eine zweite Datei brauchst
Die Qwen3.6-Basis ist multimodal. Im GGUF-Ökosystem werden Sprachmodell und multimodaler Projektor getrennt verteilt. Für reine Textnutzung reicht die Haupt-GGUF; für Bilder brauchst du zusätzlich eine passende mmproj-Datei aus demselben Repository.645
llama-server \
-m Qwen3.6-27B-Fable-Fusion-711-Q4_K_M.gguf \
--mmproj mmproj-F16.gguf \
-c 8192
Verwende keinen Projektor eines anderen Basismodells. Vision benötigt zusätzlichen Speicher. Nutzer mit 24 GB sollten daher vorsichtig testen. Auf einem 32-GB-Mac solltest du zuerst eine stabile Q4_K_M-Textkonfiguration herstellen, bevor du Vision und MTP kombinierst.45
Was beweisen die gemeldeten Benchmarks?
Die Modellkarte führt die sieben Werte als „BENCHMARKS by Nightmedia“ auf: Fable Fusion liegt in sechs Aufgaben über dem dort verglichenen Qwen3.6-27B-Basismodell, bei BoolQ gleich.1
| Aufgabe | Fable Fusion 711 | Qwen3.6-27B Base | Gemeldete Differenz |
|---|---|---|---|
| ARC Challenge | 0,711 | 0,647 | +6,4 Prozentpunkte |
| ARC Easy | 0,879 | 0,803 | +7,6 Prozentpunkte |
| BoolQ | 0,910 | 0,910 | 0,0 Prozentpunkte |
| HellaSwag | 0,790 | 0,773 | +1,7 Prozentpunkte |
| OpenBookQA | 0,514 | 0,450 | +6,4 Prozentpunkte |
| PIQA | 0,823 | 0,806 | +1,7 Prozentpunkte |
| WinoGrande | 0,763 | 0,742 | +2,1 Prozentpunkte |
| Einfacher Mittelwert | 0,770 | 0,733 | +3,7 Prozentpunkte |
Der Mittelwert ist aus den veröffentlichten Werten berechnet und kein standardisierter Gesamtbenchmark. Außerdem fehlen unter anderem die genaue Version des Evaluation Harness (typischerweise das lm-evaluation-harness), Task-Konfiguration, Chat-Template, Seeds, Quantisierung und Rohresultate.119
Die Aufgaben messen überwiegend Wissen und Multiple-Choice-Reasoning. Sie belegen keine allgemeine Überlegenheit bei Coding, kreativem Schreiben, Vision, langen Kontexten oder Agentenaufgaben.
Die belastbare Schlussfolgerung lautet:
Die Modellkarte meldet vielversprechende Verbesserungen, aber ein allgemeiner Qualitätsvorsprung ist unter vollständig reproduzierbaren Bedingungen noch nicht unabhängig nachgewiesen.
Installation mit llama.cpp
Für die reguläre Q4_K_M-Version:
llama-cli -hf DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF:Q4_K_M
Als lokaler Server:
llama-server -hf DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF:Q4_K_M
Dokumentiere bei Vergleichen den genauen llama.cpp-Build. Wenn MTP oder Vision Probleme verursacht, kehre zunächst zur regulären Textkonfiguration zurück. Die Serveroptionen sind im llama.cpp-Server-README dokumentiert.20
Installation mit LM Studio
- Öffne LM Studio und suche nach dem vollständigen Hugging-Face-Repository.
- Lade zuerst die reguläre Q4_K_M-Datei.
- Starte mit 8K Kontext.
- Prüfe, ob das Prompt-Template korrekt erkannt wird.
- Teste mehrere Textprompts.
- Füge den passenden Vision-Projektor erst nach stabiler Textinferenz hinzu.
- Vergleiche die MTP-Version in einer separaten Sitzung.
Beginne nicht mit der theoretisch maximalen Kontextlänge. Architektonische Kontextunterstützung bedeutet nicht, dass ein Mac mit 24 oder 32 GB das Maximum komfortabel nutzen kann.
Sampling-Einstellungen zum Testen
Die Modellkarte nennt Temperatur 1,0, Top-p 0,95 und Top-k 20 für Thinking-orientierte Aufgaben sowie eine niedrigere Temperatur um 0,6 für präziseres Coding. Verwende diese Werte als Testpresets und nicht als universelle Standardwerte.1
Prüfe Faktentreue, Wiederholungen, JSON-Stabilität, tatsächlich getesteten Code und Unterschiede zwischen Thinking- und Non-Thinking-Verhalten. Ein Modell mit weniger Refusals antwortet nicht automatisch genauer.
Für wen lohnt sich der Download?
Fable Fusion 711 ist besonders interessant für Nutzer, die:
- einen Mac mit mindestens 32 GB Unified Memory besitzen;
- ein leistungsfähiges lokales Allround-Modell suchen;
- weniger Refusals für legitime kreative oder wissenschaftliche Workflows wünschen;
- optionale Bildverarbeitung brauchen;
- Community-Fine-Tunes sauber vergleichen möchten;
- Modellkarten-Benchmarks als Einladung zum Testen und nicht als endgültiges Urteil verstehen.
Wer sollte ein anderes Modell wählen?
Wähle ein anderes Modell, wenn dein Mac nur 16 GB besitzt, Geschwindigkeit wichtiger ist als maximale lokale Modellgröße, du unabhängig reproduzierte Benchmarks brauchst oder Quantisierungen, Projektoren und Runtime-Versionen nicht verwalten möchtest.
Ein kleineres Modell in einer gesunden Quantisierung liefert im Alltag oft ein besseres Erlebnis als ein größeres Modell am Rand des verfügbaren Speichers.
„Uncensored“ braucht weiterhin Schutzmaßnahmen
Weniger Refusals können für fiktionales Schreiben, Rollenspiel und legitime Sicherheitsforschung nützlich sein. Gleichzeitig fällt eine Schutzschicht weg. Verbinde das Modell nicht direkt mit uneingeschränkten Shell-Befehlen, Browser-Automation, Dateilöschung, vertraulichen Repositories oder einer öffentlich erreichbaren API.
Binde lokale Dienste an 127.0.0.1, beschränke Tools über Allowlists und validiere Ausgaben vor der Ausführung. Lokal bedeutet nicht automatisch sicher.
Urteil
Fable Fusion 711 ist ein Community-Paket um eine 27B-Qwen-Basis mit Bildinput, reduzierten Refusals und optionalen MTP-Dateien.613
Der klarste Einsatzzweck ist ein Apple-Silicon-Mac mit 32 GB und der regulären Q4_K_M-GGUF. Diese Kombination bewahrt die Stärken des Modells, ohne fast den gesamten Unified Memory für Gewichtpräzision zu verbrauchen. Auf 24 GB ist IQ3_M das sinnvollere Experiment. Bei 48 und 64 GB bieten Q5_K_M oder Q6_K häufig die bessere Systembalance als ein blinder Griff zu Q8_0.
Quellen
Footnotes
-
https://huggingface.co/DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12
-
https://huggingface.co/api/models/DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF ↩ ↩2 ↩3
-
https://huggingface.co/api/models/DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF/tree/main?recursive=true ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13
-
https://github.com/ggml-org/llama.cpp/blob/master/docs/multimodal.md ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13
-
https://github.com/ggml-org/llama.cpp/blob/master/tools/quantize/README.md ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11
-
https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md ↩
Häufig gestellte Fragen
Ist Qwen3.6 Fable Fusion 711 ein offizielles Qwen-Modell?
Nein. Es ist ein Community-Fine-Tune und Merge von DavidAU auf Basis von Qwen/Qwen3.6-27B.
Welche GGUF sollte ich auf einem Mac mit 32 GB verwenden?
Starte mit der regulären Q4_K_M-Datei mit 18,0 GB. Sie bietet die sinnvollste Balance aus Modellqualität, Kontext und Systemreserve.
Läuft Fable Fusion 711 auf einem Mac mit 24 GB?
Ja, aber IQ3_M ist der sicherere Startpunkt. Halte den Kontext moderat und teste zuerst reine Textinferenz, bevor du Vision oder MTP aktivierst.
Ist die MTP-Version auf Apple Silicon schneller?
Nicht zwingend. Vergleiche sie unter identischen Bedingungen direkt mit der regulären Datei und behalte MTP nur, wenn der End-to-End-Durchsatz tatsächlich steigt.
Was bedeutet 711?
Die Zahl verweist auf den vom Uploader gemeldeten ARC-Challenge-Wert von 0,711, nicht auf eine Version oder Parameterzahl.