Stand: 15. August 2026. „Welches Open-Weight-LLM ist das beste?“ ist für einen Mac die falsche erste Frage. Entscheidend sind verfügbares Unified Memory, Modellpaket, Kontextlänge, Eingabemodalität und die Runtime. Ein Modell kann auf dem Papier klein genug wirken und beim ersten langen Prompt trotzdem in Speicherdruck oder Offloading laufen.
Der Vergleich bleibt praktisch: Er fragt, welches Modell auf einem konkreten Mac als erster Test sinnvoll ist und welche Grenzen danach sichtbar werden.
Wenn die Modellwahl mit einem neuen Gerät zusammenfällt, hilft der separate MacBook-KI-Entwicklungsguide 2026 bei der Hardwareentscheidung vor dem Modelltest.
Auswahl nach Unified Memory
| Unified Memory des Mac | Sinnvoller Startpunkt | Was du nicht versprechen solltest |
|---|---|---|
| 8 GB | Gemma 4 E2B oder ein kleinerer Tag | kein großer Kontext und keine komfortable Parallel-Nutzung |
| 16 GB | Gemma 4 E2B/E4B, kleinere Qwen-Tags | große Agentenläufe sind speicherempfindlich |
| 24 GB | Gemma 4 12B oder Qwen3.6 27B mit Reserve | 26B/35B nur mit kurzem Kontext und wenigen Apps |
| 32 GB | Qwen3.6 27B oder 35B, Gemma 4 26B | Paketgröße ist nicht gleich freie RAM-Reserve |
| 48 GB | Gemma 4 31B oder Qwen3.6 35B mit mehr Spielraum | 256K Kontext kann trotzdem zu viel sein |
| 64 GB+ | größere lokale Varianten gezielt testen | Llama 4 Scout bleibt ein Spezialfall |
Das sind Startpunkte, keine Performance-Garantien. Für einen Kaufentscheid solltest du ein konkretes Modell mit deinem eigenen Prompt, Kontext und Tool-Workflow testen.
Was die Ollama-Seiten aktuell zeigen
Die folgenden Größen sind Paketgrößen aus Ollama, keine von ai-on-mac.com gemessenen Spitzenwerte:
| Familie/Tag | Ollama-Anzeige | Kontext laut Ollama | Eingabe |
|---|---|---|---|
qwen3.6:27b | 17 GB | 256K | Text, Bild |
qwen3.6:35b | 24 GB | 256K | Text, Bild |
qwen3.6:27b-mlx | 20 GB | 256K | Text, Bild |
qwen3.6:35b-mlx | 22 GB | 256K | Text, Bild |
gemma4:e2b | 7,2 GB | 128K | Text, Bild |
gemma4:e4b | 9,6 GB | 128K | Text, Bild |
gemma4:12b | 7,6 GB | 256K | Text, Bild |
gemma4:26b | 18 GB | 256K | Text, Bild |
gemma4:31b | 20 GB | 256K | Text, Bild |
llama4:16x17b | 67 GB | 10M | Text, Bild |
Die Angaben wurden am 15. August 2026 abgerufen und können sich durch neue Tags oder Repackaging ändern. Besonders wichtig: gemma4:e4b wird aktuell mit 9,6 GB gelistet, nicht mit dem älteren Wert von 7,9 GB.
Paketgröße ist nicht RAM-Bedarf
Beim lokalen Start müssen mehr Komponenten in den Speicher passen als nur die Datei aus der Ollama-Library:
- Modellgewichte und Runtime,
- KV-Cache für den gewählten Kontext,
- Bild- oder Audio-Encoder,
- macOS und Hintergrundprozesse,
- Browser, Editor und weitere Apps,
- temporäre Puffer für lange oder parallele Aufgaben.
Auf Apple Silicon teilen sich CPU und GPU den Unified-Memory-Pool. Deshalb kann ein 18-GB-Paket auf einem 24-GB-Mac zwar startbar sein, aber kaum Platz für 256K Kontext oder weitere Programme lassen. Ein Start ohne Fehlermeldung ist kein Beweis für komfortable Nutzung.
Qwen3.6: Coding und Agenten
Ollama listet Qwen3.6 aktuell in 27B- und 35B-Varianten sowie als MLX-Tags. Die Modellkarten beschreiben Verbesserungen für Coding-Agenten, Repository-Aufgaben, multimodale Eingaben und den Erhalt von Thinking-Kontext über historische Nachrichten.
Die praktische Auswahl:
# 27B: kleinerer Text-/Bild-Einstieg
ollama pull qwen3.6:27b
ollama run qwen3.6:27b
# 35B: größere Variante, mehr Speicherreserve nötig
ollama pull qwen3.6:35b
ollama run qwen3.6:35b
Die aktuellen Ollama-Seiten listen auch qwen3.6:27b-mlx und qwen3.6:35b-mlx mit Text- und Bildeingabe.
Qwen veröffentlicht umfangreiche Benchmarktabellen. Sie enthalten unter anderem Coding-, Agenten-, Vision- und Video-Evaluierungen, aber auch klare Methodikhinweise: unterschiedliche Harnesses, Zeitlimits, Kontextlängen, Prompting und interne Datensätze. Die Zahlen sind daher Quellenmaterial, keine direkte Mac-Rangliste. Für deinen Rechner ist die praktische Frage zunächst, ob Kontext und Tool-Aufrufe ohne Offloading stabil laufen.
Gemma 4: mehr Größen, klarere On-Device-Optionen
Google beschreibt Gemma 4 als multimodale Familie mit Dense- und MoE-Varianten:
- E2B und E4B für kleinere Geräte,
- 12B als Unified-Modell,
- 26B A4B als MoE-Variante,
- 31B als Dense-Modell.
Die Google-Model-Card nennt Audio nativ bei E2B, E4B und 12B. Die aktuellen Ollama-Einträge zeigen für die lokalen Tags vor allem Text- und Bildeingabe; Audio ist deshalb nicht automatisch in jeder Ollama-/Client-Kombination verfügbar.
# leichter Einstieg
ollama pull gemma4:e4b
ollama run gemma4:e4b
# 12B: deutlich mehr Qualität bei moderater Paketgröße
ollama pull gemma4:12b
ollama run gemma4:12b
# 26B MoE: nur mit bewusster Speicherplanung
ollama pull gemma4:26b
ollama run gemma4:26b
Für einen 24-GB-Mac ist gemma4:12b der vernünftigere erste Test. gemma4:26b wird zwar mit etwa 18 GB gelistet, lässt aber nach dem Laden wenig Reserve für Kontext, Bilder und andere Apps. Die 26B-A4B-Variante hat laut Google 25,2B Gesamtparameter und 3,8B aktive Parameter; das macht sie effizienter als 31B Dense, aber nicht speicherfrei.
Llama 4 Scout: großer Kontext, kein normaler Mac-Start
Ollama listet llama4:16x17b mit 67 GB und 10M Kontext. Die Model Card beschreibt Scout als 109B-MoE-Modell mit 17B aktivierten Parametern. Die Kombination aus 67 GB Paketgröße und 10M Kontext ist für normale lokale Macs unpraktisch:
# nur für sehr große Speicher-Setups oder Server-Experimente
ollama pull llama4:16x17b
Selbst 64 GB Unified Memory bedeuten nicht, dass 67 GB Modellpaket plus Runtime, macOS und KV-Cache bequem passen. Die 128x17B-Variante liegt laut Ollama sogar bei 245 GB und 1M Kontext. Für den täglichen Mac-Workflow sind Qwen3.6 oder Gemma 4 die realistischeren Kandidaten.
Kontextlänge: die Einstellung, die viele Vergleiche verfälscht
Ollamas aktuelle Dokumentation nennt Standardwerte nach VRAM:
- unter 24 GiB: 4K Kontext,
- 24–48 GiB: 32K,
- ab 48 GiB: 256K.
Auf einem Apple-Silicon-Mac ist Unified Memory geteilt, daher sollten diese Schwellen nicht als exakte RAM-Garantie gelesen werden. Ollama empfiehlt für Coding-, Agenten- und Web-Suchaufgaben mindestens 64K, weist aber zugleich auf den höheren Speicherbedarf hin.
Prüfe nach dem Laden den tatsächlichen Zustand:
OLLAMA_CONTEXT_LENGTH=64000 ollama serve
ollama ps
ollama ps zeigt Modell, Größe, Prozessor-Aufteilung und Kontext. Wenn CPU-Offloading oder Speicherdruck auftritt, reduziere zuerst den Kontext und schließe parallele Apps, bevor du das Modell als „zu langsam“ bewertest.
Warum lokale Geschwindigkeitswerte einen Test brauchen
Tokens pro Sekunde hängen unter anderem von Modelltag, Quantisierung, Backend, Kontext, Prompt, Temperatur, Metal-/MLX-Pfad und Hintergrundlast ab. Communitywerte oder Herstellerzahlen sind für eine Vorauswahl nützlich, aber nicht reproduzierbar genug für eine Kauf- oder Produktionsentscheidung.
Ein fairer eigener Test dokumentiert mindestens:
- exaktes Mac-Modell und Unified Memory,
- macOS-Version und Ollama-Version,
- Modelltag und Quantisierung,
- Kontextlänge und Promptgröße,
- Prompt- und Output-Token,
- Prefill- und Decode-Geschwindigkeit,
- CPU-/GPU-Offload und Speicherdruck.
Praktische Auswahl
Für lokale Open-Weight-LLMs auf dem Mac zählt die Kombination aus Paketgröße, Kontext und freiem Unified Memory. Gemma 4 E2B/E4B ist für kleine Geräte gedacht, Gemma 4 12B ist ein vernünftiger 24-GB-Einstieg, Qwen3.6 27B/35B richtet sich an größere Coding- und Agenten-Setups, und Llama 4 Scout bleibt trotz 10M Kontext ein Spezialfall für sehr große Speicherumgebungen.
Die aktuellen Quellen zeigen außerdem, warum ein statisches Ranking schnell veraltet: Ollama-Tags, Paketgrößen und Eingabemodalitäten ändern sich. Prüfe den konkreten Tag, starte mit begrenztem Kontext und miss deinen eigenen Workflow, bevor du aus einem Modellnamen eine Kaufempfehlung ableitest.
Quellen
- Ollama: Qwen3.6 – aktuelle Tags, Paketgrößen, Kontext und Eingabemodalitäten.
- Qwen3.6 27B Model Card und 35B-A3B Model Card – Architektur, Benchmarks und Methodikhinweise.
- Qwen: Qwen3.6-27B und Qwen3.6-35B-A3B – offizielle Release-Einordnung und Open-Weight-Verfügbarkeit.
- Ollama: Gemma 4 – aktuelle lokale Tags und Größen.
- Google Gemma 4 Model Card – Modalitäten, Größen, Kontext und Benchmarks.
- Ollama: Llama 4 – Scout-/Maverick-Tags, Paketgrößen und Kontext.
- Meta: Llama 4 – offizielle Einordnung von Scout und Maverick.
- Ollama: Context length – Kontextstandardwerte und
ollama ps.
Häufig gestellte Fragen
Welches Modell sollte ich auf einem Mac mit 24 GB zuerst testen?
Für einen vorsichtigen Einstieg sind kleinere Gemma-4- oder Qwen-Tags sinnvoller als ein 26B-Modell. Gemma 4 12B ist laut Ollama etwa 7,6 GB groß; gemma4:26b liegt bei etwa 18 GB und lässt mit Kontext, macOS und anderen Apps wenig Reserve.
Läuft Llama 4 Scout auf dem Mac?
Ollama listet Llama 4 Scout mit etwa 67 GB und 10M Kontext. Das ist für normale lokale Mac-Setups unpraktisch, weil Modellpaket, Runtime, Kontext und macOS gemeinsam Speicher benötigen.
Sind die Paketgrößen aus der Tabelle lokale RAM-Messungen?
Nein. Sie stammen aus den zum 15. August 2026 abgerufenen Ollama-Modellseiten. Die tatsächliche Spitzenbelegung hängt zusätzlich von Kontext, KV-Cache, Runtime, Eingabemodalität und Hintergrundlast ab.
Welche Kontextlänge sollte ich in Ollama wählen?
Ollamas aktuelle Dokumentation nennt als Standardwerte <24 GiB VRAM: 4K, 24–48 GiB: 32K und ab 48 GiB: 256K. Auf Apple Silicon ist Unified Memory geteilt; prüfe deshalb die reale Belegung mit ollama ps und erhöhe den Kontext erst nach einem kleinen Test.
Hat Gemma 4 Audio-Unterstützung?
Google nennt native Audio-Unterstützung für E2B, E4B und 12B. Die aktuellen Ollama-Tags listen primär Text- und Bildeingabe; ob Audio in deinem konkreten Tag und Client funktioniert, muss separat geprüft werden.