Stand: 15. August 2026. Gemma 4 ist eine offene Modellfamilie von Google DeepMind mit fünf Größen: E2B, E4B, 12B, 26B A4B und 31B. Die größte Variante passt nicht automatisch zu jedem Mac. Maßgeblich sind Unified Memory, Kontext, Bild-/Audioeingabe und die Zahl parallel geöffneter Apps.
Kandidaten nach Unified Memory
| Mac | Erster Kandidat | Warum |
|---|---|---|
| 8 GB | gemma4:e2b | 7,2-GB-Paket, aber sehr wenig Reserve für Kontext und Apps |
| 16 GB | gemma4:e4b oder gemma4:12b | Q4-Start möglich, aber mit begrenztem Kontext, wenigen offenen Apps und wenig Reserve |
| 24 GB | gemma4:12b | mehr Reserve als 26B; passender Start für lokale Nutzung |
| 32 GB | gemma4:26b mit begrenztem Kontext | 18-GB-Paket, MoE mit 3,8B aktiven Parametern |
| 48 GB+ | gemma4:31b oder 26b | 20- bzw. 18-GB-Paket, mehr Spielraum für Kontext |
Ollama-Paketgröße und tatsächlich benötigter Speicher sind nicht identisch. KV-Cache, Runtime, Bilder, macOS und Hintergrundprogramme kommen hinzu.
Aktuelle Ollama-Tags
Beim Abruf am 15. August 2026 listet Ollama unter anderem:
| Tag | Paketgröße | Kontext | Eingabe |
|---|---|---|---|
gemma4:e2b | 7,2 GB | 128K | Text, Bild |
gemma4:e4b | 9,6 GB | 128K | Text, Bild |
gemma4:12b | 7,6 GB | 256K | Text, Bild |
gemma4:26b | 18 GB | 256K | Text, Bild |
gemma4:31b | 20 GB | 256K | Text, Bild |
gemma4:e2b-mlx | 6,5 GB | 128K | Text, Bild |
gemma4:e4b-mlx | 8,8 GB | 128K | Text, Bild |
gemma4:12b-mlx | 7,7 GB | 256K | Text, Bild |
gemma4:26b-mlx | 18 GB | 256K | Text, Bild |
gemma4:31b-mlx | 19 GB | 256K | Text, Bild |
Die aktuelle Ollama-Liste führt die MLX-Tags mit Text- und Bildeingabe; Audio ist in diesen Tag-Informationen nicht aufgeführt. Prüfe den konkreten Client, bevor du Audio-Funktionen in einen Workflow einbaust.
Gemma 4 installieren und starten
# leichter Einstieg
ollama pull gemma4:e4b
ollama run gemma4:e4b
# 12B als größere Variante bei moderater Paketgröße
ollama pull gemma4:12b
ollama run gemma4:12b
Für größere Macs:
ollama pull gemma4:26b
ollama run gemma4:26b
ollama pull gemma4:31b
ollama run gemma4:31b
Ein Bild kann über die Ollama-App oder einen kompatiblen Client zusammen mit einer Frage übergeben werden. Das Modell verarbeitet es nicht „automatisch“ in jedem Frontend; der Client muss multimodale Eingaben unterstützen.
Was Google über die Varianten sagt
Die aktuelle Google-Model-Card führt fünf Größen auf. Der Launch-Beitrag nennt im Überblick vier Varianten und hebt beim Audioeingang E2B und E4B hervor; für die zusätzliche 12B-Angabe ist deshalb die aktuelle Model-Card maßgeblich.
Die Google-Model-Card beschreibt:
- E2B und E4B als kleine Modelle mit 128K Kontext,
- 12B und 31B als Dense-Varianten mit 256K Kontext,
- 26B A4B als MoE-Modell mit 25,2B Gesamt- und 3,8B aktiven Parametern,
- Text- und Bildverarbeitung in der Familie,
- native Audio-Unterstützung bei E2B, E4B und 12B,
- konfigurierbare Thinking-Modi und native Function-Calling-Unterstützung.
Die Audioangabe stammt von Google. Dass ein Modell Audio unterstützt, heißt nicht automatisch, dass der konkrete Ollama-Tag oder dein Client eine Audiodatei annimmt. Diese Verbindung musst du separat prüfen.
Speichergrenzen von 12B, 26B und 31B
gemma4:26b kann auf einem 24-GB-Mac theoretisch startbar sein, aber ein 18-GB-Paket lässt nach Betriebssystem, Runtime und Kontext wenig Reserve. Für einen ersten lokalen Alltagstest ist gemma4:12b deshalb die vorsichtigere Wahl.
Auf 32 GB passt 26B mit begrenztem Kontext besser. 31B Dense ist mit 20 GB gelistet und braucht entsprechend mehr freie Ressourcen. Ob ein Setup nutzbar ist, hängt von Kontext, Bildauflösung, parallelen Apps und der Runtime ab.
Nach dem Start prüfen:
ollama ps
Wenn Ollama Teile auf die CPU auslagert oder macOS Speicherdruck anzeigt, reduziere Kontext und schließe Apps. Ein großes Modell mit einem kurzen Kontext kann im Alltag sinnvoller sein als dieselbe Variante mit einem nominell maximalen Kontextfenster.
Thinking-Modus mit Bedacht einsetzen
Gemma 4 unterstützt konfigurierbare Thinking-Modi. Mehr internes Reasoning kann bei Mathematik, Planung und komplexem Coding helfen, erhöht aber Rechenzeit und Tokenverbrauch. Für kurze Fragen ist ein knapper Modus oft die bessere Nutzererfahrung.
Behandle Thinking nicht als Qualitätsgarantie. Entscheidend ist, ob die zusätzliche Rechenzeit in deinem konkreten Workflow weniger Fehler erzeugt. Bei lokalen Tests solltest du Modus, Kontext und Aufgaben identisch halten, wenn du Varianten vergleichen willst.
Gemma 4 und Qwen3.6
Beide Familien bieten lokale Mac-Tags und multimodale Varianten. Eine pauschale Aussage wie „Qwen für Coding, Gemma für Bilder“ ist zu grob. Vergleiche stattdessen:
- exakten Modelltag und Paketgröße,
- Bild- und Audio-Unterstützung des Clients,
- Kontext und KV-Cache,
- Lizenz und Datenfluss,
- Leistung auf deinem eigenen Aufgabenpaket.
Herstellerbenchmarks sind nützlich, aber nicht ohne gleiche Runtime, gleiche Prompts und gleiche Auswertung direkt vergleichbar. Eine Gegenüberstellung der beiden Familien findest du im Gemma-4-vs.-Qwen3.6-Vergleich und die kompakte 12B-Einordnung im Gemma-4-12B-Artikel.
Gemma 4 auf dem eigenen Mac testen
Ein reproduzierbarer lokaler Vergleich dokumentiert:
- Mac-Modell und Unified Memory,
- macOS- und Ollama-Version,
- Tag und Backend inklusive MLX/QAT,
- Kontext und Bildauflösung,
- Antwortzeit und Tokens pro Sekunde,
- CPU-/GPU-Aufteilung aus
ollama ps, - Speicherdruck bei einer realistischen Aufgabe.
Fazit: Fünf Größen für verschiedene Speicherklassen
Die fünf Modellgrößen decken mehrere lokale Mac-Speicherklassen ab. E2B/E4B sind die kleinen Optionen, 12B ist auf 16 GB als Q4-Test mit begrenztem Kontext möglich und auf 24 GB mit mehr Reserve nutzbar, 26B A4B passt zu einem geplanten 32-GB-Setup und 31B braucht mehr Reserve.
Starte mit dem kleinsten Tag, der deine Aufgabe erfüllt. Erhöhe dann Modellgröße oder Kontext einzeln und prüfe jedes Mal ollama ps. Damit basiert die Auswahl auf dem getesteten Tag und dem Speicherlimit deines Macs.
Quellen
- Google Gemma 4 Model Card – Größen, Modalitäten, Kontext, Architektur und Benchmarks.
- Google: Gemma 4 – Positionierung und Lizenz.
- Ollama: Gemma 4 – aktuelle Tags, Paketgrößen und Kontextwerte.
Häufig gestellte Fragen
Welche Gemma-4-Variante passt auf einen 24-GB-Mac?
`gemma4:12b` ist der vorsichtige Start mit mehr Reserve. `gemma4:26b` hat ein 18-GB-Paket und lässt nach macOS, Runtime und Kontext wenig Spielraum.
Kann Gemma 4 Audio verarbeiten?
Google nennt native Audio-Unterstützung für E2B, E4B und 12B. Ob dein konkreter Ollama-Tag oder Client eine Audiodatei annimmt, musst du separat prüfen; die Tag-Liste führt primär Text und Bild.
Was ist 26B A4B bei Gemma 4?
Ein MoE-Modell mit 25,2 Milliarden Gesamtparametern, von denen pro Token etwa 3,8 Milliarden aktiv sind. Effizienter als ein dichtes 31B, aber nicht speicherfrei — das Paket ist weiterhin rund 18 GB groß.
Sollte ich den Thinking-Modus immer einschalten?
Nein. Mehr internes Reasoning hilft bei Mathematik, Planung und komplexem Coding, kostet aber Rechenzeit und Tokens. Für kurze Fragen ist ein knapper Modus oft die bessere Wahl.
Wie vergleiche ich Gemma 4 mit Qwen3.6 sinnvoll?
Nicht über pauschale Slogans, sondern mit gleichem Tag, gleicher Runtime, gleichen Prompts und eigenen Aufgaben. Herstellerbenchmarks sind ohne identische Bedingungen nicht direkt vergleichbar.