Technische Recherche mit Quellenangaben. Eigene Messungen sind im Artikel gekennzeichnet.

Veröffentlicht: 10. Mai 2026 Aktualisiert: 15. August 2026

Über den Autor

Stand: 15. August 2026. Gemma 4 ist Googles neuere offene Modellfamilie. Gemma 3 gibt es auf dem Mac für unterschiedliche Unified-Memory-Größen: Ollama führt kleine Tags, und die 4B-, 12B- und 27B-Varianten sind als multimodal gelistet. Maßgeblich sind Paketgröße, Kontext und freier Unified Memory.

Welche Gemma-3-Variante passt zu welchem Mac?

MacErster KandidatEinordnung
8 GBgemma3:4b3,3-GB-Paket; kurze Aufgaben und Bilder, wenig Reserve für große Kontexte
16 GBgemma3:4b oder gemma3:12b12B ist mit 8,1 GB deutlich anspruchsvoller; andere Apps und Kontext begrenzen
24–32 GBgemma3:12bmehr Reserve als 27b; 27b mit 17 GB nur mit bewusster Speicherplanung
48 GB+gemma3:27bgrößere lokale Variante, aber 128K Kontext bleibt eine Belastungsgrenze

Ollama listet außerdem gemma3:270m und gemma3:1b. Diese beiden kleinen Varianten sind Textmodelle mit 32K Kontext. Die 4B-, 12B- und 27B-Tags sind laut Ollama multimodal und mit 128K Kontext gelistet.

Die Paketgröße ist nicht der gesamte RAM-Bedarf. Runtime, KV-Cache, macOS, Bilder und parallele Apps kommen hinzu. Ein Startlauf schließt Speicherdruck oder CPU-Offloading bei langen Prompts nicht aus.

Gemma 3 in Ollama starten

Für den kleineren Vision-Einstieg:

ollama pull gemma3:4b
ollama run gemma3:4b

Ein Bild kann in der Ollama-App oder über einen kompatiblen Client mit einer Frage kombiniert werden. Die passende Variante ist entscheidend: 270m und 1b sind in der aktuellen Ollama-Liste Textmodelle; für Bildinput brauchst du einen multimodalen Tag wie 4b, 12b oder 27b.

Für eine größere lokale Variante:

ollama pull gemma3:12b
ollama run gemma3:12b

Die QAT-Tags (gemma3:4b-it-qat, 12b-it-qat und 27b-it-qat) sind quantization-aware-trained Varianten. Ollama beschreibt sie als speichereffizienter bei ähnlicher Qualität zur Halbpräzision. Die Angabe beschreibt Modell und Quantisierung; die Geschwindigkeit hängt trotzdem vom jeweiligen Mac ab.

Was Vision praktisch verändert

Bildinput erhöht den Speicher- und Rechenaufwand gegenüber einer reinen Textfrage. Ein Screenshot, ein PDF-Render oder ein Foto wird zunächst in visuelle Tokens beziehungsweise Encoder-Ausgaben übersetzt. Bei knappen 8- oder 16-GB-Systemen solltest du deshalb nicht gleichzeitig ein großes Modell, einen langen Textkontext und viele Bilder laden.

Für kleinere lokale Bildaufgaben ist Gemma 3 4B geeignet, etwa für:

  • einzelne Screenshots,
  • einfache Dokumentbilder,
  • kurze Bildbeschreibungen,
  • grobe UI- oder Layout-Fragen.

Für komplexe OCR, lange Dokumente oder anspruchsvolle visuelle Schlussfolgerungen ist die Modellgröße nur ein Faktor. Eingabeauflösung, Prompt, Kontext und tatsächliche Fehlertoleranz des Workflows müssen separat geprüft werden.

Die 128K-Kontextangabe richtig lesen

Ollama listet für die multimodalen Gemma-3-Tags bis zu 128K Kontext. 128K ist das Modelllimit. Der KV-Cache wächst mit der Kontextlänge; bei Vision-Aufgaben kommen Bildtokens und temporäre Puffer hinzu. Ob ein Mac den Kontext komfortabel berechnet, hängt zusätzlich von Speicher und Systemlast ab.

Starte deshalb mit einer niedrigeren Kontextlänge und erhöhe sie nur, wenn dein Workflow sie benötigt. Nach dem Laden hilft:

ollama ps

Achte auf Kontext, Modellgröße und Prozessor-Aufteilung. Wenn Teile auf die CPU ausgelagert werden oder macOS Speicherdruck meldet, reduziere zuerst Kontext und parallele Programme.

Safety, Terms und Grenzen

Googles Gemma-3-Model-Card dokumentiert interne Safety-Evaluierungen und Verbesserungen gegenüber früheren Gemma-Modellen. Die Ergebnisse stammen aus Googles Hersteller-Evaluierung und belegen keine sicheren Ausgaben in deiner lokalen Anwendung. Die Tests deckten laut Model Card außerdem nur englische Prompts ab.

Für produktive oder agentische Workflows brauchst du deshalb eigene Eingabe-/Ausgabekontrollen, ein eingeschränktes Tool- und Dateisystem-Rechtemodell und eine Prüfung riskanter Aktionen. Für Bildanwendungen kann ShieldGemma 2 als separates Safety-Modell eingesetzt werden; es ist kein automatisch aktivierter Filter in gemma3:4b.

Die Gewichte werden über Googles Gemma Terms of Use bereitgestellt. Verwechsle diese Nutzungsbedingungen nicht mit einer pauschalen Apache-2.0-Aussage für jeden Gemma-3-Download oder jede Community-Konvertierung.

Gemma 3 oder Gemma 4?

Gemma 4 ist die neuere Generation und bietet zusätzliche Größen, MoE-Varianten sowie neuere Reasoning- und Agentenfunktionen. Gemma 3 passt besser, wenn:

  • dein Mac nur 8 oder 16 GB Unified Memory hat,
  • ein bestehender Workflow genau Gemma 3 erwartet,
  • du einen kleinen und gut dokumentierten Vision-Tag benötigst,
  • eine ältere Modellgeneration für deine Aufgabe ausreichend ist.

Richte die Auswahl nach Unified Memory und Aufgabe aus. Auf einem größeren Mac kann ein Gemma-4-Tag besser passen; auf einem knappen Mac kann ein Gemma-3-4B-Tag mehr Spielraum lassen als ein größeres neues Modell. Für die neuere Generation siehe den Gemma-4-RAM-Guide und die Gemma-4-12B-Einordnung.

Gemma 3 auf dem eigenen Mac testen

Vergleiche mit einem reproduzierbaren Setup. Dokumentiere mindestens:

  1. Mac-Modell und Unified Memory,
  2. macOS- und Ollama-Version,
  3. exakten Tag inklusive QAT/MLX-Variante,
  4. Kontextlänge und Bildauflösung,
  5. Antwortzeit, Tokens pro Sekunde und Speicherdruck,
  6. ob CPU-Offloading aktiv war.

Fazit: Passt, wenn Größe und Modalität zum Memory passen

Gemma 3 passt auf dem Mac, wenn Taggröße und Eingabemodalität zum verfügbaren Unified Memory passen. gemma3:4b ist der kleinste multimodale Einstieg für kleine Systeme, 12b braucht mehr Reserve und 27b richtet sich an Macs mit deutlich mehr Unified Memory. 270m und 1b sind kleine Textoptionen.

128K ist ein technisches Limit. Lange, komfortable Sitzungen hängen zusätzlich von Speicher und Systemlast ab. Starte mit einem kleinen Tag, prüfe ollama ps und entscheide erst danach, ob der zusätzliche Speicherbedarf der größeren Variante für deinen Workflow gerechtfertigt ist.

Quellen

Häufig gestellte Fragen

Läuft Gemma 3 auf einem Mac mit 8 GB?

Ja, mit dem kleinen multimodalen Tag `gemma3:4b` (3,3-GB-Paket). Für große Kontexte oder viele parallele Apps reicht die Reserve trotzdem nicht; `ollama ps` zeigt nach dem Laden den realen Speicherdruck.

Welche Gemma-3-Varianten können Bilder verarbeiten?

Laut Ollama-Liste die Tags `4b`, `12b` und `27b`. Die kleinen Varianten `270m` und `1b` sind Textmodelle mit 32K Kontext.

Was sind die QAT-Tags von Gemma 3?

Quantization-aware-trained Varianten wie `gemma3:4b-it-qat`. Ollama beschreibt sie als speichereffizienter bei ähnlicher Qualität zur Halbpräzision; die tatsächliche Geschwindigkeit hängt vom jeweiligen Mac ab.

Reichen 128K Kontext auf jedem Mac, der das Modell lädt?

Nein. 128K ist das Modelllimit. KV-Cache, Bildtokens und parallele Programme brauchen zusätzlich Speicher. Starte mit einer niedrigeren Kontextlänge und prüfe die Aufteilung mit `ollama ps`.

Ist Gemma 3 unter Apache 2.0 lizenziert?

Nein. Die Gewichte werden über Googles Gemma Terms of Use bereitgestellt. Verwechsle diese Nutzungsbedingungen nicht mit einer pauschalen Apache-2.0-Aussage für jeden Download oder jede Community-Konvertierung.