Technische Recherche mit Quellenangaben. Eigene Messungen sind im Artikel gekennzeichnet.

Veröffentlicht: 22. Mai 2026 Aktualisiert: 21. August 2026

Über den Autor

Gemini 3.5 Flash ist Googles stabiles Cloud-Modell mittlerer Größe für die Gemini API: schnell, mit langem Kontext, multimodal und tief in Googles Agent-Werkzeuge integriert.12 Dieser Guide zeigt, was das Modell kann, wie du es vom Mac nutzt, was es kostet, wie Google mit deinen Daten umgeht und wo lokale Open-Weight-Modelle daneben passen.

Die Kurzantwort zur Lokal-Frage vorweg: Gemini 3.5 Flash läuft nicht lokal. Es ist ein Google-Cloud-/API-Modell ohne dokumentierten Gewichts- oder Laufzeitpfad für Ollama, LM Studio oder MLX. Das macht es für den Mac nicht unbrauchbar — die meisten Mac-Nutzer nutzen täglich Cloud-Modelle — aber es entscheidet, wohin deine Daten gehen und wofür du zahlst. Die Details stehen unten.

Passende Guides: Gemini 3.5 Flash API im Detail, Ollama auf dem Mac mini M4, LM Studio vs. Ollama, Unified Memory auf dem Mac, Gemma 3 auf dem Mac und die Open-Weight-Shortlist.

Gemini 3.5 Flash, Ollama lokal und Ollama Cloud im Vergleich

Die Grafik vergleicht lokale Ollama-Modelle, Ollama Cloud und die Gemini API nach Ausführungsort, Internetbedarf und Datenfluss. Grundlage sind die am 14. August 2026 geprüften Google- und Ollama-Dokumentationen.134

Was Gemini 3.5 Flash wirklich ist

Gemini 3.5 Flash ist ein stabiles Google-Modell für die Gemini API und Googles eigenes Produkt-Ökosystem. Der offizielle Modellcode lautet gemini-3.5-flash.12

Laut Googles Modellseite akzeptiert es Text, Bilder, Video, Audio und PDF als Eingabe und gibt Text aus. Das Input-Kontextfenster beträgt 1.048.576 Tokens bei einem Output-Limit von 65.536 Tokens.1

An Funktionen unterstützt es Thinking, Function Calling, Code Execution, Computer Use (Preview), File Search, URL Context, Search Grounding, Maps Grounding, die Batch API, Caching, Flex Inference und Priority Inference. Audio Generation, Image Generation und die Live API werden nicht unterstützt.1

Die Interactions API ist seit Juni 2026 allgemein verfügbar und wird für neue Projekte empfohlen; generateContent bleibt unterstützt. Interactions werden standardmäßig gespeichert, sofern du nicht store=false setzt.25

So nutzt du es vom Mac aus

Auf dem Mac gibt es nichts zu installieren. Du legst einen API-Key in Google AI Studio an und rufst das Modell über einen HTTP-Client, ein SDK oder eine App auf, die die Gemini API spricht:

Modell-ID: gemini-3.5-flash

In der Praxis sind drei Zugangswege relevant:

  • Skripte und Apps: REST-Endpunkt oder offizielles SDK mit deinem Key aufrufen. Die Interactions API ist die empfohlene Oberfläche für neue Projekte; generateContent funktioniert weiter.25
  • Agenten-Tools: Coding-Agenten und Multi-Model-Router bieten das Modell meist unter Provider-Schreibweisen wie google/gemini-3.5-flash an. Dieses Präfix ist Routing-Metadaten, kein anderes Modell.4
  • Google-Oberflächen: Gemini 3.5 Flash läuft auch in Googles eigenen Produkten — unabhängig von allem, was auf deinem Mac installiert ist.2

Request-/Response-Mechanik, Token-Bilanzierung und Codebeispiele stehen im eigenen Artikel Gemini 3.5 Flash API im Detail.

Was es kostet

Gemini 3.5 Flash ist nicht „kostenlos egal wie viel”. Free-Tier-Zugriff existiert, aber produktive Nutzung braucht Kostenkontrolle über Input, Output, Thinking-Tokens, Caching, Storage und Grounding. Preisstand 14. August 2026:6

TierInputOutputHinweis
Standard (Paid)$1,50 / 1M Tokens$9,00 / 1M TokensBaseline
Batch / Flexgünstiger als Standardgünstiger als StandardLatency-Trade-offs
Priorityteurerteurerniedrigere Latenz
GroundingKosten pro Abfrage möglichSearch- und Maps-Grounding

Cache-Writes und Cache-Hits folgen eigenen Preisregeln oberhalb dieser Zahlen.6

Datenschutz: was mit deinen Daten passiert

Hier wird Cloud gegen lokal konkret:6578

  • Free-Tier-Inhalte dürfen laut Pricing zur Verbesserung von Google-Produkten genutzt werden; die Paid-Tier-Preistabelle sagt dazu „No”.
  • Billing-enabled Logs werden standardmäßig nicht zur Produktverbesserung genutzt; Projekte können 7, 14, 28 oder 55 Tage Retention konfigurieren.7
  • Für Abuse Monitoring können Prompts und Outputs 55 Tage verarbeitet werden, ausschließlich zur Policy-Durchsetzung.8
  • Interactions werden standardmäßig gespeichert; Paid-Tier-Projekte können 7, 14, 28 oder 55 Tage konfigurieren, und store=false ist für kompatible stateless Requests möglich.5
  • Ollama sieht lokale Prompts laut FAQ nicht. Bei seinen Cloud-Modellen verarbeitet Ollama Prompts und Antworten zur Bereitstellung des Dienstes und sagt, diesen Inhalt nicht zu speichern, zu loggen oder zum Training zu nutzen.39
  • Für sensible Daten bleibt local-only-Verarbeitung oder ein klarer Enterprise-/Compliance-Workflow der sichere Default.

Läuft Gemini 3.5 Flash lokal in Ollama, LM Studio oder MLX?

Nein. Die geprüften offiziellen Quellen enthalten keine Gemini-3.5-Flash-Gewichte, keinen GGUF- oder MLX-Pfad und keine Apple-Silicon-Runtime. Ein Befehl wie ollama run gemini-3.5-flash startet dieses Modell nicht auf deinem Mac.1410

Zwei verbreitete Fallen:

  • Provider-Schreibweise ist kein Download. google/gemini-3.5-flash in Routern oder Benchmarks bedeutet Anbieter Google, Modell Gemini 3.5 Flash — kein Ollama- oder lokaler Gewichtspfad.4
  • Ollama Cloud ist keine lokale Inferenz. Ollama dokumentiert Cloud Models, die in Ollamas Infrastruktur laufen und ein Konto brauchen. Praktisch, wenn dem Mac der Speicher fehlt — aber die Daten verlassen die Maschine.3

Merksatz: Ein Ollama-Befehl bedeutet nicht automatisch lokale Inferenz. Bei Cloud-Modellen dient Ollama als lokales Interface, während die Inferenz anderswo läuft.

Das ist eine zeitgebundene Dokumentationsaussage, kein Beweis über jedes denkbare Community-Projekt. Wenn du in einem lokalen Tool einen Gemini-artigen Eintrag siehst, prüfe, ob es ein anderes Modell, ein Preview-/Provider-/Cloud-Eintrag oder etwas ist, das deinen Prompt an einen Remote-Dienst schickt.14

Lokale Alternativen, wenn du Offline-KI brauchst

Wenn du eigentlich „diese Klasse von Fähigkeit, aber auf meinem Mac” suchst, gibt es keinen 1:1-Ersatz — du wählst ein Open-Weight-Modell, das zu deiner Hardware passt:111210

ZielLokale RichtungHinweis
Google-nahes Open-Weight-ModellGemma 3nicht Gemini, aber Googles eigene offene Familie
Allround-ChatQwen / Llama / Mistral-Klasseabhängig von Größe und Quantisierung
CodingQwen / DeepSeek / Code-ModelleQualität variiert stark mit der Größe
VisionGemma 3 4B/12B/27B oder Vision-Modellenicht jedes lokale Modell kann Bilder
TranskriptionWhisperanderes Modellgebiet, sehr praktisch lokal
Private Dokumentelokales RAG + Ollama/LM StudioDatenschutzvorteil nur bei local-only Setup

Grobe Mac-RAM-Einordnung — Heuristik, keine Benchmarks:13

  • 8 GB: kleine 1B–4B-Modelle, eventuell stark quantisierte 7B.
  • 16 GB: 7B/8B komfortabel, 12B teilweise möglich.
  • 24 GB: 12B/14B realistisch, größere vorsichtig.
  • 32 GB: 27B-Klasse realistischer, Kontext begrenzen.
  • 48 GB+: größere Modelle und Vision-Workflows werden angenehm.

Runtime, Quantisierung, Kontextlänge, KV-Cache, Swap und offene Apps verändern den realen Speicherbedarf. Details stehen in Wie viel RAM braucht ein lokales LLM?

Cloud-Modell, lokales Modell — oder beides?

Für die meisten Mac-Nutzer ist die praktische Aufteilung hybrid statt entweder/oder:

Zu Gemini 3.5 Flash greifen, wenn du sehr lange Kontexte brauchst, große PDFs/Audio/Video/Bilder analysieren willst, Function Calling, Code Execution, File Search, Search- oder Maps-Grounding nutzt, mehrstufige Agenten baust oder API-Integration wichtiger ist als Offline-Privatsphäre.1

Zu lokalen Modellen greifen, wenn private Dateien den Mac nicht verlassen sollen, du offline arbeiten willst, keine laufenden Token-Kosten möchtest, du lokales RAG baust oder Kundendaten, unveröffentlichten Code oder vertrauliche Notizen verarbeitest.

Zusammen genutzt decken sich beide Seiten gegenseitig ab: private Arbeit bleibt lokal, während die Gemini API die Fälle übernimmt, in denen Kontextfenster und Tooling die Cloud-Verarbeitung rechtfertigen.

Typische Fehler

  • Gemini 3.5 Flash in Ollama installieren wollen. Korrektur: kein offizieller lokaler Pfad in den geprüften Quellen dokumentiert.14
  • Ollama Cloud mit lokaler Inferenz verwechseln. Korrektur: Cloud Model bedeutet Cloud-Verarbeitung.3
  • Gemma und Gemini gleichsetzen. Korrektur: Gemma ist Open-Weight, Gemini 3.5 Flash ist Cloud/API.11
  • google/gemini-3.5-flash als offiziellen Google-Modellcode verwenden. Korrektur: In der Gemini API heißt es gemini-3.5-flash.1
  • Lokale KI automatisch als 100 % privat darstellen. Korrektur: Nur bei local-only Setup, ohne Cloud-Tools, ohne exponierten Server.

Quellen

Footnotes

  1. https://ai.google.dev/gemini-api/docs/models/gemini-3.5-flash 2 3 4 5 6 7 8 9 10

  2. https://ai.google.dev/gemini-api/docs/whats-new-gemini-3.5 2 3 4 5

  3. https://docs.ollama.com/cloud 2 3 4

  4. https://ollama.com/search?q=gemini 2 3 4 5 6

  5. https://ai.google.dev/gemini-api/docs/interactions 2 3 4

  6. https://ai.google.dev/gemini-api/docs/pricing 2 3

  7. https://ai.google.dev/gemini-api/docs/logs-policy 2

  8. https://ai.google.dev/gemini-api/docs/usage-policies 2

  9. https://docs.ollama.com/faq

  10. https://github.com/ml-explore/mlx 2

  11. https://ollama.com/library/gemma3 2

  12. https://www.lmstudio.ai/docs/app/offline

  13. Abgeleitet aus öffentlichen Modellkarten-Größen und Community-Angaben; ai-on-mac hat hierzu keinen eigenen Benchmark gefahren.

Häufig gestellte Fragen

Was ist Gemini 3.5 Flash?

Ein stabiles Google-Cloud-Modell für die Gemini API mit Text-, Bild-, Video-, Audio- und PDF-Eingabe, Textausgabe, einem Input-Kontextfenster von 1.048.576 Tokens und Funktionen wie Thinking, Function Calling, Code Execution und Grounding.

Kann ich Gemini 3.5 Flash lokal in Ollama auf meinem Mac nutzen?

Nein. Die geprüften offiziellen Google- und Ollama-Quellen dokumentieren keinen Apple-Silicon-Laufzeit- oder Gewichtspfad. Ollama kann Modelle über sein Cloud-Angebot ausführen, aber das ist keine lokale Inferenz.

Wie nutze ich Gemini 3.5 Flash vom Mac aus?

Über die Gemini API: API-Key in Google AI Studio anlegen und die Modell-ID gemini-3.5-flash per HTTP-Client oder SDK aufrufen. Die Interactions API ist seit Juni 2026 allgemein verfügbar und wird für neue Projekte empfohlen.

Was kostet Gemini 3.5 Flash?

Im Paid Standard Tier $1,50 Input und $9,00 Output pro 1M Tokens (Preisstand 14. August 2026). Batch und Flex sind günstiger, Priority teurer; Search- oder Maps-Grounding können Kosten pro Abfrage auslösen.

Trainiert Google auf meinen Gemini-API-Inhalten?

Free-Tier-Inhalte dürfen zur Produktverbesserung genutzt werden; die Paid-Tier-Preistabelle sagt dazu nein. Billing-enabled Logs und gespeicherte Interactions haben je nach Einstellung konfigurierbare Retention zwischen 7 und 55 Tagen.

Was ist die lokal ähnlichste Alternative auf dem Mac?

Einen 1:1-Ersatz gibt es nicht. Gemma 3 ist Googles eigene Open-Weight-Familie; Qwen, Llama, Mistral oder DeepSeek decken Chat-, Coding- und Vision-Workloads ab, je nach RAM.