Was Google auf der I/O 2026 angekündigt hat
Google I/O 2026 fand am 19. Mai 2026 statt. Google positionierte die Konferenz als Übergang in eine stärker agentische Gemini-Ära. Zentrale Modellthemen waren Gemini Omni und Gemini 3.5; Gemini 3.5 Flash ist der erste Teil der neuen Gemini-3.5-Familie.123
Google positioniert Gemini 3.5 Flash für agentic coding, long-horizon tasks, Tool-Nutzung und reale Workflows. Google nennt bessere Werte als Gemini 3.1 Pro in mehreren Coding- und Agentic-Benchmarks; das sind Herstellerangaben, keine eigenen Mac-Messungen.413
Was Gemini 3.5 Flash ist
Gemini 3.5 Flash ist ein stabiles Cloud-/API-Modell von Google. Es kombiniert langen Kontext, multimodalen Input, Thinking, Function Calling, Code Execution, File Search, URL Context und Grounding. Für Mac-Nutzer ist der wichtigste Punkt: Die offiziellen Unterlagen dokumentieren keinen Apple-Silicon-Laufzeitpfad; die API-Inferenz läuft bei Google.54
Apple Silicon beschleunigt lokale Modelle über Ollama, LM Studio, MLX oder llama.cpp. Bei Gemini 3.5 Flash zählen eher Internetverbindung, API-Key, Kostenkontrolle, Datenfluss, Tooling und die Frage, welche Daten dein Gerät verlassen dürfen.
Das 1M-Kontextfenster kann große Repositories und Dokumentbestände aufnehmen. Die aktuelle Preisseite listet für Gemini 3.5 Flash den Standardtarif mit $1,50 Input und $9 Output pro 1M Tokens; Ausgabe-Tokens, Thinking, Tools, Caching und Grounding kommen je nach Nutzung hinzu.6
Offizieller Modellcode und technische Daten
Der offizielle Modellcode in der Gemini API lautet gemini-3.5-flash.54
Nicht verwechseln mit Provider- oder Router-Schreibweisen wie google/gemini-3.5-flash, die manche Drittanbieter-Tools verwenden.
| Eigenschaft | Gemini 3.5 Flash |
|---|---|
| Status | Stable / API-Modell |
| Offizieller Modellcode | gemini-3.5-flash |
| Input-Kontext | 1.048.576 Tokens |
| Output-Limit | 65.536 Tokens |
| Unterstützte Eingaben | Text, Bild, Video, Audio, PDF |
| Ausgabe | Text |
| Thinking | Unterstützt, steuerbar über thinking_level |
| Nicht unterstützt | Audio Generation, Image Generation, Live API; Computer Use ist als Preview unterstützt. |
| Lokale Mac-Inferenz | Kein dokumentierter Apple-Silicon-Pfad |
Die aktuelle Modellseite führt Gemini 3.5 Flash als stabil/GA mit 1.048.576 Input-Tokens, 65.536 Output-Tokens und Computer Use als Preview; sie nennt keinen lokalen Apple-Silicon-Checkpoint.54
Gemini 3.5 Flash: kein dokumentierter lokaler Mac-Pfad
Die geprüften Google-Quellen beschreiben Gemini 3.5 Flash als Gemini-API-/Cloud-Modell, aber keinen offiziellen Ollama-, MLX- oder GGUF-Pfad.54 Das ist eine Quellenabgrenzung, kein Beweis, dass kein lokales Experiment jemals funktionieren kann.
Der Unterschied ist praktisch wichtig:
| Ansatz | Beispiele | Stärke | Grenze |
|---|---|---|---|
| Lokale KI | Ollama, LM Studio, MLX, kleine bis mittlere Open-Weight-Modelle | Private Dateien, Offline-Arbeit, keine Tokenkosten | RAM, Modellgröße, Geschwindigkeit und Kontextfenster |
| Gemini 3.5 Flash | Google AI Studio, Gemini API, Managed Agents | 1M Kontext, Tools, Code Execution, File Search, Grounding, Cloud-Agenten | Datenfluss zu Google, API-Kosten, Internet und Produktverfügbarkeit |
API-Setup auf dem Mac
Für Gemini 3.5 Flash nutzt du einen Google-AI-Studio-API-Key, die Umgebungsvariable GEMINI_API_KEY und idealerweise das offizielle Google GenAI SDK.54
API-Key setzen
export GEMINI_API_KEY="dein-google-ai-studio-api-key"
Für eine permanente Shell-Konfiguration kannst du die Zeile in ~/.zshrc eintragen und danach source ~/.zshrc ausführen.
Python
from google import genai
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.5-flash",
contents="Erkläre Unified Memory auf Apple Silicon in drei Sätzen.",
)
print(response.text)
Python mit Thinking Level
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.5-flash",
contents="Analysiere die Vor- und Nachteile von lokaler KI und Cloud-KI auf dem Mac.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(thinking_level="high")
),
)
print(response.text)
JavaScript
import { GoogleGenAI } from "@google/genai";
const ai = new GoogleGenAI({});
async function main() {
const response = await ai.models.generateContent({
model: "gemini-3.5-flash",
contents: "Erstelle eine Checkliste für einen hybriden lokalen/Cloud-KI-Workflow auf dem Mac."
});
console.log(response.text);
}
main();
REST
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.5-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-X POST \
-d '{
"contents": [{
"parts": [{
"text": "Fasse die Unterschiede zwischen lokaler KI auf dem Mac und Gemini 3.5 Flash zusammen."
}]
}]
}'
API-Keys gehören nicht in Browser-Code, öffentliche GitHub-Repositories oder statische Astro-Seiten. Nutze ein Backend, eine Serverless Function, eine Edge Function oder sichere Secret-Verwaltung.
GenerateContent oder Interactions API?
Die Beispiele oben nutzen generateContent, weil das der einfachste Weg für einen ersten funktionierenden Request ist. Die Interactions API ist inzwischen allgemein verfügbar und wird von Google für neue Projekte empfohlen; generateContent bleibt weiterhin unterstützt.47
Die ältere Gemini-3-Entwicklerdoku ist inzwischen als deprecated markiert. Für Gemini 3.5 Flash solltest du die aktuelle „What’s new“- und Modell-Dokumentation als Primärreferenz verwenden.84
Nutze diese Trennung:
generateContentfür einfache Prompts, bestehende Integrationen, schnelle Tests und Fälle, in denen du Features brauchst, die in der Interactions API noch nicht verfügbar sind, etwa Batch API oder explizites Caching.- Interactions API für neue agentische Apps, serverseitige History-Verwaltung, sichtbare Ausführungsschritte, Tool-Orchestrierung, Hintergrundaufgaben und zukünftige Gemini-Funktionen.
Wichtiger Datenschutz-/Kostenpunkt: Die Interactions API speichert Interaction-Objekte standardmäßig (store=true) für serverseitigen Zustand, Hintergrundausführung und Observability. Für Paid-Tier-Projekte nennt die aktuelle Doku konfigurierbare Aufbewahrungsfenster von 7, 14, 28 oder 55 Tagen. Mit store=false kannst du für kompatible stateless Requests den Interaction-Speicher umgehen, verlierst dann aber Zustandsfunktionen wie previous_interaction_id; außerdem ist store=false nicht mit Background Execution kompatibel.7
Thinking Levels und Thought Preservation
Gemini 3.5 Flash unterstützt Thinking. Für Gemini 3.5 Flash solltest du thinking_level verwenden, nicht das ältere thinkingBudget-Muster aus manchen Beispielen. Die aktuelle Migration nennt medium als Default.49
Empfohlene Werte:
minimal: einfache Klassifikation, kurze Formatierung, sehr niedrige Latenzlow: leichte Analyse, kurze Hilfsaufgabenmedium: guter Standard für die meisten Aufgaben; laut aktueller Migration ist das der Default bei 3.5 Flash.49high: schwieriges Coding, Debugging, mehrstufige Agentenketten, komplexe Analyse
Thought preservation wird über Thought Signatures und die Gesprächshistorie weitergetragen. Dadurch kann das Modell in mehrstufigen Sessions konsistenter arbeiten, aber erhaltene Gedanken können den Input-Tokenverbrauch über mehrere Turns erhöhen.
Wichtig: Erwarte keine vollständige rohe Chain-of-Thought. Wenn Gedanken angezeigt oder zusammengefasst werden, passiert das nur über die jeweilige API-/SDK-Unterstützung und als kontrollierte Ausgabe oder Summary, nicht als Garantie auf die komplette interne Reasoning-Kette.
Preise: Standard, Batch, Flex, Priority und Grounding
Die Preise unten beziehen sich auf den Paid Tier laut Gemini-API-Pricing, geprüft am 11. August 2026. Output-Preise umfassen Thinking Tokens. Search Grounding kann mehrere Suchanfragen pro Request auslösen; Kosten fallen pro einzelner Search Query an.6
| Variante | Input | Output inkl. Thinking | Context Caching | Storage | Search/Maps Grounding |
|---|---|---|---|---|---|
| Standard | $1,50 / 1M Tokens | $9,00 / 1M Tokens | $0,15 / 1M Tokens | $1,00 / 1M Tokens/Stunde | 5.000 Prompts/Monat frei, danach $14 / 1.000 Search Queries |
| Batch | $0,75 / 1M Tokens | $4,50 / 1M Tokens | $0,075 / 1M Tokens | $1,00 / 1M Tokens/Stunde | 5.000 Requests/Monat frei, danach $14 / 1.000 Search Queries |
| Flex | $0,75 / 1M Tokens | $4,50 / 1M Tokens | $0,08 / 1M Tokens | $1,00 / 1M Tokens/Stunde | 5.000 Requests/Monat frei, danach $14 / 1.000 Search Queries |
| Priority | $2,70 / 1M Tokens | $16,20 / 1M Tokens | $0,27 / 1M Tokens | $1,00 / 1M Tokens/Stunde | 5.000 Prompts/Monat frei, danach $14 / 1.000 Search Queries |
Batch ist günstiger für asynchrone Batch-Workloads. Flex passt eher zu kostenbewussten Workloads mit flexibler Bereitstellung. Priority ist für priorisierte Workloads gedacht, aber nicht der einzige Weg zum 1M-Kontextfenster.
1M Kontext: nützlich, aber nicht kostenlos
Gemini 3.5 Flash hat allgemein 1.048.576 Input Tokens und 65.536 Output Tokens. Das 1M-Kontextfenster ist eine Modelleigenschaft, nicht nur ein Priority-Feature.
Langer Kontext ist trotzdem kein Freifahrtschein. Er erhöht Kosten, Latenz und Fehlerfläche. Gute Strategien:
- Input strukturieren
- irrelevante Teile entfernen
- File Search oder RAG nutzen
- Context Caching prüfen
- lange Gespräche zusammenfassen
- Ausgabeformat streng vorgeben
- nicht blind ganze Repos, Logordner oder PDFs in jeden Request kopieren
Managed Agents in der Gemini API
Managed Agents in der Gemini API erlauben, mit einem API-Call einen Agenten zu starten. Der Agent kann Reasoning, Tools und Code Execution nutzen und läuft in einer isolierten, ephemeren Linux-Umgebung.
Laut Google werden Managed Agents vom Antigravity-Agenten angetrieben und basieren auf Gemini 3.5 Flash. Sie sind über die Interactions API und Google AI Studio verfügbar. Für Mac-Nutzer ist das ein Cloud-Agenten-Workflow, aber keine lokale Apple-Silicon-Inferenz.103
Google beschreibt Managed Agents in der Launch-Mitteilung als Preview/Rollout. Behandle sie deshalb als Google-Cloud-Funktion, deren Verfügbarkeit von Account, Region, API-Zugriff und Produktänderungen abhängen kann.10
Antigravity 2.0 und Mac-Entwickler-Workflows
Antigravity 2.0 ist eine agent-first Developer Platform beziehungsweise Desktop-App. Sie soll die Orchestrierung mehrerer Agenten, Subagents, scheduled tasks und Integrationen ermöglichen.
Für Mac-Entwickler ist das interessant, weil Coding-Workflows stärker agentisch werden. Es ist aber nicht mit lokaler Ollama-Inferenz zu verwechseln. Antigravity gehört zum Google-/Cloud-Ökosystem; lokale Open-Weight-Modelle auf Apple Silicon bleiben ein anderer Workflow.
Gemini Spark und macOS-App
Google kündigte am 19. Mai 2026 Updates der Gemini-App für macOS an. Gemini Spark sollte im Sommer in die Gemini-Desktop-App kommen und Aufgaben mit lokalen Dateien und Desktop-Workflows unterstützen; das ist eine zeitgebundene Produktankündigung, keine Zusage für jede Region oder jedes Konto.11
Wichtig ist die Trennung: Spark soll zwar mit lokalen Dateien und macOS-Workflows arbeiten, ist laut Google aber cloud-basiert und läuft nicht als lokales LLM auf dem Mac. Auch wenn Spark über die macOS-App mit lokalen Dateien arbeiten kann, ist die Modellinferenz keine lokale Apple-Silicon-Inferenz.11
- lokale Inferenz: Ollama, LM Studio, MLX
- Cloud-Agenten: Gemini Spark, Antigravity, Managed Agents
Gemini 3.5 Flash vs lokale KI auf dem Mac
| Kriterium | Gemini 3.5 Flash | Lokale KI auf dem Mac |
|---|---|---|
| Private Dateien | Nur nach bewusster Cloud-Freigabe | Besser geeignet, weil Daten auf dem Gerät bleiben können |
| Offline-Arbeit | Nicht geeignet | Geeignet |
| Großer Kontext | Klarer Vorteil durch 1M Input Tokens | Abhängig von RAM, Runtime und Modell |
| Tool Calling / Code Execution | Gut im Gemini-API-Ökosystem | Möglich, aber meist mit eigener Tool-Schicht |
| Kosten | Token-, Caching- und Grounding-Kosten möglich | Keine Tokenkosten, aber Hardware- und Stromkosten |
| Reproduzierbare Open-Weight-Tests | Nicht der Fokus | Besser geeignet |
Lokale Modelle gewinnen bei vertraulichen Dateien, Offline-Arbeit, reproduzierbaren Open-Weight-Tests, Datenschutz-first und Workflows ohne Tokenkosten. Gemini 3.5 Flash gewinnt bei 1M Kontext, multimodalem Input, Tool Calling, Code Execution, File Search, Search/Maps Grounding, Managed Agents und längeren agentischen Workflows.
Datenschutz, Logs und Abuse Monitoring
Die pauschale Aussage “Prompts werden immer zum Training genutzt” ist zu grob. Die sinnvolle Differenzierung hängt von Tier, API-Oberfläche und Projektkonfiguration ab:
- Free Tier: Laut Pricing kann Content zur Verbesserung von Google-Produkten genutzt werden.6
- Paid Tier: Laut Pricing wird Content nicht zur Produktverbesserung genutzt.6
- Billing-enabled Logs: Laut Data Logging Policy werden Prompts und Responses standardmäßig nicht zur Produktverbesserung genutzt, außer Nutzer teilen Datasets oder Feedback aktiv.12
- Abuse Monitoring: Google kann Prompts, Kontextinformationen und Outputs für 55 Tage zur Missbrauchserkennung und Policy Enforcement speichern.13
- Interactions API Storage: Interactions werden standardmäßig für serverseitigen Zustand und Observability gespeichert; Paid-Tier-Projekte können ein Aufbewahrungsfenster von 7, 14, 28 oder 55 Tagen konfigurieren. Mit
store=falsekannst du für kompatible stateless Requests opt-out nutzen.7
Das macht Gemini 3.5 Flash nicht automatisch “vollständig privat”. Es ist weiterhin ein Cloud-Modell. Für sensible Daten bleiben lokale Modelle, ein Enterprise-/Vertex-AI-Setup oder eine klare Compliance-Prüfung die bessere Standardwahl.71213
Wann Gemini 3.5 Flash sinnvoll ist
Gemini 3.5 Flash ist besonders sinnvoll für:
- große Codebases oder lange Dokumente mit klarer Aufgabenstellung
- multimodale Analyse
- Tool Calling und Code Execution
- File Search und RAG-nahe Workflows
- Search/Maps Grounding, wenn aktuelle oder ortsbezogene Informationen nötig sind
- Managed Agents und längere agentische Coding-Flows
- Aufgaben, bei denen 1M Kontext wichtiger ist als lokale Datenhaltung
Wann lokale KI besser ist
Lokale KI auf dem Mac ist besser für:
- private Dokumente
- Offline-Arbeit
- Open-Weight-Experimente
- reproduzierbare Modelltests
- Workflows ohne Tokenkosten
- kurze Aufgaben, bei denen ein kleines oder mittleres lokales Modell reicht
- Fälle, in denen Daten das Gerät nicht verlassen sollen
Typische Fehler bei Gemini 3.5 Flash
- Den offiziellen Modellcode mit Provider-Aliasen verwechseln: In der Gemini API heißt das Modell
gemini-3.5-flash, nicht automatischgoogle/gemini-3.5-flash. - Alte oder fremde API-Beispiele übernehmen: Nutze für Gemini die offizielle Google GenAI SDK- oder REST-Syntax.
- Veraltete Thinking-Parameter verwenden: Für Gemini 3.x ist
thinking_leveldie aktuelle Empfehlung, nicht ältere Budget-Beispiele aus anderen Modellgenerationen.49 - Gemini 3.5 Flash in Ollama, LM Studio oder MLX suchen: Google dokumentiert dafür keinen lokalen Apple-Silicon-Pfad.54
- Das 1M-Kontextfenster blind voll ausnutzen: Langer Kontext erhöht Kosten, Latenz und Fehleranfälligkeit.
- Free Tier und Paid Tier beim Datenschutz vermischen: Datenverwendung und Produktverbesserung unterscheiden sich je nach Nutzung.612
- Search Grounding als kostenlos einplanen: Grounding kann nach Freikontingent Kosten pro Suchanfrage verursachen.6
- Gemini Spark als lokale Inferenz missverstehen: Spark kann Mac-Workflows integrieren, ist aber keine lokale Apple-Silicon-Inferenz.11
- Computer Use als überall gleich verfügbar behandeln: Google führt Computer Use als Preview-Funktion; Bild- und Audio-Generierung bleiben auf der Modellseite nicht unterstützt. Prüfe die konkrete API-Oberfläche und Region vor dem produktiven Einsatz.5
Fazit: Cloud-Werkzeug mit 1M Kontext, lokal ohne Pfad
Gemini 3.5 Flash ist für Mac-Nutzer nicht deshalb relevant, weil ein offizieller Apple-Silicon-Pfad dokumentiert wäre. Relevant ist es, weil es 1M Kontext, multimodalen Input, Thinking, Tool-Nutzung, Code Execution, File Search, Grounding und Managed Agents in einem schnellen Cloud-Modell kombiniert.5410
Für private Dateien, Offline-Arbeit und lokale Open-Weight-Experimente bleiben Ollama, LM Studio und MLX die bessere Wahl. Für große Kontexte, agentische Coding-Workflows, Tool-Ketten und Cloud-Agenten ist Gemini 3.5 Flash eine praktische Cloud-Ergänzung.
Die richtige Frage lautet also nicht: Gemini oder lokal? Sondern: Welche Daten müssen auf dem Mac bleiben, und welche Aufgaben profitieren wirklich von Googles Cloud-Agenten?61213
Quellen
Footnotes
-
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5 ↩ ↩2
-
https://blog.google/innovation-and-ai/technology/developers-tools/google-io-2026-collection ↩
-
https://blog.google/innovation-and-ai/technology/developers-tools/google-io-2026-developer-highlights ↩ ↩2 ↩3
-
https://ai.google.dev/gemini-api/docs/whats-new-gemini-3.5 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13
-
https://ai.google.dev/gemini-api/docs/models/gemini-3.5-flash ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8
-
https://ai.google.dev/gemini-api/docs/pricing ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7
-
https://ai.google.dev/gemini-api/docs/interactions ↩ ↩2 ↩3 ↩4
-
https://blog.google/innovation-and-ai/technology/developers-tools/managed-agents-gemini-api ↩ ↩2 ↩3
-
https://blog.google/innovation-and-ai/products/gemini-app/next-evolution-gemini-app ↩ ↩2 ↩3
-
https://ai.google.dev/gemini-api/docs/logs-policy ↩ ↩2 ↩3 ↩4
-
https://ai.google.dev/gemini-api/docs/usage-policies ↩ ↩2 ↩3
Häufig gestellte Fragen
Was ist Gemini 3.5 Flash?
Gemini 3.5 Flash ist Googles mittlere Modellstufe in der Gemini-3.5-Familie, positioniert zwischen Gemini 3.5 Pro (Qualität) und Gemini 3.5 Flash-Lite (Kosten). Es zielt auf latenzkritische Anwendungen wie Chat, agentenbasierten Tool Use und große Kontexte, mit 1M-Token-Kontextfenster und niedrigerem Pro-Token-Preis als die Pro-Stufe.
Was kostet Gemini 3.5 Flash?
Googles aktuelle Gemini-API-Preisseite listet für Gemini 3.5 Flash im Paid Tier 1,50 US-Dollar pro 1M Input-Tokens und 9 US-Dollar pro 1M Output-Tokens. Batch und Flex sind günstiger, Priority ist teurer; Caching und Grounding werden separat berechnet. Vor produktiver Nutzung aktuelle Preise auf ai.google.dev prüfen.
Läuft Gemini 3.5 Flash lokal auf dem Mac in Ollama oder MLX?
Die offiziellen Google-Unterlagen dokumentieren Gemini 3.5 Flash als API- und Cloud-Modell, aber keinen Apple-Silicon-Laufzeitpfad. Eine lokale Installation sollte daher nicht behauptet werden. Für lokale Mac-Workflows brauchst du dokumentierte Open-Weight-Alternativen wie Qwen3, Llama, Mistral oder Gemma.
Trainiert Google meine Gemini-3.5-Flash-API-Prompts?
Im Paid Tier listet Google die API-Daten standardmäßig als nicht zur Verbesserung der Google-Produkte verwendet. Free Tier, Logs, Abuse Monitoring und Consumer-Produkte haben eigene Regeln. Sensible Daten gehören bewusst gekürzt, Prompts eng gescoped und idealerweise zuerst durch ein lokales Modell geleitet. Vor personenbezogenen Daten Googles aktuelle Policy auf ai.google.dev lesen.
Was ist der beste Mac-Workflow mit Gemini 3.5 Flash?
Gemini 3.5 Flash für: lange Kontexte (>200K Tokens), Agent-Workflows mit Googles Managed Tools, multimodale Inputs (Bild, Video, Audio), wo lokale Modelle schwach sind. Lokales Modell (Ollama, LM Studio, MLX) für: private Dokumente, Offline-Arbeit, reproduzierbare Tests, alltäglicher Chat. Empfohlen ist ein Hybrid-Router, der pro Task das passende Modell wählt.