Lokale Modelle
Lokale Sprach-, Vision- und Audio-Modelle auf Apple Silicon: Qwen3, Gemma3, Llama, Mistral und mehr — Benchmarks und RAM-Anforderungen für M1–M4 Macs.
- Passendes Modell finden
- Setup pro Modell
- Benchmark-Vergleiche
- RAM-Anforderungen
Was zählt als lokales Modell?
Läuft auf deinem Mac
Die Modellgewichte werden heruntergeladen und die Inferenz läuft lokal über Ollama, LM Studio, MLX, llama.cpp oder eine ähnliche Runtime.
Open Weights heißt nicht immer Open Source
Viele lokale Modelle sind Open-Weight, aber ihre Lizenz kann kommerzielle Nutzung, Weiterverteilung oder Fine-Tuning trotzdem einschränken.
Speicher entscheidet
Modellgröße ist nicht gleich Speicherbedarf. Kontextlänge, KV-Cache, Quantisierung, Vision-Input und andere Apps beeinflussen Unified Memory ebenfalls.
Datenschutz hängt von der Konfiguration ab
Lokale Inferenz kann Prompts auf deinem Mac halten, aber Downloads, Plugins, Cloud-Funktionen, freigegebene lokale Server und Backups können trotzdem Datenpfade erzeugen.
Einstieg in lokale Modelle
Checkliste für lokale Modelle
- Ist das Modell wirklich herunterladbar?
- Gibt es Ollama-, GGUF-, MLX- oder LM-Studio-Unterstützung?
- Ist es text-only, vision-fähig, audio-fähig oder multimodal?
- Welche Lizenz gilt: Open Source, Open Weights, Research-only oder kommerziell?
- Wie viel Unified Memory ist realistisch nach Kontext und KV-Cache?
- Braucht es Cloud-Funktionen, API-Aufrufe oder Online-Tools?
- Kannst du es nach dem Download offline nutzen?
- Passt es besser zu deiner Aufgabe als ein kleineres Modell?
-
Qwen3.6-27B Fable Fusion 711 auf dem Mac: GGUF-Größen und RAM-Wahl
Welche Fable-Fusion-711-GGUF passt zu 24, 32, 48 oder 64 GB Unified Memory? Größen, MTP, Vision und Benchmark-Evidenz – ohne eigene Mac-Benchmarks.
-
Apple Intelligence: Lokale KI, Foundation Models und Private Cloud Compute
Welche Apple-Intelligence-Funktionen lokal laufen, wann Private Cloud Compute übernimmt und was Apples On-Device-Modelle technisch leisten.
-
Gemma 4 vs. Qwen3.6 auf dem Mac: Ollama 0.31, MLX & RAM
Gemma 4 vs. Qwen3.6 auf dem Mac: Ollama 0.31, MLX/MTP, Paketgrößen, Coding-Benchmarks, Kontext und praktischer RAM-Vergleich.
-
Beste Open-Weight-LLMs für den Mac 2026: RAM, Ollama-Tags & Auswahl
Welche Open-Weight-LLMs sind 2026 für deinen Mac sinnvoll? Vergleiche RAM, Ollama-Tags, Kontext und realistische Modelle für 8–64 GB Unified Memory.
Wie Empfehlungen für lokale Modelle entstehen
Empfehlungen für lokale Modelle auf AI on Mac sollen Modellgröße, Quantisierung, Runtime, Kontextlänge, Apple-Silicon-Generation und Unified Memory getrennt betrachten. Ein Modell, das auf einem 48-GB-Mac-Studio funktioniert, kann auf einem 8-GB-MacBook-Air unrealistisch sein. Die Artikel in dieser Kategorie sollen außerdem zwischen Open Source, Open Weights, Cloud-only-APIs und hybriden Tools unterscheiden.