Recherchierter Modellstand: 12. August 2026 · redaktionell geprüft: 15. August 2026. NVIDIA hat Nemotron 3.5 Lightning am 11. August 2026 veröffentlicht. Offiziell beschreibt NVIDIA das Modell als 30B-Mixture-of-Experts mit 3B aktiven Parametern, einer Hybridarchitektur aus Mamba-2, MoE und ausgewählten Attention-Layern sowie einem Kontextfenster von bis zu einer Million Tokens. Die Veröffentlichung umfasst BF16- und NVFP4-Checkpoints, mehrere Verfahren für spekulatives Decoding sowie Trainingsdaten und -rezepte unter OpenMDW 1.1. [S01][S06][S10]
Die kurze Einordnung lautet: Nemotron 3.5 Lightning ist kein neues Spitzenmodell für maximale allgemeine Intelligenz. Es ist ein sehr schnelles, relativ kleines Ausführungsmodell für Agenten, Tool-Aufrufe, Coding und wiederholte Arbeitsschritte. In der unabhängigen Artificial-Analysis-Auswertung erreicht es einen Intelligence Index von 24 und liegt damit unter Qwen3.6 35B A3B (32) und Muse Glimmer (35). Gleichzeitig wurden auf einem vorab getesteten DeepInfra-NVFP4-Endpunkt fast 670 Output-Tokens/s gemessen. [S15][S16][S17]
Diese Kombination ist der eigentliche Punkt des Modells: nicht „bestes Modell um jeden Preis”, sondern viel Agentenarbeit pro Sekunde und pro Dollar.
Die wichtigsten Fakten zum Nemotron 3.5 Lightning
| Merkmal | Stand 12.08.2026 | Einordnung |
|---|---|---|
| Veröffentlichung | 11.08.2026 | offiziell |
| Modellgröße | 30B gesamt / 3B aktiv laut NVIDIA | Unterschied von NVIDIA nicht erläutert; AA meldet 31,6B / 3,6B |
| Architektur | Hybrid-MoE: Mamba-2 + MoE + ausgewählte Attention-Layer | offiziell |
| Kontext | bis 1.000.000 Tokens | nicht jeder API-Anbieter stellt 1M bereit |
| Eingabe/Ausgabe | Text → Text | kein natives Bild-Input |
| Lizenz | OpenMDW 1.1 | kommerzielle Nutzung laut NVIDIA vorgesehen |
| Optimierter Checkpoint | NVFP4 | für Deployment gedacht |
| Referenz-Checkpoint | BF16 | vor allem für Anpassung/Post-Training |
| Lokale NVIDIA-Hardware | u. a. RTX 5090, DGX Spark/GB10, H100/H200 | offizielle Modellkarte |
| Apple Silicon | keine offizielle NVIDIA-Unterstützung | Community-GGUF und MLX existieren |
| OpenRouter Standard | 262K, $0,05/M Input, $0,20/M Output | provider-spezifisch |
| Fireworks | 262K, $0,05/M Input, $0,01/M Cache, $0,20/M Output | provider-spezifisch |
30B oder 31,6B? Warum verschiedene Zahlen kursieren
Hier gibt es bereits einen kleinen, aber wichtigen Widerspruch. NVIDIA nennt 30 Milliarden Gesamtparameter und 3 Milliarden aktive Parameter. Artificial Analysis führt dagegen 31,6 Milliarden Gesamtparameter und 3,6 Milliarden aktive Parameter; Fireworks listet 32,9 Milliarden Parameter. [S01][S16][S23]
Das ist kein Beleg dafür, dass eine der Quellen „falsch” sein muss. Bei MoE-Modellen können Zählweisen, Rundung und einbezogene Komponenten voneinander abweichen. In den geprüften NVIDIA-Quellen wird der Unterschied aber nicht ausdrücklich erklärt. Deshalb ist die saubere Formulierung:
NVIDIA vermarktet Nemotron 3.5 Lightning als 30B-A3B-Modell. Unabhängige beziehungsweise providerseitige Metadaten nennen höhere exakte Zählwerte.
Für Titel und Modellnamen sollte die offizielle Bezeichnung 30B-A3B verwendet werden.
Architektur: Warum nur ein Teil des Modells pro Token arbeitet
Nemotron 3.5 Lightning kombiniert drei Bausteine: Mamba-2, Mixture-of-Experts und ausgewählte Attention-Layer. Von den insgesamt rund 30 Milliarden Parametern wird pro Token nur ein deutlich kleinerer Teil aktiviert. [S01]
Das ist für Agentensysteme interessant. Ein autonomer Agent verbringt nicht jeden Schritt mit schwerem strategischem Denken. Er muss häufig Dateien lesen, strukturierte Daten umformen, APIs ansprechen, Ergebnisse überprüfen, kurze Codeänderungen erzeugen oder Subagenten koordinieren. NVIDIA positioniert Lightning genau als diese Ausführungsschicht und schlägt stärkere Modelle für schwierige Planungsschritte vor. NeMo Switchyard soll solche Aufgaben zwischen Modellen routen. [S06][S09]
Zusätzlich enthält Lightning Multi-Token Prediction (MTP). Dabei wird nicht ausschließlich das nächste einzelne Token vorhergesagt. NVIDIA veröffentlicht außerdem DSpark und DFlash als spekulative Decoding-Pfade. Das Ziel ist nicht höhere Modellintelligenz, sondern geringere Latenz beziehungsweise höherer Durchsatz bei geeigneten Serving-Setups. [S01][S04][S05]
Wie gut ist Nemotron 3.5 Lightning bei Benchmarks?
NVIDIAs eigene Release-Benchmarks
Für den NVFP4-Checkpoint veröffentlicht NVIDIA unter anderem folgende Werte: [S01]
| Benchmark | NVFP4 | Was er grob misst |
|---|---|---|
| MMLU Pro | 81,62 | breites Fachwissen/Reasoning |
| GPQA Diamond | 75,57 | schwierige wissenschaftliche Fragen |
| HLE, text-only, ohne Tools | 10,47 | sehr anspruchsvolle Wissens-/Reasoning-Aufgaben |
| SciCode | 31,38 | wissenschaftliches Coding |
| SWE-bench Verified | 52,80 | reale Software-Issues |
| SWE-bench Multilingual | 36,47 | Software-Aufgaben über mehrere Sprachen |
| Terminal-Bench 2.1 | 23,46 | Terminal-/Agentenaufgaben |
| PinchBench | 83,43 | agentische Praxisaufgaben |
| BrowseComp | 36,81 | Web-/Rechercheaufgaben |
| GDPval-AA-V2 | 865 | professionelle Aufgaben |
| IFBench loose | 72,88 | Instruction Following |
| AA-LCR | 49,19 | Long-Context-Reasoning |
Diese Zahlen sollten nicht unkritisch mit Herstellerwerten anderer Modelle zusammengemischt werden. NVIDIA weist selbst darauf hin, dass die Werte mit einem konsistenten eigenen Harness gemessen wurden und von selbstberichteten Werten anderer Anbieter abweichen können. Positiv ist, dass NVIDIA Evaluierungsrezepte veröffentlicht. [S01]
Unabhängige Einordnung von Artificial Analysis
Artificial Analysis gibt Nemotron 3.5 Lightning aktuell einen Intelligence Index von 24. Damit liegt es nach dieser Metrik hinter anderen kleinen offenen Modellen wie Qwen3.6 35B A3B mit 32 und Muse Glimmer mit 35. [S15][S16]
Der Intelligence Index und der Durchsatz messen unterschiedliche Eigenschaften: Der Index ordnet Nemotron hinter Qwen3.6 35B A3B und Muse Glimmer ein; auf einem vor dem Release getesteten DeepInfra-NVFP4-Endpunkt mit den finalen NVFP4-Gewichten wurden dagegen nahezu 670 Output-Tokens pro Sekunde gemessen. Auf der späteren Providerseite lagen zum Abrufzeitpunkt 662,9 t/s für DeepInfra, 522,8 t/s für Fireworks und 256,6 t/s für Nebius. [S15][S17]
Diese Zahlen sind keine lokale GPU-Geschwindigkeit. Sie gelten für konkrete Cloud-Endpunkte und ändern sich mit Batch-Größe, Hardware, Last, Prompt-Länge und Serving-Konfiguration. Sie zeigen aber, worauf NVIDIA optimiert: sehr hohen Durchsatz.
Ist es besser als Qwen3.6 oder Muse Glimmer?
Wenn „besser” allgemeine Problemlösungsleistung meint, lautet die Antwort nach dem derzeit besten unabhängigen Vergleich: eher nein. Artificial Analysis bewertet Qwen3.6 35B A3B und Muse Glimmer deutlich höher in der allgemeinen Intelligence-Metrik. [S15]
Wenn „besser” dagegen schnelle, häufige Agentenschritte bedeutet, kann Nemotron 3.5 Lightning die interessantere Wahl sein. Die Kombination aus 3B aktivem Arbeitsumfang, spekulativem Decoding und NVFP4 ist gezielt auf Durchsatz ausgelegt. Dafür sollte man das Modell aber in einem eigenen Agenten-Harness mit den realen Aufgaben testen statt eine einzelne Benchmarkzahl zu übertragen.
Kontextfenster: 1 Million Tokens – aber nicht überall
NVIDIA gibt ein maximales Kontextfenster von bis zu 1.000.000 Tokens an. [S01][S02]
Das bedeutet nicht, dass jeder Anbieter oder jede lokale Runtime automatisch eine Million Tokens bereitstellt. Am 12. August 2026 zeigt OpenRouter für den normalen kostenpflichtigen nvidia/nemotron-3.5-lightning-Endpunkt 262K Kontext; der kostenlose NVIDIA-Pfad wird dort mit 1M ausgewiesen. Fireworks nennt ebenfalls 262K. [S21][S22][S23]
Das ist ein wichtiger Unterschied zwischen:
- Modellmaximum – was die Architektur beziehungsweise der offizielle Checkpoint unterstützt.
- Serving-Limit – was ein Anbieter in seinem Produkt freigibt.
- praktisch nutzbarem Kontext – was Speicher, Latenz und Qualität in deinem konkreten Workflow sinnvoll machen.
Bei lokaler Nutzung kann ein theoretisch unterstütztes 1M-Fenster weit außerhalb dessen liegen, was auf einem gegebenen Rechner sinnvoll ist.
Lokale Nutzung auf NVIDIA-Hardware
Für den NVFP4-Checkpoint listet NVIDIA unter anderem GeForce RTX 5090, DGX Spark/GB10, H100 und H200. Außerdem nennt die Modellkarte Ampere über W4A16. Als konkrete Single-GPU-Beispiele stehen DGX Spark und H100 in der Karte. [S01]
Für BF16 nennt NVIDIA H100/A100-80GB als Single-GPU-Beispiele; die Karte weist darauf hin, dass bei einem einzelnen H100 in der gezeigten Konfiguration 256K statt des theoretischen 1M-Kontexts verwendet wird. [S02]
Deshalb ist die Schlagzeile „läuft auf einer einzelnen GPU” leicht missverständlich. Sie bedeutet nicht, dass das Modell offiziell für jede normale Notebook-GPU oder beliebige ältere GeForce freigegeben ist. Ein Artikel, der daraus „typischer Laptop” macht, überdehnt die Primärquelle. [S06]
Läuft Nemotron 3.5 Lightning auf dem Mac?
Ja, über Community-Runtimes – aber derzeit nicht über einen offiziellen NVIDIA-Mac-Pfad.
Bereits einen Tag nach Release stehen mehrere Konvertierungen bereit:
ggml-org/...-GGUFdokumentiert den Start mitllama.cppundbrew install llama.cpp. [S24]- Bartowskis GGUF-Repository nennt für Q4_K_M 25,48 GB; Q5_K_M liegt bei 26,96 GB und Q8_0 bei 35,00 GB. [S25]
mlx-community/...-8bitist eine MLX-Konvertierung für Apple Silicon mit 33,6 GB Dateigröße. [S27]- Vontra stellt eine weitere MLX/oMLX-Quantisierung bereit. [S28]
Ein einfacher GGUF-Start ist beispielsweise:
brew install llama.cpp
llama serve -hf ggml-org/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF:Q4_K_M
Quelle des Befehls: [S24].
Für MLX dokumentiert die Community unter anderem:
uv tool install mlx-lm
mlx_lm.server --model "mlx-community/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-8bit"
Quelle: [S27].
Wie viel Unified Memory braucht man?
Die 25,48 GB des Q4_K_M-Files sind eine Untergrenze für die Gewichte auf dem Datenträger, keine garantierte RAM-Anforderung. Zur Laufzeit kommen unter anderem Runtime-Overhead, Zustände, Kontextdaten und sonstige Puffer hinzu. [S25]
Daraus folgt als Einschätzung auf Basis der Modellarchitektur, nicht als gemessener NVIDIA-Wert:
- 24 GB Unified Memory: Q4_K_M ist bereits größer als der physische Speicher; ein sinnvoller vollresidenter Betrieb ist daher nicht zu erwarten.
- 32 GB: Q4_K_M ist größenmäßig grundsätzlich näher am Machbaren, aber der verbleibende Spielraum ist klein. Große Kontexte sind besonders problematisch.
- 48 GB oder 64 GB: deutlich plausibler für Q4/Q5 und realistische Kontextpuffer.
- 64 GB+: sinnvoller Ausgangspunkt für 8-bit-Varianten um 33,6 GB, wenn zusätzlich Kontext und andere Prozesse Platz benötigen.
Diese Einschätzung muss durch reale Messungen ergänzt werden. Zum Prüfzeitpunkt gibt es noch keine ausreichend belastbare, reproduzierbare Mac-Matrix mit Tokens/s, Energieverbrauch und maximal stabilem Kontext, die hier seriös als Fakt übernommen werden könnte.
API-Preise: auffällig günstig, aber providerabhängig
OpenRouter listet den Standardendpunkt am 12. August 2026 mit:
- $0,05 pro 1 Mio. Input-Tokens
- $0,20 pro 1 Mio. Output-Tokens
- 262K Kontext [S21]
Fireworks nennt:
- $0,05 pro 1 Mio. Input-Tokens
- $0,01 pro 1 Mio. gecachte Input-Tokens
- $0,20 pro 1 Mio. Output-Tokens
- 262K Kontext [S23]
Beispielkosten bei Fireworks
Eigene Rechnung ohne Steuern und ohne sonstige Plattformkosten:
| Szenario | Input | Output | Rechnung | Kosten |
|---|---|---|---|---|
| klein | 2M | 0,5M | 2×$0,05 + 0,5×$0,20 | $0,20 |
| mittel | 25M | 5M | 25×$0,05 + 5×$0,20 | $2,25 |
| intensiv | 250M | 50M | 250×$0,05 + 50×$0,20 | $22,50 |
| intensiv, 80 % des Inputs gecacht | 250M | 50M | 50×$0,05 + 200×$0,01 + 50×$0,20 | $14,50 |
Im letzten Beispiel reduziert Caching die modellbezogenen Tokenkosten rechnerisch um rund 35,6 % gegenüber komplett ungecachetem Input. Ob ein Agent tatsächlich 80 % Cache-Hits erreicht, ist workflowabhängig.
Artificial Analysis weist außerdem auf eine hohe Verbosität in seinem Intelligence-Test hin. Ein niedriger Preis pro Output-Token garantiert also nicht automatisch niedrige Kosten pro erledigter Aufgabe. [S16]
Welche Version sollte man herunterladen?
NVFP4 — Nimm den offiziellen NVFP4-Checkpoint, wenn du auf unterstützter NVIDIA-Hardware möglichst effizient inferieren willst. NVIDIA richtet diesen Pfad ausdrücklich auf Deployment aus. [S01]
BF16 — Nimm BF16, wenn du post-trainen, feinabstimmen, eigene Quantisierungen erzeugen oder mit den Referenzgewichten arbeiten willst. NVIDIA bezeichnet BF16 ausdrücklich als den Anpassungs-/Referenzpfad und verweist für optimierte Inferenz auf NVFP4. [S02]
GGUF — Nimm GGUF, wenn du llama.cpp, LM Studio, Ollama oder einen plattformübergreifenden lokalen Stack nutzen willst. Die derzeitigen GGUFs sind Community-Konvertierungen, nicht offizielle NVIDIA-Mac-Builds. [S24][S25][S26]
MLX — Nimm MLX, wenn Apple Silicon dein Ziel ist und du eine native MLX-Laufzeit bevorzugst. Der Pfad ist aktuell besonders frisch; deshalb sollten Funktion Calling, lange Kontexte, Thinking-Template und MTP-Unterstützung vor produktivem Einsatz mit eigenen Tests geprüft werden. [S27][S28]
Deployment-Pfade im Überblick
Die folgende Übersicht trennt offizielle NVIDIA-Pfade, Apple-Silicon-Pfade und Cloud-Routen.
Wofür ist Lightning besonders interessant?
Das Modell passt am besten zu Workloads, bei denen dieselben Agenten viele relativ klar umrissene Aufgaben wiederholen:
- Datei- und Log-Auswertung
- Tool-Aufrufe und strukturierte API-Schritte
- Code-Änderungen und Tests
- RAG-Nachbearbeitung
- Subagenten
- Datenumformung
- Validierungsschritte
- lokale/private Assistenten mit überschaubarem Hardwarebudget
Für hochkomplexe Planung, schwierige Wissenschaftsfragen oder Aufgaben, bei denen maximale allgemeine Intelligenz wichtiger ist als Durchsatz, sprechen die derzeitigen unabhängigen Daten eher dafür, ein stärkeres Modell als Planner einzusetzen und Lightning als Worker zu nutzen. [S15]
Das deckt sich mit NVIDIAs Switchyard-Idee: nicht ein Modell für alles, sondern Routing zwischen einem starken Planer und einem schnellen Ausführungsmodell. [S06][S09]
Grenzen, die man vor dem Einsatz kennen sollte
Erstens: Das Modell ist text-only. [S16]
Zweitens: Eine Million Tokens sind ein Maximalwert, keine Garantie jedes Providers oder jeder lokalen Runtime. [S01][S21][S23]
Drittens: Die auffällig hohen NVIDIA-Benchmarkwerte sind Herstellerwerte. NVIDIA veröffentlicht zwar Harness-Informationen, doch saubere modellübergreifende Vergleiche brauchen dieselben Testbedingungen. [S01]
Viertens: Der Mac-Support ist derzeit Community-getrieben. Dass ein GGUF oder MLX-Checkpoint startet, beweist noch nicht, dass alle Spezialfunktionen und sehr langen Kontexte optimal funktionieren. [S24][S27]
Fünftens: Open-weight und permissiv lizenziert bedeutet nicht automatisch, dass jede konkrete Nutzung ohne weitere Datenschutz-, Compliance- oder Sicherheitsprüfung erfolgen sollte. Die Lizenz und die Datenverarbeitung des gewählten API-Anbieters sind getrennte Ebenen. [S12][S21]
Fazit: Rolle und Grenzen des Modells
Nemotron 3.5 Lightning ist am interessantesten, wenn Durchsatz, lokale Kontrolle, günstige Tokenpreise und Agentenarbeit wichtiger sind als die absolut höchste Reasoning-Leistung.
Die bislang stärkste unabhängige Evidenz zeigt genau diesen Trade-off: Intelligence Index 24 – also klar unter Qwen3.6 35B A3B und Muse Glimmer – aber außergewöhnlich hohe Serving-Geschwindigkeit auf dem getesteten NVFP4-Endpunkt. [S15]
Für lokale Nutzer ist die Veröffentlichung ebenfalls relevant. NVIDIA unterstützt offiziell ausgewählte NVIDIA-Hardware; gleichzeitig sind GGUF-, Ollama- und MLX-Pfade bereits verfügbar. Für Apple Silicon sollte man aktuell allerdings noch keine erfundenen Tokens/s oder 1M-Kontext-Versprechen übernehmen. Der nächste sinnvolle Schritt ist ein reproduzierbarer Mac-Benchmark auf identischer Hardware mit Q4_K_M und MLX, inklusive RAM, Prefill, Generation, Energieverbrauch, Function Calling und langem Kontext.
Häufig gestellte Fragen
Was ist NVIDIA Nemotron 3.5 Lightning?
Ein offenes 30B-Mixture-of-Experts-Modell mit 3B aktiven Parametern, Hybridarchitektur aus Mamba-2, MoE und ausgewählten Attention-Layern, bis zu 1.000.000 Tokens Kontext, veröffentlicht unter OpenMDW 1.1 am 11. August 2026.
30B oder 31,6B Parameter? Warum gibt es unterschiedliche Zahlen?
NVIDIA vermarktet das Modell als 30B-A3B. Unabhängige beziehungsweise providerseitige Metadaten nennen 31,6B/3,6B (Artificial Analysis) oder 32,9B (Fireworks). NVIDIA erläutert die Differenz nicht ausdrücklich; bei MoE-Modellen können Zählweisen und Rundungen voneinander abweichen.
Wie schlägt sich Nemotron 3.5 Lightning in unabhängigen Benchmarks?
Artificial Analysis bewertet das Modell aktuell mit einem Intelligence Index von 24 und liegt damit unter Qwen3.6 35B A3B (32) und Muse Glimmer (35). Die herausragende Stärke ist nicht die allgemeine Intelligenz, sondern die Serving-Geschwindigkeit auf optimierten NVFP4-Endpunkten.
Was kostet die API?
OpenRouter listet 0,05 US-Dollar pro 1M Input-Token und 0,20 US-Dollar pro 1M Output-Token. Fireworks nennt zusätzlich 0,01 US-Dollar pro 1M gecachte Input-Token. Preise und Kontextlimits sind provider-spezifisch und können sich ändern.
Bedeutet 1M Kontext, dass jeder Anbieter 1M Tokens liefert?
Nein. Das 1M-Fenster ist das Modellmaximum. OpenRouter Standard und Fireworks zeigen aktuell 262K. Nur der kostenlose NVIDIA-Pfad bei OpenRouter listet 1M. Die Kontextgröße, die du nutzen kannst, hängt von Provider-Limit, Speicher und Latenzbudget ab.
Läuft Nemotron 3.5 Lightning auf Apple Silicon?
Es gibt keinen offiziellen NVIDIA-Mac-Pfad. Bereits am ersten Tag nach Release existieren Community-Konvertierungen: GGUF Q4_K_M mit 25,48 GB, MLX 8-bit mit 33,6 GB und weitere MLX/oQ6-Varianten. Belastbare Tokens-pro-Sekunde-Werte über M-Series-Chips fehlen bisher.
Welcher Checkpoint ist wofür gedacht?
NVFP4 ist NVIDIAs optimierter Inferenzpfad auf unterstützter Hardware. BF16 ist der Referenz- und Anpassungspfad, etwa für Post-Training. llama.cpp/GGUF und MLX sind Community-Pfade für lokale Runtimes. Ollama verpackt eigene Quantisierungen.
Wofür ist Lightning besonders gut geeignet?
Für hochvolumige Agentenschritte: Tool-Aufrufe, Code- und Test-Iterationen, RAG-Nachbearbeitung, Subagenten, Datei- und Log-Auswertung. Für schwierige Planung oder maximale allgemeine Intelligenz ist ein stärkeres Modell als Planner plus Lightning als Worker die bessere Architektur.
Transparenz
Quellen und Prüfgrundlage
Diese Primär- und Referenzquellen bilden die Grundlage der technischen Einordnung. Herstellerangaben und externe Benchmarks werden im Artikel als solche gekennzeichnet.
- huggingface.co nvidia / NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4
- huggingface.co nvidia / NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16
- huggingface.co nvidia / NVIDIA-Nemotron-3.5-Lightning-30B-A3B-Base-BF16
- huggingface.co nvidia / NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark
- huggingface.co nvidia / NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash
- developer.nvidia.com blog / nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents
- blogs.nvidia.com blog / nemotron-lightning-switchyard-rtx-dgx
- blogs.nvidia.com blog / local-ai-open-source-models-agents-nemotron
- developer.nvidia.com ai / nemotron
- github.com lightning35 / README.md
- github.com Megatron-Bridge / releases
- github.com OpenMDW / openmdw
- openmdw.ai openmdw.ai
- linuxfoundation.org press / linux-foundation-releases-openmdw-1.1-nvidia-adopts-openmdw-for-cosmos-isaac-gr00t-ising-and-nemotron-ai-model-families
- artificialanalysis.ai articles / nemotron-3-5-lightning-launch
- artificialanalysis.ai models / nemotron-3-5-lightning
- artificialanalysis.ai nemotron-3-5-lightning / providers
- pinchbench.com pinchbench.com
- github.com pinchbench / skill
- github.com pinchbench
- openrouter.ai nvidia / nemotron-3.5-lightning
- openrouter.ai nvidia
- fireworks.ai fireworks / nemotron-lightning-3p5-30b-a3b
- huggingface.co ggml-org / NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF
- huggingface.co bartowski / NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF
- huggingface.co lmstudio-community / NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF
- huggingface.co mlx-community / NVIDIA-Nemotron-3.5-Lightning-30B-A3B-8bit
- huggingface.co Vontra / NVIDIA-Nemotron-3.5-Lightning-30B-A3B-oQ6
- ollama.com blog / nemotron-3-5-lightning
- ollama.com library / nemotron-3.5-lightning
- ollama.com nemotron-3.5-lightning / tags