Technische Recherche mit Quellenangaben. Eigene Messungen sind im Artikel gekennzeichnet.

Veröffentlicht: 12. August 2026 Aktualisiert: 15. August 2026

Über den Autor

Recherchierter Modellstand: 12. August 2026 · redaktionell geprüft: 15. August 2026. NVIDIA hat Nemotron 3.5 Lightning am 11. August 2026 veröffentlicht. Offiziell beschreibt NVIDIA das Modell als 30B-Mixture-of-Experts mit 3B aktiven Parametern, einer Hybridarchitektur aus Mamba-2, MoE und ausgewählten Attention-Layern sowie einem Kontextfenster von bis zu einer Million Tokens. Die Veröffentlichung umfasst BF16- und NVFP4-Checkpoints, mehrere Verfahren für spekulatives Decoding sowie Trainingsdaten und -rezepte unter OpenMDW 1.1. [S01][S06][S10]

Die kurze Einordnung lautet: Nemotron 3.5 Lightning ist kein neues Spitzenmodell für maximale allgemeine Intelligenz. Es ist ein sehr schnelles, relativ kleines Ausführungsmodell für Agenten, Tool-Aufrufe, Coding und wiederholte Arbeitsschritte. In der unabhängigen Artificial-Analysis-Auswertung erreicht es einen Intelligence Index von 24 und liegt damit unter Qwen3.6 35B A3B (32) und Muse Glimmer (35). Gleichzeitig wurden auf einem vorab getesteten DeepInfra-NVFP4-Endpunkt fast 670 Output-Tokens/s gemessen. [S15][S16][S17]

Diese Kombination ist der eigentliche Punkt des Modells: nicht „bestes Modell um jeden Preis”, sondern viel Agentenarbeit pro Sekunde und pro Dollar.

Die wichtigsten Fakten zum Nemotron 3.5 Lightning

MerkmalStand 12.08.2026Einordnung
Veröffentlichung11.08.2026offiziell
Modellgröße30B gesamt / 3B aktiv laut NVIDIAUnterschied von NVIDIA nicht erläutert; AA meldet 31,6B / 3,6B
ArchitekturHybrid-MoE: Mamba-2 + MoE + ausgewählte Attention-Layeroffiziell
Kontextbis 1.000.000 Tokensnicht jeder API-Anbieter stellt 1M bereit
Eingabe/AusgabeText → Textkein natives Bild-Input
LizenzOpenMDW 1.1kommerzielle Nutzung laut NVIDIA vorgesehen
Optimierter CheckpointNVFP4für Deployment gedacht
Referenz-CheckpointBF16vor allem für Anpassung/Post-Training
Lokale NVIDIA-Hardwareu. a. RTX 5090, DGX Spark/GB10, H100/H200offizielle Modellkarte
Apple Siliconkeine offizielle NVIDIA-UnterstützungCommunity-GGUF und MLX existieren
OpenRouter Standard262K, $0,05/M Input, $0,20/M Outputprovider-spezifisch
Fireworks262K, $0,05/M Input, $0,01/M Cache, $0,20/M Outputprovider-spezifisch

30B oder 31,6B? Warum verschiedene Zahlen kursieren

Hier gibt es bereits einen kleinen, aber wichtigen Widerspruch. NVIDIA nennt 30 Milliarden Gesamtparameter und 3 Milliarden aktive Parameter. Artificial Analysis führt dagegen 31,6 Milliarden Gesamtparameter und 3,6 Milliarden aktive Parameter; Fireworks listet 32,9 Milliarden Parameter. [S01][S16][S23]

Das ist kein Beleg dafür, dass eine der Quellen „falsch” sein muss. Bei MoE-Modellen können Zählweisen, Rundung und einbezogene Komponenten voneinander abweichen. In den geprüften NVIDIA-Quellen wird der Unterschied aber nicht ausdrücklich erklärt. Deshalb ist die saubere Formulierung:

NVIDIA vermarktet Nemotron 3.5 Lightning als 30B-A3B-Modell. Unabhängige beziehungsweise providerseitige Metadaten nennen höhere exakte Zählwerte.

Für Titel und Modellnamen sollte die offizielle Bezeichnung 30B-A3B verwendet werden.

Hybridarchitektur Nemotron 3.5 Lightning: Mamba-2, MoE und ausgewählte Attention-Layer, 30B gesamt / 3B aktiv, nativ spekulatives Decoding über Multi-Token Prediction (MTP).

Architektur: Warum nur ein Teil des Modells pro Token arbeitet

Nemotron 3.5 Lightning kombiniert drei Bausteine: Mamba-2, Mixture-of-Experts und ausgewählte Attention-Layer. Von den insgesamt rund 30 Milliarden Parametern wird pro Token nur ein deutlich kleinerer Teil aktiviert. [S01]

Das ist für Agentensysteme interessant. Ein autonomer Agent verbringt nicht jeden Schritt mit schwerem strategischem Denken. Er muss häufig Dateien lesen, strukturierte Daten umformen, APIs ansprechen, Ergebnisse überprüfen, kurze Codeänderungen erzeugen oder Subagenten koordinieren. NVIDIA positioniert Lightning genau als diese Ausführungsschicht und schlägt stärkere Modelle für schwierige Planungsschritte vor. NeMo Switchyard soll solche Aufgaben zwischen Modellen routen. [S06][S09]

Zusätzlich enthält Lightning Multi-Token Prediction (MTP). Dabei wird nicht ausschließlich das nächste einzelne Token vorhergesagt. NVIDIA veröffentlicht außerdem DSpark und DFlash als spekulative Decoding-Pfade. Das Ziel ist nicht höhere Modellintelligenz, sondern geringere Latenz beziehungsweise höherer Durchsatz bei geeigneten Serving-Setups. [S01][S04][S05]

Wie gut ist Nemotron 3.5 Lightning bei Benchmarks?

NVIDIAs eigene Release-Benchmarks

Für den NVFP4-Checkpoint veröffentlicht NVIDIA unter anderem folgende Werte: [S01]

BenchmarkNVFP4Was er grob misst
MMLU Pro81,62breites Fachwissen/Reasoning
GPQA Diamond75,57schwierige wissenschaftliche Fragen
HLE, text-only, ohne Tools10,47sehr anspruchsvolle Wissens-/Reasoning-Aufgaben
SciCode31,38wissenschaftliches Coding
SWE-bench Verified52,80reale Software-Issues
SWE-bench Multilingual36,47Software-Aufgaben über mehrere Sprachen
Terminal-Bench 2.123,46Terminal-/Agentenaufgaben
PinchBench83,43agentische Praxisaufgaben
BrowseComp36,81Web-/Rechercheaufgaben
GDPval-AA-V2865professionelle Aufgaben
IFBench loose72,88Instruction Following
AA-LCR49,19Long-Context-Reasoning

Diese Zahlen sollten nicht unkritisch mit Herstellerwerten anderer Modelle zusammengemischt werden. NVIDIA weist selbst darauf hin, dass die Werte mit einem konsistenten eigenen Harness gemessen wurden und von selbstberichteten Werten anderer Anbieter abweichen können. Positiv ist, dass NVIDIA Evaluierungsrezepte veröffentlicht. [S01]

Diagramm: Artificial Analysis Intelligence Index mit Nemotron 3.5 Lightning bei 24, Qwen3.6 35B A3B bei 32 und Muse Glimmer bei 35; Geschwindigkeit des getesteten DeepInfra-NVFP4-Endpunkts bei rund 670 Output-Tokens pro Sekunde.

Unabhängige Einordnung von Artificial Analysis

Artificial Analysis gibt Nemotron 3.5 Lightning aktuell einen Intelligence Index von 24. Damit liegt es nach dieser Metrik hinter anderen kleinen offenen Modellen wie Qwen3.6 35B A3B mit 32 und Muse Glimmer mit 35. [S15][S16]

Der Intelligence Index und der Durchsatz messen unterschiedliche Eigenschaften: Der Index ordnet Nemotron hinter Qwen3.6 35B A3B und Muse Glimmer ein; auf einem vor dem Release getesteten DeepInfra-NVFP4-Endpunkt mit den finalen NVFP4-Gewichten wurden dagegen nahezu 670 Output-Tokens pro Sekunde gemessen. Auf der späteren Providerseite lagen zum Abrufzeitpunkt 662,9 t/s für DeepInfra, 522,8 t/s für Fireworks und 256,6 t/s für Nebius. [S15][S17]

Diese Zahlen sind keine lokale GPU-Geschwindigkeit. Sie gelten für konkrete Cloud-Endpunkte und ändern sich mit Batch-Größe, Hardware, Last, Prompt-Länge und Serving-Konfiguration. Sie zeigen aber, worauf NVIDIA optimiert: sehr hohen Durchsatz.

Ist es besser als Qwen3.6 oder Muse Glimmer?

Wenn „besser” allgemeine Problemlösungsleistung meint, lautet die Antwort nach dem derzeit besten unabhängigen Vergleich: eher nein. Artificial Analysis bewertet Qwen3.6 35B A3B und Muse Glimmer deutlich höher in der allgemeinen Intelligence-Metrik. [S15]

Wenn „besser” dagegen schnelle, häufige Agentenschritte bedeutet, kann Nemotron 3.5 Lightning die interessantere Wahl sein. Die Kombination aus 3B aktivem Arbeitsumfang, spekulativem Decoding und NVFP4 ist gezielt auf Durchsatz ausgelegt. Dafür sollte man das Modell aber in einem eigenen Agenten-Harness mit den realen Aufgaben testen statt eine einzelne Benchmarkzahl zu übertragen.

Kontextfenster: 1 Million Tokens – aber nicht überall

NVIDIA gibt ein maximales Kontextfenster von bis zu 1.000.000 Tokens an. [S01][S02]

Das bedeutet nicht, dass jeder Anbieter oder jede lokale Runtime automatisch eine Million Tokens bereitstellt. Am 12. August 2026 zeigt OpenRouter für den normalen kostenpflichtigen nvidia/nemotron-3.5-lightning-Endpunkt 262K Kontext; der kostenlose NVIDIA-Pfad wird dort mit 1M ausgewiesen. Fireworks nennt ebenfalls 262K. [S21][S22][S23]

Drei Kontextstapel: Modellmaximum 1.000.000 Tokens, OpenRouter Standard 262K, Fireworks Serverless 262K. Das Maximum ist eine Modelleigenschaft, nicht überall ausgeliefert.

Das ist ein wichtiger Unterschied zwischen:

  1. Modellmaximum – was die Architektur beziehungsweise der offizielle Checkpoint unterstützt.
  2. Serving-Limit – was ein Anbieter in seinem Produkt freigibt.
  3. praktisch nutzbarem Kontext – was Speicher, Latenz und Qualität in deinem konkreten Workflow sinnvoll machen.

Bei lokaler Nutzung kann ein theoretisch unterstütztes 1M-Fenster weit außerhalb dessen liegen, was auf einem gegebenen Rechner sinnvoll ist.

Lokale Nutzung auf NVIDIA-Hardware

Für den NVFP4-Checkpoint listet NVIDIA unter anderem GeForce RTX 5090, DGX Spark/GB10, H100 und H200. Außerdem nennt die Modellkarte Ampere über W4A16. Als konkrete Single-GPU-Beispiele stehen DGX Spark und H100 in der Karte. [S01]

Für BF16 nennt NVIDIA H100/A100-80GB als Single-GPU-Beispiele; die Karte weist darauf hin, dass bei einem einzelnen H100 in der gezeigten Konfiguration 256K statt des theoretischen 1M-Kontexts verwendet wird. [S02]

Deshalb ist die Schlagzeile „läuft auf einer einzelnen GPU” leicht missverständlich. Sie bedeutet nicht, dass das Modell offiziell für jede normale Notebook-GPU oder beliebige ältere GeForce freigegeben ist. Ein Artikel, der daraus „typischer Laptop” macht, überdehnt die Primärquelle. [S06]

Läuft Nemotron 3.5 Lightning auf dem Mac?

Ja, über Community-Runtimes – aber derzeit nicht über einen offiziellen NVIDIA-Mac-Pfad.

Bereits einen Tag nach Release stehen mehrere Konvertierungen bereit:

  • ggml-org/...-GGUF dokumentiert den Start mit llama.cpp und brew install llama.cpp. [S24]
  • Bartowskis GGUF-Repository nennt für Q4_K_M 25,48 GB; Q5_K_M liegt bei 26,96 GB und Q8_0 bei 35,00 GB. [S25]
  • mlx-community/...-8bit ist eine MLX-Konvertierung für Apple Silicon mit 33,6 GB Dateigröße. [S27]
  • Vontra stellt eine weitere MLX/oMLX-Quantisierung bereit. [S28]

Ein einfacher GGUF-Start ist beispielsweise:

brew install llama.cpp
llama serve -hf ggml-org/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF:Q4_K_M

Quelle des Befehls: [S24].

Für MLX dokumentiert die Community unter anderem:

uv tool install mlx-lm
mlx_lm.server --model "mlx-community/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-8bit"

Quelle: [S27].

Wie viel Unified Memory braucht man?

Die 25,48 GB des Q4_K_M-Files sind eine Untergrenze für die Gewichte auf dem Datenträger, keine garantierte RAM-Anforderung. Zur Laufzeit kommen unter anderem Runtime-Overhead, Zustände, Kontextdaten und sonstige Puffer hinzu. [S25]

Daraus folgt als Einschätzung auf Basis der Modellarchitektur, nicht als gemessener NVIDIA-Wert:

  • 24 GB Unified Memory: Q4_K_M ist bereits größer als der physische Speicher; ein sinnvoller vollresidenter Betrieb ist daher nicht zu erwarten.
  • 32 GB: Q4_K_M ist größenmäßig grundsätzlich näher am Machbaren, aber der verbleibende Spielraum ist klein. Große Kontexte sind besonders problematisch.
  • 48 GB oder 64 GB: deutlich plausibler für Q4/Q5 und realistische Kontextpuffer.
  • 64 GB+: sinnvoller Ausgangspunkt für 8-bit-Varianten um 33,6 GB, wenn zusätzlich Kontext und andere Prozesse Platz benötigen.

Diese Einschätzung muss durch reale Messungen ergänzt werden. Zum Prüfzeitpunkt gibt es noch keine ausreichend belastbare, reproduzierbare Mac-Matrix mit Tokens/s, Energieverbrauch und maximal stabilem Kontext, die hier seriös als Fakt übernommen werden könnte.

API-Preise: auffällig günstig, aber providerabhängig

OpenRouter listet den Standardendpunkt am 12. August 2026 mit:

  • $0,05 pro 1 Mio. Input-Tokens
  • $0,20 pro 1 Mio. Output-Tokens
  • 262K Kontext [S21]

Fireworks nennt:

  • $0,05 pro 1 Mio. Input-Tokens
  • $0,01 pro 1 Mio. gecachte Input-Tokens
  • $0,20 pro 1 Mio. Output-Tokens
  • 262K Kontext [S23]

Beispielkosten bei Fireworks

Eigene Rechnung ohne Steuern und ohne sonstige Plattformkosten:

SzenarioInputOutputRechnungKosten
klein2M0,5M2×$0,05 + 0,5×$0,20$0,20
mittel25M5M25×$0,05 + 5×$0,20$2,25
intensiv250M50M250×$0,05 + 50×$0,20$22,50
intensiv, 80 % des Inputs gecacht250M50M50×$0,05 + 200×$0,01 + 50×$0,20$14,50

Im letzten Beispiel reduziert Caching die modellbezogenen Tokenkosten rechnerisch um rund 35,6 % gegenüber komplett ungecachetem Input. Ob ein Agent tatsächlich 80 % Cache-Hits erreicht, ist workflowabhängig.

Artificial Analysis weist außerdem auf eine hohe Verbosität in seinem Intelligence-Test hin. Ein niedriger Preis pro Output-Token garantiert also nicht automatisch niedrige Kosten pro erledigter Aufgabe. [S16]

Welche Version sollte man herunterladen?

NVFP4 — Nimm den offiziellen NVFP4-Checkpoint, wenn du auf unterstützter NVIDIA-Hardware möglichst effizient inferieren willst. NVIDIA richtet diesen Pfad ausdrücklich auf Deployment aus. [S01]

BF16 — Nimm BF16, wenn du post-trainen, feinabstimmen, eigene Quantisierungen erzeugen oder mit den Referenzgewichten arbeiten willst. NVIDIA bezeichnet BF16 ausdrücklich als den Anpassungs-/Referenzpfad und verweist für optimierte Inferenz auf NVFP4. [S02]

GGUF — Nimm GGUF, wenn du llama.cpp, LM Studio, Ollama oder einen plattformübergreifenden lokalen Stack nutzen willst. Die derzeitigen GGUFs sind Community-Konvertierungen, nicht offizielle NVIDIA-Mac-Builds. [S24][S25][S26]

MLX — Nimm MLX, wenn Apple Silicon dein Ziel ist und du eine native MLX-Laufzeit bevorzugst. Der Pfad ist aktuell besonders frisch; deshalb sollten Funktion Calling, lange Kontexte, Thinking-Template und MTP-Unterstützung vor produktivem Einsatz mit eigenen Tests geprüft werden. [S27][S28]

Deployment-Pfade im Überblick

Die folgende Übersicht trennt offizielle NVIDIA-Pfade, Apple-Silicon-Pfade und Cloud-Routen.

Vergleich Deployment-Pfade: NVIDIA offiziell für NVFP4 und BF16, Apple Silicon mit GGUF und MLX als Community-Pfaden, Cloud-API mit OpenRouter und Fireworks mit 262K-Kontext.

Wofür ist Lightning besonders interessant?

Das Modell passt am besten zu Workloads, bei denen dieselben Agenten viele relativ klar umrissene Aufgaben wiederholen:

  • Datei- und Log-Auswertung
  • Tool-Aufrufe und strukturierte API-Schritte
  • Code-Änderungen und Tests
  • RAG-Nachbearbeitung
  • Subagenten
  • Datenumformung
  • Validierungsschritte
  • lokale/private Assistenten mit überschaubarem Hardwarebudget

Für hochkomplexe Planung, schwierige Wissenschaftsfragen oder Aufgaben, bei denen maximale allgemeine Intelligenz wichtiger ist als Durchsatz, sprechen die derzeitigen unabhängigen Daten eher dafür, ein stärkeres Modell als Planner einzusetzen und Lightning als Worker zu nutzen. [S15]

Das deckt sich mit NVIDIAs Switchyard-Idee: nicht ein Modell für alles, sondern Routing zwischen einem starken Planer und einem schnellen Ausführungsmodell. [S06][S09]

Grenzen, die man vor dem Einsatz kennen sollte

Erstens: Das Modell ist text-only. [S16]

Zweitens: Eine Million Tokens sind ein Maximalwert, keine Garantie jedes Providers oder jeder lokalen Runtime. [S01][S21][S23]

Drittens: Die auffällig hohen NVIDIA-Benchmarkwerte sind Herstellerwerte. NVIDIA veröffentlicht zwar Harness-Informationen, doch saubere modellübergreifende Vergleiche brauchen dieselben Testbedingungen. [S01]

Viertens: Der Mac-Support ist derzeit Community-getrieben. Dass ein GGUF oder MLX-Checkpoint startet, beweist noch nicht, dass alle Spezialfunktionen und sehr langen Kontexte optimal funktionieren. [S24][S27]

Fünftens: Open-weight und permissiv lizenziert bedeutet nicht automatisch, dass jede konkrete Nutzung ohne weitere Datenschutz-, Compliance- oder Sicherheitsprüfung erfolgen sollte. Die Lizenz und die Datenverarbeitung des gewählten API-Anbieters sind getrennte Ebenen. [S12][S21]

Fazit: Rolle und Grenzen des Modells

Nemotron 3.5 Lightning ist am interessantesten, wenn Durchsatz, lokale Kontrolle, günstige Tokenpreise und Agentenarbeit wichtiger sind als die absolut höchste Reasoning-Leistung.

Die bislang stärkste unabhängige Evidenz zeigt genau diesen Trade-off: Intelligence Index 24 – also klar unter Qwen3.6 35B A3B und Muse Glimmer – aber außergewöhnlich hohe Serving-Geschwindigkeit auf dem getesteten NVFP4-Endpunkt. [S15]

Für lokale Nutzer ist die Veröffentlichung ebenfalls relevant. NVIDIA unterstützt offiziell ausgewählte NVIDIA-Hardware; gleichzeitig sind GGUF-, Ollama- und MLX-Pfade bereits verfügbar. Für Apple Silicon sollte man aktuell allerdings noch keine erfundenen Tokens/s oder 1M-Kontext-Versprechen übernehmen. Der nächste sinnvolle Schritt ist ein reproduzierbarer Mac-Benchmark auf identischer Hardware mit Q4_K_M und MLX, inklusive RAM, Prefill, Generation, Energieverbrauch, Function Calling und langem Kontext.

Häufig gestellte Fragen

Was ist NVIDIA Nemotron 3.5 Lightning?

Ein offenes 30B-Mixture-of-Experts-Modell mit 3B aktiven Parametern, Hybridarchitektur aus Mamba-2, MoE und ausgewählten Attention-Layern, bis zu 1.000.000 Tokens Kontext, veröffentlicht unter OpenMDW 1.1 am 11. August 2026.

30B oder 31,6B Parameter? Warum gibt es unterschiedliche Zahlen?

NVIDIA vermarktet das Modell als 30B-A3B. Unabhängige beziehungsweise providerseitige Metadaten nennen 31,6B/3,6B (Artificial Analysis) oder 32,9B (Fireworks). NVIDIA erläutert die Differenz nicht ausdrücklich; bei MoE-Modellen können Zählweisen und Rundungen voneinander abweichen.

Wie schlägt sich Nemotron 3.5 Lightning in unabhängigen Benchmarks?

Artificial Analysis bewertet das Modell aktuell mit einem Intelligence Index von 24 und liegt damit unter Qwen3.6 35B A3B (32) und Muse Glimmer (35). Die herausragende Stärke ist nicht die allgemeine Intelligenz, sondern die Serving-Geschwindigkeit auf optimierten NVFP4-Endpunkten.

Was kostet die API?

OpenRouter listet 0,05 US-Dollar pro 1M Input-Token und 0,20 US-Dollar pro 1M Output-Token. Fireworks nennt zusätzlich 0,01 US-Dollar pro 1M gecachte Input-Token. Preise und Kontextlimits sind provider-spezifisch und können sich ändern.

Bedeutet 1M Kontext, dass jeder Anbieter 1M Tokens liefert?

Nein. Das 1M-Fenster ist das Modellmaximum. OpenRouter Standard und Fireworks zeigen aktuell 262K. Nur der kostenlose NVIDIA-Pfad bei OpenRouter listet 1M. Die Kontextgröße, die du nutzen kannst, hängt von Provider-Limit, Speicher und Latenzbudget ab.

Läuft Nemotron 3.5 Lightning auf Apple Silicon?

Es gibt keinen offiziellen NVIDIA-Mac-Pfad. Bereits am ersten Tag nach Release existieren Community-Konvertierungen: GGUF Q4_K_M mit 25,48 GB, MLX 8-bit mit 33,6 GB und weitere MLX/oQ6-Varianten. Belastbare Tokens-pro-Sekunde-Werte über M-Series-Chips fehlen bisher.

Welcher Checkpoint ist wofür gedacht?

NVFP4 ist NVIDIAs optimierter Inferenzpfad auf unterstützter Hardware. BF16 ist der Referenz- und Anpassungspfad, etwa für Post-Training. llama.cpp/GGUF und MLX sind Community-Pfade für lokale Runtimes. Ollama verpackt eigene Quantisierungen.

Wofür ist Lightning besonders gut geeignet?

Für hochvolumige Agentenschritte: Tool-Aufrufe, Code- und Test-Iterationen, RAG-Nachbearbeitung, Subagenten, Datei- und Log-Auswertung. Für schwierige Planung oder maximale allgemeine Intelligenz ist ein stärkeres Modell als Planner plus Lightning als Worker die bessere Architektur.

Transparenz

Quellen und Prüfgrundlage

31

Diese Primär- und Referenzquellen bilden die Grundlage der technischen Einordnung. Herstellerangaben und externe Benchmarks werden im Artikel als solche gekennzeichnet.

  1. huggingface.co nvidia / NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4
  2. huggingface.co nvidia / NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16
  3. huggingface.co nvidia / NVIDIA-Nemotron-3.5-Lightning-30B-A3B-Base-BF16
  4. huggingface.co nvidia / NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark
  5. huggingface.co nvidia / NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash
  6. developer.nvidia.com blog / nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents
  7. blogs.nvidia.com blog / nemotron-lightning-switchyard-rtx-dgx
  8. blogs.nvidia.com blog / local-ai-open-source-models-agents-nemotron
  9. developer.nvidia.com ai / nemotron
  10. github.com lightning35 / README.md
  11. github.com Megatron-Bridge / releases
  12. github.com OpenMDW / openmdw
  13. openmdw.ai openmdw.ai
  14. linuxfoundation.org press / linux-foundation-releases-openmdw-1.1-nvidia-adopts-openmdw-for-cosmos-isaac-gr00t-ising-and-nemotron-ai-model-families
  15. artificialanalysis.ai articles / nemotron-3-5-lightning-launch
  16. artificialanalysis.ai models / nemotron-3-5-lightning
  17. artificialanalysis.ai nemotron-3-5-lightning / providers
  18. pinchbench.com pinchbench.com
  19. github.com pinchbench / skill
  20. github.com pinchbench
  21. openrouter.ai nvidia / nemotron-3.5-lightning
  22. openrouter.ai nvidia
  23. fireworks.ai fireworks / nemotron-lightning-3p5-30b-a3b
  24. huggingface.co ggml-org / NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF
  25. huggingface.co bartowski / NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF
  26. huggingface.co lmstudio-community / NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF
  27. huggingface.co mlx-community / NVIDIA-Nemotron-3.5-Lightning-30B-A3B-8bit
  28. huggingface.co Vontra / NVIDIA-Nemotron-3.5-Lightning-30B-A3B-oQ6
  29. ollama.com blog / nemotron-3-5-lightning
  30. ollama.com library / nemotron-3.5-lightning
  31. ollama.com nemotron-3.5-lightning / tags