NVIDIA Nemotron 3.5 Lightning + NeMo Switchyard senken die Kosten für Agentenaufgaben auf ein Drittel von Opus 4.8

12. August 2026, 06:07

NVIDIA hat am selben Tag ein Modell und einen Router ausgeliefert, und keines davon ist Silizium. Nemotron 3.5 Lightning ist ein 30B Mixture-of-Experts-Modell mit 3B aktiven Parametern, offenen Gewichten, kostenlos zum Download und zur Modifikation. NVIDIA behauptet bis zu 4‑fach schnellere Ausgabe als Modelle seiner Klasse und 30 % schnellere agentische Aufgabenabwicklung, mit frontier‑Level‑Genauigkeit auf PinchBench. Es läuft auf RTX-PCs, Jetson, DGX oder skaliert in die Cloud, und Sie können es nachträglich mit Ihren eigenen Daten trainieren. CrowdStrike, Harvey, CodeRabbit und Fastino Labs haben bereits vertikale Implementierungen für Sicherheit, Recht, Code‑Review und Finanzen.

Der Router ist die eigentliche Geschichte

NeMo Switchyard ist eine Open-Source-Routing-Bibliothek, die jede Anfrage an das passende Modell weiterleitet – offen, proprietär oder das eigene von NVIDIA – ohne Ihren Anwendungscode zu berühren. Gewichte werden über Qualität, Latenz und Kosten abgestimmt. NVIDIAs interner Benchmark setzt die Aufgabenkosten auf etwa ein Drittel im Vergleich zum alleinigen Betrieb von Opus 4.8; Ramp meldet 58 % Einsparungen, Cognition 28 %. Kong und LangChain sind ebenfalls integriert.

So probieren Sie es aus

Gewichte sind auf Hugging Face, ModelScope und OpenRouter verfügbar, plus ein NIM-Mikrodienst auf build.nvidia.com. Switchyard lässt sich als Bibliothek zwischen Ihrer Agentenschleife und Ihren Modell-Anbietern einbinden – der typische Anwendungsfall ist ein Multi-Agent-System, bei dem ein großes Frontier-Modell plant und Lightning die hochvolumigen Teilaufgaben erledigt.

Ein konkretes Kosten-Ziel zu benennen, ist der Teil, den NVIDIA normalerweise nicht übernimmt.