KI-Buch für Kinder KI-Buch für Jugendliche KI-Buch für Familien Neue Reihe Kennen Sie schon unsere Buchreihe? KI für Kinder, Jugendliche und Erwachsene Bücher entdecken

Nemotron Cascade 2: Lokaler 30B-Coding-Agent mit 50 tok/s

local-llm coding-agent nvidia

Ende Juni 2026 geht ein Ruck durch die Community der lokalen LLM-Nutzer. Auf X häufen sich Beiträge wie jener von Entwickler David Hendrickson (@TeksEdge), der mit den Worten "Switch your local model right now" empfiehlt, von Qwen3.5-35B-A3B auf NVIDIAs Nemotron-Cascade-2-30B-A3B zu wechseln. Sein Argument: "50 tps w/100K context window", rund 50 Tokens pro Sekunde bei einem Kontextfenster von 100.000 Tokens. Die Reaktion der Community bestätigt: Cascade 2 ist zum Referenzmodell für lokale Coding-Agenten geworden.

Für Freshlab war das der Anlass, das Modell genauer einzuordnen, und zu erklären, was es für KMU bedeutet, die lokale KI produktiv einsetzen wollen.

Was ist Nemotron Cascade 2?

Nemotron-Cascade-2-30B-A3B ist ein Mixture-of-Experts-Modell (MoE) von NVIDIA, das im März 2026 als Forschungsarbeit vorgestellt wurde. Das Namensschema ist direkt lesbar: 30B Gesamtparameter, A3B = 3 Milliarden aktiv pro Token-Forward-Pass.

Das ist der entscheidende Effizienz-Vorteil gegenüber Dense-Modellen. Während ein klassisches 7B-Modell bei jeder Anfrage alle 7 Milliarden Parameter nutzt, aktiviert Cascade 2 nur rund 10 Prozent, was sowohl Latenz als auch VRAM-Anforderungen drastisch reduziert. Gleichzeitig steht dem Modell das volle Wissen aller 30 Milliarden Parameter zur Verfügung, auch wenn pro Schritt nur ein Bruchteil davon zum Einsatz kommt.

Der Begriff „Cascade" beschreibt NVIDIAs Post-Training-Methode. Anstatt klassischem Supervised Fine-Tuning setzt NVIDIA auf ein kaskadiertes Ausrichtungsverfahren, das laut den Forschern zu substanziellen Qualitätszuwächsen bei Mathematik, Code-Reasoning und Instruction-Following führt.

Wichtige Abgrenzung: Nemotron Cascade 2 ist nicht zu verwechseln mit dem Anfang dieser Woche besprochenen Nemotron 3 Ultra (550B A55B). Ultra ist ein Enterprise-Modell für Server mit hunderten Gigabyte VRAM und richtet sich an Betreiber mit dedizierter KI-Infrastruktur. Cascade 2 ist explizit für Consumer- und Semi-Pro-Hardware konzipiert.

Technische Eckdaten im Vergleich

Modell Total Aktiv ~tok/s Kontext
Nemotron Cascade 2 30B 3B ~50 100K
Qwen3.5-35B-A3B 35B 3B ~35-45 32K
Qwen3.6 27B MTP 27B 27B ~20-30 128K
Nemotron 3 Ultra 550B 55B ~8-15 1M

Alle Werte basieren auf Community-Messungen. Konkrete Ergebnisse variieren je nach Hardware, Quantisierung und Prompt-Länge.

Cascade 2 gewinnt den Sweet Spot: schneller als schwerere MoE-Modelle, qualitativ besser als kleinere Dense-Alternativen, und mit 100K Tokens ausreichend Kontext für reale Arbeit an komplexen Codebasen. Laut Community-Benchmarks übertrifft es sowohl Qwen3.5-35B-A3B als auch das deutlich größere Nemotron-3-Super-120B-A12B in den Kategorien Mathematik, Code-Reasoning, Alignment und Instruction-Following.

Hardware-Anforderungen für lokalen Betrieb

Für ~50 tok/s benötigt man nach Entwickler-Angaben:

  • Mac Studio M3 Max (96 GB) oder M3 Ultra (192 GB): Unified Memory eliminiert VRAM-Engpässe; empfohlene Plattform für dauerhaften lokalen Betrieb
  • NVIDIA RTX 4090 / 5090 (24 GB VRAM): Gequantisiertes Modell (4-Bit GGUF, ~18-22 GB) läuft auf Vollgeschwindigkeit
  • AMD Radeon RX 9070 XT (16 GB): Für niedrigere Quantisierungsstufen (Q3, Q4) nutzbar mit leichten Qualitätsabstrichen

Mit 4-Bit-Quantisierung (Q4KM) sinkt der tatsächliche Speicherbedarf auf unter 22 GB. Nach Berichten aus der Entwickler-Community sind Qualitätseinbußen gegenüber dem vollen Modell bei Code-Aufgaben minimal, bei nahezu unveränderter Inferenzgeschwindigkeit.

Setup: Lokal starten ohne Cloud-Abhängigkeit

Die empfohlene Methode der Community:

  1. Modellgewichte laden: GGUF-Dateien des Nemotron-Cascade-2-30B in der gewünschten Quantisierungsstufe von Hugging Face herunterladen (offizielle und Community-konvertierte Varianten verfügbar)
  2. Inference-Framework starten: llama.cpp oder Ollama, beide unterstützen GGUF-Modelle nativ und stellen einen OpenAI-kompatiblen API-Endpunkt bereit
  3. IDE-Plugin anbinden: Über http://localhost:11434/v1 (Ollama) oder den lokalen llama.cpp-Endpunkt verbinden, kompatibel mit Continue.dev, Cursor, Tabby und anderen Coding-Plugins
  4. Kontextfenster konfigurieren: Bei 100K Tokens können ganze Repository-Verzeichnisse übergeben werden; für optimale Leistung empfiehlt die Community, den Kontext gezielt zu strukturieren

Kein API-Key. Kein Abo. Kein einziger Byte Code verlässt den eigenen Rechner.

DSGVO-Konformität: Lokaler Betrieb als Compliance-Vorteil

Ein lokaler Coding-Agent auf Basis von Cascade 2 sendet per Konstruktion keine Daten nach außen. Das unterscheidet sich strukturell von Cloud-basierten Alternativen:

  • Quellcode bleibt intern: Prompts, Kontextdateien und Antworten verlassen nie die eigene Infrastruktur
  • Kein US-Datentransfer: Keine Anwendbarkeit von Art. 44 ff. DSGVO, keine Drittland-Risiken
  • Vollständiges Logging: Jede KI-Anfrage bleibt intern dokumentierbar und nachvollziehbar
  • Keine Auftragsdatenverarbeitung: Bei rein lokaler Verarbeitung entfällt die Notwendigkeit eines AVV mit dem Modell-Anbieter

Gemäß unserer Einschätzung vereinfacht der vollständig lokale Betrieb eines LLM die DSGVO-konforme Gestaltung erheblich. Individuelle Rechtsberatung bleibt je nach Branche und Anwendungsfall empfehlenswert. Mehr zu Datensouveränität mit lokaler KI: /data-sovereignty.html.

Wirtschaftlichkeit und Fördermöglichkeiten

Cloud-Coding-Assistenten kosten nach Marktlage 10-30 € pro Entwickler und Monat. Bei einem Team von fünf Personen sind das 600-1.800 € jährlich, ohne Schutz sensibler Codebasen. Ein Mac Studio M3 Max (ca. 3.200-4.200 €) amortisiert sich nach Einschätzung vieler Teams innerhalb von 24-36 Monaten, dazu mit voller Datenkontrolle.

Fördermöglichkeiten für KMU in Deutschland:

  • KfW-Digitalisierungskredite: Finanzierung von IT-Infrastruktur für digitale Transformation, günstige Zinsen für KMU
  • Regionale Förderprogramme: Viele Bundesländer haben eigene Digitalisierungszuschüsse für KMU
  • Freshlab unterstützt bei der Identifikation passender Förderprogramme und dem Förderantrag

Praxiseinsatz: Wann Cascade 2 den größten Unterschied macht

Das 100K-Kontextfenster und die Coding-optimierten Benchmarks machen Cascade 2 besonders stark in:

  • Repository-weite Code-Reviews: Gesamte Codebasen analysieren, statt isolierte Snippets zu übergeben
  • Automatische Dokumentation: API-Docs, README-Files und Inline-Kommentare in der Qualität eines Senior-Entwicklers
  • Datenbankabfragen aus natürlicher Sprache: SQL-Generierung für ERP-Systeme ohne Cloud-Zwischenschicht (→ /local-ai.html)
  • Debugging mit vollem Kontext: Stack-Trace-Analyse in Verbindung mit dem betroffenen Code, kein Copy-Paste in externe Tools mehr
  • Automatisierte Testgenerierung: Unit-Tests und Integrationstests auf Basis vorhandener Funktionen

Für Unternehmen, die das kAIra Tools von Freshlab einsetzen, lässt sich Cascade 2 als primäres Backbone-Modell für den integrierten Coding-Assistenten konfigurieren.

Fazit

Nemotron-Cascade-2-30B-A3B ist im Juni 2026 eines der leistungsfähigsten lokalen Coding-Modelle auf Consumer-Hardware. Die Kombination aus ~50 tok/s, 100.000-Token-Kontext und MoE-Effizienz übertrifft größere Alternativen, und das auf Hardware, die KMU realistisch betreiben können.

Wer bisher auf Qwen3.5-35B oder ähnliche Modelle gesetzt hat, sollte den Wechsel in Betracht ziehen. Die Community hat ihn bereits vollzogen.

Jetzt Pilotprojekt anfragen →, Freshlab richtet lokale KI-Infrastruktur inkl. Coding-Agent für Ihr Team ein.