A finales de junio de 2026, la comunidad de LLM locales en X está protagonizando un cambio de modelo a escala. El desarrollador David Hendrickson (@TeksEdge) publicó una recomendación directa: "Switch your local model right now", señalando Nemotron-Cascade-2-30B-A3B de NVIDIA como sustituto del Qwen3.5-35B-A3B para agentes de código locales. Su argumento: "50 tps w/100K context window", unos 50 tokens por segundo con una ventana de contexto de 100.000 tokens, a memoria comparable.
La respuesta de la comunidad ha sido rápida. Cascade 2 se está convirtiendo en la referencia para quienes ejecutan agentes de código en hardware propio.
Qué es Nemotron Cascade 2
NVIDIA publicó el paper de investigación Nemotron Cascade 2 en marzo de 2026. El nombre completo, Nemotron-Cascade-2-30B-A3B, describe la arquitectura directamente: 30B parámetros totales, A3B = 3.000 millones de parámetros activos por forward pass.
Ahí reside la ventaja de eficiencia. Un modelo denso convencional de 7B utiliza todos sus 7.000 millones de parámetros en cada token. La arquitectura Mixture of Experts (MoE) de Cascade 2 activa solo el 10 % por paso, reduciendo drásticamente la latencia y los requisitos de VRAM, sin renunciar a la calidad representacional de un modelo de 30B.
El nombre "Cascade" hace referencia al método de post-entrenamiento de NVIDIA: un proceso de alineamiento por etapas que, según los investigadores, produce mejoras medibles en razonamiento sobre código, matemáticas e instruction-following que el fine-tuning supervisado estándar no puede igualar.
No confundir con Nemotron 3 Ultra (publicado aquí el 27 de junio): Ultra es el modelo de 550B A55B diseñado para servidores empresariales con cientos de gigabytes de VRAM. Cascade 2 funciona en hardware de oficina.
Por qué la comunidad está cambiando
Según los benchmarks reportados por la comunidad, Nemotron-Cascade-2-30B-A3B supera tanto al Qwen3.5-35B-A3B como al Nemotron-3-Super-120B-A12B (4 veces más grande) en cuatro categorías: matemáticas, razonamiento sobre código, alineamiento e instruction-following.
Un modelo con 3B parámetros activos supera a otro con cuatro veces más parámetros totales en las tareas que importan para los agentes de código. Eso es exactamente lo que la metodología Cascade está diseñada para lograr.
Comparativa del panorama actual de agentes de código local, según mediciones de la comunidad:
| Modelo | Total | Activo | ~tok/s | Contexto |
|---|---|---|---|---|
| Nemotron Cascade 2 | 30B | 3B | ~50 | 100K |
| Qwen3.5-35B-A3B | 35B | 3B | ~35-45 | 32K |
| Qwen3.6 27B MTP | 27B | 27B | ~20-30 | 128K |
| Nemotron 3 Ultra | 550B | 55B | ~8-15 | 1M |
Valores basados en mediciones reportadas por la comunidad. Los resultados reales varían según hardware, nivel de cuantización y longitud del contexto.
La ventana de contexto de 100K tokens merece atención específica: la mayoría de los modelos locales actuales se quedan en 32K, 64K, lo que obliga a fragmentar repositorios completos. Con 100K, un agente puede analizar una base de código entera en una sola sesión.
Requisitos de hardware
Según los informes de la comunidad, para obtener ~50 tok/s se necesita:
- Mac Studio M3 Max (96 GB unificada) o M3 Ultra (192 GB): La plataforma preferida, la memoria unificada elimina los cuellos de botella de VRAM; velocidad sostenida a ~50 tok/s con el modelo cuantizado a 4 bits
- NVIDIA RTX 4090 / RTX 5090 (24 GB VRAM): Los pesos cuantizados Q4KM encajan con margen; velocidad completa reportada a ~50 tok/s
- AMD Radeon RX 9070 XT (16 GB VRAM): Requiere cuantización Q3, Q4; viable para asistencia de código interactiva con pequeñas concesiones de calidad
Con cuantización de 4 bits, los pesos del modelo ocupan aproximadamente 18-22 GB. Los desarrolladores reportan pérdidas de calidad mínimas frente al modelo completo en tareas de código, el caso de uso principal aquí.
Cómo ejecutarlo localmente
El proceso recomendado por la comunidad:
- Descargar pesos GGUF: Disponibles en Hugging Face en múltiples niveles de cuantización (Q4KM, Q5KM, Q8_0), tanto en versiones oficiales de NVIDIA como en conversiones de la comunidad. Elegir según el presupuesto de VRAM disponible.
- Iniciar el servidor de inferencia local: llama.cpp u Ollama soportan GGUF de forma nativa y exponen una API compatible con OpenAI en
http://localhost:11434/v1(Ollama por defecto) - Conectar el plugin del IDE: Continue.dev, Cursor, Tabby y herramientas similares se conectan directamente al endpoint local. Sin token, sin cuenta, sin facturación en la nube.
- Configurar el contexto: Con 100K tokens es posible pasar árboles de directorios completos como contexto. La comunidad recomienda prompts de sistema estructurados que indiquen al modelo qué archivos son relevantes.
Cero datos salen de la infraestructura propia. Cada prompt, cada respuesta, cada línea de código permanece en el hardware local.
RGPD y cumplimiento normativo: la IA local como ventaja
Ejecutar un agente de código localmente en los propios servidores elimina toda la clase de riesgos de transferencia de datos que conlleva integrar APIs en la nube:
- Sin obligaciones de transferencia del Art. 46 RGPD (sin datos saliendo de la UE o de España)
- Sin necesidad de acuerdo de tratamiento de datos con el proveedor del modelo para el procesamiento local
- Trazabilidad completa: cada consulta al agente puede registrarse y conservarse internamente
- Sin retención de datos por parte del proveedor ni uso de entradas para entrenamiento de modelos
Según nuestra interpretación de las obligaciones de los operadores bajo el Reglamento de IA europeo (Art. 26), los despliegues completamente locales de modelos de propósito general reducen significativamente la carga de documentación frente a las integraciones de API en la nube. Esto no constituye asesoramiento jurídico; cada organización debe verificar su clasificación específica bajo el Anexo III.
Para las PYMES europeas que evalúan estrategias de IA local, esta simplicidad de cumplimiento se está convirtiendo en un factor primario, no secundario.
Caso de negocio y financiación
Los asistentes de código en la nube tienen precios que oscilan entre 10 y 30 € por desarrollador y mes. Para un equipo de cinco personas, eso supone 600-1.800 € anuales, sin control sobre qué datos utiliza el proveedor y sin garantía de que el código permanezca en territorio europeo.
Un Mac Studio M3 Max (aproximadamente 3.200-4.200 €) ejecutando Nemotron Cascade 2 localmente alcanza el punto de equilibrio frente a los costes de suscripción en 24-36 meses, según estimaciones de los equipos. Las ventajas en cumplimiento y control de datos no aparecen en ese cálculo, pero son reales.
Kit Digital para PYMES españolas:
La subvención Kit Digital puede financiar la digitalización con IA local a través de la categoría de "Comercio Electrónico" o "Gestión de procesos", según nuestra interpretación de los criterios vigentes. Freshlab puede asesorar sobre qué categorías aplican a cada caso concreto y acompañar en la tramitación. Los importes disponibles varían según el tramo de la empresa (hasta 12.000 € para empresas de 10-49 empleados, según la convocatoria vigente); las condiciones exactas deben verificarse en la web oficial de Acelera Pyme.
Casos de uso prácticos
Donde Nemotron Cascade 2 aporta más valor visible:
- Revisión de código de repositorio completo: 100K de contexto significa que el modelo ve la base de código real, no fragmentos aislados
- Generación de documentación: Referencias de API, comentarios inline y README a calidad de ingeniero senior
- Consultas ERP en lenguaje natural: Generación de SQL local sin intermediario en la nube (→ /local-ai.html)
- Depuración con contexto completo: Análisis de stack traces junto con los archivos fuente relevantes, sin copiar y pegar en herramientas externas
- Generación automática de tests: Tests unitarios e de integración a partir de firmas de funciones existentes, listos para ejecutar
Las empresas que ya utilizan el kAIra Tools de Freshlab pueden configurar Nemotron Cascade 2 como modelo backbone principal para el asistente de código integrado.
Conclusión
Nemotron-Cascade-2-30B-A3B es, a finales de junio de 2026, el modelo de código local más capaz en hardware de consumidor, según los benchmarks de la comunidad. La combinación de ~50 tok/s, contexto de 100.000 tokens y eficiencia MoE supera a alternativas más pesadas en las tareas que importan para el trabajo de ingeniería real.
Si tu equipo está utilizando Qwen3.5-35B u otro modelo comparable como agente de código local, el cambio vale la pena.
Solicitar un proyecto piloto →, Freshlab pone en marcha infraestructura de IA local, incluyendo la integración del agente de código, para PYMES en España y la UE.