El 4 de junio de 2026, en la feria Computex, NVIDIA lanzó un modelo que reordena el panorama de los modelos de lenguaje de código abierto: Nemotron 3 Ultra. Con 550.000 millones de parámetros totales en una arquitectura Mixture-of-Experts (MoE), activando solo alrededor del 10 % de ellos por solicitud, unos 55.000 millones de parámetros activos, , y con pesos, datos de entrenamiento y recetas de entrenamiento completamente abiertos, el modelo marca un punto de inflexión.
Según mediciones reportadas por Artificial Analysis, Nemotron 3 Ultra obtiene el mayor índice de inteligencia entre todos los modelos open-weight desarrollados en Estados Unidos (47,7 en el Intelligence Index de Artificial Analysis). Para las pymes europeas que evalúan una estrategia de IA local, el mensaje es claro: calidad de nivel frontier, desplegable completamente en sus propias instalaciones, sin que ningún dato salga de su red.
Arquitectura diseñada para agentes de larga duración
Nemotron 3 Ultra no es simplemente un transformer escalado. Combina dos innovaciones arquitectónicas relevantes para cargas de trabajo de agentes:
Arquitectura híbrida Mamba2-Transformer LatentMoE: Las capas de estado selectivo (de la familia Mamba2) gestionan secuencias muy largas sin el coste cuadrático de memoria de la atención pura. Las capas transformer gestionan el razonamiento complejo. Esta combinación mantiene alto el rendimiento incluso con contextos muy extensos.
Predicción multi-token (MTP): En lugar de generar un token a la vez, el modelo predice varios tokens de salida por paso de decodificación. Para agentes que necesitan producir largas cadenas de razonamiento o estructuras de datos extendidas, esto reduce significativamente el tiempo de generación.
El resultado, según mediciones reportadas por la comunidad y por Artificial Analysis: más de 300 tokens por segundo en configuraciones estándar, superando los 400 tokens de salida por segundo en configuraciones optimizadas sobre hardware NVIDIA. Estas cifras son especialmente relevantes para agentes que encadenan muchos pasos y acumulan salidas largas.
Un millón de tokens de contexto
Nemotron 3 Ultra admite una ventana de contexto de hasta 1 millón de tokens. En la práctica, esto significa que un agente puede ingerir una base de conocimiento empresarial completa, un archivo de contratos, o meses de correos electrónicos en una sola llamada, sin necesidad de fragmentar manualmente los documentos.
Esto es especialmente relevante para sectores intensivos en documentación: asesorías jurídicas, despachos contables y fiscales, documentación de fabricación, expedientes sanitarios. Una ventana de 1 millón de tokens cambia la arquitectura de los pipelines de RAG: en lugar de recuperar fragmentos, es posible cargar dominios completos en el contexto del modelo.
Despliegue on-premise: tres caminos
NVIDIA publicó Nemotron 3 Ultra en Hugging Face y soporta tres rutas principales de despliegue:
- vLLM: El servidor de inferencia de código abierto más adoptado para producción. API compatible con OpenAI, escalado horizontal y soporte sólido de GPU NVIDIA desde H100. Las aplicaciones que usan la API de OpenAI pueden cambiar a un endpoint local de Nemotron 3 Ultra sin modificar el código.
- TensorRT-LLM: La biblioteca de inferencia optimizada de NVIDIA, que maximiza el rendimiento en hardware H200 y B200. Recomendada cuando el throughput es la restricción principal.
- Hugging Face Transformers: La opción de entrada más sencilla para desarrollo, prototipado y entornos sin infraestructura de inferencia dedicada.
El modelo fue preentrenado en formato NVFP4, el formato de punto flotante de 4 bits de NVIDIA, , que reduce el tamaño de los pesos del modelo manteniendo la calidad en hardware nativo de NVIDIA.
Soberanía de datos: el argumento central para las pymes
El caso del despliegue local sigue siendo consistente: las solicitudes nunca abandonan su infraestructura. Con Nemotron 3 Ultra corriendo localmente, ninguna consulta de empleado, ningún contenido de documento, ninguna lógica de negocio llega a un proveedor de API externo.
Esto importa en todos los sectores regulados de Europa. Según nuestra interpretación del artículo 32 del RGPD, procesar datos personales sensibles, información de empleados, expedientes de clientes, registros financieros, a través de una API en la nube crea una obligación de transferencia de datos y un perfil de riesgo que el despliegue local elimina. Lo mismo aplica a secretos comerciales y procesos propietarios que las empresas razonablemente quieren mantener fuera de infraestructuras de terceros.
Para las pymes españolas que financian su infraestructura de IA local mediante el Kit Digital, esta arquitectura encaja directamente en las categorías de «Gestión de procesos» y «Comercio electrónico e inteligencia artificial» de la convocatoria. Según nuestra interpretación del programa, las soluciones de IA local desplegadas on-premise son elegibles en la medida en que mejoran procesos de negocio internos. Le recomendamos verificar la elegibilidad de su caso concreto con su gestor de Kit Digital. Más detalles en nuestra página de Kit Digital.
¿Qué hardware necesita realmente?
Valoración honesta: Nemotron 3 Ultra no es un modelo para GPU de consumo ni para Apple Silicon. La arquitectura MoE de 550B, incluso en formato NVFP4, requiere varias GPU NVIDIA con VRAM elevado. Un mínimo práctico para inferencia fluida son dos o cuatro GPU NVIDIA H100, o un sistema NVIDIA DGX dedicado.
Dicho esto, existen puntos de entrada realistas para las pymes europeas:
- Servidores GPU alquilados en centros de datos de la UE: Acceso facturado por horas a hardware H100 o B200, ubicado físicamente en España, Alemania, Francia o los Países Bajos. Mantiene los datos dentro de la jurisdicción de la UE sin inversión de capital.
- Capacidad de workstation NVIDIA existente: Las organizaciones que ya operan hardware NVIDIA de alto rendimiento para renderizado, simulación o CAD pueden reutilizar el tiempo de GPU disponible.
- NVIDIA DGX Spark: El sistema compacto GB10 lanzado en 2026 ofrece 128 GB de memoria unificada. Si las variantes más pequeñas de Nemotron 3 se ajustan a esa configuración es algo que estamos evaluando activamente en proyectos piloto.
Para configuraciones basadas en Mac Studio, que siguen siendo excelentes para modelos de hasta aproximadamente 70B, Llama 4, Qwen3 y Gemma 4 siguen siendo las opciones correctas. Nemotron 3 Ultra es el siguiente paso natural cuando los requisitos de calidad de razonamiento y throughput de agentes superan lo que Apple Silicon gestiona actualmente.
Posición en el ecosistema open-weight de 2026
En junio de 2026, los modelos open-weight más potentes provenían principalmente de laboratorios de IA chinos: DeepSeek V4 Pro (abril 2026, 1,6 billones de parámetros, licencia MIT), MiniMax M3 (contexto de 1 millón de tokens, visión nativa), Kimi K2.7 (orientado a código). Nemotron 3 Ultra es el primer modelo desarrollado en Estados Unidos que alcanza su nivel en el Artificial Analysis Intelligence Index, según mediciones reportadas.
Para las organizaciones europeas sujetas a consideraciones de riesgo en la cadena de suministro, la distinción importa. Un modelo completamente abierto de un proveedor estadounidense opera bajo controles de exportación y condiciones de licencia diferentes a los modelos de laboratorios chinos. Ninguno es automáticamente preferible, pero la elección debe ser explícita y documentada, especialmente para organizaciones que se preparan para el cumplimiento de la Ley de IA de la UE.
Desde nuestra perspectiva de asesoramiento, la clave no es elegir el modelo "más grande", sino el modelo que mejor equilibra calidad de razonamiento, velocidad de inferencia, requisitos de hardware y marco legal para el caso de uso específico.
Próximos pasos para su empresa
Si su organización está planificando despliegues de agentes de IA, automatización del análisis de documentos, enrutamiento inteligente de flujos de trabajo, consultas ERP en lenguaje natural, , Nemotron 3 Ultra merece un lugar en su evaluación de infraestructura. Las preguntas clave para responder en un piloto:
- Requisito de throughput: ¿Cuántos usuarios concurrentes o tareas automatizadas llegarán simultáneamente al modelo?
- Profundidad de contexto: ¿Sus casos de uso requieren procesar documentos de más de 128.000 tokens?
- Ajuste de hardware: ¿Dispone de infraestructura NVIDIA existente, o está evaluando NVIDIA DGX o servidores GPU alquilados?
Freshlab asesora a pymes en toda Europa en la definición y ejecución de infraestructura de IA local, desde la evaluación inicial de hardware hasta el despliegue en producción y la documentación para la Ley de IA de la UE. Nuestro kAIra Tools cubre configuraciones basadas en Mac para cargas de trabajo de modelos más pequeños; para infraestructura de agentes basada en NVIDIA, estructuramos un proyecto piloto para validar la configuración frente a sus flujos de trabajo específicos.
Contáctenos para comenzar la conversación.