Libro de IA para niños Libro de IA para adolescentes Libro de IA para familias Nueva colección ¿Ya conoce nuestra colección de libros? IA para niños, adolescentes y adultos Descubrir los libros

Qwen3-Coder-Next: Agente de Código IA Local en Ollama

qwen3-coder local-llm coding-agent

Esta semana, la cuenta oficial de Ollama en X mostró un comando que hace doce meses habría sonado demasiado ambicioso: ollama launch codex-app --model [modelo], una sola línea para lanzar un entorno de codificación agéntico completo, con modelo local, sin clave API y sin suscripción en la nube. El post mostraba el comando ejecutándose con una etiqueta de modelo de frontera, pero la noticia más relevante para la mayoría de empresas es otra: opciones más pequeñas e igualmente capaces funcionan igual de bien en hardware convencional. En lo más alto de esa lista está Qwen3-Coder-Next.

Qué es Qwen3-Coder-Next

Qwen3-Coder-Next es un modelo de lenguaje de pesos abiertos publicado por el equipo Qwen de Alibaba a principios de 2026, diseñado desde cero para flujos de trabajo de codificación agéntica. Utiliza una arquitectura Mixture-of-Experts (MoE) con aproximadamente 80 000 millones de parámetros totales y solo unos 3 000 millones de parámetros activos por paso de inferencia, un diseño que permite alta capacidad con requisitos de memoria manejables para hardware de negocio real.

Especificaciones clave, según la documentación de la biblioteca Ollama y los benchmarks de la comunidad:

  • ~70 % de puntuación SWE-Bench, según mediciones reportadas por la comunidad, lo que lo sitúa entre los modelos de codificación de pesos abiertos más potentes disponibles a mediados de 2026
  • Ventana de contexto de 256 000 tokens, suficiente para manejar bases de código completas, diffs de PR largos o especificaciones de API extensas sin fragmentación
  • Licencia MIT, que permite uso comercial sin costes por token, límites de uso ni restricciones por tipo de código procesado
  • Disponible vía Ollama con un único comando: ollama pull qwen3-coder-next

Según informes de practicantes de la comunidad, las variantes cuantizadas se ejecutan en equipos desde aproximadamente 16 GB de memoria unificada, aunque los requisitos exactos dependen del nivel de cuantización elegido. Los equipos con 32 GB o más dispondrán de mayor margen para contextos largos y cargas de trabajo más exigentes.

Por qué la IA local importa para los equipos de desarrollo

Los asistentes de codificación en la nube tienen un problema persistente: tu código sale de tu máquina en cada solicitud. Para equipos que trabajan bajo acuerdo de confidencialidad, con algoritmos propietarios o en sectores regulados, ese flujo de datos genera riesgo real, legal, contractual y reputacional.

Qwen3-Coder-Next ejecutándose localmente mediante Ollama elimina ese riesgo por completo. Las completaciones de código, las ediciones de múltiples archivos, los bucles de tareas agénticas y el análisis de contexto largo ocurren en tu propio hardware. Nada llega a una API externa. No existe un registro de uso en servidores de terceros.

Para una visión más amplia de cómo encaja esto en una estrategia de IA local, incluyendo arquitectura de privacidad y modelos de despliegue, consulta nuestra página de referencia.

Los responsables de cumplimiento en la UE deben tener en cuenta que ejecutar inferencia en las instalaciones propias simplifica considerablemente el cumplimiento de las obligaciones de transparencia y minimización de datos del Reglamento de IA de la UE (Artículo 26), según nuestra interpretación de la normativa vigente. Para asesoramiento jurídico específico, consulte con un experto legal cualificado.

Kit Digital y financiación de IA local para pymes españolas

Para las pymes españolas, el programa Kit Digital puede cubrir parte de la inversión en soluciones de IA local bajo algunas de sus categorías de ayuda. Según nuestra interpretación de las bases de la convocatoria vigente, la implantación de soluciones de gestión de procesos con componentes de inteligencia artificial puede encajar en categorías como "Gestión de procesos y recursos" o "Business Intelligence y analítica".

Los segmentos II (10-49 empleados) y III (3-9 empleados) han registrado una elevada adopción tecnológica vía Kit Digital durante el primer semestre de 2026. Para verificar si una solución de IA local concreta es elegible y qué agente digitalizador puede acompañar el proceso, es necesaria una consulta individualizada, las condiciones exactas varían con cada convocatoria.

Para empresas con 50 o más empleados existen también líneas de crédito ICO y programas CDTI orientados a innovación tecnológica. Para más información sobre elegibilidad y plazos, consulta a un asesor o contáctanos directamente.

Configurar Qwen3-Coder-Next con Ollama

Si Ollama ya está instalado, la puesta en marcha son dos comandos:

ollama pull qwen3-coder-next
ollama run qwen3-coder-next

Para despliegues en equipo, Ollama expone una API compatible con OpenAI en el puerto 11434, lo que permite la integración con cualquier herramienta que soporte la interfaz de OpenAI Chat Completions, incluyendo Aider, Cline, Roo Code y la aplicación de escritorio Codex de OpenAI.

La integración con codex-app, publicada con Ollama 0.24 en mayo de 2026, es especialmente relevante para equipos que desean un entorno de codificación agéntico con interfaz gráfica. El comando ollama launch codex-app configura la aplicación de escritorio Codex para enrutar las solicitudes a través de tu instancia local de Ollama. Una vez configurado, la aplicación presenta la misma interfaz que los desarrolladores conocen de la versión en nube, pero la inferencia del modelo ocurre íntegramente en tu hardware.

Integración con herramientas de codificación agéntica

Qwen3-Coder-Next es compatible con los principales frameworks de codificación agéntica:

  • Aider: usa --model ollama/qwen3-coder-next y --api-base http://localhost:11434/v1
  • Cline / Roo Code: configura un proveedor compatible con OpenAI apuntando al endpoint local de Ollama
  • OpenAI Codex App: usa ollama launch codex-app con Ollama 0.24 o posterior

Para tareas de múltiples pasos, refactorización en varios archivos, generación de suites de test o implementación de funcionalidades a partir de especificaciones, los modelos con llamadas a herramientas fiables tienen un rendimiento significativamente mejor que los modelos solo de chat. Según informes de la comunidad, Qwen3-Coder-Next gestiona las llamadas estructuradas a herramientas y los bucles multistep de manera consistente, aunque cada equipo debería evaluar el rendimiento en sus flujos de trabajo específicos antes de llevarlo a producción.

Rendimiento según el hardware disponible

Basado en benchmarks y reportes de la comunidad:

Hardware Throughput aprox. Cuantización recomendada
MacBook Pro M3/M4, 32 GB 12-18 tok/s Q4KM
Mac Studio M3 Ultra, 192 GB 35-50 tok/s Q6_K
DGX Spark, 128 GB 20-30 tok/s Q4KM
RTX 5090, 32 GB VRAM 30-45 tok/s Q4KM

Todas las cifras de throughput son estimaciones de pruebas de la comunidad, no mediciones de Freshlab. El rendimiento real varía con la longitud del contexto, los usuarios concurrentes y la configuración del sistema.

Para orientación sobre qué configuración de hardware encaja con el tamaño de tu equipo y tu carga de trabajo, nuestro proceso de proyecto piloto incluye una sesión de scoping con selección de modelo, dimensionamiento de hardware y planificación de integración.

Soberanía de datos y flujos de trabajo de codificación agéntica

El desplazamiento hacia la IA agéntica, herramientas que pueden editar archivos, ejecutar comandos de shell y operar de forma autónoma sobre una base de código, eleva las exigencias sobre el control de datos. Cuando el agente está alojado en la nube, cada archivo que toca, cada comando que propone, cada diff que genera pasa por un sistema externo.

Una pila local con Qwen3-Coder-Next y Ollama mantiene todo ese bucle en tus propias instalaciones. Para organizaciones que gestionan datos empresariales sensibles, sistemas de clientes, implementaciones propietarias o sectores regulados, esto no es un detalle menor. Es la condición previa para utilizar IA de codificación agéntica en absoluto.

Los modelos de pesos abiertos bajo licencia MIT también eliminan el riesgo de dependencia de proveedor: no dependes de las decisiones de precios, los calendarios de deprecación de modelos ni los cambios en las políticas de acceso de ningún proveedor.

La elección del modelo y del hardware es a menudo donde los proyectos se atoran. Nuestro proceso de proyecto piloto cubre exactamente ese trabajo de scoping, partiendo del tamaño del equipo, las características de la base de código y los requisitos de cumplimiento normativo. Contáctanos para explorar si una pila de codificación agéntica local encaja en tu organización.