Libro de IA para niños Libro de IA para adolescentes Libro de IA para familias Nueva colección ¿Ya conoce nuestra colección de libros? IA para niños, adolescentes y adultos Descubrir los libros

IA local alcanza hito: Ollama recauda 65 millones

ollama local-llm open-source

El 9 de julio de 2026, Ollama anunció el cierre de una ronda de financiación Serie B de 65 millones de dólares, liderada por Theory Ventures y con participación de Benchmark, 8VC, Y Combinator, Pace Capital, 49 Palms y GTMFund. La financiación total acumulada alcanza según la compañía los 88 millones de dólares. Para las organizaciones que evalúan o ya utilizan IA local, esta ronda no es sólo una noticia corporativa: es una confirmación de que la inferencia de modelos de lenguaje en infraestructura propia ha pasado de ser una opción marginal a convertirse en infraestructura de referencia.

Ollama en cifras: de herramienta de entusiastas a estándar empresarial

Ollama es una plataforma de código abierto que permite ejecutar modelos de lenguaje de gran tamaño (LLM) en hardware propio. Un único comando de terminal descarga y lanza modelos como Qwen3, Llama 4, Gemma 4 o Mistral Large 3, sin API en la nube, sin transferencia de datos, sin suscripción mensual por usuario. La plataforma gestiona la cuantización del modelo, el formato de los prompts y expone una API REST local compatible con OpenAI, lo que facilita su integración en aplicaciones existentes.

Según la compañía, 8,9 millones de desarrolladores utilizan la plataforma cada mes. El uso se duplicó desde enero de 2026, y según lo reportado en el momento del anuncio se añaden aproximadamente un millón de instalaciones nuevas cada semana. Más de 67.000 integraciones se han construido sobre Ollama: plugins para IDE, pipelines de RAG, frameworks de automatización y aplicaciones empresariales. El dato más significativo para el contexto corporativo: el 85 % de las empresas del Fortune 500 utilizan Ollama en alguna forma, incluidas organizaciones del sector sanitario, administración pública y servicios financieros.

El punto de inflexión llegó en torno a enero de 2026, cuando los modelos de pesos abiertos cruzaron el umbral de calidad necesario para flujos de trabajo agénticos fiables: aquellos en los que el modelo llama herramientas, toma decisiones secuenciales y ejecuta tareas de varios pasos sin intervención humana en cada iteración.

ollama launch: asistentes de código sin salir de la red corporativa

Junto al anuncio de financiación, Ollama entregó una función con impacto inmediato en equipos de desarrollo que trabajan con datos sensibles: el comando ollama launch. Configura asistentes de codificación como Claude Code, OpenCode y Codex para que se comuniquen con el modelo elegido a través de una API local compatible con OpenAI (localhost:11434). Sin variables de entorno, sin archivos de configuración, sin conexiones salientes a servidores externos.

Requisitos: Ollama v0.15 o superior. Contexto recomendado: mínimo 64.000 tokens, ya que los asistentes de código necesitan contexto amplio para producir resultados precisos. Los modelos locales más potentes para tareas de desarrollo, según mediciones reportadas por la comunidad, son Gemma 4 26B (77,1 % en LiveCodeBench v6) y Qwen3.5 27B (80,7 %). Ambos corren en un Mac Studio M3 Ultra o una sola GPU de alto VRAM sin cuantización que degrade perceptiblemente la calidad.

Para equipos de desarrollo que trabajan con código propietario, proyectos de clientes o datos regulados, el resultado es claro: con ollama launch, ninguna línea de código abandona la red de la empresa durante una sesión de trabajo asistida por IA.

Novedades técnicas de julio de 2026

La misma actualización incorpora varias mejoras que afectan a configuraciones de hardware habituales:

  • Flash attention para GPUs NVIDIA más antiguas (capacidad de cómputo 6.x): las GPUs de la serie GTX 1000 se benefician ahora de la atención acelerada, con tiempos de generación notablemente más cortos.
  • Gemma 4 aproximadamente un 90 % más rápida en Apple Silicon: la predicción multi-token se activa automáticamente en Macs compatibles, sin configuración y sin alterar la salida del modelo.
  • Descarga de visión en iGPU: las gráficas integradas pueden cargar modelos de visión con padding para ajustarse a la memoria disponible, útil en configuraciones compactas sin GPU dedicada.
  • Plugin de búsqueda y recuperación web para OpenClaw: los modelos locales pueden acceder a contenido web actualizado en contexto, sin que el propio modelo necesite conexión a internet.

Estas incorporaciones marcan una dirección clara: Ollama evoluciona de entorno de ejecución básico a plataforma de IA local completa con capa de plugins, siguiendo el patrón de otros proyectos de infraestructura de código abierto que se han convertido en dependencias empresariales de primer nivel.

Qué señala esta ronda para el mercado de IA local

Una Serie B de 65 millones respaldada por inversores con amplia experiencia en infraestructura de código abierto no es una apuesta por un nicho. Es una apuesta a que la inferencia privada y on-premise es una capa de infraestructura duradera, que crecerá junto a la IA en la nube y no en su lugar.

La estrategia de Ollama refleja este enfoque dual: soberanía de datos completa para quienes operan completamente en local, y una opción de nube escalable para equipos con necesidades variables de capacidad. Según lo reportado, el uso de tokens en la nube creció más de un 200 % mensual en el momento del anuncio, aunque el producto local de código abierto sigue siendo el núcleo declarado de la estrategia.

Para pymes europeas bajo el RGPD o que se preparan para las obligaciones de la Ley de IA de la UE, la vía local tiene una ventaja de cumplimiento clara: los datos que nunca abandonan la infraestructura propia no activan restricciones de transferencia internacional, acuerdos de procesador externo ni preocupaciones sobre registros de entradas. Nuestra página sobre IA local para empresas detalla cómo se traduce esto en la práctica para distintos sectores.

IA local y Kit Digital: una combinación relevante para pymes españolas

Las pymes españolas que aún disponen de saldo en su bono Kit Digital ,o que tramitan una ampliación, pueden encontrar en un stack basado en Ollama una aplicación concreta para la categoría de Gestión de Procesos o Inteligencia Artificial y Analítica. Según nuestra interpretación de la normativa vigente, la implantación de herramientas de procesamiento de lenguaje natural con alojamiento local podría encajar en las soluciones elegibles, siempre que se cumpla con los requisitos de documentación y entrega definidos por Red.es.

Una solución basada en Ollama con modelos de código abierto puede justificar la inversión con criterios medibles: reducción del tiempo dedicado a tareas de redacción y síntesis, automatización de búsquedas en documentación interna y asistencia a equipos de desarrollo sin coste por token. Para explorar cómo encaja en los programas de subvención vigentes, visita nuestra página de Kit Digital para IA local.

Configuraciones recomendadas para pymes

Las siguientes configuraciones de hardware se han mostrado fiables en entornos de producción, según mediciones reportadas por la comunidad:

  • Mac Mini M4 Pro (48 GB): Punto de entrada para modelos de 7B a 14B. Silencioso, menos de 30 W en carga. Adecuado para chatbots internos, procesamiento de documentos y tareas de resumen.
  • Mac Studio M3 Ultra (192 GB): Modelos de 70B a 25-40 tokens/segundo según mediciones reportadas. Válido para inferencia compartida en equipo, RAG sobre grandes repositorios documentales y flujos agénticos.
  • RTX 4090 (24 GB VRAM): Alternativa para Windows por menos de 2.000 €; Qwen3 8B y Gemma 4 12B corren a 30-60 tokens/segundo.

Para sectores con requisitos de protección de datos estrictos ,despachos jurídicos, clínicas, gestorías, un despliegue local no es una opción más: es la única configuración que mantiene los datos de clientes o pacientes inequívocamente dentro de la infraestructura propia.

El panorama en perspectiva

67.000 integraciones, 8,9 millones de desarrolladores activos, 65 millones en capital institucional fresco. Estas cifras ya no describen una herramienta de aficionados ni un proyecto de privacidad de nicho. Describen infraestructura que ha alcanzado la escala a la que se convierte en una dependencia empresarial de largo plazo.

El comando ollama launch captura algo importante sobre hacia dónde se dirige la IA local: ya no es una concesión en materia de privacidad que sacrifica productividad. Con modelos que superan el 80 % en benchmarks de codificación y que corren en hardware que cabe en una mesa de trabajo, el argumento de productividad se acerca al de las alternativas en la nube.

Las organizaciones que aún evalúan si los LLM locales merecen atención han perdido la ventaja del pionero, pero todavía hay un beneficio acumulable significativo en empezar ahora.


¿Quieres saber qué configuración encaja con tu empresa? A través de nuestro programa de proyecto piloto llegamos a una prueba de concepto funcional en dos a cuatro semanas, con criterios de éxito definidos y una ruta clara hacia producción.