Libro de IA para niños Libro de IA para adolescentes Libro de IA para familias Nueva colección ¿Ya conoce nuestra colección de libros? IA para niños, adolescentes y adultos Descubrir los libros

IA local GPT-OSS 120B: el GGUF Fable-5 para pymes europeas

local-llm gptoss open-weight

El 22 de junio de 2026, el laboratorio de IA AutoTrust AI publicó en X: "Our first community model is live." Detrás de ese mensaje: un GGUF comunitario de GPT-OSS 120B de OpenAI, ajustado con LoRA mediante destilación de conocimiento de Claude Fable-5 y convertido al formato GGUF compatible con llama.cpp, LM Studio y Ollama. En las primeras 24 horas se registraron 243 descargas, una señal inequívoca de que la comunidad de LLMs locales llevaba tiempo esperando este lanzamiento.

Para empresas que apuestan por la IA local, las implicaciones son directas: por primera vez hay disponible en formato GGUF un modelo de 120.000 millones de parámetros que puede ejecutarse completamente en las instalaciones propias, sin depender de ninguna API externa, en hardware ya existente o fácilmente adquirible para una pyme europea.

Qué es GPT-OSS 120B, y qué significa «Fable-5 Distilled»

GPT-OSS 120B es el modelo de lenguaje abierto de OpenAI con arquitectura Mixture-of-Experts (MoE): 36 capas, 128 expertos en total, 4 activos por paso de generación de tokens. Esta arquitectura implica que solo una pequeña fracción de los parámetros se activa en cada paso de inferencia, lo que reduce considerablemente los requisitos de memoria y cómputo respecto a un modelo denso de 120B parámetros.

«Fable-5 Distilled» hace referencia al proceso de ajuste LoRA aplicado por AutoTrust AI: entrenamiento supervisado sobre datos de sesiones de código, utilizando destilación de conocimiento del modelo Claude Fable-5 de Anthropic. No se aplicó RLHF, lo que, según la documentación en Hugging Face, implica una alineación de seguridad algo más ligera que la de los modelos de instrucción comerciales. El entrenamiento se centró en escenarios de programación, donde el modelo muestra sus mayores fortalezas.

El formato GGUF permite la ejecución con llama.cpp, Ollama, LM Studio, GPT4All y MLX-LM, multiplataforma en macOS, Windows y Linux, con backends para CPU, CUDA, Metal, Vulkan y ROCm.

Requisitos de hardware: ¿qué necesito en la práctica?

El modelo en cuantización MXFP4 ocupa aproximadamente 61 GB de datos del modelo. A ello se suman los buffers de cómputo (~2,7 GB) y la caché KV (desde ~0,3 GB con 8.192 tokens). Según la guía comunitaria de llama.cpp, la memoria total necesaria con un contexto de 8.192 tokens es de unos 64 GB, y de aproximadamente 68,5 GB a 131.072 tokens.

Opciones de hardware prácticas para pymes europeas:

  • Mac Studio M3 Ultra (128-192 GB de memoria unificada): Recomendado. Según mediciones reportadas por la comunidad en Hacker News, un Mac Studio al máximo de especificaciones alcanza 60-100 tokens/s con contextos cortos. La velocidad disminuye con contextos más largos por presión de memoria.
  • Mac Studio M3 Max (96 GB): Funciona con limitaciones. Las ventanas de contexto superiores a 32.000 tokens pueden generar presión de memoria notable.
  • NVIDIA DGX Spark GB10 (128 GB): Muy adecuado. La inferencia optimizada para GPU generalmente supera a Apple Silicon con capacidad de memoria equivalente.
  • PC de escritorio con GPU de 16-24 GB y mucha RAM del sistema: Posible con descarga en CPU mediante --n-cpu-moe N en llama.cpp. La generación baja a unos 5-15 tokens/s, pero sigue siendo útil para tareas asíncronas como análisis de documentos.

Puntos de referencia de mediciones comunitarias documentadas en la discusión de llama.cpp: NVIDIA RTX Pro 6000 (96 GB VRAM) alcanza aproximadamente 196 tokens/s en generación; M2 Ultra (192 GB, 76 núcleos GPU) logra aproximadamente 80 tokens/s.

Configuración: llama.cpp y Ollama

Para sistemas con 64 GB o más de VRAM o memoria unificada, sin necesidad de descarga en CPU:

llama-server -hf ggml-org/gpt-oss-120b-GGUF --ctx-size 0 --jinja -ub 2048 -b 2048

Para sistemas con 16 GB de VRAM y suficiente RAM del sistema:

llama-server -hf ggml-org/gpt-oss-120b-GGUF \
  --ctx-size 32768 --jinja -ub 4096 -b 4096 --n-cpu-moe 32

El parámetro --n-cpu-moe indica a llama.cpp que descargue las capas MoE en la CPU, la optimización clave para configuraciones con memoria limitada. Añadir -fa (Flash Attention) mejora adicionalmente el rendimiento.

Para Ollama y LM Studio, el GGUF comunitario está disponible directamente en Hugging Face.

Importante, formato de prompt: GPT-OSS 120B requiere el formato Harmony con el protocolo <|channel|>. Los prompts estándar en ChatML o formato Alpaca producen resultados significativamente peores, según reportan los practicantes en el hilo comunitario de llama.cpp. Conviene planificar la adaptación del prompt desde el inicio al integrar el modelo en una aplicación existente.

Casos de uso y aspectos a considerar

La variante Fable-5 Distilled de AutoTrust AI se entrenó principalmente con datos de sesiones de código y rinde especialmente bien en:

  • Revisión automatizada de código y documentación técnica: A escala de 120B parámetros, el modelo demuestra una comprensión notablemente más matizada de las decisiones arquitectónicas que los modelos más pequeños.
  • Asistentes de desarrollo internos con plena soberanía de datos: Sin registros de peticiones en proveedores externos, sin dependencia de API, sin límites de tokens.
  • Análisis y resumen de documentos técnicos o jurídicos: La ventana de contexto de 128.000 tokens permite procesar bases de código completas o grandes conjuntos de contratos en una sola llamada.

Para razonamiento general y generación de texto, el modelo también funciona bien. No obstante, conviene tener en cuenta el sesgo de entrenamiento hacia código al evaluar el rendimiento en cargas de trabajo no técnicas.

Kit Digital y financiación para dar el salto

En España, la subvención Kit Digital puede cubrir la adquisición e integración de soluciones de IA local dentro del segmento de «Inteligencia Artificial». Según nuestra interpretación de las bases vigentes, los proyectos de implementación de herramientas de IA para análisis de documentos o asistencia interna al equipo técnico podrían encajar en esta categoría, aunque cada solicitud depende de la validación final del agente digitalizador y la convocatoria aplicable.

Para empresas que están evaluando modelos de mayor escala como GPT-OSS 120B, la subvención puede amortizar parte del coste de integración y formación, lo que reduce el período de retorno de la inversión.

Soberanía de datos: el argumento estructural a favor del despliegue local

El argumento fundamental a favor del despliegue en local aplica aquí como con cualquier otro modelo: toda la inferencia se ejecuta en tu propio hardware. Ninguna petición abandona tu red; ningún dato corporativo llega a servicios externos. Según nuestra interpretación del RGPD, esto supone una reducción de riesgo significativa bajo el artículo 32, especialmente relevante para despachos de abogados, proveedores de salud, gestorías y empresas industriales que procesan documentos confidenciales.

Las APIs en la nube exigen que cada petición pase por servidores externos. Con un modelo alojado en local, ningún prompt sale de tu red. Esa es una diferencia estructural que se refleja directamente en la documentación de riesgos del RGPD.

Más sobre cómo la infraestructura de IA local conecta los objetivos de privacidad con la eficiencia operativa, en nuestra página de soberanía de datos.

¿Para quién tiene sentido el salto a GPT-OSS 120B?

GPT-OSS 120B en la variante Fable-5 Distilled no es un modelo de nivel básico. Si ya ejecutas Llama 4, Qwen3 o Gemma 4 en un Mac Studio M3 con Ollama, este modelo ofrece un salto cualitativo real, con requisitos de hardware proporcionalmente mayores.

El movimiento tiene sentido para organizaciones que:

  • Ya operan Mac Studio M3 Ultra u hardware equivalente
  • Necesitan asistencia de código o análisis de documentos con la máxima calidad del modelo sin dependencia de la nube
  • Están preparadas para integrar el formato Harmony en la capa de aplicación

Para pymes que están iniciando su proyecto piloto de IA local, los modelos más pequeños, Llama 3.3 70B o Qwen3 32B, siguen siendo el punto de entrada más pragmático, con excelentes resultados en hardware más asequible.

Si estás evaluando el salto a modelos locales de clase 120B o quieres una revisión independiente de tu stack actual de IA local, contáctanos.