Libro de IA para niños Libro de IA para adolescentes Libro de IA para familias Nueva colección ¿Ya conoce nuestra colección de libros? IA para niños, adolescentes y adultos Descubrir los libros

GLM-5.2 local: un modelo frontera en tu hardware

glm mlx apple-silicon

Desde mediados de junio de 2026 existe un modelo abierto que juega en una liga que hace un año todavía pertenecía a los proveedores cerrados. GLM-5.2 de Z.ai, antes Zhipu AI, está en Hugging Face bajo licencia MIT, y un informe en X describe cómo funcionaba en un solo Mac Studio. Para las empresas que no quieren entregar sus datos a una nube ajena, eso cambia una cuenta antigua.

Ya tratamos los modelos chinos de pesos abiertos como alternativa soberana a finales de julio, entonces en términos generales y con la vista en DeepSeek y Qwen. Lo nuevo en GLM-5.2 es el salto concreto: un candidato frontera con nombre y con benchmarks que puedes ejecutar tú mismo bajo una licencia permisiva, en lugar de hablar solo de la categoría.

Qué es GLM-5.2

GLM-5.2 es un modelo Mixture-of-Experts con unos 750.000 millones de parámetros, de los que unos 40.000 millones están activos por token. La ventana de contexto es de un millón de tokens, suficiente para carpetas enteras de documentos en una sola pasada. La licencia es MIT, es decir, uso comercial, ajuste fino y despliegue local sin pedir permiso. Esa es la diferencia frente a muchos otros modelos abiertos, cuyas licencias limitan el uso comercial o añaden reglas especiales a partir de cierto número de usuarios.

Según benchmarks independientes, el modelo queda justo por detrás de Claude Opus 4.8 en tareas de programación y, según las mismas mediciones, supera a GPT-5.5 en un benchmark SWE a una fracción del coste. Estas cifras vienen de pruebas y reportes de la comunidad, no de una medición propia. Como con todo benchmark, dicen algo sobre la tarea evaluada, no sobre tu caso de uso. Un modelo que brilla programando no es automáticamente la mejor opción para resúmenes jurídicos.

El valor práctico de la licencia MIT está menos en la mera operación que en la adaptación. Puedes ajustar el modelo con tus propios datos sin pedir permiso a ningún proveedor y sin que esos datos salgan nunca del edificio. Para una empresa con vocabulario propio, plantillas de texto fijas o una base de conocimiento interna, eso a menudo vale más que los últimos puntos porcentuales en un benchmark.

750.000 millones de parámetros no significa portátil

El tamaño del modelo marca la diferencia entre la promesa y el día a día. Un informe en X describe GLM-5.2 con el stack MLX en un Mac Studio con 512 GB de memoria unificada, donde el modelo ocupaba unos 395 GB. El autor califica los tiempos de respuesta de casi instantáneos, pero no da una cifra de tokens por segundo. Lo tratamos como un relato de experiencia, no como una medición.

El punto se mantiene: 750.000 millones de parámetros no corren en el portátil de recepción. Necesitas o bien una máquina con mucha memoria unificada o bien un servidor con varias tarjetas gráficas. La arquitectura MoE ayuda con la velocidad, porque solo una fracción de los parámetros calcula por token, pero los pesos completos deben estar igualmente en memoria. Aquí es donde Apple Silicon resulta interesante: la memoria compartida entre CPU y GPU es lo que hace asequibles 512 GB en un equipo que cabe en un escritorio.

Si quieres empezar más pequeño, recurres a variantes GGUF muy cuantizadas mediante llama.cpp u Ollama. Eso reduce mucho la memoria necesaria, pero cuesta precisión. Para una primera prueba es una vía viable; para producción conviene comparar la calidad con la versión completa.

Qué significa para la soberanía del dato

La ganancia real no es la cifra del benchmark, sino el lugar. Si el modelo corre en tu propio edificio, ninguna consulta sale de la red. Para un despacho, una consulta médica o un fabricante por contrato con secretos industriales, esa es la diferencia entre sí y no. El Reglamento de IA de la UE obliga a los responsables del despliegue a demostrar diligencia en la selección y la operación. Un modelo ejecutado en local con licencia abierta acorta esa cadena de prueba, porque el flujo de datos y el origen quedan en tus manos. Hay más sobre esta idea en nuestra página de soberanía del dato.

También hay que ser honesto: muy pocas pymes necesitan 750.000 millones de parámetros. Para búsqueda documental, borradores, resúmenes y asistencia interna basta con un modelo de 8 a 30.000 millones de parámetros que corre en una sola estación de trabajo. GLM-5.2 interesa donde la fuerza en programación o un contexto muy largo inclinan la balanza, no como herramienta estándar de cada mesa. Cómo se ve un montaje local en la práctica lo hemos reunido en nuestra página de IA local.

Cuándo compensa el esfuerzo

Haz el cálculo con la cabeza fría. Un Mac Studio con 512 GB o un servidor con GPU es capital que aterriza una vez sobre la mesa, más luz, mantenimiento y alguien que lleve el sistema. Las API en la nube cobran por petición y escalan con el uso.

La vía local compensa cuando se cumple una de estas dos condiciones:

  • El riesgo de privacidad de un procesamiento externo es demasiado alto, porque trabajas con datos de clientes, pacientes o de diseño.
  • El volumen de peticiones es tan grande que la factura corriente de la nube alcanza a la compra en un plazo razonable.

Con volumen bajo e irregular y sin confidencialidad especial, la nube suele salir más barata. Este balance no es cuestión de fe, es una tabla con tus números. Si además tramitas una ayuda del Kit Digital para el equipamiento, ese cálculo cambia y conviene incluirlo desde el principio.

Lo que suele subestimarse es la operación, no la compra. Un modelo local necesita actualizaciones, supervisión y una persona que sepa qué hacer cuando una respuesta no llega. Las empresas pequeñas lo resuelven con un proveedor de servicios, las grandes con su propia informática. Quien no prevé ese papel compra una máquina cara que se para al primer problema.

Sobre todo, GLM-5.2 muestra que el techo se ha movido: lo que es posible en abierto y en local llega hoy a terrenos reservados durante mucho tiempo a los grandes proveedores. Que el paso compense para tu empresa depende de tus datos, tu volumen y tu posición de riesgo. Eso es justo lo que aclaramos en un proyecto piloto antes de que inviertas en hardware.

Preguntas frecuentes

¿Qué es GLM-5.2?

GLM-5.2 es un modelo de lenguaje abierto de Z.ai, antes Zhipu AI, publicado a mediados de junio de 2026 bajo licencia MIT. Tiene unos 750.000 millones de parámetros en una arquitectura Mixture-of-Experts, de los que unos 40.000 millones están activos por token, y una ventana de contexto de un millón de tokens.

¿Puedo ejecutar GLM-5.2 en un equipo normal?

No. Un modelo de este tamaño necesita mucha memoria. Un informe en X describe un Mac Studio con 512 GB de memoria unificada en el que el modelo ocupaba unos 395 GB. En un portátil no funciona, para eso están los modelos más pequeños de 8 a 30.000 millones de parámetros.

¿Una pyme necesita de verdad 750.000 millones de parámetros?

Normalmente no. Para búsqueda documental, borradores, resúmenes y asistencia interna basta con un modelo de 8 a 30.000 millones de parámetros en una sola estación de trabajo. GLM-5.2 compensa donde la fuerza en programación o un contexto muy largo marcan la diferencia.

¿Qué aporta el despliegue local frente a una API en la nube?

Si el modelo corre en casa, ninguna consulta sale de la red. Para despachos, clínicas y fabricantes por contrato con secretos industriales ese es el punto decisivo. El precio es capital en hardware y alguien que mantenga el sistema.

Compartir el artículo