Ejecutar un LLM local resuelve un problema de privacidad: tus prompts no viajan a servidores externos. Pero cuando ese modelo actúa como un agente, consultando bases de datos, leyendo archivos, llamando a APIs internas, aparece un segundo problema igual de importante: ¿dónde se ejecutan esas llamadas a herramientas?
En las plataformas de agentes en la nube, tanto la inferencia del modelo como la ejecución de herramientas ocurren en la infraestructura del proveedor. Cada acción que realiza el agente, una consulta SQL, la lectura de un contrato, el envío de una notificación interna, deja rastros en servidores fuera de tu control.
Un stack de agentes completamente local resuelve las dos capas. El equipo de UnslothAI publicó esta semana una guía completa para ejecutar servidores MCP junto con LLMs locales como Qwen3.6 o Gemma 4. En X, el profesional Akshay Pachaar señaló que el marco de «agentic engineering» de Karpathy cuenta «por fin» con las herramientas adecuadas, reconociendo que el ecosistema de agentes locales ha alcanzado un nivel de madurez real. Para las pymes europeas que trabajan con IA local, la conclusión práctica es clara: un agente IA que llama a tus herramientas internas sin tocar la nube ya es un objetivo de despliegue alcanzable, no un experimento.
Qué es MCP y por qué importa para la privacidad
El Model Context Protocol (MCP) es un estándar abierto, originado por Anthropic y gobernado actualmente por la Linux Foundation con el respaldo de OpenAI, Google, Microsoft, AWS y Cloudflare. Define una interfaz coherente mediante la cual un modelo de IA puede llamar a herramientas externas, funciones que leen archivos, ejecutan consultas, llaman a APIs o ejecutan código, y recibir los resultados dentro del contexto de la conversación.
La dimensión de privacidad depende enteramente de dónde se ejecutan esos servidores de herramientas. Si el servidor MCP vive en la nube de un proveedor, cada invocación de herramienta, incluyendo los datos que devuelve, transita infraestructura externa. Si el servidor MCP corre en tu propia red, las invocaciones son completamente internas: el modelo habla con un servidor local, el servidor accede a recursos locales, y nada cruza el perímetro de tu red.
Arquitectura: el stack local completo
Un agente MCP completamente local tiene tres capas:
Backend de inferencia
Ollama, llama.cpp o vLLM ejecutándose en tu propio hardware, exponiendo un endpoint REST compatible con la API de OpenAI. El modelo nunca transmite datos al exterior, solo recibe peticiones y devuelve respuestas dentro de tu red local.
Framework de orquestación
Unsloth Studio, LangChain o LlamaIndex: la capa que gestiona el estado de la conversación, enruta las respuestas del modelo a las llamadas MCP correctas y ensambla los resultados de vuelta en el contexto del modelo. También se ejecuta localmente.
Servidores MCP locales
Servicios individuales que albergas en tu propia infraestructura, cada uno exponiendo un conjunto definido de funciones de herramienta. Un servidor MCP de sistema de archivos gestiona lecturas y escrituras de ficheros. Un servidor MCP de base de datos mantiene una conexión a tu almacén SQL o NoSQL interno. Un servidor MCP de calendario o correo envuelve tus sistemas de comunicación internos. Ninguno enruta por internet.
Unsloth reporta que su implementación de «self-healing tool calling» reduce las llamadas a herramientas malformadas o rotas aproximadamente un 50% en comparación con implementaciones básicas, una mejora relevante en entornos de producción donde un fallo en una llamada a herramienta implica una respuesta incompleta o un proceso automatizado bloqueado.
Modelos recomendados
Según la documentación de Unsloth y la experiencia de la comunidad, estos modelos funcionan bien con llamadas a herramientas MCP en local:
- Qwen3 14B, 32B (cuantizado): fiabilidad alta en tool calling; funciona en Mac Studio M3 Max o NVIDIA DGX Spark
- Gemma 4 27B (cuantización QAT): bajo consumo de memoria para el nivel de calidad, especialmente optimizado para Apple Silicon
- Llama 3.3 70B (cuantizado): soporte amplio para tool calling; se recomienda aproximadamente 48-64 GB de RAM
- DeepSeek-V3 (GGUF, arquitectura MoE): alta calidad en salidas de código y estructuradas; adecuado para Mac Studio M3 Ultra (128 GB) o DGX Spark
Implicaciones en RGPD y LOPD-GDD
Según nuestra interpretación del RGPD, un despliegue MCP completamente local simplifica materialmente el cumplimiento en varios aspectos.
Sin transferencia internacional (art. 44 RGPD): los datos no salen de la UE, ni siquiera de tus propias instalaciones. No hay transferencia a tercer país que evaluar ni Cláusulas Contractuales Tipo que mantener para la capa de inferencia o ejecución de herramientas.
Sin acuerdo de encargado de tratamiento con proveedor cloud: al no transitar ningún dato por un procesador externo, no es necesario formalizar ni mantener un contrato de encargado de tratamiento del art. 28 RGPD para la IA.
Reducción del riesgo del art. 32 RGPD: la superficie de riesgo para accesos no autorizados se limita a tu propia infraestructura, en lugar de abarcar los sistemas de un proveedor en la nube, sus subprocesadores y las rutas de transmisión entre ellos.
Para sectores que tratan habitualmente datos personales sensibles, despachos de abogados, asesorías fiscales y laborales, clínicas, empresas de RRHH, estas no son consideraciones marginales de cumplimiento. Marcan la diferencia entre un despliegue jurídicamente directo y uno que requiere una Evaluación de Impacto en la Protección de Datos (EIPD) del art. 35 RGPD.
Desde la perspectiva de la Ley de IA de la UE, los agentes MCP locales ofrecen una ventaja concreta a los operadores: cada interacción entre el modelo y las llamadas a herramientas puede registrarse localmente con todo detalle, satisfaciendo las obligaciones de documentación de los operadores sin depender de exportaciones de logs de un tercero.
Casos de uso prácticos para pymes
Búsqueda y análisis de documentación interna: un agente MCP local lee contratos, procedimientos, correos y expedientes a través de un servidor MCP de sistema de archivos, y responde preguntas en lenguaje natural. Ningún documento sale de la empresa.
Consultas al ERP en lenguaje natural: el agente llama a un servidor MCP de base de datos conectado a tu ERP (SAP Business One, Odoo o similar). Un usuario pregunta: "¿Qué facturas de clientes llevan más de 30 días pendientes?" y recibe una respuesta estructurada. Sin conector en la nube, sin clave de API en manos de terceros.
Flujo de reuniones de extremo a extremo: combina Whisper local para el reconocimiento de voz con un servidor MCP de archivos local y un servidor MCP de calendario interno. La cadena, grabación de audio, transcripción, resumen, archivo, se ejecuta íntegramente en tu hardware. Cada paso, desde la voz hasta la nota archivada, permanece dentro de tu red.
Asistente para cumplimiento y auditoría interna: el agente consulta políticas internas, contratos vigentes y registros de actividad a través de servidores MCP locales para responder preguntas de cumplimiento del equipo legal o de auditoría. Sin exponer datos sensibles a ningún servicio externo.
Kit Digital: una vía de financiación para este tipo de proyectos
Las pymes españolas que quieran desplegar un stack de agentes IA local pueden explorar el programa Kit Digital como fuente de financiación. Según nuestra interpretación de las categorías elegibles, soluciones de gestión documental inteligente, automatización de procesos y herramientas de análisis de datos basadas en IA pueden encajar en varias de las categorías del programa.
La clave está en el diseño del proyecto: un piloto bien definido, con un caso de uso concreto, hardware seleccionado, modelo validado y métricas de éxito claras, facilita tanto la elegibilidad como la justificación del gasto. Nuestro programa de proyecto piloto está diseñado exactamente para generar esa documentación, que sirve de base tanto para la implantación como para solicitudes de ayuda.
Soberanía de datos en toda la cadena del agente
Un LLM local por sí solo no protege todos los flujos de datos de un agente IA. Solo cuando los servidores MCP también se ejecutan localmente se consigue la soberanía completa: las peticiones al modelo se quedan en local, las llamadas a herramientas se quedan en local, los registros se quedan en local.
Las herramientas para lograrlo ya están maduras. Modelos como Qwen3 y Gemma 4 gestionan tool calling de forma fiable en producción; frameworks como Unsloth Studio reducen considerablemente la complejidad de la configuración. El momento adecuado para empezar es ahora, antes de que competidores que dependen de agentes en la nube acumulen compromisos de privacidad que tú podrás evitar.
Si quieres saber qué stack de agentes local se adapta mejor a tu caso de uso e infraestructura, cuéntanoslo.