Todas las empresas conocen el problema: una hora de videollamada, tres páginas de notas dispersas y dos semanas después nadie recuerda con exactitud qué se acordó en el punto cuatro del orden del día. Las herramientas de transcripción en la nube resuelven la parte técnica, pero envían cada palabra de cada conversación con clientes, reunión de dirección y entrevista de recursos humanos a servidores de terceros. Bajo el RGPD, eso es un riesgo de cumplimiento real.
Existe una alternativa: Whisper, el modelo de reconocimiento de voz de código abierto de OpenAI, se ejecuta completamente en su propio hardware, sin clave de API, sin transferencia de datos, sin dependencia de proveedores externos.
Qué es Whisper
OpenAI publicó Whisper en septiembre de 2022 como modelo de pesos abiertos entrenado con 680.000 horas de audio multilingüe. El modelo actual, Whisper large-v3, alcanza una tasa de error de palabras inferior al 3 % en audio limpio en inglés, según mediciones reportadas por la comunidad, comparable a servicios comerciales como Google Speech-to-Text y Azure Cognitive Services. Los profesionales reportan resultados similares en español, alemán, francés y otras lenguas europeas con audio de calidad razonable.
Whisper turbo, una variante optimizada, es entre 6 y 8 veces más rápido que large-v3 según mediciones de la comunidad, con pérdida de precisión mínima en condiciones reales. Para transcripción de reuniones, donde la completitud importa más que el tiempo real, turbo es la opción práctica por defecto para la mayoría de los equipos.
Las dos variantes más utilizadas
faster-whisper emplea el motor CTranslate2 para lograr aproximadamente cuatro veces más rendimiento que la implementación original de Whisper en GPUs NVIDIA mediante cuantización int8, según reportes de la comunidad de practicantes. La integración incorporada de Silero VAD omite automáticamente silencios y ruido de fondo, esencial para grabaciones de oficina con teclados, pausas y voces superpuestas.
whisper.cpp está optimizado para CPU y funciona sin GPU. En Apple Silicon (Mac Studio M3 Ultra, MacBook Pro M3 Max), los usuarios de la comunidad reportan velocidades de transcripción de 10 a 15 veces el tiempo real: una grabación de 60 minutos procesada en menos de 6 minutos, únicamente con CPU.
La elección es práctica:
- Entorno con GPU NVIDIA → faster-whisper
- Apple Silicon o servidor Linux solo CPU → whisper.cpp
Diarización: quién dijo qué
La salida bruta de Whisper es un bloque de texto sin atribución. Para un acta útil se necesita asignar fragmentos a personas específicas, proceso denominado diarización de locutor.
pyannote.audio es la opción de código abierto dominante. Segmenta el audio por locutor antes de que Whisper transcriba cada segmento, produciendo un transcript estructurado con "[Locutor A]: ..." en lugar de un bloque de texto continuo. Los practicantes reportan que la combinación pyannote + faster-whisper funciona de forma estable en servidores Linux con GPU NVIDIA RTX 4090; las configuraciones en Apple Silicon son posibles, aunque requieren algo más de trabajo de configuración.
Una pila lista para producción en una PYME
Un pipeline de transcripción de reuniones para un equipo de 10 a 50 personas necesita pocos componentes:
- Hardware: Mac Studio M3 Ultra (192 GB de memoria unificada) o un servidor Linux con GPU NVIDIA. Un servidor bien configurado con 32 GB de RAM es suficiente para equipos pequeños en modo CPU.
- Modelo: Whisper turbo (multilingüe) para velocidad; large-v3 para máxima precisión con acentos marcados.
- Librería: faster-whisper o whisper.cpp según el entorno.
- Postprocesamiento: Ollama con un LLM local, Llama 3.3 70B o Qwen2.5 32B, para extraer la estructura del acta.
- Integración: Actas en Markdown o JSON entregadas vía API a sus sistemas existentes.
Todo el flujo de datos permanece en su hardware. Nada sale de su red.
Del transcript bruto al acta estructurada
Whisper produce texto. Un acta de reunión necesita más: estructura por puntos del orden del día, acuerdos, acciones con responsables y plazos. El LLM local cierra esa brecha.
Un flujo de trabajo mínimo:
- Whisper transcribe la grabación → texto bruto con marcas de tiempo.
- Un LLM local (Llama 3.3 70B vía Ollama) lo procesa: "Extrae los puntos del orden del día, los acuerdos y las tareas pendientes con responsables y plazos. Formato Markdown."
- El resultado estructurado se integra en una plantilla de acta.
- Opcional: distribución automática a los participantes y creación de tareas en la herramienta de gestión de proyectos.
Todo el pipeline corre en su propia infraestructura, sin nube, sin costes de API, sin dependencia de proveedores.
Nueva competencia: Voxtral y otras alternativas
Whisper ya no es el único modelo serio. En febrero de 2026, Mistral AI publicó Voxtral Transcribe 2, una segunda generación de su familia de speech-to-text que incluye Voxtral Mini Transcribe V2 para transcripción en lote y Voxtral Realtime para streaming en vivo. Según las cifras publicadas por Mistral y los primeros análisis de la comunidad, Voxtral apunta a una fuerte cobertura multilingüe.
La diferencia clave para las PYMEs: Voxtral es principalmente una API en la nube. Whisper, y sus variantes faster-whisper y whisper.cpp, sigue siendo la única opción madura que funciona completamente en sus propias instalaciones sin ninguna conexión a la nube.
Otros modelos de código abierto que han ganado terreno en 2025-2026 (Canary, Granite Speech) tienen una cobertura multilingüe más estrecha que las 99 lenguas de Whisper. Para equipos europeos multilingües, Whisper large-v3 y turbo siguen siendo la opción práctica.
Por qué la transcripción local es la decisión correcta bajo el RGPD
El audio de reuniones contiene habitualmente datos personales en el sentido del RGPD: nombres de empleados, información salarial, datos de salud, información de clientes. Enviar eso a cualquier servicio en la nube requiere:
- Una base jurídica (art. 6 RGPD) para la transferencia
- Un contrato de encargado de tratamiento (art. 28 RGPD) firmado con el proveedor
- Para proveedores estadounidenses: garantías adicionales de transferencia (art. 46 RGPD)
El tratamiento local elimina todos estos requisitos. Los datos nunca salen de su red. No hay ninguna decisión de adecuación en la que confiar, ningún contrato que negociar, ningún riesgo derivado de futuros pronunciamientos judiciales.
El Reglamento de IA (art. 50) añade además un requisito de transparencia: los resúmenes generados por IA que "representen opiniones o declaraciones de personas reales" deben identificarse como generados por IA. Ese requisito es fácil de gestionar internamente, y mucho más sencillo de documentar cuando todo el pipeline está bajo su propio control. Puede consultar nuestra interpretación detallada en nuestra página sobre soberanía del dato.
Casos prácticos en PYMEs
Despacho de abogados (10 personas): Las consultas con clientes se transcriben y archivan como notas de expediente sin que ningún dato de clientes salga del servidor del despacho.
Empresa de fabricación (60 empleados): Las reuniones semanales de producción se transcriben automáticamente; las acciones se envían directamente a Jira sin seguimiento manual.
Departamento de RRHH: Las entrevistas de trabajo se transcriben localmente; ningún servicio en la nube accede a los datos de los candidatos; la minimización de datos del art. 5 RGPD queda garantizada técnicamente, no solo documentada.
Consultora multilingüe: Reuniones con clientes en español, inglés y alemán transcritas automáticamente. El modelo multilingüe de Whisper cambia de idioma por grabación sin configuración adicional.
Kit Digital: posible vía de financiación
La implantación de herramientas de IA local, incluyendo infraestructura de transcripción y análisis, puede enmarcarse en la categoría "Inteligencia Artificial y Analítica" del programa Kit Digital. Según nuestra interpretación de la normativa vigente, la solución puede ser elegible como servicio de digitalización, con ayudas de hasta 6.000 € para empresas del segmento II (3 a 9 empleados) y hasta 12.000 € para el segmento I (10 a 49 empleados) y cantidades superiores para segmentos mayores. Consulte con su agente digitalizador para confirmar la elegibilidad específica de su proyecto.
Más información sobre cómo combinar la subvención con IA local en nuestra guía Kit Digital.
Primeros pasos
Si desea poner en marcha la transcripción de reuniones completamente en sus instalaciones, o conectar el pipeline a sus flujos de trabajo existentes, inicie un proyecto piloto con Freshlab: 14 días, alcance fijo, una decisión clara al final.
¿Preguntas? Contáctenos directamente. Trabajamos en español, inglés y alemán.