Jedes Unternehmen kennt das Problem: eine Stunde Videokonferenz, am Ende drei handgeschriebene Seiten Notizen, und zwei Wochen später fragt die Kollegin nach dem Beschluss aus Punkt vier der Tagesordnung, und niemand kann ihn mit Sicherheit benennen. Cloud-basierte Transkriptions-Tools lösen das technisch. Aber sie schicken jede Silbe an fremde Server: Kundengespräche, Betriebsratssitzungen, Strategiemeetings, Gehaltsverhandlungen. Unter der DSGVO ist das ein erhebliches Risiko.
Es gibt eine bessere Option: Whisper, das quelloffene Spracherkennungsmodell von OpenAI, läuft vollständig auf Ihrer eigenen Hardware, ohne API-Key, ohne Datentransfer, ohne Drittanbieter-Abhängigkeit.
Was Whisper kann
OpenAI veröffentlichte Whisper im September 2022 als Open-Weights-Modell, trainiert auf 680.000 Stunden mehrsprachigem Audio. Das aktuelle Modell Whisper large-v3 erreicht laut Community-Benchmarks eine Wortfehlerrate unter 3 Prozent bei sauberem Englisch, vergleichbar mit kommerziellen Diensten wie Google Speech-to-Text und Azure Cognitive Services. Praktiker aus dem deutschsprachigen Raum berichten von ähnlich guten Ergebnissen auf Deutsch, Spanisch und anderen europäischen Sprachen bei ausreichender Audioqualität.
Whisper turbo, eine optimierte Variante, ist laut gemessener Community-Erfahrung 6 bis 8 Mal schneller als large-v3 bei kaum merklichem Qualitätsverlust unter Alltagsbedingungen. Für Meeting-Transkription, wo Vollständigkeit wichtiger ist als Echtzeit, ist turbo in den meisten Fällen die praktisch beste Wahl.
faster-whisper vs. whisper.cpp: die zwei dominanten Varianten
Zwei Bibliotheken dominieren die lokale Praxis:
faster-whisper nutzt die CTranslate2-Engine und erreicht laut Berichten aus der Practitioner-Community etwa den 4-fachen Durchsatz gegenüber der Original-Whisper-Implementierung auf NVIDIA-GPUs durch int8-Quantisierung. Besonders nützlich: die integrierte Silero-VAD-Funktion überspringt automatisch Stille und Hintergrundgeräusche, kritisch für typische Office-Recordings mit Tastaturgeräuschen, Pausen und überlappenden Stimmen.
whisper.cpp ist für CPU-Betrieb optimiert und läuft daher auch ohne GPU stabil. Auf Apple Silicon (Mac Studio M3 Ultra, MacBook Pro M3 Max) berichten Community-Nutzer von Transkriptionsgeschwindigkeiten im 10- bis 15-fachen Echtzeittempo, eine 60-Minuten-Aufnahme in 4 bis 6 Minuten, ohne GPU.
Die Wahl ist pragmatisch:
- NVIDIA-GPU-Umgebung → faster-whisper
- Apple Silicon oder reiner CPU-Linux-Server → whisper.cpp
Sprechertrennung: wer hat was gesagt?
Whisper gibt einen undifferenzierten Textblock aus. FĂĽr ein nutzbares Protokoll brauchen Sie die Zuordnung zu Personen. Das ĂĽbernimmt Speaker Diarization, der Prozess, Audio in Sprechabschnitte aufzuteilen.
Die meistgenutzte Open-Source-Option ist pyannote.audio: es segmentiert die Aufnahme nach Sprecher, bevor Whisper die einzelnen Abschnitte transkribiert. Das Ergebnis ist ein strukturiertes Transkript mit "[Sprecherin A]: ..." statt eines langen Fließtexts. Praktiker berichten, dass die Kombination pyannote + faster-whisper auf einem Linux-Server mit NVIDIA RTX 4090 stabil läuft; Apple-Silicon-Setups sind möglich, erfordern aber etwas mehr Konfigurationsaufwand.
Setup-Ăśberblick fĂĽr ein typisches KMU
Ein produktionsfähiges Setup für 10 bis 50 Nutzer:innen braucht nur wenige Komponenten:
- Hardware: Mac Studio M3 Ultra (192 GB Unified Memory) oder ein Linux-Server mit NVIDIA-GPU. FĂĽr kleine Teams reicht ein Server-PC mit 32 GB RAM fĂĽr die CPU-Variante.
- Modell: Whisper turbo (multilingual) für den Alltagsbetrieb, large-v3 für höchste Präzision bei starken Akzenten.
- Bibliothek: faster-whisper (NVIDIA) oder whisper.cpp (Apple Silicon / CPU).
- Post-Processing: Ollama mit einem lokalen LLM, Llama 3.3 70B oder Qwen2.5 32B, fĂĽr Zusammenfassung und Strukturierung.
- Integration: Ăśbergabe der strukturierten Protokolldaten per API an Ihr bestehendes System: E-Mail, Ticketsystem oder kAIra MailForge.
Der gesamte Datenstrom bleibt auf Ihrer Hardware. Nichts verlässt Ihr Netzwerk.
Vom Transkript zum strukturierten Protokoll
Whisper liefert Text. Ein Meeting-Protokoll enthält mehr: Tagesordnungsstruktur, Beschlüsse, Aktionspunkte mit Verantwortlichen und Fristen. Das lokale LLM schließt diese Lücke.
Ein schlanker Workflow:
- Whisper transkribiert die Aufnahme → roher Textblock mit Zeitstempeln.
- Ein lokales LLM (Llama 3.3 70B via Ollama) verarbeitet ihn mit dem Prompt: "Extrahiere Tagesordnungspunkte, BeschlĂĽsse und offene Aufgaben mit Verantwortlichen und Deadlines im Format Markdown."
- Das strukturierte Ergebnis wird in eine Protokollvorlage eingebettet.
- Optional: automatischer Versand an die Teilnehmerliste und Anlage von Tickets im Projektmanagement-Tool.
Die gesamte Pipeline läuft auf Ihrer eigenen Infrastruktur, vollständig lokal, ohne Cloud-Kontakt.
Neue Mitbewerber: Voxtral und weitere Modelle
Whisper ist nicht mehr allein. Im Februar 2026 veröffentlichte Mistral AI Voxtral Transcribe 2, eine zweite Generation ihrer Speech-to-Text-Familie mit zwei Varianten: Voxtral Mini Transcribe V2 für Batch-Transkription und Voxtral Realtime für Live-Streaming. Laut Herstellerangaben und ersten Community-Vergleichen ist Voxtral stärker auf Mehrsprachen-Performance optimiert.
Der entscheidende Unterschied aus KMU-Perspektive: Voxtral ist primär als Cloud-API konzipiert. Whisper (und seine Varianten faster-whisper und whisper.cpp) bleiben die einzige ausgereifte Option, die vollständig lokal und ohne Cloud-Verbindung läuft.
DSGVO-Vorteil: warum lokale Transkription entscheidend ist
Meetings enthalten regelmäßig personenbezogene Daten im Sinne der DSGVO: Namen, Gehaltsinformationen, Gesundheitsinfos von Mitarbeitenden, Kundenstammdaten. Jede Übertragung dieser Daten an einen Cloud-Dienst setzt voraus:
- Eine Rechtsgrundlage (Art. 6 DSGVO) fĂĽr die Weitergabe
- Einen abgeschlossenen Auftragsverarbeitungsvertrag (Art. 28 DSGVO) mit dem Anbieter
- Bei US-Anbietern: zusätzliche Transfergarantien (Art. 46 DSGVO)
Bei lokaler Verarbeitung entfallen diese Anforderungen vollständig. Die Daten verlassen nie Ihr Netzwerk. Es gibt keine Drittlandproblematik, keinen AVV mit einem US-Anbieter, kein Risiko aus künftigen Gerichtsurteilen wie Schrems II und möglichen Nachfolgern.
Zusätzlich schreibt EU AI Act Art. 50 vor, dass KI-generierte Zusammenfassungen, die Sachverhalte oder Meinungen realer Personen wiedergeben, als KI-generiert gekennzeichnet sein müssen. Das lässt sich intern dokumentieren, deutlich einfacher, wenn die gesamte Pipeline unter Ihrer eigenen Kontrolle steht. Mehr zu unserer Interpretation dieser Datenschutzpflichten finden Sie auf unserer Seite zur Datensouveränität.
Praxisbeispiele fĂĽr KMU
Rechtsanwaltskanzlei (12 Personen): Mandantengespräche werden aufgezeichnet, lokal transkribiert und als Gesprächsvermerk in die Fallakte eingepflegt. Mandantendaten verlassen nie den Server der Kanzlei.
Produktionsunternehmen (80 Mitarbeitende): Wöchentliche Produktionsbesprechungen werden automatisch protokolliert. Aktionspunkte landen direkt in Jira, ohne manuelle Nachbearbeitung durch die Assistenz.
HR-Abteilung eines Mittelständlers: Bewerbungsgespräche werden mit Whisper transkribiert. Kein Cloud-Dienst erhält Zugang zu den Bewerberdaten. Datenminimierung nach Art. 5 DSGVO ist technisch sichergestellt, nicht nur dokumentiert.
Beratungsunternehmen: Kundenmeetings in drei Sprachen (Deutsch, Englisch, Spanisch) werden automatisch transkribiert. Das mehrsprachige Whisper-Modell wechselt die Sprache je nach Aufnahme ohne Konfigurationsaufwand.
Nächste Schritte
Wenn Sie Meeting-Protokollierung ohne Cloud-Abhängigkeit einführen möchten, oder eine Transkriptionspipeline an Ihre bestehenden Prozesse anschließen wollen, starten Sie mit einem Pilotprojekt bei Freshlab: 14 Tage, feste Kosten, eine saubere Entscheidungsgrundlage am Ende.
FĂĽr Fragen zu lokaler KI-Infrastruktur in Ihrem Unternehmen: Kontaktieren Sie uns, wir beraten auf Deutsch, Englisch und Spanisch.