Spracherkennung lokal und DSGVO-konform: Whisper, Voxtral und Parakeet im Vergleich

Hinweis zum Inhalt: Die Informationen in diesem Artikel wurden nach bestem Wissen zum Zeitpunkt der Veröffentlichung zusammengestellt. Technische Details, Preise, Versionen, Lizenzmodelle und externe Inhalte können sich ändern. Bitte prüfen Sie die genannten Angaben eigenständig, insbesondere vor geschäftskritischen oder sicherheitsrelevanten Entscheidungen. Dieser Artikel ersetzt keine individuelle Fach-, Rechts- oder Steuerberatung.

Diktate, Besprechungen oder Telefonate im eigenen Netz transkribieren? WZ-IT betreibt Speech-to-Text-Modelle wie Whisper oder Voxtral auf dem AI Cube im Unternehmensnetz oder auf einem Managed GPU Server, siehe den KI-Hub. Termin vereinbaren
Spracherkennung ist eine der KI-Anwendungen mit dem klarsten Nutzen: Diktate werden zu Text, Besprechungen zu Protokollen, Telefonate zu durchsuchbaren Notizen. Gleichzeitig ist Audio besonders sensibel. Eine Aufnahme enthält neben dem Inhalt die Stimme selbst, oft Namen, Gesundheitsangaben oder Mandatsdetails, und sie entsteht häufig in Situationen, in denen Betroffene nicht mit einer Weitergabe rechnen.
Cloud-Dienste für Transkription verarbeiten diese Daten beim Anbieter. Offene Modelle wie OpenAI Whisper, Mistral Voxtral und NVIDIA Parakeet laufen dagegen vollständig auf eigener Hardware. Dieser Beitrag vergleicht die Modelle anhand ihrer Model Cards (Lizenz, Größe, Deutsch-Unterstützung), zeigt die gängigen Laufzeitumgebungen, die Sprechertrennung mit pyannote und den rechtlichen Rahmen aus DSGVO, StGB und KI-Verordnung. Alle Modellangaben haben den Stand September 2026.
Inhaltsverzeichnis
- Was Spracherkennung lokal bedeutet
- Die Modelle im Überblick: Whisper, Voxtral, Parakeet
- Deutsch: was die Herstellerangaben aussagen
- Laufzeitumgebungen und Schnittstellen
- Sprechertrennung mit pyannote
- Halluzinationen und Qualitätssicherung
- Hardware: was auf 24 GB, 96 GB und den AI Cube passt
- Rechtlicher Rahmen: DSGVO, StGB und KI-Verordnung
- Anwendungsfälle: Besprechung, Diktat, Telefon
- Unser Vorgehen bei WZ-IT
- Weiterführende Guides
Was Spracherkennung lokal bedeutet
Lokal heißt: Das Modell und die Audiodateien liegen auf einem Server, den das Unternehmen selbst kontrolliert, im eigenen Netz oder in einem dedizierten Rechenzentrumsserver. Weder Audio noch Transkript gehen an einen Modellanbieter. Eine typische Kette besteht aus vier Schritten:
| Schritt | Aufgabe | Beispiele |
|---|---|---|
| Aufnahme und Vorverarbeitung | Audio in ein einheitliches Format bringen (meist 16 kHz mono), Stille erkennen | ffmpeg, Voice Activity Detection (Silero VAD) |
| Erkennung (ASR) | Sprache in Text umwandeln, mit Zeitstempeln | Whisper, Voxtral, Parakeet |
| Sprechertrennung | Abschnitte Sprechern zuordnen | pyannote |
| Weiterverarbeitung | Zusammenfassung, Protokoll, Übergabe an Fachsoftware | lokales Sprachmodell, n8n, Schnittstelle |
Die Erkennung selbst ist der rechenintensivste Teil, aber nicht der einzige, der Daten berührt. Auch die Zusammenfassung durch ein Sprachmodell sollte lokal laufen, sonst verlässt das Transkript im letzten Schritt doch das Haus.
Die Modelle im Überblick: Whisper, Voxtral, Parakeet
| Modell | Hersteller | Parameter | Lizenz | Sprachen | Veröffentlicht |
|---|---|---|---|---|---|
| Whisper large-v3 | OpenAI | 1,55 Mrd. | MIT (Repository), Model Card nennt Apache 2.0 | 99 | 06.11.2023 |
| Whisper large-v3-turbo | OpenAI | 809 Mio. | MIT | 99 (nur Transkription, keine Übersetzung) | 01.10.2024 |
| Voxtral Mini 3B (2507) | Mistral AI | 3 Mrd. laut Mistral | Apache 2.0 | 8, darunter Deutsch | 15.07.2025 |
| Voxtral Small 24B (2507) | Mistral AI | 24 Mrd. | Apache 2.0 | 8, darunter Deutsch | 15.07.2025 |
| Voxtral Mini 4B Realtime (2602) | Mistral AI | 4 Mrd. | Apache 2.0 | 13, darunter Deutsch | Februar 2026 |
| Parakeet TDT 0.6B v3 | NVIDIA | 600 Mio. | CC BY 4.0 | 25 europäische, darunter Deutsch | 14.08.2025 |
| Canary-1B-v2 | NVIDIA | 978 Mio. | CC BY 4.0 | 25 europäische, darunter Deutsch | 14.08.2025 |
Quellen: Model Cards von Whisper large-v3, Whisper large-v3-turbo, Voxtral Mini 3B, Voxtral Small 24B, Voxtral Mini 4B Realtime, Parakeet TDT 0.6B v3 und Canary-1B-v2, Veröffentlichungsdaten von Whisper aus den Ankündigungen zu large-v3 und turbo.
Whisper ist der Standard, an dem sich andere Modelle messen. Das Whisper-Repository stellt Code und Gewichte unter MIT-Lizenz. Whisper verarbeitet Audio in Fenstern von 30 Sekunden; für längere Aufnahmen setzt die Laufzeitumgebung die Abschnitte zusammen. large-v3-turbo reduziert die Decoder-Schichten von 32 auf 4, ist dadurch deutlich schneller und laut OpenAI mit einer geringen Qualitätseinbuße verbunden. Für Übersetzung in Englisch ist turbo nicht trainiert.
Voxtral ist ein Sprachmodell mit Audio-Eingang. Neben der reinen Transkription beantwortet es Fragen zum Gesprochenen und fasst zusammen, ohne separates Sprachmodell. Laut Mistral verarbeitet Voxtral bis zu 30 Minuten Audio für Transkription und bis zu 40 Minuten für Verständnisaufgaben bei 32.000 Token Kontext. Voxtral Mini 4B Realtime ist auf Live-Transkription ausgelegt, mit einstellbarer Verzögerung zwischen 80 ms und 2,4 s.
Parakeet ist ein reines Erkennungsmodell aus dem NVIDIA-NeMo-Framework. Es liefert Satzzeichen, Groß- und Kleinschreibung sowie Zeitstempel auf Wort- und Segmentebene. Laut Model Card verarbeitet es bis zu 24 Minuten Audio am Stück mit voller Attention und bis zu drei Stunden mit lokaler Attention. Canary-1B-v2 aus derselben Reihe übersetzt zusätzlich zwischen Englisch und den 24 anderen Sprachen.
Zur Lizenz: MIT und Apache 2.0 erlauben die kommerzielle Nutzung ohne weitere Auflagen außer dem Lizenzhinweis. CC BY 4.0 erlaubt sie ebenfalls, verlangt aber eine Namensnennung. Für ein internes Werkzeug ist das unkritisch, in einem Produkt für Dritte gehört der Hinweis in die Dokumentation.
Nicht alle Voxtral-Modelle sind offen. Das im Februar 2026 vorgestellte Voxtral Mini Transcribe V2 mit integrierter Sprechertrennung bietet Mistral nur über die eigene API an. Offene Gewichte gibt es aus dieser Generation nur für Voxtral Realtime.
Deutsch: was die Herstellerangaben aussagen
Für Entscheider ist die Wortfehlerrate (Word Error Rate, WER) auf Deutsch die naheliegende Kennzahl. Die verfügbaren Werte stammen allerdings von den Herstellern selbst:
| Modell | Datensatz | WER Deutsch | Quelle |
|---|---|---|---|
| Parakeet TDT 0.6B v3 | FLEURS | 5,04 % | Model Card |
| Parakeet TDT 0.6B v3 | CoVoST | 4,84 % | Model Card |
| Voxtral Mini 4B Realtime | FLEURS, 480 ms Verzögerung | 6,19 % | Model Card |
| Whisper large-v3 | keine deutsche Einzelangabe in der Model Card | - | Model Card |
Diese Zahlen sind nicht direkt vergleichbar. Normalisierung von Satzzeichen und Zahlen, Dekodierungsparameter und Testaufbau unterscheiden sich, und ein Echtzeitmodell mit 480 ms Verzögerung arbeitet unter anderen Bedingungen als ein Modell, das die gesamte Datei kennt. FLEURS und CoVoST bestehen aus vorgelesenen Sätzen in guter Aufnahmequalität. Telefonaudio mit 8 kHz, Raumhall in Besprechungen, Dialekt und Fachvokabular (Medikamentennamen, Aktenzeichen, Produktbezeichnungen) verschlechtern die Ergebnisse aller Modelle.
Mistral gibt an, dass Voxtral Whisper large-v3 in den eigenen Tests übertrifft (Mistral). Auch das ist eine Herstelleraussage. Für die Auswahl zählt ein Test mit 30 bis 60 Minuten eigener Aufnahmen, die von Hand korrekt transkribiert wurden. Die WER lässt sich daraus mit Standardwerkzeugen wie jiwer berechnen, und Fachbegriffe gehören als eigene Prüfliste dazu.
Laufzeitumgebungen und Schnittstellen
Das Modell allein ist noch kein Dienst. Zwischen Modell und Anwendung liegt eine Laufzeitumgebung, die Audio annimmt, das Modell ausführt und Text mit Zeitstempeln zurückgibt.
| Werkzeug | Lizenz | Aufgabe |
|---|---|---|
| faster-whisper | MIT | Whisper auf Basis von CTranslate2, laut Projekt bis zu viermal schneller als die Referenzimplementierung bei gleicher Genauigkeit, int8 auf GPU und CPU |
| WhisperX | BSD-2-Clause | Whisper mit Voice Activity Detection, Wort-Zeitstempeln über wav2vec2-Alignment und Sprechertrennung über pyannote |
| Speaches | MIT | OpenAI-kompatibler Server für Transkription (faster-whisper) und Sprachausgabe, mit Streaming |
| vLLM | Apache 2.0 | Transcriptions-API unter /v1/audio/transcriptions für ASR-Modelle; Mistral empfiehlt vLLM für Voxtral |
| NVIDIA NeMo | Apache 2.0 | Framework für Parakeet und Canary |
Für die Integration ist die Schnittstelle wichtiger als das Modell. Speaches und vLLM bieten einen Endpunkt im Format der OpenAI-Audio-API. Anwendungen, die bereits für eine Cloud-Transkription gebaut sind, lassen sich damit über Basis-URL und Modellname auf den eigenen Server umstellen. WZ-IT betreibt Speaches als verwalteten Dienst und vLLM für Sprach- und Audiomodelle. Wie sich vLLM von Ollama und llama.cpp unterscheidet, zeigt der Beitrag vLLM, Ollama oder llama.cpp.
Wer Nextcloud nutzt, kann Transkription auch über den Nextcloud Assistant anbinden; die Neuerungen in Version 35 beschreibt der Beitrag zu Nextcloud 35.
Sprechertrennung mit pyannote
Ein Besprechungsprotokoll braucht die Information, wer was gesagt hat. Whisper, Voxtral 2507 und Parakeet liefern diese Information nicht. Sie entsteht in einem zweiten Schritt, der Diarisierung.
Die verbreitete offene Lösung ist pyannote. Das aktuelle offene Modell speaker-diarization-community-1 steht unter CC BY 4.0, läuft mit pyannote.audio 4.x und lässt sich nach dem Herunterladen vollständig offline betreiben. Der Download setzt eine Registrierung auf Hugging Face voraus, bei der Kontaktdaten an die Entwickler gehen. Das leistungsstärkere Modell precision-2 läuft dagegen nur über die API von pyannoteAI und ist damit für den lokalen Betrieb nicht geeignet.
Zwei Punkte gehören in die Planung:
- Platzhalter statt Namen. Die Diarisierung vergibt Kennungen wie SPEAKER_00. Die Zuordnung zu Personen geschieht manuell oder über einen Abgleich mit gespeicherten Stimmprofilen.
- Stimmprofile sind heikel. Daten, die eine eindeutige Identifizierung einer Person anhand verhaltenstypischer oder physiologischer Merkmale ermöglichen, sind biometrische Daten nach Art. 4 Nr. 14 DSGVO. Werden sie zur Identifizierung verarbeitet, gilt Art. 9 DSGVO. Für die meisten Protokolle genügt die manuelle Zuordnung.
Überlappende Sprache bleibt eine Schwäche aller Verfahren. Auch Mistral weist für das eigene API-Modell darauf hin, dass bei gleichzeitigem Sprechen meist nur ein Sprecher transkribiert wird (Mistral).
Halluzinationen und Qualitätssicherung
Spracherkennung mit generativen Modellen kann Text erzeugen, der nicht gesprochen wurde. Die Model Card von Whisper large-v3 nennt diese Einschränkung ausdrücklich. Eine Untersuchung von Koenecke et al. (Careless Whisper, ACM FAccT 2024) fand in rund 1 % der Transkriptionen ganze erfundene Sätze oder Satzteile; 38 % dieser Halluzinationen enthielten problematische Inhalte wie falsche Zuschreibungen.
Maßnahmen, die das Risiko senken:
| Maßnahme | Wirkung |
|---|---|
| Voice Activity Detection vor der Erkennung | Stille Abschnitte werden nicht an das Modell gegeben; WhisperX nennt dies als Mittel gegen Halluzinationen |
| Sprache fest einstellen | verhindert Fehlerkennung der Sprache bei kurzen Abschnitten |
| Zeitstempel im Transkript behalten | jede Passage lässt sich an der Aufnahme nachhören |
| Prüfung vor der Ablage | bei Arztbriefen, Schriftsätzen und Protokollen mit Rechtswirkung zwingend |
| Fachvokabular testen | eigene Prüfliste mit Namen, Medikamenten, Aktenzeichen |
Ein Transkript ist ein Entwurf. Für Dokumente, auf die sich Entscheidungen stützen, gehört ein menschlicher Prüfschritt in den Ablauf, und das Audio sollte bis zum Abschluss der Prüfung verfügbar bleiben.
Hardware: was auf 24 GB, 96 GB und den AI Cube passt
Spracherkennung braucht deutlich weniger Grafikspeicher als große Sprachmodelle. Die Herstellerangaben:
| Modell | Speicherbedarf laut Hersteller |
|---|---|
| Whisper large-v3 | rund 10 GB VRAM (OpenAI) |
| Whisper large-v3-turbo | rund 6 GB VRAM (OpenAI) |
| Voxtral Mini 3B | rund 9,5 GB in bf16 oder fp16 (Model Card) |
| Voxtral Mini 4B Realtime | GPU mit mindestens 16 GB (Model Card) |
| Voxtral Small 24B | rund 55 GB in bf16 oder fp16 (Model Card) |
| Parakeet TDT 0.6B v3 | mindestens 2 GB RAM zum Laden (Model Card) |
Daraus ergibt sich für die Angebote von WZ-IT:
| Plattform | Speicher | Geeignet für |
|---|---|---|
| Managed GPU Server 24 (NVIDIA RTX PRO 4000 Blackwell) | 24 GB GDDR7 ECC | Whisper, Parakeet, Voxtral Mini und Realtime; parallel ein kleineres Sprachmodell für Zusammenfassungen, je nach Auslastung |
| Managed GPU Server 96 (NVIDIA RTX PRO 6000 Blackwell Max-Q) | 96 GB GDDR7 ECC | zusätzlich Voxtral Small 24B in bf16 oder Spracherkennung neben einem größeren Sprachmodell |
| AI Cube (NVIDIA GB10) | 128 GB Unified Memory | Spracherkennung und Sprachmodell auf einem Gerät im eigenen Netz |
Der Managed GPU Server 24 kostet 699 € netto pro Monat zuzüglich 499 € einmaliger Einrichtung, der Managed GPU Server 96 1.799 € netto pro Monat zuzüglich 999 € Einrichtung. Der AI Cube kostet 6.490 € netto einmalig, AI Cube Care für den laufenden Betrieb 349,90 € netto pro Monat. Wie viele gleichzeitige Nutzer und Aufgaben ein System trägt, beschreibt der Artikel zur Dimensionierung lokaler KI-Server. Die Rechnung für Sprachmodelle zeigt die VRAM-Dimensionierung.
Der Durchsatz hängt von Modell, Laufzeitumgebung, Batch-Größe und Audioqualität ab. Belastbare Werte entstehen nur durch eine Messung auf der Zielhardware mit realistischen Aufnahmen. Beim AI Cube mit Arm-Prozessor ist zusätzlich zu prüfen, ob die gewählte Laufzeitumgebung für die Plattform verfügbar ist.
Rechtlicher Rahmen: DSGVO, StGB und KI-Verordnung
Lokaler Betrieb löst die Frage des Datenwegs, nicht alle Datenschutzpflichten. Die folgende Übersicht ist eine Einordnung, keine Rechtsberatung.
| Regel | Inhalt | Bedeutung für Transkription |
|---|---|---|
| Art. 6 DSGVO | Rechtsgrundlage für jede Verarbeitung | gilt für Aufnahme, Transkript und Zusammenfassung |
| Art. 9 DSGVO | besondere Kategorien, etwa Gesundheitsdaten und biometrische Daten zur Identifizierung | Arztdiktate, Therapiegespräche, Stimmprofile |
| Art. 28 DSGVO | Auftragsverarbeitung | bei Cloud-Diensten erforderlich, bei Betrieb durch einen IT-Dienstleister ebenfalls |
| Art. 35 DSGVO | Datenschutz-Folgenabschätzung | bei umfangreicher Verarbeitung sensibler Daten oder systematischer Überwachung zu prüfen |
| § 203 StGB | Schutz von Berufsgeheimnissen | Offenbarung an mitwirkende Dienstleister nur, soweit erforderlich und mit Verpflichtung zur Verschwiegenheit |
| § 201 StGB | Vertraulichkeit des Wortes | Aufnahme des nichtöffentlich gesprochenen Wortes ohne Befugnis ist strafbar |
| Art. 5 Abs. 1 lit. f KI-Verordnung | Verbot der Emotionserkennung am Arbeitsplatz | Stimmungsanalyse von Beschäftigten im Callcenter unzulässig |
Für Berufsgeheimnisträger erlaubt § 203 Abs. 3 StGB die Offenbarung an sonstige mitwirkende Personen, soweit das für deren Tätigkeit erforderlich ist; Abs. 4 macht den Berufsgeheimnisträger dafür verantwortlich, dass diese Personen zur Geheimhaltung verpflichtet wurden. Bei lokaler Verarbeitung auf eigener Hardware entfällt die Offenbarung an einen Modellanbieter. Eine Wartung durch einen IT-Dienstleister fällt weiterhin unter diese Regeln und braucht eine entsprechende Vereinbarung.
Für Aufnahmen im Arbeitsverhältnis kommt das Mitbestimmungsrecht des Betriebsrats nach § 87 Abs. 1 Nr. 6 BetrVG hinzu, wenn die Aufzeichnung zur Leistungs- oder Verhaltenskontrolle geeignet ist. Wie sich ein KI-Assistent mit dem Betriebsrat abstimmen lässt, beschreibt der Artikel KI-Assistent und Betriebsrat. Die übrigen Pflichten aus der KI-Verordnung fasst EU AI Act für Unternehmen zusammen.
Praktisch bewährt haben sich drei Festlegungen: eine Löschfrist für das Audio (etwa nach Freigabe des Transkripts), getrennte Zugriffsrechte für Audio und Text und eine Protokollierung, wer welche Aufnahme transkribiert und abgerufen hat.
Anwendungsfälle: Besprechung, Diktat, Telefon
| Anwendung | Anforderung | Passender Aufbau |
|---|---|---|
| Besprechungsprotokolle | mehrere Sprecher, Zusammenfassung, Aufgaben | Whisper oder Parakeet, pyannote, lokales Sprachmodell für das Protokoll |
| Diktat in Kanzlei oder Praxis | ein Sprecher, Fachvokabular, Berufsgeheimnis | Whisper large-v3 oder Voxtral Mini, Prüfschritt, Übergabe an die Fachsoftware |
| Live-Untertitel und Mitschrift | geringe Verzögerung | Voxtral Mini 4B Realtime oder Streaming über Speaches |
| Callcenter und Telefon | 8-kHz-Audio, viele Stunden pro Tag, Mitbestimmung | Batch-Verarbeitung, Test mit echter Telefonqualität, keine Emotionserkennung bei Beschäftigten |
| Wissenssicherung aus Interviews | lange Aufnahmen, Weiterverwendung in einer Wissensbasis | Transkription mit Zeitstempeln, anschließend Aufbereitung für RAG |
Für Anwaltskanzleien und Arztpraxen beschreiben die Beiträge Lokale KI für Anwaltskanzleien und Lokale KI in der Arztpraxis den weiteren Rahmen. Die Aufbereitung von Gesprächen mit ausscheidenden Mitarbeitenden ist Teil des Angebots Wissenstransfer, das bei Bedarf eine Transkription einschließt.
Unser Vorgehen bei WZ-IT
- Einordnung. Audioquellen, Menge pro Tag, Sprachen und Fachvokabular, Schutzbedarf und Weiterverarbeitung. Daraus folgt, ob Batch-Transkription, Live-Betrieb oder beides gebraucht wird.
- Modelltest mit eigenen Aufnahmen. Eine Auswahl von Whisper, Voxtral und Parakeet gegen von Hand geprüfte Referenztranskripte, mit Wortfehlerrate und Prüfliste für Fachbegriffe.
- Plattform. Betrieb auf dem AI Cube im eigenen Netz oder auf einem Managed GPU Server in Deutschland, mit OpenAI-kompatibler Schnittstelle über Speaches oder vLLM.
- Integration. Sprechertrennung, Zusammenfassung durch ein lokales Sprachmodell, Übergabe an Fachsoftware oder Ablage, Löschfristen und Zugriffsrechte nach Ihrem Datenschutzkonzept.
- Betrieb. Updates, Überwachung und Regressionstest vor Modellwechseln. Support, Beratung und Implementierung durch WZ-IT.
Audioverarbeitung ist eine gesonderte Integration und wird nach fachlicher und technischer Prüfung umgesetzt. Den Rahmen für den laufenden Betrieb beschreibt Managed AI.
Weiterführende Guides
- Lokale KI für Anwaltskanzleien, Berufsgeheimnis, Mandatsdaten und Betrieb auf eigener Hardware.
- Lokale KI in der Arztpraxis, Gesundheitsdaten, Dokumentation und lokale Modelle.
- vLLM, Ollama oder llama.cpp, welche Inferenz-Software für welchen Einsatz passt.
- Dokumente mit KI verarbeiten, wie Transkripte und Dokumente in Abläufe übergehen.
- Dimensionierung lokaler KI-Server, Nutzerzahl, Aufgaben und Hardware.
- KI-Lösungen von WZ-IT, der Hub mit allen Angeboten zu lokaler KI.
Transkription ohne Cloud-Dienst? Wir testen Whisper, Voxtral und Parakeet mit Ihren Aufnahmen und betreiben die Spracherkennung auf dem AI Cube oder einem Managed GPU Server. Termin vereinbaren
Quellen
- OpenAI, Whisper Repository
- OpenAI, Whisper large-v3 Model Card
- OpenAI, Whisper large-v3-turbo Model Card
- OpenAI, Ankündigung Whisper large-v3
- OpenAI, Ankündigung Whisper large-v3-turbo
- Mistral AI, Voxtral
- Mistral AI, Voxtral Transcribe 2
- Mistral AI, Voxtral Mini 3B Model Card
- Mistral AI, Voxtral Small 24B Model Card
- Mistral AI, Voxtral Mini 4B Realtime Model Card
- NVIDIA, Parakeet TDT 0.6B v3 Model Card
- NVIDIA, Canary-1B-v2 Model Card
- pyannote, speaker-diarization-community-1
- SYSTRAN, faster-whisper
- WhisperX
- Speaches
- vLLM, Online Serving
- Koenecke et al., Careless Whisper: Speech-to-Text Hallucination Harms
- DSGVO, Art. 4
- DSGVO, Art. 9
- DSGVO, Art. 35
- § 201 StGB, Verletzung der Vertraulichkeit des Wortes
- § 203 StGB, Verletzung von Privatgeheimnissen
- § 87 BetrVG, Mitbestimmungsrechte
- KI-Verordnung, Art. 5
Spracherkennung im eigenen Netz betreiben
Wir ordnen Ihre Audioquellen und den Schutzbedarf ein, wählen Modell und Laufzeitumgebung, testen mit eigenen Aufnahmen und betreiben die Transkription auf dem AI Cube oder einem Managed GPU Server.
Häufig gestellte Fragen
Antworten auf wichtige Fragen zu diesem Thema
Stand September 2026 sind drei Familien verbreitet: OpenAI Whisper (large-v3 und large-v3-turbo, MIT-Lizenz laut Repository), Mistral Voxtral (Mini 3B, Small 24B und Mini 4B Realtime, jeweils Apache 2.0) und NVIDIA Parakeet TDT 0.6B v3 sowie Canary-1B-v2 (CC BY 4.0, Namensnennung erforderlich). Alle unterstützen Deutsch und erlauben den kommerziellen Einsatz.
Nein. Lokaler Betrieb vermeidet die Übermittlung an Dritte und damit einen Auftragsverarbeitungsvertrag mit einem Cloud-Anbieter. Rechtsgrundlage, Information der Betroffenen, Löschfristen für Audio und Transkript, Zugriffsrechte und gegebenenfalls eine Datenschutz-Folgenabschätzung bleiben Pflicht. Bei Gesundheitsdaten gilt zusätzlich Art. 9 DSGVO.
Ja, das kommt vor. Die Model Card von Whisper large-v3 weist darauf hin, dass Transkripte Text enthalten können, der im Audio nicht gesprochen wurde. Eine Studie (Koenecke et al., ACM FAccT 2024) fand in rund 1 % der untersuchten Transkriptionen ganze erfundene Sätze oder Satzteile. Voice Activity Detection vor der Erkennung verringert das Risiko, ersetzt aber keine menschliche Prüfung bei Arztbriefen oder Schriftsätzen.
Nein. Diarisierung mit pyannote trennt Sprecher und vergibt Platzhalter wie SPEAKER_00 und SPEAKER_01. Wer hinter einem Platzhalter steht, ordnet ein Mensch oder ein weiterer Schritt zu. Wird dafür ein gespeichertes Stimmprofil abgeglichen, kann es sich um biometrische Daten nach Art. 4 Nr. 14 DSGVO handeln, für die Art. 9 DSGVO gilt.
Eine allgemeingültige Rangfolge gibt es nicht. Die Hersteller veröffentlichen eigene Werte, etwa 5,04 % Wortfehlerrate auf FLEURS Deutsch für Parakeet TDT 0.6B v3 und 6,19 % für Voxtral Mini 4B Realtime bei 480 ms Verzögerung. Die Messbedingungen unterscheiden sich, und Fachbegriffe, Dialekte oder Telefonqualität verändern das Ergebnis deutlich. Verlässlich ist nur ein Test mit eigenen Aufnahmen.
Nein. Whisper large-v3-turbo benötigt laut OpenAI rund 6 GB Grafikspeicher, Parakeet TDT 0.6B v3 ist mit 600 Mio. Parametern noch kleiner, und faster-whisper läuft mit int8 auch auf CPU. Eine GPU mit 24 GB reicht für alle Modelle außer Voxtral Small 24B, das in bf16 laut Mistral rund 55 GB Grafikspeicher braucht.
Nein. Wer das nichtöffentlich gesprochene Wort eines anderen ohne Befugnis auf einen Tonträger aufnimmt, macht sich nach § 201 StGB strafbar. Vor der Aufzeichnung braucht es in der Regel die Einwilligung der Beteiligten, zusätzlich eine Rechtsgrundlage nach DSGVO. Im Arbeitsverhältnis ist außerdem der Betriebsrat zu beteiligen, wenn Aufnahmen zur Leistungs- oder Verhaltenskontrolle geeignet sind.
Nein, nicht für Beschäftigte. Art. 5 Abs. 1 lit. f der KI-Verordnung verbietet seit dem 2. Februar 2025 KI-Systeme, die Emotionen natürlicher Personen am Arbeitsplatz ableiten, ausgenommen aus medizinischen oder Sicherheitsgründen. Reine Transkription und Themenauswertung fallen nicht unter dieses Verbot.
Nein. Voxtral Mini 3B, Voxtral Small 24B und Voxtral Mini 4B Realtime stehen unter Apache 2.0 auf Hugging Face. Das im Februar 2026 vorgestellte Voxtral Mini Transcribe V2 mit integrierter Sprechertrennung bietet Mistral nur über die eigene API an. Für den lokalen Betrieb kommt dieses Modell daher nicht infrage.

Geschrieben von
Timo Wevelsiep
Co-Founder & CEO
Co-Founder von WZ-IT. Spezialisiert auf Cloud-Infrastruktur, Open-Source-Plattformen und Managed Services für KMUs und Enterprise-Kunden weltweit.
LinkedInLassen Sie uns über Ihre Idee sprechen
Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.





