Whisper local 2026: Audio und Video transkribieren, ohne seine Daten zu senden
Aktie
Eine Besprechung, ein Interview, einen Podcast oder ein Video automatisch und mit ausgezeichneter Präzision transkribieren: Das ermöglicht Whisper, das Open-Source-Modell zur Spracherkennung. Das Problem ist, dass die meisten Online-Transkriptionsdienste Ihre Aufnahmen auf entfernte Server senden. Für sensible Daten – vertrauliche Besprechungen, medizinische Interviews, rechtliche Beratungen, unveröffentlichte Inhalte – ist das inakzeptabel.
Die gute Nachricht: Whisper läuft perfekt lokal auf Ihrem eigenen Rechner, ohne Internetverbindung. Ihre Audio- und Videodateien verlassen niemals Ihren Computer. Und entgegen der landläufigen Meinung ist dies eine der ressourcenschonendsten KI-Anwendungen. Dieser Leitfaden erklärt, wie, mit welcher Variante und auf welchem Gerät.
Whisper kurz gesagt
Whisper ist ein Spracherkennungsmodell (Speech-to-Text), das von OpenAI als Open Source unter der Apache 2.0 Lizenz veröffentlicht wurde. Es transkribiert Sprache in Text in fast 99 Sprachen mit einer Präzision, die mit den besten kommerziellen Diensten konkurriert.
Der lokale Vorteil: volle Vertraulichkeit, keine Kosten
Lokale Transkription ändert alles für sensible Daten.
- Kein Versand in die Cloud. Ihre Aufnahmen bleiben von Anfang bis Ende auf Ihrem Gerät.
- Keine Kosten pro Minute. Transkriptions-APIs berechnen nach Dauer. Lokal ist es kostenlos und unbegrenzt.
- Funktioniert offline. Keine Verbindung erforderlich, nützlich unterwegs oder an sicheren Standorten.
- Designkonform. Für Berufe, die der Schweigepflicht unterliegen (Gesundheitswesen, Recht, Buchhaltung), ist dies oft die einzig akzeptable Option.
Welche Whisper-Variante soll man wählen?
Das originale OpenAI Whisper funktioniert, aber viel schnellere Reimplementierungen haben sich durchgesetzt. Hier sind die vier wichtigsten im Jahr 2026.
faster-whisper
Für die meisten Anwendungen
Die Referenzimplementierung, basierend auf CTranslate2. Gleiche Präzision wie Whisper, aber etwa 4x schneller auf der GPU und 2x auf der CPU. Die Standardwahl unter Windows und Linux mit einer NVIDIA-Karte.
WhisperX
Untertitel, Interviews, Meetings
Auf faster-whisper aufbauend, fügt es Wortzeitstempel und Sprecheridentifikation (wer wann spricht) hinzu. Unverzichtbar für präzise Untertitel, Besprechungsprotokolle und Interviewtranskriptionen.
whisper.cpp
Mac und Embedded, ohne Python
C-Implementierung ohne Python-Abhängigkeiten, mit Metal-Beschleunigung auf dem Mac. Die beste Wahl auf Apple Silicon und für leichte oder eingebettete Umgebungen.
distil-whisper
Echtzeit, geringe Latenz
Destillierte Version, halb so leicht, für Echtzeit-Transkription und Live-Untertitelung konzipiert, wenn Latenz wichtiger ist als absolute Präzision.
Welche Leistung für welchen Anwendungsbereich?
| Anwendung | Empfohlenes Modell | VRAM | Indikative Geschwindigkeit (aktuelle GPU) |
|---|---|---|---|
| Einzelne Transkription | large-v3-turbo | ca. 6 GB | 5 bis 7 Mal Echtzeit |
| Maximale Präzision, mehrsprachig | large-v3 | ca. 10 GB | 4 bis 6 Mal Echtzeit |
| Untertitel mit Sprechern | WhisperX (large-v3) | 10 bis 16 GB | variabel je nach Diarisierung |
| Echtzeit, Live-Untertitel | distil-whisper | ca. 4 GB | Echtzeit |
| Massenarchive (Batch) | insanely-fast-whisper | 12 bis 16 GB | 10 Mal Echtzeit und mehr |
Eine Stunde Audio wird so in wenigen Minuten auf einer aktuellen Karte transkribiert. Für die parallele Verarbeitung großer Volumina beschleunigen mehr Speicher und Rechenleistung den Durchsatz linear.
Schnelle Installation von faster-whisper
Auf einem Windows- oder Linux-Computer mit einer NVIDIA-Grafikkarte:
# Dedizierte Python-Umgebung
python -m venv whisper-env
source whisper-env/bin/activate # Linux/Mac
# whisper-env\Scripts\activate # Windows
# Installation von faster-whisper
pip install faster-whisper
# Transkription einer Datei
python -c "
from faster_whisper import WhisperModel
model = WhisperModel('large-v3-turbo', device='cuda', compute_type='int8')
segments, info = model.transcribe('reunion.mp3')
for s in segments:
print(s.text)
"
Wer nutzt Whisper lokal?
- Journalisten und Forscher, um Interviews zu transkribieren, ohne ihre Quellen preiszugeben.
- Gesundheitsfachkräfte für diktierte Berichte, ohne dass Patientendaten das Büro verlassen.
- Anwälte und Notare, um vertrauliche Konsultationen und Anhörungen zu transkribieren.
- Content-Ersteller, um kostenlos und unbegrenzt Untertitel und Transkriptionen von Podcasts oder Videos zu erstellen.
- Unternehmen für Protokolle interner Besprechungen, ohne auf einen Drittanbieter angewiesen zu sein.
- Barrierefreiheitsdienste für Echtzeit-Untertitelung.
Whisper mit einer lokalen KI kombinieren
Die Transkription ist oft nur der erste Schritt. Sobald Audio in Text umgewandelt wurde, kann ein lokales Sprachmodell Folgendes übernehmen: die Besprechung zusammenfassen, Entscheidungen und Aktionen extrahieren, einen strukturierten Bericht verfassen.
Welche Maschine für lokales Whisper?
Für die reine Transkription reicht eine 8-GB-Karte völlig aus. Wenn Sie auch ein lokales LLM zum Zusammenfassen und Analysieren ausführen möchten, zielen Sie auf 16 GB oder mehr ab. Hier sind unsere passenden Stationen, die in Auriol (13390) montiert und in die gesamte EU geliefert werden.
Zusammenfassend
Ist Whisper kostenlos?
Ja, Open Source unter der Apache 2.0 Lizenz. Sie zahlen nur einmal für die Hardware.
Wie präzise ist es im Vergleich zu Online-Diensten?
large-v3 konkurriert mit den besten kommerziellen Diensten in fast 99 Sprachen.
Braucht man eine große Maschine?
Nein. 8 GB VRAM reichen für die Transkription. Nur wenn Sie ein lokales LLM zum Zusammenfassen hinzufügen, sind 16 GB anzustreben.
Kann man Videos transkribieren?
Ja. Das Audio wird aus dem Video extrahiert (via ffmpeg) und dann transkribiert. Ideal für die Untertitelung von Videos.
Bleiben meine Dateien privat?
Ja, absolut. Lokal verlässt keine Aufnahme Ihren Rechner.





















