Whisper local 2026: Audio und Video transkribieren, ohne seine Daten zu senden

Eine Besprechung, ein Interview, einen Podcast oder ein Video automatisch und mit ausgezeichneter Präzision transkribieren: Das ermöglicht Whisper, das Open-Source-Modell zur Spracherkennung. Das Problem ist, dass die meisten Online-Transkriptionsdienste Ihre Aufnahmen auf entfernte Server senden. Für sensible Daten – vertrauliche Besprechungen, medizinische Interviews, rechtliche Beratungen, unveröffentlichte Inhalte – ist das inakzeptabel.

Die gute Nachricht: Whisper läuft perfekt lokal auf Ihrem eigenen Rechner, ohne Internetverbindung. Ihre Audio- und Videodateien verlassen niemals Ihren Computer. Und entgegen der landläufigen Meinung ist dies eine der ressourcenschonendsten KI-Anwendungen. Dieser Leitfaden erklärt, wie, mit welcher Variante und auf welchem Gerät.


Whisper kurz gesagt

Whisper ist ein Spracherkennungsmodell (Speech-to-Text), das von OpenAI als Open Source unter der Apache 2.0 Lizenz veröffentlicht wurde. Es transkribiert Sprache in Text in fast 99 Sprachen mit einer Präzision, die mit den besten kommerziellen Diensten konkurriert.

Wichtiger Hinweis. Im Jahr 2026 gibt es kein „Whisper v4“. Die besten offenen Modelle bleiben large-v3 (am genauesten) und large-v3-turbo (fast genauso gut, aber deutlich schneller). Seien Sie vorsichtig bei Artikeln, die eine v4-Version ankündigen: Diese existiert bisher nicht.


Der lokale Vorteil: volle Vertraulichkeit, keine Kosten

Lokale Transkription ändert alles für sensible Daten.

  • Kein Versand in die Cloud. Ihre Aufnahmen bleiben von Anfang bis Ende auf Ihrem Gerät.
  • Keine Kosten pro Minute. Transkriptions-APIs berechnen nach Dauer. Lokal ist es kostenlos und unbegrenzt.
  • Funktioniert offline. Keine Verbindung erforderlich, nützlich unterwegs oder an sicheren Standorten.
  • Designkonform. Für Berufe, die der Schweigepflicht unterliegen (Gesundheitswesen, Recht, Buchhaltung), ist dies oft die einzig akzeptable Option.
Der Punkt, der alle überrascht: Whisper ist eine der leichtesten KI-Anwendungen. Das large-v3-Modell benötigt nur etwa 3 GB VRAM. Jede neuere Grafikkarte mit 8 GB kann es problemlos ausführen. Es ist nicht nötig, nur für die Transkription in eine überdimensionierte Maschine zu investieren.


Welche Whisper-Variante soll man wählen?

Das originale OpenAI Whisper funktioniert, aber viel schnellere Reimplementierungen haben sich durchgesetzt. Hier sind die vier wichtigsten im Jahr 2026.

faster-whisper

Für die meisten Anwendungen

Die Referenzimplementierung, basierend auf CTranslate2. Gleiche Präzision wie Whisper, aber etwa 4x schneller auf der GPU und 2x auf der CPU. Die Standardwahl unter Windows und Linux mit einer NVIDIA-Karte.

WhisperX

Untertitel, Interviews, Meetings

Auf faster-whisper aufbauend, fügt es Wortzeitstempel und Sprecheridentifikation (wer wann spricht) hinzu. Unverzichtbar für präzise Untertitel, Besprechungsprotokolle und Interviewtranskriptionen.

whisper.cpp

Mac und Embedded, ohne Python

C-Implementierung ohne Python-Abhängigkeiten, mit Metal-Beschleunigung auf dem Mac. Die beste Wahl auf Apple Silicon und für leichte oder eingebettete Umgebungen.

distil-whisper

Echtzeit, geringe Latenz

Destillierte Version, halb so leicht, für Echtzeit-Transkription und Live-Untertitelung konzipiert, wenn Latenz wichtiger ist als absolute Präzision.

Um noch schneller zu werden: auf neueren NVIDIA-Karten (Ampere-Architektur und neuer, d.h. RTX 3000 und höher) nutzt insanely-fast-whisper Flash Attention 2, um die Verarbeitung großer Audio-Mengen erheblich zu beschleunigen. Ideal zum Transkribieren ganzer Archive.


Welche Leistung für welchen Anwendungsbereich?

Anwendung Empfohlenes Modell VRAM Indikative Geschwindigkeit (aktuelle GPU)
Einzelne Transkription large-v3-turbo ca. 6 GB 5 bis 7 Mal Echtzeit
Maximale Präzision, mehrsprachig large-v3 ca. 10 GB 4 bis 6 Mal Echtzeit
Untertitel mit Sprechern WhisperX (large-v3) 10 bis 16 GB variabel je nach Diarisierung
Echtzeit, Live-Untertitel distil-whisper ca. 4 GB Echtzeit
Massenarchive (Batch) insanely-fast-whisper 12 bis 16 GB 10 Mal Echtzeit und mehr

Eine Stunde Audio wird so in wenigen Minuten auf einer aktuellen Karte transkribiert. Für die parallele Verarbeitung großer Volumina beschleunigen mehr Speicher und Rechenleistung den Durchsatz linear.


Schnelle Installation von faster-whisper

Auf einem Windows- oder Linux-Computer mit einer NVIDIA-Grafikkarte:

# Dedizierte Python-Umgebung
python -m venv whisper-env
source whisper-env/bin/activate    # Linux/Mac
# whisper-env\Scripts\activate     # Windows

# Installation von faster-whisper
pip install faster-whisper

# Transkription einer Datei
python -c "
from faster_whisper import WhisperModel
model = WhisperModel('large-v3-turbo', device='cuda', compute_type='int8')
segments, info = model.transcribe('reunion.mp3')
for s in segments:
    print(s.text)
"
Häufiger Fehler: Inkompatibilitäten der CUDA-Version. faster-whisper benötigt korrekt installierte cuBLAS und cuDNN (System oder über NVIDIA-Pakete). Auf unseren Maschinen ist die Umgebung vorkonfiguriert, was diese Schwierigkeit vollständig umgeht.


Wer nutzt Whisper lokal?

  • Journalisten und Forscher, um Interviews zu transkribieren, ohne ihre Quellen preiszugeben.
  • Gesundheitsfachkräfte für diktierte Berichte, ohne dass Patientendaten das Büro verlassen.
  • Anwälte und Notare, um vertrauliche Konsultationen und Anhörungen zu transkribieren.
  • Content-Ersteller, um kostenlos und unbegrenzt Untertitel und Transkriptionen von Podcasts oder Videos zu erstellen.
  • Unternehmen für Protokolle interner Besprechungen, ohne auf einen Drittanbieter angewiesen zu sein.
  • Barrierefreiheitsdienste für Echtzeit-Untertitelung.


Whisper mit einer lokalen KI kombinieren

Die Transkription ist oft nur der erste Schritt. Sobald Audio in Text umgewandelt wurde, kann ein lokales Sprachmodell Folgendes übernehmen: die Besprechung zusammenfassen, Entscheidungen und Aktionen extrahieren, einen strukturierten Bericht verfassen.

Die komplette, 100% lokale Pipeline: Whisper transkribiert das Audio, dann fasst ein lokales LLM (über Ollama oder Open WebUI) zusammen und strukturiert. Alles auf derselben Maschine, ohne dass Daten Ihr Netzwerk verlassen. Hier zeigt eine vielseitige KI-Station ihren vollen Sinn: Sie erledigt beides.


Welche Maschine für lokales Whisper?

Für die reine Transkription reicht eine 8-GB-Karte völlig aus. Wenn Sie auch ein lokales LLM zum Zusammenfassen und Analysieren ausführen möchten, zielen Sie auf 16 GB oder mehr ab. Hier sind unsere passenden Stationen, die in Auriol (13390) montiert und in die gesamte EU geliefert werden.

Radiance CoreAI 16 CoreAI 16 — RTX 5060 Ti 16 GBWhisper + lokales LLM zum Zusammenfassen. Das richtige Gleichgewicht. 1.703 € Radiance CoreAI 32 CoreAI 32 — RTX 5070 Ti 16 GBTranskription großer Mengen im Batch, schneller. 2.442 € Radiance CoreAI 64 CoreAI 64 — RTX 5090 32 GBKomplette WhisperX-Pipeline + LLM 70B, maximaler Durchsatz. 6.042 €
Haben Sie bereits eine Maschine? Whisper ist eine der wenigen KI-Anwendungen, bei der eine bescheidene Grafikkarte ausreicht. Wenn Sie bereits einen PC mit einer NVIDIA-Grafikkarte von 8 GB oder mehr besitzen, können Sie Whisper sofort ausführen. Eine dedizierte Workstation wird vor allem dann interessant, wenn Sie auch ein lokales LLM zur Analyse Ihrer Transkriptionen oder zur kontinuierlichen Verarbeitung großer Mengen wünschen.


Zusammenfassend

Ist Whisper kostenlos?
Ja, Open Source unter der Apache 2.0 Lizenz. Sie zahlen nur einmal für die Hardware.

Wie präzise ist es im Vergleich zu Online-Diensten?
large-v3 konkurriert mit den besten kommerziellen Diensten in fast 99 Sprachen.

Braucht man eine große Maschine?
Nein. 8 GB VRAM reichen für die Transkription. Nur wenn Sie ein lokales LLM zum Zusammenfassen hinzufügen, sind 16 GB anzustreben.

Kann man Videos transkribieren?
Ja. Das Audio wird aus dem Video extrahiert (via ffmpeg) und dann transkribiert. Ideal für die Untertitelung von Videos.

Bleiben meine Dateien privat?
Ja, absolut. Lokal verlässt keine Aufnahme Ihren Rechner.

Zurück zum Blog

Holen Sie sich ein Angebot für einen PC zum besten Preis

Bestpreisgarantie

Findest du es günstiger?
Wir erstatten die Differenz + 50 € geschenkt

Gültig auf allen in Frankreich erhältlichen PCs. Teilen Sie uns mit, was Sie gefunden haben – wir kümmern uns um den Rest.

Rückerstattung der Differenz + 50 € geschenkt

Erhalten Sie Ihr individuelles Angebot

Unser Team stellt Ihnen einen PC zusammen, der zu 100 % auf Ihre Bedürfnisse und Ihr Budget zugeschnitten ist. Antwort innerhalb von 24 Stunden.

Zum Angebotsformular

Envoyez simplement votre image directement via WhatsApp ou par e-mail — c'est plus rapide et nous répondons sous 2h.


Wollen Sie einen identischen PC oder möchten Sie Komponenten ändern?



Wie möchten Sie unser Angebot erhalten?

Wir werden Sie so schnell wie möglich via WhatsApp kontaktieren (Mo–Sa, 9–19 Uhr).

Anfrage gesendet!

Wir prüfen Ihr Angebot und melden uns in Kürze bei Ihnen. Bestpreisgarantie – wir erstatten Ihnen die Differenz und schenken Ihnen zusätzlich 50 €.

Weitere Fragen?

Senden Sie uns eine E-Mail an contact@radiancesystems,eu oder kontaktieren Sie uns über das Kontaktformular. Wir beantworten alle Anfragen während der Arbeitszeiten (Montag bis Freitag von 9 bis 17 Uhr) innerhalb von 3 Stunden.

📞 +33 4 65 84 48 21