Lokale LLMs · Foto: derekGavey, CC BY 2.0
Whisper (OpenAI)
Zuletzt aktualisiert:
Typ
Modell
Lizenz
MIT
Quelle
Anwendungsfeld
Lokale LLM-Modelle
Voraussetzungen
Keine besonderen — direkt loslegen.
Der Standard für Transkription, sehr gutes Deutsch. large-v3-turbo ist der Alltags-Tipp: fast Large-Qualität bei einem Bruchteil der Rechenzeit.
So nutzt du es
Am einfachsten per Ollama: ollama pull <modellname> und dann ollama run <modellname> — oder komfortabel mit LM Studio (grafische Oberfläche, Modell-Suche eingebaut). Die Hardware-Angaben unten beziehen sich auf die übliche 4-Bit-Quantisierung (Q4).
Größen & Hardware
- Verfügbare Größen: tiny / base / small / medium / large-v3 / large-v3-turbo
- Empfohlene Hardware (Q4): tiny–small: CPU reicht · large: ~10 GB VRAM (oder Geduld)
Im Detail
Whisper von OpenAI ist der De-facto-Standard für lokale Spracherkennung und liefert gerade im Deutschen sehr zuverlässige Ergebnisse über Dialekte und Hintergrundgeräusche hinweg. Die Modellreihe deckt von tiny bis large-v3 eine breite Spanne zwischen Geschwindigkeit und Genauigkeit ab. Für den Alltag ist large-v3-turbo der beste Kompromiss: Es erreicht nahezu die Qualität von large-v3, benötigt dafür aber nur einen Bruchteil der Rechenzeit, weil es mit weniger Decoder-Schichten arbeitet. Die kleineren Modelle (tiny bis small) laufen problemlos auf der CPU und eignen sich für schnelle Live-Untertitel, während large für höchste Genauigkeit etwa 10 GB VRAM oder entsprechend Geduld auf der CPU braucht.
Praxis-Tipp
Für lange Aufnahmen oder Podcasts large-v3-turbo statt large-v3 verwenden – die Transkriptionszeit sinkt spürbar, ohne dass im Deutschen ein nennenswerter Qualitätsverlust auffällt.
Lizenz & Quelle
Erfahrungen & Kommentare.
Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Llama 3.1
Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.
Llama 3.3
Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.
Llama 4 (Scout / Maverick)
Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.
