machichdigital
ModellLokale LLM-ModelleLizenz: MIT

Whisper (OpenAI)

Der Standard für Transkription, sehr gutes Deutsch. large-v3-turbo ist der Alltags-Tipp: fast Large-Qualität bei einem Bruchteil der Rechenzeit.

× kopiert× heruntergeladenBewertung:

Der Standard für Transkription, sehr gutes Deutsch. large-v3-turbo ist der Alltags-Tipp: fast Large-Qualität bei einem Bruchteil der Rechenzeit.

So nutzt du es

Am einfachsten per Ollama: ollama pull <modellname> und dann ollama run <modellname> — oder komfortabel mit LM Studio (grafische Oberfläche, Modell-Suche eingebaut). Die Hardware-Angaben unten beziehen sich auf die übliche 4-Bit-Quantisierung (Q4).

Größen & Hardware

  • Verfügbare Größen: tiny / base / small / medium / large-v3 / large-v3-turbo
  • Empfohlene Hardware (Q4): tiny–small: CPU reicht · large: ~10 GB VRAM (oder Geduld)

Im Detail

Whisper von OpenAI ist der De-facto-Standard für lokale Spracherkennung und liefert insbesondere für Deutsch sehr zuverlässige Transkripte. Die Modellreihe reicht von tiny bis large-v3, wobei kleinere Varianten (tiny/base/small) bereits auf der CPU laufen, während large für gute Genauigkeit rund 10 GB VRAM braucht oder entsprechend Geduld auf der CPU erfordert. Der Alltags-Tipp ist large-v3-turbo: Es erreicht nahezu die Qualität von large-v3, braucht dafür aber nur einen Bruchteil der Rechenzeit – ein guter Kompromiss für alle, die viele Aufnahmen transkribieren, aber keine High-End-GPU dauerhaft blockieren wollen. Für reine Offline-Integration ohne Python-Stack lohnt eher whisper.cpp mit denselben Gewichten.

Praxis-Tipp

Für den Alltag large-v3-turbo verwenden statt large-v3 – bei kaum spürbarem Qualitätsverlust ist die Transkription deutlich schneller.

Lizenz & Quelle

Erfahrungen & Kommentare.

Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.

Llama 3.1

Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.

Llama 3.1 Community License

Llama 3.3

Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.

Llama 3.3 Community License

Llama 4 (Scout / Maverick)

Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.

Llama 4 Community License (EU-Einschränkungen für multimodale Nutzung beachten!)