machichdigital

Lokale LLMs · Foto: derekGavey, CC BY 2.0

ModellLokale LLM-ModelleLizenz: MIT

Whisper (OpenAI)

Zuletzt aktualisiert:

⧉ –× kopiert⬇ –× heruntergeladenBewertung:

Typ

Modell

Lizenz

MIT

Anwendungsfeld

Lokale LLM-Modelle

Voraussetzungen

Keine besonderen — direkt loslegen.

Der Standard für Transkription, sehr gutes Deutsch. large-v3-turbo ist der Alltags-Tipp: fast Large-Qualität bei einem Bruchteil der Rechenzeit.

So nutzt du es

Am einfachsten per Ollama: ollama pull <modellname> und dann ollama run <modellname> — oder komfortabel mit LM Studio (grafische Oberfläche, Modell-Suche eingebaut). Die Hardware-Angaben unten beziehen sich auf die übliche 4-Bit-Quantisierung (Q4).

Größen & Hardware

  • Verfügbare Größen: tiny / base / small / medium / large-v3 / large-v3-turbo
  • Empfohlene Hardware (Q4): tiny–small: CPU reicht · large: ~10 GB VRAM (oder Geduld)

Im Detail

Whisper von OpenAI ist der De-facto-Standard für lokale Spracherkennung und liefert gerade im Deutschen sehr zuverlässige Ergebnisse über Dialekte und Hintergrundgeräusche hinweg. Die Modellreihe deckt von tiny bis large-v3 eine breite Spanne zwischen Geschwindigkeit und Genauigkeit ab. Für den Alltag ist large-v3-turbo der beste Kompromiss: Es erreicht nahezu die Qualität von large-v3, benötigt dafür aber nur einen Bruchteil der Rechenzeit, weil es mit weniger Decoder-Schichten arbeitet. Die kleineren Modelle (tiny bis small) laufen problemlos auf der CPU und eignen sich für schnelle Live-Untertitel, während large für höchste Genauigkeit etwa 10 GB VRAM oder entsprechend Geduld auf der CPU braucht.

Praxis-Tipp

Für lange Aufnahmen oder Podcasts large-v3-turbo statt large-v3 verwenden – die Transkriptionszeit sinkt spürbar, ohne dass im Deutschen ein nennenswerter Qualitätsverlust auffällt.

Lizenz & Quelle

Erfahrungen & Kommentare.

Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.

Llama 3.1

Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.

Llama 3.1 Community License♥ –⧉ –

Llama 3.3

Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.

Llama 3.3 Community License♥ –⧉ –

Llama 4 (Scout / Maverick)

Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.

Llama 4 Community License (EU-Einschränkungen für multimodale Nutzung beachten!)♥ –⧉ –