machichdigital

Lokale LLMs · Foto: derekGavey, CC BY 2.0

ModellLokale LLM-ModelleLizenz: Apache-2.0

Voxtral Mini Realtime

⧉ –× kopiert⬇ –× heruntergeladenBewertung:

Typ

Modell

Lizenz

Apache-2.0

Quelle

HF ↗

Anwendungsfeld

Lokale LLM-Modelle

Entwickler von Diktat-, Untertitel- und Sprachassistenz-Anwendungen.

Voraussetzungen

Keine besonderen — direkt loslegen.

Spracherkennung in Echtzeit von Mistral: wandelt gesprochene Sprache laufend in Text um, 13 Sprachen, bis zu rund drei Stunden Audio am Stück. Apache-2.0.

Für wen: Entwickler von Diktat-, Untertitel- und Sprachassistenz-Anwendungen.

Installation

Laut Model Card ab etwa 16 GB Grafikspeicher. Ohne eigene GPU über die Mistral-API.

Erste Schritte

Anders als Whisper-artige Modelle, die fertige Aufnahmen verarbeiten, liefert die Realtime-Variante den Text schon während gesprochen wird — gut für Live-Untertitel und Sprachsteuerung.

Plattformen: GPU ab 16 GB · vLLM

Lizenz & Quelle

  • Lizenz: Apache-2.0
  • Quelle: HF

Erfahrungen & Kommentare.

Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.

Llama 3.1

Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.

Llama 3.1 Community License♥ –⧉ –

Llama 3.3

Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.

Llama 3.3 Community License♥ –⧉ –

Llama 4 (Scout / Maverick)

Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.

Llama 4 Community License (EU-Einschränkungen für multimodale Nutzung beachten!)♥ –⧉ –