Kokoro
Kleines TTS-Modell mit erstaunlich natürlicher Qualität — sehr beliebt für leichtgewichtige Vorlese-Funktionen.
Kleines TTS-Modell mit erstaunlich natürlicher Qualität — sehr beliebt für leichtgewichtige Vorlese-Funktionen.
So nutzt du es
Am einfachsten per Ollama: ollama pull <modellname> und dann ollama run <modellname> — oder komfortabel mit LM Studio (grafische Oberfläche, Modell-Suche eingebaut). Die Hardware-Angaben unten beziehen sich auf die übliche 4-Bit-Quantisierung (Q4).
Größen & Hardware
- Empfohlene Hardware (Q4): CPU/GPU, nur 82M Parameter
Im Detail
Kokoro zeigt, dass Sprachsynthese nicht zwingend riesige Modelle braucht: Mit nur 82 Millionen Parametern läuft es flüssig auf CPU oder GPU und liefert trotzdem eine erstaunlich natürliche, wenig roboterhafte Stimme. Dadurch eignet es sich besonders für leichtgewichtige Vorlese-Funktionen in Apps, Screenreadern oder lokalen Assistenten, bei denen große TTS-Modelle mit mehreren Gigabyte Overkill wären. Verglichen mit generischen, sehr rechenhungrigen Sprachmodellen punktet Kokoro durch Geschwindigkeit und geringen Ressourcenbedarf, nicht durch Stimmenvielfalt oder Sprachen-Abdeckung. Für einfache Text-Vorlesefunktionen, Barrierefreiheit oder Prototypen ist es damit oft die pragmatischere Wahl als ein großes multimodales Modell.
Praxis-Tipp
Für schnelle Vorlese-Funktionen in eigenen Skripten eignet sich Kokoro gut als lokale TTS-Engine, etwa um Zusammenfassungen oder Benachrichtigungen automatisch vorzulesen.
Lizenz & Quelle
- Lizenz: Apache-2.0
- Quelle: HF
Erfahrungen & Kommentare.
Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Llama 3.1
Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.
Llama 3.3
Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.
Llama 4 (Scout / Maverick)
Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.
