machichdigital
ModellLokale LLM-ModelleLizenz: Apache-2.0

Kokoro

Kleines TTS-Modell mit erstaunlich natürlicher Qualität — sehr beliebt für leichtgewichtige Vorlese-Funktionen.

× kopiert× heruntergeladenBewertung:

Kleines TTS-Modell mit erstaunlich natürlicher Qualität — sehr beliebt für leichtgewichtige Vorlese-Funktionen.

So nutzt du es

Am einfachsten per Ollama: ollama pull <modellname> und dann ollama run <modellname> — oder komfortabel mit LM Studio (grafische Oberfläche, Modell-Suche eingebaut). Die Hardware-Angaben unten beziehen sich auf die übliche 4-Bit-Quantisierung (Q4).

Größen & Hardware

  • Empfohlene Hardware (Q4): CPU/GPU, nur 82M Parameter

Im Detail

Kokoro zeigt, dass Sprachsynthese nicht zwingend riesige Modelle braucht: Mit nur 82 Millionen Parametern läuft es flüssig auf CPU oder GPU und liefert trotzdem eine erstaunlich natürliche, wenig roboterhafte Stimme. Dadurch eignet es sich besonders für leichtgewichtige Vorlese-Funktionen in Apps, Screenreadern oder lokalen Assistenten, bei denen große TTS-Modelle mit mehreren Gigabyte Overkill wären. Verglichen mit generischen, sehr rechenhungrigen Sprachmodellen punktet Kokoro durch Geschwindigkeit und geringen Ressourcenbedarf, nicht durch Stimmenvielfalt oder Sprachen-Abdeckung. Für einfache Text-Vorlesefunktionen, Barrierefreiheit oder Prototypen ist es damit oft die pragmatischere Wahl als ein großes multimodales Modell.

Praxis-Tipp

Für schnelle Vorlese-Funktionen in eigenen Skripten eignet sich Kokoro gut als lokale TTS-Engine, etwa um Zusammenfassungen oder Benachrichtigungen automatisch vorzulesen.

Lizenz & Quelle

  • Lizenz: Apache-2.0
  • Quelle: HF

Erfahrungen & Kommentare.

Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.

Llama 3.1

Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.

Llama 3.1 Community License

Llama 3.3

Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.

Llama 3.3 Community License

Llama 4 (Scout / Maverick)

Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.

Llama 4 Community License (EU-Einschränkungen für multimodale Nutzung beachten!)