Coqui TTS / XTTS-v2
Voice-Cloning aus ~6 Sekunden Referenz-Audio, 17 Sprachen inkl. Deutsch. Für private Projekte beeindruckend; kommerziell wegen Lizenz tabu.
Voice-Cloning aus ~6 Sekunden Referenz-Audio, 17 Sprachen inkl. Deutsch. Für private Projekte beeindruckend; kommerziell wegen Lizenz tabu.
So nutzt du es
Am einfachsten per Ollama: ollama pull <modellname> und dann ollama run <modellname> — oder komfortabel mit LM Studio (grafische Oberfläche, Modell-Suche eingebaut). Die Hardware-Angaben unten beziehen sich auf die übliche 4-Bit-Quantisierung (Q4).
Größen & Hardware
- Empfohlene Hardware (Q4): GPU empfohlen
Im Detail
XTTS-v2 klont eine Stimme aus nur rund 6 Sekunden Referenz-Audio und spricht damit Text in 17 Sprachen, inklusive Deutsch – für ein offenes Modell eine beeindruckende Leistung. Eine GPU wird empfohlen, auf CPU wird es spürbar langsam. Für private Projekte, Prototypen und Experimente ist es eine der zugänglichsten Voice-Cloning-Optionen ohne Cloud-Dienst. Wichtig: Die Coqui-Lizenz schließt kommerzielle Nutzung aus, daher ist es für Firmenprojekte tabu – wer eine Stimme kommerziell einsetzen will, muss auf lizenzfreie Alternativen ausweichen oder Rechte klären.
Praxis-Tipp
Für einen schnellen Test reichen 6 Sekunden saubere Audioaufnahme einer Zielstimme plus ein deutscher Beispielsatz – so lässt sich die Klonqualität ohne Cloud-Dienst direkt beurteilen.
Lizenz & Quelle
Erfahrungen & Kommentare.
Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Llama 3.1
Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.
Llama 3.3
Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.
Llama 4 (Scout / Maverick)
Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.
