machichdigital
ModellLokale LLM-ModelleLizenz: Code: MPL-2.0; XTTS-Gewichte: Coqui Public Model License = nicht kommerziell!

Coqui TTS / XTTS-v2

Voice-Cloning aus ~6 Sekunden Referenz-Audio, 17 Sprachen inkl. Deutsch. Für private Projekte beeindruckend; kommerziell wegen Lizenz tabu.

× kopiert× heruntergeladenBewertung:

Voice-Cloning aus ~6 Sekunden Referenz-Audio, 17 Sprachen inkl. Deutsch. Für private Projekte beeindruckend; kommerziell wegen Lizenz tabu.

So nutzt du es

Am einfachsten per Ollama: ollama pull <modellname> und dann ollama run <modellname> — oder komfortabel mit LM Studio (grafische Oberfläche, Modell-Suche eingebaut). Die Hardware-Angaben unten beziehen sich auf die übliche 4-Bit-Quantisierung (Q4).

Größen & Hardware

  • Empfohlene Hardware (Q4): GPU empfohlen

Im Detail

XTTS-v2 klont eine Stimme aus nur rund 6 Sekunden Referenz-Audio und spricht damit Text in 17 Sprachen, inklusive Deutsch – für ein offenes Modell eine beeindruckende Leistung. Eine GPU wird empfohlen, auf CPU wird es spürbar langsam. Für private Projekte, Prototypen und Experimente ist es eine der zugänglichsten Voice-Cloning-Optionen ohne Cloud-Dienst. Wichtig: Die Coqui-Lizenz schließt kommerzielle Nutzung aus, daher ist es für Firmenprojekte tabu – wer eine Stimme kommerziell einsetzen will, muss auf lizenzfreie Alternativen ausweichen oder Rechte klären.

Praxis-Tipp

Für einen schnellen Test reichen 6 Sekunden saubere Audioaufnahme einer Zielstimme plus ein deutscher Beispielsatz – so lässt sich die Klonqualität ohne Cloud-Dienst direkt beurteilen.

Lizenz & Quelle

  • Lizenz: Code: MPL-2.0; XTTS-Gewichte: Coqui Public Model License = nicht kommerziell!
  • Quelle: GitHub
  • Quelle: HF

Erfahrungen & Kommentare.

Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.

Llama 3.1

Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.

Llama 3.1 Community License

Llama 3.3

Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.

Llama 3.3 Community License

Llama 4 (Scout / Maverick)

Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.

Llama 4 Community License (EU-Einschränkungen für multimodale Nutzung beachten!)