Lokale LLMs · Foto: derekGavey, CC BY 2.0
Coqui TTS / XTTS-v2
Zuletzt aktualisiert:
Typ
Modell
Lizenz
Code: MPL-2.0; XTTS-Gewichte: Coqui Public Model License = nicht kommerziell!
Quelle
Anwendungsfeld
Lokale LLM-Modelle
Voraussetzungen
- GPU empfohlen für die Sprachgenerierung
- Referenz-Audio von rund 6 Sekunden der zu klonenden Stimme
- Prüfung der Lizenz, da eine kommerzielle Nutzung ausgeschlossen ist
Einordnung
Beeindruckendes Voice-Cloning mit wenig Referenzmaterial, aber GPU-Bedarf und Lizenzprüfung erfordern Vorbereitung.
Voice-Cloning aus ~6 Sekunden Referenz-Audio, 17 Sprachen inkl. Deutsch. Für private Projekte beeindruckend; kommerziell wegen Lizenz tabu.
Größen & Hardware
- Empfohlene Hardware (Q4): GPU empfohlen
Im Detail
XTTS-v2 aus dem Coqui-TTS-Projekt klont Stimmen aus nur rund 6 Sekunden Referenz-Audio und erzeugt daraus Sprachausgabe in 17 Sprachen, Deutsch inklusive. Die Qualität des Voice-Clonings ist für ein lokal laufendes Open-Source-Modell beeindruckend und eignet sich gut für private Projekte, Prototypen, Hörbuch-Experimente oder barrierefreie Anwendungen mit individueller Stimme. Wichtig: Die Lizenz schließt eine kommerzielle Nutzung aus, das Modell ist also nur für Forschung, private Zwecke oder interne Tests gedacht. Wer eine Stimme kommerziell klonen oder produktiv einsetzen möchte, muss auf eine anders lizenzierte Alternative ausweichen. Für den nicht-kommerziellen Einsatz gehört es aktuell zu den zugänglichsten Voice-Cloning-Optionen zum Selbst-Hosten.
Schritt für Schritt
- Referenz-Audio von etwa 6 Sekunden der Zielstimme bereitstellen.
- Zielsprache aus den 17 unterstützten Sprachen wählen, Deutsch inklusive.
- Text eingeben und die Stimme daraus klonen lassen.
- Ergebnis für private Projekte, Prototypen, Hörbuch-Experimente oder barrierefreie Anwendungen nutzen.
- Vor jeder Weiterverwendung die Lizenzbedingungen prüfen, insbesondere bei geplanter kommerzieller Nutzung.
Beispiel aus der Praxis
Ein Hobby-Entwickler klont die eigene Stimme aus einer kurzen Aufnahme und erstellt damit einen privaten Hörbuch-Prototyp auf Deutsch.
Praxis-Tipp
Nehmen Sie die 6-Sekunden-Referenz möglichst rauschfrei und in normaler Sprechlautstärke auf — die Klon-Qualität hängt stark von der Sauberkeit des Ausgangs-Audios ab.
Stolperfallen
Die Lizenz schließt eine kommerzielle Nutzung ausdrücklich aus — wer eine Stimme kommerziell klonen oder produktiv einsetzen möchte, muss auf eine anders lizenzierte Alternative ausweichen. Die Qualität des Voice-Clonings hängt zudem stark von der Qualität der kurzen Referenzaufnahme ab.
Lizenz & Quelle
Häufige Fragen.
Kann ich XTTS-v2 kommerziell einsetzen?
Nein, die Lizenz schließt eine kommerzielle Nutzung aus und erlaubt nur Forschung, private Zwecke oder interne Tests.
Wie viel Referenz-Audio brauche ich zum Stimmenklonen?
Rund 6 Sekunden Referenz-Audio reichen laut Projekt bereits aus.
Unterstützt das Modell Deutsch?
Ja, Deutsch gehört zu den 17 unterstützten Sprachen.
Erfahrungen & Kommentare.
Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Llama 3.1
Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.
Llama 3.3
Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.
Llama 4 (Scout / Maverick)
Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.
