VoiceHub: Text-zu-Sprache-Inferenz und Training¶
Eine Python-Bibliothek mit integriertem Quellcode für Inferenz, Datenaufbereitung und modellspezifisches Fine-Tuning moderner TTS-Familien.
Was ist VoiceHub?¶
VoiceHub stellt TTS-, Spracherkennungs- und Sprachaktivitätsmodelle über gemeinsame APIs für Konfiguration, Verarbeitung, Modelle, Ergebnisse und Training bereit. Die Implementierungen berücksichtigen weiterhin ihre jeweilige Architektur: Codec-Sprachmodelle, Sequence-to-Sequence-Systeme, Flow-Matching- und Diffusionsmodelle, akustische Modelle, adversarielle Systeme im VITS-Stil und zusammengesetzte Pipelines behalten ihre eigene Konditionierung, ihre Zielgrößen, die Zuständigkeit für Parameter und ihre Exportregeln bei.
Die Registry enthält 34 TTS-Integrationen, 23 ASR-Anbieter und 11 VAD-Anbieter. Die Fine-Tuning-Unterstützung hängt vom Checkpoint und von der Laufzeitumgebung ab; eine Inferenzintegration bedeutet nicht, dass ihr aktuelles VoiceHub-Artefakt differenzierbar ist. Wählen Sie eine Integration mithilfe des TTS-Modellkatalogs, der TTS-Trainingsmatrix und der ASR/VAD-Unterstützungsmatrix aus.
Der Modellquellcode und alle integrierten TTS-, ASR- und
VAD-Inferenzlaufzeiten werden standardmäßig mit VoiceHub installiert.
Checkpoint-Gewichte werden weiterhin bei Bedarf heruntergeladen oder über
lokale Pfade bereitgestellt. Fügen Sie nur voicehub[training] für
Fine-Tuning und Reporting hinzu. Die Apache-2.0-Lizenz gilt nur für VoiceHub
selbst; integrierter Quellcode, Checkpoints, Codecs, Datensätze und erzeugte
Audiodateien können anderen Bedingungen unterliegen.
-
Erste Schritte
Installieren Sie VoiceHub aus dem aktuellen Quellbaum und führen Sie die erste Generierungsanfrage über die gemeinsame Model Factory aus.
-
Inferenz
Entdecken Sie Integrationen, laden Sie Checkpoints aus Hub oder von lokalen Pfaden, konfigurieren Sie reproduzierbare Generierung und verarbeiten Sie normalisierte Audiodaten.
-
Datenaufbereitung
Erstellen Sie überprüfbare Manifeste, validieren Sie Audiodaten, verhindern Sie Datenlecks zwischen Sprechern oder Sitzungen und erzeugen Sie modellspezifische Trainingseingaben.
-
Training
Validieren Sie Checkpoint-Grenzen, führen Sie native Zielfunktionen aus, evaluieren Sie Modelle, setzen Sie vollständige Checkpoints fort und speichern Sie portable Artefakte.
-
Modelle
Vergleichen Sie TTS-Registry-Einträge, Standard-Checkpoints, Funktionen, Herkunft des Quellcodes und Einschränkungen.
-
Trainingsunterstützung
Prüfen Sie für jede Integration genau, ob Fine-Tuning mit Rohdaten oder vorverarbeiteten Daten möglich ist, eine spezialisierte Verarbeitung erfordert oder nicht verfügbar ist.
-
Notebooks
Nutzen Sie vier Notebooks: fokussierte Beispiele für Inferenz, Datenaufbereitung und Training sowie den vollständigen Dia-Workflow bis zum Export und erneuten Laden in einer frischen Laufzeitumgebung.
-
API-Referenz
Schlagen Sie Factories, Ergebnisse, Trainer-Argumente, Callbacks, Collators, Strategien, Artefakte und Erweiterungs-Registries nach.
-
Architektur
Lernen Sie Registry, Model Wrapper, Adapter, Laufzeitstrategien, Checkpoints und die Grenzen portabler Artefakte kennen.
-
Modell hinzufügen
Implementieren und testen Sie einen lazy geladenen Wrapper, eine Trainingsspezifikation, bei Bedarf einen spezialisierten Adapter sowie einen Exportvertrag.