Zum Inhalt

VoiceHub: Text-zu-Sprache-Inferenz und Training

Eine Python-Bibliothek mit integriertem Quellcode für Inferenz, Datenaufbereitung und modellspezifisches Fine-Tuning moderner TTS-Familien.

Status der kontinuierlichen Integration von VoiceHub Status des VoiceHub-Dokumentations-Builds VoiceHub unterstützt Python 3.10 und neuere Versionen VoiceHub wird unter der Apache-2.0-Lizenz bereitgestellt

Was ist VoiceHub?

VoiceHub stellt TTS-, Spracherkennungs- und Sprachaktivitätsmodelle über gemeinsame APIs für Konfiguration, Verarbeitung, Modelle, Ergebnisse und Training bereit. Die Implementierungen berücksichtigen weiterhin ihre jeweilige Architektur: Codec-Sprachmodelle, Sequence-to-Sequence-Systeme, Flow-Matching- und Diffusionsmodelle, akustische Modelle, adversarielle Systeme im VITS-Stil und zusammengesetzte Pipelines behalten ihre eigene Konditionierung, ihre Zielgrößen, die Zuständigkeit für Parameter und ihre Exportregeln bei.

Die Registry enthält 34 TTS-Integrationen, 23 ASR-Anbieter und 11 VAD-Anbieter. Die Fine-Tuning-Unterstützung hängt vom Checkpoint und von der Laufzeitumgebung ab; eine Inferenzintegration bedeutet nicht, dass ihr aktuelles VoiceHub-Artefakt differenzierbar ist. Wählen Sie eine Integration mithilfe des TTS-Modellkatalogs, der TTS-Trainingsmatrix und der ASR/VAD-Unterstützungsmatrix aus.

Der Modellquellcode und alle integrierten TTS-, ASR- und VAD-Inferenzlaufzeiten werden standardmäßig mit VoiceHub installiert. Checkpoint-Gewichte werden weiterhin bei Bedarf heruntergeladen oder über lokale Pfade bereitgestellt. Fügen Sie nur voicehub[training] für Fine-Tuning und Reporting hinzu. Die Apache-2.0-Lizenz gilt nur für VoiceHub selbst; integrierter Quellcode, Checkpoints, Codecs, Datensätze und erzeugte Audiodateien können anderen Bedingungen unterliegen.

  • Erste Schritte


    Installieren Sie VoiceHub aus dem aktuellen Quellbaum und führen Sie die erste Generierungsanfrage über die gemeinsame Model Factory aus.

    Schnellstart

  • Inferenz


    Entdecken Sie Integrationen, laden Sie Checkpoints aus Hub oder von lokalen Pfaden, konfigurieren Sie reproduzierbare Generierung und verarbeiten Sie normalisierte Audiodaten.

    Inferenzleitfaden

  • Datenaufbereitung


    Erstellen Sie überprüfbare Manifeste, validieren Sie Audiodaten, verhindern Sie Datenlecks zwischen Sprechern oder Sitzungen und erzeugen Sie modellspezifische Trainingseingaben.

    Leitfaden zur Datenaufbereitung

  • Training


    Validieren Sie Checkpoint-Grenzen, führen Sie native Zielfunktionen aus, evaluieren Sie Modelle, setzen Sie vollständige Checkpoints fort und speichern Sie portable Artefakte.

    Trainingsleitfaden

  • Modelle


    Vergleichen Sie TTS-Registry-Einträge, Standard-Checkpoints, Funktionen, Herkunft des Quellcodes und Einschränkungen.

    Modellkatalog

  • Trainingsunterstützung


    Prüfen Sie für jede Integration genau, ob Fine-Tuning mit Rohdaten oder vorverarbeiteten Daten möglich ist, eine spezialisierte Verarbeitung erfordert oder nicht verfügbar ist.

    Trainingsmatrix

  • Notebooks


    Nutzen Sie vier Notebooks: fokussierte Beispiele für Inferenz, Datenaufbereitung und Training sowie den vollständigen Dia-Workflow bis zum Export und erneuten Laden in einer frischen Laufzeitumgebung.

    Notebook-Galerie öffnen

  • API-Referenz


    Schlagen Sie Factories, Ergebnisse, Trainer-Argumente, Callbacks, Collators, Strategien, Artefakte und Erweiterungs-Registries nach.

    API durchsuchen

  • Architektur


    Lernen Sie Registry, Model Wrapper, Adapter, Laufzeitstrategien, Checkpoints und die Grenzen portabler Artefakte kennen.

    Bibliotheksarchitektur

  • Modell hinzufügen


    Implementieren und testen Sie einen lazy geladenen Wrapper, eine Trainingsspezifikation, bei Bedarf einen spezialisierten Adapter sowie einen Exportvertrag.

    Leitfaden zur Modellintegration