Aller au contenu

VoiceHub : inférence et entraînement de synthèse vocale

Une bibliothèque Python intégrée au code source pour l'inférence, la préparation des données et l'ajustement propre à chaque modèle dans les familles TTS modernes.

État de l'intégration continue de VoiceHub État de la compilation de la documentation VoiceHub VoiceHub prend en charge Python 3.10 et les versions ultérieures VoiceHub est distribué sous licence Apache 2.0

Qu'est-ce que VoiceHub ?

VoiceHub présente les modèles TTS, de reconnaissance automatique de la parole et de détection d'activité vocale au moyen d'API communes pour la configuration, le traitement, les modèles, les résultats et l'entraînement. Les implémentations restent adaptées à leur architecture : les modèles de langage à codec, les systèmes séquence à séquence, les modèles de flow matching et de diffusion, les modèles acoustiques, les systèmes antagonistes de type VITS et les pipelines composites conservent leurs propres conditionnements, objectifs, règles de propriété des paramètres et règles d'exportation.

Le registry contient 34 intégrations TTS, 23 fournisseurs ASR et 11 fournisseurs VAD. La prise en charge de l'ajustement dépend du checkpoint et de l'environnement d'exécution ; une intégration d'inférence ne garantit pas que son artefact VoiceHub actuel soit différentiable. Consultez le catalogue TTS, la matrice d'entraînement TTS et la matrice de prise en charge ASR/VAD pour choisir une intégration.

Le code source des modèles et tous les environnements d'inférence TTS, ASR et VAD intégrés sont installés par défaut avec VoiceHub. Les poids des checkpoints sont téléchargés à la demande ou fournis sous forme de chemins locaux. Ajoutez uniquement voicehub[training] pour l'ajustement et le reporting. La licence Apache-2.0 couvre uniquement VoiceHub ; le code intégré, les checkpoints, les codecs, les jeux de données et les fichiers audio générés peuvent être soumis à des conditions distinctes.

  • Bien démarrer


    Installez VoiceHub depuis l'arborescence source actuelle et exécutez votre première requête de génération avec le model factory partagé.

    Démarrage rapide

  • Inférence


    Découvrez les intégrations, chargez des checkpoints depuis Hub ou des chemins locaux, configurez une génération reproductible et exploitez un signal audio normalisé.

    Guide d'inférence

  • Préparation des données


    Créez des manifests auditables, validez le signal audio, empêchez les fuites entre locuteurs ou sessions et générez des entrées d'entraînement propres à chaque modèle.

    Guide de préparation des données

  • Entraînement


    Validez les limites des checkpoints, exécutez les objectifs natifs, évaluez, reprenez à partir de checkpoints complets et enregistrez des artefacts portables.

    Guide d'entraînement

  • Modèles


    Comparez les entrées TTS du registry, leurs checkpoints par défaut, leurs capacités, la provenance du code source et leurs contraintes.

    Catalogue des modèles

  • Prise en charge de l'entraînement


    Vérifiez précisément, pour chaque intégration, si l'ajustement accepte des données brutes ou prétraitées, requiert un traitement spécialisé ou n'est pas disponible.

    Matrice d'entraînement

  • Notebooks


    Utilisez quatre notebooks : des exemples ciblés d'inférence, de préparation des données et d'entraînement, ainsi que le workflow Dia complet jusqu'à l'exportation et au rechargement dans un nouvel environnement d'exécution.

    Ouvrir la galerie de notebooks

  • Référence de l'API


    Consultez les factories, les résultats, les arguments du trainer, les callbacks, les collators, les stratégies, les artefacts et les registries d'extensions.

    Parcourir l'API

  • Architecture


    Comprenez le registry, les model wrappers, les adaptateurs, les stratégies d'exécution, les checkpoints et les limites des artefacts portables.

    Architecture de la bibliothèque

  • Ajouter un modèle


    Implémentez et testez un wrapper lazy, une spécification d'entraînement, un adaptateur spécialisé si nécessaire et un contrat d'exportation.

    Guide d'intégration d'un modèle