VoiceHub : inférence et entraînement de synthèse vocale¶
Une bibliothèque Python intégrée au code source pour l'inférence, la préparation des données et l'ajustement propre à chaque modèle dans les familles TTS modernes.
Qu'est-ce que VoiceHub ?¶
VoiceHub présente les modèles TTS, de reconnaissance automatique de la parole et de détection d'activité vocale au moyen d'API communes pour la configuration, le traitement, les modèles, les résultats et l'entraînement. Les implémentations restent adaptées à leur architecture : les modèles de langage à codec, les systèmes séquence à séquence, les modèles de flow matching et de diffusion, les modèles acoustiques, les systèmes antagonistes de type VITS et les pipelines composites conservent leurs propres conditionnements, objectifs, règles de propriété des paramètres et règles d'exportation.
Le registry contient 34 intégrations TTS, 23 fournisseurs ASR et 11 fournisseurs VAD. La prise en charge de l'ajustement dépend du checkpoint et de l'environnement d'exécution ; une intégration d'inférence ne garantit pas que son artefact VoiceHub actuel soit différentiable. Consultez le catalogue TTS, la matrice d'entraînement TTS et la matrice de prise en charge ASR/VAD pour choisir une intégration.
Le code source des modèles et tous les environnements d'inférence TTS, ASR et
VAD intégrés sont installés par défaut avec VoiceHub. Les poids des checkpoints
sont téléchargés à la demande ou fournis sous forme de chemins locaux. Ajoutez
uniquement voicehub[training] pour l'ajustement et le reporting. La licence
Apache-2.0 couvre uniquement VoiceHub ; le code intégré, les checkpoints, les
codecs, les jeux de données et les fichiers audio générés peuvent être soumis
à des conditions distinctes.
-
Bien démarrer
Installez VoiceHub depuis l'arborescence source actuelle et exécutez votre première requête de génération avec le model factory partagé.
-
Inférence
Découvrez les intégrations, chargez des checkpoints depuis Hub ou des chemins locaux, configurez une génération reproductible et exploitez un signal audio normalisé.
-
Préparation des données
Créez des manifests auditables, validez le signal audio, empêchez les fuites entre locuteurs ou sessions et générez des entrées d'entraînement propres à chaque modèle.
-
Entraînement
Validez les limites des checkpoints, exécutez les objectifs natifs, évaluez, reprenez à partir de checkpoints complets et enregistrez des artefacts portables.
-
Modèles
Comparez les entrées TTS du registry, leurs checkpoints par défaut, leurs capacités, la provenance du code source et leurs contraintes.
-
Prise en charge de l'entraînement
Vérifiez précisément, pour chaque intégration, si l'ajustement accepte des données brutes ou prétraitées, requiert un traitement spécialisé ou n'est pas disponible.
-
Notebooks
Utilisez quatre notebooks : des exemples ciblés d'inférence, de préparation des données et d'entraînement, ainsi que le workflow Dia complet jusqu'à l'exportation et au rechargement dans un nouvel environnement d'exécution.
-
Référence de l'API
Consultez les factories, les résultats, les arguments du trainer, les callbacks, les collators, les stratégies, les artefacts et les registries d'extensions.
-
Architecture
Comprenez le registry, les model wrappers, les adaptateurs, les stratégies d'exécution, les checkpoints et les limites des artefacts portables.
-
Ajouter un modèle
Implémentez et testez un wrapper lazy, une spécification d'entraînement, un adaptateur spécialisé si nécessaire et un contrat d'exportation.