VoiceHub: inferencia y entrenamiento de texto a voz¶
Una biblioteca de Python integrada con el código fuente para inferencia, preparación de datos y ajuste fino específico de cada modelo en familias TTS modernas.
¿Qué es VoiceHub?¶
VoiceHub presenta modelos de TTS, reconocimiento automático de voz y detección de actividad de voz mediante API compartidas de configuración, procesamiento, modelo, resultados y entrenamiento. Las implementaciones conservan las particularidades de cada arquitectura: los modelos de lenguaje con codec, los sistemas de secuencia a secuencia, los modelos de flow matching y difusión, los modelos acústicos, los sistemas adversariales de tipo VITS y los pipelines compuestos mantienen sus propios condicionamientos, objetivos, propiedad de parámetros y reglas de exportación.
El registry contiene 34 integraciones TTS, 23 proveedores ASR y 11 proveedores VAD. La compatibilidad con el ajuste fino depende del checkpoint y del entorno de ejecución; disponer de una integración de inferencia no implica que su artefacto actual de VoiceHub sea diferenciable. Consulte el catálogo TTS, la matriz de entrenamiento TTS y la matriz de compatibilidad ASR/VAD para seleccionar una integración.
El código fuente de los modelos y todos los entornos de inferencia TTS, ASR y
VAD integrados se instalan de forma predeterminada con VoiceHub. Los pesos de
los checkpoints se descargan bajo demanda o se proporcionan mediante rutas
locales. Añada únicamente voicehub[training] para el ajuste fino y los
informes. La licencia Apache-2.0 cubre únicamente VoiceHub; el código
integrado, los checkpoints, los codecs, los conjuntos de datos y el audio
generado pueden estar sujetos a condiciones distintas.
-
Primeros pasos
Instale VoiceHub desde el árbol de código fuente actual y ejecute la primera solicitud de generación mediante el model factory compartido.
-
Inferencia
Descubra integraciones, cargue checkpoints desde Hub o rutas locales, configure una generación reproducible y utilice audio normalizado.
-
Preparación de datos
Cree manifests auditables, valide el audio, evite fugas entre hablantes o sesiones y genere entradas de entrenamiento específicas para cada modelo.
-
Entrenamiento
Valide los límites de los checkpoints, ejecute objetivos nativos, evalúe, reanude checkpoints completos y guarde artefactos portátiles.
-
Modelos
Compare las entradas TTS del registry, los checkpoints predeterminados, las capacidades, la procedencia del código fuente y las restricciones.
-
Compatibilidad de entrenamiento
Consulte el límite exacto del ajuste fino con datos sin procesar, preprocesados, especializados o no disponibles para cada integración.
-
Notebooks
Use cuatro notebooks: ejemplos centrados en inferencia, preparación de datos y entrenamiento, además del flujo de trabajo completo de Dia hasta la exportación y la recarga en un entorno nuevo.
-
Referencia de la API
Consulte factories, resultados, argumentos del trainer, callbacks, collators, estrategias, artefactos y registries de extensiones.
-
Arquitectura
Comprenda el registry, los model wrappers, los adaptadores, las estrategias de ejecución, los checkpoints y los límites de los artefactos portátiles.
-
Añadir un modelo
Implemente y pruebe un wrapper lazy, una especificación de entrenamiento, un adaptador especializado cuando sea necesario y un contrato de exportación.