Saltar a contenido

VoiceHub: inferencia y entrenamiento de texto a voz

Una biblioteca de Python integrada con el código fuente para inferencia, preparación de datos y ajuste fino específico de cada modelo en familias TTS modernas.

Estado de la integración continua de VoiceHub Estado de la compilación de la documentación de VoiceHub VoiceHub es compatible con Python 3.10 y versiones posteriores VoiceHub se distribuye bajo la licencia Apache 2.0

¿Qué es VoiceHub?

VoiceHub presenta modelos de TTS, reconocimiento automático de voz y detección de actividad de voz mediante API compartidas de configuración, procesamiento, modelo, resultados y entrenamiento. Las implementaciones conservan las particularidades de cada arquitectura: los modelos de lenguaje con codec, los sistemas de secuencia a secuencia, los modelos de flow matching y difusión, los modelos acústicos, los sistemas adversariales de tipo VITS y los pipelines compuestos mantienen sus propios condicionamientos, objetivos, propiedad de parámetros y reglas de exportación.

El registry contiene 34 integraciones TTS, 23 proveedores ASR y 11 proveedores VAD. La compatibilidad con el ajuste fino depende del checkpoint y del entorno de ejecución; disponer de una integración de inferencia no implica que su artefacto actual de VoiceHub sea diferenciable. Consulte el catálogo TTS, la matriz de entrenamiento TTS y la matriz de compatibilidad ASR/VAD para seleccionar una integración.

El código fuente de los modelos y todos los entornos de inferencia TTS, ASR y VAD integrados se instalan de forma predeterminada con VoiceHub. Los pesos de los checkpoints se descargan bajo demanda o se proporcionan mediante rutas locales. Añada únicamente voicehub[training] para el ajuste fino y los informes. La licencia Apache-2.0 cubre únicamente VoiceHub; el código integrado, los checkpoints, los codecs, los conjuntos de datos y el audio generado pueden estar sujetos a condiciones distintas.

  • Primeros pasos


    Instale VoiceHub desde el árbol de código fuente actual y ejecute la primera solicitud de generación mediante el model factory compartido.

    Inicio rápido

  • Inferencia


    Descubra integraciones, cargue checkpoints desde Hub o rutas locales, configure una generación reproducible y utilice audio normalizado.

    Guía de inferencia

  • Preparación de datos


    Cree manifests auditables, valide el audio, evite fugas entre hablantes o sesiones y genere entradas de entrenamiento específicas para cada modelo.

    Guía de preparación de datos

  • Entrenamiento


    Valide los límites de los checkpoints, ejecute objetivos nativos, evalúe, reanude checkpoints completos y guarde artefactos portátiles.

    Guía de entrenamiento

  • Modelos


    Compare las entradas TTS del registry, los checkpoints predeterminados, las capacidades, la procedencia del código fuente y las restricciones.

    Catálogo de modelos

  • Compatibilidad de entrenamiento


    Consulte el límite exacto del ajuste fino con datos sin procesar, preprocesados, especializados o no disponibles para cada integración.

    Matriz de entrenamiento

  • Notebooks


    Use cuatro notebooks: ejemplos centrados en inferencia, preparación de datos y entrenamiento, además del flujo de trabajo completo de Dia hasta la exportación y la recarga en un entorno nuevo.

    Abrir la galería de notebooks

  • Referencia de la API


    Consulte factories, resultados, argumentos del trainer, callbacks, collators, estrategias, artefactos y registries de extensiones.

    Explorar la API

  • Arquitectura


    Comprenda el registry, los model wrappers, los adaptadores, las estrategias de ejecución, los checkpoints y los límites de los artefactos portátiles.

    Arquitectura de la biblioteca

  • Añadir un modelo


    Implemente y pruebe un wrapper lazy, una especificación de entrenamiento, un adaptador especializado cuando sea necesario y un contrato de exportación.

    Guía de integración de modelos