Ir para o conteúdo

VoiceHub: inferência e treinamento de síntese de voz

Uma biblioteca Python integrada ao código-fonte para inferência, preparação de dados e ajuste fino específico para diferentes famílias modernas de TTS.

Status da integração contínua do VoiceHub Status da compilação da documentação do VoiceHub O VoiceHub é compatível com Python 3.10 ou posterior O VoiceHub é licenciado sob a Apache 2.0

O que é o VoiceHub?

O VoiceHub disponibiliza modelos de TTS, reconhecimento automático de fala e detecção de atividade de voz por meio de APIs compartilhadas de configuração, processador, modelo, saída e treinador. As implementações permanecem cientes da arquitetura: modelos de linguagem com codec, sistemas de sequência para sequência, modelos de flow-matching e difusão, modelos acústicos, sistemas adversariais no estilo VITS e pipelines compostos mantêm seus próprios condicionamentos, objetivos, regras de propriedade de parâmetros e de exportação.

O registro contém 34 integrações TTS, 23 provedores ASR e 11 provedores VAD. O suporte a ajuste fino depende do checkpoint e do ambiente de execução; uma integração de inferência não implica que seu artefato atual do VoiceHub seja diferenciável. Consulte o catálogo TTS, a matriz de treinamento TTS e a matriz de suporte ASR/VAD para selecionar uma integração.

O código-fonte dos modelos e todos os ambientes de inferência TTS, ASR e VAD integrados são instalados por padrão com o VoiceHub. Os pesos dos checkpoints são baixados sob demanda ou fornecidos por caminhos locais. Adicione apenas voicehub[training] para ajuste fino e relatórios. A licença Apache-2.0 abrange o próprio VoiceHub; código integrado, checkpoints, codecs, conjuntos de dados e áudio gerado podem estar sujeitos a termos distintos.

  • Primeiros passos


    Instale o VoiceHub a partir da árvore de código-fonte atual e execute a primeira solicitação de geração usando a fábrica de modelos compartilhada.

    Início rápido

  • Inferência


    Encontre integrações, carregue checkpoints do Hub ou locais, configure uma geração reproduzível e consuma áudio normalizado.

    Guia de inferência

  • Preparação de dados


    Crie manifestos auditáveis, valide o áudio, evite vazamento entre locutores ou sessões e produza entradas de treinamento específicas para cada modelo.

    Guia de preparação de dados

  • Treinamento


    Valide os limites dos checkpoints, execute objetivos nativos, avalie, retome checkpoints completos e salve artefatos portáteis.

    Guia de treinamento

  • Modelos


    Compare as entradas TTS do registro, checkpoints padrão, recursos, procedência do código-fonte e restrições.

    Catálogo de modelos

  • Suporte a treinamento


    Verifique, para cada integração, o limite exato de ajuste fino com dados brutos, dados pré-processados, fluxo especializado ou sem suporte.

    Matriz de treinamento

  • Notebooks


    Use quatro notebooks: exemplos focados em inferência, preparação de dados e treinamento, além do fluxo de trabalho completo do Dia até a exportação e o recarregamento em um novo ambiente de execução.

    Abrir a galeria de notebooks

  • Referência da API


    Consulte fábricas, saídas, argumentos do treinador, callbacks, collators, estratégias, artefatos e registros de extensão.

    Explorar a API

  • Arquitetura


    Entenda o registro, os wrappers de modelo, os adaptadores, as estratégias de execução, os checkpoints e os limites dos artefatos portáteis.

    Arquitetura da biblioteca

  • Adicionar um modelo


    Implemente e teste um wrapper com carregamento tardio, uma especificação de treinamento, um adaptador especializado quando necessário e um contrato de exportação.

    Guia de integração de modelos