VoiceHub: inferência e treinamento de síntese de voz¶
Uma biblioteca Python integrada ao código-fonte para inferência, preparação de dados e ajuste fino específico para diferentes famílias modernas de TTS.
O que é o VoiceHub?¶
O VoiceHub disponibiliza modelos de TTS, reconhecimento automático de fala e detecção de atividade de voz por meio de APIs compartilhadas de configuração, processador, modelo, saída e treinador. As implementações permanecem cientes da arquitetura: modelos de linguagem com codec, sistemas de sequência para sequência, modelos de flow-matching e difusão, modelos acústicos, sistemas adversariais no estilo VITS e pipelines compostos mantêm seus próprios condicionamentos, objetivos, regras de propriedade de parâmetros e de exportação.
O registro contém 34 integrações TTS, 23 provedores ASR e 11 provedores VAD. O suporte a ajuste fino depende do checkpoint e do ambiente de execução; uma integração de inferência não implica que seu artefato atual do VoiceHub seja diferenciável. Consulte o catálogo TTS, a matriz de treinamento TTS e a matriz de suporte ASR/VAD para selecionar uma integração.
O código-fonte dos modelos e todos os ambientes de inferência TTS, ASR e VAD
integrados são instalados por padrão com o VoiceHub. Os pesos dos checkpoints
são baixados sob demanda ou fornecidos por caminhos locais. Adicione apenas
voicehub[training] para ajuste fino e relatórios. A licença Apache-2.0
abrange o próprio VoiceHub; código integrado, checkpoints, codecs, conjuntos
de dados e áudio gerado podem estar sujeitos a termos distintos.
-
Primeiros passos
Instale o VoiceHub a partir da árvore de código-fonte atual e execute a primeira solicitação de geração usando a fábrica de modelos compartilhada.
-
Inferência
Encontre integrações, carregue checkpoints do Hub ou locais, configure uma geração reproduzível e consuma áudio normalizado.
-
Preparação de dados
Crie manifestos auditáveis, valide o áudio, evite vazamento entre locutores ou sessões e produza entradas de treinamento específicas para cada modelo.
-
Treinamento
Valide os limites dos checkpoints, execute objetivos nativos, avalie, retome checkpoints completos e salve artefatos portáteis.
-
Modelos
Compare as entradas TTS do registro, checkpoints padrão, recursos, procedência do código-fonte e restrições.
-
Suporte a treinamento
Verifique, para cada integração, o limite exato de ajuste fino com dados brutos, dados pré-processados, fluxo especializado ou sem suporte.
-
Notebooks
Use quatro notebooks: exemplos focados em inferência, preparação de dados e treinamento, além do fluxo de trabalho completo do Dia até a exportação e o recarregamento em um novo ambiente de execução.
-
Referência da API
Consulte fábricas, saídas, argumentos do treinador, callbacks, collators, estratégias, artefatos e registros de extensão.
-
Arquitetura
Entenda o registro, os wrappers de modelo, os adaptadores, as estratégias de execução, os checkpoints e os limites dos artefatos portáteis.
-
Adicionar um modelo
Implemente e teste um wrapper com carregamento tardio, uma especificação de treinamento, um adaptador especializado quando necessário e um contrato de exportação.