VoiceHub:文本转语音推理与训练¶
一款集成模型源码的 Python 库,面向现代 TTS 模型家族提供推理、数据准备和 模型专用微调能力。
VoiceHub 是什么?¶
VoiceHub 通过统一的配置、处理器、模型、输出和训练器 API 提供 TTS、自动语音识别 和语音活动检测模型。模型实现始终遵循各自的架构特性:编解码器语言模型、序列到序列系统、 流匹配和扩散模型、声学模型、VITS 风格的对抗系统以及复合流水线,均保留各自的 条件机制、训练目标、参数归属和导出规则。
模型注册表包含 34 个 TTS 集成、23 个 ASR 提供程序和 11 个 VAD 提供程序。微调支持取决于具体的 checkpoint 和运行时;支持推理并不意味着当前的 VoiceHub 工件支持可微分训练。请参考 TTS 模型目录、 TTS 训练矩阵和 ASR/VAD 支持矩阵来选择合适的集成。
模型源码以及所有内置 TTS、ASR 和 VAD 推理运行时都会随 VoiceHub 默认安装。
checkpoint 权重仍按需下载,也可以通过本地路径提供。只有在微调和记录实验时才
需要添加 voicehub[training]。Apache-2.0 许可证仅适用于 VoiceHub 本身;
集成的源码、checkpoint、编解码器、数据集和生成的音频可能适用其他条款。
-
快速入门
从当前源码树安装 VoiceHub,并通过统一的模型工厂完成第一次生成请求。
-
推理
查找集成、加载 Hub 或本地 checkpoint、配置可复现的生成流程,并获取 标准化音频。
-
数据准备
构建可审计的清单、验证音频、防止说话人或会话信息泄漏,并生成模型专用的 训练输入。
-
训练
验证 checkpoint 边界、运行原生训练目标、执行评估、从完整 checkpoint 恢复训练,并保存可移植工件。
-
模型
对比 TTS 注册项的默认 checkpoint、功能、源码来源和使用限制。
-
训练支持
查看每个集成准确的微调边界:原始数据、预处理数据、专用流程或暂不支持。
-
Notebook 示例集
使用四个 Notebook:运行聚焦推理、数据准备和训练的示例,或按照完整的 Dia 工作流完成导出,并在全新运行时中重新加载。
-
API 参考
查阅工厂、输出、训练器参数、回调、collator、策略、工件和扩展注册表。
-
架构
了解注册表、模型 wrapper、适配器、运行时策略、checkpoint 和可移植工件 边界。
-
添加模型
实现并测试延迟加载 wrapper、训练规范、必要时使用的专用适配器以及导出 契约。