VoiceHub: инференс и обучение моделей синтеза речи¶
Python-библиотека с интегрированным исходным кодом моделей для инференса, подготовки данных и специализированного дообучения современных семейств TTS.
Что такое VoiceHub?¶
VoiceHub предоставляет модели TTS, автоматического распознавания речи и детекции речевой активности через унифицированные API конфигурации, процессора, модели, результата и тренера. Реализации сохраняют особенности каждой архитектуры: языковые модели с кодеками, системы sequence-to-sequence, модели flow-matching и диффузионные модели, акустические модели, состязательные системы в стиле VITS и составные пайплайны используют собственные способы кондиционирования, целевые функции, правила управления параметрами и экспорта.
Реестр содержит 34 интеграции TTS, 23 провайдеров ASR и 11 провайдеров VAD. Возможность дообучения зависит от конкретных checkpoint и среды выполнения; поддержка инференса не означает, что текущий артефакт VoiceHub поддерживает дифференцируемое обучение. Для выбора интеграции используйте каталог TTS, матрицу обучения TTS и матрицу поддержки ASR/VAD.
Исходный код моделей и все встроенные среды инференса TTS, ASR и VAD входят в
стандартную установку VoiceHub. Веса checkpoint загружаются по мере
необходимости или указываются через локальные пути. Добавляйте
voicehub[training] только для дообучения и отчётности. Лицензия Apache-2.0
распространяется на сам VoiceHub; для интегрированного исходного кода,
checkpoint, кодеков, наборов данных и сгенерированного аудио могут действовать
отдельные условия.
-
Начало работы
Установите VoiceHub из текущего дерева исходного кода и выполните первый запрос генерации через общую фабрику моделей.
-
Инференс
Находите интеграции, загружайте checkpoint из Hub или локального хранилища, настраивайте воспроизводимую генерацию и получайте нормализованное аудио.
-
Подготовка данных
Создавайте пригодные для аудита манифесты, проверяйте аудио, предотвращайте утечку данных между дикторами или сессиями и формируйте входные данные для обучения конкретной модели.
-
Обучение
Проверяйте состав и границы checkpoint, выполняйте нативные целевые функции, оценивайте модель, возобновляйте работу с полных checkpoint и сохраняйте переносимые артефакты.
-
Модели
Сравнивайте записи TTS в реестре: checkpoint по умолчанию, возможности, происхождение исходного кода и ограничения.
-
Поддержка обучения
Проверяйте точные границы дообучения для каждой интеграции: на необработанных или предобработанных данных, по специализированной схеме либо без поддержки.
-
Jupyter-ноутбуки
Используйте четыре Jupyter-ноутбука: тематические примеры по инференсу, подготовке данных и обучению, а также полный рабочий процесс Dia вплоть до экспорта и повторной загрузки в новой среде выполнения.
-
Справочник API
Изучите фабрики, выходные данные, аргументы тренера, callbacks, collators, стратегии, артефакты и реестры расширений.
-
Архитектура
Разберитесь в устройстве реестра, оберток моделей, адаптеров, стратегий выполнения, checkpoint и границ переносимых артефактов.
-
Добавление модели
Реализуйте и протестируйте обертку с отложенной загрузкой, спецификацию обучения, специализированный адаптер при необходимости и контракт экспорта.