Перейти к содержанию

VoiceHub: инференс и обучение моделей синтеза речи

Python-библиотека с интегрированным исходным кодом моделей для инференса, подготовки данных и специализированного дообучения современных семейств TTS.

Статус непрерывной интеграции VoiceHub Статус сборки документации VoiceHub VoiceHub поддерживает Python 3.10 и более поздние версии VoiceHub распространяется по лицензии Apache 2.0

Что такое VoiceHub?

VoiceHub предоставляет модели TTS, автоматического распознавания речи и детекции речевой активности через унифицированные API конфигурации, процессора, модели, результата и тренера. Реализации сохраняют особенности каждой архитектуры: языковые модели с кодеками, системы sequence-to-sequence, модели flow-matching и диффузионные модели, акустические модели, состязательные системы в стиле VITS и составные пайплайны используют собственные способы кондиционирования, целевые функции, правила управления параметрами и экспорта.

Реестр содержит 34 интеграции TTS, 23 провайдеров ASR и 11 провайдеров VAD. Возможность дообучения зависит от конкретных checkpoint и среды выполнения; поддержка инференса не означает, что текущий артефакт VoiceHub поддерживает дифференцируемое обучение. Для выбора интеграции используйте каталог TTS, матрицу обучения TTS и матрицу поддержки ASR/VAD.

Исходный код моделей и все встроенные среды инференса TTS, ASR и VAD входят в стандартную установку VoiceHub. Веса checkpoint загружаются по мере необходимости или указываются через локальные пути. Добавляйте voicehub[training] только для дообучения и отчётности. Лицензия Apache-2.0 распространяется на сам VoiceHub; для интегрированного исходного кода, checkpoint, кодеков, наборов данных и сгенерированного аудио могут действовать отдельные условия.

  • Начало работы


    Установите VoiceHub из текущего дерева исходного кода и выполните первый запрос генерации через общую фабрику моделей.

    Краткое руководство

  • Инференс


    Находите интеграции, загружайте checkpoint из Hub или локального хранилища, настраивайте воспроизводимую генерацию и получайте нормализованное аудио.

    Руководство по инференсу

  • Подготовка данных


    Создавайте пригодные для аудита манифесты, проверяйте аудио, предотвращайте утечку данных между дикторами или сессиями и формируйте входные данные для обучения конкретной модели.

    Руководство по подготовке данных

  • Обучение


    Проверяйте состав и границы checkpoint, выполняйте нативные целевые функции, оценивайте модель, возобновляйте работу с полных checkpoint и сохраняйте переносимые артефакты.

    Руководство по обучению

  • Модели


    Сравнивайте записи TTS в реестре: checkpoint по умолчанию, возможности, происхождение исходного кода и ограничения.

    Каталог моделей

  • Поддержка обучения


    Проверяйте точные границы дообучения для каждой интеграции: на необработанных или предобработанных данных, по специализированной схеме либо без поддержки.

    Матрица обучения

  • Jupyter-ноутбуки


    Используйте четыре Jupyter-ноутбука: тематические примеры по инференсу, подготовке данных и обучению, а также полный рабочий процесс Dia вплоть до экспорта и повторной загрузки в новой среде выполнения.

    Открыть галерею ноутбуков

  • Справочник API


    Изучите фабрики, выходные данные, аргументы тренера, callbacks, collators, стратегии, артефакты и реестры расширений.

    Открыть справочник API

  • Архитектура


    Разберитесь в устройстве реестра, оберток моделей, адаптеров, стратегий выполнения, checkpoint и границ переносимых артефактов.

    Архитектура библиотеки

  • Добавление модели


    Реализуйте и протестируйте обертку с отложенной загрузкой, спецификацию обучения, специализированный адаптер при необходимости и контракт экспорта.

    Руководство по интеграции модели