コンテンツにスキップ

VoiceHub:音声合成の推論と学習

最新の TTS モデルファミリーを対象に、推論、データ準備、モデル固有の ファインチューニングを提供する、ソースコード統合型の Python ライブラリです。

VoiceHub の継続的インテグレーションのステータス VoiceHub ドキュメントのビルドステータス VoiceHub は Python 3.10 以降をサポートしています VoiceHub は Apache 2.0 ライセンスで提供されています

VoiceHub とは?

VoiceHub は、共通の設定、プロセッサ、モデル、出力、トレーナー API を通じて TTS、自動音声認識、音声区間検出モデルを提供します。モデルの実装では、それぞれの アーキテクチャ固有の特性を維持します。コーデック言語モデル、 シーケンス・ツー・シーケンスシステム、フローマッチングおよび拡散モデル、 音響モデル、VITS 形式の敵対的システム、複合パイプラインは、それぞれ独自の 条件付け、目的関数、パラメータ所有権、エクスポート規則を保持します。

レジストリには 34 の TTS 統合23 の ASR プロバイダー11 の VAD プロバイダーがあります。ファインチューニングのサポートは checkpoint と ランタイムに依存します。推論に対応していても、現在の VoiceHub アーティファクトが微分可能であるとは限りません。統合機能を選択する際は、 TTS モデルカタログTTS 学習マトリクスASR/VAD サポートマトリクスを参照してください。

モデルのソースコードと、組み込みの TTS・ASR・VAD 推論ランタイムはすべて VoiceHub の標準インストールに含まれます。checkpoint の重みは必要に応じて ダウンロードするか、ローカルパスで指定します。ファインチューニングと レポート機能が必要な場合だけ voicehub[training] を追加してください。 Apache-2.0 ライセンスが適用されるのは VoiceHub 本体です。統合された ソースコード、checkpoint、コーデック、データセット、生成音声には、 それぞれ別の条件が適用される場合があります。

  • はじめに


    現在のソースツリーから VoiceHub をインストールし、共通モデルファクトリを 使用して最初の生成リクエストを実行します。

    クイックスタート

  • 推論


    統合機能を検索し、Hub またはローカルの checkpoint を読み込み、再現可能な 生成を設定して、正規化された音声を取得します。

    推論ガイド

  • データ準備


    監査可能なマニフェストを作成し、音声を検証し、話者やセッションのリークを 防ぎ、モデル固有の学習入力を作成します。

    データ準備ガイド

  • 学習


    checkpoint の境界を検証し、ネイティブの目的関数を実行して評価し、完全な checkpoint から再開して、移植可能なアーティファクトを保存します。

    学習ガイド

  • モデル


    TTS のレジストリエントリについて、既定の checkpoint、機能、 ソースの来歴、制約を比較します。

    モデルカタログ

  • 学習サポート


    各統合機能について、生データ、前処理済みデータ、専用ワークフロー、 サポート対象外のいずれに該当するか、正確なファインチューニング境界を 確認します。

    学習マトリクス

  • Notebook コレクション


    4 つの Notebook で、推論、データ準備、学習に特化した例を実行するか、 エクスポートと新しいランタイムでの再読み込みまで含む完全な Dia ワークフローをたどります。

    Notebook ギャラリーを開く

  • API リファレンス


    ファクトリ、出力、トレーナー引数、コールバック、collator、ストラテジー、 アーティファクト、拡張レジストリを参照します。

    API を参照

  • アーキテクチャ


    レジストリ、モデル wrapper、アダプター、ランタイムストラテジー、 checkpoint、移植可能なアーティファクトの境界について説明します。

    ライブラリアーキテクチャ

  • モデルの追加


    遅延読み込み wrapper、学習仕様、必要に応じた専用アダプター、 エクスポート契約を実装してテストします。

    モデル統合ガイド