VoiceHub:音声合成の推論と学習¶
最新の TTS モデルファミリーを対象に、推論、データ準備、モデル固有の ファインチューニングを提供する、ソースコード統合型の Python ライブラリです。
VoiceHub とは?¶
VoiceHub は、共通の設定、プロセッサ、モデル、出力、トレーナー API を通じて TTS、自動音声認識、音声区間検出モデルを提供します。モデルの実装では、それぞれの アーキテクチャ固有の特性を維持します。コーデック言語モデル、 シーケンス・ツー・シーケンスシステム、フローマッチングおよび拡散モデル、 音響モデル、VITS 形式の敵対的システム、複合パイプラインは、それぞれ独自の 条件付け、目的関数、パラメータ所有権、エクスポート規則を保持します。
レジストリには 34 の TTS 統合、23 の ASR プロバイダー、11 の VAD プロバイダーがあります。ファインチューニングのサポートは checkpoint と ランタイムに依存します。推論に対応していても、現在の VoiceHub アーティファクトが微分可能であるとは限りません。統合機能を選択する際は、 TTS モデルカタログ、 TTS 学習マトリクス、 ASR/VAD サポートマトリクスを参照してください。
モデルのソースコードと、組み込みの TTS・ASR・VAD 推論ランタイムはすべて
VoiceHub の標準インストールに含まれます。checkpoint の重みは必要に応じて
ダウンロードするか、ローカルパスで指定します。ファインチューニングと
レポート機能が必要な場合だけ voicehub[training] を追加してください。
Apache-2.0 ライセンスが適用されるのは VoiceHub 本体です。統合された
ソースコード、checkpoint、コーデック、データセット、生成音声には、
それぞれ別の条件が適用される場合があります。
-
はじめに
現在のソースツリーから VoiceHub をインストールし、共通モデルファクトリを 使用して最初の生成リクエストを実行します。
-
推論
統合機能を検索し、Hub またはローカルの checkpoint を読み込み、再現可能な 生成を設定して、正規化された音声を取得します。
-
データ準備
監査可能なマニフェストを作成し、音声を検証し、話者やセッションのリークを 防ぎ、モデル固有の学習入力を作成します。
-
学習
checkpoint の境界を検証し、ネイティブの目的関数を実行して評価し、完全な checkpoint から再開して、移植可能なアーティファクトを保存します。
-
モデル
TTS のレジストリエントリについて、既定の checkpoint、機能、 ソースの来歴、制約を比較します。
-
学習サポート
各統合機能について、生データ、前処理済みデータ、専用ワークフロー、 サポート対象外のいずれに該当するか、正確なファインチューニング境界を 確認します。
-
Notebook コレクション
4 つの Notebook で、推論、データ準備、学習に特化した例を実行するか、 エクスポートと新しいランタイムでの再読み込みまで含む完全な Dia ワークフローをたどります。
-
API リファレンス
ファクトリ、出力、トレーナー引数、コールバック、collator、ストラテジー、 アーティファクト、拡張レジストリを参照します。
-
アーキテクチャ
レジストリ、モデル wrapper、アダプター、ランタイムストラテジー、 checkpoint、移植可能なアーティファクトの境界について説明します。
-
モデルの追加
遅延読み込み wrapper、学習仕様、必要に応じた専用アダプター、 エクスポート契約を実装してテストします。