Model list¶
Choose a model to open its dedicated usage, source, training, checkpoint, and public API documentation.
Text to speech¶
| Model | Languages | Hugging Face ID | Training | Notebook |
|---|---|---|---|---|
Bark |
de, en, es, fr, … complete audited list on the model page |
suno/bark-small |
preprocessed |
Colab |
Chatterbox |
ar, da, de, el, … complete audited list on the model page |
ResembleAI/chatterbox |
custom |
Colab |
ConversationTTS |
en, zh, yue |
AudioFoundation/SpeechFoundation |
native |
Colab |
CosyVoice |
zh, en, ja, ko, … complete audited list on the model page |
FunAudioLLM/Fun-CosyVoice3-0.5B-2512 |
custom |
Colab |
CSM |
en |
sesame/csm-1b |
native |
Colab |
Dia |
en |
nari-labs/Dia-1.6B-0626 |
native |
Colab |
EchoTTS |
en |
jordand/echo-tts-base |
preprocessed |
Colab |
F5TTS |
en, zh |
SWivid/F5-TTS |
preprocessed |
— |
FishTTS |
zh, en, ja, ko, … complete audited list on the model page |
fishaudio/s2-pro |
preprocessed |
Colab |
GPTSoVITS |
zh, en, ja, ko, yue |
lj1995/GPT-SoVITS |
preprocessed |
Colab |
HiggsTTS |
en, zh, de, ko |
bosonai/higgs-tts-2-3b-base |
native |
Colab |
InflectTTS |
en-US |
owensong/Inflect-Micro-v2 |
preprocessed |
Colab |
IrodoriTTS |
ja |
Aratako/Irodori-TTS-500M-v3 |
native |
Colab |
Kokoro |
en-US, en-GB, es, fr, … complete audited list on the model page |
hexgrad/Kokoro-82M |
preprocessed |
Colab |
Llasa |
zh, en, de, fr, … complete audited list on the model page |
HKUSTAudio/Llasa-1B-Multilingual |
native |
Colab |
MeloTTS |
en, fr, ja, es, zh, ko |
myshell-ai/MeloTTS-English |
preprocessed |
— |
MossTTS |
zh, yue, en, ar, … complete audited list on the model page |
OpenMOSS-Team/MOSS-TTS-v1.5 |
native |
Colab |
NeuTTS |
en |
neuphonic/neutts-2e |
native |
Colab |
OmniVoice |
aae, aal, aao, ab, … complete audited list on the model page |
k2-fsa/OmniVoice |
native |
Colab |
OpenVoice |
en, es, fr, zh, ja, ko |
myshell-ai/OpenVoiceV2 |
custom |
Colab |
OrpheusTTS |
en |
canopylabs/orpheus-3b-0.1-ft |
native |
Colab |
OuteTTS |
en, ar, zh, nl, … complete audited list on the model page |
OuteAI/Llama-OuteTTS-1.0-1B |
preprocessed |
Colab |
ParlerTTS |
en |
parler-tts/parler-tts-mini-v1 |
native |
Colab |
Qwen3TTS |
zh, en, ja, ko, … complete audited list on the model page |
Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice |
preprocessed |
Colab |
SpeechT5 |
en |
microsoft/speecht5_tts |
native |
Colab |
StyleTTS2 |
en-US |
yl4579/StyleTTS2-LibriTTS |
preprocessed |
— |
Supertonic |
en, ko, ja, ar, … complete audited list on the model page |
Supertone/supertonic-3 |
preprocessed |
Colab |
VibeVoice |
en |
microsoft/VibeVoice-Realtime-0.5B |
preprocessed |
Colab |
Vits |
en |
facebook/mms-tts-eng |
preprocessed |
Colab |
VoxCPM |
zh, en, ar, my, … complete audited list on the model page |
openbmb/VoxCPM2 |
native |
Colab |
Vui |
en |
fluxions/vui |
preprocessed |
— |
XTTS |
en, es, fr, de, … complete audited list on the model page |
coqui/XTTS-v2 |
preprocessed |
Colab |
Zonos |
en, ja, zh, fr, de |
Zyphra/Zonos-v0.1-transformer |
preprocessed |
Colab |
Zonos2 |
en, zh, ja, ko, … complete audited list on the model page |
Zyphra/ZONOS2 |
native |
Colab |
Automatic speech recognition¶
| Model | Languages | Hugging Face ID | Training | Notebook |
|---|---|---|---|---|
Cohere |
ar, de, el, en, … complete audited list on the model page |
CohereLabs/cohere-transcribe-03-2026 |
native |
Colab |
ESPnetASR |
en |
espnet/shinji-watanabe-librispeech_asr_train_asr_transformer_e18_raw_bpe_sp_valid.acc.best |
native |
Colab |
FasterWhisper |
en, zh, de, es, … complete audited list on the model page |
openai/whisper-small |
native |
Colab |
FunASR |
zh, en, ja, ko, yue |
FunAudioLLM/SenseVoiceSmall |
native |
Colab |
GraniteSpeech |
en, fr, de, es, pt, ja |
ibm-granite/granite-speech-4.1-2b |
native |
Colab |
Hubert |
en |
facebook/hubert-large-ls960-ft |
native |
Colab |
MedASR |
en |
google/medasr |
native |
Colab |
Moonshine |
en |
UsefulSensors/moonshine-tiny |
native |
Colab |
NeMoASR |
en |
Not published / not applicable | native |
— |
Nemotron |
en-US, en-GB, es-US, es-ES, … complete audited list on the model page |
nvidia/nemotron-3.5-asr-streaming-0.6b |
native |
Colab |
OpenAIWhisper |
en, zh, de, es, … complete audited list on the model page |
openai/whisper-small |
native |
Colab |
ParakeetTDT |
en, es, fr, de, … complete audited list on the model page |
nvidia/parakeet-tdt-0.6b-v3 |
native |
Colab |
Qwen3ASR |
ar, yue, zh, cs, … complete audited list on the model page |
Qwen/Qwen3-ASR-0.6B |
native |
Colab |
SeamlessM4Tv2 |
afr, amh, arb, ary, … complete audited list on the model page |
facebook/seamless-m4t-v2-large |
native |
Colab |
SpeechBrainASR |
en |
speechbrain/asr-crdnn-rnnlm-librispeech |
native |
Colab |
Tiron |
en, zh |
Trelis/tiron |
native |
Colab |
TransformersASR |
en, zh, de, es, … complete audited list on the model page |
openai/whisper-small |
native |
Colab |
VibeVoice |
en, zh, es, pt, … complete audited list on the model page |
microsoft/VibeVoice-ASR-HF |
native |
Colab |
Wav2Vec2 |
en |
facebook/wav2vec2-base-960h |
native |
Colab |
WavLM |
en |
patrickvonplaten/wavlm-libri-clean-100h-base-plus |
native |
Colab |
WeNetASR |
en |
Not published / not applicable | native |
— |
Whisper |
en, zh, de, es, … complete audited list on the model page |
openai/whisper-large-v3-turbo |
native |
Colab |
WhisperX |
en, zh, de, es, … complete audited list on the model page |
openai/whisper-small |
native |
Colab |
Voice activity detection¶
| Model | Languages | Hugging Face ID | Training | Notebook |
|---|---|---|---|---|
AuditokVAD |
Not text-language conditioned | Not published / not applicable | inference-only |
— |
FunASRVAD |
Not text-language conditioned | funasr/fsmn-vad |
native |
Colab |
NeMoVAD |
Not text-language conditioned | nvidia/Frame_VAD_Multilingual_MarbleNet_v2.0 |
native |
Colab |
PyannoteBrouhahaVAD |
Not text-language conditioned | pyannote/brouhaha |
native |
Colab |
PyannoteSegmentationVAD |
Not text-language conditioned | pyannote/segmentation-3.0 |
native |
Colab |
PyannoteVAD |
Not text-language conditioned | pyannote/voice-activity-detection |
native |
Colab |
SherpaONNXVAD |
Not text-language conditioned | safestack/silero-vad |
native |
Colab |
SileroVAD |
Not text-language conditioned | safestack/silero-vad |
native |
Colab |
SpeechBrainVAD |
Not text-language conditioned | speechbrain/vad-crdnn-libriparty |
native |
Colab |
TransformersVAD |
Not text-language conditioned | Not published / not applicable | native |
— |
WebRTCVAD |
Not text-language conditioned | Not published / not applicable | inference-only |
— |
Registry access¶
Registry discovery stays lazy and imports no model runtime.
from voicehub import list_model_specs
for model in list_model_specs():
print(model.task.value, model.display_name, model.model_type)
Use the training matrix and optimization catalog for compact comparisons.
Generated by scripts/generate_model_pages.py from lazy registry metadata.