language:
- zh
- en
- ms
- ta
- bn
- te
- nl
- fr
- de
- it
- pl
- pt
- es
- ar configs:
- config_name: 700h-tr-turkish-text-to-speech
data_files:
- split: train path: 700h-tr-turkish-text-to-speech/train-*
- config_name: 9jalingo-hausa
data_files:
- split: train path: 9jalingo-hausa/train-*
- config_name: 9jalingo-igbo
data_files:
- split: train path: 9jalingo-igbo/train-*
- config_name: 9jalingo-pidgin
data_files:
- split: train path: 9jalingo-pidgin/train-*
- config_name: 9jalingo-yoruba
data_files:
- split: train path: 9jalingo-yoruba/train-*
- config_name: AISHELL-1-processed
data_files:
- split: train path: AISHELL-1-processed/train-*
- config_name: AISHELL3
data_files:
- split: train path: AISHELL3/train-*
- config_name: AItuber-Persona-Voices-JA
data_files:
- split: train path: AItuber-Persona-Voices-JA/train-*
- config_name: ALFFA-Swahili-News
data_files:
- split: train path: ALFFA-Swahili-News/train-*
- config_name: ASCEND
data_files:
- split: train path: ASCEND/train-*
- config_name: ASCEND-phoneme
data_files:
- split: train path: ASCEND-phoneme/train-*
- config_name: ASR-Benchmarking-Dataset
data_files:
- split: train path: ASR-Benchmarking-Dataset/train-*
- config_name: ASR-Tamil-cleaned
data_files:
- split: train path: ASR-Tamil-cleaned/train-*
- config_name: ASR_TEDx_Tunisie
data_files:
- split: train path: ASR_TEDx_Tunisie/train-*
- config_name: ASR_f5
data_files:
- split: train path: ASR_f5/train-*
- config_name: ASR_pulaar
data_files:
- split: train path: ASR_pulaar/train-*
- config_name: ATCO2-ASR-1h
data_files:
- split: train path: ATCO2-ASR-1h/train-*
- config_name: ATC_combined
data_files:
- split: train path: ATC_combined/train-*
- config_name: ATC_combined__Tabys
data_files:
- split: train path: ATC_combined__Tabys/train-*
- config_name: Ace-Taffy-voice
data_files:
- split: train path: Ace-Taffy-voice/train-*
- config_name: Adaption-low-resource-audio
data_files:
- split: train path: Adaption-low-resource-audio/train-*
- config_name: Adaption-multilingual-speech
data_files:
- split: train path: Adaption-multilingual-speech/train-*
- config_name: Alexis
data_files:
- split: train path: Alexis/train-*
- config_name: AniSpeech
data_files:
- split: train path: AniSpeech/train-*
- config_name: AnimeSpeech
data_files:
- split: train path: AnimeSpeech/train-*
- config_name: AnimeVox
data_files:
- split: train path: AnimeVox/train-*
- config_name: Antuan_de_Sent-Ekziupiery_Planieta_ludziei_all
data_files:
- split: train path: Antuan_de_Sent-Ekziupiery_Planieta_ludziei_all/train-*
- config_name: Antuan_de_Sent-Ekziupiery_Planieta_ludziei_output_original
data_files:
- split: train path: Antuan_de_Sent-Ekziupiery_Planieta_ludziei_output_original/train-*
- config_name: ArVoice
data_files:
- split: train path: ArVoice/train-*
- config_name: Arabic-Diacritized-TTS
data_files:
- split: train path: Arabic-Diacritized-TTS/train-*
- config_name: Arabic-Speech-TN
data_files:
- split: train path: Arabic-Speech-TN/train-*
- config_name: Arabic-professional-voice
data_files:
- split: train path: Arabic-professional-voice/train-*
- config_name: Arabic_Diacritized_Audio_Dataset
data_files:
- split: train path: Arabic_Diacritized_Audio_Dataset/train-*
- config_name: Armenian-speech-corpus
data_files:
- split: train path: Armenian-speech-corpus/train-*
- config_name: Asian-High-Fidelity-ASR-Dataset
data_files:
- split: train path: Asian-High-Fidelity-ASR-Dataset/train-*
- config_name: Audio-text
data_files:
- split: train path: Audio-text/train-*
- config_name: Azerbaijani_News_TTS
data_files:
- split: train path: Azerbaijani_News_TTS/train-*
- config_name: Azure-TTS-Synthetic
data_files:
- split: train path: Azure-TTS-Synthetic/train-*
- config_name: Azure-TTS-annotated
data_files:
- split: train path: Azure-TTS-annotated/train-*
- config_name: BA_Datensatz_V2
data_files:
- split: train path: BA_Datensatz_V2/train-*
- config_name: Bahnar_Vietnamese
data_files:
- split: train path: Bahnar_Vietnamese/train-*
- config_name: Bam_ASR_Eval_500
data_files:
- split: train path: Bam_ASR_Eval_500/train-*
- config_name: Bambara_AudioSynthetique_42K_V3
data_files:
- split: train path: Bambara_AudioSynthetique_42K_V3/train-*
- config_name: Bangali_local_dialect_ASR_HF_Dataset
data_files:
- split: train path: Bangali_local_dialect_ASR_HF_Dataset/train-*
- config_name: Bangor-Miami-Spanish-English-Corpus
data_files:
- split: train path: Bangor-Miami-Spanish-English-Corpus/train-*
- config_name: Ben-Tucker
data_files:
- split: train path: Ben-Tucker/train-*
- config_name: BiasInEar
data_files:
- split: train path: BiasInEar/train-*
- config_name: BibleMMS_vie
data_files:
- split: train path: BibleMMS_vie/train-*
- config_name: BitesizeIrish-GA-EN
data_files:
- split: train path: BitesizeIrish-GA-EN/train-*
- config_name: Bolbosh
data_files:
- split: train path: Bolbosh/train-*
- config_name: C3T
data_files:
- split: train path: C3T/train-*
- config_name: CAESAR-TINY
data_files:
- split: train path: CAESAR-TINY/train-*
- config_name: CAESAR-TV3
data_files:
- split: train path: CAESAR-TV3/train-*
- config_name: CAMEO
data_files:
- split: train path: CAMEO/train-*
- config_name: CAMEO__yiyandeng
data_files:
- split: train path: CAMEO__yiyandeng/train-*
- config_name: CORAA-v1.1
data_files:
- split: train path: CORAA-v1.1/train-*
- config_name: CRPO
data_files:
- split: train path: CRPO/train-*
- config_name: CRPO__declare-lab
data_files:
- split: train path: CRPO__declare-lab/train-*
- config_name: CSEMOTIONS
data_files:
- split: train path: CSEMOTIONS/train-*
- config_name: CSEMOTIONS__sdcsdccdsd
data_files:
- split: train path: CSEMOTIONS__sdcsdccdsd/train-*
- config_name: Changsha_Dialect_Conversational_Speech_Corpus
data_files:
- split: train path: Changsha_Dialect_Conversational_Speech_Corpus/train-*
- config_name: ChildMandarin
data_files:
- split: train path: ChildMandarin/train-*
- config_name: ClArTTS
data_files:
- split: train path: ClArTTS/train-*
- config_name: ClarinStudioPL
data_files:
- split: train path: ClarinStudioPL/train-*
- config_name: CoSHE-500
data_files:
- split: train path: CoSHE-500/train-*
- config_name: CoVoST2-EN-AR
data_files:
- split: train path: CoVoST2-EN-AR/train-*
- config_name: Common-Voice-Geo-Cleaned
data_files:
- split: train path: Common-Voice-Geo-Cleaned/train-*
- config_name: Common-Voice-Geo-Cleaned__CH0BRK
data_files:
- split: train path: Common-Voice-Geo-Cleaned__CH0BRK/train-*
- config_name: CommonPhoneDataset
data_files:
- split: train path: CommonPhoneDataset/train-*
- config_name: CommonVoice22_Sidon
data_files:
- split: train path: CommonVoice22_Sidon/train-*
- config_name: Corinth_dataset
data_files:
- split: train path: Corinth_dataset/train-*
- config_name: Creativeguy-persian-asr
data_files:
- split: train path: Creativeguy-persian-asr/train-*
- config_name: Czech-Speech-Monospeaker-Honza
data_files:
- split: train path: Czech-Speech-Monospeaker-Honza/train-*
- config_name: DASS2019_NLP
data_files:
- split: train path: DASS2019_NLP/train-*
- config_name: DATASET-darija
data_files:
- split: train path: DATASET-darija/train-*
- config_name: DATASET-darija-ASR-clean
data_files:
- split: train path: DATASET-darija-ASR-clean/train-*
- config_name: Dahee7
data_files:
- split: train path: Dahee7/train-*
- config_name: DarijaTTS-clean
data_files:
- split: train path: DarijaTTS-clean/train-*
- config_name: Dastum-yar-stt-breton-data
data_files:
- split: train path: Dastum-yar-stt-breton-data/train-*
- config_name: Debatts-Data
data_files:
- split: train path: Debatts-Data/train-*
- config_name: Debatts-Data__Qq111-hf
data_files:
- split: train path: Debatts-Data__Qq111-hf/train-*
- config_name: Dhravani
data_files:
- split: train path: Dhravani/train-*
- config_name: DialectalSpeech-ICL
data_files:
- split: train path: DialectalSpeech-ICL/train-*
- config_name: DisfluencySpeech
data_files:
- split: train path: DisfluencySpeech/train-*
- config_name: DuBLaB-en-fr-0.7
data_files:
- split: train path: DuBLaB-en-fr-0.7/train-*
- config_name: DuBLaB-en-fr-0.7-f-0.2
data_files:
- split: train path: DuBLaB-en-fr-0.7-f-0.2/train-*
- config_name: DuBLaB-en-fr-0.7-f-0.5
data_files:
- split: train path: DuBLaB-en-fr-0.7-f-0.5/train-*
- config_name: DuBLaB-en-fr-0.8
data_files:
- split: train path: DuBLaB-en-fr-0.8/train-*
- config_name: EA-UD-DI
data_files:
- split: train path: EA-UD-DI/train-*
- config_name: EGY2K
data_files:
- split: train path: EGY2K/train-*
- config_name: ESLTTS
data_files:
- split: train path: ESLTTS/train-*
- config_name: EUbookshop-Speech-Irish
data_files:
- split: train path: EUbookshop-Speech-Irish/train-*
- config_name: EchoTTS-OmniVoice-En
data_files:
- split: train path: EchoTTS-OmniVoice-En/train-*
- config_name: Egyptian-ASR-MGB-3
data_files:
- split: train path: Egyptian-ASR-MGB-3/train-*
- config_name: Egyptian-ASR-MGB-3__severo
data_files:
- split: train path: Egyptian-ASR-MGB-3__severo/train-*
- config_name: Egyptian-Arabic-Lectures
data_files:
- split: train path: Egyptian-Arabic-Lectures/train-*
- config_name: Elise
data_files:
- split: train path: Elise/train-*
- config_name: EmergentTTS-Eval
data_files:
- split: train path: EmergentTTS-Eval/train-*
- config_name: Emilia-NV
data_files:
- split: train path: Emilia-NV/train-*
- config_name: EmoVoice-DB
data_files:
- split: train path: EmoVoice-DB/train-*
- config_name: Enigma-Dataset
data_files:
- split: train path: Enigma-Dataset/train-*
- config_name: FLEURS-GA-EN
data_files:
- split: train path: FLEURS-GA-EN/train-*
- config_name: FLEURS-SpeechT-GL-EN
data_files:
- split: train path: FLEURS-SpeechT-GL-EN/train-*
- config_name: FalAR
data_files:
- split: train path: FalAR/train-*
- config_name: FeruzaSpeech_to_fine_tuning
data_files:
- split: train path: FeruzaSpeech_to_fine_tuning/train-*
- config_name: Fleurs-Kn
data_files:
- split: train path: Fleurs-Kn/train-*
- config_name: Fleurs-Kn__Indic-LLM-Labs
data_files:
- split: train path: Fleurs-Kn__Indic-LLM-Labs/train-*
- config_name: Fleurs-Kn__Kannada-LLM-Labs
data_files:
- split: train path: Fleurs-Kn__Kannada-LLM-Labs/train-*
- config_name: French_game_voice
data_files:
- split: train path: French_game_voice/train-*
- config_name: GAPS
data_files:
- split: train path: GAPS/train-*
- config_name: GCP-TTS
data_files:
- split: train path: GCP-TTS/train-*
- config_name: GLOBE
data_files:
- split: train path: GLOBE/train-*
- config_name: GLOBE_V2
data_files:
- split: train path: GLOBE_V2/train-*
- config_name: GLOBE_V3
data_files:
- split: train path: GLOBE_V3/train-*
- config_name: GLaDOS-audio-v2
data_files:
- split: train path: GLaDOS-audio-v2/train-*
- config_name: GMaSC
data_files:
- split: train path: GMaSC/train-*
- config_name: GTTS-Chirp3-Synthetic
data_files:
- split: train path: GTTS-Chirp3-Synthetic/train-*
- config_name: GTTS-WaveNet-Synthetic
data_files:
- split: train path: GTTS-WaveNet-Synthetic/train-*
- config_name: Habibi
data_files:
- split: train path: Habibi/train-*
- config_name: Hellenic-greek-parliamentary-speech
data_files:
- split: train path: Hellenic-greek-parliamentary-speech/train-*
- config_name: HiKE
data_files:
- split: train path: HiKE/train-*
- config_name: Hindi-1482Hrs
data_files:
- split: train path: Hindi-1482Hrs/train-*
- config_name: Hindi-audio-speech
data_files:
- split: train path: Hindi-audio-speech/train-*
- config_name: Hypa-Speech-10k
data_files:
- split: train path: Hypa-Speech-10k/train-*
- config_name: Hypa-Speech-10k__Kppwdfgu1
data_files:
- split: train path: Hypa-Speech-10k__Kppwdfgu1/train-*
- config_name: Hypa_Fleurs
data_files:
- split: train path: Hypa_Fleurs/train-*
- config_name: IMDA-TTS
data_files:
- split: train path: IMDA-TTS/train-*
- config_name: INDspeech
data_files:
- split: train path: INDspeech/train-*
- config_name: ISSAI_KSC_335RS_v_1_1
data_files:
- split: train path: ISSAI_KSC_335RS_v_1_1/train-*
- config_name: Indic-High-Fidelity-MultiSpeaker-ASR
data_files:
- split: train path: Indic-High-Fidelity-MultiSpeaker-ASR/train-*
- config_name: IndicTTS
data_files:
- split: train path: IndicTTS/train-*
- config_name: IndicTTS-Bengali
data_files:
- split: train path: IndicTTS-Bengali/train-*
- config_name: IndicTTS-Hindi
data_files:
- split: train path: IndicTTS-Hindi/train-*
- config_name: IndicTTS_Assamese
data_files:
- split: train path: IndicTTS_Assamese/train-*
- config_name: IndicTTS_Bengali
data_files:
- split: train path: IndicTTS_Bengali/train-*
- config_name: IndicTTS_BengaliOLD
data_files:
- split: train path: IndicTTS_BengaliOLD/train-*
- config_name: IndicTTS_English
data_files:
- split: train path: IndicTTS_English/train-*
- config_name: IndicTTS_Kannada
data_files:
- split: train path: IndicTTS_Kannada/train-*
- config_name: IndicTTS_Malayalam
data_files:
- split: train path: IndicTTS_Malayalam/train-*
- config_name: IndicTTS_Manipuri
data_files:
- split: train path: IndicTTS_Manipuri/train-*
- config_name: IndicTTS_Manipuri__Chingkheinganba
data_files:
- split: train path: IndicTTS_Manipuri__Chingkheinganba/train-*
- config_name: IndicTTS_Marathi
data_files:
- split: train path: IndicTTS_Marathi/train-*
- config_name: IndicTTS_Odia
data_files:
- split: train path: IndicTTS_Odia/train-*
- config_name: IndicTTS_Punjabi
data_files:
- split: train path: IndicTTS_Punjabi/train-*
- config_name: IndicTTS_Rajasthani
data_files:
- split: train path: IndicTTS_Rajasthani/train-*
- config_name: IndicTTS_Tamil
data_files:
- split: train path: IndicTTS_Tamil/train-*
- config_name: IndicTTS_Telugu
data_files:
- split: train path: IndicTTS_Telugu/train-*
- config_name: IndicTTS_Telugu_MultiSpeaker
data_files:
- split: train path: IndicTTS_Telugu_MultiSpeaker/train-*
- config_name: IndicTTS_v2
data_files:
- split: train path: IndicTTS_v2/train-*
- config_name: IndicVoices-R_Hindi
data_files:
- split: train path: IndicVoices-R_Hindi/train-*
- config_name: IndicVoices-R_Hindi__impriyanshu-garg00
data_files:
- split: train path: IndicVoices-R_Hindi__impriyanshu-garg00/train-*
- config_name: Indic_ASR_Eval
data_files:
- split: train path: Indic_ASR_Eval/train-*
- config_name: InstructTTSEval
data_files:
- split: train path: InstructTTSEval/train-*
- config_name: Irodori-Ja-500M-v2-vs-600M-v3-compare-20
data_files:
- split: train path: Irodori-Ja-500M-v2-vs-600M-v3-compare-20/train-*
- config_name: Irodori-Ja-Spk1-10k
data_files:
- split: train path: Irodori-Ja-Spk1-10k/train-*
- config_name: Irodori-Ja-Spk2-10k
data_files:
- split: train path: Irodori-Ja-Spk2-10k/train-*
- config_name: Irodori-Ja-Spk3-10k
data_files:
- split: train path: Irodori-Ja-Spk3-10k/train-*
- config_name: Irodori-Ja-Spk4-10k
data_files:
- split: train path: Irodori-Ja-Spk4-10k/train-*
- config_name: J-HARD-TTS-Eval
data_files:
- split: train path: J-HARD-TTS-Eval/train-*
- config_name: JA_audio_JA_text_180k_samples
data_files:
- split: train path: JA_audio_JA_text_180k_samples/train-*
- config_name: JSS
data_files:
- split: train path: JSS/train-*
- config_name: Japanese-Anime-Speech-v2
data_files:
- split: train path: Japanese-Anime-Speech-v2/train-*
- config_name: Japanese-Eroge-Voice
data_files:
- split: train path: Japanese-Eroge-Voice/train-*
- config_name: Jevanhielle_Zyhamont_outChecked
data_files:
- split: train path: Jevanhielle_Zyhamont_outChecked/train-*
- config_name: KOpenAudioBench
data_files:
- split: train path: KOpenAudioBench/train-*
- config_name: KOpenAudioBench__anonyemnlpauthor18
data_files:
- split: train path: KOpenAudioBench__anonyemnlpauthor18/train-*
- config_name: KSS
data_files:
- split: train path: KSS/train-*
- config_name: KSS_Dataset
data_files:
- split: train path: KSS_Dataset/train-*
- config_name: KVoiceBench
data_files:
- split: train path: KVoiceBench/train-*
- config_name: KVoiceBench__anonyemnlpauthor18
data_files:
- split: train path: KVoiceBench__anonyemnlpauthor18/train-*
- config_name: Kabyle_ASR-En_Translation
data_files:
- split: train path: Kabyle_ASR-En_Translation/train-*
- config_name: Kabyle_ASR-Fr_Translation
data_files:
- split: train path: Kabyle_ASR-Fr_Translation/train-*
- config_name: KeSpeech
data_files:
- split: train path: KeSpeech/train-*
- config_name: KinyaWhisperDataset
data_files:
- split: train path: KinyaWhisperDataset/train-*
- config_name: Korean-Japanese-Code-Switching-Speech
data_files:
- split: train path: Korean-Japanese-Code-Switching-Speech/train-*
- config_name: LATAM-High-Fidelity-ASR
data_files:
- split: train path: LATAM-High-Fidelity-ASR/train-*
- config_name: LHCP-ASR
data_files:
- split: train path: LHCP-ASR/train-*
- config_name: LOD_Claude
data_files:
- split: train path: LOD_Claude/train-*
- config_name: LOD_Maxine
data_files:
- split: train path: LOD_Maxine/train-*
- config_name: LRSC
data_files:
- split: train path: LRSC/train-*
- config_name: LSVSC
data_files:
- split: train path: LSVSC/train-*
- config_name: LT_Medical_S_corpus
data_files:
- split: train path: LT_Medical_S_corpus/train-*
- config_name: LaFrescat
data_files:
- split: train path: LaFrescat/train-*
- config_name: Lahaja
data_files:
- split: train path: Lahaja/train-*
- config_name: Latin-Audio
data_files:
- split: train path: Latin-Audio/train-*
- config_name: Laurie-Ann-Walden
data_files:
- split: train path: Laurie-Ann-Walden/train-*
- config_name: LibriS2S
data_files:
- split: train path: LibriS2S/train-*
- config_name: Lingua_Libre_br
data_files:
- split: train path: Lingua_Libre_br/train-*
- config_name: Living-Audio-Irish
data_files:
- split: train path: Living-Audio-Irish/train-*
- config_name: MASC-Arabic
data_files:
- split: train path: MASC-Arabic/train-*
- config_name: MGB-3-Arabic
data_files:
- split: train path: MGB-3-Arabic/train-*
- config_name: MMedFD
data_files:
- split: train path: MMedFD/train-*
- config_name: MMedFD__1989wuk
data_files:
- split: train path: MMedFD__1989wuk/train-*
- config_name: MSC
data_files:
- split: train path: MSC/train-*
- config_name: MUCS-Hinglish
data_files:
- split: train path: MUCS-Hinglish/train-*
- config_name: Magpie-Speech-Orpheus-125k
data_files:
- split: train path: Magpie-Speech-Orpheus-125k/train-*
- config_name: Malaysian-TTS-v2
data_files:
- split: train path: Malaysian-TTS-v2/train-*
- config_name: Marathi_voices
data_files:
- split: train path: Marathi_voices/train-*
- config_name: MasriSpeech-Full
data_files:
- split: train path: MasriSpeech-Full/train-*
- config_name: MediBeng
data_files:
- split: train path: MediBeng/train-*
- config_name: MediaSpeech
data_files:
- split: train path: MediaSpeech/train-*
- config_name: Meta_STT_EN_Set2
data_files:
- split: train path: Meta_STT_EN_Set2/train-*
- config_name: Meta_STT_ZH_AIShell3
data_files:
- split: train path: Meta_STT_ZH_AIShell3/train-*
- config_name: MiscSpeech-ja
data_files:
- split: train path: MiscSpeech-ja/train-*
- config_name: MsceneSpeech
data_files:
- split: train path: MsceneSpeech/train-*
- config_name: MultiMed
data_files:
- split: train path: MultiMed/train-*
- config_name: MultiMed-ST
data_files:
- split: train path: MultiMed-ST/train-*
- config_name: MultiMed__ttthe
data_files:
- split: train path: MultiMed__ttthe/train-*
- config_name: NH_voice
data_files:
- split: train path: NH_voice/train-*
- config_name: NURC-SP_ENTOA_TTS
data_files:
- split: train path: NURC-SP_ENTOA_TTS/train-*
- config_name: Nanchang_Dialect_Conversational_Speech_Corpus
data_files:
- split: train path: Nanchang_Dialect_Conversational_Speech_Corpus/train-*
- config_name: Nav-train-gnjr-s-t-t
data_files:
- split: train path: Nav-train-gnjr-s-t-t/train-*
- config_name: NepaliONE-tts
data_files:
- split: train path: NepaliONE-tts/train-*
- config_name: New-Lisan-Sudanese-TTS-Dataset
data_files:
- split: train path: New-Lisan-Sudanese-TTS-Dataset/train-*
- config_name: NgocHuyenViVoice
data_files:
- split: train path: NgocHuyenViVoice/train-*
- config_name: NonverbalTTS
data_files:
- split: train path: NonverbalTTS/train-*
- config_name: NorthTTS_audio
data_files:
- split: train path: NorthTTS_audio/train-*
- config_name: NovaLingua-code-switch-en-zh
data_files:
- split: train path: NovaLingua-code-switch-en-zh/train-*
- config_name: ORAA-MUPE-ASR
data_files:
- split: train path: ORAA-MUPE-ASR/train-*
- config_name: OpenHQ-SpeechT-GL-EN
data_files:
- split: train path: OpenHQ-SpeechT-GL-EN/train-*
- config_name: OpenSLR54-Nepali-ASR
data_files:
- split: train path: OpenSLR54-Nepali-ASR/train-*
- config_name: OutteTTS-urdu-dataset
data_files:
- split: train path: OutteTTS-urdu-dataset/train-*
- config_name: ParlaSpeech-CZ
data_files:
- split: train path: ParlaSpeech-CZ/train-*
- config_name: ParlaSpeech-HR
data_files:
- split: train path: ParlaSpeech-HR/train-*
- config_name: ParlaSpeech-PL
data_files:
- split: train path: ParlaSpeech-PL/train-*
- config_name: ParlaSpeech-RS
data_files:
- split: train path: ParlaSpeech-RS/train-*
- config_name: ParsiGoo
data_files:
- split: train path: ParsiGoo/train-*
- config_name: Persian-ASR-Benchmark
data_files:
- split: train path: Persian-ASR-Benchmark/train-*
- config_name: Persian-Farsi-Speech
data_files:
- split: train path: Persian-Farsi-Speech/train-*
- config_name: Persian-Speech-Dataset
data_files:
- split: train path: Persian-Speech-Dataset/train-*
- config_name: PersianVox_NM
data_files:
- split: train path: PersianVox_NM/train-*
- config_name: Persian_Course_TTS
data_files:
- split: train path: Persian_Course_TTS/train-*
- config_name: Pidgin_ASR_Dataset_Combined
data_files:
- split: train path: Pidgin_ASR_Dataset_Combined/train-*
- config_name: Pidgin_ASR_Dataset_Combined__timniel
data_files:
- split: train path: Pidgin_ASR_Dataset_Combined__timniel/train-*
- config_name: Porjai-Thai-voice-dataset-central
data_files:
- split: train path: Porjai-Thai-voice-dataset-central/train-*
- config_name: Porjai-Thai-voice-dataset-khummuang
data_files:
- split: train path: Porjai-Thai-voice-dataset-khummuang/train-*
- config_name: Porjai-Thai-voice-dataset-korat
data_files:
- split: train path: Porjai-Thai-voice-dataset-korat/train-*
- config_name: Porjai-Thai-voice-dataset-pattani
data_files:
- split: train path: Porjai-Thai-voice-dataset-pattani/train-*
- config_name: Pulaar
data_files:
- split: train path: Pulaar/train-*
- config_name: Punjabi_ASR_datasets
data_files:
- split: train path: Punjabi_ASR_datasets/train-*
- config_name: Quran-Ayah-Corpus
data_files:
- split: train path: Quran-Ayah-Corpus/train-*
- config_name: Quran-Recitations
data_files:
- split: train path: Quran-Recitations/train-*
- config_name: Quran_Speech_Dataset
data_files:
- split: train path: Quran_Speech_Dataset/train-*
- config_name: Rasa
data_files:
- split: train path: Rasa/train-*
- config_name: Rural_Women_Bhojpuri
data_files:
- split: train path: Rural_Women_Bhojpuri/train-*
- config_name: Rural_Women_Bhojpuri__ai4bharat
data_files:
- split: train path: Rural_Women_Bhojpuri__ai4bharat/train-*
- config_name: SADA-Najdi-from-kaggle
data_files:
- split: train path: SADA-Najdi-from-kaggle/train-*
- config_name: SADA22
data_files:
- split: train path: SADA22/train-*
- config_name: SASRBench-v1
data_files:
- split: train path: SASRBench-v1/train-*
- config_name: SBCSAE
data_files:
- split: train path: SBCSAE/train-*
- config_name: SCC22
data_files:
- split: train path: SCC22/train-*
- config_name: SCC22__ahmed220v
data_files:
- split: train path: SCC22__ahmed220v/train-*
- config_name: SPC
data_files:
- split: train path: SPC/train-*
- config_name: SPRING_INX_Malayalam_R1
data_files:
- split: train path: SPRING_INX_Malayalam_R1/train-*
- config_name: SPRING_INX_Malayalam_R2
data_files:
- split: train path: SPRING_INX_Malayalam_R2/train-*
- config_name: SP_HW5
data_files:
- split: train path: SP_HW5/train-*
- config_name: STOMA
data_files:
- split: train path: STOMA/train-*
- config_name: STT-algerian-dialect
data_files:
- split: train path: STT-algerian-dialect/train-*
- config_name: STT-v1
data_files:
- split: train path: STT-v1/train-*
- config_name: SUBAK.KO
data_files:
- split: train path: SUBAK.KO/train-*
- config_name: SUMM-RE
data_files:
- split: train path: SUMM-RE/train-*
- config_name: Sagalee
data_files:
- split: train path: Sagalee/train-*
- config_name: Sagalee__turiabu
data_files:
- split: train path: Sagalee__turiabu/train-*
- config_name: ScreenTalk-XS
data_files:
- split: train path: ScreenTalk-XS/train-*
- config_name: Segmented-Moroccan-Darija-Wiki-Audio-Dataset
data_files:
- split: train path: Segmented-Moroccan-Darija-Wiki-Audio-Dataset/train-*
- config_name: Sentiment-Reasoning
data_files:
- split: train path: Sentiment-Reasoning/train-*
- config_name: Shanghai_Dialect_Conversational_Speech_Corpus
data_files:
- split: train path: Shanghai_Dialect_Conversational_Speech_Corpus/train-*
- config_name: Shrutilipi-ML
data_files:
- split: train path: Shrutilipi-ML/train-*
- config_name: Shubham_sarvam_tts_assignment
data_files:
- split: train path: Shubham_sarvam_tts_assignment/train-*
- config_name: SimbaBench_dataset
data_files:
- split: train path: SimbaBench_dataset/train-*
- config_name: SloPalSpeech
data_files:
- split: train path: SloPalSpeech/train-*
- config_name: Speech-MASSIVE
data_files:
- split: train path: Speech-MASSIVE/train-*
- config_name: Speech-MASSIVE_vie
data_files:
- split: train path: Speech-MASSIVE_vie/train-*
- config_name: Speech2Latex
data_files:
- split: train path: Speech2Latex/train-*
- config_name: Speech_to_fine_tuning
data_files:
- split: train path: Speech_to_fine_tuning/train-*
- config_name: StoryTTS
data_files:
- split: train path: StoryTTS/train-*
- config_name: StressTest
data_files:
- split: train path: StressTest/train-*
- config_name: Sukuma-Voices
data_files:
- split: train path: Sukuma-Voices/train-*
- config_name: Sukuma-Voices-ACL
data_files:
- split: train path: Sukuma-Voices-ACL/train-*
- config_name: Synth-Manglish
data_files:
- split: train path: Synth-Manglish/train-*
- config_name: SynthaticPipelines
data_files:
- split: train path: SynthaticPipelines/train-*
- config_name: Synthetic-Medical-Speech-Dataset
data_files:
- split: train path: Synthetic-Medical-Speech-Dataset/train-*
- config_name: Synthetic-Medical-Speech-Dataset__niamhtracey1
data_files:
- split: train path: Synthetic-Medical-Speech-Dataset__niamhtracey1/train-*
- config_name: Synthetic_Turkish_TTS_Data
data_files:
- split: train path: Synthetic_Turkish_TTS_Data/train-*
- config_name: Synthetic_Turkish_TTS_Data__Taklaxbr
data_files:
- split: train path: Synthetic_Turkish_TTS_Data__Taklaxbr/train-*
- config_name: TORGO-database
data_files:
- split: train path: TORGO-database/train-*
- config_name: TORGO-database__kingp12
data_files:
- split: train path: TORGO-database__kingp12/train-*
- config_name: TOSD
data_files:
- split: train path: TOSD/train-*
- config_name: TTS-CCabNavMSC
data_files:
- split: train path: TTS-CCabNavMSC/train-*
- config_name: TTS-CFCabNavSC
data_files:
- split: train path: TTS-CFCabNavSC/train-*
- config_name: TTS-Danish
data_files:
- split: train path: TTS-Danish/train-*
- config_name: TTS-Finnish
data_files:
- split: train path: TTS-Finnish/train-*
- config_name: TTS-Greek
data_files:
- split: train path: TTS-Greek/train-*
- config_name: TTS-Hungarian
data_files:
- split: train path: TTS-Hungarian/train-*
- config_name: TTS-Italian
data_files:
- split: train path: TTS-Italian/train-*
- config_name: TTS-Romanian
data_files:
- split: train path: TTS-Romanian/train-*
- config_name: TTS-SCCusSerFSC
data_files:
- split: train path: TTS-SCCusSerFSC/train-*
- config_name: TTS-SCDuFSC
data_files:
- split: train path: TTS-SCDuFSC/train-*
- config_name: TTS-SCFChilSC
data_files:
- split: train path: TTS-SCFChilSC/train-*
- config_name: TTS-Swedish
data_files:
- split: train path: TTS-Swedish/train-*
- config_name: TTS_Telugu
data_files:
- split: train path: TTS_Telugu/train-*
- config_name: TV-44kHz-Full
data_files:
- split: train path: TV-44kHz-Full/train-*
- config_name: Tabaghe16_dataset_persian
data_files:
- split: train path: Tabaghe16_dataset_persian/train-*
- config_name: Taiwanese-Minnan-Sutiau
data_files:
- split: train path: Taiwanese-Minnan-Sutiau/train-*
- config_name: Tamazight-ASR-Dataset-v2
data_files:
- split: train path: Tamazight-ASR-Dataset-v2/train-*
- config_name: Tamazight-Speech-to-Arabic-Text
data_files:
- split: train path: Tamazight-Speech-to-Arabic-Text/train-*
- config_name: Tamil_dataset_new
data_files:
- split: train path: Tamil_dataset_new/train-*
- config_name: TatSC_ASR
data_files:
- split: train path: TatSC_ASR/train-*
- config_name: Tatoeba-Speech-Irish
data_files:
- split: train path: Tatoeba-Speech-Irish/train-*
- config_name: Telugu_ASR_corpus
data_files:
- split: train path: Telugu_ASR_corpus/train-*
- config_name: Thai-Voice-Test-10000
data_files:
- split: train path: Thai-Voice-Test-10000/train-*
- config_name: Thai-dialect-corpus
data_files:
- split: train path: Thai-dialect-corpus/train-*
- config_name: ThanhPahm-TTS
data_files:
- split: train path: ThanhPahm-TTS/train-*
- config_name: The_Spoken_Wikipedia_Corpora_Dutch_ASR_Hiidden
data_files:
- split: train path: The_Spoken_Wikipedia_Corpora_Dutch_ASR_Hiidden/train-*
- config_name: TiCo-Bench
data_files:
- split: train path: TiCo-Bench/train-*
- config_name: Tianjin_Dialect_Conversational_Speech_Corpus
data_files:
- split: train path: Tianjin_Dialect_Conversational_Speech_Corpus/train-*
- config_name: Tibetan-0310
data_files:
- split: train path: Tibetan-0310/train-*
- config_name: ToneBooks
data_files:
- split: train path: ToneBooks/train-*
- config_name: ToneBooksPlus
data_files:
- split: train path: ToneBooksPlus/train-*
- config_name: ToneBooksPlus-Grigorii
data_files:
- split: train path: ToneBooksPlus-Grigorii/train-*
- config_name: ToneBooks__ICML-2026
data_files:
- split: train path: ToneBooks__ICML-2026/train-*
- config_name: ToneRuLS
data_files:
- split: train path: ToneRuLS/train-*
- config_name: ToneSlavic
data_files:
- split: train path: ToneSlavic/train-*
- config_name: ToneSlavic__ICML-2026
data_files:
- split: train path: ToneSlavic__ICML-2026/train-*
- config_name: ToneSpeak
data_files:
- split: train path: ToneSpeak/train-*
- config_name: ToneSpeak__ICML-2026
data_files:
- split: train path: ToneSpeak__ICML-2026/train-*
- config_name: ToneWebinars
data_files:
- split: train path: ToneWebinars/train-*
- config_name: Trys2
data_files:
- split: train path: Trys2/train-*
- config_name: TunSwitch
data_files:
- split: train path: TunSwitch/train-*
- config_name: Tunisian_MSA
data_files:
- split: train path: Tunisian_MSA/train-*
- config_name: Turkish-Podcast-2
data_files:
- split: train path: Turkish-Podcast-2/train-*
- config_name: Turkish_TTS_Data
data_files:
- split: train path: Turkish_TTS_Data/train-*
- config_name: TuyenVanHoa2
data_files:
- split: train path: TuyenVanHoa2/train-*
- config_name: TuyenVanHoa4
data_files:
- split: train path: TuyenVanHoa4/train-*
- config_name: UAT
data_files:
- split: train path: UAT/train-*
- config_name: Urdu-Poetry-TTS-Dataset
data_files:
- split: train path: Urdu-Poetry-TTS-Dataset/train-*
- config_name: UrduSpeech
data_files:
- split: train path: UrduSpeech/train-*
- config_name: UrduTTSDataset
data_files:
- split: train path: UrduTTSDataset/train-*
- config_name: UrduTTSDataset-22khz
data_files:
- split: train path: UrduTTSDataset-22khz/train-*
- config_name: Utterly
data_files:
- split: train path: Utterly/train-*
- config_name: VLSP2020
data_files:
- split: train path: VLSP2020/train-*
- config_name: VNAVC
data_files:
- split: train path: VNAVC/train-*
- config_name: Vaani
data_files:
- split: train path: Vaani/train-*
- config_name: ViMedCSS
data_files:
- split: train path: ViMedCSS/train-*
- config_name: ViMedCSS-Cop
data_files:
- split: train path: ViMedCSS-Cop/train-*
- config_name: ViVoice34
data_files:
- split: train path: ViVoice34/train-*
- config_name: Vibravox_dummy
data_files:
- split: train path: Vibravox_dummy/train-*
- config_name: VieNeu-TTS-140h
data_files:
- split: train path: VieNeu-TTS-140h/train-*
- config_name: VietBibleVox-aligned
data_files:
- split: train path: VietBibleVox-aligned/train-*
- config_name: VietMDD
data_files:
- split: train path: VietMDD/train-*
- config_name: VietMed
data_files:
- split: train path: VietMed/train-*
- config_name: VietMed-NER
data_files:
- split: train path: VietMed-NER/train-*
- config_name: VietMed_labeled
data_files:
- split: train path: VietMed_labeled/train-*
- config_name: VietSpeech
data_files:
- split: train path: VietSpeech/train-*
- config_name: Vietnamese_ASR_TestingData_Old
data_files:
- split: train path: Vietnamese_ASR_TestingData_Old/train-*
- config_name: Vietnamese_Medical_Consultation
data_files:
- split: train path: Vietnamese_Medical_Consultation/train-*
- config_name: Voices-in-the-Wild-Bench
data_files:
- split: train path: Voices-in-the-Wild-Bench/train-*
- config_name: VoxPopuli-Platinum-en
data_files:
- split: train path: VoxPopuli-Platinum-en/train-*
- config_name: WESR-Bench
data_files:
- split: train path: WESR-Bench/train-*
- config_name: WaxalNLP
data_files:
- split: train path: WaxalNLP/train-*
- config_name: WenetSpeech4TTS_Premium
data_files:
- split: train path: WenetSpeech4TTS_Premium/train-*
- config_name: Wikimedia-Speech-Irish
data_files:
- split: train path: Wikimedia-Speech-Irish/train-*
- config_name: WildASR
data_files:
- split: train path: WildASR/train-*
- config_name: WolneLektury-TTS-Polish
data_files:
- split: train path: WolneLektury-TTS-Polish/train-*
- config_name: YodaLingua-Farsi
data_files:
- split: train path: YodaLingua-Farsi/train-*
- config_name: YodaLingua-preview
data_files:
- split: train path: YodaLingua-preview/train-*
- config_name: YouTube_Video_Transkriptleri_TR
data_files:
- split: train path: YouTube_Video_Transkriptleri_TR/train-*
- config_name: Zeroth-STT-Korean
data_files:
- split: train path: Zeroth-STT-Korean/train-*
- config_name: Zhengzhou_Dialect_Conversational_Speech_Corpus
data_files:
- split: train path: Zhengzhou_Dialect_Conversational_Speech_Corpus/train-*
- config_name: accenti_italiani
data_files:
- split: train path: accenti_italiani/train-*
- config_name: ace-kising-segments
data_files:
- split: train path: ace-kising-segments/train-*
- config_name: ace-opencpop-segments
data_files:
- split: train path: ace-opencpop-segments/train-*
- config_name: acl-6060
data_files:
- split: train path: acl-6060/train-*
- config_name: adlam_fulfulde
data_files:
- split: train path: adlam_fulfulde/train-*
- config_name: adlib-devterm
data_files:
- split: train path: adlib-devterm/train-*
- config_name: africanvoices_hau
data_files:
- split: train path: africanvoices_hau/train-*
- config_name: afrikaans-30s
data_files:
- split: train path: afrikaans-30s/train-*
- config_name: afrikaans-speech-dataset
data_files:
- split: train path: afrikaans-speech-dataset/train-*
- config_name: afrispeech_afrikaans
data_files:
- split: train path: afrispeech_afrikaans/train-*
- config_name: afvoices
data_files:
- split: train path: afvoices/train-*
- config_name: ai-terms-public
data_files:
- split: train path: ai-terms-public/train-*
- config_name: akuapem_multispeaker_audio_transcribed
data_files:
- split: train path: akuapem_multispeaker_audio_transcribed/train-*
- config_name: ales-krautsevich-karotkaia-gistoryia-belarusi-uladzimir-lisouski-output
data_files:
- split: train path: ales-krautsevich-karotkaia-gistoryia-belarusi-uladzimir-lisouski-output/train-*
- config_name: ales-krautsevich-karotkaia-gistoryia-belarusi-uladzimir-lisouski-output_original
data_files:
- split: train path: ales-krautsevich-karotkaia-gistoryia-belarusi-uladzimir-lisouski-output_original/train-*
- config_name: ales-krautsevich-karotkaia-gistoryia-belarusi-uladzimir-lisouski_all
data_files:
- split: train path: ales-krautsevich-karotkaia-gistoryia-belarusi-uladzimir-lisouski_all/train-*
- config_name: ales_razanau_all
data_files:
- split: train path: ales_razanau_all/train-*
- config_name: ales_razanau_output_original
data_files:
- split: train path: ales_razanau_output_original/train-*
- config_name: ales_zhuk_praklytaya_lyubow_all
data_files:
- split: train path: ales_zhuk_praklytaya_lyubow_all/train-*
- config_name: ales_zhuk_praklytaya_lyubow_output_original
data_files:
- split: train path: ales_zhuk_praklytaya_lyubow_output_original/train-*
- config_name: alffa-amharic
data_files:
- split: train path: alffa-amharic/train-*
- config_name: alffa-amharic-v2
data_files:
- split: train path: alffa-amharic-v2/train-*
- config_name: algerian-STT-dialect
data_files:
- split: train path: algerian-STT-dialect/train-*
- config_name: alsanaa-emirati-arabic-asr
data_files:
- split: train path: alsanaa-emirati-arabic-asr/train-*
- config_name: amharic-speech
data_files:
- split: train path: amharic-speech/train-*
- config_name: amharic-speech-dataset
data_files:
- split: train path: amharic-speech-dataset/train-*
- config_name: amharic_cleaned_testset_verified
data_files:
- split: train path: amharic_cleaned_testset_verified/train-*
- config_name: ami
data_files:
- split: train path: ami/train-*
- config_name: ami-2speaker-test
data_files:
- split: train path: ami-2speaker-test/train-*
- config_name: ami-disfluent
data_files:
- split: train path: ami-disfluent/train-*
- config_name: ami__0x3
data_files:
- split: train path: ami__0x3/train-*
- config_name: ami__Patilani
data_files:
- split: train path: ami__Patilani/train-*
- config_name: an-be-kalan-bench
data_files:
- split: train path: an-be-kalan-bench/train-*
- config_name: anatol_vyartsinski_pesnya_pra_hleb_all
data_files:
- split: train path: anatol_vyartsinski_pesnya_pra_hleb_all/train-*
- config_name: anatol_vyartsinski_pesnya_pra_hleb_output_original
data_files:
- split: train path: anatol_vyartsinski_pesnya_pra_hleb_output_original/train-*
- config_name: andre_marua_pakaranne_zolatam_all
data_files:
- split: train path: andre_marua_pakaranne_zolatam_all/train-*
- config_name: andre_marua_pakaranne_zolatam_output_original
data_files:
- split: train path: andre_marua_pakaranne_zolatam_output_original/train-*
- config_name: andrew-v3
data_files:
- split: train path: andrew-v3/train-*
- config_name: annotated_catalan_common_voice_v17_cleaned_enhanced
data_files:
- split: train path: annotated_catalan_common_voice_v17_cleaned_enhanced/train-*
- config_name: anta_women_tts
data_files:
- split: train path: anta_women_tts/train-*
- config_name: anv_data_ke
data_files:
- split: train path: anv_data_ke/train-*
- config_name: ar-eg-dataset
data_files:
- split: train path: ar-eg-dataset/train-*
- config_name: ar-quran-hadith14books-MSA
data_files:
- split: train path: ar-quran-hadith14books-MSA/train-*
- config_name: arabic-audio-collection-algerian-kahwa-postcast
data_files:
- split: train path: arabic-audio-collection-algerian-kahwa-postcast/train-*
- config_name: arabic-audio-collection-algerian-loubna-stories
data_files:
- split: train path: arabic-audio-collection-algerian-loubna-stories/train-*
- config_name: arabic-audio-collection-algerian-rawi
data_files:
- split: train path: arabic-audio-collection-algerian-rawi/train-*
- config_name: arabic-audio-collection-mohamed-khairy
data_files:
- split: train path: arabic-audio-collection-mohamed-khairy/train-*
- config_name: arabic-audio-collection-mostafa-mahmoud
data_files:
- split: train path: arabic-audio-collection-mostafa-mahmoud/train-*
- config_name: arabic-audio-collection-mostafa-mahmoud__EYang27
data_files:
- split: train path: arabic-audio-collection-mostafa-mahmoud__EYang27/train-*
- config_name: arabic-audio-collection-syrian-podcast
data_files:
- split: train path: arabic-audio-collection-syrian-podcast/train-*
- config_name: arabic-egy-cleaned
data_files:
- split: train path: arabic-egy-cleaned/train-*
- config_name: arabic-english-code-switching
data_files:
- split: train path: arabic-english-code-switching/train-*
- config_name: arabic-male-host
data_files:
- split: train path: arabic-male-host/train-*
- config_name: arabic-msa-25k-saudi-male-tashkeel
data_files:
- split: train path: arabic-msa-25k-saudi-male-tashkeel/train-*
- config_name: arabic-multidialect
data_files:
- split: train path: arabic-multidialect/train-*
- config_name: arabic-multidialect-emotional-speech-demo
data_files:
- split: train path: arabic-multidialect-emotional-speech-demo/train-*
- config_name: arabic-speech-SADA22-Khaliji
data_files:
- split: train path: arabic-speech-SADA22-Khaliji/train-*
- config_name: arabic-speech-SADA22-MSA
data_files:
- split: train path: arabic-speech-SADA22-MSA/train-*
- config_name: arabic-tashkeel-speech
data_files:
- split: train path: arabic-tashkeel-speech/train-*
- config_name: arabic-tts-wav-24k
data_files:
- split: train path: arabic-tts-wav-24k/train-*
- config_name: arabic-whisper-multidialect
data_files:
- split: train path: arabic-whisper-multidialect/train-*
- config_name: arabic_quranic_asr
data_files:
- split: train path: arabic_quranic_asr/train-*
- config_name: arabic_quranic_asr__ahmed220v
data_files:
- split: train path: arabic_quranic_asr__ahmed220v/train-*
- config_name: arabic_speech_corpus
data_files:
- split: train path: arabic_speech_corpus/train-*
- config_name: arg-spanish-tts
data_files:
- split: train path: arg-spanish-tts/train-*
- config_name: arknights_voices
data_files:
- split: train path: arknights_voices/train-*
- config_name: arknights_voices_zh-processed
data_files:
- split: train path: arknights_voices_zh-processed/train-*
- config_name: armenian-speech-dataset
data_files:
- split: train path: armenian-speech-dataset/train-*
- config_name: asante-twi-bible
data_files:
- split: train path: asante-twi-bible/train-*
- config_name: asante-twi-bible-speech-phonemes
data_files:
- split: train path: asante-twi-bible-speech-phonemes/train-*
- config_name: asr-context-induced-leakage
data_files:
- split: train path: asr-context-induced-leakage/train-*
- config_name: asr-farsi-youtube-chunked-30-seconds
data_files:
- split: train path: asr-farsi-youtube-chunked-30-seconds/train-*
- config_name: asr-leaderboard-datasets
data_files:
- split: train path: asr-leaderboard-datasets/train-*
- config_name: asr-tts-rioplatense-audiobooks-argentina
data_files:
- split: train path: asr-tts-rioplatense-audiobooks-argentina/train-*
- config_name: asr_codeswitched_dataset
data_files:
- split: train path: asr_codeswitched_dataset/train-*
- config_name: assamese-asr-dataset
data_files:
- split: train path: assamese-asr-dataset/train-*
- config_name: assamese-tts-train
data_files:
- split: train path: assamese-tts-train/train-*
- config_name: assamese_dataset
data_files:
- split: train path: assamese_dataset/train-*
- config_name: assamese_speech_corpus
data_files:
- split: train path: assamese_speech_corpus/train-*
- config_name: assamese_speech_dataset1
data_files:
- split: train path: assamese_speech_dataset1/train-*
- config_name: astryd_lindgren_braty_lvinae_sertsa_all
data_files:
- split: train path: astryd_lindgren_braty_lvinae_sertsa_all/train-*
- config_name: astryd_lindgren_braty_lvinae_sertsa_output_original
data_files:
- split: train path: astryd_lindgren_braty_lvinae_sertsa_output_original/train-*
- config_name: atco2-asr-atcosim
data_files:
- split: train path: atco2-asr-atcosim/train-*
- config_name: atco2_corpus_1h
data_files:
- split: train path: atco2_corpus_1h/train-*
- config_name: atco2_only_augmented
data_files:
- split: train path: atco2_only_augmented/train-*
- config_name: atcosim_corpus
data_files:
- split: train path: atcosim_corpus/train-*
- config_name: atcs
data_files:
- split: train path: atcs/train-*
- config_name: audio-dataset
data_files:
- split: train path: audio-dataset/train-*
- config_name: audio-dataset-300
data_files:
- split: train path: audio-dataset-300/train-*
- config_name: audio-dataset-shuffled-300
data_files:
- split: train path: audio-dataset-shuffled-300/train-*
- config_name: audio-dataset__AJosh
data_files:
- split: train path: audio-dataset__AJosh/train-*
- config_name: audio_data_russian
data_files:
- split: train path: audio_data_russian/train-*
- config_name: audio_data_russian_annotated
data_files:
- split: train path: audio_data_russian_annotated/train-*
- config_name: audio_data_russian_backup
data_files:
- split: train path: audio_data_russian_backup/train-*
- config_name: audio_set_blr_tryvoznae_szczasce
data_files:
- split: train path: audio_set_blr_tryvoznae_szczasce/train-*
- config_name: audiobooks
data_files:
- split: train path: audiobooks/train-*
- config_name: audiobooks__yasalma
data_files:
- split: train path: audiobooks__yasalma/train-*
- config_name: azerbaijani-audiobooks
data_files:
- split: train path: azerbaijani-audiobooks/train-*
- config_name: azerbaijani-speech-dataset
data_files:
- split: train path: azerbaijani-speech-dataset/train-*
- config_name: azerbaijani-tts-achernar
data_files:
- split: train path: azerbaijani-tts-achernar/train-*
- config_name: azerbaijani-tts-dataset
data_files:
- split: train path: azerbaijani-tts-dataset/train-*
- config_name: azerbaijani-tts-dataset-audio
data_files:
- split: train path: azerbaijani-tts-dataset-audio/train-*
- config_name: azerbaijani_asr
data_files:
- split: train path: azerbaijani_asr/train-*
- config_name: baltivoice-asr
data_files:
- split: train path: baltivoice-asr/train-*
- config_name: bam-asr-benchmark
data_files:
- split: train path: bam-asr-benchmark/train-*
- config_name: banspeech
data_files:
- split: train path: banspeech/train-*
- config_name: baoule-common-voice
data_files:
- split: train path: baoule-common-voice/train-*
- config_name: bashkort_tts_dataset
data_files:
- split: train path: bashkort_tts_dataset/train-*
- config_name: bashkort_voice
data_files:
- split: train path: bashkort_voice/train-*
- config_name: basque_speech_dataset
data_files:
- split: train path: basque_speech_dataset/train-*
- config_name: belarusian-speech-dataset
data_files:
- split: train path: belarusian-speech-dataset/train-*
- config_name: bely_klyck_all
data_files:
- split: train path: bely_klyck_all/train-*
- config_name: bely_klyck_output
data_files:
- split: train path: bely_klyck_output/train-*
- config_name: betrac-2026-with-meta
data_files:
- split: train path: betrac-2026-with-meta/train-*
- config_name: bg-audiobooks-tts
data_files:
- split: train path: bg-audiobooks-tts/train-*
- config_name: bigc-bem-eng
data_files:
- split: train path: bigc-bem-eng/train-*
- config_name: biggest-ru-book
data_files:
- split: train path: biggest-ru-book/train-*
- config_name: bobiwine
data_files:
- split: train path: bobiwine/train-*
- config_name: bplus_podcast_persian
data_files:
- split: train path: bplus_podcast_persian/train-*
- config_name: broadcast
data_files:
- split: train path: broadcast/train-*
- config_name: broadcast-speech-uk
data_files:
- split: train path: broadcast-speech-uk/train-*
- config_name: buckeye
data_files:
- split: train path: buckeye/train-*
- config_name: bulgarian-audiobooks-tts-400h
data_files:
- split: train path: bulgarian-audiobooks-tts-400h/train-*
- config_name: bulgarian_tts
data_files:
- split: train path: bulgarian_tts/train-*
- config_name: bundestag-asr
data_files:
- split: train path: bundestag-asr/train-*
- config_name: burmese-synthetic-speech-corpus
data_files:
- split: train path: burmese-synthetic-speech-corpus/train-*
- config_name: camoes_SI
data_files:
- split: train path: camoes_SI/train-*
- config_name: cantonese_daily
data_files:
- split: train path: cantonese_daily/train-*
- config_name: catalan-dataset
data_files:
- split: train path: catalan-dataset/train-*
- config_name: catalan-speech-dataset
data_files:
- split: train path: catalan-speech-dataset/train-*
- config_name: chichewa-trigrams-speech-text-parallel
data_files:
- split: train path: chichewa-trigrams-speech-text-parallel/train-*
- config_name: chuvash_voice
data_files:
- split: train path: chuvash_voice/train-*
- config_name: ciempiess_balance
data_files:
- split: train path: ciempiess_balance/train-*
- config_name: ciempiess_complementary
data_files:
- split: train path: ciempiess_complementary/train-*
- config_name: ciempiess_fem
data_files:
- split: train path: ciempiess_fem/train-*
- config_name: ciempiess_light
data_files:
- split: train path: ciempiess_light/train-*
- config_name: ciempiess_light__ciempiess
data_files:
- split: train path: ciempiess_light__ciempiess/train-*
- config_name: cld-enzh-dataset
data_files:
- split: train path: cld-enzh-dataset/train-*
- config_name: cld-multi-dataset
data_files:
- split: train path: cld-multi-dataset/train-*
- config_name: clean_hausa_dataset
data_files:
- split: train path: clean_hausa_dataset/train-*
- config_name: clean_yoruba_dataset
data_files:
- split: train path: clean_yoruba_dataset/train-*
- config_name: clotho-dev-sample
data_files:
- split: train path: clotho-dev-sample/train-*
- config_name: cml-tts
data_files:
- split: train path: cml-tts/train-*
- config_name: cml_tts_dataset_polish
data_files:
- split: train path: cml_tts_dataset_polish/train-*
- config_name: cmu_haitian
data_files:
- split: train path: cmu_haitian/train-*
- config_name: cmu_haitian_creole_speech
data_files:
- split: train path: cmu_haitian_creole_speech/train-*
- config_name: codeswitch-fr-en-kyutai-stt
data_files:
- split: train path: codeswitch-fr-en-kyutai-stt/train-*
- config_name: combined_amharic_speech_dataset
data_files:
- split: train path: combined_amharic_speech_dataset/train-*
- config_name: combined_malayalam
data_files:
- split: train path: combined_malayalam/train-*
- config_name: common-voice-13-fa
data_files:
- split: train path: common-voice-13-fa/train-*
- config_name: common-voice-18-arabic
data_files:
- split: train path: common-voice-18-arabic/train-*
- config_name: common-voice-18-arabic__ahmadafaneh
data_files:
- split: train path: common-voice-18-arabic__ahmadafaneh/train-*
- config_name: common-voice-20-mn-normalized
data_files:
- split: train path: common-voice-20-mn-normalized/train-*
- config_name: common-voice-22
data_files:
- split: train path: common-voice-22/train-*
- config_name: common-voice-22-en-teens
data_files:
- split: train path: common-voice-22-en-teens/train-*
- config_name: common-voice-24-ethiopian
data_files:
- split: train path: common-voice-24-ethiopian/train-*
- config_name: common-voice-24-ethiopian-v2
data_files:
- split: train path: common-voice-24-ethiopian-v2/train-*
- config_name: common-voice-corpus-20
data_files:
- split: train path: common-voice-corpus-20/train-*
- config_name: common-voices-24-mn
data_files:
- split: train path: common-voices-24-mn/train-*
- config_name: common_voice_13_french_phoneme
data_files:
- split: train path: common_voice_13_french_phoneme/train-*
- config_name: common_voice_16-zh-CN
data_files:
- split: train path: common_voice_16-zh-CN/train-*
- config_name: common_voice_17_indic_te
data_files:
- split: train path: common_voice_17_indic_te/train-*
- config_name: common_voice_19_0_zh-TW
data_files:
- split: train path: common_voice_19_0_zh-TW/train-*
- config_name: common_voice_20_armenian
data_files:
- split: train path: common_voice_20_armenian/train-*
- config_name: common_voice_21_0_fa
data_files:
- split: train path: common_voice_21_0_fa/train-*
- config_name: common_voice_22_0
data_files:
- split: train path: common_voice_22_0/train-*
- config_name: common_voice_22_0_fa
data_files:
- split: train path: common_voice_22_0_fa/train-*
- config_name: common_voice_23_0_es
data_files:
- split: train path: common_voice_23_0_es/train-*
- config_name: common_voice_25_zh-TW
data_files:
- split: train path: common_voice_25_zh-TW/train-*
- config_name: commonvoice-12.0-arabic-voice-converted
data_files:
- split: train path: commonvoice-12.0-arabic-voice-converted/train-*
- config_name: commonvoice_17_tr_fixed
data_files:
- split: train path: commonvoice_17_tr_fixed/train-*
- config_name: composite_corpus_eseu_v1.0
data_files:
- split: train path: composite_corpus_eseu_v1.0/train-*
- config_name: composite_corpus_eu_v2.1
data_files:
- split: train path: composite_corpus_eu_v2.1/train-*
- config_name: conversations
data_files:
- split: train path: conversations/train-*
- config_name: coraal
data_files:
- split: train path: coraal/train-*
- config_name: coraal_chunked
data_files:
- split: train path: coraal_chunked/train-*
- config_name: coral-tts
data_files:
- split: train path: coral-tts/train-*
- config_name: coral-v2
data_files:
- split: train path: coral-v2/train-*
- config_name: coral-v3
data_files:
- split: train path: coral-v3/train-*
- config_name: coser
data_files:
- split: train path: coser/train-*
- config_name: costumer-service-persian-1
data_files:
- split: train path: costumer-service-persian-1/train-*
- config_name: cretan-speech-corpus
data_files:
- split: train path: cretan-speech-corpus/train-*
- config_name: cv-corpus-1.0-en-client_id-grouped
data_files:
- split: train path: cv-corpus-1.0-en-client_id-grouped/train-*
- config_name: cv-corpus-17.0-ja-client_id-grouped
data_files:
- split: train path: cv-corpus-17.0-ja-client_id-grouped/train-*
- config_name: cv-corpus-17.0-zh-CN-client_id-grouped
data_files:
- split: train path: cv-corpus-17.0-zh-CN-client_id-grouped/train-*
- config_name: cv-corpus-17.0-zh-TW-client_id-grouped
data_files:
- split: train path: cv-corpus-17.0-zh-TW-client_id-grouped/train-*
- config_name: cv-mn-24.0
data_files:
- split: train path: cv-mn-24.0/train-*
- config_name: cv10-uk-testset-clean
data_files:
- split: train path: cv10-uk-testset-clean/train-*
- config_name: cv17_sw_kenyan_sample
data_files:
- split: train path: cv17_sw_kenyan_sample/train-*
- config_name: cv_corpus_v22
data_files:
- split: train path: cv_corpus_v22/train-*
- config_name: cy-asr-cv
data_files:
- split: train path: cy-asr-cv/train-*
- config_name: czech_train_data
data_files:
- split: train path: czech_train_data/train-*
- config_name: da-asr-cv
data_files:
- split: train path: da-asr-cv/train-*
- config_name: dagbani-bible-audio-text-tts
data_files:
- split: train path: dagbani-bible-audio-text-tts/train-*
- config_name: dagbani-bible-audio-text-tts__fiifinketia
data_files:
- split: train path: dagbani-bible-audio-text-tts__fiifinketia/train-*
- config_name: dailytalk-female
data_files:
- split: train path: dailytalk-female/train-*
- config_name: dailytalk-male
data_files:
- split: train path: dailytalk-male/train-*
- config_name: danish-speech-dataset
data_files:
- split: train path: danish-speech-dataset/train-*
- config_name: darija-speech-to-text
data_files:
- split: train path: darija-speech-to-text/train-*
- config_name: darija-stt-mix
data_files:
- split: train path: darija-stt-mix/train-*
- config_name: darija_speech_to_text
data_files:
- split: train path: darija_speech_to_text/train-*
- config_name: data-khmer
data_files:
- split: train path: data-khmer/train-*
- config_name: dataset-vietvoice_v2
data_files:
- split: train path: dataset-vietvoice_v2/train-*
- config_name: datatalk
data_files:
- split: train path: datatalk/train-*
- config_name: david-dataset
data_files:
- split: train path: david-dataset/train-*
- config_name: deg-speech-text-parallel
data_files:
- split: train path: deg-speech-text-parallel/train-*
- config_name: dhivehi-audio-casts
data_files:
- split: train path: dhivehi-audio-casts/train-*
- config_name: dhivehi-audio-kn
data_files:
- split: train path: dhivehi-audio-kn/train-*
- config_name: dialogs-ru-emotional-conversations
data_files:
- split: train path: dialogs-ru-emotional-conversations/train-*
- config_name: dinner-party-corpus
data_files:
- split: train path: dinner-party-corpus/train-*
- config_name: dowis
data_files:
- split: train path: dowis/train-*
- config_name: dubs
data_files:
- split: train path: dubs/train-*
- config_name: dv_syn_speech_md
data_files:
- split: train path: dv_syn_speech_md/train-*
- config_name: dv_syn_speech_md__mashey
data_files:
- split: train path: dv_syn_speech_md__mashey/train-*
- config_name: dv_syn_speech_sm
data_files:
- split: train path: dv_syn_speech_sm/train-*
- config_name: dv_syn_speech_sm__alakxender
data_files:
- split: train path: dv_syn_speech_sm__alakxender/train-*
- config_name: dzhordzh-oruel-ferma-jaska-haspadar-valer-budzevich_output_original
data_files:
- split: train path: dzhordzh-oruel-ferma-jaska-haspadar-valer-budzevich_output_original/train-*
- config_name: dzhozef_redzyard_kipling_all
data_files:
- split: train path: dzhozef_redzyard_kipling_all/train-*
- config_name: dzhozef_redzyard_kipling_output_original
data_files:
- split: train path: dzhozef_redzyard_kipling_output_original/train-*
- config_name: dzintra_shultse_robertsik_all
data_files:
- split: train path: dzintra_shultse_robertsik_all/train-*
- config_name: e2tts-test-suite
data_files:
- split: train path: e2tts-test-suite/train-*
- config_name: echo
data_files:
- split: train path: echo/train-*
- config_name: echo-ref-speakers-4k-en
data_files:
- split: train path: echo-ref-speakers-4k-en/train-*
- config_name: echo-tts-en-benchmarks-v1
data_files:
- split: train path: echo-tts-en-benchmarks-v1/train-*
- config_name: edited_common_voice
data_files:
- split: train path: edited_common_voice/train-*
- config_name: egyptian-arabic-400k
data_files:
- split: train path: egyptian-arabic-400k/train-*
- config_name: egyption-with-emotion-dataset
data_files:
- split: train path: egyption-with-emotion-dataset/train-*
- config_name: eka-hard
data_files:
- split: train path: eka-hard/train-*
- config_name: elevenlabs_multilingual_v2-technical-speech
data_files:
- split: train path: elevenlabs_multilingual_v2-technical-speech/train-*
- config_name: elevenlabs_ru
data_files:
- split: train path: elevenlabs_ru/train-*
- config_name: emilia_zh
data_files:
- split: train path: emilia_zh/train-*
- config_name: en-everyday-conversation-asr
data_files:
- split: train path: en-everyday-conversation-asr/train-*
- config_name: eng-sports-radio-psst-iu-emotion-splits
data_files:
- split: train path: eng-sports-radio-psst-iu-emotion-splits/train-*
- config_name: english-accent-4h
data_files:
- split: train path: english-accent-4h/train-*
- config_name: english-alloy-intense-anger
data_files:
- split: train path: english-alloy-intense-anger/train-*
- config_name: english-en-x-code-switching-main-lang
data_files:
- split: train path: english-en-x-code-switching-main-lang/train-*
- config_name: english-en-x-code-switching-main-lang-samples
data_files:
- split: train path: english-en-x-code-switching-main-lang-samples/train-*
- config_name: english-en-x-code-switching-main-lang-samples-merged
data_files:
- split: train path: english-en-x-code-switching-main-lang-samples-merged/train-*
- config_name: english-x-code-switching
data_files:
- split: train path: english-x-code-switching/train-*
- config_name: english-x-code-switching-samples
data_files:
- split: train path: english-x-code-switching-samples/train-*
- config_name: english_dialects
data_files:
- split: train path: english_dialects/train-*
- config_name: enwaucymraeg
data_files:
- split: train path: enwaucymraeg/train-*
- config_name: erasmian_greek_nt
data_files:
- split: train path: erasmian_greek_nt/train-*
- config_name: ernest_heminguei_stary_chalavek_i_mora_all
data_files:
- split: train path: ernest_heminguei_stary_chalavek_i_mora_all/train-*
- config_name: ernest_heminguei_stary_chalavek_i_mora_output_original
data_files:
- split: train path: ernest_heminguei_stary_chalavek_i_mora_output_original/train-*
- config_name: eryh_maryya_remark_all
data_files:
- split: train path: eryh_maryya_remark_all/train-*
- config_name: eryh_maryya_remark_output_original
data_files:
- split: train path: eryh_maryya_remark_output_original/train-*
- config_name: eryh_raspe_prygody_barona_myunhau_zena_all
data_files:
- split: train path: eryh_raspe_prygody_barona_myunhau_zena_all/train-*
- config_name: eryh_raspe_prygody_barona_myunhau_zena_output_original
data_files:
- split: train path: eryh_raspe_prygody_barona_myunhau_zena_output_original/train-*
- config_name: esd
data_files:
- split: train path: esd/train-*
- config_name: estonian-speech-dataset
data_files:
- split: train path: estonian-speech-dataset/train-*
- config_name: ethiopian-speech-flat
data_files:
- split: train path: ethiopian-speech-flat/train-*
- config_name: everyayah
data_files:
- split: train path: everyayah/train-*
- config_name: everyayah-phonemes
data_files:
- split: train path: everyayah-phonemes/train-*
- config_name: ewe-bible-audio-text-tts
data_files:
- split: train path: ewe-bible-audio-text-tts/train-*
- config_name: ewe-bible-audio-text-tts__fiifinketia
data_files:
- split: train path: ewe-bible-audio-text-tts__fiifinketia/train-*
- config_name: ewe_bible_v2_tts
data_files:
- split: train path: ewe_bible_v2_tts/train-*
- config_name: ewe_bible_v2_tts__JeanKouss
data_files:
- split: train path: ewe_bible_v2_tts__JeanKouss/train-*
- config_name: expressive-eng-tts
data_files:
- split: train path: expressive-eng-tts/train-*
- config_name: expresso
data_files:
- split: train path: expresso/train-*
- config_name: f1-team-radio
data_files:
- split: train path: f1-team-radio/train-*
- config_name: f1-team-radio__fluffypotatoes
data_files:
- split: train path: f1-team-radio__fluffypotatoes/train-*
- config_name: f1-team-radio__scriptaudio
data_files:
- split: train path: f1-team-radio__scriptaudio/train-*
- config_name: fairytales
data_files:
- split: train path: fairytales/train-*
- config_name: fake-emergencies-br
data_files:
- split: train path: fake-emergencies-br/train-*
- config_name: fante-multispeaker_speech-text-20k
data_files:
- split: train path: fante-multispeaker_speech-text-20k/train-*
- config_name: farsi_voice_dataset
data_files:
- split: train path: farsi_voice_dataset/train-*
- config_name: female-LJSpeech-italian
data_files:
- split: train path: female-LJSpeech-italian/train-*
- config_name: festcat_trimmed_denoised
data_files:
- split: train path: festcat_trimmed_denoised/train-*
- config_name: festvox-iiith-ml
data_files:
- split: train path: festvox-iiith-ml/train-*
- config_name: filatov_24000
data_files:
- split: train path: filatov_24000/train-*
- config_name: filimo
data_files:
- split: train path: filimo/train-*
- config_name: filimo-farsi
data_files:
- split: train path: filimo-farsi/train-*
- config_name: filipino-tts-biblical
data_files:
- split: train path: filipino-tts-biblical/train-*
- config_name: filipinospeechcorpus
data_files:
- split: train path: filipinospeechcorpus/train-*
- config_name: filtered_nepali_male_dataset1
data_files:
- split: train path: filtered_nepali_male_dataset1/train-*
- config_name: fleurs
data_files:
- split: train path: fleurs/train-*
- config_name: fleurs-ar-eg
data_files:
- split: train path: fleurs-ar-eg/train-*
- config_name: fleurs-azerbaijani-asr
data_files:
- split: train path: fleurs-azerbaijani-asr/train-*
- config_name: fleurs-cs
data_files:
- split: train path: fleurs-cs/train-*
- config_name: fleurs-en-test
data_files:
- split: train path: fleurs-en-test/train-*
- config_name: fleurs-ethiopian-v2
data_files:
- split: train path: fleurs-ethiopian-v2/train-*
- config_name: fleurs-farsi
data_files:
- split: train path: fleurs-farsi/train-*
- config_name: fleurs-farsi-full
data_files:
- split: train path: fleurs-farsi-full/train-*
- config_name: fleurs-mn
data_files:
- split: train path: fleurs-mn/train-*
- config_name: fleurs-ro
data_files:
- split: train path: fleurs-ro/train-*
- config_name: fleurs-somali
data_files:
- split: train path: fleurs-somali/train-*
- config_name: fleurs_openslr42_mpwt
data_files:
- split: train path: fleurs_openslr42_mpwt/train-*
- config_name: fleurs_test
data_files:
- split: train path: fleurs_test/train-*
- config_name: fluers-mn
data_files:
- split: train path: fluers-mn/train-*
- config_name: fon
data_files:
- split: train path: fon/train-*
- config_name: fongbe-hausa-asr-dataset
data_files:
- split: train path: fongbe-hausa-asr-dataset/train-*
- config_name: fongbe-speech-zenodo
data_files:
- split: train path: fongbe-speech-zenodo/train-*
- config_name: formosan_asr_benchmark
data_files:
- split: train path: formosan_asr_benchmark/train-*
- config_name: fpt_fosd
data_files:
- split: train path: fpt_fosd/train-*
- config_name: french-education-speech
data_files:
- split: train path: french-education-speech/train-*
- config_name: french-education-speech__Lexia-Labs
data_files:
- split: train path: french-education-speech__Lexia-Labs/train-*
- config_name: french-long-form-test
data_files:
- split: train path: french-long-form-test/train-*
- config_name: french-tts-ft1
data_files:
- split: train path: french-tts-ft1/train-*
- config_name: french_homophone_asr
data_files:
- split: train path: french_homophone_asr/train-*
- config_name: frisian-asr-cv22
data_files:
- split: train path: frisian-asr-cv22/train-*
- config_name: fttrtest
data_files:
- split: train path: fttrtest/train-*
- config_name: ga-multispeaker-speech-text-20k
data_files:
- split: train path: ga-multispeaker-speech-text-20k/train-*
- config_name: ga-speech-text-parallel-90k
data_files:
- split: train path: ga-speech-text-parallel-90k/train-*
- config_name: galician-speech-dataset
data_files:
- split: train path: galician-speech-dataset/train-*
- config_name: gametime
data_files:
- split: train path: gametime/train-*
- config_name: gemini-flash-2.0-speech
data_files:
- split: train path: gemini-flash-2.0-speech/train-*
- config_name: genadz_pashkou_all
data_files:
- split: train path: genadz_pashkou_all/train-*
- config_name: genadz_pashkou_output_original
data_files:
- split: train path: genadz_pashkou_output_original/train-*
- config_name: genshin-voice
data_files:
- split: train path: genshin-voice/train-*
- config_name: genshin-voice-v3.3-mandarin
data_files:
- split: train path: genshin-voice-v3.3-mandarin/train-*
- config_name: genshin-voice-v3.4-mandarin
data_files:
- split: train path: genshin-voice-v3.4-mandarin/train-*
- config_name: genshin-voice-v3.5-mandarin
data_files:
- split: train path: genshin-voice-v3.5-mandarin/train-*
- config_name: genshin-voice-v3.5-mandarin-processed
data_files:
- split: train path: genshin-voice-v3.5-mandarin-processed/train-*
- config_name: genshin-voice-zh
data_files:
- split: train path: genshin-voice-zh/train-*
- config_name: genshin_ch_10npc
data_files:
- split: train path: genshin_ch_10npc/train-*
- config_name: ghana-english-asr-2700hrs
data_files:
- split: train path: ghana-english-asr-2700hrs/train-*
- config_name: ghana-english-speech-600hrs
data_files:
- split: train path: ghana-english-speech-600hrs/train-*
- config_name: ghana-english-speech-filtered-v1
data_files:
- split: train path: ghana-english-speech-filtered-v1/train-*
- config_name: ghana-female-twi-8sec-splits
data_files:
- split: train path: ghana-female-twi-8sec-splits/train-*
- config_name: ghana-female-twi-asr-16word-splits
data_files:
- split: train path: ghana-female-twi-asr-16word-splits/train-*
- config_name: ghana-female-twi-speech-asr-8word-splits
data_files:
- split: train path: ghana-female-twi-speech-asr-8word-splits/train-*
- config_name: ghana-named-entities-tts-twi
data_files:
- split: train path: ghana-named-entities-tts-twi/train-*
- config_name: gigaspeech
data_files:
- split: train path: gigaspeech/train-*
- config_name: gigaspeech2_vie
data_files:
- split: train path: gigaspeech2_vie/train-*
- config_name: glados-ru-voice
data_files:
- split: train path: glados-ru-voice/train-*
- config_name: google-argentinian-spanish
data_files:
- split: train path: google-argentinian-spanish/train-*
- config_name: google-chilean-spanish
data_files:
- split: train path: google-chilean-spanish/train-*
- config_name: google-colombian-spanish
data_files:
- split: train path: google-colombian-spanish/train-*
- config_name: google-tamil
data_files:
- split: train path: google-tamil/train-*
- config_name: google_audio
data_files:
- split: train path: google_audio/train-*
- config_name: gos-demo
data_files:
- split: train path: gos-demo/train-*
- config_name: greek-tts-dataset
data_files:
- split: train path: greek-tts-dataset/train-*
- config_name: gujarati-f-openslr
data_files:
- split: train path: gujarati-f-openslr/train-*
- config_name: gurbani-sehajpath
data_files:
- split: train path: gurbani-sehajpath/train-*
- config_name: gurbani-sehajpath-yt-captions-canonical
data_files:
- split: train path: gurbani-sehajpath-yt-captions-canonical/train-*
- config_name: hailuo-ai-jokes
data_files:
- split: train path: hailuo-ai-jokes/train-*
- config_name: hailuo-ai-voices
data_files:
- split: train path: hailuo-ai-voices/train-*
- config_name: haqkiem-TTS
data_files:
- split: train path: haqkiem-TTS/train-*
- config_name: hausa-tts-22k
data_files:
- split: train path: hausa-tts-22k/train-*
- config_name: hausa-tts-24khz-naijavoices-O0456
data_files:
- split: train path: hausa-tts-24khz-naijavoices-O0456/train-*
- config_name: hausa-tts-24khz-waxalnlp-3
data_files:
- split: train path: hausa-tts-24khz-waxalnlp-3/train-*
- config_name: hausa-tts-24khz-waxalnlp-5
data_files:
- split: train path: hausa-tts-24khz-waxalnlp-5/train-*
- config_name: hausa-tts-inference-mar-23
data_files:
- split: train path: hausa-tts-inference-mar-23/train-*
- config_name: havacilik-veriseti
data_files:
- split: train path: havacilik-veriseti/train-*
- config_name: hawrami_speech
data_files:
- split: train path: hawrami_speech/train-*
- config_name: heart-failure-audio
data_files:
- split: train path: heart-failure-audio/train-*
- config_name: hebrew-speech-dataset
data_files:
- split: train path: hebrew-speech-dataset/train-*
- config_name: hebrew_speech_campus
data_files:
- split: train path: hebrew_speech_campus/train-*
- config_name: hebrew_speech_coursera
data_files:
- split: train path: hebrew_speech_coursera/train-*
- config_name: hebrew_speech_kan
data_files:
- split: train path: hebrew_speech_kan/train-*
- config_name: hebrew_speech_kan_nikud
data_files:
- split: train path: hebrew_speech_kan_nikud/train-*
- config_name: hifi-tts
data_files:
- split: train path: hifi-tts/train-*
- config_name: highquality_nepali_female_asr
data_files:
- split: train path: highquality_nepali_female_asr/train-*
- config_name: hindi-asr-benchmark
data_files:
- split: train path: hindi-asr-benchmark/train-*
- config_name: hindi-audio-stories-20-30s
data_files:
- split: train path: hindi-audio-stories-20-30s/train-*
- config_name: hindi-tts-dataset
data_files:
- split: train path: hindi-tts-dataset/train-*
- config_name: hindi_ai4bharat_indictts
data_files:
- split: train path: hindi_ai4bharat_indictts/train-*
- config_name: hindi_karya
data_files:
- split: train path: hindi_karya/train-*
- config_name: hinglish-compressed
data_files:
- split: train path: hinglish-compressed/train-*
- config_name: hmong-dataset-audio-v1
data_files:
- split: train path: hmong-dataset-audio-v1/train-*
- config_name: hq-conversations
data_files:
- split: train path: hq-conversations/train-*
- config_name: humans-benchmark
data_files:
- split: train path: humans-benchmark/train-*
- config_name: humans-benchmark__HUMANSBenchmark
data_files:
- split: train path: humans-benchmark__HUMANSBenchmark/train-*
- config_name: hundred-reverb-asr-dataset-0.4
data_files:
- split: train path: hundred-reverb-asr-dataset-0.4/train-*
- config_name: hung-yi_lee
data_files:
- split: train path: hung-yi_lee/train-*
- config_name: hungarian-single-speaker-tts
data_files:
- split: train path: hungarian-single-speaker-tts/train-*
- config_name: hungarian-speech-dataset
data_files:
- split: train path: hungarian-speech-dataset/train-*
- config_name: hyvoxpopuli
data_files:
- split: train path: hyvoxpopuli/train-*
- config_name: iagan_frydryh_shyler_kubak_all
data_files:
- split: train path: iagan_frydryh_shyler_kubak_all/train-*
- config_name: iagan_frydryh_shyler_kubak_output_original
data_files:
- split: train path: iagan_frydryh_shyler_kubak_output_original/train-*
- config_name: iakub-kolas-kazki-zhytstsia-output
data_files:
- split: train path: iakub-kolas-kazki-zhytstsia-output/train-*
- config_name: iakub-kolas-kazki-zhytstsia-output_original
data_files:
- split: train path: iakub-kolas-kazki-zhytstsia-output_original/train-*
- config_name: iakub-kolas-kazki-zhytstsia_all
data_files:
- split: train path: iakub-kolas-kazki-zhytstsia_all/train-*
- config_name: iban-speech
data_files:
- split: train path: iban-speech/train-*
- config_name: icelandic-speech-dataset
data_files:
- split: train path: icelandic-speech-dataset/train-*
- config_name: idrak_ryanspeech
data_files:
- split: train path: idrak_ryanspeech/train-*
- config_name: igbo-dict
data_files:
- split: train path: igbo-dict/train-*
- config_name: igbo-dict-16khz
data_files:
- split: train path: igbo-dict-16khz/train-*
- config_name: igbo-dict-expansion
data_files:
- split: train path: igbo-dict-expansion/train-*
- config_name: igbo-dict-expansion-16khz
data_files:
- split: train path: igbo-dict-expansion-16khz/train-*
- config_name: iisc-mile-tamil-asr
data_files:
- split: train path: iisc-mile-tamil-asr/train-*
- config_name: iisc_mono_hindi_female
data_files:
- split: train path: iisc_mono_hindi_female/train-*
- config_name: iitm_mono_hindi_female
data_files:
- split: train path: iitm_mono_hindi_female/train-*
- config_name: imasc_slr
data_files:
- split: train path: imasc_slr/train-*
- config_name: in22-legal
data_files:
- split: train path: in22-legal/train-*
- config_name: inbrowser-proctor-dataset
data_files:
- split: train path: inbrowser-proctor-dataset/train-*
- config_name: indian-english-nptel-v0
data_files:
- split: train path: indian-english-nptel-v0/train-*
- config_name: indian-tts-60min
data_files:
- split: train path: indian-tts-60min/train-*
- config_name: indian-tts-dataset
data_files:
- split: train path: indian-tts-dataset/train-*
- config_name: indian_accent_english
data_files:
- split: train path: indian_accent_english/train-*
- config_name: indic-Malayalam-PD
data_files:
- split: train path: indic-Malayalam-PD/train-*
- config_name: indic-speech
data_files:
- split: train path: indic-speech/train-*
- config_name: indic_hi_en_tts
data_files:
- split: train path: indic_hi_en_tts/train-*
- config_name: indic_tts_ml
data_files:
- split: train path: indic_tts_ml/train-*
- config_name: indicvoices-bengali
data_files:
- split: train path: indicvoices-bengali/train-*
- config_name: indicvoices_r
data_files:
- split: train path: indicvoices_r/train-*
- config_name: indicvoices_r-ML
data_files:
- split: train path: indicvoices_r-ML/train-*
- config_name: indonesian-audiobook-tts
data_files:
- split: train path: indonesian-audiobook-tts/train-*
- config_name: infore1_25hours
data_files:
- split: train path: infore1_25hours/train-*
- config_name: infore2_audiobooks
data_files:
- split: train path: infore2_audiobooks/train-*
- config_name: irodori-refs-10k
data_files:
- split: train path: irodori-refs-10k/train-*
- config_name: irodori-refs-10k-v2
data_files:
- split: train path: irodori-refs-10k-v2/train-*
- config_name: irodori-refs-10k__shoron08
data_files:
- split: train path: irodori-refs-10k__shoron08/train-*
- config_name: irodori-tts-refs-12k
data_files:
- split: train path: irodori-tts-refs-12k/train-*
- config_name: isindebele-asr
data_files:
- split: train path: isindebele-asr/train-*
- config_name: isixhosa-asr
data_files:
- split: train path: isixhosa-asr/train-*
- config_name: isixhosa-asr-gaussian-noise
data_files:
- split: train path: isixhosa-asr-gaussian-noise/train-*
- config_name: isixhosa-asr-specaugment
data_files:
- split: train path: isixhosa-asr-specaugment/train-*
- config_name: isixhosa-asr-test
data_files:
- split: train path: isixhosa-asr-test/train-*
- config_name: isixhosa-asr-train
data_files:
- split: train path: isixhosa-asr-train/train-*
- config_name: isizulu-asr-gaussian-noise
data_files:
- split: train path: isizulu-asr-gaussian-noise/train-*
- config_name: isizulu-asr-specaugment
data_files:
- split: train path: isizulu-asr-specaugment/train-*
- config_name: isizulu-asr-test
data_files:
- split: train path: isizulu-asr-test/train-*
- config_name: isizulu-asr-train
data_files:
- split: train path: isizulu-asr-train/train-*
- config_name: it_youtube_uzbek_speech_dataset
data_files:
- split: train path: it_youtube_uzbek_speech_dataset/train-*
- config_name: it_youtube_uzbek_speech_dataset__BoburAmirov
data_files:
- split: train path: it_youtube_uzbek_speech_dataset__BoburAmirov/train-*
- config_name: it_youtube_uzbek_speech_dataset__azimislom
data_files:
- split: train path: it_youtube_uzbek_speech_dataset__azimislom/train-*
- config_name: ivan-melezh-podykh-navalnitsy-valer-budzevich-output_original
data_files:
- split: train path: ivan-melezh-podykh-navalnitsy-valer-budzevich-output_original/train-*
- config_name: ivan-melezh-podykh-navalnitsy-valer-budzevich_all
data_files:
- split: train path: ivan-melezh-podykh-navalnitsy-valer-budzevich_all/train-*
- config_name: ivan-melezh-zavei-snezhan-valer-budzevich-output_original
data_files:
- split: train path: ivan-melezh-zavei-snezhan-valer-budzevich-output_original/train-*
- config_name: ivan-melezh-zavei-snezhan-valer-budzevich_all
data_files:
- split: train path: ivan-melezh-zavei-snezhan-valer-budzevich_all/train-*
- config_name: ivan-navumenka-zhul-vern-output_original
data_files:
- split: train path: ivan-navumenka-zhul-vern-output_original/train-*
- config_name: ivan-navumenka-zhul-vern_all
data_files:
- split: train path: ivan-navumenka-zhul-vern_all/train-*
- config_name: ivan-ptashnikau-lvy-output_original
data_files:
- split: train path: ivan-ptashnikau-lvy-output_original/train-*
- config_name: ivan-ptashnikau-lvy_all
data_files:
- split: train path: ivan-ptashnikau-lvy_all/train-*
- config_name: ivan_navumenka_sasna_pry_daroze_all
data_files:
- split: train path: ivan_navumenka_sasna_pry_daroze_all/train-*
- config_name: ivan_navumenka_sasna_pry_daroze_output_original
data_files:
- split: train path: ivan_navumenka_sasna_pry_daroze_output_original/train-*
- config_name: ivan_ptashnikau_all
data_files:
- split: train path: ivan_ptashnikau_all/train-*
- config_name: ivan_ptashnikau_output_original
data_files:
- split: train path: ivan_ptashnikau_output_original/train-*
- config_name: ivan_shamyakin_sertsa_na_daloni_all
data_files:
- split: train path: ivan_shamyakin_sertsa_na_daloni_all/train-*
- config_name: ivan_shamyakin_sertsa_na_daloni_output_original
data_files:
- split: train path: ivan_shamyakin_sertsa_na_daloni_output_original/train-*
- config_name: ivan_shamyakin_tryvozhnae_shchastse_all
data_files:
- split: train path: ivan_shamyakin_tryvozhnae_shchastse_all/train-*
- config_name: ivan_shamyakin_tryvozhnae_shchastse_output_original
data_files:
- split: train path: ivan_shamyakin_tryvozhnae_shchastse_output_original/train-*
- config_name: jacob-common-voice-19-zh-TW-curated
data_files:
- split: train path: jacob-common-voice-19-zh-TW-curated/train-*
- config_name: jaepa_dataset
data_files:
- split: train path: jaepa_dataset/train-*
- config_name: jalandhary_asr
data_files:
- split: train path: jalandhary_asr/train-*
- config_name: japanese-Eroge-Voice-V2
data_files:
- split: train path: japanese-Eroge-Voice-V2/train-*
- config_name: japanese-anime-speech
data_files:
- split: train path: japanese-anime-speech/train-*
- config_name: japanese-anime-speech-v2
data_files:
- split: train path: japanese-anime-speech-v2/train-*
- config_name: japanese-anime-speech-v2-split
data_files:
- split: train path: japanese-anime-speech-v2-split/train-*
- config_name: jenny-mimi
data_files:
- split: train path: jenny-mimi/train-*
- config_name: jenny_tts_dataset
data_files:
- split: train path: jenny_tts_dataset/train-*
- config_name: jessica-076
data_files:
- split: train path: jessica-076/train-*
- config_name: jl-speech
data_files:
- split: train path: jl-speech/train-*
- config_name: kabyle_asr
data_files:
- split: train path: kabyle_asr/train-*
- config_name: karamojong-speech-dataset
data_files:
- split: train path: karamojong-speech-dataset/train-*
- config_name: kasem-speech-text-parallel
data_files:
- split: train path: kasem-speech-text-parallel/train-*
- config_name: kazakh-emotional-tts
data_files:
- split: train path: kazakh-emotional-tts/train-*
- config_name: kazakh-speech-dataset
data_files:
- split: train path: kazakh-speech-dataset/train-*
- config_name: kazakh-stt
data_files:
- split: train path: kazakh-stt/train-*
- config_name: kazakh-tts-test
data_files:
- split: train path: kazakh-tts-test/train-*
- config_name: kazakh-tts-val
data_files:
- split: train path: kazakh-tts-val/train-*
- config_name: kazakh_songs_asr
data_files:
- split: train path: kazakh_songs_asr/train-*
- config_name: kazakh_speech_dataset_ksd
data_files:
- split: train path: kazakh_speech_dataset_ksd/train-*
- config_name: kazakh_speech_mfa_punctuation
data_files:
- split: train path: kazakh_speech_mfa_punctuation/train-*
- config_name: kazlibri
data_files:
- split: train path: kazlibri/train-*
- config_name: kenyan-swahili-asr-clean
data_files:
- split: train path: kenyan-swahili-asr-clean/train-*
- config_name: khanacademy-turkish
data_files:
- split: train path: khanacademy-turkish/train-*
- config_name: khanacademy-turkish-math
data_files:
- split: train path: khanacademy-turkish-math/train-*
- config_name: khanacademy-turkish__Taklaxbr
data_files:
- split: train path: khanacademy-turkish__Taklaxbr/train-*
- config_name: khasi-tts
data_files:
- split: train path: khasi-tts/train-*
- config_name: khm-asr-cultural__DDD-Cambodia
data_files:
- split: train path: khm-asr-cultural__DDD-Cambodia/train-*
- config_name: khm-asr-cultural__lyhourt-FSA
data_files:
- split: train path: khm-asr-cultural__lyhourt-FSA/train-*
- config_name: khmer_mpwt_speech
data_files:
- split: train path: khmer_mpwt_speech/train-*
- config_name: khursanirevo_chatter
data_files:
- split: train path: khursanirevo_chatter/train-*
- config_name: killkan
data_files:
- split: train path: killkan/train-*
- config_name: kinyarwanda-pastor-snac
data_files:
- split: train path: kinyarwanda-pastor-snac/train-*
- config_name: kinyarwanda-speech-sample
data_files:
- split: train path: kinyarwanda-speech-sample/train-*
- config_name: kinyarwanda-tts-dataset
data_files:
- split: train path: kinyarwanda-tts-dataset/train-*
- config_name: kinyarwanda-tts-dataset-kin
data_files:
- split: train path: kinyarwanda-tts-dataset-kin/train-*
- config_name: kiswahili-asr-challenge-eval
data_files:
- split: train path: kiswahili-asr-challenge-eval/train-*
- config_name: kiswahili-tts-dataset
data_files:
- split: train path: kiswahili-tts-dataset/train-*
- config_name: km-speech-corpus
data_files:
- split: train path: km-speech-corpus/train-*
- config_name: knihi-be-arlou_tancy_nad_horadam_all
data_files:
- split: train path: knihi-be-arlou_tancy_nad_horadam_all/train-*
- config_name: knihi-be-arlou_tancy_nad_horadam_output_original
data_files:
- split: train path: knihi-be-arlou_tancy_nad_horadam_output_original/train-*
- config_name: konkani-bible-audio
data_files:
- split: train path: konkani-bible-audio/train-*
- config_name: korean-audio-text-develop
data_files:
- split: train path: korean-audio-text-develop/train-*
- config_name: korean-tts-training
data_files:
- split: train path: korean-tts-training/train-*
- config_name: korean_dataset
data_files:
- split: train path: korean_dataset/train-*
- config_name: kuroyukihime-speech
data_files:
- split: train path: kuroyukihime-speech/train-*
- config_name: kuzma_chorny_makarkavyh_volka_all
data_files:
- split: train path: kuzma_chorny_makarkavyh_volka_all/train-*
- config_name: kuzma_chorny_makarkavyh_volka_output_original
data_files:
- split: train path: kuzma_chorny_makarkavyh_volka_output_original/train-*
- config_name: kuzma_chorny_poshuki_buduchyni_all
data_files:
- split: train path: kuzma_chorny_poshuki_buduchyni_all/train-*
- config_name: kuzma_chorny_poshuki_buduchyni_output_original
data_files:
- split: train path: kuzma_chorny_poshuki_buduchyni_output_original/train-*
- config_name: kuzma_chorny_zyamlya_all
data_files:
- split: train path: kuzma_chorny_zyamlya_all/train-*
- config_name: kuzma_chorny_zyamlya_output_original
data_files:
- split: train path: kuzma_chorny_zyamlya_output_original/train-*
- config_name: kyrgyz-asr
data_files:
- split: train path: kyrgyz-asr/train-*
- config_name: l2-arctic-manual-v5.0-16k
data_files:
- split: train path: l2-arctic-manual-v5.0-16k/train-*
- config_name: l2arcticperceived-pr
data_files:
- split: train path: l2arcticperceived-pr/train-*
- config_name: ladino-karen-TTS
data_files:
- split: train path: ladino-karen-TTS/train-*
- config_name: lagodny-tsmok-iury-zhygamont-output_original
data_files:
- split: train path: lagodny-tsmok-iury-zhygamont-output_original/train-*
- config_name: lagodny-tsmok-iury-zhygamont_all
data_files:
- split: train path: lagodny-tsmok-iury-zhygamont_all/train-*
- config_name: lahgtna-levantine-tts
data_files:
- split: train path: lahgtna-levantine-tts/train-*
- config_name: lai-speech
data_files:
- split: train path: lai-speech/train-*
- config_name: laions-voice-acting-flat
data_files:
- split: train path: laions-voice-acting-flat/train-*
- config_name: lao-asr-thesis-dataset
data_files:
- split: train path: lao-asr-thesis-dataset/train-*
- config_name: lao-data-speech
data_files:
- split: train path: lao-data-speech/train-*
- config_name: lao-speech-dataset
data_files:
- split: train path: lao-speech-dataset/train-*
- config_name: laos-speech-dataset
data_files:
- split: train path: laos-speech-dataset/train-*
- config_name: laos-voice-dataset-v2
data_files:
- split: train path: laos-voice-dataset-v2/train-*
- config_name: latvian-speech-dataset
data_files:
- split: train path: latvian-speech-dataset/train-*
- config_name: legendy-i-padanni
data_files:
- split: train path: legendy-i-padanni/train-*
- config_name: legendy-i-padanni_all
data_files:
- split: train path: legendy-i-padanni_all/train-*
- config_name: legendy-i-padanni_original
data_files:
- split: train path: legendy-i-padanni_original/train-*
- config_name: leyu-amharic-gojjam-dialect
data_files:
- split: train path: leyu-amharic-gojjam-dialect/train-*
- config_name: leyu-amharic-gonder-dialect
data_files:
- split: train path: leyu-amharic-gonder-dialect/train-*
- config_name: leyu-amharic-shewa-dialect
data_files:
- split: train path: leyu-amharic-shewa-dialect/train-*
- config_name: leyu-amharic-wello-dialect
data_files:
- split: train path: leyu-amharic-wello-dialect/train-*
- config_name: lfm-audio-fc-5500
data_files:
- split: train path: lfm-audio-fc-5500/train-*
- config_name: libris_clean_100
data_files:
- split: train path: libris_clean_100/train-*
- config_name: librispeech-alignments
data_files:
- split: train path: librispeech-alignments/train-*
- config_name: librispeech-alignments_clean100
data_files:
- split: train path: librispeech-alignments_clean100/train-*
- config_name: librispeech-arpabet-processed
data_files:
- split: train path: librispeech-arpabet-processed/train-*
- config_name: librispeech-pc-44khz-opus
data_files:
- split: train path: librispeech-pc-44khz-opus/train-*
- config_name: librispeech-segment
data_files:
- split: train path: librispeech-segment/train-*
- config_name: librispeech_asr
data_files:
- split: train path: librispeech_asr/train-*
- config_name: librispeech_asr__0x3
data_files:
- split: train path: librispeech_asr__0x3/train-*
- config_name: librispeech_asr__Inku004
data_files:
- split: train path: librispeech_asr__Inku004/train-*
- config_name: librispeech_asr__MONOKOTIL
data_files:
- split: train path: librispeech_asr__MONOKOTIL/train-*
- config_name: librispeech_asr__TC0729
data_files:
- split: train path: librispeech_asr__TC0729/train-*
- config_name: librispeech_asr__sovitrath
data_files:
- split: train path: librispeech_asr__sovitrath/train-*
- config_name: librispeech_asr_test_clean_word_timestamp
data_files:
- split: train path: librispeech_asr_test_clean_word_timestamp/train-*
- config_name: libritts
data_files:
- split: train path: libritts/train-*
- config_name: libritts-dac
data_files:
- split: train path: libritts-dac/train-*
- config_name: libritts-mimi
data_files:
- split: train path: libritts-mimi/train-*
- config_name: libritts_opus
data_files:
- split: train path: libritts_opus/train-*
- config_name: libritts_r
data_files:
- split: train path: libritts_r/train-*
- config_name: libritts_r__pharaouk
data_files:
- split: train path: libritts_r__pharaouk/train-*
- config_name: libritts_r_filtered
data_files:
- split: train path: libritts_r_filtered/train-*
- config_name: libritts_r_opus
data_files:
- split: train path: libritts_r_opus/train-*
- config_name: librivox-tts-swedish
data_files:
- split: train path: librivox-tts-swedish/train-*
- config_name: librivox_spanish
data_files:
- split: train path: librivox_spanish/train-*
- config_name: liepa-asr
data_files:
- split: train path: liepa-asr/train-*
- config_name: liepa-tts
data_files:
- split: train path: liepa-tts/train-*
- config_name: lili-romanian-single-speaker-piper
data_files:
- split: train path: lili-romanian-single-speaker-piper/train-*
- config_name: linto-dataset-audio-ar-tn
data_files:
- split: train path: linto-dataset-audio-ar-tn/train-*
- config_name: linto-dataset-audio-ar-tn-augmented
data_files:
- split: train path: linto-dataset-audio-ar-tn-augmented/train-*
- config_name: linustechtips-transcript-audio
data_files:
- split: train path: linustechtips-transcript-audio/train-*
- config_name: lithuanian-speech-dataset
data_files:
- split: train path: lithuanian-speech-dataset/train-*
- config_name: lleisiau-arfor
data_files:
- split: train path: lleisiau-arfor/train-*
- config_name: lomwe-speech-text
data_files:
- split: train path: lomwe-speech-text/train-*
- config_name: low-decoder
data_files:
- split: train path: low-decoder/train-*
- config_name: luna-speech-dataset
data_files:
- split: train path: luna-speech-dataset/train-*
- config_name: mTEDx-ptbr
data_files:
- split: train path: mTEDx-ptbr/train-*
- config_name: mabama-v6
data_files:
- split: train path: mabama-v6/train-*
- config_name: macedonian
data_files:
- split: train path: macedonian/train-*
- config_name: macedonian-speech-dataset
data_files:
- split: train path: macedonian-speech-dataset/train-*
- config_name: magicdata
data_files:
- split: train path: magicdata/train-*
- config_name: maithili_syspin_female_tts_22050
data_files:
- split: train path: maithili_syspin_female_tts_22050/train-*
- config_name: makhuwa-trigrams-speech-text-parallel
data_files:
- split: train path: makhuwa-trigrams-speech-text-parallel/train-*
- config_name: maksim_tank_all
data_files:
- split: train path: maksim_tank_all/train-*
- config_name: maksim_tank_output_original
data_files:
- split: train path: maksim_tank_output_original/train-*
- config_name: malagasy-nwt-bible
data_files:
- split: train path: malagasy-nwt-bible/train-*
- config_name: malay-audiobook
data_files:
- split: train path: malay-audiobook/train-*
- config_name: malay-tts-tags
data_files:
- split: train path: malay-tts-tags/train-*
- config_name: malayalam-speech-dataset
data_files:
- split: train path: malayalam-speech-dataset/train-*
- config_name: malayalam-tts-pro-voice
data_files:
- split: train path: malayalam-tts-pro-voice/train-*
- config_name: malayalam-tts-pro-voice__sachin6624
data_files:
- split: train path: malayalam-tts-pro-voice__sachin6624/train-*
- config_name: malayalam-whisper-corpus-v2
data_files:
- split: train path: malayalam-whisper-corpus-v2/train-*
- config_name: malayalam-whisper-corpus_v3
data_files:
- split: train path: malayalam-whisper-corpus_v3/train-*
- config_name: malayalam_data_from_bhashini_100125
data_files:
- split: train path: malayalam_data_from_bhashini_100125/train-*
- config_name: malayalam_dataset_17_01_25
data_files:
- split: train path: malayalam_dataset_17_01_25/train-*
- config_name: malaysian-chinese-emilia
data_files:
- split: train path: malaysian-chinese-emilia/train-*
- config_name: malaysian-emilia-v2
data_files:
- split: train path: malaysian-emilia-v2/train-*
- config_name: maltese-speech-dataset
data_files:
- split: train path: maltese-speech-dataset/train-*
- config_name: mar_yan_duksa_output_original
data_files:
- split: train path: mar_yan_duksa_output_original/train-*
- config_name: marathi-speech-dataset
data_files:
- split: train path: marathi-speech-dataset/train-*
- config_name: marathi_asr_dataset
data_files:
- split: train path: marathi_asr_dataset/train-*
- config_name: marathi_reg_test_set
data_files:
- split: train path: marathi_reg_test_set/train-*
- config_name: masri_synthetic
data_files:
- split: train path: masri_synthetic/train-*
- config_name: maya-audio
data_files:
- split: train path: maya-audio/train-*
- config_name: mbspeech_mn
data_files:
- split: train path: mbspeech_mn/train-*
- config_name: med-dictate
data_files:
- split: train path: med-dictate/train-*
- config_name: med-term
data_files:
- split: train path: med-term/train-*
- config_name: medical-terms-2025
data_files:
- split: train path: medical-terms-2025/train-*
- config_name: medv3-turkish-medical-asr
data_files:
- split: train path: medv3-turkish-medical-asr/train-*
- config_name: meiteimayek-audio-parallel-corpus
data_files:
- split: train path: meiteimayek-audio-parallel-corpus/train-*
- config_name: merged_Arabic-Diacritized_ClArTTS
data_files:
- split: train path: merged_Arabic-Diacritized_ClArTTS/train-*
- config_name: merged_urdu_TTS
data_files:
- split: train path: merged_urdu_TTS/train-*
- config_name: messenian-speech-corpus
data_files:
- split: train path: messenian-speech-corpus/train-*
- config_name: mgb2-arabic
data_files:
- split: train path: mgb2-arabic/train-*
- config_name: microsoft-speech-corpus-indian
data_files:
- split: train path: microsoft-speech-corpus-indian/train-*
- config_name: minds14
data_files:
- split: train path: minds14/train-*
- config_name: minds14__yxl10086
data_files:
- split: train path: minds14__yxl10086/train-*
- config_name: mixed_cantonese_and_english_speech
data_files:
- split: train path: mixed_cantonese_and_english_speech/train-*
- config_name: mixed_shona_dataset
data_files:
- split: train path: mixed_shona_dataset/train-*
- config_name: ml_superb_br
data_files:
- split: train path: ml_superb_br/train-*
- config_name: mls_dutch
data_files:
- split: train path: mls_dutch/train-*
- config_name: mms-tts-uig-script_arabic-UQSpeech
data_files:
- split: train path: mms-tts-uig-script_arabic-UQSpeech/train-*
- config_name: moroccan_amazigh_asr
data_files:
- split: train path: moroccan_amazigh_asr/train-*
- config_name: mother_tongue_dataset
data_files:
- split: train path: mother_tongue_dataset/train-*
- config_name: msc
data_files:
- split: train path: msc/train-*
- config_name: mtedx
data_files:
- split: train path: mtedx/train-*
- config_name: mucs
data_files:
- split: train path: mucs/train-*
- config_name: mucs-hinglish-blindtest
data_files:
- split: train path: mucs-hinglish-blindtest/train-*
- config_name: multilingual-TEDX-fr
data_files:
- split: train path: multilingual-TEDX-fr/train-*
- config_name: multilingual-nchlt-dataset
data_files:
- split: train path: multilingual-nchlt-dataset/train-*
- config_name: multilingual-synthetic-tts
data_files:
- split: train path: multilingual-synthetic-tts/train-*
- config_name: multilingual-tts
data_files:
- split: train path: multilingual-tts/train-*
- config_name: multilingual_librispeech
data_files:
- split: train path: multilingual_librispeech/train-*
- config_name: multilingual_librispeech_french_phoneme
data_files:
- split: train path: multilingual_librispeech_french_phoneme/train-*
- config_name: multilingual_librispeech_italian_phoneme
data_files:
- split: train path: multilingual_librispeech_italian_phoneme/train-*
- config_name: multimed-hard
data_files:
- split: train path: multimed-hard/train-*
- config_name: multiturn_ks
data_files:
- split: train path: multiturn_ks/train-*
- config_name: myanmar-speech-dataset-for-asr
data_files:
- split: train path: myanmar-speech-dataset-for-asr/train-*
- config_name: myanmar-speech-dataset-google-fleurs
data_files:
- split: train path: myanmar-speech-dataset-google-fleurs/train-*
- config_name: myanmar-speech-dataset-openslr-80
data_files:
- split: train path: myanmar-speech-dataset-openslr-80/train-*
- config_name: nEMO
data_files:
- split: train path: nEMO/train-*
- config_name: naijavoices-dataset
data_files:
- split: train path: naijavoices-dataset/train-*
- config_name: namuwiki-arknights-asr-preview
data_files:
- split: train path: namuwiki-arknights-asr-preview/train-*
- config_name: natasha_sova_ai
data_files:
- split: train path: natasha_sova_ai/train-*
- config_name: navigation-corpus-dagbani-speech
data_files:
- split: train path: navigation-corpus-dagbani-speech/train-*
- config_name: navigation-corpus-dagbani-speech__fiifinketia
data_files:
- split: train path: navigation-corpus-dagbani-speech__fiifinketia/train-*
- config_name: navigation-corpus-ewe-speech
data_files:
- split: train path: navigation-corpus-ewe-speech/train-*
- config_name: navigation-corpus-ewe-speech__fiifinketia
data_files:
- split: train path: navigation-corpus-ewe-speech__fiifinketia/train-*
- config_name: navigation-corpus-twi-speech
data_files:
- split: train path: navigation-corpus-twi-speech/train-*
- config_name: nb-NO-asr-cv
data_files:
- split: train path: nb-NO-asr-cv/train-*
- config_name: nbtale12
data_files:
- split: train path: nbtale12/train-*
- config_name: nbtale3
data_files:
- split: train path: nbtale3/train-*
- config_name: nchlt
data_files:
- split: train path: nchlt/train-*
- config_name: nchlt_speech_afr
data_files:
- split: train path: nchlt_speech_afr/train-*
- config_name: nchlt_speech_afrikaans
data_files:
- split: train path: nchlt_speech_afrikaans/train-*
- config_name: nchlt_speech_eng
data_files:
- split: train path: nchlt_speech_eng/train-*
- config_name: nchlt_speech_isindebele
data_files:
- split: train path: nchlt_speech_isindebele/train-*
- config_name: nchlt_speech_nbl
data_files:
- split: train path: nchlt_speech_nbl/train-*
- config_name: nchlt_speech_nso
data_files:
- split: train path: nchlt_speech_nso/train-*
- config_name: nchlt_speech_sepedi
data_files:
- split: train path: nchlt_speech_sepedi/train-*
- config_name: nchlt_speech_sesotho
data_files:
- split: train path: nchlt_speech_sesotho/train-*
- config_name: nchlt_speech_setswana
data_files:
- split: train path: nchlt_speech_setswana/train-*
- config_name: nchlt_speech_siswati
data_files:
- split: train path: nchlt_speech_siswati/train-*
- config_name: nchlt_speech_sot
data_files:
- split: train path: nchlt_speech_sot/train-*
- config_name: nchlt_speech_ssw
data_files:
- split: train path: nchlt_speech_ssw/train-*
- config_name: nchlt_speech_tsn
data_files:
- split: train path: nchlt_speech_tsn/train-*
- config_name: nchlt_speech_tso
data_files:
- split: train path: nchlt_speech_tso/train-*
- config_name: nchlt_speech_ven
data_files:
- split: train path: nchlt_speech_ven/train-*
- config_name: nchlt_speech_venda
data_files:
- split: train path: nchlt_speech_venda/train-*
- config_name: nchlt_speech_xho
data_files:
- split: train path: nchlt_speech_xho/train-*
- config_name: nchlt_speech_xhosa
data_files:
- split: train path: nchlt_speech_xhosa/train-*
- config_name: nchlt_speech_xitsonga
data_files:
- split: train path: nchlt_speech_xitsonga/train-*
- config_name: nchlt_speech_zulu
data_files:
- split: train path: nchlt_speech_zulu/train-*
- config_name: ne-asr-ccp
data_files:
- split: train path: ne-asr-ccp/train-*
- config_name: ne-asr-clk
data_files:
- split: train path: ne-asr-clk/train-*
- config_name: ne-asr-clk-aug
data_files:
- split: train path: ne-asr-clk-aug/train-*
- config_name: ne-asr-grt
data_files:
- split: train path: ne-asr-grt/train-*
- config_name: ne-asr-grt-aug
data_files:
- split: train path: ne-asr-grt-aug/train-*
- config_name: ne-asr-lus
data_files:
- split: train path: ne-asr-lus/train-*
- config_name: ne-asr-lus-aug
data_files:
- split: train path: ne-asr-lus-aug/train-*
- config_name: ne-asr-mjw
data_files:
- split: train path: ne-asr-mjw/train-*
- config_name: ne-asr-nag
data_files:
- split: train path: ne-asr-nag/train-*
- config_name: ne-asr-nag-aug
data_files:
- split: train path: ne-asr-nag-aug/train-*
- config_name: ne-asr-nbu
data_files:
- split: train path: ne-asr-nbu/train-*
- config_name: ne-asr-nbu-aug
data_files:
- split: train path: ne-asr-nbu-aug/train-*
- config_name: ne-asr-njm
data_files:
- split: train path: ne-asr-njm/train-*
- config_name: ne-asr-njm-aug
data_files:
- split: train path: ne-asr-njm-aug/train-*
- config_name: ne-asr-njo
data_files:
- split: train path: ne-asr-njo/train-*
- config_name: ne-asr-njo-aug
data_files:
- split: train path: ne-asr-njo-aug/train-*
- config_name: ne-asr-njz
data_files:
- split: train path: ne-asr-njz/train-*
- config_name: ne-asr-njz-aug
data_files:
- split: train path: ne-asr-njz-aug/train-*
- config_name: ne-asr-nnp
data_files:
- split: train path: ne-asr-nnp/train-*
- config_name: ne-asr-nnp-aug
data_files:
- split: train path: ne-asr-nnp-aug/train-*
- config_name: ne-asr-nre
data_files:
- split: train path: ne-asr-nre/train-*
- config_name: ne-asr-nre-aug
data_files:
- split: train path: ne-asr-nre-aug/train-*
- config_name: ne-asr-nri
data_files:
- split: train path: ne-asr-nri/train-*
- config_name: ne-asr-nri-aug
data_files:
- split: train path: ne-asr-nri-aug/train-*
- config_name: ne-asr-tgj
data_files:
- split: train path: ne-asr-tgj/train-*
- config_name: ne-asr-tgj-aug
data_files:
- split: train path: ne-asr-tgj-aug/train-*
- config_name: ne-asr-trp
data_files:
- split: train path: ne-asr-trp/train-*
- config_name: ne-en-codeswitching-asr-technical-interview
data_files:
- split: train path: ne-en-codeswitching-asr-technical-interview/train-*
- config_name: ne-tts-ccp
data_files:
- split: train path: ne-tts-ccp/train-*
- config_name: ne-tts-clk
data_files:
- split: train path: ne-tts-clk/train-*
- config_name: ne-tts-coqui-multilingual
data_files:
- split: train path: ne-tts-coqui-multilingual/train-*
- config_name: ne-tts-f5-ccp
data_files:
- split: train path: ne-tts-f5-ccp/train-*
- config_name: ne-tts-f5-grt
data_files:
- split: train path: ne-tts-f5-grt/train-*
- config_name: ne-tts-f5-lus
data_files:
- split: train path: ne-tts-f5-lus/train-*
- config_name: ne-tts-f5-nag
data_files:
- split: train path: ne-tts-f5-nag/train-*
- config_name: ne-tts-grt
data_files:
- split: train path: ne-tts-grt/train-*
- config_name: ne-tts-lus
data_files:
- split: train path: ne-tts-lus/train-*
- config_name: ne-tts-mjw
data_files:
- split: train path: ne-tts-mjw/train-*
- config_name: ne-tts-mms-grt
data_files:
- split: train path: ne-tts-mms-grt/train-*
- config_name: ne-tts-mms-nag
data_files:
- split: train path: ne-tts-mms-nag/train-*
- config_name: ne-tts-mms-tgj
data_files:
- split: train path: ne-tts-mms-tgj/train-*
- config_name: ne-tts-nag
data_files:
- split: train path: ne-tts-nag/train-*
- config_name: ne-tts-nbu
data_files:
- split: train path: ne-tts-nbu/train-*
- config_name: ne-tts-njm
data_files:
- split: train path: ne-tts-njm/train-*
- config_name: ne-tts-njo
data_files:
- split: train path: ne-tts-njo/train-*
- config_name: ne-tts-njz
data_files:
- split: train path: ne-tts-njz/train-*
- config_name: ne-tts-nnp
data_files:
- split: train path: ne-tts-nnp/train-*
- config_name: ne-tts-nre
data_files:
- split: train path: ne-tts-nre/train-*
- config_name: ne-tts-nri
data_files:
- split: train path: ne-tts-nri/train-*
- config_name: ne-tts-tgj
data_files:
- split: train path: ne-tts-tgj/train-*
- config_name: ne-tts-trp
data_files:
- split: train path: ne-tts-trp/train-*
- config_name: nekopara-speech
data_files:
- split: train path: nekopara-speech/train-*
- config_name: nepali-asr-benchmark-50gb
data_files:
- split: train path: nepali-asr-benchmark-50gb/train-*
- config_name: nepali-english-speech-data
data_files:
- split: train path: nepali-english-speech-data/train-*
- config_name: nepali-slr
data_files:
- split: train path: nepali-slr/train-*
- config_name: nepali-tts-slr54-female-5-15s
data_files:
- split: train path: nepali-tts-slr54-female-5-15s/train-*
- config_name: nepali_openslr43_tts_22050
data_files:
- split: train path: nepali_openslr43_tts_22050/train-*
- config_name: nepali_speech_english_translation_shuffle_dataset
data_files:
- split: train path: nepali_speech_english_translation_shuffle_dataset/train-*
- config_name: nepali_speech_to_text
data_files:
- split: train path: nepali_speech_to_text/train-*
- config_name: neurologySTT
data_files:
- split: train path: neurologySTT/train-*
- config_name: news_youtube_uzbek_speech_dataset
data_files:
- split: train path: news_youtube_uzbek_speech_dataset/train-*
- config_name: news_youtube_uzbek_speech_dataset__BoburAmirov
data_files:
- split: train path: news_youtube_uzbek_speech_dataset__BoburAmirov/train-*
- config_name: news_youtube_uzbek_speech_dataset__azimislom
data_files:
- split: train path: news_youtube_uzbek_speech_dataset__azimislom/train-*
- config_name: news_youtube_uzbek_speech_dataset__hostbot77
data_files:
- split: train path: news_youtube_uzbek_speech_dataset__hostbot77/train-*
- config_name: neyshekar-v4-persian-asr-fa
data_files:
- split: train path: neyshekar-v4-persian-asr-fa/train-*
- config_name: ngochuyen_voice
data_files:
- split: train path: ngochuyen_voice/train-*
- config_name: nigerian-pidgin-1.0
data_files:
- split: train path: nigerian-pidgin-1.0/train-*
- config_name: nigerian-pidgin-speech
data_files:
- split: train path: nigerian-pidgin-speech/train-*
- config_name: nigerian-speech-accent
data_files:
- split: train path: nigerian-speech-accent/train-*
- config_name: nigerian_accented_english_dataset
data_files:
- split: train path: nigerian_accented_english_dataset/train-*
- config_name: nigerian_common_voice_dataset
data_files:
- split: train path: nigerian_common_voice_dataset/train-*
- config_name: nigerian_common_voice_dataset__AlaminI
data_files:
- split: train path: nigerian_common_voice_dataset__AlaminI/train-*
- config_name: nil-gilevich-vybranae-autar-output
data_files:
- split: train path: nil-gilevich-vybranae-autar-output/train-*
- config_name: nil-gilevich-vybranae-autar-output_original
data_files:
- split: train path: nil-gilevich-vybranae-autar-output_original/train-*
- config_name: nil-gilevich-vybranae-autar_all
data_files:
- split: train path: nil-gilevich-vybranae-autar_all/train-*
- config_name: nl-asr-cv
data_files:
- split: train path: nl-asr-cv/train-*
- config_name: no-filter-raw-NepaliParliamentDSv2
data_files:
- split: train path: no-filter-raw-NepaliParliamentDSv2/train-*
- config_name: nonverbalspeech38k
data_files:
- split: train path: nonverbalspeech38k/train-*
- config_name: north-female-vnese
data_files:
- split: train path: north-female-vnese/train-*
- config_name: norwegian-100h
data_files:
- split: train path: norwegian-100h/train-*
- config_name: norwegian-100h-v2
data_files:
- split: train path: norwegian-100h-v2/train-*
- config_name: norwegian-100h-v3
data_files:
- split: train path: norwegian-100h-v3/train-*
- config_name: norwegian-nynorsk-speech-dataset
data_files:
- split: train path: norwegian-nynorsk-speech-dataset/train-*
- config_name: notebooklm_rus
data_files:
- split: train path: notebooklm_rus/train-*
- config_name: npsc_nb
data_files:
- split: train path: npsc_nb/train-*
- config_name: nst-da
data_files:
- split: train path: nst-da/train-*
- config_name: nst-da-norm
data_files:
- split: train path: nst-da-norm/train-*
- config_name: nyan-jenny-format
data_files:
- split: train path: nyan-jenny-format/train-*
- config_name: oc_voice_2026_word_timings
data_files:
- split: train path: oc_voice_2026_word_timings/train-*
- config_name: occitan-speech-dataset
data_files:
- split: train path: occitan-speech-dataset/train-*
- config_name: odia-english-ASR
data_files:
- split: train path: odia-english-ASR/train-*
- config_name: omnilingual-asr-corpus
data_files:
- split: train path: omnilingual-asr-corpus/train-*
- config_name: omniscribe_corpus
data_files:
- split: train path: omniscribe_corpus/train-*
- config_name: omnivoice-best-of-n-dev-eval
data_files:
- split: train path: omnivoice-best-of-n-dev-eval/train-*
- config_name: omnivoice-best-of-n-training
data_files:
- split: train path: omnivoice-best-of-n-training/train-*
- config_name: omnivoice-de
data_files:
- split: train path: omnivoice-de/train-*
- config_name: omnivoice-es
data_files:
- split: train path: omnivoice-es/train-*
- config_name: omnivoice-fr
data_files:
- split: train path: omnivoice-fr/train-*
- config_name: omnivoice-it
data_files:
- split: train path: omnivoice-it/train-*
- config_name: omnivoice-ja
data_files:
- split: train path: omnivoice-ja/train-*
- config_name: omnivoice-ru
data_files:
- split: train path: omnivoice-ru/train-*
- config_name: omnivoice-test-de
data_files:
- split: train path: omnivoice-test-de/train-*
- config_name: omnivoice-test-es
data_files:
- split: train path: omnivoice-test-es/train-*
- config_name: omnivoice-test-fr
data_files:
- split: train path: omnivoice-test-fr/train-*
- config_name: omnivoice-test-it
data_files:
- split: train path: omnivoice-test-it/train-*
- config_name: omnivoice-test-ru
data_files:
- split: train path: omnivoice-test-ru/train-*
- config_name: omnivoice-test-th
data_files:
- split: train path: omnivoice-test-th/train-*
- config_name: omnivoice-test-tr
data_files:
- split: train path: omnivoice-test-tr/train-*
- config_name: omnivoice-test-zh
data_files:
- split: train path: omnivoice-test-zh/train-*
- config_name: omnivoice-th
data_files:
- split: train path: omnivoice-th/train-*
- config_name: omnivoice-tr
data_files:
- split: train path: omnivoice-tr/train-*
- config_name: omnivoice-zh
data_files:
- split: train path: omnivoice-zh/train-*
- config_name: one_voice_FACEBOOK_PARQUET
data_files:
- split: train path: one_voice_FACEBOOK_PARQUET/train-*
- config_name: open-large-bengali-asr-data
data_files:
- split: train path: open-large-bengali-asr-data/train-*
- config_name: opendata-iisys-hui
data_files:
- split: train path: opendata-iisys-hui/train-*
- config_name: openslr-140-hq-Kazakh
data_files:
- split: train path: openslr-140-hq-Kazakh/train-*
- config_name: openslr-32-hq-SA-languages
data_files:
- split: train path: openslr-32-hq-SA-languages/train-*
- config_name: openslr-32-hq-SA-languages-Afrikaans
data_files:
- split: train path: openslr-32-hq-SA-languages-Afrikaans/train-*
- config_name: openslr-32-hq-SA-languages-Sesotho
data_files:
- split: train path: openslr-32-hq-SA-languages-Sesotho/train-*
- config_name: openslr-32-hq-SA-languages-Sesotho__Max5ive
data_files:
- split: train path: openslr-32-hq-SA-languages-Sesotho__Max5ive/train-*
- config_name: openslr-32-hq-SA-languages-Setswana
data_files:
- split: train path: openslr-32-hq-SA-languages-Setswana/train-*
- config_name: openslr-32-hq-SA-languages-isiXhosa
data_files:
- split: train path: openslr-32-hq-SA-languages-isiXhosa/train-*
- config_name: openslr-slr67
data_files:
- split: train path: openslr-slr67/train-*
- config_name: openslr-slr69-ca-trimmed-denoised
data_files:
- split: train path: openslr-slr69-ca-trimmed-denoised/train-*
- config_name: openslr42-khmer-tts
data_files:
- split: train path: openslr42-khmer-tts/train-*
- config_name: openslr61-es-ar-full
data_files:
- split: train path: openslr61-es-ar-full/train-*
- config_name: openslr63
data_files:
- split: train path: openslr63/train-*
- config_name: openslr65-tamil
data_files:
- split: train path: openslr65-tamil/train-*
- config_name: openslr80-burmese
data_files:
- split: train path: openslr80-burmese/train-*
- config_name: opentts-kateryna
data_files:
- split: train path: opentts-kateryna/train-*
- config_name: opentts-lada
data_files:
- split: train path: opentts-lada/train-*
- config_name: opentts-oleksa
data_files:
- split: train path: opentts-oleksa/train-*
- config_name: opentts-tetiana
data_files:
- split: train path: opentts-tetiana/train-*
- config_name: or_in_dataset
data_files:
- split: train path: or_in_dataset/train-*
- config_name: original_data_malayalam_tts
data_files:
- split: train path: original_data_malayalam_tts/train-*
- config_name: output4Checked
data_files:
- split: train path: output4Checked/train-*
- config_name: ovb-huissen-1
data_files:
- split: train path: ovb-huissen-1/train-*
- config_name: pangloss
data_files:
- split: train path: pangloss/train-*
- config_name: parliament
data_files:
- split: train path: parliament/train-*
- config_name: parrot-radiology-asr-en
data_files:
- split: train path: parrot-radiology-asr-en/train-*
- config_name: persian-voice-v1
data_files:
- split: train path: persian-voice-v1/train-*
- config_name: persian-words
data_files:
- split: train path: persian-words/train-*
- config_name: persian_tss
data_files:
- split: train path: persian_tss/train-*
- config_name: phoaudiobook
data_files:
- split: train path: phoaudiobook/train-*
- config_name: phoneme-ctc-english-60h-balanced
data_files:
- split: train path: phoneme-ctc-english-60h-balanced/train-*
- config_name: phoneme_asr
data_files:
- split: train path: phoneme_asr/train-*
- config_name: phonetico-speech
data_files:
- split: train path: phonetico-speech/train-*
- config_name: podcasts_tashkent_dialect_youtube_uzbek_speech_dataset
data_files:
- split: train path: podcasts_tashkent_dialect_youtube_uzbek_speech_dataset/train-*
- config_name: podcasts_tashkent_dialect_youtube_uzbek_speech_dataset__BoburAmirov
data_files:
- split: train path: podcasts_tashkent_dialect_youtube_uzbek_speech_dataset__BoburAmirov/train-*
- config_name: podcasts_tashkent_dialect_youtube_uzbek_speech_dataset__azimislom
data_files:
- split: train path: podcasts_tashkent_dialect_youtube_uzbek_speech_dataset__azimislom/train-*
- config_name: pony-singing
data_files:
- split: train path: pony-singing/train-*
- config_name: pony-speech
data_files:
- split: train path: pony-speech/train-*
- config_name: pony-speech__Lindarychwalski
data_files:
- split: train path: pony-speech__Lindarychwalski/train-*
- config_name: preacher-tts-dataset
data_files:
- split: train path: preacher-tts-dataset/train-*
- config_name: primewords_chinese_corpus_set_1
data_files:
- split: train path: primewords_chinese_corpus_set_1/train-*
- config_name: process_dataset_mini
data_files:
- split: train path: process_dataset_mini/train-*
- config_name: processed-cv-17-th-130k
data_files:
- split: train path: processed-cv-17-th-130k/train-*
- config_name: processed-voice-th-169k
data_files:
- split: train path: processed-voice-th-169k/train-*
- config_name: prus
data_files:
- split: train path: prus/train-*
- config_name: punjabi-asr
data_files:
- split: train path: punjabi-asr/train-*
- config_name: pvariant-EQ
data_files:
- split: train path: pvariant-EQ/train-*
- config_name: pwr-azon-speech-dataset
data_files:
- split: train path: pwr-azon-speech-dataset/train-*
- config_name: qirimtatar-tts
data_files:
- split: train path: qirimtatar-tts/train-*
- config_name: quran-md-ayahs
data_files:
- split: train path: quran-md-ayahs/train-*
- config_name: raddromur_asr
data_files:
- split: train path: raddromur_asr/train-*
- config_name: radiotalk-voices-2k
data_files:
- split: train path: radiotalk-voices-2k/train-*
- config_name: raisa_baravikova_vasmiradkou_i_all
data_files:
- split: train path: raisa_baravikova_vasmiradkou_i_all/train-*
- config_name: raisa_baravikova_vasmiradkou_i_output_original
data_files:
- split: train path: raisa_baravikova_vasmiradkou_i_output_original/train-*
- config_name: raisa_baravikova_vershy_pra_kahanne_all
data_files:
- split: train path: raisa_baravikova_vershy_pra_kahanne_all/train-*
- config_name: raisa_baravikova_vershy_pra_kahanne_output_original
data_files:
- split: train path: raisa_baravikova_vershy_pra_kahanne_output_original/train-*
- config_name: ravnursson_asr
data_files:
- split: train path: ravnursson_asr/train-*
- config_name: real-world-noise-through-zoom
data_files:
- split: train path: real-world-noise-through-zoom/train-*
- config_name: rel_dataset
data_files:
- split: train path: rel_dataset/train-*
- config_name: reverb-asr-dataset-0.4
data_files:
- split: train path: reverb-asr-dataset-0.4/train-*
- config_name: reverb-asr-dataset-0.8
data_files:
- split: train path: reverb-asr-dataset-0.8/train-*
- config_name: reviewed_sample
data_files:
- split: train path: reviewed_sample/train-*
- config_name: rick-sanchez
data_files:
- split: train path: rick-sanchez/train-*
- config_name: romanian-speech-v2
data_files:
- split: train path: romanian-speech-v2/train-*
- config_name: romanian-tts-single-speaker
data_files:
- split: train path: romanian-tts-single-speaker/train-*
- config_name: room_sim_reverb_dataset
data_files:
- split: train path: room_sim_reverb_dataset/train-*
- config_name: ru_book_dataset
data_files:
- split: train path: ru_book_dataset/train-*
- config_name: ruslan_sova_ai
data_files:
- split: train path: ruslan_sova_ai/train-*
- config_name: russian-glados-portal2
data_files:
- split: train path: russian-glados-portal2/train-*
- config_name: russian_librispeech
data_files:
- split: train path: russian_librispeech/train-*
- config_name: rw-tts-dataset
data_files:
- split: train path: rw-tts-dataset/train-*
- config_name: sada-validation-preprocessed
data_files:
- split: train path: sada-validation-preprocessed/train-*
- config_name: sagalee
data_files:
- split: train path: sagalee/train-*
- config_name: sagalee-v2
data_files:
- split: train path: sagalee-v2/train-*
- config_name: salmon-asr-smj
data_files:
- split: train path: salmon-asr-smj/train-*
- config_name: sample-id
data_files:
- split: train path: sample-id/train-*
- config_name: samromur_children
data_files:
- split: train path: samromur_children/train-*
- config_name: sarawak-malay-asr
data_files:
- split: train path: sarawak-malay-asr/train-*
- config_name: sarvam-indian-tts-60min
data_files:
- split: train path: sarvam-indian-tts-60min/train-*
- config_name: sarvam-tts-dataset
data_files:
- split: train path: sarvam-tts-dataset/train-*
- config_name: sarvam-tts-dataset__Avishii0309
data_files:
- split: train path: sarvam-tts-dataset__Avishii0309/train-*
- config_name: sarvam-tts-in-te-en
data_files:
- split: train path: sarvam-tts-in-te-en/train-*
- config_name: sberdevices_golos_100h_farfield
data_files:
- split: train path: sberdevices_golos_100h_farfield/train-*
- config_name: sberdevices_golos_10h_crowd
data_files:
- split: train path: sberdevices_golos_10h_crowd/train-*
- config_name: seke-nepali-dataset
data_files:
- split: train path: seke-nepali-dataset/train-*
- config_name: seniortalk
data_files:
- split: train path: seniortalk/train-*
- config_name: serbian-speech-dataset
data_files:
- split: train path: serbian-speech-dataset/train-*
- config_name: shata_rustaveli_vitsyaz_u_tygravai_shkury_all
data_files:
- split: train path: shata_rustaveli_vitsyaz_u_tygravai_shkury_all/train-*
- config_name: shata_rustaveli_vitsyaz_u_tygravai_shkury_output_original
data_files:
- split: train path: shata_rustaveli_vitsyaz_u_tygravai_shkury_output_original/train-*
- config_name: shrutilipi_sanskrit
data_files:
- split: train path: shrutilipi_sanskrit/train-*
- config_name: simple-escwa
data_files:
- split: train path: simple-escwa/train-*
- config_name: simulated_rirs_dataset
data_files:
- split: train path: simulated_rirs_dataset/train-*
- config_name: singaporean_accent_district_names_continuation
data_files:
- split: train path: singaporean_accent_district_names_continuation/train-*
- config_name: singaporean_district_noise
data_files:
- split: train path: singaporean_district_noise/train-*
- config_name: singaporean_district_noise_snr_2_7
data_files:
- split: train path: singaporean_district_noise_snr_2_7/train-*
- config_name: singaporean_district_noise_snr_5_10
data_files:
- split: train path: singaporean_district_noise_snr_5_10/train-*
- config_name: singlish-speaker
data_files:
- split: train path: singlish-speaker/train-*
- config_name: sixuxar_yijiri_mak7
data_files:
- split: train path: sixuxar_yijiri_mak7/train-*
- config_name: slovak-speech-dataset
data_files:
- split: train path: slovak-speech-dataset/train-*
- config_name: slovenian-speech-dataset
data_files:
- split: train path: slovenian-speech-dataset/train-*
- config_name: slr43
data_files:
- split: train path: slr43/train-*
- config_name: slr72_dataset
data_files:
- split: train path: slr72_dataset/train-*
- config_name: slurp-ear-masked-eval
data_files:
- split: train path: slurp-ear-masked-eval/train-*
- config_name: sna-dataset-annotated
data_files:
- split: train path: sna-dataset-annotated/train-*
- config_name: sna-manasseh-150-raw
data_files:
- split: train path: sna-manasseh-150-raw/train-*
- config_name: snips_slu_v1.0
data_files:
- split: train path: snips_slu_v1.0/train-*
- config_name: snips_slu_v1.0__juanborbon
data_files:
- split: train path: snips_slu_v1.0__juanborbon/train-*
- config_name: somali-tts-datasets
data_files:
- split: train path: somali-tts-datasets/train-*
- config_name: soomali-asr-dataset
data_files:
- split: train path: soomali-asr-dataset/train-*
- config_name: southern-kurdish-asr
data_files:
- split: train path: southern-kurdish-asr/train-*
- config_name: sova_rudevices
data_files:
- split: train path: sova_rudevices/train-*
- config_name: spanish-argentino-cordobes-voseo-100
data_files:
- split: train path: spanish-argentino-cordobes-voseo-100/train-*
- config_name: spc_r
data_files:
- split: train path: spc_r/train-*
- config_name: spc_r_segmented
data_files:
- split: train path: spc_r_segmented/train-*
- config_name: spc_r_segmented__eko57
data_files:
- split: train path: spc_r_segmented__eko57/train-*
- config_name: speech-CMMLU
data_files:
- split: train path: speech-CMMLU/train-*
- config_name: speech-mendeley-pa
data_files:
- split: train path: speech-mendeley-pa/train-*
- config_name: speech-pa
data_files:
- split: train path: speech-pa/train-*
- config_name: speechaccentarchive-pr
data_files:
- split: train path: speechaccentarchive-pr/train-*
- config_name: speechocean-l2eval
data_files:
- split: train path: speechocean-l2eval/train-*
- config_name: speechocean762
data_files:
- split: train path: speechocean762/train-*
- config_name: ss400
data_files:
- split: train path: ss400/train-*
- config_name: steak-test
data_files:
- split: train path: steak-test/train-*
- config_name: stefan_tsvei_g_nyabachnaya_kalektsyya_all
data_files:
- split: train path: stefan_tsvei_g_nyabachnaya_kalektsyya_all/train-*
- config_name: stefan_tsvei_g_nyabachnaya_kalektsyya_output_original
data_files:
- split: train path: stefan_tsvei_g_nyabachnaya_kalektsyya_output_original/train-*
- config_name: steinsgate-voice
data_files:
- split: train path: steinsgate-voice/train-*
- config_name: stock_market_asx_audio
data_files:
- split: train path: stock_market_asx_audio/train-*
- config_name: stt-AfricanAcc-test-fr
data_files:
- split: train path: stt-AfricanAcc-test-fr/train-*
- config_name: stt-atthack-test
data_files:
- split: train path: stt-atthack-test/train-*
- config_name: stt-cefc-fr-test
data_files:
- split: train path: stt-cefc-fr-test/train-*
- config_name: stt-covost25-test-fr
data_files:
- split: train path: stt-covost25-test-fr/train-*
- config_name: stt-fleurs-test
data_files:
- split: train path: stt-fleurs-test/train-*
- config_name: stt-librispeech-test-en
data_files:
- split: train path: stt-librispeech-test-en/train-*
- config_name: stt-mediaspeech-test
data_files:
- split: train path: stt-mediaspeech-test/train-*
- config_name: stt-mini-bench
data_files:
- split: train path: stt-mini-bench/train-*
- config_name: stt-mls-test
data_files:
- split: train path: stt-mls-test/train-*
- config_name: stt-mls-test-fr
data_files:
- split: train path: stt-mls-test-fr/train-*
- config_name: stt-summre-fr-test
data_files:
- split: train path: stt-summre-fr-test/train-*
- config_name: stt-tedx-test-fr
data_files:
- split: train path: stt-tedx-test-fr/train-*
- config_name: stt-vibravox-fr-test
data_files:
- split: train path: stt-vibravox-fr-test/train-*
- config_name: stt-voxpopuli-test-en
data_files:
- split: train path: stt-voxpopuli-test-en/train-*
- config_name: stt-voxpopuli-test-fr
data_files:
- split: train path: stt-voxpopuli-test-fr/train-*
- config_name: stuttering_asr
data_files:
- split: train path: stuttering_asr/train-*
- config_name: sub-reverb-asr-dataset-0.4
data_files:
- split: train path: sub-reverb-asr-dataset-0.4/train-*
- config_name: sudanese_dialect_speech
data_files:
- split: train path: sudanese_dialect_speech/train-*
- config_name: supreme-court-speech
data_files:
- split: train path: supreme-court-speech/train-*
- config_name: sv-SE-asr-cv
data_files:
- split: train path: sv-SE-asr-cv/train-*
- config_name: svq
data_files:
- split: train path: svq/train-*
- config_name: swahili-speech-400hr
data_files:
- split: train path: swahili-speech-400hr/train-*
- config_name: swahili-words-speech-text-parallel
data_files:
- split: train path: swahili-words-speech-text-parallel/train-*
- config_name: swahili_asr_data
data_files:
- split: train path: swahili_asr_data/train-*
- config_name: swiss-german-city-sentences_v2
data_files:
- split: train path: swiss-german-city-sentences_v2/train-*
- config_name: switchboard
data_files:
- split: train path: switchboard/train-*
- config_name: synthetic-parallel-external
data_files:
- split: train path: synthetic-parallel-external/train-*
- config_name: synthetic-parallel-salt
data_files:
- split: train path: synthetic-parallel-salt/train-*
- config_name: synthetic_audio_paired_preferences
data_files:
- split: train path: synthetic_audio_paired_preferences/train-*
- config_name: synthetic_dem
data_files:
- split: train path: synthetic_dem/train-*
- config_name: synthetic_transcript_nl
data_files:
- split: train path: synthetic_transcript_nl/train-*
- config_name: synthetic_transcript_pt
data_files:
- split: train path: synthetic_transcript_pt/train-*
- config_name: syspin-telugu-tts
data_files:
- split: train path: syspin-telugu-tts/train-*
- config_name: tachelhiyt-darija
data_files:
- split: train path: tachelhiyt-darija/train-*
- config_name: tadabur
data_files:
- split: train path: tadabur/train-*
- config_name: tajik-asr-augmented-test
data_files:
- split: train path: tajik-asr-augmented-test/train-*
- config_name: tajik-speech-dataset
data_files:
- split: train path: tajik-speech-dataset/train-*
- config_name: talkbank_4_stt
data_files:
- split: train path: talkbank_4_stt/train-*
- config_name: talromur3_with_prompts
data_files:
- split: train path: talromur3_with_prompts/train-*
- config_name: talromur3_without_emotions
data_files:
- split: train path: talromur3_without_emotions/train-*
- config_name: tamazight_asr
data_files:
- split: train path: tamazight_asr/train-*
- config_name: tamil-combined
data_files:
- split: train path: tamil-combined/train-*
- config_name: tamil-speech-dataset
data_files:
- split: train path: tamil-speech-dataset/train-*
- config_name: taper-reverb-asr-dataset-0.5
data_files:
- split: train path: taper-reverb-asr-dataset-0.5/train-*
- config_name: taras_shau_chenka_vershy_paemy_all
data_files:
- split: train path: taras_shau_chenka_vershy_paemy_all/train-*
- config_name: taras_shau_chenka_vershy_paemy_output_original
data_files:
- split: train path: taras_shau_chenka_vershy_paemy_output_original/train-*
- config_name: tarteel-ai-everyayah-Quran
data_files:
- split: train path: tarteel-ai-everyayah-Quran/train-*
- config_name: tat_hackathon_asr
data_files:
- split: train path: tat_hackathon_asr/train-*
- config_name: ted_talks_en_mn
data_files:
- split: train path: ted_talks_en_mn/train-*
- config_name: ted_talks_en_mn_split
data_files:
- split: train path: ted_talks_en_mn_split/train-*
- config_name: tedx_spanish
data_files:
- split: train path: tedx_spanish/train-*
- config_name: tele_con_ciencia
data_files:
- split: train path: tele_con_ciencia/train-*
- config_name: telugu-asr
data_files:
- split: train path: telugu-asr/train-*
- config_name: telugu_OpenSLR
data_files:
- split: train path: telugu_OpenSLR/train-*
- config_name: telugu_tts
data_files:
- split: train path: telugu_tts/train-*
- config_name: telugu_whisper_asr
data_files:
- split: train path: telugu_whisper_asr/train-*
- config_name: test
data_files:
- split: train path: test/train-*
- config_name: test-audio
data_files:
- split: train path: test-audio/train-*
- config_name: test-datasets
data_files:
- split: train path: test-datasets/train-*
- config_name: test1
data_files:
- split: train path: test1/train-*
- config_name: test3434234
data_files:
- split: train path: test3434234/train-*
- config_name: testgloss
data_files:
- split: train path: testgloss/train-*
- config_name: testgloss2
data_files:
- split: train path: testgloss2/train-*
- config_name: testgloss3
data_files:
- split: train path: testgloss3/train-*
- config_name: testgloss4
data_files:
- split: train path: testgloss4/train-*
- config_name: testgloss5
data_files:
- split: train path: testgloss5/train-*
- config_name: tev_vox_data
data_files:
- split: train path: tev_vox_data/train-*
- config_name: text_to_speech_dataset
data_files:
- split: train path: text_to_speech_dataset/train-*
- config_name: thai-audio-full-trainval
data_files:
- split: train path: thai-audio-full-trainval/train-*
- config_name: thai-tts-dataset
data_files:
- split: train path: thai-tts-dataset/train-*
- config_name: thchs30
data_files:
- split: train path: thchs30/train-*
- config_name: thchs30-segment
data_files:
- split: train path: thchs30-segment/train-*
- config_name: the-mc-speech-dataset
data_files:
- split: train path: the-mc-speech-dataset/train-*
- config_name: thiomi-5k
data_files:
- split: train path: thiomi-5k/train-*
- config_name: tibetan-audio-english-6datasets-sample
data_files:
- split: train path: tibetan-audio-english-6datasets-sample/train-*
- config_name: tibetan-audio-english-6datasets-sample2
data_files:
- split: train path: tibetan-audio-english-6datasets-sample2/train-*
- config_name: tibetan-audio-to-english-fixed-filtered
data_files:
- split: train path: tibetan-audio-to-english-fixed-filtered/train-*
- config_name: tibetan-speech-english-text-dataset
data_files:
- split: train path: tibetan-speech-english-text-dataset/train-*
- config_name: tibetan-to-english-audio-dataset
data_files:
- split: train path: tibetan-to-english-audio-dataset/train-*
- config_name: tibetan_voice
data_files:
- split: train path: tibetan_voice/train-*
- config_name: tibetan_wz_tts
data_files:
- split: train path: tibetan_wz_tts/train-*
- config_name: tl-whisper
data_files:
- split: train path: tl-whisper/train-*
- config_name: tobydata-tts-dataset
data_files:
- split: train path: tobydata-tts-dataset/train-*
- config_name: toronto-tv-ukrainian
data_files:
- split: train path: toronto-tv-ukrainian/train-*
- config_name: toy_corpus_asr_ca
data_files:
- split: train path: toy_corpus_asr_ca/train-*
- config_name: toy_corpus_asr_es
data_files:
- split: train path: toy_corpus_asr_es/train-*
- config_name: transcription-scorer
data_files:
- split: train path: transcription-scorer/train-*
- config_name: tretret34543
data_files:
- split: train path: tretret34543/train-*
- config_name: tts-100-v1
data_files:
- split: train path: tts-100-v1/train-*
- config_name: tts-crh-abibullah
data_files:
- split: train path: tts-crh-abibullah/train-*
- config_name: tts-crh-arslan
data_files:
- split: train path: tts-crh-arslan/train-*
- config_name: tts-crh-sevil
data_files:
- split: train path: tts-crh-sevil/train-*
- config_name: tts-crh-sevil-fixed
data_files:
- split: train path: tts-crh-sevil-fixed/train-*
- config_name: tts-datacreation
data_files:
- split: train path: tts-datacreation/train-*
- config_name: tts-egyption-dataset
data_files:
- split: train path: tts-egyption-dataset/train-*
- config_name: tts-hindi-stts2
data_files:
- split: train path: tts-hindi-stts2/train-*
- config_name: tts-indian-dataset
data_files:
- split: train path: tts-indian-dataset/train-*
- config_name: tts-indian-dataset__BharathGaddam
data_files:
- split: train path: tts-indian-dataset__BharathGaddam/train-*
- config_name: tts-indian-languages
data_files:
- split: train path: tts-indian-languages/train-*
- config_name: tts-indo
data_files:
- split: train path: tts-indo/train-*
- config_name: tts-pretrain-refs-3k-mos
data_files:
- split: train path: tts-pretrain-refs-3k-mos/train-*
- config_name: tts-rj-hi-karya
data_files:
- split: train path: tts-rj-hi-karya/train-*
- config_name: tts-zh-clone-bench-4model
data_files:
- split: train path: tts-zh-clone-bench-4model/train-*
- config_name: tts-zh-zonos2-expressive
data_files:
- split: train path: tts-zh-zonos2-expressive/train-*
- config_name: tts_ahmet_deniz_tur
data_files:
- split: train path: tts_ahmet_deniz_tur/train-*
- config_name: turkana-speech-dataset
data_files:
- split: train path: turkana-speech-dataset/train-*
- config_name: turkic_tts_dataset
data_files:
- split: train path: turkic_tts_dataset/train-*
- config_name: turkish-parliament-speech
data_files:
- split: train path: turkish-parliament-speech/train-*
- config_name: turkish-tts-combined-raw
data_files:
- split: train path: turkish-tts-combined-raw/train-*
- config_name: turkish-tts-combined-raw__Taklaxbr
data_files:
- split: train path: turkish-tts-combined-raw__Taklaxbr/train-*
- config_name: turkish-tts-combined-raw__mshasir
data_files:
- split: train path: turkish-tts-combined-raw__mshasir/train-*
- config_name: turkish_female
data_files:
- split: train path: turkish_female/train-*
- config_name: turkish_male
data_files:
- split: train path: turkish_male/train-*
- config_name: turkishvoicedataset
data_files:
- split: train path: turkishvoicedataset/train-*
- config_name: turkmen-speech
data_files:
- split: train path: turkmen-speech/train-*
- config_name: tusom2021-pr
data_files:
- split: train path: tusom2021-pr/train-*
- config_name: twi-agriculture-speech
data_files:
- split: train path: twi-agriculture-speech/train-*
- config_name: twi-health-asr
data_files:
- split: train path: twi-health-asr/train-*
- config_name: twi-trigrams-speech-text-parallel
data_files:
- split: train path: twi-trigrams-speech-text-parallel/train-*
- config_name: twi-trigrams-speech-text-parallel__ghananlpcommunity
data_files:
- split: train path: twi-trigrams-speech-text-parallel__ghananlpcommunity/train-*
- config_name: twi-words-speech-text-parallel-400k
data_files:
- split: train path: twi-words-speech-text-parallel-400k/train-*
- config_name: twi_bible_v2_tts
data_files:
- split: train path: twi_bible_v2_tts/train-*
- config_name: twi_dataset
data_files:
- split: train path: twi_dataset/train-*
- config_name: twi_multispeaker_audio_transcribed
data_files:
- split: train path: twi_multispeaker_audio_transcribed/train-*
- config_name: ucla_dataset
data_files:
- split: train path: ucla_dataset/train-*
- config_name: uilyam_folkner_pah_verbeny_all
data_files:
- split: train path: uilyam_folkner_pah_verbeny_all/train-*
- config_name: uilyam_folkner_pah_verbeny_output_original
data_files:
- split: train path: uilyam_folkner_pah_verbeny_output_original/train-*
- config_name: ukr-dialects-audio-dataset
data_files:
- split: train path: ukr-dialects-audio-dataset/train-*
- config_name: ukrainian-speech-dataset
data_files:
- split: train path: ukrainian-speech-dataset/train-*
- config_name: ukrainian-tts-audiobook-pani-nina-parquet
data_files:
- split: train path: ukrainian-tts-audiobook-pani-nina-parquet/train-*
- config_name: ukrainian-tts-audiobook-pani-nina-parquet-old
data_files:
- split: train path: ukrainian-tts-audiobook-pani-nina-parquet-old/train-*
- config_name: uladzimir-karatkevich-dzikae-paliavanne-karalia-stakha-aleg-garbuz-output
data_files:
- split: train path: uladzimir-karatkevich-dzikae-paliavanne-karalia-stakha-aleg-garbuz-output/train-*
- config_name: uladzimir-karatkevich-dzikae-paliavanne-karalia-stakha-aleg-garbuz-output_original
data_files:
- split: train path: uladzimir-karatkevich-dzikae-paliavanne-karalia-stakha-aleg-garbuz-output_original/train-*
- config_name: uladzimir-karatkevich-dzikae-paliavanne-karalia-stakha-aleg-garbuz_all
data_files:
- split: train path: uladzimir-karatkevich-dzikae-paliavanne-karalia-stakha-aleg-garbuz_all/train-*
- config_name: ulca_ml
data_files:
- split: train path: ulca_ml/train-*
- config_name: urdu-tts
data_files:
- split: train path: urdu-tts/train-*
- config_name: urdu-tts-16000Hz
data_files:
- split: train path: urdu-tts-16000Hz/train-*
- config_name: urdu-tts-corpus
data_files:
- split: train path: urdu-tts-corpus/train-*
- config_name: urdu-tts-fast
data_files:
- split: train path: urdu-tts-fast/train-*
- config_name: urdu-tts-mini
data_files:
- split: train path: urdu-tts-mini/train-*
- config_name: urdu-tts-speaker3
data_files:
- split: train path: urdu-tts-speaker3/train-*
- config_name: urdu-voice-dataset
data_files:
- split: train path: urdu-voice-dataset/train-*
- config_name: urdu_asr_data
data_files:
- split: train path: urdu_asr_data/train-*
- config_name: uwb_atcc
data_files:
- split: train path: uwb_atcc/train-*
- config_name: uzbek-speech-corpus
data_files:
- split: train path: uzbek-speech-corpus/train-*
- config_name: uzbekvoice
data_files:
- split: train path: uzbekvoice/train-*
- config_name: uzbekvoice-2k-each-accent
data_files:
- split: train path: uzbekvoice-2k-each-accent/train-*
- config_name: uzbekvoice-filtered
data_files:
- split: train path: uzbekvoice-filtered/train-*
- config_name: uzbekvoice-filtered2
data_files:
- split: train path: uzbekvoice-filtered2/train-*
- config_name: uzbekvoice-filtered__ai4uz
data_files:
- split: train path: uzbekvoice-filtered__ai4uz/train-*
- config_name: vagla-speech-text-parallel
data_files:
- split: train path: vagla-speech-text-parallel/train-*
- config_name: vai-speech-text-parallel
data_files:
- split: train path: vai-speech-text-parallel/train-*
- config_name: vais1000
data_files:
- split: train path: vais1000/train-*
- config_name: vasil_bykau_all
data_files:
- split: train path: vasil_bykau_all/train-*
- config_name: vasil_bykau_output_original
data_files:
- split: train path: vasil_bykau_output_original/train-*
- config_name: vasil_zue_nok_syaliba_all
data_files:
- split: train path: vasil_zue_nok_syaliba_all/train-*
- config_name: vasil_zue_nok_syaliba_output_original
data_files:
- split: train path: vasil_zue_nok_syaliba_output_original/train-*
- config_name: vctk
data_files:
- split: train path: vctk/train-*
- config_name: viVoice
data_files:
- split: train path: viVoice/train-*
- config_name: vibravox_16k
data_files:
- split: train path: vibravox_16k/train-*
- config_name: vibravox_enhanced_by_EBEN
data_files:
- split: train path: vibravox_enhanced_by_EBEN/train-*
- config_name: viet_bud500
data_files:
- split: train path: viet_bud500/train-*
- config_name: viktar_prau_dzin_all
data_files:
- split: train path: viktar_prau_dzin_all/train-*
- config_name: viktar_prau_dzin_output_original
data_files:
- split: train path: viktar_prau_dzin_output_original/train-*
- config_name: visualears-benchmark-269-gold
data_files:
- split: train path: visualears-benchmark-269-gold/train-*
- config_name: visualears-golden-6669
data_files:
- split: train path: visualears-golden-6669/train-*
- config_name: vividh-test-hindi
data_files:
- split: train path: vividh-test-hindi/train-*
- config_name: vividh-test-malayalam
data_files:
- split: train path: vividh-test-malayalam/train-*
- config_name: vivos-vie-speech2text
data_files:
- split: train path: vivos-vie-speech2text/train-*
- config_name: vlm-voice-audio
data_files:
- split: train path: vlm-voice-audio/train-*
- config_name: vlsp-vie-speech2text1
data_files:
- split: train path: vlsp-vie-speech2text1/train-*
- config_name: vlsp2020_vinai_100h
data_files:
- split: train path: vlsp2020_vinai_100h/train-*
- config_name: vn_tts_medium_clean
data_files:
- split: train path: vn_tts_medium_clean/train-*
- config_name: voa
data_files:
- split: train path: voa/train-*
- config_name: voice-dataset-lili
data_files:
- split: train path: voice-dataset-lili/train-*
- config_name: voice-design-bench-50-dnsmos
data_files:
- split: train path: voice-design-bench-50-dnsmos/train-*
- config_name: voice-of-america
data_files:
- split: train path: voice-of-america/train-*
- config_name: voice_medical
data_files:
- split: train path: voice_medical/train-*
- config_name: voices_jp
data_files:
- split: train path: voices_jp/train-*
- config_name: voxangeles-pr
data_files:
- split: train path: voxangeles-pr/train-*
- config_name: voxbox
data_files:
- split: train path: voxbox/train-*
- config_name: voxcpm-nepali-data
data_files:
- split: train path: voxcpm-nepali-data/train-*
- config_name: voxforge_spanish
data_files:
- split: train path: voxforge_spanish/train-*
- config_name: voxpopuli
data_files:
- split: train path: voxpopuli/train-*
- config_name: voxpopuli__Prabh139
data_files:
- split: train path: voxpopuli__Prabh139/train-*
- config_name: voxpopuli_hu_dac_pairs
data_files:
- split: train path: voxpopuli_hu_dac_pairs/train-*
- config_name: wavenet_flashback
data_files:
- split: train path: wavenet_flashback/train-*
- config_name: waxal-lug-clean
data_files:
- split: train path: waxal-lug-clean/train-*
- config_name: waxal-orm-tts-merged
data_files:
- split: train path: waxal-orm-tts-merged/train-*
- config_name: waxal-tts
data_files:
- split: train path: waxal-tts/train-*
- config_name: wayuu_CO_test
data_files:
- split: train path: wayuu_CO_test/train-*
- config_name: welsh-speech-dataset
data_files:
- split: train path: welsh-speech-dataset/train-*
- config_name: whisper-large-training
data_files:
- split: train path: whisper-large-training/train-*
- config_name: wikipedia_spanish
data_files:
- split: train path: wikipedia_spanish/train-*
- config_name: wjbmattingly_xhosa_merged_audio
data_files:
- split: train path: wjbmattingly_xhosa_merged_audio/train-*
- config_name: wolof-audio-data
data_files:
- split: train path: wolof-audio-data/train-*
- config_name: wolof-audio-data__vonewman
data_files:
- split: train path: wolof-audio-data__vonewman/train-*
- config_name: wolof-french-asr
data_files:
- split: train path: wolof-french-asr/train-*
- config_name: wolof_speech_transcription
data_files:
- split: train path: wolof_speech_transcription/train-*
- config_name: wolof_tts
data_files:
- split: train path: wolof_tts/train-*
- config_name: wpp_pav_transcrito_deepgram
data_files:
- split: train path: wpp_pav_transcrito_deepgram/train-*
- config_name: wpp_pav_transcrito_gemini
data_files:
- split: train path: wpp_pav_transcrito_gemini/train-*
- config_name: wpp_pav_transcrito_openai
data_files:
- split: train path: wpp_pav_transcrito_openai/train-*
- config_name: wuwa-voice-EN
data_files:
- split: train path: wuwa-voice-EN/train-*
- config_name: xhosa_merged_audio
data_files:
- split: train path: xhosa_merged_audio/train-*
- config_name: xhosa_merged_audio__wjbmattingly
data_files:
- split: train path: xhosa_merged_audio__wjbmattingly/train-*
- config_name: yakub_kolas_novaya_zyamlya_all
data_files:
- split: train path: yakub_kolas_novaya_zyamlya_all/train-*
- config_name: yakub_kolas_novaya_zyamlya_output_original
data_files:
- split: train path: yakub_kolas_novaya_zyamlya_output_original/train-*
- config_name: yanka_bryl_ptushki_i_gne_zdy_all
data_files:
- split: train path: yanka_bryl_ptushki_i_gne_zdy_all/train-*
- config_name: yanka_bryl_ptushki_i_gne_zdy_output_original
data_files:
- split: train path: yanka_bryl_ptushki_i_gne_zdy_output_original/train-*
- config_name: yanka_sipakou_odzium_all
data_files:
- split: train path: yanka_sipakou_odzium_all/train-*
- config_name: yanka_sipakou_odzium_output_original
data_files:
- split: train path: yanka_sipakou_odzium_output_original/train-*
- config_name: yannick-kilcher-transcript-audio
data_files:
- split: train path: yannick-kilcher-transcript-audio/train-*
- config_name: yodas-ja000
data_files:
- split: train path: yodas-ja000/train-*
- config_name: yodas2
data_files:
- split: train path: yodas2/train-*
- config_name: yoruba-speech-text-parallel
data_files:
- split: train path: yoruba-speech-text-parallel/train-*
- config_name: youtube-farsi
data_files:
- split: train path: youtube-farsi/train-*
- config_name: youtube_tt
data_files:
- split: train path: youtube_tt/train-*
- config_name: yt-danish-public-v2
data_files:
- split: train path: yt-danish-public-v2/train-*
- config_name: yue_emo_speech
data_files:
- split: train path: yue_emo_speech/train-*
- config_name: zeroth-STT-Ko
data_files:
- split: train path: zeroth-STT-Ko/train-*
- config_name: zeroth_korean
data_files:
- split: train path: zeroth_korean/train-*
- config_name: zeroth_korean_ipa
data_files:
- split: train path: zeroth_korean_ipa/train-*
- config_name: zh-taiwan
data_files:
- split: train path: zh-taiwan/train-*
- config_name: zh-yue-tts-dataset
data_files:
- split: train path: zh-yue-tts-dataset/train-*
- config_name: zoengjyutgaai
data_files:
- split: train path: zoengjyutgaai/train-* dataset_info:
- config_name: 700h-tr-turkish-text-to-speech
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 612623 num_examples: 2000 download_size: 220626 dataset_size: 612623
- config_name: 9jalingo-hausa
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 12392359 num_examples: 88979 download_size: 2289000 dataset_size: 12392359
- config_name: 9jalingo-igbo
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 9524267 num_examples: 47452 download_size: 2817519 dataset_size: 9524267
- config_name: 9jalingo-pidgin
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 10149156 num_examples: 52369 download_size: 2885072 dataset_size: 10149156
- config_name: 9jalingo-yoruba
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 9283541 num_examples: 44834 download_size: 2723529 dataset_size: 9283541
- config_name: AISHELL-1-processed
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 4788328 num_examples: 34671 download_size: 1536711 dataset_size: 4788328
- config_name: AISHELL3
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 7738748 num_examples: 63262 download_size: 2516398 dataset_size: 7738748
- config_name: AItuber-Persona-Voices-JA
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 4370094 num_examples: 20402 download_size: 862192 dataset_size: 4370094
- config_name: ALFFA-Swahili-News
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 1952900 num_examples: 12171 download_size: 505062 dataset_size: 1952900
- config_name: ASCEND
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 1102820 num_examples: 11028 download_size: 430357 dataset_size: 1102820
- config_name: ASCEND-phoneme
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 1367492 num_examples: 11028 download_size: 430759 dataset_size: 1367492
- config_name: ASR-Benchmarking-Dataset
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 34541 num_examples: 100 download_size: 15187 dataset_size: 34541
- config_name: ASR-Tamil-cleaned
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 81852700 num_examples: 278234 download_size: 23296758 dataset_size: 81852700
- config_name: ASR_TEDx_Tunisie
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 3269364 num_examples: 16284 download_size: 1145627 dataset_size: 3269364
- config_name: ASR_f5
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 4708770 num_examples: 36269 download_size: 1416678 dataset_size: 4708770
- config_name: ASR_pulaar
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 2537693 num_examples: 13218 download_size: 989340 dataset_size: 2537693
- config_name: ATCO2-ASR-1h
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 101440 num_examples: 560 download_size: 33162 dataset_size: 101440
- config_name: ATC_combined
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 2957325 num_examples: 21709 download_size: 648551 dataset_size: 2957325
- config_name: ATC_combined__Tabys
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 3413214 num_examples: 21709 download_size: 641226 dataset_size: 3413214
- config_name: Ace-Taffy-voice
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 210110 num_examples: 1781 download_size: 62978 dataset_size: 210110
- config_name: Adaption-low-resource-audio
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 532138 num_examples: 3704 download_size: 122222 dataset_size: 532138
- config_name: Adaption-multilingual-speech
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 2543845 num_examples: 10274 download_size: 1112386 dataset_size: 2543845
- config_name: Alexis
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 412639 num_examples: 2528 download_size: 164121 dataset_size: 412639
- config_name: AniSpeech
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 3674069 num_examples: 23528 download_size: 1178381 dataset_size: 3674069
- config_name: AnimeSpeech
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 3835242 num_examples: 23651 download_size: 1228235 dataset_size: 3835242
- config_name: AnimeVox
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 1534516 num_examples: 11020 download_size: 442452 dataset_size: 1534516
- config_name: Antuan_de_Sent-Ekziupiery_Planieta_ludziei_all
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 865905 num_examples: 2808 download_size: 241581 dataset_size: 865905
- config_name: Antuan_de_Sent-Ekziupiery_Planieta_ludziei_output_original
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 906591 num_examples: 2689 download_size: 229948 dataset_size: 906591
- config_name: ArVoice
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 9673197 num_examples: 23111 download_size: 590588 dataset_size: 9673197
- config_name: Arabic-Diacritized-TTS
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 4034696 num_examples: 8497 download_size: 1279209 dataset_size: 4034696
- config_name: Arabic-Speech-TN
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 2226834 num_examples: 10334 download_size: 774868 dataset_size: 2226834
- config_name: Arabic-professional-voice
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 169644 num_examples: 439 download_size: 65498 dataset_size: 169644
- config_name: Arabic_Diacritized_Audio_Dataset
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 996529 num_examples: 3201 download_size: 248692 dataset_size: 996529
- config_name: Armenian-speech-corpus
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 6878734 num_examples: 35595 download_size: 1655465 dataset_size: 6878734
- config_name: Asian-High-Fidelity-ASR-Dataset
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 383463 num_examples: 233 download_size: 129693 dataset_size: 383463
- config_name: Audio-text
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 50110 num_examples: 500 download_size: 16122 dataset_size: 50110
- config_name: Azerbaijani_News_TTS
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 9219615 num_examples: 29309 download_size: 3679945 dataset_size: 9219615
- config_name: Azure-TTS-Synthetic
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 151438 num_examples: 1220 download_size: 19716 dataset_size: 151438
- config_name: Azure-TTS-annotated
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 49133871 num_examples: 211759 download_size: 15879766 dataset_size: 49133871
- config_name: BA_Datensatz_V2
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 1312358 num_examples: 5924 download_size: 521327 dataset_size: 1312358
- config_name: Bahnar_Vietnamese
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 55180475 num_examples: 114045 download_size: 21740213 dataset_size: 55180475
- config_name: Bam_ASR_Eval_500
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 71014 num_examples: 500 download_size: 26656 dataset_size: 71014
- config_name: Bambara_AudioSynthetique_42K_V3
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 8002574 num_examples: 38943 download_size: 2044688 dataset_size: 8002574
- config_name: Bangali_local_dialect_ASR_HF_Dataset
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 19230295 num_examples: 41499 download_size: 5437568 dataset_size: 19230295
- config_name: Bangor-Miami-Spanish-English-Corpus
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 1500511 num_examples: 56 download_size: 813064 dataset_size: 1500511
- config_name: Ben-Tucker
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 489080 num_examples: 2144 download_size: 256077 dataset_size: 489080
- config_name: BiasInEar
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 756038 num_examples: 2400 download_size: 76618 dataset_size: 756038
- config_name: BibleMMS_vie
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 470070 num_examples: 2000 download_size: 201913 dataset_size: 470070
- config_name: BitesizeIrish-GA-EN
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 716681 num_examples: 6141 download_size: 161328 dataset_size: 716681
- config_name: Bolbosh
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 7494135 num_examples: 30740 download_size: 3032333 dataset_size: 7494135
- config_name: C3T
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 8824502 num_examples: 7954 download_size: 139838 dataset_size: 8824502
- config_name: CAESAR-TINY
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 130719 num_examples: 667 download_size: 38594 dataset_size: 130719
- config_name: CAESAR-TV3
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 524554 num_examples: 2960 download_size: 252769 dataset_size: 524554
- config_name: CAMEO
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 4866623 num_examples: 40903 download_size: 679316 dataset_size: 4866623
- config_name: CAMEO__yiyandeng
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 5609770 num_examples: 40903 download_size: 737234 dataset_size: 5609770
- config_name: CORAA-v1.1
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 48666334 num_examples: 380772 download_size: 13993121 dataset_size: 48666334
- config_name: CRPO
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 11617159 num_examples: 100000 download_size: 2703600 dataset_size: 11617159
- config_name: CRPO__declare-lab
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 15462471 num_examples: 99646 download_size: 2947482 dataset_size: 15462471
- config_name: CSEMOTIONS
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 723231 num_examples: 4160 download_size: 123839 dataset_size: 723231
- config_name: CSEMOTIONS__sdcsdccdsd
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 872991 num_examples: 4160 download_size: 136184 dataset_size: 872991
- config_name: Changsha_Dialect_Conversational_Speech_Corpus
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 423671 num_examples: 1487 download_size: 88258 dataset_size: 423671
- config_name: ChildMandarin
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 4765039 num_examples: 40637 download_size: 1210091 dataset_size: 4765039
- config_name: ClArTTS
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 2159958 num_examples: 9705 download_size: 735422 dataset_size: 2159958
- config_name: ClarinStudioPL
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 3637529 num_examples: 13813 download_size: 1721962 dataset_size: 3637529
- config_name: CoSHE-500
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 313975 num_examples: 500 download_size: 150258 dataset_size: 313975
- config_name: CoVoST2-EN-AR
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 799908 num_examples: 5736 download_size: 216633 dataset_size: 799908
- config_name: Common-Voice-Geo-Cleaned
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 7183534 num_examples: 21421 download_size: 1981261 dataset_size: 7183534
- config_name: Common-Voice-Geo-Cleaned__CH0BRK
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 7697638 num_examples: 21421 download_size: 1979023 dataset_size: 7697638
- config_name: CommonPhoneDataset
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 23857271 num_examples: 76307 download_size: 5951725 dataset_size: 23857271
- config_name: CommonVoice22_Sidon
features:
- name: audio_filename dtype: string
- name: speaker dtype: string
- name: text dtype: string splits:
- name: train num_bytes: 358269016 num_examples: 2156190 download_size: 171415639 dataset_size: 358269016
- config_name: Corinth_dataset
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 72374 num_examples: 423 download_size: 27045 dataset_size: 72374
- config_name: Creativeguy-persian-asr
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 13088123 num_examples: 18808 download_size: 5787086 dataset_size: 13088123
- config_name: Czech-Speech-Monospeaker-Honza
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 800626 num_examples: 2548 download_size: 285570 dataset_size: 800626
- config_name: DASS2019_NLP
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 22589980 num_examples: 47593 download_size: 9206875 dataset_size: 22589980
- config_name: DATASET-darija
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 361428 num_examples: 633 download_size: 147248 dataset_size: 361428
- config_name: DATASET-darija-ASR-clean
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 125987 num_examples: 192 download_size: 53665 dataset_size: 125987
- config_name: Dahee7
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 1731620 num_examples: 12890 download_size: 589188 dataset_size: 1731620
- config_name: DarijaTTS-clean
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 3871695 num_examples: 21023 download_size: 1152559 dataset_size: 3871695
- config_name: Dastum-yar-stt-breton-data
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 1261067 num_examples: 7816 download_size: 232791 dataset_size: 1261067
- config_name: Debatts-Data
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 3503 num_examples: 8 download_size: 5299 dataset_size: 3503
- config_name: Debatts-Data__Qq111-hf
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 3743 num_examples: 8 download_size: 5406 dataset_size: 3743
- config_name: Dhravani
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 1531 num_examples: 13 download_size: 2483 dataset_size: 1531
- config_name: DialectalSpeech-ICL
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 52520 num_examples: 294 download_size: 19173 dataset_size: 52520
- config_name: DisfluencySpeech
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 1082104 num_examples: 5000 download_size: 411178 dataset_size: 1082104
- config_name: DuBLaB-en-fr-0.7
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 1657753 num_examples: 10946 download_size: 507009 dataset_size: 1657753
- config_name: DuBLaB-en-fr-0.7-f-0.2
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 1805862 num_examples: 10590 download_size: 504185 dataset_size: 1805862
- config_name: DuBLaB-en-fr-0.7-f-0.5
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 1742602 num_examples: 10167 download_size: 489167 dataset_size: 1742602
- config_name: DuBLaB-en-fr-0.8
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 921963 num_examples: 5986 download_size: 289014 dataset_size: 921963
- config_name: EA-UD-DI
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 112559228 num_examples: 450228 download_size: 26490065 dataset_size: 112559228
- config_name: EGY2K
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 380487 num_examples: 1540 download_size: 165770 dataset_size: 380487
- config_name: ESLTTS
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 4443418 num_examples: 41806 download_size: 527194 dataset_size: 4443418
- config_name: EUbookshop-Speech-Irish
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 16715580 num_examples: 67268 download_size: 5639763 dataset_size: 16715580
- config_name: EchoTTS-OmniVoice-En
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 59013 num_examples: 200 download_size: 28173 dataset_size: 59013
- config_name: Egyptian-ASR-MGB-3
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 755745 num_examples: 1159 download_size: 320095 dataset_size: 755745
- config_name: Egyptian-ASR-MGB-3__severo
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 783561 num_examples: 1159 download_size: 323680 dataset_size: 783561
- config_name: Egyptian-Arabic-Lectures
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 2570510 num_examples: 4074 download_size: 1013064 dataset_size: 2570510
- config_name: Elise
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 200533 num_examples: 1194 download_size: 82888 dataset_size: 200533
- config_name: EmergentTTS-Eval
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 495635 num_examples: 1645 download_size: 143296 dataset_size: 495635
- config_name: Emilia-NV
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 40789622 num_examples: 174143 download_size: 21830733 dataset_size: 40789622
- config_name: EmoVoice-DB
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 3687061 num_examples: 22100 download_size: 1221255 dataset_size: 3687061
- config_name: Enigma-Dataset
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 305677538 num_examples: 1526253 download_size: 87669858 dataset_size: 305677538
- config_name: FLEURS-GA-EN
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 904868 num_examples: 3991 download_size: 236906 dataset_size: 904868
- config_name: FLEURS-SpeechT-GL-EN
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 829555 num_examples: 3450 download_size: 214775 dataset_size: 829555
- config_name: FalAR
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 333887926 num_examples: 792464 download_size: 144309355 dataset_size: 333887926
- config_name: FeruzaSpeech_to_fine_tuning
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 3773637 num_examples: 12989 download_size: 1392449 dataset_size: 3773637
- config_name: Fleurs-Kn
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 1621408 num_examples: 3489 download_size: 315811 dataset_size: 1621408
- config_name: Fleurs-Kn__Indic-LLM-Labs
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 1788880 num_examples: 3489 download_size: 317915 dataset_size: 1788880
- config_name: Fleurs-Kn__Kannada-LLM-Labs
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 1809814 num_examples: 3489 download_size: 318073 dataset_size: 1809814
- config_name: French_game_voice
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 29611987 num_examples: 175831 download_size: 8349156 dataset_size: 29611987
- config_name: GAPS
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 23341327 num_examples: 172629 download_size: 8062795 dataset_size: 23341327
- config_name: GCP-TTS
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 21909744 num_examples: 124276 download_size: 8740253 dataset_size: 21909744
- config_name: GLOBE
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 78180852 num_examples: 581658 download_size: 26735014 dataset_size: 78180852
- config_name: GLOBE_V2
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 75147834 num_examples: 540408 download_size: 25366697 dataset_size: 75147834
- config_name: GLOBE_V3
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 102098523 num_examples: 710006 download_size: 35679158 dataset_size: 102098523
- config_name: GLaDOS-audio-v2
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 266127 num_examples: 1806 download_size: 92980 dataset_size: 266127
- config_name: GMaSC
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 380553 num_examples: 2000 download_size: 130629 dataset_size: 380553
- config_name: GTTS-Chirp3-Synthetic
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 6968328 num_examples: 23849 download_size: 2968116 dataset_size: 6968328
- config_name: GTTS-WaveNet-Synthetic
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 10466321 num_examples: 33445 download_size: 2701412 dataset_size: 10466321
- config_name: Habibi
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 2375917 num_examples: 11357 download_size: 858861 dataset_size: 2375917
- config_name: Hellenic-greek-parliamentary-speech
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 27901320 num_examples: 92124 download_size: 7018314 dataset_size: 27901320
- config_name: HiKE
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 185489 num_examples: 1121 download_size: 86488 dataset_size: 185489
- config_name: Hindi-1482Hrs
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 237469061 num_examples: 900872 download_size: 62099752 dataset_size: 237469061
- config_name: Hindi-audio-speech
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 1138639 num_examples: 2463 download_size: 399963 dataset_size: 1138639
- config_name: Hypa-Speech-10k
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 1535315 num_examples: 6687 download_size: 725676 dataset_size: 1535315
- config_name: Hypa-Speech-10k__Kppwdfgu1
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 1781724 num_examples: 6687 download_size: 746175 dataset_size: 1781724
- config_name: Hypa_Fleurs
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 230857 num_examples: 1162 download_size: 72813 dataset_size: 230857
- config_name: IMDA-TTS
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 730730 num_examples: 6033 download_size: 342448 dataset_size: 730730
- config_name: INDspeech
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 210095 num_examples: 2000 download_size: 65476 dataset_size: 210095
- config_name: ISSAI_KSC_335RS_v_1_1
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 43396484 num_examples: 153853 download_size: 13205915 dataset_size: 43396484
- config_name: Indic-High-Fidelity-MultiSpeaker-ASR
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 1379311 num_examples: 37 download_size: 467874 dataset_size: 1379311
- config_name: IndicTTS
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 18502979 num_examples: 50886 download_size: 5628038 dataset_size: 18502979
- config_name: IndicTTS-Bengali
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 7926323 num_examples: 34269 download_size: 2518809 dataset_size: 7926323
- config_name: IndicTTS-Hindi
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 3915524 num_examples: 11825 download_size: 1302923 dataset_size: 3915524
- config_name: IndicTTS_Assamese
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 3501732 num_examples: 16358 download_size: 1011576 dataset_size: 3501732
- config_name: IndicTTS_Bengali
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 3483777 num_examples: 12548 download_size: 1092925 dataset_size: 3483777
- config_name: IndicTTS_BengaliOLD
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 3680398 num_examples: 12852 download_size: 1120926 dataset_size: 3680398
- config_name: IndicTTS_English
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 24503313 num_examples: 140808 download_size: 6701429 dataset_size: 24503313
- config_name: IndicTTS_Kannada
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 2995805 num_examples: 9694 download_size: 906952 dataset_size: 2995805
- config_name: IndicTTS_Malayalam
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 3766529 num_examples: 13129 download_size: 1126706 dataset_size: 3766529
- config_name: IndicTTS_Manipuri
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 2627016 num_examples: 16360 download_size: 627856 dataset_size: 2627016
- config_name: IndicTTS_Manipuri__Chingkheinganba
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 3452433 num_examples: 16360 download_size: 670487 dataset_size: 3452433
- config_name: IndicTTS_Marathi
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 2883983 num_examples: 10939 download_size: 877148 dataset_size: 2883983
- config_name: IndicTTS_Odia
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 2662104 num_examples: 11564 download_size: 804708 dataset_size: 2662104
- config_name: IndicTTS_Punjabi
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 1613490 num_examples: 6892 download_size: 494976 dataset_size: 1613490
- config_name: IndicTTS_Rajasthani
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 2637632 num_examples: 9060 download_size: 837939 dataset_size: 2637632
- config_name: IndicTTS_Tamil
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 4187582 num_examples: 9437 download_size: 1346770 dataset_size: 4187582
- config_name: IndicTTS_Telugu
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 4510032 num_examples: 8576 download_size: 1534597 dataset_size: 4510032
- config_name: IndicTTS_Telugu_MultiSpeaker
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 4877931 num_examples: 8486 download_size: 1509263 dataset_size: 4877931
- config_name: IndicTTS_v2
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 28136318 num_examples: 94376 download_size: 7981859 dataset_size: 28136318
- config_name: IndicVoices-R_Hindi
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 10611685 num_examples: 26318 download_size: 3171633 dataset_size: 10611685
- config_name: IndicVoices-R_Hindi__impriyanshu-garg00
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 12190765 num_examples: 26318 download_size: 3241816 dataset_size: 12190765
- config_name: Indic_ASR_Eval
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 167301 num_examples: 769 download_size: 61669 dataset_size: 167301
- config_name: InstructTTSEval
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 444563 num_examples: 2000 download_size: 225731 dataset_size: 444563
- config_name: Irodori-Ja-500M-v2-vs-600M-v3-compare-20
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 5602 num_examples: 20 download_size: 4531 dataset_size: 5602
- config_name: Irodori-Ja-Spk1-10k
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string splits:
- name: train num_bytes: 2214701 num_examples: 10000 download_size: 740011 dataset_size: 2214701
- config_name: Irodori-Ja-Spk2-10k
features:
- name: audio_filename dtype: string
- name: text dtype: string
- name: speaker dtype: string split