VietSuperSpeech Vietnamese Speech Recognition Dataset Dataset Information Total samples : 32,267 Train samples : 29,041 Dev samples : 3,226 Total duration : 103.18 hours Sample rate : 16000 Hz Average segment length : ~12 seconds Source Datasets asr dataset nguoivietdailynews asr dataset nguyenkhangofficial asr dataset trinhlieu Format The dataset follows Icefall format: train.json : Training samples dev.json : Development samples manifest.json : Dataset metadata audio/ : Audio files organized by source dataset Each sample contains: audio : Relative path to audio file text : Transcribed text duration : Duration in seconds source : Source video/file name Transcription Model Transcribed using Zipformer 30M RNNT 6000h model. License MIT
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy