TTS Pretrain Clones (3M) — with DNSMOS This is SynDataLab/tts pretrain clones 3m with an added per utterance dnsmos column (DNSMOS P.835 OVRL score, float32), computed with the sig bak ovr.onnx model. 2,967,779 clone utterances across 2971 English speakers. Sample rate: 44.1 kHz, WAV in Parquet dnsmos : overall MOS quality estimate per utterance (higher is better) Generated by echo tts synthesizing English text on speaker latents derived from Qwen3 TTS VoiceDesign base speakers. Per speaker: 10 voice clone latents × 100 texts. Coverage: speakers 1 60 + 61 (partial, 749 rows) + 91 3000.
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy