🎙️ Better Youtube Dataset
Высококачественный русскоязычный аудио-датасет для задач TTS и ASR, собранный и обработанный с использованием современного пайплайна.
📊 Статистика

| Параметр | Значение |
|---|---|
| 🔢 Всего сэмплов | 17 670 |
| ⏱️ Общая длительность | 39ч 35м 29с |
| 📏 Средняя длина | 8.07 сек |
| 📐 Медианная длина | 8.01 сек |
| ⬇️ Минимальная длина | 0.25 сек |
| ⬆️ Максимальная длина | 24.57 сек |
Распределение по длительности
| Категория | Кол-во сэмплов | Средняя длина | Диапазон |
|---|---|---|---|
| ⚡ Очень короткие | 2 947 | 3.70 сек | 0.25 – 4.91 сек |
| 🔹 Короткие | 4 633 | 6.17 сек | 4.94 – 7.32 сек |
| 🔸 Средние | 4 393 | 8.45 сек | 7.34 – 9.60 сек |
| 🔶 Длинные | 3 588 | 10.68 сек | 9.61 – 11.92 сек |
| 🔴 Очень длинные | 2 109 | 13.09 сек | 11.93 – 24.57 сек |
🗂️ Формат данных
Метаданные хранятся в формате CSV с разделителем ||:
path_to_audio || text (с ударениями) || длительность (сек)
Каждый аудиофайл сохранён в формате Opus (48 kHz, mono). Рядом с каждым .opus файлом находится .txt файл с транскрипцией.
⚙️ Пайплайн обработки
FireRed VAD
↓
GigaAM (x2, двойной прогон с мерджингом)
├─ Пунктуация из E2E модели
└─ Текст из обычной модели
↓
Выравнивание через Qwen Align
↓
Очистка через ClearVoice
⚠️ Для доступа к датасету необходимо принять условия лицензионного соглашения.
📬 Контакты
По вопросам удаления материалов или сотрудничества: tera2space@gmail.com