japanese hubert base phoneme ctc rinna/japanese hubert base を CTC での日本語音素認識にファインチューニングしたモデルです。 Update: より精度の良い新バージョンを公開しました prj beatrice/japanese hubert base phoneme ctc v2 モデル概要 ReazonSpeech v2 データセットを使用し、pyopenjtalk plus で生成した音素ラベルを正解と見做して rinna/japanese hubert base をファインチューニング 0.3 エポック程度学習したのち、JSUT コーパス (ラベル: https://github.com/sarulab speech/jsut label) に対する精度が最も良いチェックポイントを選択 ハイパーパラメータ 学習率 CTC Head: 2e 5 他: 2e 6 バッチサイズ: 32 最大音声サンプル数: 250000 最適化: AdamW betas: (0.9, 0.98) weight decay: 0.01 学習率スケジューリング: Cosine Warmup ステップ数: 10000 最大ステップ数: 800000 ただし、途中で JSUT での精度が改善されなくなったため 200000 ステップで打ち切り 使用例 学習環境 A100 80GB Python 3.10.12
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy