Anime Whisper 🤗🎤📝 Anime Whisper は、特に日本語のアニメ調演技セリフのドメインに特化した日本語音声認識モデルです。 このモデルは kotoba whisper v2.0 をベースモデルとして、約5,300時間373万ファイルのアニメ調の音声・台本データセット Galgame Speech ASR 16kHz でファインチューニングしたものです。 特にアニメ演技音声ドメインに特化していますが、それ以外の音声でも、他のモデルにはない特徴や高い性能を持っています。 気軽にお試しできるデモはこちらから: https://huggingface.co/spaces/litagin/anime whisper demo 注意❗ このモデルは初期プロンプト(initial prompt) との相性が悪いようで、設定をするとハルシネーションが起きて質が極めて劣化します。初期プロンプトを設定せずにご使用ください。 Using an initial prompt causes a decline in quality, with the model exhibiting hallucinations and significantly degraded performance. Please avoid using an initial prompt. 特徴 🌟 Anime Whisperは、他モデルに比べて一般的に次のような傾向があります。 ハルシネーションが少ない 他のモデルでスキップされがちな言い淀みや、笑い声や叫びや吐息などの非言語発話も忠実に書き起こす 「。、!?…」の句読点が音声のリズムや感情に合わせて適切に付き、セリフ台本として違和感がない自然な文体で書き起こされる アニメ調な演技セリフに対しては特に精度が高い kotoba whisper (whisper large v3の蒸留モデル) ベースなので軽量で高速 他モデルでは書き起こしがほぼ不可能なNSFW音声もきちんとした文体で文字起こし可能 使い方例 🚀 複数ファイルを一気に推論する場合は pipe に単にファイルパスのリストを渡せばよいです。 繰り返しハルシネーションが目立つ場合は、上記の no repeat ngram size: int を 5 10 程度に設定したり、 repetition penalty を1より上に設定することで抑制できます。 評価 📊 詳しい評価・観察レポートや評価コードはGitHubリポジトリで公開予定です。 CER (Character Error Rate, 文字誤り率) 「学習データと同じアニメ調セリフのドメインではあるが、 学習データには含まれていない 個人的に所持している5本ノベルゲーム(合計約75kファイル)」で評価 Ope…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy