What’s this? 日本語リソースで学習した DeBERTa V3 モデルです。 以下のような特徴を持ちます: 定評のある DeBERTa V3 を用いたモデル 日本語特化 推論時に形態素解析器を用いない 単語境界をある程度尊重する ( の都合上 や の判定負けを喫し のような複数語のトークンを生じさせない) This is a model based on DeBERTa V3 pre trained on Japanese resources. The model has the following features: Based on the well known DeBERTa V3 model Specialized for the Japanese language Does not use a morphological analyzer during inference Respects word boundaries to some extent (does not produce tokens spanning multiple words like の都合上 or の判定負けを喫し ) How to use Tokenizer 工藤氏によって示された手法で学習しました。 以下のことを意識しています: 推論時の形態素解析器なし トークンが単語の境界を跨がない (辞書: unidic cwj 202302 ) Hugging Faceで使いやすい 大きすぎない語彙数 本家の DeBERTa V3 は大きな語彙数で学習されていることに特徴がありますが、反面埋め込み層のパラメータ数が大きくなりすぎる (microsoft/deberta v3 base モデルの場合で埋め込み層が全体の 54%) ことから、本モデルでは小さめの語彙数を採用しています。 注意点として、 xsmall 、 base 、 large の 3 つのモデルのうち、前者二つは unigram アルゴリズムで学習しているが、 large モデルのみ BPE アルゴリズムで学習している。 深い理由はなく、 large モデルのみ語彙サイズを増やすために独立して学習を行ったが、なぜか unigram アルゴリズムでの学習がうまくいかなかったことが原因である。 原因の探究よりモデルの完成を優先して、 BPE アルゴリズムに切り替えた。 The tokenizer is trained using the method introduced by Kudo. Key points include: No morphological analyzer needed during inference Tokens do not cross word boundaries (dict…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy