wikipedia jp, wikipedia en(サンプリング), cc-100(ja, サンプリング)(追記: 作成スクリプトを確認したところ、日本語wikipediaのみを利用していました)のデータを unidic で分割 + sentencepiece Unigram で学習した、XLM-Roberta 形式の日本語トークナイザ。
Inference Providers
NEW
This model is not currently available via any of the supported third-party Inference Providers, and
HF Inference API was unable to determine this model’s pipeline type.