蓬莱3 90m base ja v2

architecture:

  • lfm2moe

tarined by:

  • rtx3060 * 2.5h * 6
    training code in ./training_codes
    train use bit-linear and swa for only attention layer (like bitnet swa ssm hybrid moe on train)
    (only can work in pretrain, if in sft recommend normal training)

tarined by (日本語):

  • rtx3060 * 2.5h * 6
    トレーニングコードは ./training_codesにあります。
    学習時のみ bit-linear と swa を attention layerのみに適応しました。 (bitnet swa ssm hybrid moeのような構成で学習しました。)
    (事前学習以外ではこの方法は推奨していません, sft時は普通に学習したほうが良いと思います。)

tokenizer from ku-nlp/gpt2-small-japanese-char
+(qwne3 chat format | special tokens)

dataset:

  • OmniAICreator/Japanese-Wikipedia-202506
    use 150k rows 1 epoch * 6, = 900k row (512 seq)
Downloads last month
8
Safetensors
Model size
85M params
Tensor type
F32
·
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for WariHima/hourai3-90m-ja-base-v2

Finetuned
(6)
this model

Collection including WariHima/hourai3-90m-ja-base-v2