蓬莱3 90m base ja v2
architecture:
tarined by:
- rtx3060 * 2.5h * 6
training code in ./training_codes
train use bit-linear and swa for only attention layer (like bitnet swa ssm hybrid moe on train)
(only can work in pretrain, if in sft recommend normal training)
tarined by (日本語):
- rtx3060 * 2.5h * 6
トレーニングコードは ./training_codesにあります。
学習時のみ bit-linear と swa を attention layerのみに適応しました。 (bitnet swa ssm hybrid moeのような構成で学習しました。)
(事前学習以外ではこの方法は推奨していません, sft時は普通に学習したほうが良いと思います。)
tokenizer from ku-nlp/gpt2-small-japanese-char
+(qwne3 chat format | special tokens)
dataset:
- OmniAICreator/Japanese-Wikipedia-202506
use 150k rows 1 epoch * 6, = 900k row (512 seq)