ViuAI/viu-mini-pretrain-40-30-30
Viewer β’ Updated β’ 422k β’ 21
Hinglish-first research MoE. Pehle batata hu, tum approve karoge, tabhi code chhedege β ye repo isi rule se bana hai.
model/scripts/viu1_moe.py smoke β total 241.7M / active 166.2Mmodel/scripts/train.py (AdamW + cosine 5% warmup + grad-clip 1.0 + BF16 + grad-accum)Mini-ViuAI-50M/ <- ye repo root (HF model repo ke liye)
model/
configs/viu1_moe_config.yaml + config.json
scripts/viu1_moe.py, train.py, push_to_hf.py
checkpoints/ (LFS)
tokenizer/
configs/tokenizer_config.yaml
outputs/tokenizer.json (FINAL 48k, abhi TEST 36252 bytes)
scripts/tokenizer_train.py
data/
raw/ hinglish.txt (40%) hindi.txt (30%) english.txt (30%) -> HF dataset repo me jayega
eval/sample_test.txt
docs/
PROGRESS.md, VIU1_MOE_PLAN.md, HF_PUSH_GUIDE.md
48k byte-level BPE, NFC + ByteLevel. Mix 40:30:30.
# local 500k lines
python tokenizer/scripts/tokenizer_train.py --data_dir ./data/raw --out ./tokenizer/outputs/tokenizer.json --vocab_size 48000 --max_lines 500000
# HF dataset se (ready ke baad)
python tokenizer/scripts/tokenizer_train.py --hf_dataset ViuAI/viu-mini-pretrain-40-30-30 --out ./tokenizer/outputs/tokenizer.json
pip install -r requirements.txt
# smoke (CPU, 3 steps, tiny model β loop test)
python model/scripts/train.py --smoke
# real (needs CUDA + FINAL tokenizer + HF dataset)
python model/scripts/train.py --config model/configs/train_config.yaml --model_config model/configs/viu1_moe_config.yaml
# ya HF dataset streaming
python model/scripts/train.py --hf_dataset ViuAI/viu-mini-pretrain-40-30-30 --config model/configs/train_config.yaml
See docs/HF_PUSH_GUIDE.md. Model repo: ViuAI/ViuMini-MoE-242M, Dataset repo: ViuAI/viu-mini-pretrain-40-30-30.
Requires huggingface_hub login β token .hf_token me nahi, hf auth login se.
NOTES.md, daily docs/PROGRESS.mdResearch purpose. MoE fail risk 50-60% first run, 85% after retune β prevention checklist docs/VIU1_MOE_PLAN.md me.