kopriaLM
99,360 パラメータの極小言語モデル(再帰 Transformer + TT-Embedding + LoRA)。
- 語彙: 3,000(ByteLevel BPE)
- コンテキスト長: 512
- 事前学習: BabyLM-2026-Strict-Small + WikiText-2
- SFT: databricks-dolly-15k(3 epoch)
ベンチマーク結果
| Task | Shots | Metric | Score |
|---|---|---|---|
| HellaSwag | 0 | acc_norm |
25.39% |
| LAMBADA OpenAI | 0 | acc |
0.10% |
| PIQA | 0 | acc_norm |
49.78% |
| WinoGrande | 0 | acc |
49.80% |
| ARC-Easy | 0 | acc_norm |
24.83% |
| ARC-Challenge | 0 | acc_norm |
26.11% |
| BoolQ | 0 | acc |
37.83% |
| MMLU(57科目平均) | 0 | acc |
23.02% |
| 全タスク平均 | - | - | 29.61% |
使い方
trust_remote_code=True が必要です。KVキャッシュ非対応のため use_cache=False で生成してください。
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
"Ryosei-Akatsuka/kopriaLM", trust_remote_code=True)
tok = AutoTokenizer.from_pretrained("Ryosei-Akatsuka/kopriaLM")
ids = tok("Q: What is 2+2?\nA: ", return_tensors="pt")
gen = model.generate(**ids, max_new_tokens=30, use_cache=False)
print(tok.decode(gen[0], skip_special_tokens=True))
ライセンス
MIT
- Downloads last month
- 371