trtd56/TimeCapsuleLLM-ja-corpus-v2
Viewer • Updated • 87.4k • 343
1868–1945年に限定した日本語コーパスからゼロから学習したdecoder-only GPTです。現代の知識や安全性を備えたチャットモデルではありません。
v2からモデル規模のみを345M→730Mへ拡大したv3です。学習データはv2と同一(2,742,489,368 unique train tokens)のため、対応データセットは新規公開せず trtd56/TimeCapsuleLLM-ja-corpus-v2 を引き続き参照します。
対応データセットは trtd56/TimeCapsuleLLM-ja-corpus-v2 です。青空文庫の時代・権利フィルタ通過作品と、1945年以前刊行かつPDMであるNDL OCR品質通過資料を使用しました。test作品はフェーズ間で固定しています。
Parameters: 730,164,480
Processed tokens: 8,231,321,600
Training iterations: 31,400
戦前test BPB: 0.9922
現代文control BPB: 1.6698
自動生成rubric: 100.0%
詳細な設定、checksum、固定プローブ出力は同梱の training_config.yaml、artifact_manifest.json、evaluation.json を参照してください。
python inference.py '文明開化とは' を実行してください。必要パッケージは torch, tokenizers, safetensors です。
小型モデルであり、事実誤認、反復、OCR由来の誤字、歴史的な差別表現を生成し得ます。医療・法律・金融その他の意思決定には使用しないでください。