trtd56/TimeCapsuleLLM-ja-corpus-v1
Viewer • Updated • 29.1k • 267
1868–1945年に限定した日本語コーパスからゼロから学習したdecoder-only GPTです。現代の知識や安全性を備えたチャットモデルではありません。
v1-smallからデータ量・モデル規模を拡大したv1です。代表的な成功例と失敗例は phase3_generation_samples.md に掲載しています。
対応データセットは trtd56/TimeCapsuleLLM-ja-corpus-v1 です。青空文庫の時代・権利フィルタ通過作品と、1945年以前刊行かつPDMであるNDL OCR品質通過資料を使用しました。test作品はフェーズ間で固定しています。
aozora-bunko: 1,576 documents / 15,457,625 characters
ndl-next-digital-library: 27,527 documents / 1,944,648,693 characters
戦前test BPB: 1.0654
現代文control BPB: 1.8756
自動生成rubric: 93.3%
詳細な設定、checksum、固定プローブ出力は同梱の training_config.yaml、artifact_manifest.json、evaluation.json を参照してください。
python inference.py '文明開化とは' を実行してください。必要パッケージは torch, tokenizers, safetensors です。
小型モデルであり、事実誤認、反復、OCR由来の誤字、歴史的な差別表現を生成し得ます。医療・法律・金融その他の意思決定には使用しないでください。