range3/wikipedia-ja-20230101
Viewer • Updated • 1.35M • 1.06k • 6
コードはこちら
ExLoD-1 は、google/gemma-3-270m をベースに 日本語の流暢さ(自然さ)を底上げする目的で、range3/cc100-ja を用いて 継続事前学習(Continual Pretraining / DAPT)を行ったモデルです。
google/gemma-3-270mrange3/cc100-ja(Webクロール由来の日本語テキスト)Web由来データの性質上、以下を含む可能性があります。
{"text": ...} 形式のテキストを学習datasets の streaming でデータを読み込み、最小限のクリーニング(空行除去・strip等)を適用SFTTrainer を CLM 学習の枠組みとして使用(テキスト列をそのまま次トークン予測)注: 実際の品質は、フィルタリング(短文除去、文字種比率、記号率、重複除去など)と
packing設定に大きく依存します。より強いフィルタは別途推奨です。
2e-510,000161100bf1632768Falseevaluate.py による、 range3/wikipedia-ja-20230101 を使用したPerplexity計測を実施。
| Model | Dataset | #Samples | Metric | Score |
|---|---|---|---|---|
| ExLoD-1 | range3/wikipedia-ja-20230101 | 1000 | Perplexity (↓) | 33.56 |
| Gemma 3 270M | range3/wikipedia-ja-20230101 | 1000 | Perplexity (↓) | 24.97 |
license: gemma)。google/gemma-3-270m をベースに range3/cc100-ja で継続事前学習google/gemma-3-270mrange3/cc100-ja , range3/wikipedia-ja-20230101Base model
google/gemma-3-270m