3LM-MLX / NOTICE
GeneLab's picture
3LM-MLX: 35.66M / 367.6M tokens pretrained + SFT
0fb999f verified
Raw
History Blame Contribute Delete
7.82 kB
3LM-MLX
Copyright (c) 2026 hiroki-abe-58
このリポジトリのコード(src/, data/, eval/, tools/, scripts/, web/, server.py)は
MIT License で提供しています。LICENSE を参照してください。
================================================================================
学習済みモデルについて
================================================================================
3LM は2段階で学習しています。
1. 事前学習: 大規模な日本語テキストで「次のトークン予測」を学ぶ
2. SFT : 対話データセットで「質問に答える形」に合わせる
どちらの段階も、**ShareAlike(継承)条件を持たないライセンスのデータだけ**を
使っています。学習済みの重みを Apache License 2.0 相当の条件で配布するためで、
継承条件つきのデータ(CC BY-SA など)は、その条件が重みに及ぶかどうかが
明確でないため意図的に採用していません。
日本語の大規模コーパスとして真っ先に候補になる Wikipedia は CC BY-SA
なので、この方針のもとでは使えません。代わりに ODC-By の FineWeb2 と
CC BY の青空文庫を使っています。
--------------------------------------------------------------------------------
1. 事前学習コーパス
--------------------------------------------------------------------------------
FineWeb 2(jpn_Jpan サブセット)
https://huggingface.co/datasets/HuggingFaceFW/fineweb-2
Copyright (c) HuggingFace and contributors
Licensed under the Open Data Commons Attribution License (ODC-By) v1.0
https://opendatacommons.org/licenses/by/1-0/
revision: af9c13333eb981300149d5ca60a8e9d659b276b9
ODC-By 1.0 は帰属表示を求めるライセンスで、継承条件は持ちません。
FineWeb 2 は Common Crawl 由来のため、元のウェブページそれぞれの
権利は各著作権者に属します。
青空文庫(クリーニング済み)
https://huggingface.co/datasets/globis-university/aozorabunko-clean
Copyright (c) globis-university
Licensed under Creative Commons Attribution 4.0 International (CC BY 4.0)
https://creativecommons.org/licenses/by/4.0/
revision: 42a9c9c0f1d67e6a5554d9bea4201973dc9b049c
原典は青空文庫(https://www.aozora.gr.jp/)で公開されている、
著作権保護期間が満了した作品です。
加えた変更:
- 1文書1行のプレーンテキストに整形した(改行と空白を半角スペースに置換)
- ナビゲーション・Cookie 通知・著作権表示などの定型行を除去した
- 日本語文字の比率が 70% 未満の文書を除外した
- 200文字未満の文書を除外し、20,000文字を超える文書は切り詰めた
- 同じ文字並びが繰り返される文書(表の残骸など)を除外した
- 先頭200文字のハッシュで重複を除去した
- アダルト誘導・エラーページと判定した文書を除外した
- 青空文庫の割合を全体の約10%に抑えた
以上の処理は data/prepare_pretrain.py に実装されています。
使用したシャード名とその SHA256、除外の内訳、各ソースの構成比は
data/corpus_pretrain.manifest.json に記録してあります。
整形後のコーパス自体はリポジトリに含めていません(数GBあります)。
revision を固定してあるので、data/prepare_pretrain.py を実行すると
同じものが再現できます。
--------------------------------------------------------------------------------
2. SFT(対話)コーパス
--------------------------------------------------------------------------------
以下はいずれも Apache License 2.0 で、ShareAlike 条件を持ちません。
OpenAssistant Conversations Dataset (OASST1 / OASST2)
https://huggingface.co/datasets/OpenAssistant/oasst1
https://huggingface.co/datasets/OpenAssistant/oasst2
Copyright (c) OpenAssistant / LAION-AI contributors
Licensed under the Apache License, Version 2.0
oasst1-89k-ja(OASST1 を Google 翻訳で日本語化したもの)
https://huggingface.co/datasets/kunishou/oasst1-89k-ja
Licensed under the Apache License, Version 2.0
oasst2-33k-ja(OASST2 の英語サブセットを DeepL で日本語化したもの)
https://huggingface.co/datasets/llm-jp/oasst2-33k-ja
Copyright (c) LLM-jp
Licensed under the Apache License, Version 2.0
magpie-sft-v1.0(Magpie 法による日本語合成対話データ)
https://huggingface.co/datasets/llm-jp/magpie-sft-v1.0
Copyright (c) LLM-jp
Licensed under the Apache License, Version 2.0
生成に用いられたモデル: cyberagent/calm3-22b-chat (Apache-2.0),
Qwen/Qwen2.5-32B-Instruct (Apache-2.0)
Magpie-Tanuki-8B-97k(Magpie 法による日本語合成対話データ)
https://huggingface.co/datasets/Aratako/Magpie-Tanuki-8B-97k
Copyright (c) Aratako
Licensed under the Apache License, Version 2.0
生成に用いられたモデル: weblab-GENIAC/Tanuki-8B-dpo-v1.0 (Apache-2.0)
Apache License, Version 2.0 の全文は licenses/Apache-2.0.txt に同梱しています。
原文: http://www.apache.org/licenses/LICENSE-2.0
加えた変更(Apache License 2.0 Section 4(b) に基づく記載):
- OASST1 では prompter と assistant のペアを parent_id から復元した
- conversations / messages 形式のデータセットでは、隣り合う user と
assistant の発言を取り出して1組の会話にした(3ターン目以降は分割)
- 翻訳失敗フラグ(ng_translation == "1")の立ったレコードを除外した
- 翻訳の崩れたレコードを、質問と返答の一致・短い並びの過剰な反復を
手がかりに除外した(oasst2-33k-ja には翻訳失敗フラグがないため)
- 質問・返答の長さでフィルタし、重複を除去した
- 出現頻度の低い文字を含む会話を除外した
- 改行を半角スペースに置換し、1行1会話のプレーンテキストに整形した
以上の処理は data/prepare_sft.py に実装されています。
どのデータセットを使ったかは data/prepare_sft.py --list-sources で確認できます。
================================================================================
制作にあたって
================================================================================
このリポジトリのコードと文書は、AI コーディング支援ツールを用いて
書かれています。学習データは、上記のとおり継承条件を持たないライセンスで
公開されているデータセットのみで構成しています。
学習データの生成に、出力の学習利用を禁じている商用サービス
(Anthropic Claude など)は一切使っていません。
================================================================================
免責
================================================================================
本モデルの出力は、学習コーパスの統計から次のトークンを予測し続けた結果にすぎません。
事実性・正確性は一切保証されず、実在の人物・団体・製品について
誤った内容を断定的に出力する場合があります。
事前学習コーパスは Common Crawl 由来のウェブテキストを含むため、
偏りや不適切な表現を含む可能性があります。品質フィルタは掛けていますが、
完全ではありません。
出力をそのまま公開の場に掲載する場合は、機械生成物である旨を明記してください。