ai-theories 標準トークナイザ(コード・バイトレベル BPE、暫定)
ai-theories(https://github.com/kojikojiprg/ai-theories)プロジェクトの成果物。
バイトレベル Byte Pair Encoding(BPE、語彙サイズ 8192)の
スクラッチ実装によるトークナイザ。
研究・教育目的で構築したものであり、品質保証は行っていない。商用・実運用での利用は 想定しない。
暫定(provisional)扱いについて
このアーティファクトは暫定扱いである。 006. 小型 GPT の事前学習 はコードドメインで言語モデルの学習・トークナイザ条件の比較を行っておらず、コードドメイン における「正解」となる設定(方式・語彙サイズ)はまだ確立していない。将来、コードドメインで のトークナイザ比較実験が行われ、より適した設定が判明した場合はこのアーティファクトを 差し替える可能性がある。
現時点では、006 の本番実験で英語について選定された設定(バイトレベル BPE、語彙サイズ
8192、max_chunk_bytes=64)を仮採用している。
由来
005. トークナイザ
で導入された load_code_corpus()(src/data/text.py)により取得したコーパス
(本リポジトリ自身の src/ 配下の Python ソースコードを連結したもの)から学習した。
このコーパスはリポジトリ自身の内容に依存する。 load_code_corpus() はリポジトリの
src/ を実行時点の内容で連結するため、取得結果は取得時点のリポジトリ内容に依存し、
将来のコミットでは変化しうる。取得に使ったコミットハッシュ: 05b684285b77ffd1a6b6f6fcb762cdd8e332b0d5
構成
- 方式: バイトレベル BPE(byte-level Byte Pair Encoding)
- 語彙サイズ: 8192
- 事前分割チャンクの最大バイト数(
max_chunk_bytes): 64 - 学習コーパスサイズ: 271,810 バイト
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support