ai-theories 標準トークナイザ(コード・バイトレベル BPE、暫定)

ai-theories(https://github.com/kojikojiprg/ai-theories)プロジェクトの成果物。 バイトレベル Byte Pair Encoding(BPE、語彙サイズ 8192)の スクラッチ実装によるトークナイザ。

研究・教育目的で構築したものであり、品質保証は行っていない。商用・実運用での利用は 想定しない。

暫定(provisional)扱いについて

このアーティファクトは暫定扱いである。 006. 小型 GPT の事前学習 はコードドメインで言語モデルの学習・トークナイザ条件の比較を行っておらず、コードドメイン における「正解」となる設定(方式・語彙サイズ)はまだ確立していない。将来、コードドメインで のトークナイザ比較実験が行われ、より適した設定が判明した場合はこのアーティファクトを 差し替える可能性がある。

現時点では、006 の本番実験で英語について選定された設定(バイトレベル BPE、語彙サイズ 8192、max_chunk_bytes=64)を仮採用している。

由来

005. トークナイザ で導入された load_code_corpus()(src/data/text.py)により取得したコーパス (本リポジトリ自身の src/ 配下の Python ソースコードを連結したもの)から学習した。

このコーパスはリポジトリ自身の内容に依存する。 load_code_corpus() はリポジトリの src/ を実行時点の内容で連結するため、取得結果は取得時点のリポジトリ内容に依存し、 将来のコミットでは変化しうる。取得に使ったコミットハッシュ: 05b684285b77ffd1a6b6f6fcb762cdd8e332b0d5

構成

  • 方式: バイトレベル BPE(byte-level Byte Pair Encoding)
  • 語彙サイズ: 8192
  • 事前分割チャンクの最大バイト数(max_chunk_bytes): 64
  • 学習コーパスサイズ: 271,810 バイト
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support