Upload tokenizer.py with huggingface_hub
Browse files- tokenizer.py +12 -2
tokenizer.py
CHANGED
|
@@ -13,7 +13,9 @@ from tokenizers.decoders import ByteLevel as ByteLevelDecoder
|
|
| 13 |
from tokenizers import AddedToken
|
| 14 |
|
| 15 |
SPECIAL = ["<pad>", "<bos>", "<eos>", "<mask>",
|
| 16 |
-
"<think>", "</think>", "<tool>", "</tool>", "<result>"
|
|
|
|
|
|
|
| 17 |
|
| 18 |
|
| 19 |
class YKTokenizer:
|
|
@@ -84,7 +86,15 @@ class YKTokenizer:
|
|
| 84 |
@property
|
| 85 |
def endtool_id(self): return self._ids["</tool>"]
|
| 86 |
@property
|
| 87 |
-
def result_id(self):
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 88 |
|
| 89 |
# ---- encode / decode ------------------------------------------------
|
| 90 |
def encode(self, text, add_special=False):
|
|
|
|
| 13 |
from tokenizers import AddedToken
|
| 14 |
|
| 15 |
SPECIAL = ["<pad>", "<bos>", "<eos>", "<mask>",
|
| 16 |
+
"<think>", "</think>", "<tool>", "</tool>", "<result>",
|
| 17 |
+
# learned secondary-memory tokens (side store, not in weights)
|
| 18 |
+
"<mem_write>", "<mem_read>", "<mem_kv>", "<mem_evict>"]
|
| 19 |
|
| 20 |
|
| 21 |
class YKTokenizer:
|
|
|
|
| 86 |
@property
|
| 87 |
def endtool_id(self): return self._ids["</tool>"]
|
| 88 |
@property
|
| 89 |
+
def result_id(self): return self._ids["<result>"]
|
| 90 |
+
@property
|
| 91 |
+
def mem_write_id(self): return self._ids["<mem_write>"]
|
| 92 |
+
@property
|
| 93 |
+
def mem_read_id(self): return self._ids["<mem_read>"]
|
| 94 |
+
@property
|
| 95 |
+
def mem_kv_id(self): return self._ids["<mem_kv>"]
|
| 96 |
+
@property
|
| 97 |
+
def mem_evict_id(self): return self._ids["<mem_evict>"]
|
| 98 |
|
| 99 |
# ---- encode / decode ------------------------------------------------
|
| 100 |
def encode(self, text, add_special=False):
|