XLS commited on
Commit
f6a6791
·
verified ·
1 Parent(s): fab437e

Upload 4 files

Browse files
Files changed (4) hide show
  1. added_tokens.json +227 -0
  2. special_tokens_map.json +7 -0
  3. tokenizer_config.json +16 -0
  4. vocab.txt +69 -0
added_tokens.json ADDED
@@ -0,0 +1,227 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "BB": 69,
3
+ "BD": 70,
4
+ "BE": 71,
5
+ "BF": 72,
6
+ "BH": 73,
7
+ "BI": 74,
8
+ "BJ": 75,
9
+ "BK": 76,
10
+ "BL": 77,
11
+ "BM": 78,
12
+ "BO": 79,
13
+ "BP": 80,
14
+ "BQ": 81,
15
+ "BR": 82,
16
+ "BS": 83,
17
+ "BU": 84,
18
+ "BV": 85,
19
+ "BW": 86,
20
+ "BX": 87,
21
+ "BY": 88,
22
+ "BZ": 89,
23
+ "DB": 90,
24
+ "DD": 91,
25
+ "DE": 92,
26
+ "DF": 93,
27
+ "DH": 94,
28
+ "DI": 95,
29
+ "DJ": 96,
30
+ "DK": 97,
31
+ "DL": 98,
32
+ "DM": 99,
33
+ "DO": 100,
34
+ "DP": 101,
35
+ "DQ": 102,
36
+ "DR": 103,
37
+ "DS": 104,
38
+ "DU": 105,
39
+ "DV": 106,
40
+ "DW": 107,
41
+ "DX": 108,
42
+ "DY": 109,
43
+ "DZ": 110,
44
+ "EB": 111,
45
+ "ED": 112,
46
+ "EE": 113,
47
+ "EF": 114,
48
+ "EH": 115,
49
+ "EI": 116,
50
+ "EJ": 117,
51
+ "EK": 118,
52
+ "EL": 119,
53
+ "EM": 120,
54
+ "EO": 121,
55
+ "EP": 122,
56
+ "EQ": 123,
57
+ "ER": 124,
58
+ "ES": 125,
59
+ "EU": 126,
60
+ "EV": 127,
61
+ "EW": 128,
62
+ "EX": 129,
63
+ "EY": 130,
64
+ "EZ": 131,
65
+ "FB": 132,
66
+ "FD": 133,
67
+ "FE": 134,
68
+ "FF": 135,
69
+ "FH": 136,
70
+ "FI": 137,
71
+ "FJ": 138,
72
+ "FK": 139,
73
+ "FL": 140,
74
+ "FM": 141,
75
+ "FO": 142,
76
+ "FP": 143,
77
+ "FQ": 144,
78
+ "FR": 145,
79
+ "FS": 146,
80
+ "FU": 147,
81
+ "FV": 148,
82
+ "FW": 149,
83
+ "FX": 150,
84
+ "FY": 151,
85
+ "FZ": 152,
86
+ "HB": 153,
87
+ "HD": 154,
88
+ "HE": 155,
89
+ "HF": 156,
90
+ "HH": 157,
91
+ "HI": 158,
92
+ "HJ": 159,
93
+ "HK": 160,
94
+ "HL": 161,
95
+ "HM": 162,
96
+ "HO": 163,
97
+ "HP": 164,
98
+ "HQ": 165,
99
+ "HR": 166,
100
+ "HS": 167,
101
+ "HU": 168,
102
+ "HV": 169,
103
+ "HW": 170,
104
+ "HX": 171,
105
+ "HY": 172,
106
+ "HZ": 173,
107
+ "IB": 174,
108
+ "ID": 175,
109
+ "IE": 176,
110
+ "IF": 177,
111
+ "IH": 178,
112
+ "II": 179,
113
+ "IJ": 180,
114
+ "IK": 181,
115
+ "IL": 182,
116
+ "IM": 183,
117
+ "IO": 184,
118
+ "IP": 185,
119
+ "IQ": 186,
120
+ "IR": 187,
121
+ "IS": 188,
122
+ "IU": 189,
123
+ "IV": 190,
124
+ "IW": 191,
125
+ "IX": 192,
126
+ "IY": 193,
127
+ "IZ": 194,
128
+ "JB": 195,
129
+ "JD": 196,
130
+ "JE": 197,
131
+ "JF": 198,
132
+ "JH": 199,
133
+ "JI": 200,
134
+ "JJ": 201,
135
+ "JK": 202,
136
+ "JL": 203,
137
+ "JM": 204,
138
+ "JO": 205,
139
+ "JP": 206,
140
+ "JQ": 207,
141
+ "JR": 208,
142
+ "JS": 209,
143
+ "JU": 210,
144
+ "JV": 211,
145
+ "JW": 212,
146
+ "JX": 213,
147
+ "JY": 214,
148
+ "JZ": 215,
149
+ "KB": 216,
150
+ "KD": 217,
151
+ "KE": 218,
152
+ "KF": 219,
153
+ "KH": 220,
154
+ "KI": 221,
155
+ "KJ": 222,
156
+ "KK": 223,
157
+ "KL": 224,
158
+ "KM": 225,
159
+ "KO": 226,
160
+ "KP": 227,
161
+ "KQ": 228,
162
+ "KR": 229,
163
+ "KS": 230,
164
+ "KU": 231,
165
+ "KV": 232,
166
+ "KW": 233,
167
+ "KX": 234,
168
+ "KY": 235,
169
+ "KZ": 236,
170
+ "LB": 237,
171
+ "LD": 238,
172
+ "LE": 239,
173
+ "LF": 240,
174
+ "LH": 241,
175
+ "LI": 242,
176
+ "LJ": 243,
177
+ "LK": 244,
178
+ "LL": 245,
179
+ "LM": 246,
180
+ "LO": 247,
181
+ "LP": 248,
182
+ "LQ": 249,
183
+ "LR": 250,
184
+ "LS": 251,
185
+ "LU": 252,
186
+ "LV": 253,
187
+ "LW": 254,
188
+ "LX": 255,
189
+ "LY": 256,
190
+ "LZ": 257,
191
+ "MB": 258,
192
+ "MD": 259,
193
+ "ME": 260,
194
+ "MF": 261,
195
+ "MH": 262,
196
+ "MI": 263,
197
+ "MJ": 264,
198
+ "MK": 265,
199
+ "ML": 266,
200
+ "MM": 267,
201
+ "MO": 268,
202
+ "MP": 269,
203
+ "MQ": 270,
204
+ "MR": 271,
205
+ "MS": 272,
206
+ "MU": 273,
207
+ "MV": 274,
208
+ "MW": 275,
209
+ "MX": 276,
210
+ "MY": 277,
211
+ "MZ": 278,
212
+ "OB": 279,
213
+ "OD": 280,
214
+ "OE": 281,
215
+ "OF": 282,
216
+ "OH": 283,
217
+ "OI": 284,
218
+ "OJ": 285,
219
+ "OK": 286,
220
+ "OL": 287,
221
+ "OM": 288,
222
+ "OO": 289,
223
+ "OP": 290,
224
+ "OQ": 291,
225
+ "OR": 292,
226
+ "OS": 293
227
+ }
special_tokens_map.json ADDED
@@ -0,0 +1,7 @@
 
 
 
 
 
 
 
 
1
+ {
2
+ "cls_token": "[CLS]",
3
+ "mask_token": "[MASK]",
4
+ "pad_token": "[PAD]",
5
+ "sep_token": "[SEP]",
6
+ "unk_token": "[UNK]"
7
+ }
tokenizer_config.json ADDED
@@ -0,0 +1,16 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "cls_token": "[CLS]",
3
+ "do_basic_tokenize": true,
4
+ "do_lower_case": false,
5
+ "mask_token": "[MASK]",
6
+ "max_len": 512,
7
+ "name_or_path": "armheb/DNA_bert_3",
8
+ "never_split": null,
9
+ "pad_token": "[PAD]",
10
+ "sep_token": "[SEP]",
11
+ "special_tokens_map_file": "/home/lixc/.cache/huggingface/transformers/370b400d6fc7ef6a8f6c09f60827737f1a768d8994ff4ea0f2870e732f0f1948.dd8bd9bfd3664b530ea4e645105f557769387b3da9f79bdb55ed556bdd80611d",
12
+ "strip_accents": null,
13
+ "tokenize_chinese_chars": true,
14
+ "tokenizer_class": "BertTokenizer",
15
+ "unk_token": "[UNK]"
16
+ }
vocab.txt ADDED
@@ -0,0 +1,69 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ [PAD]
2
+ [UNK]
3
+ [CLS]
4
+ [SEP]
5
+ [MASK]
6
+ AAA
7
+ AAT
8
+ AAC
9
+ AAG
10
+ ATA
11
+ ATT
12
+ ATC
13
+ ATG
14
+ ACA
15
+ ACT
16
+ ACC
17
+ ACG
18
+ AGA
19
+ AGT
20
+ AGC
21
+ AGG
22
+ TAA
23
+ TAT
24
+ TAC
25
+ TAG
26
+ TTA
27
+ TTT
28
+ TTC
29
+ TTG
30
+ TCA
31
+ TCT
32
+ TCC
33
+ TCG
34
+ TGA
35
+ TGT
36
+ TGC
37
+ TGG
38
+ CAA
39
+ CAT
40
+ CAC
41
+ CAG
42
+ CTA
43
+ CTT
44
+ CTC
45
+ CTG
46
+ CCA
47
+ CCT
48
+ CCC
49
+ CCG
50
+ CGA
51
+ CGT
52
+ CGC
53
+ CGG
54
+ GAA
55
+ GAT
56
+ GAC
57
+ GAG
58
+ GTA
59
+ GTT
60
+ GTC
61
+ GTG
62
+ GCA
63
+ GCT
64
+ GCC
65
+ GCG
66
+ GGA
67
+ GGT
68
+ GGC
69
+ GGG