floschne-cohere commited on
Commit
b0f6a59
·
verified ·
1 Parent(s): fa548d9

Set `tokenizer_class` to `TokenizersBackend` to preserve the pre-tokenizer defined in `tokenizer.json`.

Browse files

Set `tokenizer_class` to `TokenizersBackend` so transformers v5 uses the pre-tokenizer stored in `tokenizer.json`, preserving NMV digit grouping

Files changed (1) hide show
  1. tokenizer_config.json +1 -1
tokenizer_config.json CHANGED
@@ -339,7 +339,7 @@
339
  },
340
  "sp_model_kwargs": {},
341
  "spaces_between_special_tokens": false,
342
- "tokenizer_class": "TokenizersBackend",
343
  "unk_token": "<UNK>",
344
  "use_default_system_prompt": false,
345
  "video_token": "<|VIDEO_PAD|>",
 
339
  },
340
  "sp_model_kwargs": {},
341
  "spaces_between_special_tokens": false,
342
+ "tokenizer_class": "PreTrainedTokenizerFast",
343
  "unk_token": "<UNK>",
344
  "use_default_system_prompt": false,
345
  "video_token": "<|VIDEO_PAD|>",