PechaBridgeOCR / tokenizer_config.json
TibetanCodexAITeam's picture
Release OCR checkpoint-184000
1d87586 verified
Raw
History Blame Contribute Delete
451 Bytes
{
"tokenizer_class": "SentencePieceTokenizerAdapter",
"source_tokenizer_dir": "/home/nico/Code/PechaBridge/ext/BoSentencePiece",
"model_max_length": 1000000000000000019884624838656,
"unk_token": "<unk>",
"pad_token": "<pad>",
"bos_token": "<s>",
"eos_token": "</s>",
"cls_token": "[CLS]",
"sep_token": "[SEP]",
"mask_token": "[MASK]",
"additional_special_tokens": [
"<NL>",
"<s_ocr>",
"</s_ocr>",
"<s_cls1>"
]
}