File size: 1,397 Bytes
a15230d | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 | {
"vocab_size": 4192,
"special_tokens": [
"<pad>",
"<unk>",
"<bos>",
"<eos>"
],
"pad_id": 0,
"unk_id": 1,
"bos_id": 2,
"eos_id": 3,
"train_ratio": 0.8,
"seed": 42,
"languages": [
"ml"
],
"normalizer": "NFC",
"pre_tokenizer": "ByteLevel",
"recommended_seq_len": 768,
"fertility_per_lang": {
"ml": {
"mean_fertility": 0.6979,
"mean_tokens": 391.4,
"p50_tokens": 394,
"p90_tokens": 576,
"p95_tokens": 688,
"p99_tokens": 1086,
"max_tokens": 1316
}
},
"token_overlap": {
"pairwise": {},
"family_overlap": {
"indo_aryan_vs_indo_aryan": {
"shared_tokens": 0,
"jaccard_similarity": 0
},
"dravidian_vs_indo_aryan": {
"shared_tokens": 0,
"jaccard_similarity": 0.0
},
"dravidian_vs_dravidian": {
"shared_tokens": 3628,
"jaccard_similarity": 1.0
}
},
"per_lang_unique_tokens": {
"ml": 3628
}
},
"vocab_utilization": {
"vocab_size": 4192,
"used_tokens": 3628,
"unused_tokens": 564,
"utilization_rate": 0.8655,
"shared_all_langs": 3628,
"unique_per_lang": {
"ml": 3628
}
},
"oov_rates": {
"ml": {
"total_tokens": 880083,
"unk_tokens": 0,
"oov_rate": 0.0
}
}
} |