Persian Pixel: A large-scale synthetic OCR dataset for Persian language Paper • 2607.20385 • Published Jul 22
Koshur Pixel: a large-scale synthetic ocr dataset for kashmiri Paper • 2606.23144 • Published Jun 22 • 3
Koshur Diacritizer: A Byte-Level Sequence-to-Sequence Model for Kashmiri Diacritic Restoration Paper • 2606.15883 • Published Jun 14 • 2
ks-pret-5m: a 5 million word, 12 million token kashmiri pretraining dataset Paper • 2604.11066 • Published Apr 13 • 1
synthocr-gen: A synthetic ocr dataset generator for low-resource languages- breaking the data barrier Paper • 2601.16113 • Published Jan 22
ks-lit-3m: A 3.1 million word kashmiri text dataset for large language model pretraining Paper • 2601.01091 • Published Jan 3
600k-ks-ocr: a large-scale synthetic dataset for optical character recognition in kashmiri script Paper • 2601.01088 • Published Jan 3