Nayana Multilingual OCR
OpenEnv document OCR, layout and VQA over 22 languages
OpenEnv environments for multilingual OCR (22 languages) and speech recognition (102 languages), with GRPO recipes and Kannada runs.
OpenEnv document OCR, layout and VQA over 22 languages
Note Environment · document OCR, layout detection and VQA over 1M Nayana pages in 22 languages, plus Sarvam Indic OCR Bench as evaluation splits. Playground at /web.
OpenEnv speech recognition over 102 FLEURS languages
Note Environment · transcription, verbatim transcription and language ID over all 102 FLEURS languages, scored per word or per character by script.
Note Kannada OCR · Gemma 4 E4B + LoRA, GRPO on 4,000 Nayana crops. Sarvam Indic OCR Bench (Kannada) CER 0.428 → 0.360.
Note Kannada ASR · Gemma 4 E4B + LoRA, GRPO on every FLEURS Kannada clip. Held-out CER 0.105 → 0.057 (−45%).
Kannada ASR and OCR GRPO runs, with live held-out evals
Note Training and live-evaluation curves for both Kannada runs.
Note Every checkpoint's held-out predictions, paired curves, trainer logs and the exact HF Jobs / TRL scripts that ran.
Note Sarvam Indic OCR Bench by Sarvam AI (Apache-2.0), served as evaluation-only splits and scored with its own metrics.py.
Note Source corpus for the OCR environment, by CognitiveLab (CC BY-NC 4.0).
Note Source speech for the ASR environment, by Google (CC BY 4.0).
Note Base model for both adapters: Gemma 4 E4B, with audio and vision encoders.