COPUS: Co-adaptive Parallelism and Batch Size Selection in Large Language Model Training Paper • 2604.26687 • Published Apr 29 • 2
LinguDistill: Recovering Linguistic Ability in Vision- Language Models via Selective Cross-Modal Distillation Paper • 2604.00829 • Published Apr 1 • 8
Llama-3.1-Sherkala-8B-Chat: An Open Large Language Model for Kazakh Paper • 2503.01493 • Published Mar 3, 2025 • 1
Llama-3-Nanda-10B-Chat: An Open Generative Large Language Model for Hindi Paper • 2504.06011 • Published Apr 8, 2025 • 2
FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning Paper • 2506.02515 • Published Jun 3, 2025 • 4
Predicting the Order of Upcoming Tokens Improves Language Modeling Paper • 2508.19228 • Published Aug 26, 2025 • 23
Softpick: No Attention Sink, No Massive Activations with Rectified Softmax Paper • 2504.20966 • Published Apr 29, 2025 • 31
Shifting Long-Context LLMs Research from Input to Output Paper • 2503.04723 • Published Mar 6, 2025 • 22
COPAL-ID: Indonesian Language Reasoning with Local Culture and Nuances Paper • 2311.01012 • Published Nov 2, 2023
Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models Paper • 2308.16149 • Published Aug 30, 2023 • 29