Synthetic Pre-pretraining Survives Scale, but Not as a Grammatical Prior Paper • 2609.39827 • Published 12 days ago • 13
Synthetic Pre-pretraining Survives Scale, but Not as a Grammatical Prior Paper • 2609.39827 • Published 12 days ago • 13
When Tokenizers Fail: Byte-Level Chunking for Zero-Shot Transfer to Low-Resource Languages Paper • 2608.27658 • Published Aug 27
How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data Paper • 2604.13977 • Published Apr 15 • 3
MultiHashFormer: Hash-based Generative Language Models Paper • 2606.28057 • Published Jun 26 • 23
On the Utility and Factual Reliability of Pruned Mixture-of-Experts Models in the Biomedical Domain Paper • 2607.01444 • Published Jul 1 • 2
MultiHashFormer: Hash-based Generative Language Models Paper • 2606.28057 • Published Jun 26 • 23