Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference Paper • 2412.13663 • Published Dec 18, 2024 • 171
Skill-based Agentic Evaluation for Real-time Data Science Tasks Paper • 2609.16487 • Published 13 days ago • 1
ModularRSI: Modular and Generalizable Recursive Harness Self-Improvement Paper • 2609.14857 • Published 14 days ago • 214
FrogNano: Training a 4B Coding Agent via Online Task Synthesis Paper • 2609.07925 • Published 21 days ago • 5
A Multi-Task, Multi-Modal Approach for Predicting Categorical and Dimensional Emotions Paper • 2401.00536 • Published Dec 31, 2023 • 3
RedPajama: an Open Dataset for Training Large Language Models Paper • 2411.12372 • Published Nov 19, 2024 • 60
Jellyfish: A Large Language Model for Data Preprocessing Paper • 2312.01678 • Published Dec 4, 2023 • 2
view article Article Model2Vec: Distill a Small Fast Model from any Sentence Transformer Pringled • Oct 14, 2024 • 105
Long Short-Term Memory Based Recurrent Neural Network Architectures for Large Vocabulary Speech Recognition Paper • 1402.1128 • Published Feb 5, 2014 • 1
Large Language Models' Detection of Political Orientation in Newspapers Paper • 2406.00018 • Published May 23, 2024 • 1
Training Sparse Mixture Of Experts Text Embedding Models Paper • 2502.07972 • Published Feb 11, 2025 • 12
view article Article SetFit: Efficient Few-Shot Learning Without Prompts +4 Unso, lewtun, luketheduke, danielkorat, orenpereg, moshew • Sep 26, 2022 • 43
view article Article Small Language Models (SLM): A Comprehensive Overview jjokah • Feb 22, 2025 • 177
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models Paper • 2402.03300 • Published Feb 5, 2024 • 150
No Language Left Behind: Scaling Human-Centered Machine Translation Paper • 2207.04672 • Published Jul 11, 2022 • 4