FEST Checkpoints for the paper "Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance" kaiyan289/FEST-RL-Dataset Updated May 7 kaiyan289/FEST-DPO-1.5B-Math Text Generation • 0.8B • Updated May 7 • 5 kaiyan289/FEST-GRPO-1.5B-Math Text Generation • 0.8B • Updated May 7 • 6
FEST Checkpoints for the paper "Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance" kaiyan289/FEST-RL-Dataset Updated May 7 kaiyan289/FEST-DPO-1.5B-Math Text Generation • 0.8B • Updated May 7 • 5 kaiyan289/FEST-GRPO-1.5B-Math Text Generation • 0.8B • Updated May 7 • 6