KarthikRagunathAnandaKumar/LearningToPresent-RL-Qwen-2.5B-Coder-Instruct-GRPO-Finetuned Text Generation • Updated Mar 18 • 29
Logics-MLLM/Logics-PPT-Qwen3.6-35B-A3B-RL Reinforcement Learning • 35B • Updated 11 days ago • 156 • 1