PhoenixHu/grpo_stable_reasoning_withlow_075_1000steps_lora64_changetolora8_5e-60726 Updated 6 days ago
PhoenixHu/grpo_stable_reasoning_withlow_075_1000steps_lora16_changetolora8_0725 Updated 6 days ago • 6
PhoenixHu/grpo_stable_reasoning_nolow_0722_075_1200steps_lora64_withlow_0723 Reinforcement Learning • Updated 9 days ago
PhoenixHu/grpo_stable_reasoning_nolow_0722_075_1200steps_lora64_0723 Reinforcement Learning • Updated 9 days ago
PhoenixHu/grpo_stable_reasoning_nolow_0722_075_1200steps Reinforcement Learning • Updated 10 days ago
PhoenixHu/grpo_stable_reasoning_nolow_0722_075_1200steps_temp12 Reinforcement Learning • Updated 10 days ago
PhoenixHu/grpo_stable_reasoning_nolow_0719_8rollout_075_0720 Reinforcement Learning • Updated 12 days ago