PhoenixHu/grpo_stable_reasoning_nolow_075_1000steps_lora64_changetolora8_2e-50727 Updated about 24 hours ago
PhoenixHu/grpo_stable_reasoning_nolow_075_1000steps_lora64_changetolora8_2e-50727 Updated about 24 hours ago
PhoenixHu/grpo_stable_reasoning_withlow_075_1000steps_lora64_changetolora8_5e-60726 Updated 2 days ago
PhoenixHu/grpo_stable_reasoning_withlow_075_1000steps_lora64_changetolora8_5e-60726 Updated 2 days ago
PhoenixHu/grpo_stable_reasoning_withlow_075_1000steps_lora16_changetolora8_0725 Updated 2 days ago • 6
PhoenixHu/grpo_stable_reasoning_withlow_075_1000steps_lora16_changetolora8_0725 Updated 2 days ago • 6
PhoenixHu/grpo_stable_reasoning_nolow_0722_075_1200steps_lora64_withlow_0723 Reinforcement Learning • Updated 5 days ago
PhoenixHu/grpo_stable_reasoning_nolow_0722_075_1200steps_lora64_withlow_0723 Reinforcement Learning • Updated 5 days ago
PhoenixHu/grpo_stable_reasoning_nolow_0722_075_1200steps_lora64_0723 Reinforcement Learning • Updated 5 days ago
PhoenixHu/grpo_stable_reasoning_nolow_0722_075_1200steps_lora64_0723 Reinforcement Learning • Updated 5 days ago
PhoenixHu/grpo_stable_reasoning_nolow_0722_075_1200steps_temp12 Reinforcement Learning • Updated 6 days ago
PhoenixHu/grpo_stable_reasoning_nolow_0722_075_1200steps_temp12 Reinforcement Learning • Updated 6 days ago