PhoenixHu/grpo_stable_reasoning_nolow_075_1000steps_lora64_changetolora8_2e-50727 Updated about 22 hours ago
PhoenixHu/grpo_stable_reasoning_withlow_075_1000steps_lora64_changetolora8_5e-60726 Updated 2 days ago
PhoenixHu/grpo_stable_reasoning_withlow_075_1000steps_lora16_changetolora8_0725 Updated 2 days ago • 6
PhoenixHu/grpo_stable_reasoning_nolow_0722_075_1200steps_lora64_withlow_0723 Reinforcement Learning • Updated 4 days ago
PhoenixHu/grpo_stable_reasoning_nolow_0722_075_1200steps_lora64_0723 Reinforcement Learning • Updated 5 days ago
PhoenixHu/grpo_stable_reasoning_nolow_0722_075_1200steps_temp12 Reinforcement Learning • Updated 6 days ago
PhoenixHu/grpo_stable_reasoning_nolow_0719_8rollout_075_0720 Reinforcement Learning • Updated 7 days ago
PhoenixHu/grpo_internvl2_5_how2sign_1b_bleu1_bleu4_checkpoint31656_newalldata_lora16_0517 Updated May 26
PhoenixHu/grpo_internvl2_5_how2sign_1b_bleu1_bleu4_checkpoint31656_newalldata_lora16_moredata_0523 Updated May 24
PhoenixHu/grpo_internvl2_5_how2sign_1b_bleu1_bleu4_checkpoint31656_newalldata_lora16_12kdata_0523 Updated May 24