logan7000/cogrpo-n3-randompeer-qwen25-3b-x-llama32-3b-x-qwen3-1p7b-math345-groupA-qwen25-best Reinforcement Learning • 242k • Updated Aug 10 • 10
logan7000/cogrpo-n3-pooledmaj-qwen25-3b-x-llama32-3b-x-qwen3-1p7b-math345-groupC-qwen3-end Reinforcement Learning • 2B • Updated Aug 10 • 10
logan7000/cogrpo-n3-pooledmaj-qwen25-3b-x-llama32-3b-x-qwen3-1p7b-math345-groupC-qwen3-best Reinforcement Learning • 2B • Updated Aug 10 • 20
logan7000/cogrpo-n3-pooledmaj-qwen25-3b-x-llama32-3b-x-qwen3-1p7b-math345-groupB-llama32-end Reinforcement Learning • 175k • Updated Aug 10 • 10
logan7000/cogrpo-n3-pooledmaj-qwen25-3b-x-llama32-3b-x-qwen3-1p7b-math345-groupB-llama32-best Reinforcement Learning • 175k • Updated Aug 10 • 8
logan7000/cogrpo-n3-pooledmaj-qwen25-3b-x-llama32-3b-x-qwen3-1p7b-math345-groupA-qwen25-end Reinforcement Learning • 242k • Updated Aug 10 • 10
logan7000/cogrpo-n3-pooledmaj-qwen25-3b-x-llama32-3b-x-qwen3-1p7b-math345-groupA-qwen25-best Reinforcement Learning • 242k • Updated Aug 10 • 15
logan7000/mllm-mmr1-ttrl-qwen25vl-3b-full-end-s722 Reinforcement Learning • 756k • Updated Aug 9 • 13
logan7000/mllm-mmr1-ttrl-qwen25vl-3b-full-best-s100 Reinforcement Learning • 756k • Updated Aug 9 • 8
logan7000/mllm-cogrpo-heter-qwen25vl-7b-x-internvl35-8b-mmr1-mmupt-groupB-internvl35-8b Image-Text-to-Text • 695k • Updated Aug 9 • 21
logan7000/mllm-cogrpo-heter-qwen25vl-7b-x-internvl35-8b-mmr1-mmupt-groupA-qwen25vl-7b Image-Text-to-Text • 849k • Updated Aug 9 • 25
logan7000/mllm-cogrpo-heter-qwen25vl-7b-x-internvl35-8b-mmr1-groupB-internvl35-8b Image-Text-to-Text • 695k • Updated Aug 9 • 19