logan7000/mllm-cogrpo-heter-qwen25vl-7b-x-internvl35-8b-mmr1-groupA-qwen25vl-7b Image-Text-to-Text • 849k • Updated Aug 9 • 15
logan7000/mllm-cogrpo-homo-internvl35-8b-mmr1-groupB-internvl35-8b Image-Text-to-Text • 695k • Updated Aug 9 • 13
logan7000/mllm-cogrpo-homo-internvl35-8b-mmr1-groupA-internvl35-8b Image-Text-to-Text • 695k • Updated Aug 9 • 17
logan7000/cogrpo-n3-selfpeers-qwen25-3b-x-llama32-3b-x-qwen3-1p7b-math345-groupC-qwen3-end Reinforcement Learning • 2B • Updated Aug 6 • 13
logan7000/cogrpo-n3-selfpeers-qwen25-3b-x-llama32-3b-x-qwen3-1p7b-math345-groupC-qwen3-best Reinforcement Learning • 2B • Updated Aug 6 • 8
logan7000/cogrpo-n3-selfpeers-qwen25-3b-x-llama32-3b-x-qwen3-1p7b-math345-groupB-llama32-end Reinforcement Learning • 175k • Updated Aug 6 • 5
logan7000/cogrpo-n3-selfpeers-qwen25-3b-x-llama32-3b-x-qwen3-1p7b-math345-groupB-llama32-best Reinforcement Learning • 175k • Updated Aug 6 • 11
logan7000/cogrpo-n3-selfpeers-qwen25-3b-x-llama32-3b-x-qwen3-1p7b-math345-groupA-qwen25-end Reinforcement Learning • 242k • Updated Aug 6 • 10
logan7000/cogrpo-n3-selfpeers-qwen25-3b-x-llama32-3b-x-qwen3-1p7b-math345-groupA-qwen25-best Reinforcement Learning • 242k • Updated Aug 6 • 17