a3ilab-llm-uncertainty/gptoss_20b_all_zhtw_lr5e-7_ep5_64_128_256_2_1_2_llamafactory_oringal_train Text Generation • Updated 5 days ago • 13 • 1
The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning Paper • 2606.29526 • Published Jun 28 • 170
OmniDirector: General Multi-Shot Camera Cloning without Cross-Paired Data Paper • 2606.13432 • Published Jun 11 • 113
deqing/convergent-llama-300M-muon-6digit-addition_6digit_custom3 Text Generation • 0.2B • Updated Jun 2 • 40 • 1
CubePart: An Open-Vocabulary Part-Controllable 3D Generator Paper • 2605.28763 • Published May 27 • 14