BruceQQ0
AI & ML interests
None yet
Recent Activity
upvoted a paper about 2 months ago
Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models upvoted a paper about 2 months ago
Rethinking the Divergence Regularization in LLM RL upvoted a paper about 2 months ago
Beyond Uniform Token-Level Trust Region in LLM Reinforcement LearningOrganizations
None yet