On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability Paper • 2608.30320 • Published 29 days ago • 63
view article Article Benchmark Smarter: Tailor Your Model Evaluation Suite with EvalScope kelseye • Jan 22 • 7
view article Article Qwen-Image-i2L: Training Strategies for Image-to-LoRA Generation kelseye • Dec 16, 2025 • 59
Parallel-R1: Towards Parallel Thinking via Reinforcement Learning Paper • 2509.07980 • Published Sep 9, 2025 • 106
On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting Paper • 2508.11408 • Published Aug 15, 2025 • 8 • 6
On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification Paper • 2508.05629 • Published Aug 7, 2025 • 191 • 21
DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning Paper • 2505.14362 • Published May 20, 2025 • 6 • 2
Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning Paper • 2506.01939 • Published Jun 2, 2025 • 190 • 7