PLaID++: A Preference Aligned Language Model for Targeted Inorganic Materials Design Paper • 2509.07150 • Published Sep 8, 2025 • 1
Running Agents 22 Lemat Bench 😻 22 Explore and submit crystal generation model results on a leaderboard
PLaID++: A Preference Aligned Language Model for Targeted Inorganic Materials Design Paper • 2509.07150 • Published Sep 8, 2025 • 1
view article Article DeepSeek-R1 Dissection: Understanding PPO & GRPO Without Any Prior Reinforcement Learning Knowledge NormalUhr • Feb 7, 2025 • 297
DAPO: An Open-Source LLM Reinforcement Learning System at Scale Paper • 2503.14476 • Published Mar 18, 2025 • 146