William Smith
William288
AI & ML interests
None yet
Recent Activity
upvoted a paper about 3 hours ago
SAKI: Maximal-Coupling-Routed Teacher Supervision for On-Policy Distillation upvoted a paper about 3 hours ago
TGRL: Temperature-Grouped Reinforcement Learning for Efficient Exploration in LLMs upvoted a paper 2 months ago
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement LearningOrganizations
None yet