Xuekang Wang
wxk123
ยท
AI & ML interests
LLM Safety
Recent Activity
authored a paper about 2 months ago
Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning upvoted a paper about 2 months ago
Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning updated a model 7 months ago
wxk123/llama-3.2-1b-instruct-augmented