Arjun Patel
apatel-1995
ยท
AI & ML interests
Reinforcement learning, reward modeling, RLHF, policy optimization, offline RL
Recent Activity
liked a model 34 minutes ago
santiviquez/reward_modeling_anthropic_hh liked a model 34 minutes ago
H0key/Veri-R1_Llama3.2-3B-Instruct-OfflineRL upvoted a paper 35 minutes ago
A Lie Detector Test for Language Models: Reading Knowledge a Model Won't RevealOrganizations
None yet