Hugging Face's logo Hugging Face
  • Models
  • Datasets
  • Spaces
  • Buckets new
  • Docs
  • Enterprise
  • Pricing
    • Website
      • Tasks
      • HuggingChat
      • Collections
      • Languages
      • Organizations
    • Community
      • Blog
      • Posts
      • Daily Papers
      • Hardware
      • Learn
      • Discord
      • Forum
      • GitHub
    • Solutions
      • Team & Enterprise
      • Hugging Face PRO
      • Enterprise Support
      • Inference Providers
      • Inference Endpoints
      • Storage Buckets

  • Log In
  • Sign Up
W Wang's picture

W Wang

LBanBan
3 1
·

AI & ML interests

learning MLLM~

Recent Activity

upvoted a paper about 8 hours ago
SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation
upvoted a paper 6 days ago
DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space
upvoted a paper 6 days ago
CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization
View all activity

Organizations

None yet

upvoted a paper about 8 hours ago

SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation

Paper • 2608.03092 • Published 1 day ago • 10
upvoted 2 papers 6 days ago

DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space

Paper • 2607.25675 • Published 8 days ago • 65

CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization

Paper • 2607.25659 • Published 8 days ago • 83
updated a model about 1 year ago

LBanBan/MATS

Updated Jul 16, 2025
published a model about 1 year ago

LBanBan/MATS

Updated Jul 16, 2025
liked a model almost 2 years ago

facebook/audiogen-medium

Updated Mar 12, 2024 • 28.1k • 147
Company
TOS Privacy About Careers
Website
Models Datasets Spaces Pricing Docs