Hugging Face's logo Hugging Face
  • Models
  • Datasets
  • Spaces
  • Buckets new
  • Docs
  • Enterprise
  • Pricing
    • Website
      • Tasks
      • HuggingChat
      • Collections
      • Languages
      • Organizations
    • Community
      • Blog
      • Posts
      • Daily Papers
      • Hardware
      • Learn
      • Discord
      • Forum
      • GitHub
    • Solutions
      • Team & Enterprise
      • Hugging Face PRO
      • Enterprise Support
      • Inference Providers
      • Inference Endpoints
      • Storage Buckets

  • Log In
  • Sign Up

joshycodes
/
bad-rl-adapters

PEFT
Safetensors
lora
grafting
reward-hacking
alignment
Model card Files Files and versions
xet
Community

Instructions to use joshycodes/bad-rl-adapters with libraries, inference providers, notebooks, and local apps. Follow these links to get started.

  • Libraries
  • PEFT

    How to use joshycodes/bad-rl-adapters with PEFT:

    Task type is invalid.
  • Notebooks
  • Google Colab
  • Kaggle
bad-rl-adapters
78.2 GB
Ctrl+K
Ctrl+K
  • 1 contributor
History: 108 commits
joshycodes's picture
joshycodes
add gemma-3-12b/difficult-advice-sft/control-3m-seed0
83c3d17 verified about 9 hours ago
  • gemma-3-12b
    add gemma-3-12b/difficult-advice-sft/control-3m-seed0 about 9 hours ago
  • gemma-3-27b
    add gemma-3-27b/robustness/neutral-control-seed2 about 22 hours ago
  • llama-3.1-8b
    add llama-3.1-8b/robustness/neutral-control-seed2 1 day ago
  • nemotron-nano-12b-v2
    add nemotron-nano-12b-v2/robustness/neutral-control-seed2 about 22 hours ago
  • nemotron-nano-9b-v2
    add nemotron-nano-9b-v2/grafted-paper-recipe/10m 1 day ago
  • qwen3-14b
    add qwen3-14b/robustness/10m-seed2 about 21 hours ago
  • qwen3-4b
    add qwen3-4b/robustness/neutral-control about 20 hours ago
  • qwen3.5-9b
    add qwen3.5-9b/robustness/neutral-control about 21 hours ago
  • .gitattributes
    1.52 kB
    initial commit 1 day ago
  • README.md
    4.15 kB
    README about 21 hours ago