Hugging Face
Models
Datasets
Spaces
Buckets
new
Docs
Enterprise
Pricing
Website
Tasks
HuggingChat
Collections
Languages
Organizations
Community
Blog
Posts
Daily Papers
Hardware
Learn
Discord
Forum
GitHub
Solutions
Team & Enterprise
Hugging Face PRO
Enterprise Support
Inference Providers
Inference Endpoints
Storage Buckets
Log In
Sign Up
Edit Models filters
Main
Tasks
Libraries
Languages
1
Licenses
Other
Reset Languages
English
Chinese
French
Spanish
German
Japanese
Korean
Portuguese
Italian
Russian
Arabic
Hindi
Thai
Turkish
multilingual
Vietnamese
Dutch
Polish
Indonesian
Swedish
Ukrainian
Romanian
Finnish
Czech
Persian
Bengali
Danish
Greek
Hebrew
Malay
Hungarian
Tamil
Nepali
Urdu
Telugu
Bulgarian
Swahili
Catalan
Norwegian
Marathi
Slovenian
Slovak
Estonian
Serbian
Gujarati
Lithuanian
Croatian
Latvian
Burmese
Malayalam
Panjabi
Icelandic
Kannada
Galician
Khmer
Tagalog
Kazakh
Basque
Afrikaans
Amharic
French
Georgian
Hausa
Mongolian
Assamese
Lao
Armenian
Macedonian
Welsh
Yoruba
Sinhala
Belarusian
Azerbaijani
Uzbek
Albanian
Maltese
Bosnian
Sindhi
Sanskrit
Somali
Irish
Latin
Javanese
Sundanese
Pashto
English
Shona
Malagasy
Oriya
Haitian
+ 5529 languages
Apply filters
Models
3,661
Base only
Inference Available
Inference
Edit filters
Sort: Trending
Active filters:
ppo
Clear all
ostap-khm/LunarLanderPPO
Reinforcement Learning
•
Updated
Jan 5
mykor/mmBERT-base-GGUF
0.3B
•
Updated
Jan 6
•
202
mykor/mmBERT-small-GGUF
0.1B
•
Updated
Jan 6
•
196
anonymousML123/llama3-8b-pku-PPO-NoInstruct-SFT-NoInstruct
Updated
Jan 5
anonymousML123/llama3-8b-pku-PPO-Instruct-SFT-Instruct
Updated
Jan 5
joshkaura/ppo-CartPole-v1
Reinforcement Learning
•
Updated
Jan 7
joshkaura/ppo-LunarLanding2-v2
Reinforcement Learning
•
Updated
Jan 7
waanney/ppo-CartPole-v1
Reinforcement Learning
•
Updated
Jan 8
seoseoheee/ppo-CartPole-v1
Reinforcement Learning
•
Updated
Jan 9
•
17
seoseoheee/ppo-LunarLander-v3
Reinforcement Learning
•
Updated
Jan 9
shiptoday101/beastybar-ppo
Reinforcement Learning
•
Updated
Jan 14
guardion/ModernGuard-1
Text Classification
•
0.3B
•
Updated
7 days ago
•
21.9k
•
7
Adi070204/ppo-Lunar-Lander-v2
Reinforcement Learning
•
Updated
Jan 13
acwkim/ppo-helpful
Reinforcement Learning
•
Updated
Jan 17
•
9
acwkim/ppo-harmless
Reinforcement Learning
•
Updated
Jan 17
•
7
acwkim/ppo-humor
Reinforcement Learning
•
Updated
Jan 17
•
9
Irisaka/ppo-cleanrl-LunarLander-v2
Reinforcement Learning
•
Updated
Jan 15
payelb/aligned_tinyllama_ultrafeedback_fixed1k_noaug
Updated
Jan 15
payelb/aligned_tinyllama_ultrafeedback_fixed1k_won
Updated
Jan 15
payelb/aligned_tinyllama_ultrafeedback_fixed1k_baseline
Updated
Jan 15
payelb/aligned_tinyllama_ultrafeedback_fixed1k_mars
Updated
Jan 15
jalaneunos/LunarLander-v3-ppo-1
Reinforcement Learning
•
Updated
Jan 16
Kolosok/ppo-CartPole-v1
Reinforcement Learning
•
Updated
Jan 16
Kolosok/ppo-LunarLander-v2_2
Reinforcement Learning
•
Updated
Jan 16
BrennanDrake/ppo-LunarLander-v2-1
Reinforcement Learning
•
Updated
Jan 18
GavinChan1105/Llama-3-8B-ppo-lora
Reinforcement Learning
•
Updated
Jan 20
•
13
•
1
ianyang02/ppo_model_qwen3-4b_aita_h200_one_ex
Updated
Jan 22
jinn33/kanana-1.5-8b-rlhf
Updated
Jan 21
nhankins/ppo-LunarLander-v3
Reinforcement Learning
•
Updated
Jan 21
Martox/Myppo-LunarLander
Reinforcement Learning
•
Updated
Jan 21
Previous
1
...
97
98
99
100
Next