umesh251 commited on
Commit
b92afa8
·
verified ·
1 Parent(s): d6a26cf

Push PPO LunarLander-v2 agent to the Hub

Browse files
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ replay.mp4 filter=lfs diff=lfs merge=lfs -text
README.md CHANGED
@@ -1,10 +1,11 @@
1
  ---
2
- library_name: stable-baselines3
3
  tags:
4
  - LunarLander-v2
 
5
  - deep-reinforcement-learning
6
  - reinforcement-learning
7
- - stable-baselines3
 
8
  model-index:
9
  - name: PPO
10
  results:
@@ -16,22 +17,24 @@ model-index:
16
  type: LunarLander-v2
17
  metrics:
18
  - type: mean_reward
19
- value: 264.12 +/- 15.25
20
  name: mean_reward
21
  verified: false
22
  ---
23
 
24
- # **PPO** Agent playing **LunarLander-v2**
25
- This is a trained model of a **PPO** agent playing **LunarLander-v2**
26
- using the [stable-baselines3 library](https://github.com/DLR-RM/stable-baselines3).
27
 
28
- ## Usage (with Stable-baselines3)
29
- TODO: Add your code
30
 
 
31
 
32
- ```python
33
- from stable_baselines3 import ...
34
- from huggingface_sb3 import load_from_hub
35
 
36
- ...
37
- ```
 
 
 
 
 
 
 
1
  ---
 
2
  tags:
3
  - LunarLander-v2
4
+ - ppo
5
  - deep-reinforcement-learning
6
  - reinforcement-learning
7
+ - custom-implementation
8
+ - deep-rl-course
9
  model-index:
10
  - name: PPO
11
  results:
 
17
  type: LunarLander-v2
18
  metrics:
19
  - type: mean_reward
20
+ value: 35.32 +/- 57.58
21
  name: mean_reward
22
  verified: false
23
  ---
24
 
25
+ # PPO Agent Playing LunarLander-v2
 
 
26
 
27
+ This is a PPO agent trained from scratch using PyTorch.
 
28
 
29
+ ## Evaluation
30
 
31
+ Mean reward: 35.32 +/- 57.58
 
 
32
 
33
+ Evaluation episodes: 10
34
+
35
+ ## Files
36
+
37
+ - `model.pt` — trained PPO model weights
38
+ - `replay.mp4` — replay video
39
+ - `results.json` — evaluation results
40
+ - `hyperparameters.json` — training configuration
hyperparameters.json ADDED
@@ -0,0 +1,4 @@
 
 
 
 
 
1
+ {
2
+ "batch_size": 512,
3
+ "minibatch_size": 128
4
+ }
logs/events.out.tfevents.1789204122.cfd3f46d3e47.803.0 ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8667f63367c8a2404c82ab10205e829e5be019e845fec2ad1a3d077ae4731fd0
3
+ size 669151
model.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b84b61b090ff17e6fb838e8b70c3ddd2e873d9b102c5f1712a5ca1e1b69a2938
3
+ size 43419
replay.mp4 ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4cf1311c3e08ba64f67f520765e9a8e715c6422b6ec9ccf85cec2f2d1a5729af
3
+ size 185877
results.json CHANGED
@@ -1 +1,7 @@
1
- {"mean_reward": 264.11657990000003, "std_reward": 15.246895270158488, "is_deterministic": true, "n_eval_episodes": 10, "eval_datetime": "2026-09-11T06:20:13.536000"}
 
 
 
 
 
 
 
1
+ {
2
+ "env_id": "LunarLander-v2",
3
+ "mean_reward": 35.31697097242282,
4
+ "std_reward": 57.58304267882205,
5
+ "n_evaluation_episodes": 10,
6
+ "eval_datetime": "2026-09-12T09:17:46.857908"
7
+ }