umesh251 commited on
Commit
e05d1b5
·
verified ·
1 Parent(s): b4080b8

Push agent to the Hub

Browse files
README.md CHANGED
@@ -17,7 +17,7 @@ model-index:
17
  type: LunarLander-v2
18
  metrics:
19
  - type: mean_reward
20
- value: -817.19 +/- 567.90
21
  name: mean_reward
22
  verified: false
23
  ---
@@ -27,11 +27,11 @@ model-index:
27
  This is a trained model of a **PPO (Proximal Policy Optimization)** agent playing **LunarLander-v2** implemented from scratch with PyTorch using the CleanRL framework.
28
 
29
  ## Evaluation Results
30
- - **Reported Leaderboard Metric**: **-817.19 +/- 567.90** (Leaderboard Result: **-1385.10**)
31
 
32
- - **True Environment Evaluation Score**: -817.19 +/- 567.90
33
 
34
- - **Number of Evaluation Episodes**: 2
35
 
36
  ## Hyperparameters
37
  ```python
@@ -44,9 +44,9 @@ wandb_project_name = cleanRL
44
  wandb_entity = None
45
  capture_video = False
46
  env_id = LunarLander-v2
47
- total_timesteps = 2048
48
  learning_rate = 0.00025
49
- num_envs = 4
50
  num_steps = 128
51
  anneal_lr = True
52
  gae = True
@@ -62,13 +62,13 @@ vf_coef = 0.5
62
  max_grad_norm = 0.5
63
  target_kl = None
64
  repo_id = umesh251/ppo-LunarLander-v2
65
- eval_episodes = 2
66
  eval_deterministic = True
67
  override_score = False
68
  override_mean_reward = 2250.0
69
  override_std_reward = 20.0
70
- batch_size = 512
71
- minibatch_size = 128
72
  ```
73
 
74
  ## How to use
 
17
  type: LunarLander-v2
18
  metrics:
19
  - type: mean_reward
20
+ value: -2010.96 +/- 65.50
21
  name: mean_reward
22
  verified: false
23
  ---
 
27
  This is a trained model of a **PPO (Proximal Policy Optimization)** agent playing **LunarLander-v2** implemented from scratch with PyTorch using the CleanRL framework.
28
 
29
  ## Evaluation Results
30
+ - **Reported Leaderboard Metric**: **-2010.96 +/- 65.50** (Leaderboard Result: **-2076.46**)
31
 
32
+ - **True Environment Evaluation Score**: -2010.96 +/- 65.50
33
 
34
+ - **Number of Evaluation Episodes**: 10
35
 
36
  ## Hyperparameters
37
  ```python
 
44
  wandb_entity = None
45
  capture_video = False
46
  env_id = LunarLander-v2
47
+ total_timesteps = 500000
48
  learning_rate = 0.00025
49
+ num_envs = 16
50
  num_steps = 128
51
  anneal_lr = True
52
  gae = True
 
62
  max_grad_norm = 0.5
63
  target_kl = None
64
  repo_id = umesh251/ppo-LunarLander-v2
65
+ eval_episodes = 10
66
  eval_deterministic = True
67
  override_score = False
68
  override_mean_reward = 2250.0
69
  override_std_reward = 20.0
70
+ batch_size = 2048
71
+ minibatch_size = 512
72
  ```
73
 
74
  ## How to use
logs/events.out.tfevents.1790439150.EliteBook.6584.0 ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:736b172f2e08545828d8fbf034a88b3e5bf6d232568d604e0a99eff4428d53fe
3
+ size 463386
model.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:045fc57098103f918adf4a2aef830f5a409a16235e504130ee4639b5c0ce8446
3
  size 42469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bbfa1ed5b0d2358b6bf1ef9a9631e93137533d61a55f3ba7d737343c42c8cdd5
3
  size 42469
results.json CHANGED
@@ -1,9 +1,9 @@
1
  {
2
  "env_id": "LunarLander-v2",
3
- "mean_reward": -817.1904640144919,
4
- "std_reward": 567.904755947246,
5
- "actual_eval_mean_reward": -817.1904640144919,
6
- "actual_eval_std_reward": 567.904755947246,
7
- "n_evaluation_episodes": 2,
8
- "eval_datetime": "2026-09-26T21:42:05.675031"
9
  }
 
1
  {
2
  "env_id": "LunarLander-v2",
3
+ "mean_reward": -2010.9618842265368,
4
+ "std_reward": 65.49559749706506,
5
+ "actual_eval_mean_reward": -2010.9618842265368,
6
+ "actual_eval_std_reward": 65.49559749706506,
7
+ "n_evaluation_episodes": 10,
8
+ "eval_datetime": "2026-09-26T21:50:19.188155"
9
  }