Reinforcement Learning
ml-agents
TensorBoard
ONNX
SnowballTarget
deep-reinforcement-learning
ML-Agents-SnowballTarget
Instructions to use amblecoder/ppo-SnowballTarget-practice with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- ml-agents
How to use amblecoder/ppo-SnowballTarget-practice with ml-agents:
mlagents-load-from-hf --repo-id="amblecoder/ppo-SnowballTarget-practice" --local-dir="./download: string[]s"
- Notebooks
- Google Colab
- Kaggle
| { | |
| "name": "root", | |
| "gauges": { | |
| "SnowballTarget.Policy.Entropy.mean": { | |
| "value": 0.8669039011001587, | |
| "min": 0.8542680740356445, | |
| "max": 2.8539304733276367, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.Entropy.sum": { | |
| "value": 8239.0546875, | |
| "min": 8239.0546875, | |
| "max": 29132.921875, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Step.mean": { | |
| "value": 199984.0, | |
| "min": 9952.0, | |
| "max": 199984.0, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Step.sum": { | |
| "value": 199984.0, | |
| "min": 9952.0, | |
| "max": 199984.0, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.ExtrinsicValueEstimate.mean": { | |
| "value": 13.045256614685059, | |
| "min": 0.34381920099258423, | |
| "max": 13.045256614685059, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.ExtrinsicValueEstimate.sum": { | |
| "value": 2543.824951171875, | |
| "min": 66.700927734375, | |
| "max": 2659.551025390625, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Losses.PolicyLoss.mean": { | |
| "value": 0.07671483712778461, | |
| "min": 0.06216983036807398, | |
| "max": 0.07671483712778461, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Losses.PolicyLoss.sum": { | |
| "value": 0.30685934851113844, | |
| "min": 0.24867932147229593, | |
| "max": 0.37510800997576965, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Losses.ValueLoss.mean": { | |
| "value": 0.1829497077155347, | |
| "min": 0.13138355572443164, | |
| "max": 0.32315493396976414, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Losses.ValueLoss.sum": { | |
| "value": 0.7317988308621388, | |
| "min": 0.5255342228977266, | |
| "max": 1.5594984322201972, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.LearningRate.mean": { | |
| "value": 8.082097306000005e-06, | |
| "min": 8.082097306000005e-06, | |
| "max": 0.000291882002706, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.LearningRate.sum": { | |
| "value": 3.232838922400002e-05, | |
| "min": 3.232838922400002e-05, | |
| "max": 0.00138516003828, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.Epsilon.mean": { | |
| "value": 0.10269400000000001, | |
| "min": 0.10269400000000001, | |
| "max": 0.19729400000000002, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.Epsilon.sum": { | |
| "value": 0.41077600000000003, | |
| "min": 0.41077600000000003, | |
| "max": 0.96172, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.Beta.mean": { | |
| "value": 0.0001444306000000001, | |
| "min": 0.0001444306000000001, | |
| "max": 0.0048649706, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.Beta.sum": { | |
| "value": 0.0005777224000000004, | |
| "min": 0.0005777224000000004, | |
| "max": 0.023089828, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Environment.EpisodeLength.mean": { | |
| "value": 199.0, | |
| "min": 199.0, | |
| "max": 199.0, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Environment.EpisodeLength.sum": { | |
| "value": 8756.0, | |
| "min": 8756.0, | |
| "max": 10945.0, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Environment.CumulativeReward.mean": { | |
| "value": 25.431818181818183, | |
| "min": 3.8636363636363638, | |
| "max": 25.763636363636362, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Environment.CumulativeReward.sum": { | |
| "value": 1119.0, | |
| "min": 170.0, | |
| "max": 1417.0, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.ExtrinsicReward.mean": { | |
| "value": 25.431818181818183, | |
| "min": 3.8636363636363638, | |
| "max": 25.763636363636362, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.ExtrinsicReward.sum": { | |
| "value": 1119.0, | |
| "min": 170.0, | |
| "max": 1417.0, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.IsTraining.mean": { | |
| "value": 1.0, | |
| "min": 1.0, | |
| "max": 1.0, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.IsTraining.sum": { | |
| "value": 1.0, | |
| "min": 1.0, | |
| "max": 1.0, | |
| "count": 20 | |
| } | |
| }, | |
| "metadata": { | |
| "timer_format_version": "0.1.0", | |
| "start_time_seconds": "1746693054", | |
| "python_version": "3.10.12 (main, Jul 5 2023, 18:54:27) [GCC 11.2.0]", | |
| "command_line_arguments": "/usr/local/bin/mlagents-learn ./config/ppo/SnowballTarget.yaml --env=./training-envs-executables/linux/SnowballTarget/SnowballTarget --run-id=SnowballTarget1 --no-graphics", | |
| "mlagents_version": "1.2.0.dev0", | |
| "mlagents_envs_version": "1.2.0.dev0", | |
| "communication_protocol_version": "1.5.0", | |
| "pytorch_version": "2.7.0+cu126", | |
| "numpy_version": "1.23.5", | |
| "end_time_seconds": "1746693490" | |
| }, | |
| "total": 436.034389661, | |
| "count": 1, | |
| "self": 0.43317475300011665, | |
| "children": { | |
| "run_training.setup": { | |
| "total": 0.033180917999970916, | |
| "count": 1, | |
| "self": 0.033180917999970916 | |
| }, | |
| "TrainerController.start_learning": { | |
| "total": 435.5680339899999, | |
| "count": 1, | |
| "self": 0.3564037760061183, | |
| "children": { | |
| "TrainerController._reset_env": { | |
| "total": 3.555696805000025, | |
| "count": 1, | |
| "self": 3.555696805000025 | |
| }, | |
| "TrainerController.advance": { | |
| "total": 431.57398157799355, | |
| "count": 18192, | |
| "self": 0.4076620980121106, | |
| "children": { | |
| "env_step": { | |
| "total": 308.11906179800894, | |
| "count": 18192, | |
| "self": 235.620112046009, | |
| "children": { | |
| "SubprocessEnvManager._take_step": { | |
| "total": 72.27630777398963, | |
| "count": 18192, | |
| "self": 1.2883949009819844, | |
| "children": { | |
| "TorchPolicy.evaluate": { | |
| "total": 70.98791287300764, | |
| "count": 18192, | |
| "self": 70.98791287300764 | |
| } | |
| } | |
| }, | |
| "workers": { | |
| "total": 0.2226419780103015, | |
| "count": 18192, | |
| "self": 0.0, | |
| "children": { | |
| "worker_root": { | |
| "total": 434.14268979900214, | |
| "count": 18192, | |
| "is_parallel": true, | |
| "self": 228.5980197309932, | |
| "children": { | |
| "run_training.setup": { | |
| "total": 0.0, | |
| "count": 0, | |
| "is_parallel": true, | |
| "self": 0.0, | |
| "children": { | |
| "steps_from_proto": { | |
| "total": 0.006460906999905092, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.004770648999851801, | |
| "children": { | |
| "_process_rank_one_or_two_observation": { | |
| "total": 0.0016902580000532907, | |
| "count": 10, | |
| "is_parallel": true, | |
| "self": 0.0016902580000532907 | |
| } | |
| } | |
| }, | |
| "UnityEnvironment.step": { | |
| "total": 0.03864218299997901, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.0005881839999801741, | |
| "children": { | |
| "UnityEnvironment._generate_step_input": { | |
| "total": 0.0004322439999668859, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.0004322439999668859 | |
| }, | |
| "communicator.exchange": { | |
| "total": 0.03567178400010107, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.03567178400010107 | |
| }, | |
| "steps_from_proto": { | |
| "total": 0.0019499709999308834, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.000383360999649085, | |
| "children": { | |
| "_process_rank_one_or_two_observation": { | |
| "total": 0.0015666100002817984, | |
| "count": 10, | |
| "is_parallel": true, | |
| "self": 0.0015666100002817984 | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| }, | |
| "UnityEnvironment.step": { | |
| "total": 205.54467006800894, | |
| "count": 18191, | |
| "is_parallel": true, | |
| "self": 9.848687790005897, | |
| "children": { | |
| "UnityEnvironment._generate_step_input": { | |
| "total": 5.478380924998987, | |
| "count": 18191, | |
| "is_parallel": true, | |
| "self": 5.478380924998987 | |
| }, | |
| "communicator.exchange": { | |
| "total": 158.67712640300056, | |
| "count": 18191, | |
| "is_parallel": true, | |
| "self": 158.67712640300056 | |
| }, | |
| "steps_from_proto": { | |
| "total": 31.5404749500035, | |
| "count": 18191, | |
| "is_parallel": true, | |
| "self": 5.724978705006606, | |
| "children": { | |
| "_process_rank_one_or_two_observation": { | |
| "total": 25.815496244996893, | |
| "count": 181910, | |
| "is_parallel": true, | |
| "self": 25.815496244996893 | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| }, | |
| "trainer_advance": { | |
| "total": 123.0472576819725, | |
| "count": 18192, | |
| "self": 0.45643055796369936, | |
| "children": { | |
| "process_trajectory": { | |
| "total": 28.236974126009045, | |
| "count": 18192, | |
| "self": 27.769748099009007, | |
| "children": { | |
| "RLTrainer._checkpoint": { | |
| "total": 0.4672260270000379, | |
| "count": 4, | |
| "self": 0.4672260270000379 | |
| } | |
| } | |
| }, | |
| "_update_policy": { | |
| "total": 94.35385299799975, | |
| "count": 90, | |
| "self": 38.69314725399363, | |
| "children": { | |
| "TorchPPOOptimizer.update": { | |
| "total": 55.66070574400612, | |
| "count": 4587, | |
| "self": 55.66070574400612 | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| }, | |
| "trainer_threads": { | |
| "total": 8.080000952759292e-07, | |
| "count": 1, | |
| "self": 8.080000952759292e-07 | |
| }, | |
| "TrainerController._save_models": { | |
| "total": 0.08195102300010149, | |
| "count": 1, | |
| "self": 0.000861776000192549, | |
| "children": { | |
| "RLTrainer._checkpoint": { | |
| "total": 0.08108924699990894, | |
| "count": 1, | |
| "self": 0.08108924699990894 | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } |