┐ ╖ ╓╖╬│╡ ││╬╖╖ ╓╖╬│││││┘ ╬│││││╬╖ ╖╬│││││╬╜ ╙╬│││││╖╖ ╗╗╗ ╬╬╬╬╖││╦╖ ╖╬││╗╣╣╣╬ ╟╣╣╬ ╟╣╣╣ ╜╜╜ ╟╣╣ ╬╬╬╬╬╬╬╬╖│╬╖╖╓╬╪│╓╣╣╣╣╣╣╣╬ ╟╣╣╬ ╟╣╣╣ ╒╣╣╖╗╣╣╣╗ ╣╣╣ ╣╣╣╣╣╣ ╟╣╣╖ ╣╣╣ ╬╬╬╬┐ ╙╬╬╬╬│╓╣╣╣╝╜ ╫╣╣╣╬ ╟╣╣╬ ╟╣╣╣ ╟╣╣╣╙ ╙╣╣╣ ╣╣╣ ╙╟╣╣╜╙ ╫╣╣ ╟╣╣ ╬╬╬╬┐ ╙╬╬╣╣ ╫╣╣╣╬ ╟╣╣╬ ╟╣╣╣ ╟╣╣╬ ╣╣╣ ╣╣╣ ╟╣╣ ╣╣╣┌╣╣╜ ╬╬╬╜ ╬╬╣╣ ╙╝╣╣╬ ╙╣╣╣╗╖╓╗╣╣╣╜ ╟╣╣╬ ╣╣╣ ╣╣╣ ╟╣╣╦╓ ╣╣╣╣╣ ╙ ╓╦╖ ╬╬╣╣ ╓╗╗╖ ╙╝╣╣╣╣╝╜ ╘╝╝╜ ╝╝╝ ╝╝╝ ╙╣╣╣ ╟╣╣╣ ╩╬╬╬╬╬╬╦╦╬╬╣╣╗╣╣╣╣╣╣╣╝ ╫╣╣╣╣ ╙╬╬╬╬╬╬╬╣╣╣╣╣╣╝╜ ╙╬╬╬╣╣╣╜ ╙ Version information: ml-agents: 1.2.0.dev0, ml-agents-envs: 1.2.0.dev0, Communicator API: 1.5.0, PyTorch: 2.2.2+cu121 [INFO] Connected to Unity environment with package version 2.2.1-exp.1 and communication version 1.5.0 [INFO] Connected new brain: Pyramids?team=0 [INFO] Hyperparameters for behavior name Pyramids: trainer_type: ppo hyperparameters: batch_size: 128 buffer_size: 2048 learning_rate: 0.0003 beta: 0.01 epsilon: 0.2 lambd: 0.95 num_epoch: 3 shared_critic: False learning_rate_schedule: linear beta_schedule: linear epsilon_schedule: linear checkpoint_interval: 500000 network_settings: normalize: False hidden_units: 512 num_layers: 2 vis_encode_type: simple memory: None goal_conditioning_type: hyper deterministic: False reward_signals: extrinsic: gamma: 0.99 strength: 1.0 network_settings: normalize: False hidden_units: 128 num_layers: 2 vis_encode_type: simple memory: None goal_conditioning_type: hyper deterministic: False rnd: gamma: 0.99 strength: 0.01 network_settings: normalize: False hidden_units: 64 num_layers: 3 vis_encode_type: simple memory: None goal_conditioning_type: hyper deterministic: False learning_rate: 0.0001 encoding_size: None init_path: None keep_checkpoints: 5 even_checkpoints: False max_steps: 1000000 time_horizon: 128 summary_freq: 10000 threaded: False self_play: None behavioral_cloning: None [INFO] Pyramids. Step: 10000. Time Elapsed: 79.680 s. No episode was completed since last summary. Training. [INFO] Pyramids. Step: 20000. Time Elapsed: 154.731 s. Mean Reward: -1.000. Std of Reward: 0.000. Training. [INFO] Pyramids. Step: 30000. Time Elapsed: 264.587 s. No episode was completed since last summary. Training. [INFO] Pyramids. Step: 40000. Time Elapsed: 382.006 s. Mean Reward: -1.000. Std of Reward: 0.000. Training. [INFO] Pyramids. Step: 50000. Time Elapsed: 516.293 s. Mean Reward: -1.000. Std of Reward: 0.000. Training. [INFO] Pyramids. Step: 60000. Time Elapsed: 708.649 s. Mean Reward: 1.266. Std of Reward: 0.000. Training. [INFO] Learning was interrupted. Please wait while the graph is generated. [INFO] Exported results/Pyramids-course-20260925-v2/Pyramids/Pyramids-63991.onnx [INFO] Copied results/Pyramids-course-20260925-v2/Pyramids/Pyramids-63991.onnx to results/Pyramids-course-20260925-v2/Pyramids.onnx.