YAML Metadata Warning:empty or missing yaml metadata in repo card
Check out the documentation for more information.
🤖 Pick & Stack (블록 집기 및 순차 적재) 모델
모델명: task12_act_v3
- 데이터셋 구성 (Dataset)
1.1 이전 모델과의 차이점
Task 데이터셋 통합: 기존에는 task1(블록 옮기기), task2(탑 쌓기)를 각각 별도 데이터셋/모델로 학습 이번 버전은 두 task 데이터를 하나의 데이터셋으로 병합하고, environment_state(0=task1, 1=task2) 값으로 두 task를 구분하도록 구성
kl_weight 파라미터 조정: 기본값인 10.0에서 1.0으로 하향 조정함.
파라미터의 역할: kl_weight는 ACT의 CVAE 손실 함수(Loss)에서 잠재 공간(Latent Space)의 정규 분포 규제(KL Divergence) 비중을 결정함.
수정 이유: 높은 kl_weight 설정 시 발생하는 Posterior Collapse(잠재 공간 단순화 현상)를 완화하기 위함. 기존 10.0 환경에서는 모델이 카메라 관측 정보(시각/상태)보다 고정된 평균 궤적에 지나치게 의존하여, 특정 위치로 제어 손끝이 쏠리거나 목표물과의 미세 거리 감각을 잃는 문제가 존재했음.
기대 효과: KL 규제를 완화함으로써 입력되는 비전 데이터(Top/Wrist 카메라)와 로봇 상태값의 영향력을 대폭 강화하여, 목표 블록의 미세한 위치 차이나 정밀 거리 조절 능력을 향상시킴.
1.2 전체 데이터셋 구조
- grad_block_merged_task12_v2
- 모델 학습 방식 (Training Procedure)
2.1 모델 아키텍처 (ACT 기반)
차이 없음
2.2 서버 추론 기반 시스템 및 통신
- jetson-server 소켓 통신 구조는 기존과 동일
- request에 environment_state 필드 추가 → 서버가 이 값으로 task1/task2 구분
2.3 Chunk 및 Step 차이
차이 없음
- 수행 결과 (Evaluation & Results)
3.1 수행 결과
[task1 — 블록 옮기기]
고정 위치: 총 5회 시도, 옮긴 블록 개수 1, 1, 2, 0, 2 (평균 1.2개)
랜덤 위치: 총 5회 시도, 옮긴 블록 개수 0(아래쪽), 2(위쪽), 1(왼쪽), 2(오른쪽), 1(아래쪽) (평균 1.2개)
[task2 — 탑 쌓기]
고정 위치, 랜덤 위치 모두 2단까지는 대체로 도달하나, 3단째부터 무너지는 현상이 반복적으로 발생하여 2단을 넘는 성공 사례를 아직 확보하지 못함
대체로 중심을 맞추어 쌓지 못하고 종종 2열로 나누어 쌓음
3.2 결과 피드백
성능 및 정밀도: kl_weight를 1.0으로 낮춘 결과, 관측 시각 데이터에 대한 반응성이 향상되어 이전 버전에서 관찰되던 특정 고정 위치로의 쏠림 현상(Posterior Collapse) 및 목표물 부근에서의 거리 감각 부족 문제가 소폭 개선됨. 그러나 W&B 로그 확인 결과 kld loss가 여전히 0에 가깝게 급격히 수렴함. 따라서 단순한 kl_weight 파라미터 조절만으로는 Posterior collapse 문제를 근본적으로 해결하기 어렵다고 판단함.
한계점 (Jittering 발생): 시각 데이터 및 상태값 노이즈에 대한 민감도가 높아지면서, kl_weight=10.0 일 때보다 로봇 제어 궤적에 미세한 덜덜거림(Jittering) 및 불연속적 움직임이 유발됨을 확인함.
향후 계획: kl_weight=1.0이 제공하는 높은 관측 민감도 및 정밀도를 유지하면서 궤적의 안정성을 확보하기 위해, 추론(Inference) 단계에 Temporal Ensembling (시그모이드 기반 지수 가중 앙상블) 기법을 적용하여 동작을 연속적이고 부드럽게 보정하여 재테스트할 예정임.
- Downloads last month
- 71