act_xy_224 — 좌표 조건화 알약 조제 정책

섞여 있는 알약 중 지정한 색 하나만 집어 약통에 담는 정책입니다. OpenManipulator-X 로 수집한 224 에피소드를 ACT 로 학습했습니다.

실기 결과: 3색 연속 조제 성공 (2026-08-17)

목표를 어떻게 받는가

색 이름이 아니라 화면 좌표를 받습니다.

observation.environment_state = (goal_u, goal_v)   정규화된 top 카메라 좌표

색을 찾는 일은 HSV 검출기가 하고, 정책은 "거기로 가서 집기"만 합니다. 어려운 부분을 정책에서 덜어낸 것이 이 방식이 이긴 이유입니다.

색 이름만으로는 방향을 정할 수 없습니다 — 알약 위치를 매 에피소드 무작위로 바꿨기 때문입니다. 실측으로도 색이 행동을 설명하는 정도가 어느 구간에서도 0.21 을 넘지 않았습니다.

검증

학습에 한 번도 나온 적 없는 임의 좌표를 줘서 암기가 아님을 확인했습니다. 암기라면 대응 궤적이 없어 아무 데나 가야 합니다.

지표
자유 좌표 추종 상관 +0.484
기울기 +0.29
자기색 오차 0.833

쓰는 법

from lerobot.policies.act.modeling_act import ACTPolicy
policy = ACTPolicy.from_pretrained("kimy0420/act_xy_224")

매 프레임 observation.environment_state 에 목표 알약의 정규화 좌표를 넣어 주어야 합니다. 데이터셋: kimy0420/pill_v3_xy

사양

항목
구조 ACT (chunk 100, temporal ensembling)
학습 250,000 스텝 · 배치 8 · 8.1 에폭
관측 top·wrist 카메라 (640×480), 관절 6, 목표 좌표 2
행동 관절 6 (Dynamixel)
체크포인트 150000

함께 보기

정책 목표 전달 실기
act_film_224 원-핫 + FiLM 3색 연속 성공 (검출기 불필요)
smolvla_v10 좌표를 관측 상태로 성공 (SmolVLA 로는 처음)

알아둘 것

  • 오프라인 지표로 체크포인트를 고를 수 없습니다. 이 프로젝트에서 오프라인 순위와 실기 순위가 어긋난 사례가 세 번 있었습니다. 최종 선정은 실기로 했습니다.
  • 자기 색을 담은 뒤 정지 조건이 완전하지 않습니다. 트레이에 목표 색이 없을 때 멈추는 것은 현재 검출기가 개입해 처리합니다.
Downloads last month
14
Safetensors
Model size
52.2M params
Tensor type
F32
·
Video Preview
loading