act_film_224 — 원-핫 + FiLM 알약 조제 정책

섞여 있는 알약 중 지정한 색 하나만 집어 약통에 담습니다. 검출기 없이 정책이 화면에서 직접 색을 찾습니다.

실기 결과: 3색 연속 조제 성공 — 같은 배치에서 알약을 건드리지 않고 지시 색만 바꿔 3/3 (2026-08-14)

목표를 어떻게 받는가

3차원 원-핫 벡터입니다.

observation.environment_state = [goal_yellow, goal_red, goal_green]

중요한 것은 넣는 방식입니다. 같은 원-핫이라도 관측의 한 칸으로 끼워 넣은 판(act_v3_3color)은 자기색 대비 1.00 으로 지시를 완전히 무시했습니다. 목표가 수백 개 입력 중 세 칸뿐이라 어텐션에서 존재감이 없고, 무시해도 손실이 오르지 않으니 실제로 무시합니다.

FiLM 은 목표에서 γ, β 를 뽑아 모든 시각 특징의 모든 채널을 변조합니다.

f' = (1 + γ) · f + β

한 칸이 아니라 전체가 바뀌므로 무시할 수 없습니다. 같은 정보, 같은 모델, 같은 데이터인데 넣는 경로만 바꿔 실패가 성공이 됐습니다.

오프라인 지표를 믿지 마십시오

이 정책의 자기색 대비는 1.25 로, 기준선(1.02) 바로 위입니다. "목표를 거의 안 본다"로 읽고 폐기할 뻔했으나 실기는 3/3 이었습니다.

오프라인은 프레임 하나로 궤적을 한 번 예측하는 열린 루프이고, 실기는 매 스텝 다시 예측하며 앙상블로 누적되는 닫힌 루프입니다. 팔이 빨강 쪽으로 조금만 기울면 다음 프레임에서 빨강이 화면 중앙에 오고, 그것이 다시 방향을 굳힙니다. 약한 신호가 증폭되는 것입니다.

쓰는 법

from lerobot.policies.act.modeling_act import ACTPolicy
policy = ACTPolicy.from_pretrained("kimy0420/act_film_224")

observation.environment_state 에 원-핫을 넣습니다 (순서: yellow, red, green). 데이터셋: kimy0420/pill_v3_onehot_224

사양

항목
구조 ACT (chunk 100, temporal ensembling, FiLM 목표 조건화)
학습 128,000 스텝 · 배치 8
관측 top·wrist 카메라 (640×480), 관절 6, 목표 원-핫 3
체크포인트 100000

함께 보기

정책 목표 전달 색을 찾는 주체
act_xy_224 화면 좌표 HSV 검출기
smolvla_v10 좌표를 관측 상태로 HSV 검출기
act_film_224 원-핫 + FiLM 정책

알아둘 것

  • 색을 추가하려면 원-핫 차원이 바뀌므로 재학습이 필요합니다. 좌표 방식은 HSV 범위 한 줄만 추가하면 됩니다.
  • 색상 증강(밝기·대비 흔들기)은 쓰지 않았습니다. 색 판별에 필요한 신호를 훼손해 목표를 더 무시하게 만들었습니다.
Downloads last month
15
Safetensors
Model size
52.2M params
Tensor type
F32
·
Video Preview
loading