allex-eef-AB-h16 β€” arm AB (CogAlign + action-latent)

ALLEX μ ˆλŒ€-EEF 50D RLDX-1 mid-train. arm N 에 두 κ°€μ§€κ°€ μΆ”κ°€λœλ‹€:

  1. CogAlign (cog loss) β€” pooled cog 토큰 β†’ state 50D μ •λ ¬, weight 0.2 (RLDX_COG_ADAPTER=1, RLDX_COG_ADAPTER_HID=256, RLDX_LATAL_FINGERTIP=0.2, RLDX_LATAL_HEAD=linear, RLDX_LATAL_FINGERTIP_FROM_STATE=1, RLDX_LATAL_FINGERTIP_DIM=50) fingertip μ’Œν‘œκ°€ μ—†μ–΄ state 50D μžμ²΄κ°€ μ •λ ¬ 타깃이닀.
  2. actlat β€” flow-matching 타깃이 μ›μ‹œ μ•‘μ…˜μ΄ μ•„λ‹ˆλΌ frozen action-only ν† ν¬λ‚˜μ΄μ €μ˜ z (--actlat-mode, --actlat-embodiment-id allex)

⚠️ 이 섀정은 ν™˜κ²½λ³€μˆ˜λ‘œλ§Œ λ“€μ–΄κ°€μ„œ conf.yaml 에 남지 μ•ŠλŠ”λ‹€. μœ„ 값이 정본이닀.

ꡬ쑰

경둜 λ‚΄μš©
checkpoint-20000/ step 20,000
checkpoint-30000/ step 30,000
checkpoint-40000/ step 40,000 (ν•™μŠ΅ μ§„ν–‰ 쀑, 60k λͺ©ν‘œ)
tokenizer/ eval 에 ν•„μš”ν•œ Stage-1 ν† ν¬λ‚˜μ΄μ € 일체

tokenizer/ β€” AB 좔둠에 λ°˜λ“œμ‹œ ν•„μš”

파일 μš©λ„
model.safetensors (37MB) action-only ν† ν¬λ‚˜μ΄μ € κ°€μ€‘μΉ˜ (100k μŠ€ν…)
tokenizer_config.json --actlat-tokenizer-path κ°€ μ½λŠ” μ„€μ •
norm_stats.json --actlat-prq-stats-path β€” ν† ν¬λ‚˜μ΄μ € μž…λ ₯ q01/q99
embodiments.runtime.json embodiment id λ§€ν•‘ (allex)

ν† ν¬λ‚˜μ΄μ €: allex_eef50_q99_split_w0p03_actiononly_bs512_h16_100k, action_dim 50 / horizon 16 / token_dim 64 / data_config allex_eef_h16. Stage-2 와 λ™μΌν•œ q99 μ •κ·œν™”λ₯Ό μ“΄λ‹€ (bit-identical 확인됨).

from huggingface_hub import snapshot_download
p = snapshot_download("jungwook2358/allex-eef-AB-h16",
                      allow_patterns=["checkpoint-40000/*", "tokenizer/*"])

곡톡 μ„€μ • (두 arm 동일)

  • base: RLWRLD/RLDX-1-PT-IMG
  • action: μ ˆλŒ€ EEF 50D = left_wrist_wrt_base 9 + right_wrist_wrt_base 9
    • left_hand_joints 15 + right_hand_joints 15 + neck_joints 2 (waist μ œμ™Έ, μƒλŒ€ν™” μ—†μŒ) μˆœμ„œλŠ” Stage-1 ν† ν¬λ‚˜μ΄μ €μ™€ Stage-2 RLDX κ°€ λ™μΌν•˜λ‹€ (left β†’ right β†’ neck).
  • horizon 16, embodiment_tag GENERAL_EMBODIMENT, --override-pretraining-statistics
  • μ •κ·œν™” q99: 2*(x-q01)/(q99-q01)-1 ν›„ clamp(-1,1). 3μ†ŒμŠ€ 병합톡계(q01=min-of-q01, q99=max-of-q99)
  • κΈ€λ‘œλ²Œ 배치 256 (2 GPU Γ— per-device 128, accum 1), lr 1e-4, 60,000 μŠ€ν…
  • 카메라 2λŒ€ (ego left/right), video_length 1, state_dropout 0.3
  • VLM 동결: tune_llm=False, tune_visual=False, tune_top_llm_layers=0
  • 데이터: robot allex v1v6 / human hmd,umi v1v12 LPF β€” λΉ„μœ¨ 0.50 : 0.25 : 0.25

각 checkpoint-*/ μ•ˆμ— κ·Έ 체크포인트 고유의 μ •κ·œν™” 톡계가 λ“€μ–΄ μžˆλ‹€: experiment_cfg/dataset_statistics.json, processor/statistics.json. λ‹€λ₯Έ 체크포인트의 톡계λ₯Ό κ°–λ‹€ μ“°μ§€ 말 것.

좔둠에 쓰이지 μ•ŠλŠ” ν•™μŠ΅ μƒνƒœ(global_step*/, optimizer.pt, scheduler.pt, rng_state_*.pth, training_args.bin, zero_to_fp32.py)λŠ” μ˜¬λ¦¬μ§€ μ•Šμ•˜λ‹€.

μ½”λ“œ

  • Stage-2: jungwook235/RLDX-1-egopi branch feat/allex-eef-h16-midtrain
  • μŠ€ν¬λ¦½νŠΈΒ·λ¬Έμ„œ: jungwook235/action-tokenizer gpu26-server/submit/allex_eef_*, docs/allex_eef_midtrain/README.md

⚠️ action_dim 이 48 이 μ•„λ‹ˆλΌ 50 이닀. κΈ°μ‘΄ allex 런(쑰인트 48D, waist 포함)κ³Ό λ‹€λ₯Έ κ³„λ³΄μ΄λ―€λ‘œ 48D 둜 λ‘œλ“œν•˜λ©΄ μ•ˆ λœλ‹€.

⚠️ AB λ₯Ό 좔둠에 μ“°λ €λ©΄ load_merged_prq_action_minmax κ°€ PRQ_KEYSΒ·min/max ν•˜λ“œμ½”λ”©μ΄λΌ allex 50D/q99 용 λ‘œλ” ν¬νŒ…μ΄ ν•„μš”ν•˜λ‹€.

Downloads last month

-

Downloads are not tracked for this model. How to track
Video Preview
loading