YAML Metadata Warning:empty or missing yaml metadata in repo card

Check out the documentation for more information.

DINOv2 + RoboMamba + ACT Policy Architecture

A state-of-the-art imitation learning policy combining Meta AI's DINOv2 self-supervised vision backbone, RoboMamba State Space Models (SSM) sequence encoder, and ACT Action Chunking Transformer decoder for high-precision robotic manipulation.


🌟 Architecture Highlights

  1. DINOv2 Vision Backbone (dinov2_vits14):

    • Extract dense spatial patch features ($16 \times 16 = 256$ tokens per camera) pre-trained self-supervised on Meta's LVD-142M dataset.
    • Superior geometric perception and zero-shot spatial localization compared to standard supervised ResNet backbones.
  2. RoboMamba Sequence Encoder:

    • Linear $\mathcal{O}(N)$ complexity selective state-space model for efficient spatiotemporal sequence encoding.
  3. ACT (Action Chunking Transformer):

    • CVAE latent action distribution encoding + Transformer query decoding predicting multi-step action trajectories ($T=16$).

πŸ“ Repository Structure

RoboMamba_DINO_ACT_Policy/
β”œβ”€β”€ config.yaml               # Training & model hyperparameters
β”œβ”€β”€ dataset/
β”‚   └── hf_dataset.py         # LeRobot HuggingFace dataset loader with ImageNet z-scoring & 224x224 resize
β”œβ”€β”€ models/
β”‚   β”œβ”€β”€ dino_backbone.py      # DINOv2 feature extractor with spatial patch pooling & projection
β”‚   β”œβ”€β”€ mamba_block.py        # RoboMamba State Space Model encoder layer
β”‚   β”œβ”€β”€ act_decoder.py        # CVAE Encoder & ACT Transformer Query Decoder
β”‚   └── policy.py             # Full unified DINOv2RoboMambaACTPolicy module
β”œβ”€β”€ train.py                  # Full PyTorch training loop with AdamW, Cosine LR, and checkpointing
β”œβ”€β”€ eval_leisaac.py           # Evaluation connector for Isaac Sim & hardware execution with temporal ensembling
└── README.md

πŸš€ Quick Start

1. Training

Run the training loop on HuggingFace dataset (e.g. Gogul99/300_episode):

python train.py

2. Configuration (config.yaml)

Edit config.yaml to customize dataset, backbone, or training parameters:

model:
  dino_backbone: "dinov2_vits14"  # Options: dinov2_vits14, dinov2_vitb14
  freeze_dino: true              # Freeze DINOv2 backbone for fast training and low memory
  d_model: 512                   # Mamba and ACT feature dimension
  chunk_size: 16                 # Action prediction horizon

πŸ§ͺ Evaluation in Isaac Sim

To evaluate the trained checkpoint in Isaac Sim:

PYTHONPATH=.:$PYTHONPATH \
python scripts/evaluation/policy_inference.py \
    --task LeIsaac-SO101-CustomTask-v0 \
    --policy_type robomamba-act \
    --policy_checkpoint_path ./checkpoints/best_model.pt
Downloads last month
117
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support