method-robots-rebn-0826-0821

LoRA adapters from mt-moral-alignment run method-robots-rebn-0826-0821, one subfolder per checkpoint, converted from verl FSDP shards. Per-episode logs: https://huggingface.co/datasets/agentic-moral-alignment/mtma/tree/main/runs/train/method-robots-rebn-0826-0821

step load
20 subfolder="step_20"
25 subfolder="step_25"
30 subfolder="step_30"
35 subfolder="step_35"
40 subfolder="step_40"
base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3.5-4B-Base")
model = PeftModel.from_pretrained(base, "agentic-moral-alignment/method-robots-rebn-0826-0821", subfolder="step_40")

WARNING: vLLM cannot serve these adapters on Qwen3.5 -- hybrid-GDN LoRA is a silent no-op (vllm#49354). Merge first: model.merge_and_unload().save_pretrained(...).

Frozen run config

# frozen for method-robots-rebn-0826-0821 (2026-08-26T13:44:32Z, git d403f7a)
STAGE: train
MODEL: Qwen/Qwen3.5-4B-Base
GPUS: 1
TP: 1
MAX_SEQS: 64
GPU_MEM_UTIL: 0.72
GAMES: robots
BATCH_GAME: 4
START_SAMPLE: True
START_RESAMPLE_STEP: True
TURN_CAP: 64
N: 8
STEPS: 40
LR: 1.5e-05
TOP_P: 0.95
ROLLOUT_SEED: 42
FRAMING: game-goals
LAM: 1
TASK_WEIGHT: 0
MORAL: deon_soft
RETURN_FN: reward_to_go
BASELINE_FN: batch_mean
NORMALIZE_FN: batch_std
GAMMA: 1.0
OMEGA: 0
TD_LAMBDA: 0.8
THINKING: True
MAX_TURN_TOKENS: 4096
ENV_TIMEOUT_S: 60
AGENT_WORKERS: 2
REWARD_WORKERS: 1
BYPASS: True
GRAD_CKPT: True
CALC_ENTROPY: True
SAVE_FREQ: 5
NOSET: 0
PUSH: 0
PROMPT_LEN: 4096
RESPONSE_LEN: 40960
MAX_MODEL_LEN: 45056
TOKEN_LEN_PER_GPU: 49152
LORA_RANK: 32
LORA_ALPHA: 64
Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for agentic-moral-alignment/method-robots-rebn-0826-0821

Adapter
(48)
this model

Collection including agentic-moral-alignment/method-robots-rebn-0826-0821