mt-moral-alignment
Collection
model checkpoints for multi-turn alignment • 36 items • Updated
How to use agentic-moral-alignment/method-robots-rebn-0826-0821 with PEFT:
Task type is invalid.
LoRA adapters from mt-moral-alignment run method-robots-rebn-0826-0821, one subfolder per checkpoint,
converted from verl FSDP shards. Per-episode logs:
https://huggingface.co/datasets/agentic-moral-alignment/mtma/tree/main/runs/train/method-robots-rebn-0826-0821
| step | load |
|---|---|
| 20 | subfolder="step_20" |
| 25 | subfolder="step_25" |
| 30 | subfolder="step_30" |
| 35 | subfolder="step_35" |
| 40 | subfolder="step_40" |
base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3.5-4B-Base")
model = PeftModel.from_pretrained(base, "agentic-moral-alignment/method-robots-rebn-0826-0821", subfolder="step_40")
WARNING: vLLM cannot serve these adapters on Qwen3.5 -- hybrid-GDN LoRA is a
silent no-op (vllm#49354). Merge first: model.merge_and_unload().save_pretrained(...).
# frozen for method-robots-rebn-0826-0821 (2026-08-26T13:44:32Z, git d403f7a)
STAGE: train
MODEL: Qwen/Qwen3.5-4B-Base
GPUS: 1
TP: 1
MAX_SEQS: 64
GPU_MEM_UTIL: 0.72
GAMES: robots
BATCH_GAME: 4
START_SAMPLE: True
START_RESAMPLE_STEP: True
TURN_CAP: 64
N: 8
STEPS: 40
LR: 1.5e-05
TOP_P: 0.95
ROLLOUT_SEED: 42
FRAMING: game-goals
LAM: 1
TASK_WEIGHT: 0
MORAL: deon_soft
RETURN_FN: reward_to_go
BASELINE_FN: batch_mean
NORMALIZE_FN: batch_std
GAMMA: 1.0
OMEGA: 0
TD_LAMBDA: 0.8
THINKING: True
MAX_TURN_TOKENS: 4096
ENV_TIMEOUT_S: 60
AGENT_WORKERS: 2
REWARD_WORKERS: 1
BYPASS: True
GRAD_CKPT: True
CALC_ENTROPY: True
SAVE_FREQ: 5
NOSET: 0
PUSH: 0
PROMPT_LEN: 4096
RESPONSE_LEN: 40960
MAX_MODEL_LEN: 45056
TOKEN_LEN_PER_GPU: 49152
LORA_RANK: 32
LORA_ALPHA: 64
Base model
Qwen/Qwen3.5-4B-Base