File size: 2,626 Bytes
cbf3932
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
ROOT="$(cd "$(dirname "${BASH_SOURCE[0]}")/.." && pwd)"
cd "${ROOT}"

export TMPDIR=/pfss/mlde/workspaces/mlde_wsp_MGPATH/phuc/tmp
export PIP_CACHE_DIR=/pfss/mlde/workspaces/mlde_wsp_MGPATH/phuc/.cache/pip
mkdir -p "$TMPDIR" "$PIP_CACHE_DIR"

CACHE_ROOT="${ROOT}/.cache"
export HF_HOME="${CACHE_ROOT}/huggingface"
export HUGGINGFACE_HUB_CACHE="${HF_HOME}/hub"
export HF_DATASETS_CACHE="${HF_HOME}/datasets"
export TRANSFORMERS_CACHE="${HF_HOME}/hub"
export VLLM_CACHE_ROOT="${CACHE_ROOT}/vllm"
export FLASHINFER_CACHE_DIR="${CACHE_ROOT}/flashinfer"
export FLASHINFER_JIT_DIR="${CACHE_ROOT}/flashinfer/jit"
export TRITON_CACHE_DIR="${CACHE_ROOT}/triton"
export TORCHINDUCTOR_CACHE_DIR="${CACHE_ROOT}/torchinductor"
export XDG_CACHE_HOME="${CACHE_ROOT}"
mkdir -p "${HUGGINGFACE_HUB_CACHE}" "${HF_DATASETS_CACHE}" "${VLLM_CACHE_ROOT}" \
  "${FLASHINFER_JIT_DIR}" "${TRITON_CACHE_DIR}" "${TORCHINDUCTOR_CACHE_DIR}"

# DeepSpeed imports torch.utils.cpp_extension and requires CUDA_HOME/nvcc.
# Same pattern as rubric_med: conda cuda-nvcc 12.8 + CUDA_HOME=$CONDA_PREFIX.
if [ -z "${CUDA_HOME:-}" ] && [ -n "${CONDA_PREFIX:-}" ] && [ -x "${CONDA_PREFIX}/bin/nvcc" ]; then
  export CUDA_HOME="${CONDA_PREFIX}"
  export PATH="${CUDA_HOME}/bin:${PATH}"
fi

# source ~/.bashrc
# conda activate pre_rlvr
# # cd verl/
# # pip install -e .
# pip install lmdeploy==0.15.0
# pip install deepspeed==0.16.4
# # Official Dao-AILab linux_x86_64 wheels need GLIBC 2.32 (Ubuntu 22.04).
# # This host is Ubuntu 20.04 / GLIBC 2.31, so use Astral's manylinux_2_24 build.
# pip install --no-deps \
#   "https://wheels.astral.sh/artifacts/d4ffd81f93ca34e2e3f8b93499cd62e26faed24250657e7efcc3afd5a9b479df/flash_attn-2.8.3+cu.12.8.torch.2.8-cp311-cp311-manylinux_2_24_x86_64.whl"


deepspeed --num_gpus=4 src/run_dlms.py \
    --model_path models/dLMs-0.999zoo_op2-20+0.001teacher_op2 \
    --dataset context \
    --learning_rate 1e-6 \
    --model_name SDAR-100M-0.999zoo_op2-20+0.001teacher_op2-process \
    --num_iterations 200 \
    --mini_batch_size 1536\
    --clip_ratio_high 0.28 \
    --per_device_batch_size 64 \
    --use_step_process_reward \
    --num_samples 1024 \
    --num_generations_per_sample 6 \

deepspeed --num_gpus=4 src/run_ar.py \
    --model_path models/AR-0.999zoo_op2-20+0.001teacher_op2 \
    --dataset context\
    --learning_rate 1e-6 \
    --model_name Qwen3-100M-AR-0.999zoo_op2-20+0.001teacher_op2-process\
    --num_iterations 200 \
    --mini_batch_size 1536\
    --clip_ratio_high 0.28 \
    --per_device_batch_size 64 \
    --use_step_process_reward \
    --num_samples 1024 \
    --num_generations_per_sample 6 \