Safety-WaRP (WSR-Tune) β€” gsm8k (basis/mask: beavertails) fine-tuned keep_ratio=0.01

kmseong/llama2_7b-chat-Safety-FT-lr5e-5 λ₯Ό μ‹œμž‘μ μœΌλ‘œ, WaRP(Weight space Rotation Process) μž¬νŒŒλΌλ―Έν„°ν™” κ³΅κ°„μ—μ„œ μ•ˆμ „ κ΄€λ ¨ κ³„μˆ˜ λ°©ν–₯을 λ™κ²°ν•œ 채 gsm8k (basis/mask: beavertails) 둜 downstream fine-tuning ν•œ λͺ¨λΈμž…λ‹ˆλ‹€.

  • 각 weight matrix λ₯Ό μž…λ ₯ ν™œμ„±κ°’ κ³΅λΆ„μ‚°μ˜ κ³ μœ κΈ°μ € U 둜 νšŒμ „ (C = W U)
  • μ•ˆμ „ 데이터(circuit_breakers)에 λŒ€ν•œ gradient μ€‘μš”λ„ μƒμœ„ keep_ratio μ’Œν‘œλ₯Ό 동결
  • λ‚˜λ¨Έμ§€("flat") μ’Œν‘œλ§Œ ν•™μŠ΅ β€” forward 의 mask+detach 둜 κ΅¬ν˜„ (non-freeze 방식)
  • token-wise constrained SFT (shallow-vs-deep) κ²°ν•©

적용 λ²”μœ„: q_proj, k_proj, v_proj, up_proj, down_proj / 전체 32개 layer / per-layer μ€‘μš”λ„.

Training run

base model kmseong/llama2_7b-chat-Safety-FT-lr5e-5
downstream data gsm8k (basis/mask: beavertails) (7473 samples)
epochs / lr 3 / 5e-05
batch x grad_accum 2 x 8 (effective 16)
optimizer / scheduler adamw_torch / cosine
coordinate space non_freeze
frozen safety coefficients 45,681,460 / 4,496,293,888 (1.02%)
train wall-clock 1964 s
train peak VRAM (device) 96.02 GB
Downloads last month
5
Safetensors
Model size
7B params
Tensor type
BF16
Β·
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support

Model tree for kmseong/llama2_7b_chat-WaRP-beavertails-kr0.01_lr5e-5