CAA — vocal_gender (Stable Audio Open)

Steering vectors for the vocal_gender concept on Stable Audio Open, computed via contrastive activation addition (CAA).

Paper

TADA! Tuning Audio Diffusion Models through Activation Steering — https://huggingface.co/papers/2602.11910

Quickstart

from src.steering import SteerableStableAudioModel, StableAudioCAASteeringController

model = SteerableStableAudioModel(device="cuda")
ctrl = StableAudioCAASteeringController.from_pretrained("lukasz-staniszewski/stable-audio-caa-vocal-gender", alpha=1.0)

with model.steer(ctrl):
    out = model.generate(
        prompt="instrumental music",
        num_inference_steps=100, audio_length_in_s=10.0,
        guidance_scale=7.0, seed=0,
    )

Generation config

{
  "method": "standard_caa_stable_audio",
  "model": "stabilityai/stable-audio-open-1.0",
  "concept": "vocal_gender",
  "num_inference_steps": 100,
  "audio_length_in_s": 10.0,
  "guidance_scale": 7.0,
  "seed": 10,
  "device": "cuda",
  "dtype": "float16",
  "save_all_cfg_passes": true,
  "layers_preset": "all",
  "layers_to_steer": [
    ".transformer.transformer_blocks.0.attn2",
    ".transformer.transformer_blocks.1.attn2",
    ".transformer.transformer_blocks.2.attn2",
    ".transformer.transformer_blocks.3.attn2",
    ".transformer.transformer_blocks.4.attn2",
    ".transformer.transformer_blocks.5.attn2",
    ".transformer.transformer_blocks.6.attn2",
    ".transformer.transformer_blocks.7.attn2",
    ".transformer.transformer_blocks.8.attn2",
    ".transformer.transformer_blocks.9.attn2",
    ".transformer.transformer_blocks.10.attn2",
    ".transformer.transformer_blocks.11.attn2",
    ".transformer.transformer_blocks.12.attn2",
    ".transformer.transformer_blocks.13.attn2",
    ".transformer.transformer_blocks.14.attn2",
    ".transformer.transformer_blocks.15.attn2",
    ".transformer.transformer_blocks.16.attn2",
    ".transformer.transformer_blocks.17.attn2",
    ".transformer.transformer_blocks.18.attn2",
    ".transformer.transformer_blocks.19.attn2",
    ".transformer.transformer_blocks.20.attn2",
    ".transformer.transformer_blocks.21.attn2",
    ".transformer.transformer_blocks.22.attn2",
    ".transformer.transformer_blocks.23.attn2"
  ],
  "normalize_sv": true
}
Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Collection including lukasz-staniszewski/stable-audio-caa-vocal-gender

Paper for lukasz-staniszewski/stable-audio-caa-vocal-gender