Instructions to use fassabilf/sd15-dpo-us-real with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Diffusers
How to use fassabilf/sd15-dpo-us-real with Diffusers:
pip install -U diffusers transformers accelerate
import torch from diffusers import DiffusionPipeline # switch to "mps" for apple devices pipe = DiffusionPipeline.from_pretrained("fassabilf/sd15-dpo-us-real", dtype=torch.bfloat16, device_map="cuda") prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k" image = pipe(prompt).images[0] - Notebooks
- Google Colab
- Kaggle
SD 1.5 Diffusion-DPO β foto asli, US, gender
UNet hasil train.py (mode dpo) di 280 foto asli Pexels (1400 baris train / 420 val,
dataset fassabilf/ift-train-us-real), 20 epoch, --seed 0.
Loss Diffusion-DPO pada pasangan preferensi, bukan MSE-e satu gambar. beta_dpo = 5000 (default paper), batch 4 pasangan x accum 8, lr 1e-5. Pasangannya distribusional: chosen = foto pool utama (proporsi per okupasi mengikuti p_female_target), rejected = foto pool flip dengan caption yang sama persis. Dataset di folder dpo/ repo fassabilf/ift-train-us-real.
UNet referensi = base SD 1.5, bukan checkpoint SFT. Jadi ini arm "DPO saja" yang bisa dibaca langsung terhadap base dan terhadap fassabilf/sd15-ift-us-real.
Hasil: bobot ini TIDAK memperbaiki distribusi
Training ini gagal melakukan debiasing, dan itu temuannya β bukan bug. MAE test (n=100/okupasi) DPO 0,150-0,172 vs base SD 1.5 0,149; selisihnya tidak signifikan di satu checkpoint pun (paired cluster bootstrap 14 okupasi). Arm SFT dengan data dan protokol yang sama menurunkannya ke 0,118.
Base SD 1.5 sudah kolaps di beberapa okupasi (software_developer 0,000, engineer 0,010, administrative_assistant 1,000, nurse 0,989) dan DPO tidak menarik satu pun keluar dari situ. Tambahan kecondongan ke mayoritas di atas base hanya signifikan di ep20 (+0,038, CI [+0,016, +0,065]) β satu dari empat titik, satu seed, belum temuan.
Yang kokoh: kualitas gambar turun. Unclear rate judge naik 0,098 -> 0,191 (ep20, CI selisih [+0,060, +0,132]), dan implicit accuracy melewati plafon teoretis 0,6514 sejak ep8 di val β tanda model menghafal 280 fotonya, bukan belajar distribusinya. Turunan plafon dan seluruh angkanya ada di analysis/REPORT.md.
Pakai checkpoint ini sebagai objek studi kegagalan DPO distribusional, bukan sebagai model yang lebih adil dari base.
VAE, text encoder, dan tokenizer identik dengan SD 1.5 base β tidak ikut diunggah.
Rakit pipeline-nya dengan memasang UNet di sini ke stable-diffusion-v1-5/stable-diffusion-v1-5
(lihat scripts/ift/ckpt_to_pipeline.py di repo kode).
Checkpoint yang diunggah: ep1, ep2, ep3, ep4, ep5, ep6, ep7, ep8, ep9, ep10, ep11, ep12, ep13, ep14, ep15, ep16, ep17, ep18, ep19, ep20. Setelan lengkap di hparams.yml; angka evaluasi,
error bar, dan lantai MAE di analysis/.
Model ini artefak penelitian tentang bias distribusi gender, bukan model produksi.
- Downloads last month
- -
Model tree for fassabilf/sd15-dpo-us-real
Base model
stable-diffusion-v1-5/stable-diffusion-v1-5