SD 1.5 Diffusion-DPO β€” foto asli, US, gender

UNet hasil train.py (mode dpo) di 280 foto asli Pexels (1400 baris train / 420 val, dataset fassabilf/ift-train-us-real), 20 epoch, --seed 0.

Loss Diffusion-DPO pada pasangan preferensi, bukan MSE-e satu gambar. beta_dpo = 5000 (default paper), batch 4 pasangan x accum 8, lr 1e-5. Pasangannya distribusional: chosen = foto pool utama (proporsi per okupasi mengikuti p_female_target), rejected = foto pool flip dengan caption yang sama persis. Dataset di folder dpo/ repo fassabilf/ift-train-us-real.

UNet referensi = base SD 1.5, bukan checkpoint SFT. Jadi ini arm "DPO saja" yang bisa dibaca langsung terhadap base dan terhadap fassabilf/sd15-ift-us-real.

Hasil: bobot ini TIDAK memperbaiki distribusi

Training ini gagal melakukan debiasing, dan itu temuannya β€” bukan bug. MAE test (n=100/okupasi) DPO 0,150-0,172 vs base SD 1.5 0,149; selisihnya tidak signifikan di satu checkpoint pun (paired cluster bootstrap 14 okupasi). Arm SFT dengan data dan protokol yang sama menurunkannya ke 0,118.

Base SD 1.5 sudah kolaps di beberapa okupasi (software_developer 0,000, engineer 0,010, administrative_assistant 1,000, nurse 0,989) dan DPO tidak menarik satu pun keluar dari situ. Tambahan kecondongan ke mayoritas di atas base hanya signifikan di ep20 (+0,038, CI [+0,016, +0,065]) β€” satu dari empat titik, satu seed, belum temuan.

Yang kokoh: kualitas gambar turun. Unclear rate judge naik 0,098 -> 0,191 (ep20, CI selisih [+0,060, +0,132]), dan implicit accuracy melewati plafon teoretis 0,6514 sejak ep8 di val β€” tanda model menghafal 280 fotonya, bukan belajar distribusinya. Turunan plafon dan seluruh angkanya ada di analysis/REPORT.md.

Pakai checkpoint ini sebagai objek studi kegagalan DPO distribusional, bukan sebagai model yang lebih adil dari base.

VAE, text encoder, dan tokenizer identik dengan SD 1.5 base β€” tidak ikut diunggah. Rakit pipeline-nya dengan memasang UNet di sini ke stable-diffusion-v1-5/stable-diffusion-v1-5 (lihat scripts/ift/ckpt_to_pipeline.py di repo kode).

Checkpoint yang diunggah: ep1, ep2, ep3, ep4, ep5, ep6, ep7, ep8, ep9, ep10, ep11, ep12, ep13, ep14, ep15, ep16, ep17, ep18, ep19, ep20. Setelan lengkap di hparams.yml; angka evaluasi, error bar, dan lantai MAE di analysis/.

Model ini artefak penelitian tentang bias distribusi gender, bukan model produksi.

Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support

Model tree for fassabilf/sd15-dpo-us-real

Finetuned
(404)
this model