SD 1.5 Diffusion-DPO โ€” foto asli, UK, gender

UNet hasil train.py (mode dpo) di 400 foto asli Pexels (2000 baris train / 600 val, dataset fassabilf/ift-train-uk-real), 20 epoch, --seed 0.

Loss Diffusion-DPO pada pasangan preferensi, bukan MSE-e satu gambar. beta_dpo = 5000 (default paper), batch 4 pasangan x accum 8, lr 1e-5, 20 epoch = 1.260 step (63 step/epoch; jangan menyamakan epN UK dengan epN US yang 44 step/epoch). Pasangannya distribusional: chosen = foto pool utama (proporsi per okupasi mengikuti p_female_target dari ONS), rejected = foto pool flip dengan caption yang sama persis. 400 foto unik/split, 2.000 pasangan train / 600 val. Dataset di folder dpo/ repo fassabilf/ift-train-uk-real.

UNet referensi = base SD 1.5, bukan checkpoint SFT โ€” arm "DPO saja", bisa dibaca langsung terhadap base dan terhadap fassabilf/sd15-ift-uk-real (SFT UK, data dan protokol sama).

20 okupasi terlatih (sufiks _uk): mechanic, civil_engineer, engineer, engineering_technician, it_support, caretaker, it_operations, sales_executive, lab_technician, finance_analyst, sports_coach, higher_ed_teacher, director, accountant, further_ed_teacher, secondary_teacher, office_manager, nurse, teaching_assistant, personal_assistant. Lima okupasi held-out: metal_fitter, senior_care_worker, care_worker, crossing_patrol, education_support.

Status: evaluasi MAE test BELUM lengkap

Bobot ini diunggah sebelum sweep MAE test selesai. Belum ada klaim apa pun soal apakah DPO UK memperbaiki distribusi; kartu ini akan diperbarui dengan paired ฮ”MAE vs base dan analysis/REPORT.md setelah sweep-nya jadi.

Yang sudah terukur, dari training dan fixed-t val:

  • implicit accuracy train rata-rata per epoch 0,525 (ep1) -> 0,617 (ep5) -> 0,612 (ep10) -> 0,635 (ep15) -> 0,633 (ep20): plateau di bawah plafon teoretis 0,6432 (turunan plafon di analysis/ceiling.csv). Arm US menembus plafonnya di ep15.
  • DPO loss train naik 0,91 -> 1,56 dan model_mse > ref_mse sejak ep5 โ€” pola "menang di preferensi dengan merusak rekonstruksi", sama seperti US.
  • fixed-t val: loss naik monoton 0,693 -> 1,43 tanpa minimum; implicit accuracy puncak 0,654 di ep6 (di atas plafon), lalu turun ke 0,63-0,64. Ini tanda menghafal 400 fotonya, bukan belajar distribusinya (analysis/fixedt_dpo_val.csv).

Perlakukan checkpoint ini sebagai objek studi, bukan model yang lebih adil dari base.

VAE, text encoder, dan tokenizer identik dengan SD 1.5 base โ€” tidak ikut diunggah. Rakit pipeline-nya dengan memasang UNet di sini ke stable-diffusion-v1-5/stable-diffusion-v1-5 (lihat scripts/ift/ckpt_to_pipeline.py di repo kode).

Checkpoint yang diunggah: ep1, ep2, ep3, ep4, ep5, ep6, ep7, ep8, ep9, ep10, ep11, ep12, ep13, ep14, ep15, ep16, ep17, ep18, ep19, ep20. Setelan lengkap di hparams.yml; angka evaluasi, error bar, dan lantai MAE di analysis/.

Model ini artefak penelitian tentang bias distribusi gender, bukan model produksi.

Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support

Model tree for fassabilf/sd15-dpo-uk-real

Finetuned
(408)
this model