PS IMAGE v1.1 — Stable Diffusion + LoRA Pets

Evolução do PS IMAGE 1.0 (que era classificador MobileNetV2 CIFAR-10, 94.1%). A v1.1 muda a base para geração: Stable Diffusion 1.5 + LoRA treinado em dataset público de alta qualidade.

  • Base: runwayml/stable-diffusion-v1-5 (512px)
  • Adaptação: LoRA rank 8 no UNet (~1.6M params treináveis, 6.2MB)
  • Dataset público: Oxford-IIIT Pet (3680 imagens alta-res, 37 raças gato/cachorro) — continuidade com classes gato/cachorro da v1.0
  • Treino: 1800 steps, batch efetivo 4, lr 1e-4 cosine, fp16, gradient checkpointing, Tesla T4
  • Prompts treino: a photo of a {Breed} {cat/dog}, high quality, detailed fur, sharp

Resultado

grid

4/4 gerações nítidas 512px validadas (gato Abissínio, Beagle, Persa, Golden).

Uso

from diffusers import StableDiffusionPipeline
from peft import PeftModel
import torch

BASE = "runwayml/stable-diffusion-v1-5"
pipe = StableDiffusionPipeline.from_pretrained(BASE, torch_dtype=torch.float16, safety_checker=None).to("cuda")
pipe.unet = PeftModel.from_pretrained(pipe.unet, "Pedro21613/PS-IMAGE-1.1")
pipe.unet = pipe.unet.merge_and_unload()

img = pipe("a photo of a Beagle dog, high quality, detailed fur, sharp",
           num_inference_steps=30, guidance_scale=7.5).images[0]
img.save("ps_v11.png")

Ou use usar_v11.py neste repo.

Arquivos

  • adapter_model.safetensors + adapter_config.json → LoRA v1.1
  • examples/ → 4 amostras + grid
  • usar_v11.py → inferência

Diferenças v1.0 → v1.1

  • v1.0: classificação (MobileNetV2, 10 classes CIFAR PT, input 128px)
  • v1.1: geração (SD1.5 + LoRA, 512px, prompts EN + classes pets)
  • Próximo: v1.2 pode cobrir as 10 classes originais (aviao, carro, passaro...) com SDXL.

Base SD: runwayml/stable-diffusion-v1-5 (CreativeML Open RAIL-M). LoRA: treinado por Pedro21613.

Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Pedro21613/PS-IMAGE-1.1

Adapter
(2760)
this model