SDXS-512-0.9 — export ONNX quantifié (pour Attic)

Export ONNX, prêt pour onnxruntime-node/onnxruntime-web, du modèle IDKiro/sdxs-512-0.9 — utilisé par le nœud « Texte → image » de Attic, un studio nodal de traitement audio/créatif.

Pas de conversion officielle de ce modèle en ONNX au moment de la publication de ce dépôt : les fichiers ici sont une conversion indépendante, avec les choix documentés ci-dessous.

Ce que contient ce dépôt

Fichier Rôle Poids Précision
onnx/text_encoder_int8.onnx Encodeur de texte CLIP (OpenCLIP ViT-H, hidden_size 1024) ~342 Mo int8 (quantification dynamique)
onnx/unet_int8.onnx UNet de diffusion (0,3 Md paramètres, 3 blocs down/up) ~330 Mo int8 (quantification dynamique)
onnx/vae_decoder.onnx Décodeur TAESD (AutoencoderTiny, 1,2 M paramètres) ~5 Mo fp32
tokenizer/tokenizer.json + tokenizer_config.json Tokenizer CLIP rapide (format tokenizers/Rust) ~3,6 Mo

Total ≈ 680 Mo (à comparer aux ~4,3 Go du modèle original en fp32).

Attribution et licence

  • Modèle de base : IDKiro/sdxs-512-0.9 (SDXS: Real-Time One-Step Latent Diffusion Models with Image Conditions, Song et al.), distillé à partir de SD-Turbo (Stability AI, teacher DM) et Stable Diffusion 2.1 base (offline DM).
  • Licence déclarée par le modèle de base : openrail++ (CreativeML Open RAIL++-M). Cette licence autorise l'usage commercial et la redistribution de dérivés, à condition de retransmettre les mêmes restrictions d'usage aux utilisateurs en aval (pas de génération de contenu illégal, nuisible, ou visant à tromper — voir le texte complet de la licence : https://huggingface.co/spaces/CompVis/stable-diffusion-license/raw/main/license.txt).
  • Note de provenance : le modèle de base est distillé à partir de SD-Turbo, publié sous la licence Stability AI Community (plus restrictive que openrail++, avec seuil de revenu pour l'usage commercial). Les auteurs de SDXS eux-mêmes notent avoir retenu la publication des versions plus récentes (1.0) « pour éviter d'éventuels risques commerciaux et de droits d'auteur ». La version 0.9 utilisée ici reste publiée sous openrail++ par ses auteurs, mais cette zone grise de provenance n'est pas définitivement tranchée — à prendre en compte pour tout usage commercial de ce dépôt.
  • Décodeur TAESD : madebyollin/taesd, licence MIT.

Détails de la conversion

  • Export via torch.onnx.export (exporteur legacy TorchScript, opset 17→18), un composant à la fois (encodeur de texte, UNet, décodeur VAE), à partir des poids fp32 du pipeline diffusers.
  • text_encoder et unet quantifiés en int8 via onnxruntime.quantization.quantize_dynamic (~4× plus petit que fp32, sans réentraînement). Le décodeur TAESD est resté en fp32 (déjà minuscule).
  • SDXS-512 utilise un seul pas de diffusion, à un timestep fixe (t=999). La formule de reconstruction (prédiction epsilon → x0) et la constante alpha_cumprod(999) ≈ 0.00466009508818388 ont été mesurées empiriquement en instrumentant le scheduler PNDM de référence de diffusers, plutôt que réimplémentées depuis la théorie — voir le code du nœud Attic (electron/sdxs-image.cjs) pour l'implémentation JS complète.

Utilisation

Prévu pour le nœud « Texte → image » d'Attic : téléchargez ce dépôt dans public/oonx/sdxs-512-texte-image/ (ou tout chemin pointé par le paramètre « Chemin modèle » du nœud). Utilisable indépendamment d'Attic avec onnxruntime-node/onnxruntime-web (CPU) et un tokenizer CLIP compatible.

  • Résolution fixe : 512×512.
  • ~8-11 s par image en CPU pur (mesuré, aucune accélération GPU requise).
  • Prompts en anglais recommandés (le modèle de base n'a pas été entraîné/évalué en français).
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Fcouprie/sdxs-512-texte-image

Quantized
(1)
this model

Paper for Fcouprie/sdxs-512-texte-image