Visual Question Answering
Diffusers
Safetensors
English
Hindi
StableDiffusionPipeline
multimodal
text-to-image
image-to-image
image-to-text
vision
ocr
sashi
sashi-1.0-vision
8k
india
varanasi
Instructions to use ftmdeveloperz006/SaShi-1.0-Vision with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Diffusers
How to use ftmdeveloperz006/SaShi-1.0-Vision with Diffusers:
pip install -U diffusers transformers accelerate
import torch from diffusers import DiffusionPipeline # switch to "mps" for apple devices pipe = DiffusionPipeline.from_pretrained("ftmdeveloperz006/SaShi-1.0-Vision", dtype=torch.bfloat16, device_map="cuda") prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k" image = pipe(prompt).images[0] - Notebooks
- Google Colab
- Kaggle
๐๏ธ๐จ SaShi 1.0 Vision โ Sovereign Indian Multimodal AI Ecosystem
SaShi 1.0 Vision is an all-in-one unified Visual Intelligence & Art engine developed by ftmdeveloperz006 in Varanasi (Banaras), Uttar Pradesh, India (Two Brothers).
๐ The 3-in-1 Unified Multimodal Engine
SaShi 1.0 Vision consolidates three essential visual AI capabilities into one unified framework:
โโโโโโโโโโโโโโโโโโโโโโโโโโโ
โ ๐๏ธ SaShi 1.0 Vision โ
โโโโโโโโโโโโโโฌโโโโโโโโโโโโโ
โโโโโโโโโโโโโโโโโโโโโโโโโโโโโผโโโโโโโโโโโโโโโโโโโโโโโโโโโโ
โผ โผ โผ
โโโโโโโโโโโโโโโโโโโโ โโโโโโโโโโโโโโโโโโโโ โโโโโโโโโโโโโโโโโโโโ
โ ๐จ Text-to-Image โ โ ๐ผ๏ธ Image-to-Imageโ โ ๐ Image-to-Text โ
โ (T2I) โ โ (I2I) โ โ (I2T/Vision) โ
โ 8K Ultra-HD Art โ โ Style & Upscale โ โ OCR & Visual QA โ
โโโโโโโโโโโโโโโโโโโโ โโโโโโโโโโโโโโโโโโโโ โโโโโโโโโโโโโโโโโโโโ
- Text-to-Image (T2I): Generate photorealistic 8K images, Indian cultural monuments, temples, futuristic concepts, and DSLR portraits from natural language prompts.
- Image-to-Image (I2I): Transform existing photos, modify styles, convert sketches to photorealistic art, and enhance lighting.
- Image-to-Text (I2T / Vision): Visual Question Answering (VQA), reading Devanagari/English text from receipts and signboards (OCR), and understanding complex diagrams.
๐ ๏ธ Unified Python Code (T2I, I2I, and I2T)
import torch
from PIL import Image
from diffusers import StableDiffusionPipeline, StableDiffusionImg2ImgPipeline, EulerAncestralDiscreteScheduler
from transformers import pipeline
device = "cuda" if torch.cuda.is_available() else "cpu"
# 1. Text-to-Image (T2I)
t2i_pipe = StableDiffusionPipeline.from_pretrained(
"ftmdeveloperz006/SaShi-1.0-Vision",
torch_dtype=torch.float16
).to(device)
def sashi_t2i(prompt):
return t2i_pipe(prompt + ", 8k uhd photorealistic", num_inference_steps=30).images[0]
# 2. Image-to-Image (I2I)
i2i_pipe = StableDiffusionImg2ImgPipeline.from_pretrained(
"ftmdeveloperz006/SaShi-1.0-Vision",
torch_dtype=torch.float16
).to(device)
def sashi_i2i(init_image, prompt, strength=0.75):
return i2i_pipe(prompt=prompt, image=init_image, strength=strength).images[0]
# 3. Image-to-Text (I2T / Vision Analysis)
vqa_pipe = pipeline("image-to-text", model="Salesforce/blip-image-captioning-large", device=0 if device=="cuda" else -1)
def sashi_i2t(image):
return vqa_pipe(image)[0]["generated_text"]
๐ฎ๐ณ Origin & Creators
- Name Origin: Sa-Shi (Named after the Two Brothers who conceived and trained this AI model).
- Location: Varanasi (Kashi / Banaras), Uttar Pradesh, India.
- Downloads last month
- 28