Image-Text-to-Text
Transformers
Safetensors
Russian
English
qwen3
text-generation
vision
multimodal
lora
russian
code
text-generation-inference
Instructions to use AuroraSystem/Clary-0.6-0.6B with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use AuroraSystem/Clary-0.6-0.6B with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("image-text-to-text", model="AuroraSystem/Clary-0.6-0.6B")# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("AuroraSystem/Clary-0.6-0.6B") model = AutoModelForCausalLM.from_pretrained("AuroraSystem/Clary-0.6-0.6B", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use AuroraSystem/Clary-0.6-0.6B with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "AuroraSystem/Clary-0.6-0.6B" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "AuroraSystem/Clary-0.6-0.6B", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/AuroraSystem/Clary-0.6-0.6B
- SGLang
How to use AuroraSystem/Clary-0.6-0.6B with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "AuroraSystem/Clary-0.6-0.6B" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "AuroraSystem/Clary-0.6-0.6B", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "AuroraSystem/Clary-0.6-0.6B" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "AuroraSystem/Clary-0.6-0.6B", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use AuroraSystem/Clary-0.6-0.6B with Docker Model Runner:
docker model run hf.co/AuroraSystem/Clary-0.6-0.6B
Aurora Clary 0.6 Safetensors
Файлы
| Файл | Описание |
|---|---|
config.json |
конфиг LLM |
model.safetensors |
Qwen3-0.6B + LoRA (merged) |
tokenizer.json / tokenizer_config.json |
токенизатор |
projector.safetensors |
vision-проектор (768→2048→2048→1024) |
clip_vision/ |
CLIP ViT-B/32 vision encoder |
Быстрый старт (text only)
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
"AuroraSystem/Aurora-Clary-0.6",
subfolder="merged", torch_dtype="auto", device_map="auto"
)
tok = AutoTokenizer.from_pretrained("AuroraSystem/Aurora-Clary-0.6", subfolder="merged")
prompt = tok.apply_chat_template(
[{"role": "user", "content": "Напиши факториал на Python"}],
tokenize=False, add_generation_prompt=True
)
out = model.generate(tok(prompt, return_tensors="pt").to(model.device), max_new_tokens=200)
print(tok.decode(out[0], skip_special_tokens=True))
Быстрый старт (Vision)
Для картинок нужен CLIP + проектор. Архитектура:
Image -> CLIP ViT-B/32 (frozen) -> Projector (768→2048→2048→1024) -> [49 tokens]
Text -> Qwen3 embeddings -> [tokens]
[vision_tokens + text_tokens] -> Qwen3-0.6B -> ответ
Возможности
- Текст: инструкции, знания, русский + английский
- Код: генерация Python
- Математика
- Суммаризация (EN + RU)
- Vision: описание изображений, цвета
- Режим
/think(Qwen3 thinking)
Ограничения
- Вижн OCR слабый (мелкий текст не читает)
- Системные промпты не обучались
- База — Qwen3-0.6B, потолок соответствует 0.6B-классу
Альтернативные форматы
- GGUF (для llama.cpp / LM Studio / Ollama): AuroraSystem/Clary-0.6-0.6B-GGUF
Лицензия
Apache-2.0. Base — Qwen3-0.6B (Apache-2.0).
English
Files
| File | Description |
|---|---|
config.json |
LLM config |
model.safetensors |
Qwen3-0.6B + LoRA (merged) |
tokenizer.json / tokenizer_config.json |
tokenizer |
projector.safetensors |
vision projector (768→2048→2048→1024) |
clip_vision/ |
CLIP ViT-B/32 vision encoder |
Quick start (text only)
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
"AuroraSystem/Aurora-Clary-0.6",
subfolder="merged", torch_dtype="auto", device_map="auto"
)
tok = AutoTokenizer.from_pretrained("AuroraSystem/Aurora-Clary-0.6", subfolder="merged")
prompt = tok.apply_chat_template(
[{"role": "user", "content": "Write a Python factorial function"}],
tokenize=False, add_generation_prompt=True
)
out = model.generate(tok(prompt, return_tensors="pt").to(model.device), max_new_tokens=200)
print(tok.decode(out[0], skip_special_tokens=True))
Quick start (Vision)
For images you need CLIP + projector. Architecture:
Image -> CLIP ViT-B/32 (frozen) -> Projector (768→2048→2048→1024) -> [49 tokens]
Text -> Qwen3 embeddings -> [tokens]
[vision_tokens + text_tokens] -> Qwen3-0.6B -> answer
Capabilities
- Text: instructions, knowledge, Russian + English
- Code: Python generation
- Math
- Summarization (EN + RU)
- Vision: image description, colors
/thinkmode (Qwen3 thinking)
Limitations
- OCR is weak (small text not recognized)
- System prompts were not trained
- Base is Qwen3-0.6B, ceiling matches 0.6B class
Alternative formats
- GGUF (for llama.cpp / LM Studio / Ollama): AuroraSystem/Clary-0.6-0.6B-GGUF
License
Apache-2.0. Base — Qwen3-0.6B (Apache-2.0).
- Downloads last month
- -
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

