Instructions to use surogate/Surogate-3.5-9B with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use surogate/Surogate-3.5-9B with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("image-text-to-text", model="surogate/Surogate-3.5-9B") messages = [ { "role": "user", "content": [ {"type": "image", "url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/p-blog/candy.JPG"}, {"type": "text", "text": "What animal is on the candy?"} ] }, ] pipe(text=messages)# Load model directly from transformers import AutoProcessor, AutoModelForMultimodalLM processor = AutoProcessor.from_pretrained("surogate/Surogate-3.5-9B") model = AutoModelForMultimodalLM.from_pretrained("surogate/Surogate-3.5-9B", device_map="auto") messages = [ { "role": "user", "content": [ {"type": "image", "url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/p-blog/candy.JPG"}, {"type": "text", "text": "What animal is on the candy?"} ] }, ] inputs = processor.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(processor.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use surogate/Surogate-3.5-9B with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "surogate/Surogate-3.5-9B" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "surogate/Surogate-3.5-9B", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }'Use Docker
docker model run hf.co/surogate/Surogate-3.5-9B
- SGLang
How to use surogate/Surogate-3.5-9B with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "surogate/Surogate-3.5-9B" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "surogate/Surogate-3.5-9B", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "surogate/Surogate-3.5-9B" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "surogate/Surogate-3.5-9B", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }' - Docker Model Runner
How to use surogate/Surogate-3.5-9B with Docker Model Runner:
docker model run hf.co/surogate/Surogate-3.5-9B
Rezultate
EDIT- Foarte slab la matematică (l-am rugat să calculeze masa unui cub dându-i densitatea și cota).
La design web la fel de schilodit - pentru un simplu landing page cu titlu, subtitlu și conținut a creat artefacte. suprapuneri.
Cu efort maxim de gândire, chain of thought-ul este defect. V-ați grăbit cu tot repo-ul dupa github, dar n-ați putut livra un model demo decent.
Dacă prin el l-ați fine-tunat, prefer lentoarea Studioului Huggingface.
Testat cu Pi.dev prin llama.cpp - RTX 4000 Blackwell.
O zi bună!
Salut, poti posta ceva prompt-uri cu care ai avut probleme, ca sa il putem imbunatati ?
Problemă principală: aritmetică inexactă
4 calcule greșite din 7 (57%). Modelul nu stăpînește înmulțirea cu 3 numere.
- Verificarea inversă nu validează nimic — reface același calcul (inclusiv
greșit). Nu e o verificare reală. - Auto-contrazicere — în același răspuns, modelul produce două valori
diferite pentru același calcul, apoi continuă cu una dintre ele fără să
rezolve contradicția. - Conversii riscante mm↔cm — factor 10 apare și dispare arbitrar. Modelul
nu aplică consistent regula 1 cm³ = 1000 mm³
Modelul face aritmetică corectă în ~43% din cazuri. Restul conțin erori,
una fiind majoră (31%). Nu e fiabil pentru calcule fără un tool extern.
Problemă secundară
Delimitatorul zecimal — virgulă vs. punct
Modelul lucrează într-un context bilingv (RO + EN) și întîlnește ambele
notații:: cînd modelul scrie 1,510,500 (un milion cinci sute
zece mii cinci sute, cu separator de mii românesc), propriul „parser
mental" poate trata virgulele ca zecimale și produce 1.5105 în loc de
1510500. De aici erorile de factor 10, 100, 1000.
Dovada: test intern proprietar unde modelul dă două valori diferite pentru același volum
(56.9 vs 5.690). Factorul exact este 100 — o virgulă/zecimală deplasată.
Tool calling = 10/10, impecabil, testat pe fisiere .txt, .md si .json.