Instructions to use CELL-LAB/C_SERVER-GRPO-MIX-MERGED with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use CELL-LAB/C_SERVER-GRPO-MIX-MERGED with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("image-text-to-text", model="CELL-LAB/C_SERVER-GRPO-MIX-MERGED")# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("CELL-LAB/C_SERVER-GRPO-MIX-MERGED", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use CELL-LAB/C_SERVER-GRPO-MIX-MERGED with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "CELL-LAB/C_SERVER-GRPO-MIX-MERGED" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "CELL-LAB/C_SERVER-GRPO-MIX-MERGED", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/CELL-LAB/C_SERVER-GRPO-MIX-MERGED
- SGLang
How to use CELL-LAB/C_SERVER-GRPO-MIX-MERGED with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "CELL-LAB/C_SERVER-GRPO-MIX-MERGED" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "CELL-LAB/C_SERVER-GRPO-MIX-MERGED", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "CELL-LAB/C_SERVER-GRPO-MIX-MERGED" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "CELL-LAB/C_SERVER-GRPO-MIX-MERGED", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use CELL-LAB/C_SERVER-GRPO-MIX-MERGED with Docker Model Runner:
docker model run hf.co/CELL-LAB/C_SERVER-GRPO-MIX-MERGED
C_SERVER-GRPO-MIX-MERGED
This repository packages a GRPO LoRA adapter merged into CELL-LAB/lora-plus-f2f-backup.
Two folders are included:
merged/: standalone BF16 checkpoint for vLLM serving.adapter/: PEFT LoRA adapter files kept for reproducibility and adapter-only loading.
The LoRA has already been merged in merged/. Do not pass an adapter or enable
LoRA when loading the merged/ folder.
vLLM 0.8.1
This repository is prepared for the requested serving stack:
pip install "vllm==0.8.1" "transformers==4.50.0"
Because the full checkpoint is stored in the merged/ subfolder, download the
repository first and point vllm serve at that local folder:
python - <<'PY'
from huggingface_hub import snapshot_download
snapshot_download("CELL-LAB/C_SERVER-GRPO-MIX-MERGED", local_dir="./C_SERVER-GRPO-MIX-MERGED")
PY
vllm serve ./C_SERVER-GRPO-MIX-MERGED/merged \
--served-model-name C_SERVER-GRPO-MIX-MERGED \
--dtype bfloat16 \
--max-model-len 8192 \
--trust-remote-code
For multiple GPUs, add --tensor-parallel-size GPU_COUNT.
The BF16 weight shards are large. Make sure the GPU has enough memory for the model weights plus KV cache.
Direct Python vLLM
from huggingface_hub import snapshot_download
from vllm import LLM, SamplingParams
repo_dir = snapshot_download("CELL-LAB/C_SERVER-GRPO-MIX-MERGED")
model_dir = repo_dir + "/merged"
llm = LLM(model=model_dir, trust_remote_code=True, dtype="bfloat16")
sampling = SamplingParams(max_tokens=512, temperature=0.0)
outputs = llm.generate(["์๋
ํ์ธ์"], sampling)
print(outputs[0].outputs[0].text)
Adapter Loading
from transformers import AutoTokenizer, Gemma3ForConditionalGeneration
from peft import PeftModel
base_id = "CELL-LAB/lora-plus-f2f-backup"
adapter_dir = "adapter"
tokenizer = AutoTokenizer.from_pretrained(base_id)
base = Gemma3ForConditionalGeneration.from_pretrained(
base_id,
device_map="auto",
torch_dtype="auto",
)
model = PeftModel.from_pretrained(base, adapter_dir)
The repository root is a container layout. For vLLM, use the merged/
subfolder, not the repo root.
Model tree for CELL-LAB/C_SERVER-GRPO-MIX-MERGED
Base model
CELL-LAB/lora-plus-f2f-backup