Instructions to use Junping0645/vtuber with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use Junping0645/vtuber with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("EleutherAI/polyglot-ko-3.8b") model = PeftModel.from_pretrained(base_model, "Junping0645/vtuber") - Transformers
How to use Junping0645/vtuber with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="Junping0645/vtuber")# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("Junping0645/vtuber", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use Junping0645/vtuber with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "Junping0645/vtuber" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Junping0645/vtuber", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/Junping0645/vtuber
- SGLang
How to use Junping0645/vtuber with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "Junping0645/vtuber" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Junping0645/vtuber", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "Junping0645/vtuber" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Junping0645/vtuber", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use Junping0645/vtuber with Docker Model Runner:
docker model run hf.co/Junping0645/vtuber
λ§λ무 β λ κ±° μ΄λ₯΄μ μ© AI λν μ±λ΄ (QLoRA μ΄λν°)
EleutherAI/polyglot-ko-3.8bλ₯Ό QLoRA(4bit NF4)λ‘ νμΈνλν LoRA μ΄λν°μ
λλ€.
λ
κ±° μ΄λ₯΄μ κ³Ό μ§§κ³ λ°λ»ν μ‘΄λλ§λ‘ λννλ©°, λ¨Όμ 곡κ°νκ³ νμμ μλΆλ₯Ό μ±κΈ°λ νλ₯΄μλλ‘ νμ΅νμ΅λλ€.
νμ΅ λ°μ΄ν°
- λ¨λ° λν 11,266κ°: 16κ° μΉ΄ν κ³ λ¦¬(건κ°/μΈλ‘μ/μμ£Ό/λͺ μ λ±) Γ 8κ° κ°μ , GPT-4o-miniλ‘ μμ± + μ€μ μ΄λ₯΄μ μΈν°λ·° μ μ¬μμ μΆμΆν μ¬ν¬λ¦¬/ꡬμ΄μ²΄ λ°ν 1,266κ°(μ¬ν¬λ¦¬ μ λ ₯ μ΄ν΄ 보κ°μ©)
- λ©ν°ν΄ λν 1,000νΈ(λνλΉ νκ· 7.1ν΄) β ν΄λ§λ€ μ¬λΌμ΄λ© μλμ°λ‘ νμ₯ν΄ 3,546κ° νμ΅ μνλ‘ λ³ν
- μ΅μ’ train 14,072 / val 740
νμ΅ μ€μ
- LoRA: r=8, alpha=16, dropout=0.1, target_modules=["query_key_value", "dense"] (GPT-NeoX μ΄ν μ μμ£Όλ‘ μ’κ² νκΉ β κ³Όμ ν© μ΅μ )
- 4bit NF4 μμν(bitsandbytes), MAX_LENGTH=768
- batch_size=2, gradient_accumulation_steps=8 (μ ν¨ λ°°μΉ 16), 5 epoch μΊ‘ + EarlyStoppingCallback(patience=3)
- κ²°κ³Ό: epoch 3.296μμ early stopping, eval_loss 1.366, RTX 3060 Ti(8GB)μμ 141.9λΆ μμ, peak VRAM 3.4GB
μ¬μ©λ²
λ² μ΄μ€ λͺ¨λΈ(7.6GB)μ 4bitλ‘ λ‘λν λ€ μ΄ μ΄λν°λ₯Ό μΉμ΅λλ€.
import torch
from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig
BASE_MODEL = "EleutherAI/polyglot-ko-3.8b"
ADAPTER = "Junping0645/Vtuber" # μ΄ λ¦¬ν¬
tokenizer = AutoTokenizer.from_pretrained(BASE_MODEL)
bnb = BitsAndBytesConfig(
load_in_4bit=True,
bnb_4bit_quant_type="nf4",
bnb_4bit_compute_dtype=torch.float16,
bnb_4bit_use_double_quant=True,
)
base = AutoModelForCausalLM.from_pretrained(BASE_MODEL, quantization_config=bnb, device_map={"": 0})
model = PeftModel.from_pretrained(base, ADAPTER)
model.eval()
prompt = "### μ΄λ₯΄μ : μμ¦ λ§μ΄ μΈλ‘μ΅λλ€.\n### λ§λ무:"
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=80, do_sample=True, temperature=0.8,
top_p=0.9, repetition_penalty=1.15,
pad_token_id=tokenizer.eos_token_id, eos_token_id=tokenizer.eos_token_id)
print(tokenizer.decode(out[0], skip_special_tokens=True))
λ©ν°ν΄(λν μ΄λ ₯ μ μ§)
μ΄μ ν΄λ€μ κ°μ ν¬λ§·μΌλ‘ μ΄μ΄λΆμ΄λ©΄ λ¬Έλ§₯μ λ°μν λ΅λ³μ΄ λμ΅λλ€(νμ΅ μ μ¬μ©ν ν¬λ§·κ³Ό λμΌν΄μΌ ν¨):
### μ΄λ₯΄μ : μμ£Όκ° λ€μ μ£Όμ λλ¬ μ¨λμ.
### λ§λ무: μ λ§μ? κΈ°λλμκ² μ΄μ! μ¦κ±°μ΄ μκ° λ³΄λ΄μκΈΈ λ°λμ.
### μ΄λ₯΄μ : λͺ μ΄μΈμ§ μ λ¬Όμ΄λ³΄μ
¨λ€μ, μ΄λ²μ μ΄λ±νκ΅ λ€μ΄κ°μ.
### λ§λ무: κ·Έλ κ΅°μ! μμ¦ μμ΄λ€μ λΉ λ₯΄μ£ .
### μ΄λ₯΄μ : κ±κ° μ€λ©΄ λ ν΄μ£Όλ©΄ μ’μν κΉμ?
### λ§λ무:
μ°Έκ³
- VRAM: νμ΅ 3.4GB / μΆλ‘ μ½ 3.3GB (RTX 3060 Ti 8GB κΈ°μ€)
- Framework: PEFT 0.19.1, transformers 5.13.0, bitsandbytes 0.49.2, torch 2.11.0+cu128
- Downloads last month
- 17
Model tree for Junping0645/vtuber
Base model
EleutherAI/polyglot-ko-3.8b