Qwen3-Embedding-8B-rbln-tp4

Qwen/Qwen3-Embedding-8B ๋ฅผ Rebellions RBLN-CA25 NPU์šฉ์œผ๋กœ ์ปดํŒŒ์ผํ•œ ๋ชจ๋ธ.

  • RBLN SDK: rebel-compiler 0.11.0 / optimum-rbln 0.11.0.post1
  • ํƒ€๊นƒ: RBLN-CA25 (15.7 GiB/device)
  • ์ปดํŒŒ์ผ config: num_devices=4, max_seq_len=8192, batch_size=16, attn_impl=flash_attn, partition=4096
  • โš ๏ธ ๋Ÿฐํƒ€์ž„ device ๊ฐœ์ˆ˜ = ์ปดํŒŒ์ผ num_devices โ€” ์ด ๋นŒ๋“œ๋Š” 4์žฅ ์ „์šฉ ([0,1,2,3]).

๋กœ๋“œ

from optimum.rbln import RBLNAutoModel
model = RBLNAutoModel.from_pretrained("Qwen3-Embedding-8B-rbln-tp4", export=False, rbln_config={"device": [0,1,2,3]})

์ž„๋ฒ ๋”ฉ: last-token ํ’€๋ง + ์ฟผ๋ฆฌ instruction ํ”„๋ฆฌํ”ฝ์Šค. vLLM --task embed๋กœ๋„ ์„œ๋น™ ๊ฐ€๋Šฅ.

ํ† ํฌ๋‚˜์ด์ €/ํ”„๋กœ์„ธ์„œ๊ฐ€ ์—†์œผ๋ฉด base ๋ชจ๋ธ(Qwen/Qwen3-Embedding-8B)์—์„œ ๋กœ๋“œํ•˜์„ธ์š”.

Downloads last month
6
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support

Model tree for iAcloud/Qwen3-Embedding-8B-rbln-tp4

Finetuned
(40)
this model