Qwen3-Embedding-4B-rbln-tp2

Qwen/Qwen3-Embedding-4B ๋ฅผ Rebellions RBLN-CA25 NPU์šฉ์œผ๋กœ ์ปดํŒŒ์ผํ•œ ๋ชจ๋ธ.

  • RBLN SDK: rebel-compiler 0.11.0 / optimum-rbln 0.11.0.post1
  • ํƒ€๊นƒ: RBLN-CA25 (15.7 GiB/device)
  • ์ปดํŒŒ์ผ config: num_devices=2, max_seq_len=8192, batch_size=16, attn_impl=flash_attn, partition=4096
  • โš ๏ธ ๋Ÿฐํƒ€์ž„ device ๊ฐœ์ˆ˜ = ์ปดํŒŒ์ผ num_devices โ€” ์ด ๋นŒ๋“œ๋Š” 2์žฅ ์ „์šฉ ([0,1]).

๋กœ๋“œ

from optimum.rbln import RBLNAutoModel
model = RBLNAutoModel.from_pretrained("Qwen3-Embedding-4B-rbln-tp2", export=False, rbln_config={"device": [0,1]})

์ž„๋ฒ ๋”ฉ: last-token ํ’€๋ง + ์ฟผ๋ฆฌ instruction ํ”„๋ฆฌํ”ฝ์Šค. vLLM --task embed๋กœ๋„ ์„œ๋น™ ๊ฐ€๋Šฅ.

ํ† ํฌ๋‚˜์ด์ €/ํ”„๋กœ์„ธ์„œ๊ฐ€ ์—†์œผ๋ฉด base ๋ชจ๋ธ(Qwen/Qwen3-Embedding-4B)์—์„œ ๋กœ๋“œํ•˜์„ธ์š”.

Downloads last month
8
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support

Model tree for iAcloud/Qwen3-Embedding-4B-rbln-tp2

Finetuned
(67)
this model