NGA-KR/ko-embed-v0

Korean dense text embedding model (149M parameters), fine-tuned from skt/A.X-Encoder-base.

Training data (zero-shot on MTEB(kor))

This model was trained only on public English retrieval datasets โ€” no Korean benchmark train splits were used:

  • MSMARCO
  • NQ
  • HotpotQA
  • GooAQ

Consequently, the model is 100% zero-shot on MTEB(kor, v1) and MTEB(kor, v2) (declared via training_datasets in the MTEB model metadata).

Usage

from sentence_transformers import SentenceTransformer
model = SentenceTransformer("NGA-KR/ko-embed-v0")
q = model.encode(["์ „์„ธ ๊ณ„์•ฝ์„œ์— ๊ธฐ๊ฐ„์„ ์•ˆ ์ผ์œผ๋ฉด ์–ผ๋งˆ ๋™์•ˆ ์œ ํšจํ•ด?"], prompt_name="query")
d = model.encode(["์ž„๋Œ€์ฐจ ๊ณ„์•ฝ ๊ธฐ๊ฐ„์„ ์ •ํ•˜์ง€ ์•Š์€ ๊ฒฝ์šฐ 2๋…„์œผ๋กœ ๋ณธ๋‹ค..."], prompt_name="document")
print(q @ d.T)

Prompts are stored in the model config: query: for queries, passage: for documents.

Evaluation

Evaluated with mteb on MTEB(kor, v2) (20 tasks). See the MTEB leaderboard entry for full per-task scores.

Training details

  • Base: skt/A.X-Encoder-base (ModernBERT-style Korean encoder, mean pooling, L2-normalised)
  • Objective: contrastive (CachedMultipleNegativesRankingLoss), in-batch + 1 hard negative
  • Batch 2048, lr 2e-5, cosine schedule, 1 epoch, bf16
  • Max sequence length: 512

License

apache-2.0. Base model license: see skt/A.X-Encoder-base.

Downloads last month
2
Safetensors
Model size
0.1B params
Tensor type
BF16
ยท
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support

Model tree for NGA-KR/ko-embed-v0

Finetuned
(13)
this model

Space using NGA-KR/ko-embed-v0 1