Sentence Similarity
sentence-transformers
Safetensors
Korean
English
modernbert
embedding
retrieval
mteb
korean
text-embeddings-inference
Instructions to use NGA-KR/ko-embed-v0 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- sentence-transformers
How to use NGA-KR/ko-embed-v0 with sentence-transformers:
from sentence_transformers import SentenceTransformer model = SentenceTransformer("NGA-KR/ko-embed-v0") sentences = [ "The weather is lovely today.", "It's so sunny outside!", "He drove to the stadium." ] embeddings = model.encode(sentences) similarities = model.similarity(embeddings, embeddings) print(similarities.shape) # [3, 3] - Notebooks
- Google Colab
- Kaggle
NGA-KR/ko-embed-v0
Korean dense text embedding model (149M parameters), fine-tuned from skt/A.X-Encoder-base.
Training data (zero-shot on MTEB(kor))
This model was trained only on public English retrieval datasets โ no Korean benchmark train splits were used:
- MSMARCO
- NQ
- HotpotQA
- GooAQ
Consequently, the model is 100% zero-shot on MTEB(kor, v1) and MTEB(kor, v2) (declared via training_datasets in the MTEB model metadata).
Usage
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("NGA-KR/ko-embed-v0")
q = model.encode(["์ ์ธ ๊ณ์ฝ์์ ๊ธฐ๊ฐ์ ์ ์ผ์ผ๋ฉด ์ผ๋ง ๋์ ์ ํจํด?"], prompt_name="query")
d = model.encode(["์๋์ฐจ ๊ณ์ฝ ๊ธฐ๊ฐ์ ์ ํ์ง ์์ ๊ฒฝ์ฐ 2๋
์ผ๋ก ๋ณธ๋ค..."], prompt_name="document")
print(q @ d.T)
Prompts are stored in the model config: query: for queries, passage: for documents.
Evaluation
Evaluated with mteb on MTEB(kor, v2) (20 tasks). See the MTEB leaderboard entry for full per-task scores.
Training details
- Base: skt/A.X-Encoder-base (ModernBERT-style Korean encoder, mean pooling, L2-normalised)
- Objective: contrastive (CachedMultipleNegativesRankingLoss), in-batch + 1 hard negative
- Batch 2048, lr 2e-5, cosine schedule, 1 epoch, bf16
- Max sequence length: 512
License
apache-2.0. Base model license: see skt/A.X-Encoder-base.
- Downloads last month
- 2
Model tree for NGA-KR/ko-embed-v0
Base model
skt/A.X-Encoder-base