🇹🇷 Türkçe Edebiyat Embedding Modeli (BGE-M3 Fine-tuned)

Bu model, nezahatkorkmaz/turkce-embedding-bge-m3 üzerine Türk edebiyatı metinleri kullanılarak fine-tune edilmiş bir cümle embedding modelidir. Türkçe edebi metinler arasında anlamsal benzerlik, metin arama ve kümeleme görevleri için optimize edilmiştir.

Model Özellikleri

Özellik Değer
Temel Model nezahatkorkmaz/turkce-embedding-bge-m3
Mimari XLM-RoBERTa + Pooling + Normalize
Embedding Boyutu 1024
Maksimum Dizi Uzunluğu 256 token
Benzerlik Fonksiyonu Cosine (Kosinüs)
Dil Türkçe 🇹🇷
Kullanım Alanları Anlamsal Arama, Metin Benzerliği, RAG, Kümeleme

Kullanım

from sentence_transformers import SentenceTransformer

model = SentenceTransformer("yusufekorman/turkce-edebiyat-embedding-bge-m3-basic")

cümleler = [
    "Deniz, dalgaların kıyıya vuruşuyla huzur veren bir ses çıkarıyordu.",
    "Dalgaların sahile çarptığında çıkardığı ses, insana dinginlik veriyordu.",
    "Bugün marketten alışveriş yapmam gerekiyor, akşama misafir gelecek."
]
embeddings = model.encode(cümleler, normalize_embeddings=True)

similarities = model.similarity(embeddings, embeddings)
print(similarities)

Eğitim Verisi

Fine-tune işlemi, açık kaynaklı edebi materyaller, telif süresi dolmuş (kamu malı) Türk edebiyatı klasikleri ve yapılandırılmış paraphrase triplet verileri kullanılarak yapılmıştır.

Eğitim Detayları

Hiperparametreler

Parametre Değer
Batch size (efektif) 16 (2 × 8 grad accumulation)
Learning rate 2e-5
Epoch 3
Optimizer AdamW 8-bit
Mixed precision BF16
Gradient checkpointing Evet
Loss CachedMultipleNegativesRankingLoss
Max sequence length 256 token

Donanım

  • GPU: NVIDIA GeForce RTX 4060 (8GB VRAM)
  • Eğitim süresi: ~9.7 dakika

Performans

Test Seti Karşılaştırması (89 triplet)

Model Avg Pozitif Avg Negatif Margin Acc
Fine-tuned (bu model) 0.772 0.249 0.522 %100
nezahatkorkmaz/bge-m3 (base) 0.833 0.449 0.384 %100
BAAI/bge-m3 (multilingual) 0.862 0.510 0.352 %100

Fine-tuned model, pozitif-paraphrase benzerliğini daha düşük gösterirken (0.77) negatif (ilgisiz) metinleri çok daha iyi ayırmaktadır (0.25 vs 0.45-0.51). Margin (pozitif - negatif farkı) en belirleyici metriktir: fine-tuned model 0.522 ile base modellerin 0.384 ve 0.352'sine karşı açık ara öndedir.

Değerlendirme Seti

Metrik Değer
Cosine Accuracy 1.0 (111/111 doğru sıralama)
Validation Loss 0.0002

License

Bu model BAAI/bge-m3 temel alınarak fine-tune edilmiştir. Temel modelin lisansı geçerlidir (MIT).

Downloads last month
62
Safetensors
Model size
0.6B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for yusufekorman/turkce-edebiyat-embedding-bge-m3-basic

Base model

BAAI/bge-m3
Finetuned
(1)
this model