Instructions to use yusufekorman/turkce-edebiyat-embedding-bge-m3-basic with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- sentence-transformers
How to use yusufekorman/turkce-edebiyat-embedding-bge-m3-basic with sentence-transformers:
from sentence_transformers import SentenceTransformer model = SentenceTransformer("yusufekorman/turkce-edebiyat-embedding-bge-m3-basic") sentences = [ "Deniz, dalgaların kıyıya vuruşuyla huzur veren bir ses çıkarıyordu.", "Dalgaların sahile çarptığında çıkardığı ses, insana dinginlik veriyordu.", "Bugün marketten alışveriş yapmam gerekiyor, akşama misafir gelecek." ] embeddings = model.encode(sentences) similarities = model.similarity(embeddings, embeddings) print(similarities.shape) # [3, 3] - Notebooks
- Google Colab
- Kaggle
🇹🇷 Türkçe Edebiyat Embedding Modeli (BGE-M3 Fine-tuned)
Bu model, nezahatkorkmaz/turkce-embedding-bge-m3 üzerine Türk edebiyatı metinleri kullanılarak fine-tune edilmiş bir cümle embedding modelidir. Türkçe edebi metinler arasında anlamsal benzerlik, metin arama ve kümeleme görevleri için optimize edilmiştir.
Model Özellikleri
| Özellik | Değer |
|---|---|
| Temel Model | nezahatkorkmaz/turkce-embedding-bge-m3 |
| Mimari | XLM-RoBERTa + Pooling + Normalize |
| Embedding Boyutu | 1024 |
| Maksimum Dizi Uzunluğu | 256 token |
| Benzerlik Fonksiyonu | Cosine (Kosinüs) |
| Dil | Türkçe 🇹🇷 |
| Kullanım Alanları | Anlamsal Arama, Metin Benzerliği, RAG, Kümeleme |
Kullanım
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("yusufekorman/turkce-edebiyat-embedding-bge-m3-basic")
cümleler = [
"Deniz, dalgaların kıyıya vuruşuyla huzur veren bir ses çıkarıyordu.",
"Dalgaların sahile çarptığında çıkardığı ses, insana dinginlik veriyordu.",
"Bugün marketten alışveriş yapmam gerekiyor, akşama misafir gelecek."
]
embeddings = model.encode(cümleler, normalize_embeddings=True)
similarities = model.similarity(embeddings, embeddings)
print(similarities)
Eğitim Verisi
Fine-tune işlemi, açık kaynaklı edebi materyaller, telif süresi dolmuş (kamu malı) Türk edebiyatı klasikleri ve yapılandırılmış paraphrase triplet verileri kullanılarak yapılmıştır.
Eğitim Detayları
Hiperparametreler
| Parametre | Değer |
|---|---|
| Batch size (efektif) | 16 (2 × 8 grad accumulation) |
| Learning rate | 2e-5 |
| Epoch | 3 |
| Optimizer | AdamW 8-bit |
| Mixed precision | BF16 |
| Gradient checkpointing | Evet |
| Loss | CachedMultipleNegativesRankingLoss |
| Max sequence length | 256 token |
Donanım
- GPU: NVIDIA GeForce RTX 4060 (8GB VRAM)
- Eğitim süresi: ~9.7 dakika
Performans
Test Seti Karşılaştırması (89 triplet)
| Model | Avg Pozitif | Avg Negatif | Margin | Acc |
|---|---|---|---|---|
| Fine-tuned (bu model) | 0.772 | 0.249 | 0.522 | %100 |
| nezahatkorkmaz/bge-m3 (base) | 0.833 | 0.449 | 0.384 | %100 |
| BAAI/bge-m3 (multilingual) | 0.862 | 0.510 | 0.352 | %100 |
Fine-tuned model, pozitif-paraphrase benzerliğini daha düşük gösterirken (0.77) negatif (ilgisiz) metinleri çok daha iyi ayırmaktadır (0.25 vs 0.45-0.51). Margin (pozitif - negatif farkı) en belirleyici metriktir: fine-tuned model 0.522 ile base modellerin 0.384 ve 0.352'sine karşı açık ara öndedir.
Değerlendirme Seti
| Metrik | Değer |
|---|---|
| Cosine Accuracy | 1.0 (111/111 doğru sıralama) |
| Validation Loss | 0.0002 |
License
Bu model BAAI/bge-m3 temel alınarak fine-tune edilmiştir. Temel modelin lisansı geçerlidir (MIT).
- Downloads last month
- 62