Instructions to use lliaafra/kpop-embedding-finetuned with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use lliaafra/kpop-embedding-finetuned with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("feature-extraction", model="lliaafra/kpop-embedding-finetuned")# Load model directly from transformers import AutoTokenizer, AutoModel tokenizer = AutoTokenizer.from_pretrained("lliaafra/kpop-embedding-finetuned") model = AutoModel.from_pretrained("lliaafra/kpop-embedding-finetuned", device_map="auto") - sentence-transformers
How to use lliaafra/kpop-embedding-finetuned with sentence-transformers:
from sentence_transformers import SentenceTransformer model = SentenceTransformer("lliaafra/kpop-embedding-finetuned") sentences = [ "The weather is lovely today.", "It's so sunny outside!", "He drove to the stadium." ] embeddings = model.encode(sentences) similarities = model.similarity(embeddings, embeddings) print(similarities.shape) # [3, 3] - Notebooks
- Google Colab
- Kaggle
K-Pop Embedding Finetuned
Deskripsi Model
K-Pop Embedding Finetuned merupakan model Sentence Transformer yang telah melalui proses fine-tuning menggunakan dataset bertema K-Pop. Model ini dirancang untuk menghasilkan representasi (embedding) kalimat yang lebih baik sehingga mampu memahami hubungan semantik antar teks yang berkaitan dengan dunia K-Pop.
Model ini diekspor ke format ONNX sehingga memiliki proses inferensi yang lebih cepat dan efisien untuk diintegrasikan ke dalam aplikasi berbasis web maupun sistem produksi.
Model Dasar
Model ini dikembangkan dengan melakukan fine-tuning terhadap model:
sentence-transformers/all-MiniLM-L6-v2
Model dasar tersebut merupakan model embedding yang banyak digunakan untuk tugas seperti:
- Semantic Search
- Text Similarity
- Information Retrieval
- Retrieval-Augmented Generation (RAG)
Setelah dilakukan fine-tuning, model menjadi lebih memahami istilah-istilah yang sering muncul pada domain K-Pop.
Tujuan Pengembangan
Model ini dikembangkan untuk meningkatkan performa pencarian informasi pada domain K-Pop sehingga lebih akurat dibandingkan model umum.
Model dapat digunakan untuk:
- Semantic Search
- Information Retrieval
- Question Answering
- Chatbot berbasis RAG
- Text Similarity
- Sistem Rekomendasi
- Pencarian artikel K-Pop
- Pencarian informasi artis, lagu, album, dan grup K-Pop
Dataset
Model dilatih menggunakan dataset bertema K-Pop yang berisi informasi seperti:
- Nama grup K-Pop
- Nama idol
- Lagu
- Album
- Entertainment Agency
- Comeback
- Fan terminology
- Konser
- Penghargaan
- Berita K-Pop
Dataset tersebut digunakan untuk meningkatkan kemampuan model dalam memahami konteks dan hubungan semantik pada teks yang berkaitan dengan K-Pop.
Arsitektur Model
- Base Model : sentence-transformers/all-MiniLM-L6-v2
- Framework : Hugging Face Transformers
- Arsitektur : BERT
- Format Model : ONNX
- Tokenizer : BERT Tokenizer
File Repository
Repository ini berisi beberapa file utama:
- model.onnx
- config.json
- tokenizer.json
- tokenizer_config.json
- special_tokens_map.json
- vocab.txt
Cara Menggunakan Model
Instalasi
pip install transformers optimum onnxruntime
Memuat Model
from transformers import AutoTokenizer
from optimum.onnxruntime import ORTModelForFeatureExtraction
model_id = "lliaafra/kpop-embedding-finetuned"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = ORTModelForFeatureExtraction.from_pretrained(model_id)
Contoh Penggunaan
text = "BLACKPINK akan mengadakan konser dunia."
inputs = tokenizer(
text,
return_tensors="pt",
truncation=True,
padding=True
)
outputs = model(**inputs)
embedding = outputs.last_hidden_state
Hasil Fine-Tuning
Setelah dilakukan proses fine-tuning menggunakan dataset K-Pop, model menunjukkan peningkatan kemampuan dalam memahami istilah-istilah khusus pada domain K-Pop, seperti:
- Nama artis
- Nama grup
- Judul lagu
- Nama album
- Nama agensi
- Istilah fandom
- Informasi comeback
- Berita hiburan Korea
Dibandingkan model dasar, model hasil fine-tuning mampu menghasilkan embedding yang lebih relevan untuk kebutuhan pencarian informasi bertema K-Pop.
Kelebihan Model
- Lebih memahami konteks K-Pop.
- Menghasilkan embedding yang lebih representatif.
- Cocok digunakan untuk aplikasi Semantic Search.
- Mendukung Retrieval-Augmented Generation (RAG).
- Mendukung deployment menggunakan ONNX Runtime.
- Ukuran model relatif ringan sehingga inferensi lebih cepat.
Keterbatasan
Model ini dioptimalkan khusus untuk domain K-Pop.
Performa model dapat menurun apabila digunakan pada domain lain seperti:
- Medis
- Hukum
- Keuangan
- Sains
- Dokumen akademik umum
Penggunaan yang Disarankan
Model ini cocok digunakan untuk:
- Sistem pencarian informasi K-Pop
- Chatbot K-Pop
- Sistem Rekomendasi Lagu
- Mesin pencarian artikel hiburan Korea
- Retrieval-Augmented Generation (RAG)
- Penelitian Natural Language Processing (NLP)
Detail Fine-Tuning
Model ini dikembangkan melalui proses fine-tuning menggunakan framework Sentence Transformers.
Konfigurasi pelatihan meliputi:
- Base Model : sentence-transformers/all-MiniLM-L6-v2
- Framework : Hugging Face Transformers
- Format Deployment : ONNX
Model kemudian diekspor ke format ONNX agar dapat digunakan dengan performa inferensi yang lebih cepat pada berbagai platform.
Lisensi
Model ini menggunakan lisensi MIT License.
Penulis
Model ini dikembangkan oleh lliaafra sebagai bagian dari penelitian dan pengembangan di bidang Natural Language Processing (NLP), khususnya untuk meningkatkan kualitas representasi embedding pada domain K-Pop menggunakan teknik fine-tuning Sentence Transformers.
Ucapan Terima Kasih
Pengembangan model ini memanfaatkan berbagai proyek open-source, antara lain:
- Hugging Face Transformers
- Sentence Transformers
- ONNX Runtime
- all-MiniLM-L6-v2
Terima kasih kepada komunitas open-source yang telah menyediakan berbagai pustaka dan model dasar sehingga penelitian ini dapat dilakukan.
- Downloads last month
- 46
Model tree for lliaafra/kpop-embedding-finetuned
Base model
nreimers/MiniLM-L6-H384-uncased