S7-relevance-rubert-20260823
Бинарная классификация релевантности русскоязычных текстов для домена S7.
Model details
- Base model:
ai-forever/ruRoBERTa-large - Architecture:
RuBERTBinaryClassifier - Best validation F1:
0.978417 - Test F1:
0.971429 - Test precision:
0.951049 - Test recall:
0.992701 - Decision threshold:
0.5 - Maximum sequence length:
512 - Training class ratio (relevant:irrelevant):
3.0:1
Usage
from huggingface_hub import hf_hub_download
from transformers import AutoTokenizer
import torch
repo = "DanielNRU/S7-relevance-rubert-20260823"
tokenizer = AutoTokenizer.from_pretrained(repo)
model = RuBERTBinaryClassifier("ai-forever/ruRoBERTa-large", hidden_size=512)
weights = hf_hub_download(repo_id=repo, filename="model.safetensors" if (output_dir / "model.safetensors").exists() else "pytorch_model.bin")
model.load_state_dict(torch.load(weights, map_location="cpu"))
model.eval()
Limitations
Модель предназначена для S7-домена. При изменении распределения данных рекомендуется повторно проверить threshold и метрики.
- Downloads last month
- 39