librarian-bots/arxiv-new-datasets-v2
Viewer • Updated • 3.21k • 60
How to use davanstrien/modernbert-arxiv-new-dataset-v2 with Transformers:
# Use a pipeline as a high-level helper
from transformers import pipeline
pipe = pipeline("text-classification", model="davanstrien/modernbert-arxiv-new-dataset-v2") # Load model directly
from transformers import AutoTokenizer, AutoModelForSequenceClassification
tokenizer = AutoTokenizer.from_pretrained("davanstrien/modernbert-arxiv-new-dataset-v2")
model = AutoModelForSequenceClassification.from_pretrained("davanstrien/modernbert-arxiv-new-dataset-v2", device_map="auto")answerdotai/ModernBERT-base fine-tuned for single-label text classification on librarian-bots/arxiv-new-datasets-v2.
new_dataset, not_new_dataset| Metric | Value |
|---|---|
| accuracy | 0.8816 |
| f1_macro | 0.8316 |
from transformers import AutoModelForSequenceClassification, AutoTokenizer
model = AutoModelForSequenceClassification.from_pretrained("davanstrien/modernbert-arxiv-new-dataset-v2", trust_remote_code=True)
tokenizer = AutoTokenizer.from_pretrained("davanstrien/modernbert-arxiv-new-dataset-v2", trust_remote_code=True)
inputs = tokenizer("your text here", return_tensors="pt", truncation=True)
print(model.config.id2label[model(**inputs).logits.argmax().item()])
Produced on Hugging Face Jobs (gpu) with the train-classifier.py recipe from uv-scripts. Run it yourself:
hf jobs uv run --flavor gpu --secrets HF_TOKEN \
https://huggingface.co/datasets/uv-scripts/classification/raw/main/train-classifier.py \
librarian-bots/arxiv-new-datasets-v2 davanstrien/modernbert-arxiv-new-dataset-v2 --model answerdotai/ModernBERT-base --label-column labels
Base model
answerdotai/ModernBERT-base