Spanish Bibliographic Subject & UDC Classifier

This model is a multi-label sequence classification transformer fine-tuned on Spanish bibliographic records from the Biblioteca Nacional de España (BNE). It predicts SKOS subject headings and Universal Decimal Classification (UDC/Dewey) codes from book titles and publication descriptions.

Benchmark Evaluation Results

Evaluation Metric Score Description
SKOS Subject Top-1 Accuracy 0.6071 Exact match top-1 accuracy on SKOS preferred subject headings
SKOS Subject Top-3 Accuracy 0.9286 Top-3 candidate coverage for SKOS subject headings
SKOS Subject Macro F1 0.2519 Unweighted Macro F1 across SKOS subject classes
SKOS Subject Weighted F1 0.4587 Frequency-weighted F1 across SKOS subject classes
UDC Division Top-1 Accuracy 1.0000 Classification accuracy on UDC main divisions
UDC Division Macro F1 1.0000 Unweighted Macro F1 across UDC classification codes

Model Details

  • Foundation Model: dccuchile/bert-base-spanish-wwm-cased (BETO)
  • Parameters: ~110 Million
  • Training Dataset: hsilvosa/bne-linked-data
  • Task: Bibliographic subject and UDC code classification

Usage

from bne_semantic_linker.inference.classifier_pipeline import BNESubjectClassifierPipeline

pipeline = BNESubjectClassifierPipeline("hsilvosa/bne-spanish-subject-classifier")
results = pipeline.predict(
    title="Don Quijote de la Mancha", 
    description="Edición crítica con notas explicativas sobre la novela barroca española"
)

print(results)

Intended Use & Limitations

Optimized for library cataloging, automated subject indexing, and semantic categorisation of Spanish publications.

Downloads last month
8
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for hsilvosa/bne-spanish-subject-classifier

Finetuned
(195)
this model

Dataset used to train hsilvosa/bne-spanish-subject-classifier

Evaluation results