Arlo Score 1.0

Arlo is een Nederlandse modelfamilie voor snelle, getypeerde beslissingen. Waar een taalmodel tekst genereert die je daarna moet interpreteren, geeft Arlo direct een waarde terug waar software mee kan werken — altijd met een confidence score.

Dit model dekt het Score-primitief: tekst beoordelen tegen een rubric en daar een getal tussen 0 en 1 voor teruggeven.

Arlo in actie

Wat dit model onderscheidt

Het rubric geef je pas op het moment van gebruik mee. Hetzelfde model scoort klanttevredenheid, kwaliteit van dienstverlening of semantische gelijkenis — afhankelijk van het criterium dat je meestuurt. Je hoeft niet per maatstaf een apart model te trainen.

Daarnaast voorspelt het model naast de score ook zijn eigen onzekerheid. Die komt niet uit een truc achteraf, maar uit de training zelf: het model is getraind met heteroscedastic regressie, waarbij het per voorbeeld zowel de waarde als de spreiding leert. Een lage confidence betekent dus echt dat het model twijfelt — bruikbaar om te bepalen wat automatisch door kan en wat naar een mens moet.

Gebruik

from transformers import AutoModel, AutoTokenizer

model = AutoModel.from_pretrained("NoaberAI/arlo-score", trust_remote_code=True)
tokenizer = AutoTokenizer.from_pretrained("NoaberAI/arlo-score")

model.score(tokenizer,
    "Geweldige service, binnen een dag alles geregeld.",
    "klanttevredenheid (0-1)")
# {"score": 0.86, "confidence": 1.00}

Voorbeelden

model.score(tokenizer,
    "Vriendelijke bediening, eten kwam snel, prima ervaring.",
    "algemene tevredenheid over het restaurantbezoek (0-1)")
# {"score": 0.81, "confidence": 0.99}

model.score(tokenizer,
    "De trein naar Amsterdam vertrekt om 14:32 uur.",
    'semantische gelijkenis (0-1) met: "Om 14:32 vertrekt de trein richting Amsterdam."')
# {"score": 0.97, "confidence": 1.00}

Een goed rubric schrijven

De kwaliteit van de score hangt af van hoe concreet je het criterium formuleert. Geef het schaaluiteinden en een situationele betekenis:

# scherp
"klanttevredenheid op schaal 0-1, waarbij 0 = zeer ontevreden en 1 = zeer tevreden"

# vaag
"hoe goed is dit"

Heeft een beoordeling meerdere onafhankelijke aspecten, splits die dan op in losse vragen en combineer de uitkomsten zelf — dat levert scherpere en beter uitlegbare scores op dan één samengesteld oordeel.

Ook op andere talen

Het model is op Nederlands getraind, maar de backbone (mdeberta-v3-base) is multilingual en dat blijft merkbaar. Hetzelfde rubric — in het Nederlands — werkt op anderstalige tekst:

rubric = "klanttevredenheid (0-1)"

model.score(tok, "Geweldige service, binnen een dag alles geregeld.", rubric)
# {"score": 0.86, "confidence": 1.00}
model.score(tok, "Excellent service, everything sorted within a day.", rubric)
# {"score": 0.83, "confidence": 0.99}
model.score(tok, "Ausgezeichneter Service, alles innerhalb eines Tages geregelt.", rubric)
# {"score": 0.85, "confidence": 0.99}

Je hoeft je rubric dus niet per taal te herschrijven.

De Arlo-familie

Arlo bestaat uit drie modellen die samen een complete laag vormen voor gestructureerde beslissingen. Ze delen dezelfde backbone-architectuur en hetzelfde output-contract — een waarde plus een confidence — en zijn onafhankelijk of gecombineerd te gebruiken.

Model Primitieven Waarvoor
arlo-classify Choice, Noul categoriseren, routeren, waarheidsvragen
arlo-score Score numeriek beoordelen tegen een rubric
arlo-extract Extraction getypeerde velden uit tekst halen

Score is de natuurlijke aanvulling op de andere twee: arlo-classify bepaalt wáár iets over gaat, arlo-extract haalt de feiten eruit, en arlo-score geeft er een maat aan. Samen leveren ze uit één stuk vrije tekst een compleet gestructureerd record op — label, velden én beoordeling.

tekst = "Vriendelijke bediening, eten kwam snel, prima ervaring."

classify.choice(tokenizer_c, tekst, ["compliment", "klacht", "vraag"])
# [{"label": "compliment", "confidence": 0.62}, ...]

classify.noul(tokenizer_c, tekst, "De klant is tevreden.")
# {"truth": 0.93}

score.score(tokenizer_s, tekst, "algemene tevredenheid over het restaurantbezoek (0-1)")
# {"score": 0.81, "confidence": 0.99}

Technische details

  • Backbone: microsoft/mdeberta-v3-base (~280M parameters)
  • Kop: regressie met twee outputs — voorspelde waarde en voorspelde log-variantie (heteroscedastic regressie, Gaussian NLL-loss)
  • Taal: Nederlands
  • Trainingsdata: Nederlandstalige data uit meerdere domeinen — productbeoordelingen, servicekwaliteit en semantische gelijkenis — zodat het model rubric-beoordeling in brede zin leert in plaats van alleen sentiment
  • Hardware: getraind op een NVIDIA A100
  • Licentie: MIT

Gemaakt door NoaberAI.

Downloads last month
53
Safetensors
Model size
0.3B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for NoaberAI/arlo-score

Finetuned
(301)
this model