scorelens-dd4
Feingetunte Variante von dart-sense (Basismodell, Lizenz CC BY-NC 4.0) für FreeDarts/ScoreLens.
Training auf Kaggle (T4-GPU, Gratis-Kontingent), Datensatz DeepDarts D1+D2 (CC BY 4.0), D2 (seitliche Kamera) doppelt gewichtet.
✅ Erster Lauf, der die Baseline auf beiden Kennzahlen schlägt (Tip Recall UND Tip Precision, gesamt und seitlich).
Trainingsdaten
| Datensatz | data3 (DeepDarts D1+D2), D2-Bilder 2× im Training |
| Bildgröße | 800px |
| Trainingsbilder | 16.616 |
| Validierungsbilder | 1.441 |
| Epochen | 50 |
| Lernrate | 0,0005, Cosinus-Abklingen |
| Freeze | kein Freeze (volles Finetuning) |
Metriken (Validierung)
| Metrik | Baseline (dart-sense) | dd4 (feingetunt) |
|---|---|---|
| mAP50 | 0,9679 | 0,9908 |
| mAP50-95 | 0,6129 | 0,8923 |
| Precision | 0,9823 | 0,9960 |
| Recall | 0,9349 | 0,9901 |
| Tip Recall @10px | 0,9199 | 0,9578 |
| Tip Precision @10px | 0,9722 | 0,9729 |
| Tip Recall @10px (nur D2, seitlich) | 0,9012 | 0,9469 |
| Tip Precision @10px (nur D2, seitlich) | 0,9636 | 0,9856 |
Im Unterschied zu dd1–dd3 steigen hier Recall und Precision gleichzeitig, am deutlichsten bei der seitlichen Kamera (+4,6 Punkte Recall, +2,2 Punkte Precision) — dem für FreeDarts relevanten Winkel. Kandidat für den TFLite-Export und den Einsatz in der App, sofern eine unabhängige Prüfung (z. B. Score-Benchmark) das bestätigt.
Harter Benchmark: Schrägsicht + Verderbung kombiniert
Dieselben 615 echten DeepDarts-Val-Bilder, aber jedes einzelne mit starker Schrägsicht (45–60°) und
Realitäts-Verderbung (dunkel, unscharf, verrauscht, JPEG, Schatten) zugleich — kein leichter Fall bleibt übrig.
Aufbau in tools/finetune/bench_hard.py, gemessen auf Modal (T4). Fairer Vergleich über alle Läufe hinweg,
weil identisch für jedes Modell gebaut.
| Kriterium | Wert |
|---|---|
| Spitzen gefunden / richtig @10px (conf 0,3) | 72.0 % / 68.0 % |
| dito @5px | 66.1 % / 62.5 % |
| Board erkannt (alle 4 Kalibrierpunkte) | 90.6 % |
| Wurf komplett richtig gezählt (Kalibrier-Schwelle 0,6) | 60.5 % |
| Darts im richtigen Feld | 71.2 % |
| Enge Spitzen (unter 24 px auseinander) | 50.6 % Recall |
| Drei Darts im Bild | 68.3 % Recall |
| Übersehene Darts / Fehlalarme (von 615 Bildern) | 152 / 81 |
Fremde Fotos (300 unveränderte Bilder aus dem Roboflow-Datensatz dartsync/darts-bjj98-minfw, keines davon im Training gesehen): Wurf richtig gezählt 89.3 %, Darts im Feld 95.1 %, enge Spitzen 88.0 % Recall, 16 übersehene Darts.
Dateien
best.pt— Checkpoint (Ultralytics-Format)results.csv— Trainingsverlauf je Epochemetrics.json— Baseline- vs. Ergebnis-Vergleich (Rohdaten für obige Tabelle)