scorelens-dd6
Feingetunte Variante von dart-sense (Basismodell, Lizenz CC BY-NC 4.0) für FreeDarts/ScoreLens.
Training auf Kaggle (T4-GPU, Gratis-Kontingent), Warmstart aus dd4 (die ersten 5 Backbone-Blöcke bleiben eingefroren), Datensatz data6 (alle 16.050 DeepDarts-Bilder D1+D2, plus 32.486 synthetische Schrägsichten, plus 8.188 vermehrte harte Fälle davon 302 vom Vorgängermodell selbst als Fehler gefunden, plus 30 % realitätsnah verdorbene Fassungen: dunkler Raum, Unschärfe, Rauschen, JPEG-Artefakte, Schatten).
✅ Neuer Bestwert, schlägt dd4 auf praktisch jeder Kennzahl.
Trainingsdaten
| Datensatz | data6 (77.884 Trainingsbilder nach D2-Gewichtung) |
| Bildgröße | 800px |
| Epochen | 30, auf 9,5 h Laufzeit gedeckelt |
| Lernrate | 0,0003, Cosinus-Abklingen |
| Backbone | Warmstart aus dd4, erste 5 Blöcke eingefroren |
| D2-Gewicht | 2× |
Metriken (Validierung auf den 615 echten DeepDarts-Bildern, Vergleichsbasis für alle Läufe)
| Metrik | dd4 | dd6 (feingetunt) |
|---|---|---|
| Tip Recall @10px (gesamt) | 0,966 | 0,967 |
| Tip Precision @10px (gesamt) | 0,973 | 0,977 |
| Tip Recall @10px (nur D2, seitlich) | 0,953 | 0,953 |
| Tip Precision @10px (nur D2, seitlich) | 0,983 | 0,991 |
| Falsche Spitzen (1.441 Bilder inkl. Schrägsichten) | 79 | 65 |
| Recall auf hartem Benchmark (val_hard: starke Schräge + Verderbung) | 0,842 | 0,912 |
| Precision auf hartem Benchmark | 0,837 | 0,958 |
Der größte Sprung liegt bei den harten Fällen (Schrägsicht + Verderbung): +7 Punkte Recall, +12 Punkte Precision gegenüber dd4, ohne die Precision auf echter Seitensicht zu verlieren – im Gegenteil, sie steigt auf den bisher höchsten Wert aller Läufe.
Harter Benchmark: Schrägsicht + Verderbung kombiniert
Dieselben 615 echten DeepDarts-Val-Bilder, aber jedes einzelne mit starker Schrägsicht (45–60°) und
Realitäts-Verderbung (dunkel, unscharf, verrauscht, JPEG, Schatten) zugleich — kein leichter Fall bleibt übrig.
Aufbau in tools/finetune/bench_hard.py, gemessen auf Modal (T4). Fairer Vergleich über alle Läufe hinweg,
weil identisch für jedes Modell gebaut.
| Kriterium | Wert |
|---|---|
| Spitzen gefunden / richtig @10px (conf 0,3) | 82.3 % / 92.7 % |
| dito @5px | 78.4 % / 88.2 % |
| Board erkannt (alle 4 Kalibrierpunkte) | 99.2 % |
| Wurf komplett richtig gezählt (Kalibrier-Schwelle 0,6) | 74.8 % |
| Darts im richtigen Feld | 83.9 % |
| Enge Spitzen (unter 24 px auseinander) | 57.6 % Recall |
| Drei Darts im Bild | 78.3 % Recall |
| Übersehene Darts / Fehlalarme (von 615 Bildern) | 130 / 15 |
Fremde Fotos (300 unveränderte Bilder aus dem Roboflow-Datensatz dartsync/darts-bjj98-minfw, keines davon im Training gesehen): Wurf richtig gezählt 95.3 %, Darts im Feld 97.9 %, enge Spitzen 92.0 % Recall, 8 übersehene Darts.
Dateien
best.pt— Checkpoint (Ultralytics-Format)results.csv— Trainingsverlauf je Epochemetrics.json— Baseline- vs. Ergebnis-Vergleich (Rohdaten für obige Tabelle)