scorelens-dd3

Feingetunte Variante von dart-sense (Basismodell, Lizenz CC BY-NC 4.0) für FreeDarts/ScoreLens.

Training auf Kaggle (T4-GPU, Gratis-Kontingent), Datensatz DeepDarts D1+D2 (CC BY 4.0), deutlich größerer Trainingsanteil als dd2.

Formal nicht besser als die Baseline (Recall UND Precision müssten beide steigen), aber der Recall-Gewinn bei der seitlichen Kamera ist real — siehe Metriken unten.

Trainingsdaten

Datensatz data3 (DeepDarts D1+D2, größerer Anteil)
Bildgröße 800px
Trainingsbilder 12.865
Validierungsbilder 1.441
Epochen 30
Freeze kein Freeze (volles Finetuning)

Metriken (Validierung)

Metrik Baseline (dart-sense) dd3 (feingetunt)
mAP50 0,9679 0,9917
mAP50-95 0,6129 0,8827
Precision 0,9823 0,9944
Recall 0,9349 0,9905
Tip Recall @10px 0,9199 0,9578
Tip Precision @10px 0,9722 0,9646
Tip Recall @10px (nur D2, seitlich) 0,9012 0,9458
Tip Precision @10px (nur D2, seitlich) 0,9636 0,9611

Tip Recall steigt deutlich (+3,8 Punkte gesamt, +4,5 Punkte bei der seitlichen Kamera), Tip Precision sinkt nur minimal (−0,8 bzw. −0,25 Punkte). Nach der strikten Regel „Recall UND Precision müssen beide steigen“ zählt das als nicht besser, in der Praxis ist der Recall-Gewinn bei der für FreeDarts relevanten Seitenansicht aber der beste Wert aller bisherigen Läufe (dd1, dd2, dd3) und ein Kandidat für weitere Prüfung (z. B. Score-Benchmark statt reiner Tip-Metrik).

Harter Benchmark: Schrägsicht + Verderbung kombiniert

Dieselben 615 echten DeepDarts-Val-Bilder, aber jedes einzelne mit starker Schrägsicht (45–60°) und Realitäts-Verderbung (dunkel, unscharf, verrauscht, JPEG, Schatten) zugleich — kein leichter Fall bleibt übrig. Aufbau in tools/finetune/bench_hard.py, gemessen auf Modal (T4). Fairer Vergleich über alle Läufe hinweg, weil identisch für jedes Modell gebaut.

Kriterium Wert
Spitzen gefunden / richtig @10px (conf 0,3) 70.6 % / 67.6 %
dito @5px 65.4 % / 62.7 %
Board erkannt (alle 4 Kalibrierpunkte) 89.9 %
Wurf komplett richtig gezählt (Kalibrier-Schwelle 0,6) 59.7 %
Darts im richtigen Feld 71.8 %
Enge Spitzen (unter 24 px auseinander) 52.5 % Recall
Drei Darts im Bild 66.2 % Recall
Übersehene Darts / Fehlalarme (von 615 Bildern) 145 / 88

Fremde Fotos (300 unveränderte Bilder aus dem Roboflow-Datensatz dartsync/darts-bjj98-minfw, keines davon im Training gesehen): Wurf richtig gezählt 91.3 %, Darts im Feld 95.8 %, enge Spitzen 86.0 % Recall, 16 übersehene Darts.

Dateien

  • best.pt — Checkpoint (Ultralytics-Format)
  • results.csv — Trainingsverlauf je Epoche
  • metrics.json — Baseline- vs. Ergebnis-Vergleich (Rohdaten für obige Tabelle)
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support