scorelens-dd3
Feingetunte Variante von dart-sense (Basismodell, Lizenz CC BY-NC 4.0) für FreeDarts/ScoreLens.
Training auf Kaggle (T4-GPU, Gratis-Kontingent), Datensatz DeepDarts D1+D2 (CC BY 4.0), deutlich größerer Trainingsanteil als dd2.
Formal nicht besser als die Baseline (Recall UND Precision müssten beide steigen), aber der Recall-Gewinn bei der seitlichen Kamera ist real — siehe Metriken unten.
Trainingsdaten
| Datensatz | data3 (DeepDarts D1+D2, größerer Anteil) |
| Bildgröße | 800px |
| Trainingsbilder | 12.865 |
| Validierungsbilder | 1.441 |
| Epochen | 30 |
| Freeze | kein Freeze (volles Finetuning) |
Metriken (Validierung)
| Metrik | Baseline (dart-sense) | dd3 (feingetunt) |
|---|---|---|
| mAP50 | 0,9679 | 0,9917 |
| mAP50-95 | 0,6129 | 0,8827 |
| Precision | 0,9823 | 0,9944 |
| Recall | 0,9349 | 0,9905 |
| Tip Recall @10px | 0,9199 | 0,9578 |
| Tip Precision @10px | 0,9722 | 0,9646 |
| Tip Recall @10px (nur D2, seitlich) | 0,9012 | 0,9458 |
| Tip Precision @10px (nur D2, seitlich) | 0,9636 | 0,9611 |
Tip Recall steigt deutlich (+3,8 Punkte gesamt, +4,5 Punkte bei der seitlichen Kamera), Tip Precision sinkt nur minimal (−0,8 bzw. −0,25 Punkte). Nach der strikten Regel „Recall UND Precision müssen beide steigen“ zählt das als nicht besser, in der Praxis ist der Recall-Gewinn bei der für FreeDarts relevanten Seitenansicht aber der beste Wert aller bisherigen Läufe (dd1, dd2, dd3) und ein Kandidat für weitere Prüfung (z. B. Score-Benchmark statt reiner Tip-Metrik).
Harter Benchmark: Schrägsicht + Verderbung kombiniert
Dieselben 615 echten DeepDarts-Val-Bilder, aber jedes einzelne mit starker Schrägsicht (45–60°) und
Realitäts-Verderbung (dunkel, unscharf, verrauscht, JPEG, Schatten) zugleich — kein leichter Fall bleibt übrig.
Aufbau in tools/finetune/bench_hard.py, gemessen auf Modal (T4). Fairer Vergleich über alle Läufe hinweg,
weil identisch für jedes Modell gebaut.
| Kriterium | Wert |
|---|---|
| Spitzen gefunden / richtig @10px (conf 0,3) | 70.6 % / 67.6 % |
| dito @5px | 65.4 % / 62.7 % |
| Board erkannt (alle 4 Kalibrierpunkte) | 89.9 % |
| Wurf komplett richtig gezählt (Kalibrier-Schwelle 0,6) | 59.7 % |
| Darts im richtigen Feld | 71.8 % |
| Enge Spitzen (unter 24 px auseinander) | 52.5 % Recall |
| Drei Darts im Bild | 66.2 % Recall |
| Übersehene Darts / Fehlalarme (von 615 Bildern) | 145 / 88 |
Fremde Fotos (300 unveränderte Bilder aus dem Roboflow-Datensatz dartsync/darts-bjj98-minfw, keines davon im Training gesehen): Wurf richtig gezählt 91.3 %, Darts im Feld 95.8 %, enge Spitzen 86.0 % Recall, 16 übersehene Darts.
Dateien
best.pt— Checkpoint (Ultralytics-Format)results.csv— Trainingsverlauf je Epochemetrics.json— Baseline- vs. Ergebnis-Vergleich (Rohdaten für obige Tabelle)