bone_2026/models/train_report.md

3.0 KiB
Raw Permalink Blame History

Отчёт об обучении классификатора качества DXA

  • Backbone: resnet18
  • Устройство: mps
  • Источник меток: labels/labels_images.csv
  • Seed: 42, балансировка классов: none
  • Размер выборок: train 198 снимков / 81 исследований, val 53 снимков / 19 исследований (разбиение по исследованиям)
  • Предобработка: {'norm': 'percentile', 'p_low': 0.5, 'p_high': 99.5, 'imagenet_norm': True, 'input_size': 224}
  • Обучено эпох: 82, лучшая эпоха: 57
  • Рабочий порог (подобран по F1 на валидации): логит -0.1370 (вероятность 0.4658)

Метрики на валидации (лучший чекпоинт)

Метрика Значение
Accuracy 0.6792
Precision 0.4783
Recall 0.6875
F1 0.5641
ROC-AUC 0.6689
PR-AUC 0.4769
Порог (логит / вероятность) -0.1370 / 0.4658
TP/TN/FP/FN 11/25/12/5

Валидация невелика (единицы исследований), поэтому метрики имеют широкий доверительный интервал и не заменяют оценку на закрытом наборе.

Метрики по анатомическим областям

Область n Нарушений ROC-AUC F1 Recall
spine 19 5 0.9286 0.8000 0.8000
hip_right 17 6 0.6061 0.5714 0.6667
hip_left 17 5 0.5667 0.4000 0.6000

Нарушения в наборе распределены крайне неравномерно (в позвоночнике ~29 % снимков против ~4–5 % у бёдер), а анатомическая область почти однозначно определяется по размеру кадра. Поэтому общий AUC частично отражает различение области, а не только распознавание дефекта: сопоставляйте общий показатель со значениями по областям.

Ограничения и следующий шаг

  • Единицей разметки в исходных данных было исследование; снимок наследует метку исследования, поэтому часть меток заведомо шумная.
  • Область предсказывает вспомогательная голова; при ошибке области тип нарушения тоже будет определён неверно.
  • Для устойчивой оценки нужен больший набор и независимый тест: на 20–50 снимках валидации доверительные интервалы метрик очень широкие.