결과
Platt 보정으로 오차(ECE) 44% 감소
0.114
보정 전 ECE (미보정 다이얼)
0.063
보정 후 ECE (Platt)
표본: 교량 GT 시험셋 649개 인스턴스(167 오탐 / 482 진짜균열), fit/test 분리. ECE(Expected Calibration Error)는 "신뢰도"와 "실제 오탐율"의 평균 괴리 — 낮을수록 다이얼 눈금이 진짜 확률.
reliability diagram
회색=신뢰도(이상), 초록=실제 오탐율 — 둘이 같을수록 보정됨
보정 전 (raw)
0.0–0.1
n=64
0.1–0.2
n=46
0.2–0.3
n=56
0.3–0.4
n=24
0.4–0.5
n=26
0.5–0.6
n=57
0.6–0.7
n=27
0.7–0.8
n=21
0.8–0.9
n=3
보정 후 (Platt)
0.0–0.1
n=45
0.1–0.2
n=78
0.2–0.3
n=55
0.3–0.4
n=64
0.4–0.5
n=53
0.5–0.6
n=23
0.6–0.7
n=6
왜 중요한가: 미보정 점수는 모델마다 분포가 달라 그대로는 계약 근거가 못 된다(산업 검사 AI 연구가 지적). 우리는 GT로 보정해 다이얼 눈금이 실제 오탐 확률을 뜻하게 만들었다 — 이게 "오탐 −X% @ recall Y%"를 고객별로 신뢰가능하게 계약하는 전제이자, 능동학습 데이터 루프(불확실 항목 선별)의 기반이다.
immersivecast · measure-first · 게이트 신뢰도 보정(calibration.json)