AI 성능표를 정리할 때 수치의 크기만큼 신경 써야 할 것이 평가 조건입니다. 결과가 나온 뒤 계산한 값과 당시 알 수 있던 정보로 예측한 값은 어떻게 구분할까요? 아래는 실제 회사 수치를 사용하지 않은 일반화한 검증 노트입니다.

목표 수치·사후 평가·운영 검증을 서로 다른 근거로 읽도록 나눈 설명 도식입니다. 실제 성능 수치는 사용하지 않았습니다.
목표 수치·사후 평가·운영 검증을 서로 다른 근거로 읽도록 나눈 설명 도식입니다. 실제 성능 수치는 사용하지 않았습니다.도식 크게 보기
숫자의 크기와 함께 그 숫자가 나온 조건을 남기기

막히기 쉬운 지점

같은 정확도라고 적혀 있어도 자료를 읽는 시점이 다르면 의미가 달라집니다. 내일을 예측하는 모델에 결과가 나온 뒤 보완된 입력을 넣었다면, 실제 운영과 같은 조건의 평가로 볼 수 없습니다.

표에서 나눌 항목

예측 시점, 입력 자료의 마감 시점, 실제 결과의 확정 시점을 따로 적습니다. 전체 대상 중 무엇을 평가했고 무엇을 제외했는지도 남겨야 합니다. 어려운 사례가 많이 빠졌다면 그 범위를 알 수 있어야 하기 때문입니다.

달성하려는 목표, 결과를 알고 다시 계산한 평가, 실제 운영에서 확인한 결과도 분리합니다. 한 표에 담을 수는 있지만 같은 단계의 증거처럼 읽히지 않도록 이름을 구분해야 합니다.

이 단계의 인사이트

좋은 성능표에는 숫자와 함께 그 숫자를 어디까지 사용할 수 있는지가 적혀 있습니다. 발표용으로 내용을 줄일 때도 판단을 바꾸는 조건은 남겨야 합니다. 그래야 다른 사람도 결과를 검토할 수 있습니다.

다음 확인

새 모델과 이전 모델을 비교한다면 같은 대상·같은 시점·같은 계산 방법을 썼는지 확인합니다. 조건이 다르면 결과 옆에 차이를 적고, 그 비교만으로 개선을 단정하지 않습니다. 이런 기록이 다음에 검증해야 할 구간을 찾는 출발점이 됩니다.