AI 성능표를 정리할 때 수치의 크기만큼 신경 써야 할 것이 평가 조건입니다. 결과가 나온 뒤 계산한 값과 당시 알 수 있던 정보로 예측한 값은 어떻게 구분할까요? 같은 이름의 지표라도 답하고 있는 질문이 다를 수 있습니다. 이 글은 실제 회사 수치나 특정 모델의 성과를 사용하지 않고, 성능표를 읽고 비교할 때 남겨야 할 조건을 정리한 일반화한 검증 노트입니다.

목표 수치·사후 평가·운영 검증을 서로 다른 근거로 읽도록 나눈 설명 도식입니다. 실제 성능 수치는 사용하지 않았습니다.
목표 수치·사후 평가·운영 검증을 서로 다른 근거로 읽도록 나눈 설명 도식입니다. 실제 성능 수치는 사용하지 않았습니다.도식 크게 보기
숫자의 크기와 함께 그 숫자가 나온 조건을 남기기

숫자를 읽기 전에 질문을 맞추기

표에 정확도라는 같은 이름이 붙어 있으면 수치가 큰 쪽이 더 좋은 결과처럼 보이기 쉽습니다. 하지만 어떤 자료를 언제 사용했고 무엇을 대상으로 계산했는지가 다르면 같은 의미로 비교하기 어렵습니다. 우선 그 숫자가 어떤 상황에서의 성능을 설명하는지 알아야 합니다.

가상의 생산량 예측 사례를 생각해볼 수 있습니다. 한 평가는 당시 확보한 자료만 사용하고, 다른 평가는 실제 생산이 끝난 뒤 보완된 자료까지 사용했다고 가정하겠습니다. 두 값 모두 계산 결과일 수 있지만 실제 의사결정 시점에 사용할 수 있는 정보를 반영한 정도는 다릅니다. 뒤늦게 추가된 정보가 포함됐다면 그 조건을 함께 적어야 독자가 결과를 해석할 수 있습니다.

세 가지 시점을 나누어 적기

먼저 예측 시점, 입력 자료의 마감 시점, 실제 결과의 확정 시점을 따로 적습니다. 예측 시점은 모델이 값을 내는 때이고, 입력 마감은 그때까지 어떤 정보가 준비됐는지 정하는 경계입니다. 결과 확정은 예측과 비교할 실제 값이 정해지는 때입니다. 세 시점이 같은 역할을 하지 않으므로 한 날짜로 묶으면 중요한 차이가 사라집니다.

가령 내일 값을 예측한다는 표현만으로는 입력 조건이 충분히 설명되지 않습니다. 오늘 어느 시점까지 들어온 자료를 사용했는지, 뒤늦게 수정된 값이 평가 자료에 섞여 있지는 않은지 확인해야 합니다. 나중에 정리된 자료로 과거 상황을 재현할 때에도, 당시 알 수 있던 범위가 유지됐는지 살펴볼 필요가 있습니다.

실제 결과가 나중에 수정될 수 있는 대상이라면 비교 기준으로 사용한 결과의 상태도 남겨야 합니다. 잠정값과 확정값을 섞어 계산하면 차이가 모델에서 생겼는지 기준 자료에서 생겼는지 구분하기 어렵습니다. 이러한 시간 정보는 평가를 반복하거나 다른 사람이 검토할 때 필요한 맥락입니다.

평가한 대상과 빠진 대상을 함께 보기

다음으로 전체 대상 중 무엇을 평가했고 무엇을 제외했는지 적습니다. 입력이 충분한 경우만 평가했는지, 일부 기간이나 유형이 빠졌는지에 따라 수치가 설명하는 범위가 달라집니다. 결과가 좋아 보여도 그 숫자로 말할 수 있는 대상은 실제 평가 범위 안에 있습니다.

제외가 있었다는 사실만으로 평가가 잘못됐다고 판단할 필요는 없습니다. 비교할 실제 값이 아직 없거나 필요한 자료가 없는 경우처럼 제외 이유가 있을 수 있습니다. 중요한 것은 그 이유와 범위를 읽을 수 있게 남기는 것입니다. 독자가 실제 사용 환경에도 비슷한 사례가 있는지 판단할 수 있어야 합니다.

특히 어려운 사례가 많이 빠졌다면 그 점을 보이지 않게 요약해서는 안 됩니다. 남은 대상의 성능과 제외된 대상의 존재를 함께 보여줘야 다음에 어디를 검증할지 정할 수 있습니다. 평가할 수 없었던 사례도 앞으로 해결해야 할 데이터나 운영 조건을 알려주는 단서가 됩니다.

목표와 평가와 운영 결과의 이름을 구분하기

달성하려는 목표, 결과를 알고 다시 계산한 평가, 실제 운영에서 확인한 결과는 한 표에 담을 수 있습니다. 다만 같은 단계의 증거처럼 읽히지 않도록 이름을 나누어야 합니다. 목표는 앞으로 도달하려는 기준이고, 평가는 정해진 조건에서 확인한 값이며, 운영 결과는 실제 사용 과정에서 관찰한 범위의 기록입니다.

사후 평가도 유용합니다. 이미 모인 자료로 모델의 차이나 취약한 구간을 살펴볼 수 있습니다. 다만 그 결과가 곧바로 운영에서의 성능을 보장하지는 않습니다. 평가 자료를 만드는 과정과 실제 입력이 들어오는 과정의 조건이 같았는지 추가로 확인해야 합니다.

운영에서 확인했다는 설명에도 범위가 필요합니다. 어느 기간과 대상을 관찰했는지, 실제 입력 조건은 어땠는지 함께 남겨야 합니다. 운영이라는 이름만으로 모든 상황을 검증한 것처럼 읽히지 않도록 하는 것입니다. 증거의 이름을 정확히 붙이면 현재 말할 수 있는 결론과 다음에 확인할 질문을 구분하기가 쉬워집니다.

새 모델을 비교할 때 남길 기준

새 모델과 이전 모델을 비교할 때에는 같은 대상, 같은 시점, 같은 계산 방법을 사용했는지 먼저 확인합니다. 모델이 달라진 것과 평가 조건이 달라진 것이 동시에 일어나면 수치 차이의 이유를 분리하기 어렵습니다. 조건이 다르면 그 차이를 결과 옆에 적고, 해당 비교만으로 개선을 단정하지 않아야 합니다.

전체 평균뿐 아니라 평가 대상의 구성이 같은지도 볼 필요가 있습니다. 가상 예시로 한쪽에는 입력이 충분한 날이 많고 다른 쪽에는 자료가 부족한 날이 많이 포함돼 있다면, 평균 차이에는 대상의 차이가 함께 반영될 수 있습니다. 같은 조건에서 비교할 수 있는 범위를 먼저 찾고 나머지는 따로 해석하는 편이 낫습니다.

발표를 위해 표를 줄일 때도 판단을 바꾸는 조건은 남겨야 합니다. 예측 시점과 입력 마감, 평가 대상과 제외 이유, 증거의 단계, 비교 방식은 숫자를 어디까지 사용할 수 있는지 알려줍니다. 좋은 성능표를 만드는 일은 결과를 보기 좋게 정리하는 데서 이어져, 다른 사람이 같은 질문으로 검토할 수 있게 하는 일입니다. 그 기록이 있어야 다음 검증도 앞선 결과에서 출발할 수 있습니다.