의사결정 모델을 평가하는 방법
이 페이지는 실용적인 질문 하나를 다룹니다. 두 숫자 묶음이 서로 어긋날 때, 어느 쪽을 믿어야 하는가?
공개 평가의 모습
제3자가 다시 실행할 수 있는 것부터 시작합니다. 그 숫자보다 그 설계가 더 유용합니다.
선택지 섞기, 반복 실행. 정답을 공개하고 재현 실행기를 제공하는 평가 하나는 108개의 4지선다 질문을 사용하며, 문서도 도구도 없이 질문당 3회 실행, 선택지 순서 섞기를 합니다. 무작위 추측은 25%입니다. 현재 공개 모델을 84.6%, 중앙값 199 ms, $0.0088로 보고하고, 가장 강한 비교 대상 모델은 98.0%지만 2.12 s, $1.59입니다.
⚠️ 그 두 수치의 단위는 출처에 명시되지 않았습니다(출처에는 per full run이라고만 적혀 있습니다). 호출당 가격으로 바꾸지 마십시오.
요점은 누가 이기느냐가 아니라 세 축이 모두 테이블 위에 있다는 것입니다. 199 ms의 84.6%와 2.12 s의 98.0%는 서로 다른 두 제품이지, 하나가 다른 하나보다 나쁜 것이 아닙니다.
섞기는 한 가지를 시험하기 위해 존재합니다. 모델이 선택지 순서에 민감하면 프로덕션에서 불안정한 부품입니다. 그 평가는 그 축을 보고합니다.
기저율은 천장입니다. 또 다른 독립 리더보드는 PubMedQA, Banking77, HelpSteer2를 질문당 300개 항목 × 5회 실행으로 돌리고, 모든 판단별 확률을 CC BY 4.0으로 공개합니다. 두 가지 발견이 중요합니다.
- PubMedQA에서 그 모델은 1/28의 비용으로 공동 1위를 합니다.
- HelpSteer2에서는 어떤 모델도 라벨 기저율을 넘지 못합니다.
둘째는 다음을 뜻합니다. 그 데이터셋에서는 “가장 흔한 라벨을 항상 고른다”가 강력한 기준선이고 아무것도 그것을 넘지 못했습니다. 그런 상황에서 1위라는 순위는 아무것도 증명하지 못합니다. 라벨 분포를 재고 있을 뿐 모델을 재는 것이 아닙니다.
형식이 어긋난 출력은 오답으로 셉니다. 어떤 벤치마크는 명시적으로 그렇게 합니다. 지나친 따지기처럼 들리지만, 이것이 서로 다른 모델의 점수를 아예 비교할 수 있는지를 결정한다는 점을 알아채면 그렇지 않습니다. 불법 값을 내도록 허용된 모델의 정확도는 무의미합니다.
통계 비교: 큰 것이 더 좋은 것이 아니다
84.6% 대 85.1%면 하나가 더 낫다는 뜻인가?
꼭 그렇지 않습니다. n=100에서는 잡음 범위 한가운데입니다. 여기서 실제로 쓰인 검정 하나는 McNemar입니다. 두 모델이 같은 항목에서 불일치한 경우를 비교하지, 두 총계를 비교하지 않습니다.
재현 구현 하나가 공개된 정답을 256개 판단에 재생해 231 대 238, McNemar p = 0.21을 얻었습니다 — 원래 모델과 유의미한 차이가 없습니다. “유의미한 차이 없음”은 지극히 존중할 만한 결론이고, 하나가 더 가깝다고 우기는 것보다 훨씬 유용합니다.
더 엄격한 변형은 사전등록입니다. 기준을 먼저 고정하고 나서 실행합니다. 재순위 벤치마크 하나가 정확히 그렇게 해서 “20 Newsgroups에서는 통과, Amazon ESCI에서는 여섯 조건 중 넷 실패”를 보고했습니다. 그런 반반 결과가 전부 통과보다 더 믿을 만합니다. 기준이 실제로 일하고 있음을 보여주기 때문입니다.
자기보고 수치의 네 가지 함정
대부분의 실제 프로젝트는 데이터셋 하나를 돌리고 숫자 하나를 보고합니다. 그 숫자에는 예측 가능한 네 가지 함정이 있습니다.
① 질문의 형태가 답을 바꿉니다.
설문형 실험 하나가 어려운 비교를 만들어냈습니다. 예/아니오 질문을 Noul로 쓰느냐
Choice로 쓰느냐가 Jev와 GPT-4.1 사이의 격차보다 더 중요합니다. 곧, 많은 “A가 B를
이겼다”는 결론에서 실제로 일하고 있는 것은 질문의 표현일 수 있습니다. 프리미티브를
바꾸면 다시 측정해야 합니다. 결과는 전이되지 않습니다.
② 한 번의 실행, 작은 표본, 분산 없음. 자기보고된 “공격 차단율 100%“가 항목 열 개에 기대고 있을 수 있습니다. 같은 생태계의 다른 곳에서 재현 가능한 프로젝트들은 분모와 함께 보고합니다 — “50건 중 적대적 뒤집기 0건”. 분모가 곧 신뢰도입니다.
③ 호출 간 흔들림(jitter). 모델을 계산기처럼 쓰는 프로젝트 하나(문자마다 13개 선택지 중 하나를 고르게 함)는 같은 입력에 대한 두 호출 사이의 흔들림을 드러내는 Rerun 버튼을 일부러 제공합니다. 흔들림 자체가 무서운 것이 아니라, 그것을 모르는 것이 무섭습니다. 측정한 임계값이 다른 시점에는 성립하지 않을 수 있다는 뜻이기 때문입니다.
④ 홈그라운드에서 이기는 전문가는 일반적인 승리가 아닙니다. 706,048개 파라미터(2.8 MB)의 전문가 모델이 자기 양식 채우기 과제에서 99.7%를 내고, 범용 모델은 83.6%를 냅니다. 저자들은 이것이 **“일반적인 승리가 아니라 홈그라운드의 전문가”**라고 분명히 말합니다. 그 문장이 모든 “Jev를 이겼다” 항목의 기본 독법이 되어야 합니다.
한 문장으로
평가의 가치는 헤드라인이 아니라 분모, 분산, 부분류에 있습니다. 표본 크기와 선택지 순서 시험, 부정 결과를 갖춘 60이 그것들 없는 95를 이깁니다.