문서

공개 비판과 재현되지 않은 결과

이전 페이지는 캘리브레이션을 어떻게 고치는지를 다뤘습니다. 이 페이지는 왜 고쳐야 하는지를 다룹니다. 공개된 반대 근거를 모읍니다. 그런 것은 프로젝트 홈페이지에 좀처럼 오르지 않기 때문입니다.

이 페이지를 읽는 올바른 방식은 “그럼 모델이 나쁘구나”가 아니라 **“이것들은 알려진 실패 모드이고, 당신의 시스템은 그것을 견뎌야 한다”**입니다.

주사위 실험

가장 직접적인 사례입니다. 모델에게 공정한 주사위를 400번 맞히라고 시킵니다.

항목 결과
고른 면 400번 모두 같은 면
평균 자기보고 확률 82.9%
실제 적중률 19.0%

이 숫자들은 두 가지를 동시에 말합니다. 첫째, 자기보고 확률은 아무런 정보도 담지 않을 수 있습니다. 적중률 19%인 과제에 대해 82.9%는 아무것도 알려주지 못했습니다. 둘째, 모델은 “모르겠다”를 표현하지 못합니다. 공정한 주사위에서 정답은 “각각 약 16.7%“이고, 출력 형태 — 높은 확률이 붙은 하나의 선호 선택지 — 는 그것을 말할 방법이 없습니다.

같은 저자의 또 다른 결과도 기억할 만합니다. 합성 예측 문서에서 30%의 부족 위험이 Choice를 거치면 5.3%로, Noul을 거치면 26.7%로 바뀌었습니다. 같은 입력, 같은 의미, 다른 프리미티브 — 다섯 배 차이입니다. 프리미티브 선택이 답을 바꿉니다. 이에 대한 더 강한 증거는 평가 페이지에 있습니다.

“Jev Can’t Be Calibrated”

널리 퍼진 비판 하나는 통계 수준에서, 가용한 증거로는 캘리브레이션 주장이 성립하지 않는다고 논합니다. 추천을 많이 받은 토론 하나는 같은 요점을 더 신중하게 정리합니다.

타입 안전성 보장은 실재하지만(여러 방향에서 검증됨), 캘리브레이션 주장 뒤에는 공개된 ECE나 신뢰도 곡선이 없습니다.

정확성에 주목하십시오. 캘리브레이션이 거짓이라고 말하지 않고, 그것을 뒷받침하는 공개 증거가 없다고 말합니다. 서로 다른 진술이고, 엔지니어링 결정에서는 같은 곳으로 이어집니다. 공개된 신뢰도 곡선이 없는 것 위에는 프로덕션 임계값을 세울 수 없습니다.

재순위: 완전한 부정 결과

이 부류의 결과가 가장 값집니다. 구체적이고 재현 가능하며, “무엇이든 할 수 있다”는 함의를 정확히 반박하기 때문입니다.

재순위 평가 하나는 33,047개 항목, 실제 쿼리 164개, 판정된 쌍 9,831개를 사용했고, 순수 의사결정 모델 재순위는 벡터 검색에 진다고 결론지었습니다.

규모가 핵심입니다. 3만 개가 넘는 항목과 100개가 넘는 실제 쿼리는 장난감 설정이 아닙니다. 그리고 그것이 반박하는 용도 — 시맨틱 재순위 — 는 분류에서 공짜로 따라온다고 가장 많이 가정되는 바로 그것입니다.

갈리는 판정

어떤 결과는 어느 행을 읽느냐에 따라 달라집니다. 점수 매기기 대 생성 비교 하나입니다.

일본어 NLI에서 로컬로 적합한 가중치를 쓴 다차원 점수 매기기가 직접 묻는 것을 이겼습니다(0.9076 대 0.8373). 그러나 어려운 정상(양성) 행을 공격으로 잘못 표시한 수가 약 25배였습니다(37.2% 대 1.5%).

평균은 개선되었지만 한 클래스의 오탐률은 25배가 되었습니다. 정상 입력을 잘못 표시하는 것이 당신의 시스템에서 비싸다면, 이 개선은 당신에게 부정적입니다 — 긍정적으로 보이더라도.

사전등록된 실험(실행 전에 기준을 고정하고, 결과를 어느 쪽이든 공개)도 하나 있는데, 데이터셋마다 일관되지 않은 판정을 냈습니다 — 하나는 통과, 다른 하나는 실패.

벤더 자신의 문서도 이를 인정한다

공식 “model jaggedness” 페이지는 현재 공개 버전의 알려진 실패 모드를 나열합니다. 그것은 반대 증거가 아니지만, 그 존재 자체가 무언가를 말합니다. “이 모델은 일부 과제에서 나쁘게 작동한다”는 것이 비밀이 아니라 공식 입장의 일부입니다.

이 페이지를 규칙으로 바꾸기

세 가지 엔지니어링 규칙이 나옵니다.

  1. 신뢰도의 절댓값으로 과제를 넘나들며 추론하지 마십시오. “0.9는 90% 맞는다”는 주사위 같은 과제에서는 그냥 거짓입니다.
  2. 프리미티브 선택은 스타일 선택이 아니라 실험 변수입니다. 같은 질문을 Choice로 묻든 Noul로 묻든 다섯 배까지 달라질 수 있습니다. 임의로 하나를 고르지 말고 그 차이를 측정하십시오.
  3. 합계가 아니라 부분류를 보십시오. 25배 오탐 사례는 집계에서는 완전히 보이지 않습니다.

한 문장으로

이 중 어느 것도 이 모델들을 쓰지 말라는 이유가 아닙니다. 기본값을 믿지 말라는 이유입니다. 이 가이드 다른 곳의 모든 패턴(임계값은 코드가 갖는다, 게이팅, 등각 기권)은 이 페이지의 제약 안에서 일하는 방식입니다.