의사결정 모델 실전 가이드
이 페이지들은 세 가지 질문에 답합니다.
- 실제 프로젝트에서 사람들은 이것을 실제로 어떻게 쓰는가?
- 어떤 관행이 반복해서 나타나고, 그중 어느 것이 누군가 크게 데인 뒤에야 생겨난 것인가?
- 문서가 결론을 내리지 못하는 부분 — 무엇보다 그 확률을 믿을 수 있는지 — 에 대해 근거는 무엇을 말하는가?
아래 모든 페이지의 수치는 공개적으로 검증 가능한 1차 기록에서 옵니다. 독립적인 재계산, 사전등록 실험, 또는 프로젝트가 직접 공개한 산출물입니다. 어느 것에 해당하는지는 그 페이지에서 밝힙니다. 이 셋은 무게가 전혀 다르기 때문입니다.
줄기
Jev와 Laya에는 이해하기도 쉽고 과대포장하기도 쉬운 성질이 하나 있습니다.
출력의 형태가 보장된다는 것입니다. Choice를 요청하면 선택지 하나와 확률이
돌아옵니다. Noul을 요청하면 0과 1 사이의 수가 돌아옵니다. 파싱할 텍스트가
없으니 “모델이 횡설수설하다가 프로그램이 죽는” 일도 없습니다.
하지만 그것은 타입 안전성이지 캘리브레이션된 확률이 아닙니다. 후자는 다른 주장이고, 현재 공개적으로 다툼의 대상입니다.
- 독립적인 재계산에서
Score질문에 대해 반환된confidence가 흔히 점수의 소수 부분에 불과하다는 것이 발견되었습니다(그런 출력 121건, 촘촘하게 몰려 있음). 이는 캘리브레이션된 확률이라기보다 전송 형식의 부산물처럼 보입니다. - 공개 실험에서 Jev에게 공정한 주사위를 400번 맞히라고 했더니, 400번 모두 같은 면을 골랐고 평균 자기보고 확률은 82.9%였으며 실제 적중률은 19.0%였습니다.
- 독립적인 분포 외(out-of-distribution) 캘리브레이션 테스트가 오차의 부호를
보고했습니다.
Choice와Score는 체계적으로 과신하고,Boolean은 체계적으로 과소신합니다.
그래서 아래 모든 페이지는 한 문장으로 되돌아옵니다. 신뢰도를 보장이 아니라 캘리브레이션해야 할 사전확률로 다루십시오. 아래 모든 페이지는 그것이 특정 상황에서 무엇을 뜻하는지를 다룹니다.
숫자를 읽는 법
아래 수치는 세 종류의 출처에서 옵니다. 어느 것인지 페이지에서 밝히려고 합니다.
| 출처 | 의미 | 활용법 |
|---|---|---|
| 자기보고 | 저자가 자기 README나 블로그에 낸 결과 | 단서로만, 결론으로는 삼지 않습니다 |
| 독립적 재계산 | 제3자가 다시 실행했거나, 다시 실행할 수 있는 산출물을 공개 | 인용할 수 있지만 표본 크기는 여전히 확인해야 합니다 |
| 사전등록 | 실행 전에 판정 기준을 고정하고, 결과를 어느 쪽이든 공개 | 가장 정보가 많은 종류입니다 |
이 구분은 지나친 따지기가 아닙니다. 같은 모델이 “Jev를 이겼다”는 자기보고 결과에도, 독립적인 부정 결과에도 등장합니다. 둘 다 사실이고, 차이는 누가 측정했는가, 그리고 얼마나 많이 측정했는가입니다.