Kev-8B (Qwen3)
이전 세대(Qwen3). 이 체크포인트는 Apple Silicon에서 빠른 옵션으로 유지됩니다(어텐션만 있는 백본이 MPS에서 패킹된 포워드를 전속력으로 실행합니다). 정확도와 캘리브레이션에는 Kev-9B를 사용하십시오: 잠긴 테스트에서 같은 항목에 대해 이 모델이 도메인 외 0.780인 반면 그 모델은 0.837을 기록합니다. 가중치:
jaredpalmer/kev-8b.
Kev-8B는 의사결정 모델입니다: 문서 하나(상태)와 타입이 지정된 질문 묶음이 들어가면, 질문마다 확률 분포 하나가 나오고, 이는 모두 한 번의 포워드 패스에서 이루어집니다. 텍스트 생성은 없습니다. Qwen/Qwen3-8B-Base(revision 49e3418f) 위에 얹은 LoRA 어댑터(r=16)와 포인터 헤드로, TypeSafe의 공개 /v1/systemone 계약을 서빙합니다.
가장 정확한 Kev. 고정되고 체크섬이 검증된 프로토콜 아래에서 모든 크기를 통틀어 최고인 체크포인트입니다: 최고의 분포 내 정확도, 최고의 도메인 외 정확도(transfer-v4 dev에서 0.796, Jev와 여섯 점 차), 8B에서 모든 Kev 중 최고의 홀드아웃 규칙 추론. 같은 레시피를 두 개 시드에서 실행: 0.796 / 0.774; 이 체크포인트는 개발 파티션에서 선택된 시드입니다.
- Hub:
jaredpalmer/kev-8b(이 저장소; 트라이얼v7-final/00-trial-0) - 코드, 스위트, 해시와 짝지은 부트스트랩이 담긴 모든 트라이얼: github.com/jaredpalmer/kev —
PLAN.md(전체 기록은 git tagresearch-archive-2026-09-24),runs/leaderboard.md
결과(모든 행에 동일한 고정 항목)
| Kev-0.5B (프로토타입) | Kev-0.6B | Kev-4B | Kev-8B | Jev | |
|---|---|---|---|---|---|
| 분포 내 정확도(decision-v4 dev, 1,200 q) | 0.712 | 0.801 | 0.854 | 0.863 | 0.845 |
| 도메인 외 정확도(transfer-v4 dev, 560 q) | 0.561 | 0.620 | 0.790 | 0.796 | 0.857 |
| 도메인 외 Brier | 0.50 | 0.536 | 0.328 | 0.337 | 0.211 |
| 도메인 외 확신 오류(p ≥ 0.9이고 오답) | – | 10.8% | 8.2% | 9.9% | 3.7% |
| 홀드아웃 정책 구조, 두 형제 모두 정답 | – | 0.08 | 0.73 | 0.69 | 0.86 |
| 선택지 순서 뒤집힘 비율 | 0.21 | 0.02 | 0.00 | 0.00 | 0.00 |
소스별 도메인 외 정확도(Kev-8B / Jev): QNLI 0.91 / 0.93, SciQ 1.00 / 0.99, TweetEval-offensive 0.79 / 0.81, PAWS 0.78 / 0.79, MMLU 0.70 / 0.90, Emotion 0.56 / 0.59, deadline(3단계 날짜 산술) 0.60 / 0.93, (A and B) or not C 0.91 / 0.97, if A then not B else C 0.59 / 0.78.
시드: decision-v7에서 두 개 시드: transfer 0.796 / 0.774, 홀드아웃 규칙 쌍 0.69 / 0.64(Jev 0.86); 이 체크포인트는 시드 0입니다. decision-v7에서 학습(10k 공개 기록 + 896개 정책 기록, 아홉 개 템플릿 패밀리에 걸쳐 있으며 네 개의 서수 Score 임계값 패밀리 포함 + 1,680개 기록, 부정이 어디에나 올 수 있는 60개 무작위 규칙 구조에서 생성); 개발/테스트 항목은 v4와 바이트 단위로 동일하므로, 여기의 모든 숫자는 이전 체크포인트와 비교 가능합니다.
잠긴 테스트, 한 번만 읽음 (runs/locked/kev-8b-v7-preview-ungated/): 분포 내 0.870(Brier 0.193), 도메인 외 0.780(Brier 0.327, 확신 오류 7.6%, 홀드아웃 쌍 0.62). 이 파티션은 이 체크포인트를 위해 다시 읽지 않습니다.
만들면서 배운 것
- 도메인 외는 용량이 지배합니다. 공개 예시와 합성 예산을 동일하게 유지했을 때, 0.6B → 4B는 +14–19 pp, 4B → 8B는 +1–7 pp입니다.
- 파인튜닝은 베이스 능력을 침식하며, 학습률이 그 정도를 좌우합니다. 4B 베이스는 문자 판독으로 zero-shot을 하면 같은 MMLU 항목에서 0.688, PAWS에서 0.787을 기록합니다; 기본 레시피(lr 2e-4)로 학습하면 0.60–0.66 / 0.56–0.71까지 떨어졌습니다. lr을 5e-5로 낮추면 대부분을 회복하며, 이는 우리가 찾은 최대 단일 레시피 개선입니다; LoRA 대상 모듈을 줄이고 rank를 낮추는 것은 도움이 덜 합니다.
- 공개 학습 데이터가 많아지면 분포 내 정확도는 오르고 transfer는 내려갑니다 (4B에서, 10k 대 3.4k 기록: −3 pp). 지식 MCQ 소스(ARC, OpenBookQA, CommonsenseQA)는 transfer를 움직이지 않으면서 분포 내 정확도를 0.86까지 올립니다.
- 프로그램 방식의 대조 정책 쌍은 학습된 규칙 구조를 가르치지만(둘 다 정답 0.85–1.0), 보지 못한 구조로의 transfer는 부분적으로만 됩니다(4B에서 0.5–0.6, 0.6B에서 0.03–0.11).
알려진 한계
- 홀드아웃 정책 추론(보지 못한 규칙 조합, 유예 기간이 있는 날짜 산술)은 Jev와 거리가 멉니다.
- 학습에 유사 사례가 없는 제품 형태의 질문은 보장되지 않습니다; 자신의 입력에서 측정하십시오.
- 도메인 외 확률은 사용 가능하지만 캘리브레이션되어 있지 않습니다(원시 ECE 0.128); 분포 내에서 적합한 온도(temperature)는 transfer되지 않습니다.
- 8B fp32는 약 33 GB가 필요하며 32 GB Mac에는 들어가지 않습니다;
KEV_DTYPE=bf16(약 17 GB)은 들어갑니다. 학습은 H100 한 대에서 약 70분 걸렸습니다.
학습
고정된 스위트 evals/v6/decision-v6(개발/테스트 바이트는 v4와 동일): 13,000개 공개 기록(소스당 1,000개: v4 소스 열 개 더하기 ARC-Challenge, OpenBookQA, CommonsenseQA) 더하기 448개 기록으로 된 두 개의 프로그램 방식 정책 암, 두 에포크, 어텐션과 MLP 프로젝션에 대한 LoRA r=16, 처음부터 학습하는 포인터 헤드, 선택지 분포에 대한 교차 엔트로피, lr 5e-5(OneCycle), 유효 배치 8, fp32 마스터 가중치를 쓰는 bf16 autocast, 그래디언트 체크포인팅, H100 한 대(약 70분). 증강: 선택지 순열, none-of-the-above 삽입, 방해 선택지(distractor), Choice 기록의 25%에 대한 none 최소 대조 쌍(minimal pair). 학습에는 어떤 Jev 출력도 사용되지 않았습니다.
평가 프로토콜
개발 파티션이 모델을 선택합니다; 잠긴 테스트 파티션은 후보당 최대 한 번 읽습니다. 모든 숫자는 result.json에 스위트 해시, 코드 해시, git commit을 함께 지닙니다. 우리 자신의 이전 주장에 가한 정정은 git tag research-archive-2026-09-24의 PLAN.md(“Evidence and corrections”)를 참고하십시오.
사용
uv run --extra serve python -m kev.serve --run jaredpalmer/kev-8b --port 8008 # KEV_DTYPE=bf16 on a 32 GB Mac
TypeSafe 호환 클라이언트라면 무엇이든 동작합니다: TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8008", model="kev-latest").
라이선스
어댑터와 헤드는 Apache-2.0; Qwen3 베이스는 Apache-2.0; 데이터셋은 각자의 라이선스를 따릅니다.