Kev-4B (Qwen3)
이전 세대(Qwen3). 이 체크포인트는 Apple Silicon에서 빠른 옵션으로 유지됩니다(어텐션만 있는 백본이 MPS에서 패킹된 포워드를 전속력으로 실행합니다). 정확도와 캘리브레이션에는 Kev-4B (Qwen3.5)를 사용하십시오: 잠긴 테스트에서 같은 항목에 대해 이 모델이 도메인 외 0.806인 반면 그 모델은 0.832를 기록합니다. 가중치:
jaredpalmer/kev-4b@qwen3.
Kev-4B는 의사결정 모델입니다: 문서 하나(상태)와 타입이 지정된 질문 묶음이 들어가면, 질문마다 확률 분포 하나가 나오고, 이는 모두 한 번의 포워드 패스에서 이루어집니다. 텍스트 생성은 없습니다. Qwen/Qwen3-4B-Base 위에 얹은 LoRA 어댑터(r=16)와 포인터 헤드로, TypeSafe의 공개 /v1/systemone 계약을 서빙합니다.
추천하는 Kev. 약 40회의 통제된 4B 트라이얼 끝에 고정되고 체크섬이 검증된 프로토콜 아래에서 최고인 4B 체크포인트이며, 같은 항목에서 도메인 외 기준 Jev와 일곱 점 이내에 든 첫 Kev입니다. 같은 레시피를 세 개 시드에서 실행: transfer 0.773 / 0.790 / 0.770; 이 체크포인트는 개발 파티션에서 선택된 시드입니다(잠긴 테스트에서는 절대 선택하지 않음).
- Hub:
jaredpalmer/kev-4b, revision tagqwen3(트라이얼v7-rc3/01-trial-1); 이 저장소의 main revision은 이제 Qwen3.5 체크포인트를 담고 있습니다 - 코드, 스위트, 해시와 짝지은 부트스트랩이 담긴 모든 트라이얼: github.com/jaredpalmer/kev —
PLAN.md(전체 기록은 git tagresearch-archive-2026-09-24),runs/leaderboard.md
결과(모든 행에 동일한 고정 항목)
| Kev-0.5B (프로토타입) | Kev-0.6B | Kev-4B | Jev | |
|---|---|---|---|---|
| 분포 내 정확도(decision-v4 dev, 1,200 q) | 0.712 | 0.801 | 0.854 | 0.845 |
| 도메인 외 정확도(transfer-v4 dev, 560 q) | 0.561 | 0.620 | 0.790 | 0.857 |
| 도메인 외 Brier | 0.50 | 0.536 | 0.328 | 0.211 |
| 도메인 외 확신 오류(p ≥ 0.9이고 오답) | – | 10.8% | 8.2% | 3.7% |
| 홀드아웃 정책 구조, 두 형제 모두 정답 | – | 0.08 | 0.73 | 0.86 |
| 선택지 순서 뒤집힘 비율 | 0.21 | 0.07 | 0.06 | 0.00 |
소스별 도메인 외 정확도(Kev-4B / Jev): QNLI 0.89 / 0.93, SciQ 0.99 / 0.99, TweetEval-offensive 0.75 / 0.81, PAWS 0.72 / 0.79, MMLU 0.65 / 0.90, Emotion 0.66 / 0.59, deadline(3단계 날짜 산술) 0.53 / 0.93, (A and B) or not C 0.97 / 0.97, if A then not B else C 0.88 / 0.78.
시드: decision-v7에서 세 개 시드: transfer 0.773 / 0.790 / 0.770, 홀드아웃 규칙 쌍 0.62 / 0.73 / 0.67(Jev 0.86); 이 체크포인트는 시드 1이며, 개발 transfer 정확도로 선택되었습니다. decision-v7에서 학습(10k 공개 기록 + 896개 정책 기록, 아홉 개 템플릿 패밀리에 걸쳐 있으며 네 개의 서수 Score 임계값 패밀리 포함 + 1,680개 기록, 부정이 어디에나 올 수 있는 60개 무작위 규칙 구조에서 생성); 개발/테스트 항목은 v4와 바이트 단위로 동일하므로, 여기의 모든 숫자는 이전 체크포인트와 비교 가능합니다.
잠긴 테스트, 한 번만 읽음 (runs/locked/kev-4b-v7-preview-ungated/): 분포 내 0.856(Brier 0.211), 도메인 외 0.806(Brier 0.294, 확신 오류 6.6%, 홀드아웃 쌍 0.66). 이 파티션은 이 체크포인트를 위해 다시 읽지 않습니다.
만들면서 배운 것
- 도메인 외는 용량이 지배합니다. 공개 예시와 합성 예산을 동일하게 유지했을 때, 0.6B → 4B는 +14–19 pp, 4B → 8B는 +1–7 pp입니다.
- 파인튜닝은 베이스 능력을 침식하며, 학습률이 그 정도를 좌우합니다. 4B 베이스는 문자 판독으로 zero-shot을 하면 같은 MMLU 항목에서 0.688, PAWS에서 0.787을 기록합니다; 기본 레시피(lr 2e-4)로 학습하면 0.60–0.66 / 0.56–0.71까지 떨어졌습니다. lr을 5e-5로 낮추면 대부분을 회복하며, 이는 우리가 찾은 최대 단일 레시피 개선입니다; LoRA 대상 모듈을 줄이고 rank를 낮추는 것은 도움이 덜 합니다.
- 공개 학습 데이터가 많아지면 분포 내 정확도는 오르고 transfer는 내려갑니다 (4B에서, 10k 대 3.4k 기록: −3 pp). 지식 MCQ 소스(ARC, OpenBookQA, CommonsenseQA)는 transfer를 움직이지 않으면서 분포 내 정확도를 0.86까지 올립니다.
- 프로그램 방식의 대조 정책 쌍은 학습된 규칙 구조를 가르치지만(둘 다 정답 0.85–1.0), 보지 못한 구조로의 transfer는 부분적으로만 됩니다(4B에서 0.5–0.6, 0.6B에서 0.03–0.11).
알려진 한계
- 홀드아웃 정책 추론(보지 못한 규칙 조합, 유예 기간이 있는 날짜 산술)은 Jev와 거리가 멉니다.
- 학습에 유사 사례가 없는 제품 형태의 질문은 보장되지 않습니다: TypeSafe 문서 예시(“내 카드에 두 건의 청구” → 청구 문제가 있습니까?)에서 이 체크포인트는 0.48로 답하는 한편(Kev-8B 0.95, Kev-0.6B 0.97), 반품 사유는 올바르게 고릅니다(사이즈 오류 0.53; Kev-8B 0.84; Kev-0.6B는 “해당 없음”(none of the above) 0.58을 선호). 자신의 입력에서 측정하십시오.
- 도메인 외 확률은 사용 가능하지만 캘리브레이션되어 있지 않습니다(원시 ECE 0.096); 분포 내에서 적합한 온도(temperature)는 transfer되지 않습니다.
- 4B fp32는 약 16 GB가 필요합니다; 32 GB Mac에서는
KEV_DTYPE=bf16을 사용하십시오. H100에서 지연 시간은 패킹된 요청당 약 45 ms입니다; M5에서는 수백 ms입니다.
학습
고정된 스위트 evals/v4/decision-v4: 10,000개 공개 기록(소스당 1,000개, 소스 열 개) 더하기 448개 기록으로 된 두 개의 프로그램 방식 정책 암, 두 에포크, 어텐션과 MLP 프로젝션에 대한 LoRA r=16, 처음부터 학습하는 포인터 헤드, 선택지 분포에 대한 교차 엔트로피, lr 5e-5(OneCycle), 유효 배치 8, fp32 마스터 가중치를 쓰는 bf16 autocast, 그래디언트 체크포인팅, H100 한 대(약 40분). 증강: 선택지 순열, none-of-the-above 삽입, 방해 선택지(distractor), Choice 기록의 25%에 대한 none 최소 대조 쌍(minimal pair). 학습에는 어떤 Jev 출력도 사용되지 않았습니다.
평가 프로토콜
개발 파티션이 모델을 선택합니다; 잠긴 테스트 파티션은 후보당 최대 한 번 읽습니다. 모든 숫자는 result.json에 스위트 해시, 코드 해시, git commit을 함께 지닙니다. 우리 자신의 이전 주장에 가한 정정은 git tag research-archive-2026-09-24의 PLAN.md(“Evidence and corrections”)를 참고하십시오.
사용
uv run --extra serve python -m kev.serve --run jaredpalmer/kev-4b --port 8008 # KEV_DTYPE=bf16 on a 32 GB Mac
TypeSafe 호환 클라이언트라면 무엇이든 동작합니다: TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8008", model="kev-latest").
라이선스
어댑터와 헤드는 Apache-2.0; Qwen3 베이스는 Apache-2.0; 데이터셋은 각자의 라이선스를 따릅니다.