Kev-0.6B (Qwen3)
이전 세대(Qwen3). Apple Silicon에서 빠른 소형 옵션으로 유지됩니다(질문 다섯 개 요청당 0.12 s, Kev-0.8B는 0.33 s). 정확도를 위해서는 Kev-0.8B를 사용하십시오: 잠긴 테스트에서 동일한 항목에 대해 도메인 외 점수가 0.668로 본 모델의 0.642보다 높습니다. 가중치:
jaredpalmer/kev-0.6b.
Kev-0.6B는 의사결정 모델입니다: 하나의 문서(상태)와 타입이 지정된 질문 집합이 들어가면, 한 번의 포워드 패스로 질문마다 하나의 확률 분포가 나옵니다. 텍스트 생성은 없습니다. Qwen/Qwen3-0.6B-Base 위의 LoRA 어댑터(r=16)와 포인터 헤드이며, TypeSafe의 공개 /v1/systemone 계약을 서빙합니다.
Kev 패밀리의 소형 멤버. 동결되고 체크섬이 검증된 평가 프로토콜 아래에서 최고의 0.6B 체크포인트입니다: 4B/8B 레시피의 데이터(decision-v7)를 lr 1e-4로, 세 개 시드(transfer 0.613 / 0.605 / 0.620), 이전 데이터로 8번의 단일 노브 변이와 세 시드를 거쳐도 0.61보다 나은 것을 찾지 못한 뒤였습니다. 도메인 외에서는 0.6B 모델입니다 — 정확도를 위해서는 Kev-4B를 사용하고, 메모리나 지연 때문에 4B가 배제되는 곳에서는 이것을 사용하되 자신의 데이터에서 측정하십시오.
- Hub:
jaredpalmer/kev-0.6b(이 저장소; 시험v7-06b/02-trial-2, 3개 중 시드 2) - 코드, 스위트, 결과, 그리고 전체 연구 로그: github.com/jaredpalmer/kev —
PLAN.md(전체 기록은 git tagresearch-archive-2026-09-24),runs/leaderboard.md,evals/v4/*/manifest.json참고
Kev-0.5B 이후 바뀐 점
| Kev-0.5B | Kev-0.6B (본 모델) | |
|---|---|---|
| 백본 | Qwen2.5-0.5B | Qwen3-0.6B-Base |
| 학습 레코드 | 9,000 (여섯 소스) | 12,576 (공개 소스 열 개 + 896개 정책 최소 쌍 + 60개 무작위 규칙 구조에서 나온 1,680개 레코드) |
| none-of-the-above | 증강 수정만 | + 최소 쌍: 동일한 상태를 진짜 옵션이 있는 버전과 제거한 버전으로 렌더링 |
| 분포 내 정확도 (decision-v4 dev) | 0.712 | 0.801 |
| 도메인 외 정확도 (transfer-v4 dev) | 0.561 | 0.620 |
| none 옵션이 있을 때 정확도 | 0.25 (transfer-v1) | 0.80 |
| 숫자 뒤의 시드 수 | 1 | 3 (transfer 0.605–0.620) |
Jev(typesafe-ai/jev, Vercel AI Gateway 경유)는 동일한 동결 개발 세트에서: 분포 내 0.845, 도메인 외 0.857. 이 체크포인트의 소스별 전이 정확도: QNLI 0.85, SciQ 0.93, TweetEval-offensive 0.69, PAWS 0.59, Emotion 0.49, MMLU 0.50; 홀드아웃 정책 구조는 거의 무작위 수준입니다.
알려진 한계
- 도메인 외에서는 0.6B 모델입니다. 우리가 시도한 모든 하이퍼파라미터에서 전이 정확도는 약 0.60으로 평평합니다(8번의 단일 노브 변이, 세 시드). 같은 레시피가 4B에서는 0.72–0.75, 8B에서는 0.74–0.77에 도달합니다; 이 크기에서는 데이터가 아니라 용량이 병목입니다.
- 홀드아웃 정책 추론은 실패합니다: 규칙 구조가 한 번도 학습된 적 없는 프로그램적 정책 쌍에서, 두 형제를 모두 맞히는 비율은 6–11%입니다(Kev-4B 0.73, Jev 0.86).
- 서수적 헤징: 날짜 산술이 있는 3레벨 Score 질문에서 중간 레벨로 붕괴합니다.
- 도메인 외 확신 오류율은 11%(신뢰도 ≥0.9이고 오답); 원시 ECE는 분포 내 0.09, 도메인 외 0.15. 확률은 분포 내에서 사용할 수 있으며, 그 외에서는 참고용으로 취급하십시오.
- 잠긴 테스트, 한 번만 읽음 (
runs/locked/kev-06b-v7-ungated/): 분포 내 정확도 0.808(Brier 0.266, ECE 0.089), 도메인 외 0.642(Brier 0.483, ECE 0.128, 확신 오류 7.9%). 이 파티션은 이 체크포인트를 위해 다시 읽지 않습니다.
아키텍처
블록 인과 어텐션 마스크를 사용하는 prefill 전용 인과 LM입니다: 공유 상태 프리픽스, 질문마다 하나의 격리된 브랜치, 그리고 옵션 경계 토큰에 대한 포인터 판독입니다. 하나의 요청으로 패킹된 질문들은 단독으로 얻었을 것과 정확히 같은 확률을 얻습니다(측정된 최대 차이 4e-6). 세부 사항은 저장소 README에 있습니다.
학습
동결된 스위트 evals/v7/decision-v7(manifest가 데이터셋과 베이스 모델 리비전을 고정): 10,000개 공개 레코드(소스당 1,000개), 아홉 개 템플릿 패밀리에 걸친 896개 정책 최소 쌍 레코드, 그리고 60개 무작위 생성 규칙 구조에서 나온 1,680개 레코드, 두 에포크, 어텐션과 MLP 프로젝션에 LoRA r=16, lr 1e-4, 포인터 헤드는 처음부터, 옵션 분포에 대한 교차 엔트로피, H100 한 대에서 bf16 autocast와 fp32 마스터 가중치(약 12분). 증강: 옵션 순열, none-of-the-above 삽입, 디스트랙터, 그리고 Choice 레코드의 25%에 대한 none 최소 쌍. 학습에 Jev 출력은 사용되지 않았습니다.
평가 프로토콜
개발 파티션이 모델을 선택합니다; 잠긴 테스트 파티션이 존재하며 승격된 후보마다 최대 한 번 읽습니다. 위의 모든 수치는 result.json에 스위트 해시, 코드 해시, git commit을 담고 있습니다. 비교에는 레코드로 클러스터링된 짝지은 부트스트랩을 사용합니다. 우리 자신의 이전 주장에 대해 우리가 한 정정은 git tag research-archive-2026-09-24의 PLAN.md(“Evidence and corrections”)를 참고하십시오.
사용
from typesafe import TypeSafeClient # any TypeSafe-compatible client
client = TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8008", model="kev-latest")
저장소에서 uv run --extra serve python -m kev.serve --run jaredpalmer/kev-0.6b --port 8008로 서빙하십시오.
라이선스
어댑터와 헤드는 Apache-2.0. 베이스 모델은 Apache-2.0(Qwen3). 학습 데이터셋은 각자의 라이선스를 가집니다.