문서

Kev-0.6B (Qwen3)

이전 세대(Qwen3). Apple Silicon에서 빠른 소형 옵션으로 유지됩니다(질문 다섯 개 요청당 0.12 s, Kev-0.8B는 0.33 s). 정확도를 위해서는 Kev-0.8B를 사용하십시오: 잠긴 테스트에서 동일한 항목에 대해 도메인 외 점수가 0.668로 본 모델의 0.642보다 높습니다. 가중치: jaredpalmer/kev-0.6b.

Kev-0.6B는 의사결정 모델입니다: 하나의 문서(상태)와 타입이 지정된 질문 집합이 들어가면, 한 번의 포워드 패스로 질문마다 하나의 확률 분포가 나옵니다. 텍스트 생성은 없습니다. Qwen/Qwen3-0.6B-Base 위의 LoRA 어댑터(r=16)와 포인터 헤드이며, TypeSafe의 공개 /v1/systemone 계약을 서빙합니다.

Kev 패밀리의 소형 멤버. 동결되고 체크섬이 검증된 평가 프로토콜 아래에서 최고의 0.6B 체크포인트입니다: 4B/8B 레시피의 데이터(decision-v7)를 lr 1e-4로, 세 개 시드(transfer 0.613 / 0.605 / 0.620), 이전 데이터로 8번의 단일 노브 변이와 세 시드를 거쳐도 0.61보다 나은 것을 찾지 못한 뒤였습니다. 도메인 외에서는 0.6B 모델입니다 — 정확도를 위해서는 Kev-4B를 사용하고, 메모리나 지연 때문에 4B가 배제되는 곳에서는 이것을 사용하되 자신의 데이터에서 측정하십시오.

  • Hub: jaredpalmer/kev-0.6b (이 저장소; 시험 v7-06b/02-trial-2, 3개 중 시드 2)
  • 코드, 스위트, 결과, 그리고 전체 연구 로그: github.com/jaredpalmer/kev — PLAN.md(전체 기록은 git tag research-archive-2026-09-24), runs/leaderboard.md, evals/v4/*/manifest.json 참고

Kev-0.5B 이후 바뀐 점

Kev-0.5B Kev-0.6B (본 모델)
백본 Qwen2.5-0.5B Qwen3-0.6B-Base
학습 레코드 9,000 (여섯 소스) 12,576 (공개 소스 열 개 + 896개 정책 최소 쌍 + 60개 무작위 규칙 구조에서 나온 1,680개 레코드)
none-of-the-above 증강 수정만 + 최소 쌍: 동일한 상태를 진짜 옵션이 있는 버전과 제거한 버전으로 렌더링
분포 내 정확도 (decision-v4 dev) 0.712 0.801
도메인 외 정확도 (transfer-v4 dev) 0.561 0.620
none 옵션이 있을 때 정확도 0.25 (transfer-v1) 0.80
숫자 뒤의 시드 수 1 3 (transfer 0.605–0.620)

Jev(typesafe-ai/jev, Vercel AI Gateway 경유)는 동일한 동결 개발 세트에서: 분포 내 0.845, 도메인 외 0.857. 이 체크포인트의 소스별 전이 정확도: QNLI 0.85, SciQ 0.93, TweetEval-offensive 0.69, PAWS 0.59, Emotion 0.49, MMLU 0.50; 홀드아웃 정책 구조는 거의 무작위 수준입니다.

알려진 한계

  • 도메인 외에서는 0.6B 모델입니다. 우리가 시도한 모든 하이퍼파라미터에서 전이 정확도는 약 0.60으로 평평합니다(8번의 단일 노브 변이, 세 시드). 같은 레시피가 4B에서는 0.72–0.75, 8B에서는 0.74–0.77에 도달합니다; 이 크기에서는 데이터가 아니라 용량이 병목입니다.
  • 홀드아웃 정책 추론은 실패합니다: 규칙 구조가 한 번도 학습된 적 없는 프로그램적 정책 쌍에서, 두 형제를 모두 맞히는 비율은 6–11%입니다(Kev-4B 0.73, Jev 0.86).
  • 서수적 헤징: 날짜 산술이 있는 3레벨 Score 질문에서 중간 레벨로 붕괴합니다.
  • 도메인 외 확신 오류율은 11%(신뢰도 ≥0.9이고 오답); 원시 ECE는 분포 내 0.09, 도메인 외 0.15. 확률은 분포 내에서 사용할 수 있으며, 그 외에서는 참고용으로 취급하십시오.
  • 잠긴 테스트, 한 번만 읽음 (runs/locked/kev-06b-v7-ungated/): 분포 내 정확도 0.808(Brier 0.266, ECE 0.089), 도메인 외 0.642(Brier 0.483, ECE 0.128, 확신 오류 7.9%). 이 파티션은 이 체크포인트를 위해 다시 읽지 않습니다.

아키텍처

블록 인과 어텐션 마스크를 사용하는 prefill 전용 인과 LM입니다: 공유 상태 프리픽스, 질문마다 하나의 격리된 브랜치, 그리고 옵션 경계 토큰에 대한 포인터 판독입니다. 하나의 요청으로 패킹된 질문들은 단독으로 얻었을 것과 정확히 같은 확률을 얻습니다(측정된 최대 차이 4e-6). 세부 사항은 저장소 README에 있습니다.

학습

동결된 스위트 evals/v7/decision-v7(manifest가 데이터셋과 베이스 모델 리비전을 고정): 10,000개 공개 레코드(소스당 1,000개), 아홉 개 템플릿 패밀리에 걸친 896개 정책 최소 쌍 레코드, 그리고 60개 무작위 생성 규칙 구조에서 나온 1,680개 레코드, 두 에포크, 어텐션과 MLP 프로젝션에 LoRA r=16, lr 1e-4, 포인터 헤드는 처음부터, 옵션 분포에 대한 교차 엔트로피, H100 한 대에서 bf16 autocast와 fp32 마스터 가중치(약 12분). 증강: 옵션 순열, none-of-the-above 삽입, 디스트랙터, 그리고 Choice 레코드의 25%에 대한 none 최소 쌍. 학습에 Jev 출력은 사용되지 않았습니다.

평가 프로토콜

개발 파티션이 모델을 선택합니다; 잠긴 테스트 파티션이 존재하며 승격된 후보마다 최대 한 번 읽습니다. 위의 모든 수치는 result.json에 스위트 해시, 코드 해시, git commit을 담고 있습니다. 비교에는 레코드로 클러스터링된 짝지은 부트스트랩을 사용합니다. 우리 자신의 이전 주장에 대해 우리가 한 정정은 git tag research-archive-2026-09-24의 PLAN.md(“Evidence and corrections”)를 참고하십시오.

사용

from typesafe import TypeSafeClient   # any TypeSafe-compatible client
client = TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8008", model="kev-latest")

저장소에서 uv run --extra serve python -m kev.serve --run jaredpalmer/kev-0.6b --port 8008로 서빙하십시오.

라이선스

어댑터와 헤드는 Apache-2.0. 베이스 모델은 Apache-2.0(Qwen3). 학습 데이터셋은 각자의 라이선스를 가집니다.