문서

Kev-0.8B

모델 요약

Kev-0.8B는 의사결정 모델입니다. 하나의 문서(상태)와 그에 관한 일련의 타입 지정된 질문을 읽고, 각 질문에 함께 주어진 선택지들 위의 캘리브레이션된 확률 분포를 한 번의 포워드 패스로, 텍스트를 생성하지 않고 반환합니다. TypeSafe의 공개 System One API(POST /v1/systemone)를 구현하므로, TypeSafe SDK가 변경 없이 이를 대상으로 동작합니다. 가장 작은 Kev입니다: Qwen3.5-0.8B-Base 위의 LoRA 어댑터와 포인터 헤드로, 노트북이나 4 GB GPU에서 실행됩니다. 메모리나 비용 때문에 더 큰 크기가 배제되고 작업이 학습한 것과 유사한 곳을 위한 것입니다. 도메인 외에서는 Kev-4B보다 현저히 덜 정확합니다. 이 카드는 Kev 1.0의 체크포인트를 설명하며, 2026-09-24에 처음 공개되었습니다.

모델 세부 사항

개발자 Jared Palmer (github.com/jaredpalmer/kev)
모델 유형 의사결정 모델: 인과 언어 모델 백본을 prefill만으로 실행하고, 선택지 위에 포인터 헤드를 얹은 것
백본 Qwen/Qwen3.5-0.8B-Base(revision dc7cdfe2): 24개 레이어, Gated DeltaNet(선형 어텐션) 18개와 완전 어텐션 6개; 동결
어댑터 LoRA, rank 16, α 32, 어텐션, MLP 및 DeltaNet 프로젝션에 적용(11.3M 파라미터)
헤드 포인터 헤드: 두 개의 프로젝션이 각 선택지의 종료 토큰을 질문의 마지막 토큰과 비교해 점수를 매기고, softmax가 확률을 산출
정밀도 fp32 가중치 위에서 bf16 autocast로 학습; bf16으로 서빙(로드 시 어댑터를 베이스에 병합); fp32로 평가
컨텍스트 최대 65,536 토큰의 상태를 서빙하며, 질문마다 최소 8,192 토큰이 추가됩니다. 학습 상태는 최대 7,552 토큰이었습니다.
검증된 컨텍스트 길이 8,192 토큰(긴 문서 참고)
캘리브레이션 단일 온도(temperature), T = 2.35, head.pt에 저장되며 로드 시 적용
언어 영어
라이선스 Apache-2.0(어댑터와 헤드); 베이스 모델은 Apache-2.0
버전 Kev 1.0: jaredpalmer/kev-0.8b의 main, revision 9a45d25e(2026-09-24 공개)
이전 버전 Hub tag night2-du-release와 v7-base

입력. 하나의 상태(텍스트, 또는 레이블이 붙은 텍스트로 렌더링된 JSON 객체나 배열)와 임의 개수의 이름 붙은 질문, 각 질문은 세 가지 유형 중 하나입니다:

유형 선택지 출력
choice 이름 붙은 선택지 1–255개, 각각 선택적 설명 포함 선택지별 확률, 가장 가능성이 높은 선택지, 그리고 신뢰도
score 순서가 있는 레벨 1–255개 레벨별 확률과 기대 레벨 인덱스
noul 예 / 아니오, 선택적 설명 포함 예일 확률

각 질문은 공유 상태에서 이어지는 자기 자신의 행으로 답변되므로, 질문들이 서로 영향을 줄 수 없습니다. 상태는 한 번만 계산되어 캐시됩니다.

의도된 용도

  • Kev-4B를 돌리기엔 너무 작은 하드웨어(노트북, L4 또는 4 GB GPU)에서, 자신의 학습 패밀리에 가까운 타입 지정 결정(문서 분류, 라우팅, 명시된 규칙에 대한 정책 검사).
  • 학습 비용이 중요한 상황에서 사용자 자신의 레이블로 파인튜닝하기 위한 출발점(kev.train --init_from jaredpalmer/kev-0.8b).
  • 더 큰 Kev로 옮기기 전에 System One API를 대상으로 프로토타이핑.

범위 밖 용도

  • 텍스트 생성, 대화, 요약, 또는 개방형 질의응답. 모델은 주어진 선택지에만 점수를 매깁니다.
  • 도구 호출 라우팅(도구를 호출할지, 빠진 파라미터를 요청할지, 아니면 거절할지): 이 모델의 When2Call 정확도는 우연보다 낮습니다(한계와 트레이드오프 참고).
  • 사람에게 법적, 의료적, 금융적, 고용상 또는 이와 유사한 결과를 초래하는 완전 자동화된 결정을, 사람의 검토 없이 내리는 것.
  • 지식 집약적인 질문, 날짜 산술, 65,536 토큰보다 긴 상태, 그리고 영어 이외의 언어.

사용 방법

Kev 저장소로 서빙합니다. CUDA에서는 융합된 DeltaNet 커널과 CUDA graphs와 함께 bf16으로 실행됩니다(L4 한 장이면 충분). Apple Silicon에서는 같은 명령이 MLX를 통해 서빙하며, 자동으로 선택됩니다.

git clone https://github.com/jaredpalmer/kev.git && cd kev && uv sync --extra serve
uv run --extra serve python -m kev.serve --run jaredpalmer/kev-0.8b --port 8008        # Kev 1.0 (this card)
uv run --extra serve python -m kev.serve --run jaredpalmer/kev-0.8b@v1.0 --port 8008   # the same weights, pinned
from typesafe_sdk import Choice, Noul, TypeSafeClient

client = TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8008", model="kev-latest")
response = client.system_one(
    state="I was charged twice for order 1182. Please refund one of the charges.",
    questions={
        "team": Choice(instructions="Which team should handle this?",
                       criteria={"billing": "Charges and refunds", "shipping": "Deliveries", "returns": "Exchanges"}),
        "urgent": Noul(instructions="Does this need a reply today?"),
    },
)
print(response.choices["team"].choice, response.nouls["urgent"].noul)

캘리브레이션된 온도는 기본적으로 적용됩니다. KEV_TEMPERATURE=1.0은 원시 확률을 반환합니다. KEV_DTYPE=fp32는 평가에 사용된 정확한 경로를 선택합니다. 65,536 토큰을 넘는 상태는 거부되며, 토큰 수를 알려주는 422가 반환됩니다.

학습 데이터

단계 레코드 수 내용과 레이블
베이스 레시피(decision-v7) 12,576 열 개의 공개 분류 데이터셋에서 온 10,000개 레코드(각 1,000개, 이 카드의 메타데이터에 나열됨)와 그 원래 레이블; 아홉 개 템플릿 패밀리에 걸친 896개의 생성된 정책 최소 대조 쌍(minimal pair); 60개의 무작위 생성 규칙 구조를 네 가지 렌더링으로 만든 1,680개 레코드; 레이블은 코드로 계산
날짜와 결측 증거 1,425 생성: 날짜가 있는 정책 사례 900개(일반, 일수 계산 문장 포함, 또는 date_facts 필드 포함); 결정 문장을 제거하고 균일 타깃을 준 사례 255개, 그리고 손대지 않은 대조 270개
문서와 기술, 한 단계 16,539 documents-v1 train: 미국 소비자 금융 민원 서술 5,219건(CFPB, 최대 약 7k 토큰)과 7,488개 질문, 두 오픈 웨이트 교사가 소비자 자신의 신고와 일치한 곳에서 레이블 유지. hard-v1 train: 일곱 개 기술 패밀리(긴 정책, 트레이드오프, 확률, 멀티홉, 날짜와 산술, 제안된 답 판정, 결측 사실 보류)에 걸친 프로그램으로 레이블된 6,000개 레코드, 템플릿 0–3. devtools-v1 train: CodeReviewer, CommitPackFT, FlakeFlagger, Aegis에서 온 5,320개 레코드, 각 데이터셋 자체 레이블 사용

두 파인튜닝 단계는 decision-v7에서 2,000개와 6,000개 레코드를 재생(replay)합니다. Jev(TypeSafe의 호스팅 의사결정 모델)의 출력은 전혀 사용되지 않았습니다. CodeReviewer와 FlakeFlagger는 Zenodo에서 왔고, CFPB 서술은 미국 정부 저작물입니다. 소스별 라이선스와 revision은 스위트 manifest에 기록되어 있습니다. 아래의 평가 전용 스위트(breadth-v1, tasksource-heldout-v1, transfer-v4, longdoc-v1, 그리고 devtools-v1의 When2Call 및 프롬프트 인젝션 소스)는 학습에 전혀 들어가지 않습니다.

학습 절차

  1. 베이스 레시피. 베이스에서 decision-v7에 대해 두 epoch: LoRA rank 16, α 32; 학습률 1e-4, one-cycle 스케줄; batch 8; bf16 autocast; seed 2. 손실은 각 질문의 선택지에 대한 교차 엔트로피입니다. 선택지 순서를 섞고, “해당 없음”(none of the above) 선택지와 방해 선택지(distractor)를 무작위로 삽입하며, choice 레코드의 4분의 1은 최소 대조 쌍(minimal pair)도 생성합니다(“해당 없음” 선택지가 있는 그 질문을, 정답 선택지가 있을 때와 제거했을 때 한 번씩).
  2. 날짜와 결측 증거. 단계 1에서 학습률 4e-5로 한 epoch, 2,000개 레코드 재생.
  3. 문서와 기술. 단계 2에서 세 학습 세트를 모두 함께, 학습률 2e-5로 한 epoch, 6,000개 레코드 재생; batch 4 × 2 누적; 상태 최대 7,552 토큰; 그래디언트 체크포인팅; seed 1; 옵티마이저 스텝 2,818회.
  4. 캘리브레이션. 단일 온도(temperature) T = 2.35, 단계 3 트라이얼의 decision-v7 개발 행(질문 1,264개)에서 음의 로그 우도를 최소화. 이들은 학습 코퍼스의 홀드아웃 항목입니다. 홀드아웃 데이터셋에서의 재적합(refit)을 평가했으나 채택하지 않았습니다(캘리브레이션 참고).

평가

방법론. 별도 언급이 없으면 모든 숫자는 배포된 온도에서의 fp32 평가 경로입니다. 개발 파티션은 선택에 사용되었고, 테스트 파티션은 이 체크포인트를 위해 한 번 읽었습니다. transfer-v4 테스트는 잠겨 있으며(후보마다 한 번 읽음) 사전에 고정된 기준선에 비추어 판정되었습니다. 짝지은 구간은 전체 레코드를 재표본추출하는 95 % bootstrap(2,000회 재표본)이므로, 같은 상태를 공유하는 질문들은 함께 움직입니다. 차이는 퍼센트 포인트(pp)로 표시합니다. Jev(TypeSafe의 호스팅 모델, Vercel AI Gateway를 통해 쿼리)는 같은 항목에서 읽은 곳에 표시합니다. 스위트는 다음과 같습니다:

  • breadth-v1: 다섯 영역(지식, 언어, 검색, 도구, 예술)의 홀드아웃 공개 데이터셋 14개, 학습한 적 없음.
  • tasksource-heldout-v1: 공개 멀티태스크 컬렉션의 24개 전체 태스크 패밀리, 학습한 적 없음(패밀리 이름 비공개).
  • transfer-v4: 학습한 적 없는 여섯 공개 소스(QNLI, SciQ, TweetEval-offensive, PAWS, MMLU, Emotion)의 도메인 외 결정, 그리고 홀드아웃 정책 및 규칙 구조.
  • hard-v1: 위의 기술 패밀리; 테스트 분할은 학습된 생성기의 템플릿을 홀드아웃합니다.
  • devtools-v1: 라이선스 검증을 거친 여섯 소스(네 개 학습, 두 개 평가 전용)의 개발자 도구 결정.
  • documents-v1 / documents-v2: CFPB 민원 서술; v2는 비공개 홀드아웃 테스트 세트.
  • longdoc-v1: CUAD 상업 계약과 생성된 계약 번들, 상태 4k~64k 토큰.

“감사됨(audited)”으로 표시된 헤드라인 패널은 레이블 감사에서 부적절하다고 판명된 항목을 제외합니다¹. 제외할 때마다 비교의 양쪽에서 같은 행을 제거합니다.

홀드아웃 데이터(학습한 적 없음).

패널 (질문 수) Kev-0.8B Jev
홀드아웃 공개 데이터셋, breadth-v1 개발, 감사됨, 10개 데이터셋 (2,475) 0.653 –
breadth-v1 개발, 14개 데이터셋 전체 (3,075) 0.597 0.757
breadth-v1 테스트, 14개 데이터셋 전체 (3,089) 0.586 0.757
breadth-v1 테스트, 우연 보정 지수² [95 % CI] 23.3 [21.2, 25.9] 54.0 [51.2, 57.0]
홀드아웃 태스크 패밀리, tasksource-heldout-v1 개발, 감사됨, 17개 패밀리 (1,993) 0.515 –
tasksource-heldout-v1 개발, 24개 패밀리 전체 (2,788) 0.513 –
도메인 외, transfer-v4 개발 (656): 정확도 / Brier 0.648 / 0.430 0.857 / 0.211
도메인 외, transfer-v4 잠긴 테스트 (656): 정확도 / Brier 0.697 / 0.397 –
transfer-v4 잠긴 테스트: ECE / ≤ 5 % 오류에서의 커버리지 0.045 / 0.274 –
MMLU-Pro, 10개 선택지 (transfer-v9 개발) 0.230 0.840
p ≥ 0.9로 답한 답변 불가 항목 (낮을수록 좋음) 0.00 0.09

학습된 패밀리(홀드아웃 항목과 템플릿).

패널 (질문 수) Kev-0.8B Jev
documents-v1 개발 (920) / 테스트 (936) 0.842 / 0.851 0.868 / –
documents-v2, 비공개 홀드아웃 테스트 (953) 0.848 –
hard-v1 개발 (1,083) / 테스트 (1,088) 0.594 / 0.665 0.777 / –
devtools-v1 개발, 감사된 소스 (772) 0.633 –
devtools-v1 개발 (1,072) / 테스트 (1,071), 모든 소스 0.602 / 0.637 0.713 / –
decision-v7 개발 (1,264) / 잠긴 테스트 (1,200) 0.827 / 0.838 0.845 / –
생성된 결정의 홀드아웃 도메인, ood-v2 (4,988) 0.661 –

Jev의 devtools-v1 수치는 개발 질문 1,074개 전체에 대한 것입니다. Kev의 행은 스위트 빌더가 두 레코드에 재사용한 CodeReviewer id(질문 2개)를 제외합니다.

이전 버전과 비교(tag night2-du-release, 자체 온도 2.41에서; 등록된 기준, 각 테스트를 한 번씩 읽음):

패널 Δ [95 % CI]
documents-v1 테스트 +24.4 [+21.3, +27.6]
documents-v2 +23.2 [+19.9, +26.4]
hard-v1 테스트 +26.9 [+23.4, +30.4]
devtools-v1 테스트 +16.4 [+13.1, +19.4]
hard-v1 + devtools-v1 테스트, 합산 +21.7 [+19.5, +24.0]
transfer-v4 잠긴 테스트 +1.2 [−1.1, +3.7]

긴 문서.

  • 검증된 컨텍스트 길이: 8,192 토큰, 즉 학습 길이. 16k 버킷은 허용 범위를 벗어납니다. 하한이 −8.5 pp로 −3 pp 아래이므로, 더 긴 길이는 검증되지 않았습니다.
  • 규칙, 읽기 전에 고정: 검증된 길이는 16,384 토큰부터 위로, 그 버킷과 그것과 8,192 사이의 모든 버킷이 허용 범위 안에 드는 가장 큰 버킷의 명목 크기입니다. 허용 범위 안이란 8k 버킷(상태 6,553–7,618 토큰, 즉 학습 길이)과의 CUAD 정확도 차이가, 같은 계약·반복·질문에서 짝지어졌을 때 95 % 하한이 최소 −3 pp이고 모든 레코드가 답변되었음을 뜻합니다. 16k 버킷이 실패하면 검증된 길이는 8,192 토큰입니다.

명목 상태 길이별 CUAD 정확도, ECE, 그리고 8k 버킷과의 짝지은 차이(longdoc-v1 개발):

명목 상태 길이 CUAD 질문 수 정확도 ECE 8k 대비 Δ, pp [95 % CI]
4k 443 0.779 0.128 –
8k 453 0.711 0.066 기준
16k 452 0.659 0.047 −5.2 [−8.5, −2.1]
32k 454 0.663 0.055 −6.0 [−9.5, −2.5]
64k 452 0.637 0.038 −7.9 [−11.8, −4.2]

배포된 T = 2.35에서의 ECE. Δ는 두 길이에서 같은 계약에 대해 물은 445–447개 질문에서 짝지어집니다. 4k 버킷은 다른 계약을 담고 있어 규칙의 기준이 아닙니다. 출처: runs/r28-readout/context.json(라운드 28의 등록된 판독 결과, runs/r28-08b-r15-longdoc).

캘리브레이션(기대 캘리브레이션 오류, ECE, 배포된 T = 2.35에서; 낮을수록 좋음):

패널 ECE
breadth-v1 개발, 감사됨 / 14개 데이터셋 전체 0.022 / 0.032
breadth-v1 테스트, 14개 데이터셋 전체 0.042
tasksource-heldout-v1 개발, 감사됨 0.096
transfer-v4 개발 / 잠긴 테스트 0.049 / 0.045
hard-v1 개발 / 테스트 0.112 / 0.125
devtools-v1 개발, 감사됨 0.092
documents-v1 개발 / 테스트 0.059 / 0.071
decision-v7 개발(적합에 쓰인 행) 0.033
ood-v2 0.123

배포된 온도는 학습 코퍼스의 홀드아웃 항목에서 적합되었는데, 프로젝트 규칙은 이제 새 릴리스에 이를 허용하지 않습니다. 홀드아웃 데이터셋의 648개 질문(transfer-r3의 캘리브레이션 분할, 여덟 소스, 그리고 200개 MMLU-Pro 질문)에 대한 등록된 재적합은 T = 2.52(90 % bootstrap 구간 [2.19, 2.83])를 줍니다. 감사된 breadth-v1 및 tasksource-heldout-v1 개발 질문 4,468개에서 그것이 더 잘 캘리브레이션됩니다: ECE 0.037 대 0.048, Brier는 0.0020 [0.0014, 0.0025] 더 낮습니다. 학습된 패밀리에서는 더 나쁩니다. 각각 등록 허용치 0.005를 넘습니다: hard-v1 ECE 0.124 대 0.112, devtools-v1(감사됨) 0.099 대 0.092, documents-v1 0.078 대 0.059. 따라서 재적합은 자격을 얻지 못했고 T = 2.35가 유지됩니다. 워크로드가 Kev의 학습 패밀리보다 홀드아웃 공개 데이터셋과 더 닮은 사용자는 KEV_TEMPERATURE=2.52로 재적합 값에서 서빙할 수 있습니다. 답은 T에 의존하지 않습니다.

기타 결과.

스위트 Kev-0.8B Jev
날짜 산술, deadline 정책 (transfer-v9 개발) 0.35 0.95
MMLU, 4개 선택지 (transfer-v9 개발) 0.425 0.90
홀드아웃 정책 구조, 최소 대조 쌍 두 형제 모두 정답 (transfer-v4 개발) 0.422 –
When2Call, 개발 / 테스트 (평가 전용 소스) 0.167 / 0.133 –
프롬프트 인젝션, 개발 (평가 전용 소스) 0.547 0.893
SemIf (직접 작성한 결정 144개; 더 큰 모델에서는 거의 포화, 참고로만 보고) 0.722 0.965
JevBench 공개 항목, 전체 231 / hard 등급 111 (ECE) 0.636 / 0.360 (0.181) –

서빙. CUDA, 융합 커널과 CUDA graphs를 쓴 bf16, L4 한 장; 새 상태 / 반복 상태에 대한 요청당 모델 시간(20회 중앙값): 짧은 상태에 대한 질문 6개는 22.7 / 16.1 ms, 2,200-토큰 상태에 대한 질문 5개는 108.6 / 32.3 ms; 클라이언트 64개에서 초당 62.8 요청. 상주 GPU 메모리는 3.8 GB입니다. 서빙되는 확률은 280개 질문에서 fp32 평가 경로와 0.017 이내로 유지되며, 답이 바뀐 것은 1개입니다.

Apple Silicon (MLX, bf16, 32 GB M5; 질문 3개, 그중 하나는 60 % 깊이에 심어 둔 사실에 관한 것; 상태는 1,024-토큰 청크로 prefill됨):

상태 토큰 새 상태 캐시된 상태 MLX 피크(가중치 1.5 GB) 프로세스 풋프린트 심어 둔 사실 (p)
8,192 1.4 s 74 ms 2.7 GB 5.3 GB 정답 (0.68)
16,384 3.2 s 94 ms 3.0 GB 6.1 GB 정답 (0.68)
32,768 8.0 s 134 ms 3.1 GB 6.3 GB 정답 (0.70)
65,000 21.2 s 202 ms 3.8 GB 5.4 GB 정답 (0.62)

같은 요청에서 CPU의 fp32 PyTorch와 비교하면, MLX 답은 8k에서 최대 0.0076, 16k 토큰에서 0.0052 차이가 나며, 바뀐 답은 없습니다. 100개 짧은 상태 질문에서 MLX 경로는 fp32 평가 경로와 0.020 이내이며, 답이 바뀐 것은 1개입니다.

¹ 감사된 패널에서 제외됨: breadth-v1 데이터셋 네 개(routerbench, 그 상태가 물은 정보를 결여함; cfcolor와 humicroedit, 모든 시스템에서 우연 수준; chessbench, 모든 시스템에서 하한); 레이블이 유효하지 않거나 복구 불가능한 tasksource-heldout-v1 패밀리 일곱 개(이름 비공개); 상태가 레이블을 결정하지 못하는 devtools-v1 태스크 두 개(flakeflagger, commit 변경 유형).

² 커뮤니티 Decision Index 0.2의 우연 보정 지수: 데이터셋마다 (score − chance) / (1 − chance), 각 영역 안에서 평균한 뒤, 100 × 다섯 영역의 평균. Jev의 지수는 같은 테스트 항목을 별도로 한 번 읽은 데서 나온 것입니다.

한계와 트레이드오프

  • 도메인 외에서는 sub-1B 모델입니다. transfer-v4 개발에서 Jev에 21점, breadth-v1 지수에서 31점 뒤처집니다. 지식(MMLU-Pro 0.230)과 패러프레이즈는 학습되지 않은 베이스에 가깝습니다. 정확도가 중요한 곳에서는 Kev-4B를 사용하십시오.
  • 이득은 분포 내에 있습니다. documents-v1, hard-v1, devtools-v1의 학습 분할이 학습 데이터에 들어 있습니다. 분포 외 점검인 JevBench 공개 hard 등급에서 documents-and-skills 단계는 +2.7 pp [−1.8, +7.2]만큼 움직였으며, 0과 구별되지 않습니다.
  • 도구 호출 라우팅은 더 나빠졌습니다. 평가 전용 소스인 When2Call은 개발에서 0.260에서 0.167로, 테스트에서 0.233에서 0.133으로 떨어졌으며, 이는 네 선택지 중 하나를 찍는 4분의 1 비율보다 낮습니다. 도구 호출 라우팅에 사용하지 마십시오.
  • devtools-v1 결과 하나는 설명되지 않습니다. FlakeFlagger는 분할마다 150개 질문에서 개발에서는 0.500 → 0.520으로, 테스트에서는 0.507 → 0.813으로 움직였습니다. 기술이 아니라 설명되지 않는 것으로 취급하십시오.
  • 날짜 산술이 가장 약한 패밀리입니다: deadline 정책 질문에서 0.35로 Jev의 0.95에 대비됩니다. KEV_DATE_FACTS=1 전처리기는 이 모델보다 더 큰 모델에 더 도움이 됩니다.
  • 규칙 조합이 약합니다: 홀드아웃 정책 최소 대조 쌍의 두 형제가 모두 맞을 확률이 0.422입니다.
  • 캘리브레이션은 하나의 분포 내 온도입니다(캘리브레이션 참고). 이는 신뢰도의 순서를 바꿀 수 없습니다. 도메인 외에서 ≤ 5 % 오류의 커버리지는 개발에서 0.145로 Jev의 0.70에 대비되므로, 엄격한 오류 예산에서 자동화할 수 있는 결정은 거의 없습니다.
  • 학습되지 않은 길이. 학습 상태는 최대 7,552 토큰이었습니다. 더 긴 상태는 65,536 토큰까지 서빙됩니다. 정확도가 얼마나 유지되는지는 위의 검증된 컨텍스트 길이입니다.
  • 선택지 순서가 답을 바꿀 수 있습니다. 질문 격리는 이를 막지 못합니다.

편향, 위험 및 윤리적 고려사항

  • 캘리브레이션된 확률은 부당한 신뢰를 낳을 수 있습니다. 온도는 학습 분포의 개발 행에서 적합되었으며 모든 워크로드로 전이되지 않습니다. 임계값을 설정하기 전에, 자신의 데이터에서 레이블된 표본으로 정확도와 캘리브레이션을 측정하고, 그곳에서 온도를 재적합하십시오(python -m kev.calibrate).
  • 정확도와 캘리브레이션은 도메인이 바뀌면 이동하며, 더 큰 규모보다 이 규모에서 더 그렇습니다. 위의 숫자에 의존하기보다 프로덕션 오류율을 모니터링하십시오.
  • 사람에 관한 중대한 자동 결정을 사람의 검토 없이 내리는 데 사용하지 마십시오. 베이스 모델과 학습 데이터(다른 모델이 생성한 레이블 포함)의 편향은 측정되지 않았습니다.
  • 상태에는 개인정보나 기밀 데이터가 포함될 수 있습니다. 셀프 호스팅은 입력을 자신의 하드웨어에 둡니다. KEV_API_KEY를 설정하지 않으면 서버는 열려 있으므로, 자체 접근 제어와 데이터 처리 정책을 적용하십시오.

컴퓨트

  • 베이스 레시피: NVIDIA H100 한 장에서 약 20분. 날짜 단계: 9분.
  • 문서와 기술 단계: NVIDIA H200 한 장에서 52분(피크 23.9 GB).
  • 평가 및 서빙 점검: Modal의 단일 H100 / H200 / L4 GPU; MLX 측정은 Apple M5에서.

출처와 재현성

  • 코드, 스위트, 평가 보고서: github.com/jaredpalmer/kev. 릴리스 숫자: runs/release/kev-08b-r15.json(scripts/release_numbers.py --release kev-08b-r15), 잠긴 판독 runs/locked/kev-08b-r15-ungated/, 2026-09-30 패밀리 판독 runs/fam-08b-breadth/, runs/fam-08b-breadthtest/ 및 runs/fam-breadth-test-report/, 캘리브레이션 재적합 runs/r28-readout/round28.json, 서빙 runs/serve-08b-l4/, runs/mlx-long-states/, runs/mlx-full-0.8b/.
  • 단계: 베이스 트라이얼 q35-08b/02-trial-2(tag v7-base); 날짜 night2-08b-du2/00-trial-0(tag night2-du-release); 문서와 기술 라운드 15 r15-08b/00-trial-0(experiments/round15/joint.json, 규칙 experiments/rounds/r15.json). 캘리브레이션 재적합: 라운드 28 arm 08b-r15(experiments/rounds/r28.json).
  • 공개 가중치: Hub revision 9a45d25e; 어댑터 sha256 9b908623…, head.pt sha256 f400bd12…(T = 2.3511).
  • 릴리스 이력: 2026-09-24에 라운드 15의 확정 후보로 공개되었고, Kev 1.0에 변경 없이 포함되었습니다. 이것이 어떻게 선정되었는지에 대한 기록 — 이후 건전하지 않다고 폐기된 스위트(scienthoon, WANLI-v2, TypeSafe) 포함 — 은 Hub revision 9a45d25e의 README와 git tag research-archive-2026-09-24의 PLAN.md입니다.

인용

@misc{palmer2026kev08b,
  title        = {Kev-0.8B: a calibrated decision model on Qwen3.5-0.8B},
  author       = {Palmer, Jared},
  year         = {2026},
  howpublished = {\url{https://huggingface.co/jaredpalmer/kev-0.8b}},
  note         = {Kev 1.0}
}

연락처

질문과 이슈: github.com/jaredpalmer/kev/issues.