문서

Kev-9B

모델 요약

Kev-9B는 의사결정 모델입니다. 문서 하나(상태)와 그에 관한 타입이 지정된 질문 집합을 읽고, 각 질문에 함께 주어진 선택지에 대한 캘리브레이션된 확률 분포를 한 번의 포워드 패스로, 텍스트를 생성하지 않고 반환합니다. 문서를 분류·라우팅·트리아지하거나 검사하고, 예를 들어 불확실한 사례를 사람 검토로 보내기 위해 임계값을 정할 수 있는 확률이 필요한 개발자를 위한 것입니다. TypeSafe의 공개 System One API(POST /v1/systemone)를 구현하므로 TypeSafe SDK가 변경 없이 그대로 동작합니다. Qwen3.5-9B-Base 위의 LoRA 어댑터와 포인터 헤드이며, 24 GB급 GPU 한 장에 들어갑니다. 이 카드는 2026-09-30에 출시되어 Kev 1.0에 포함된 version 2를 설명합니다.

모델 세부 사항

개발자 Jared Palmer (github.com/jaredpalmer/kev)
모델 유형 의사결정 모델: 인과 언어 모델 백본을 prefill 전용으로 실행하고, 선택지 위에 포인터 헤드를 둡니다
백본 Qwen/Qwen3.5-9B-Base (revision 68c46c4b): 32개 레이어, 24개 Gated DeltaNet(선형 어텐션)과 8개 완전 어텐션, hidden size 4,096; 동결
어댑터 LoRA, rank 16, α 32, 어텐션·MLP·DeltaNet 프로젝션에 적용(45.4M 파라미터)
헤드 포인터 헤드: 두 개의 프로젝션이 각 선택지의 마지막 토큰을 질문의 최종 토큰에 대해 점수화합니다; softmax가 확률을 줍니다
정밀도 fp32 가중치 위에서 bf16 autocast로 학습; bf16으로 서빙(로드 시 어댑터를 베이스에 병합); fp32로 평가
컨텍스트 최대 65,536토큰의 상태가 서빙되고, 질문마다 최소 8,192토큰이 더해집니다. 학습 상태는 최대 7,552토큰이었습니다.
검증된 컨텍스트 길이 8,192토큰(긴 문서 참조)
캘리브레이션 온도 하나, T = 2.19, head.pt에 저장되어 로드 시 적용
언어 영어
라이선스 Apache-2.0(어댑터와 헤드); 베이스 모델은 Apache-2.0
버전 v2 (Kev 1.0): jaredpalmer/kev-9b의 main, revision b5d8c18e(2026-09-30 출시)
이전 버전 v1, documents와 스킬 단계가 없는 동일한 레시피(T = 2.30), 태그 v1; 그 카드는 해당 태그의 README입니다

입력. 상태 하나(텍스트, 또는 레이블이 붙은 텍스트로 렌더링된 JSON 객체나 배열)와 임의 개수의 이름 있는 질문, 각 질문은 세 가지 유형 중 하나입니다:

유형 선택지 출력
choice 1–255개의 이름 있는 선택지, 각각 선택적 설명 포함 선택지마다 확률 하나, 가장 가능성 높은 선택지, 신뢰도
score 1–255개의 순서가 있는 레벨 레벨마다 확률 하나와 기대 레벨 인덱스
noul 예 / 아니오, 선택적 설명 포함 예일 확률

각 질문은 공유 상태에서 이어지는 자기 자신의 행으로 답변되므로, 질문들은 서로 영향을 줄 수 없습니다; 상태는 한 번 계산되어 캐시됩니다.

의도된 용도

  • 수천 토큰 정도의 문서에 대한 타입이 지정된 의사결정: 분류, 라우팅, 트리아지, 추출 선택, 정책 및 자격 검사, 그리고 명시된 기준에 대한 제안된 답의 판정.
  • 신뢰도를 근거로 행동하는 워크플로: 확신하는 사례는 자동화하고 나머지는 대기열에 넣으며, 임계값은 사용자 자신의 워크로드에서 레이블이 붙은 표본에 고정합니다.
  • 24 GB급 GPU 한 장에서 System One 엔드포인트를 대체하는 자체 호스팅 드롭인 교체품, 그리고 사용자 자신의 레이블로 파인튜닝하기 위한 시작점(kev.train --init_from jaredpalmer/kev-9b).

범위 밖 용도

  • 텍스트 생성, 채팅, 요약, 개방형 질의응답. 모델은 주어진 선택지만 점수화합니다.
  • 사람에 대한 법적, 의료적, 금융적, 고용상 또는 유사한 결과를 낳는 결정을 사람 검토 없이 완전 자동으로 내리는 것.
  • 답이 상태에 없고 상식도 아닌 사실에 의존하는 질문, 그리고 지식 집약적 시험(한계 참조).
  • KEV_DATE_FACTS=1 전처리기 없이 일 단위 정밀도의 날짜 산술, 65,536토큰보다 긴 상태, 그리고 영어 이외의 언어.

사용 방법

Kev 저장소로 서빙합니다. CUDA에서는 융합된 DeltaNet 커널과 CUDA graphs와 함께 bf16으로 실행됩니다(L40S 또는 H100 한 장; 상주 약 22 GB); Apple Silicon에서는 같은 명령이 MLX를 통해 서빙하며, 자동으로 선택됩니다.

git clone https://github.com/jaredpalmer/kev.git && cd kev && uv sync --extra serve
uv run --extra serve python -m kev.serve --run jaredpalmer/kev-9b --port 8008          # v2, Kev 1.0 (this card)
uv run --extra serve python -m kev.serve --run jaredpalmer/kev-9b@v1 --port 8008       # v1
from typesafe_sdk import Choice, Noul, TypeSafeClient

client = TypeSafeClient(api_key="local", base_url="http://127.0.0.1:8008", model="kev-latest")
response = client.system_one(
    state="I was charged twice for order 1182. Please refund one of the charges.",
    questions={
        "team": Choice(instructions="Which team should handle this?",
                       criteria={"billing": "Charges and refunds", "shipping": "Deliveries", "returns": "Exchanges"}),
        "urgent": Noul(instructions="Does this need a reply today?"),
    },
)
print(response.choices["team"].choice, response.nouls["urgent"].noul)

캘리브레이션된 온도는 기본적으로 적용됩니다; KEV_TEMPERATURE=1.0은 원시 확률을 반환합니다. KEV_DTYPE=fp32는 평가에 사용된 정확한 경로를 선택합니다. KEV_DATE_FACTS=1은 상태에서 찾은 각 날짜 쌍 사이의 일수를 덧붙이며, 모델은 이를 사용하도록 학습되었습니다. 65,536토큰을 넘는 상태는 토큰 수를 알려 주는 422와 함께 거부됩니다.

학습 데이터

단계 레코드 내용과 레이블
베이스 레시피(decision-v7) 12,576 열 개의 공개 분류 데이터셋에서 온 10,000개 레코드(각 1,000개, 이 카드의 메타데이터에 나열)와 그 고유 레이블; 아홉 개 템플릿 패밀리에 걸친 896개의 생성된 정책 최소 대조 쌍(minimal pair); 네 가지 렌더링으로 된 60개의 무작위 생성 규칙 구조에서 온 1,680개 레코드; 레이블은 코드로 계산
날짜와 누락 증거 1,425 생성: 900개의 날짜 포함 정책 사례(일반, 일수 문장 포함, 또는 date_facts 필드 포함); 결정 문장이 제거되고 균일 목표가 붙은 255개 사례, 그리고 270개의 온전한 대조
문서와 스킬, 한 단계 16,539 documents-v1 train: 5,219개의 미국 소비자 금융 불만 서사(CFPB, 최대 약 7k 토큰)와 7,488개 질문, 레이블은 두 오픈 웨이트 교사가 소비자 자신의 신고와 일치한 경우에 유지. hard-v1 train: 일곱 개 스킬 패밀리(긴 정책, 트레이드오프, 확률, 멀티홉, 날짜와 산술, 제안된 답 판정, 누락 사실 기권)의 프로그램 방식으로 레이블된 6,000개 레코드, 템플릿 0–3. devtools-v1 train: CodeReviewer, CommitPackFT, FlakeFlagger, Aegis에서 온 5,320개 레코드와 각 데이터셋 자체의 레이블

두 파인튜닝 단계는 decision-v7에서 2,000개와 10,000개 레코드를 재생합니다. Jev(TypeSafe의 호스팅 의사결정 모델)의 출력은 사용되지 않았습니다. CodeReviewer와 FlakeFlagger는 Zenodo에서 왔습니다; CFPB 서사는 미국 정부 저작물입니다; 출처별 라이선스와 revision은 스위트 manifest에 기록되어 있습니다. 아래의 평가 전용 스위트(breadth-v1, tasksource-heldout-v1, transfer-v4, longdoc-v1, 그리고 devtools-v1의 When2Call과 프롬프트 인젝션 출처)는 결코 학습에 들어가지 않습니다.

학습 절차

  1. 베이스 레시피. 베이스에서 decision-v7에 대해 두 epoch: LoRA rank 16, α 32; 학습률 5e-5, one-cycle 스케줄; 유효 배치 8(4 × 2 누적); bf16 autocast, 그래디언트 체크포인팅. 손실은 각 질문의 선택지에 대한 교차 엔트로피입니다. 선택지 순서는 섞이고, “해당 없음”(none of the above) 선택지와 방해 선택지(distractor)가 무작위로 삽입되며, choice 레코드의 4분의 1은 최소 대조 쌍(minimal pair)도 만들어 냅니다(“해당 없음”(none of the above) 선택지가 붙은 그 질문을, 정답 선택지가 있는 상태로 한 번, 제거된 상태로 한 번).
  2. 날짜와 누락 증거. 단계 1에서 학습률 2e-5로 한 epoch, 2,000개 레코드를 재생. 이것이 v1입니다.
  3. 문서와 스킬. v1에서 세 학습 집합 모두를 함께 한 epoch, 학습률 2e-5, 10,000개 레코드 재생; 배치 2 × 4 누적; 최대 7,552토큰의 상태; 시드 1; 3,318 옵티마이저 스텝.
  4. 캘리브레이션. 온도 하나, T = 2.19, 홀드아웃 데이터셋의 648개 질문에 대해 음의 로그 우도를 최소화: 448개는 transfer-r3의 캘리브레이션 분할(여섯 개 공개 데이터셋 QNLI, SciQ, TweetEval-offensive, PAWS, MMLU, Emotion, 그리고 생성된 정책 레코드의 홀드아웃 패밀리 두 개)에서, 200개는 MMLU-Pro 질문(transfer-v9 개발)에서. 이 풀은 적합 전에 체크포인트의 학습 스위트에 대해 확인되었습니다.

평가

방법론. 모든 비교는 동일한 항목에서 Kev-9B v1에 대한 것이며, 각 모델은 자신이 서빙되는 온도에 있습니다(v1: 2.30). 비교와 그 기준선은 확인 판독 전에 등록되었습니다; 테스트 파티션은 이 체크포인트를 위해 한 번 읽혔습니다; transfer-v4 테스트는 잠겨 있습니다(후보마다 한 번 읽음). 쌍 구간은 전체 레코드를 재표본하는 95 % bootstrap(2,000회 재표본)이므로, 상태를 공유하는 질문들은 함께 움직입니다. 차이는 퍼센트 포인트(pp)입니다. Jev(TypeSafe의 호스팅 모델, Vercel AI Gateway를 통해 질의)는 같은 항목에서 읽힌 곳에 표시됩니다. 스위트는 다음과 같습니다:

  • breadth-v1: 다섯 영역(지식, 언어, 검색, 도구, 예술)의 14개 홀드아웃 공개 데이터셋, 결코 학습되지 않음.
  • transfer-v4: 한 번도 학습되지 않은 여섯 개 공개 출처의 도메인 외 의사결정, 그리고 홀드아웃 정책과 규칙 구조.
  • transfer-r3: 캘리브레이션 풀과 같은 여덟 개 홀드아웃 출처의 짧은 상태 패널.
  • hard-v1: 위의 스킬 패밀리; 테스트 분할은 학습된 생성기의 템플릿을 홀드아웃합니다.
  • devtools-v1: 라이선스를 확인한 여섯 개 출처(네 개 학습, 두 개 평가 전용)의 개발자 도구 의사결정.
  • documents-v1 / documents-v2: CFPB 불만 서사; v2는 비공개 홀드아웃 테스트 집합입니다.
  • longdoc-v1: CUAD 상업 계약과 생성된 계약 묶음, 상태는 4k에서 64k 토큰.

devtools-v1 헤드라인 패널은 상태가 레이블을 결정하지 못하는 두 과제(flakeflagger, commit 변경 유형)를 제외합니다; 같은 행이 양쪽에서 빠집니다.

v1에 대한 결과(등록된 확인).

패널(질문 수) Kev-9B v2 Kev-9B v1 Δ [95 % CI]
hard-v1 + devtools-v1 개발, 감사됨(1,855) 0.821 0.628 +19.3 [+17.2, +21.6]
documents-v1 개발(920) 0.902 0.833 +7.0 [+4.8, +9.2]
짧은 상태: transfer-v4 개발 + transfer-r3 테스트, emotion 제외(1,586) 0.871 0.871 +0.1 [−1.1, +1.2]
hard-v1 + devtools-v1 테스트, 감사됨(1,859) 0.822 0.635 +18.7 [+16.7, +20.8]
documents-v1 테스트(936) 0.900 0.829 +7.1 [+4.7, +9.2]
도메인 외, transfer-v4 잠긴 테스트(656): 정확도 0.852 0.852 +0.0 [−1.7, +1.8]
transfer-v4 잠긴 테스트: 서빙 Brier 0.199 0.224 −0.025 [−0.047, −0.007]

홀드아웃 데이터(결코 학습되지 않음).

패널(질문 수) Kev-9B v2 Kev-9B v1 Jev
breadth-v1 개발, 14개 데이터셋 전부(3,075) 0.700 0.697 0.757
breadth-v1 테스트, 14개 데이터셋 전부(3,089) 0.698 0.692 0.757
breadth-v1 테스트, 우연 보정 지수¹ [95 % CI] 41.0 [38.8, 43.9] 40.0 [38.1, 43.0] 54.0 [51.2, 57.0]
도메인 외, transfer-v4 개발(656): 정확도 / Brier 0.820 / 0.262 0.822 / 0.264 0.857 / 0.211
transfer-v4 잠긴 테스트: ECE / 확신 오류(p ≥ 0.9이고 오답) / ≤ 5 % 오류에서의 커버리지 0.034 / 1.4% / 0.742 0.042 / 3.2% / 0.645 –
짧은 상태, transfer-r3 테스트(1,150) 0.847 0.847 –
MMLU-Pro, 10개 선택지(transfer-v9 개발) 0.590 0.515 0.840
p ≥ 0.9로 답한 답변 불가 항목(낮을수록 좋음) 0.00 0.00 0.09

v1에 대해 breadth-v1 정확도 차이는 개발에서 +0.3 [−0.7, +1.3], 테스트에서 +0.6 [−0.4, +1.6]입니다. tasksource-heldout-v1 개발은 이 체크포인트를 위해 읽혔지만 그 판독은 완료되지 않았습니다; 여기서는 보고하지 않습니다.

학습된 패밀리(홀드아웃 항목과 템플릿).

패널(질문 수) Kev-9B v2 Kev-9B v1 Jev
hard-v1 개발(1,083) / 테스트(1,088) 0.813 / 0.834 0.574 / 0.584 0.777 / –
devtools-v1 개발(1,072) / 테스트(1,071), 모든 출처 0.772 / 0.791 0.631 / 0.637 0.713 / –
documents-v1 개발(920) / 테스트(936) 0.902 / 0.900 0.833 / 0.829 0.868 / –
documents-v2, 비공개 홀드아웃 테스트(953) 0.900 0.821 –
decision-v7 개발(1,264) / 잠긴 테스트(1,200) 0.874 / 0.873 0.872 / – 0.845 / –
생성된 의사결정의 홀드아웃 도메인, ood-v2(4,988) 0.889 – –

v1에 대한 테스트 차이: hard-v1 +25.0 [+22.0, +28.1], devtools-v1(모든 출처) +15.4 [+11.0, +19.4], documents-v2 +8.0 [+5.9, +10.2].

긴 문서.

  • 검증된 컨텍스트 길이: 8,192토큰, 학습된 길이입니다. 16k 버킷은 허용 범위를 벗어납니다: 그 하한이 −3.7 pp로 −3 pp보다 낮으므로, 더 긴 길이는 검증되지 않습니다.
  • 판독 전에 고정된 규칙: 검증된 길이는 16,384토큰부터 위로, 그 버킷과 8,192 사이의 모든 버킷이 허용 범위 안에 있는 가장 큰 버킷의 명목 크기입니다. 허용 범위 안이란, 8k 버킷(6,553–7,618토큰의 상태, 학습된 길이)에 대한 CUAD 정확도 차이가 같은 계약·반복·질문에서 쌍을 이뤄 95 % 하한이 최소 −3 pp이고 모든 레코드가 답변되었음을 뜻합니다. 16k 버킷이 실패하면 검증된 길이는 8,192토큰입니다.

명목 상태 길이별 CUAD 정확도, ECE, 그리고 8k 버킷과의 쌍 차이(longdoc-v1 개발):

명목 상태 길이 CUAD 질문 수 정확도 ECE 8k 대비 Δ, pp [95 % CI]
4k 443 0.876 0.049 –
8k 453 0.850 0.051 기준
16k 452 0.839 0.033 −1.4 [−3.7, +0.9]
32k 454 0.819 0.041 −3.6 [−6.4, −0.9]
64k 452 0.801 0.056 −5.2 [−7.9, −2.5]

출시된 T = 2.19에서의 ECE. Δ는 두 길이에서 같은 계약에 대해 물은 445–447개 질문에서 쌍을 이룹니다. 4k 버킷은 다른 계약을 담고 있어 규칙의 기준이 되지 않습니다. 출처: runs/r28-readout/context.json(28라운드의 등록된 판독, runs/r29-9b-r18a-longdoc).

캘리브레이션(기대 캘리브레이션 오차, ECE, 서빙되는 그대로; 낮을수록 좋음):

패널 Kev-9B v2 (T = 2.19) Kev-9B v1 (T = 2.30)
breadth-v1 테스트, 14개 데이터셋 전부 0.034 0.044
transfer-v4 개발 / 잠긴 테스트 0.041 / 0.034 0.042 / 0.042
hard-v1 테스트 0.054 0.075
devtools-v1 테스트, 모든 출처 0.098 0.147
documents-v1 테스트 0.017 0.103

온도의 90 % bootstrap 구간은 [2.05, 2.41]입니다. v1의 2.30은 자신의 학습 분포의 개발 행에 적합되었습니다; v2는 홀드아웃 데이터셋에 적합된 온도로 서빙되는 첫 9B입니다.

기타 결과.

스위트 Kev-9B v2 Jev
날짜 산술, deadline 정책(transfer-v9 개발) 0.725 0.95
MMLU, 4개 선택지(transfer-v9 개발) 0.725 0.90
SemIf(144개 직접 작성 의사결정; 거의 포화, 보고만) 0.917 0.965

서빙. CUDA, 융합 커널과 CUDA graphs를 사용한 bf16; 새 상태 / 반복된 상태에 대한 요청당 모델 시간(20회 중앙값), v1에서 측정(동일 아키텍처와 어댑터 형태):

GPU 질문 6개, 짧은 상태 질문 5개, 2,200토큰 상태 요청/s, 클라이언트 64
L40S 66.4 / 42.7 ms 235.6 / 57.5 ms 32.7
H100 24.0 / 16.6 ms 88.5 / 26.4 ms 79.5

상주 GPU 메모리는 21.9 GB입니다. 서빙된 확률은 280개 질문에서 fp32 평가 경로와 0.017 이내로 유지되며, 바뀐 답은 없습니다. fp32 평가 경로(H100, v2)에서 16k / 32k / 64k 토큰의 상태는 5.1 / 10.9 / 25.4 s가 걸리고 가중치 위로 4.6 / 9.1 / 18.2 GiB를 사용합니다.

Apple Silicon(MLX): Kev-0.8B와 Kev-4B를 위해 수행한 긴 상태 측정은 이 크기에서는 이루어지지 않았습니다; 그것들에 사용된 32 GB M5에서는 19.3 GB의 bf16 백본과 그 작업 집합이 가용 메모리에 들어가지 않았습니다.

¹ 커뮤니티 Decision Index 0.2의 우연 보정 지수: 데이터셋마다 (score − chance) / (1 − chance)를 계산해 각 영역 내에서 평균하고, 그다음 100 × 다섯 영역의 평균. Jev의 지수는 같은 테스트 항목을 별도로 읽은 것입니다.

한계와 트레이드오프

  • 선택. 이 체크포인트는 더 이른 라운드에서 개발 데이터로 학습되고 읽혔으며, 그 숫자들을 알고 있는 상태에서 더 늦은 규칙에 따라 다시 선택되었습니다. 테스트 파티션과 잠긴 판독(각각 한 번씩 읽음)이 방어선입니다; 개발 마진은 낙관적으로 보십시오.
  • 큰 이득은 분포 내에 있습니다. hard-v1, devtools-v1, documents-v1의 학습 분할이 그 학습 데이터에 있습니다; 그 이득은 학습된 패밀리의 홀드아웃 항목과 템플릿이지 새 과제로의 전이가 아닙니다.
  • 새 작업에서 v1보다 낫지 않습니다. breadth-v1 테스트 +0.6 pp [−0.4, +1.6], transfer-v4 개발 −0.2 pp [−2.4, +1.8], transfer-r3 테스트 +0.0 pp [−1.2, +1.2]. breadth-v1 지수에서 Kev-27B가 11포인트 앞서고, Jev가 13포인트 앞섭니다.
  • 지식은 베이스가 정합니다. MMLU-Pro는 0.590으로, Kev-27B의 0.675와 Jev의 0.840에 대비됩니다.
  • 날짜 산술이 가장 약한 패밀리입니다: deadline 정책 질문에서 0.725로 Jev의 0.95에 대비됩니다; KEV_DATE_FACTS=1 전처리기가 도움이 됩니다.
  • 캘리브레이션. devtools-v1은 가장 캘리브레이션이 나쁜 스위트입니다(테스트 ECE 0.098). 온도의 구간은 [2.05, 2.41]입니다. 온도는 이유가 기록된 채 등록된 풀 적합으로부터 head.pt에 기록되었는데, 캘리브레이션 스크립트가 결합된 학습 파일의 출처를 나열해 풀 자체를 재확인할 수 없기 때문입니다; 그 라운드 자체의 확인이 그것을 커버했습니다. 그 확인은 manifest에 출처가 나열되지 않은 v1의 날짜와 누락 증거 데이터를 커버하지 않습니다; 그 레코드들은 네 개의 생성 패밀리이며 어느 것도 풀에 없습니다.
  • 학습되지 않은 길이. 학습 상태는 최대 7,552토큰이었습니다. 더 긴 상태는 최대 65,536토큰까지 서빙됩니다; 정확도가 어디까지 유지되는지는 위의 검증된 컨텍스트 길이입니다.
  • 선택지 순서는 답을 바꿀 수 있습니다; 질문 격리는 이를 막지 못합니다.

편향, 위험 및 윤리적 고려사항

  • 캘리브레이션된 확률은 근거 없는 신뢰를 만들 수 있습니다. 온도는 공개 홀드아웃 데이터셋에 적합되었으며 모든 워크로드에 전이되지 않습니다; 임계값을 설정하기 전에 자신의 데이터에서 레이블이 붙은 표본으로 정확도와 캘리브레이션을 측정하고 그곳에서 온도를 재적합하십시오(python -m kev.calibrate).
  • 정확도와 캘리브레이션은 도메인 변화에 따라 달라집니다. 위의 숫자에 의존하기보다 프로덕션 오류율을 모니터링하십시오.
  • 사람에 대한 중대한 자동 의사결정에 사람 검토 없이 사용하지 마십시오. 베이스 모델과 학습 데이터(다른 모델이 생성한 레이블 포함)의 편향은 측정되지 않았습니다.
  • 상태에는 개인적이거나 기밀인 데이터가 포함될 수 있습니다. 자체 호스팅은 입력을 자신의 하드웨어에 유지합니다; KEV_API_KEY가 설정되지 않으면 서버가 열려 있으므로, 자신의 접근 제어와 데이터 처리 정책을 적용하십시오.

컴퓨트

  • 베이스 레시피와 날짜 단계(v1): 단일 NVIDIA H100 GPU.
  • 문서와 스킬 단계: NVIDIA H200 한 장에서 2.6시간(피크 74.1 GB).
  • 평가와 서빙 점검: Modal의 단일 H100 / H200 / L40S GPU.

출처와 재현성

  • 코드, 스위트, 평가 보고서: github.com/jaredpalmer/kev. 릴리스 번호: runs/release/kev-9b-r27.json(scripts/release_numbers.py --release kev-9b-r27); 등록된 규칙과 판정 experiments/rounds/r27.json, runs/r27-readout/, runs/r27-verdict/; 2026-09-30 패밀리 판독 runs/fam-9bnew-breadth/, runs/fam-9b-breadth/, runs/fam-breadth-test-report/; ood-v2 runs/r29-9b-r18a-ood/; 서빙 runs/serve-9b-l40s/, runs/serve-9b-h100/, runs/long-state-9b-h100/.
  • 단계: 베이스 시도 q35-9b/01-trial-1(태그 v7-base); 날짜 night2-9b-du/00-trial-0(v1, 태그 v1); 문서와 스킬 라운드 18 암 (a) r18-9b/00-trial-0(experiments/round18/joint.json), 라운드 27의 9b-r18a로 선택 및 확인됨.
  • 출시된 가중치: Hub commit b5d8c18e; 어댑터 sha256 2b2a70cf4ef4440b6c22899e1f72c2f8ea5c6f65b19aa344539b4b8971d1f13d, head.pt sha256 8e1dab2c…(T = 2.1936).
  • 검증: Hub에서 익명으로 로드했을 때, T = 2.19에서 252개 SemIf 행 중 252개와 764개 transfer-v4 개발 행 중 764개에서 출시 전 평가의 답을 재현했습니다(runs/rel9-public/).

인용

@misc{palmer2026kev9b,
  title        = {Kev-9B: a calibrated decision model on Qwen3.5-9B},
  author       = {Palmer, Jared},
  year         = {2026},
  howpublished = {\url{https://huggingface.co/jaredpalmer/kev-9b}},
  note         = {Version 2, released 2026-09-30; Kev 1.0}
}

연락처

질문과 이슈: github.com/jaredpalmer/kev/issues.