決策模型術語表

這些詞在官方文件裡都是英文。本站統一譯法,並保留英文原名便於對照原文。

System OneSystem One 模型

一類專為「做出軟體可直接消費的快速結構化決策」而訓練的模型。與生成式大模型的關鍵差別在於:它不產生文本,所以沒有需要解析的內容,也沒有可以幻覺的餘地 —— 輸出直接就是型別化的值和機率分佈,程式碼可以拿它分支、排序和路由。Jev 是第一個 System One 模型,Laya 屬於同一類。

See also state · question

原文 System One

state狀態

傳送給模型、供它評估的材料:一封郵件、一張工單、一份 JSON 文件、一段合同文本。一次請求裡所有問題都對同一個 state 求值,而且相互獨立。這帶來一個實用性質:增加問題幾乎不改變響應時間,也不會因為問題多而產生上下文腐化。

See also question · choice

原文 狀態

question問題(原語)

對 state 提出的一個型別化問題。只有三種:choice、score、noul。「原語」這個叫法是相對軟體原語而言 —— 它們模組化、可組合、結構化。一次請求裡可以混用三種並同時提出多個。

See also choice · score · noul

原文 原語(問題)

choice選擇(choice)

從一組給定的選項裡選一個。Jev 的 Choice 最多支援 255 個選項。回答裡除了選中的那一項,還會給出每個選項各自的可能性以及整體置信度。適合分類、路由、從候選集裡挑一個這類任務。

See also score · noul · confidence

原文 Choice

score評分(score)

把 state 放在一條有序的、有描述的量規上。回答是落在某一檔上的分值、各檔的可能性、以及置信度。與 choice 的區別在於選項之間是否有序。常見的坑是「一次問一個複合判斷」—— 正確做法是拆成多個原子 score,再在程式碼裡用自己的權重合成。

See also choice · noul · confidence

原文 Score

noulnoul(是非判斷)

問一個是非題,返回「答案為是」的機率(0–1)。它和 confidence 不是一回事:noul 給出的是關於世界的機率,confidence 給出的是關於模型自己的判斷可靠程度。這個區別是初學者最容易混淆的地方。

See also confidence · choice

原文 Noul

confidence置信度(confidence)

模型對自己這次判斷有多確定的度量。這就是 System One 模型最有用的輸出:答案告訴你「是什麼」,置信度告訴你「該不該據此行動」。典型用法是做門控 —— 高置信度自動處理,低置信度轉人工。注意並不是所有問題型別都返回它:choice 和 score 有,noul 沒有(noul 本身就是一個機率)。

See also noul · score

原文 置信度

calibration校準

機率輸出是否「說到做到」的性質:模型說 70% 的那些樣本里,真的約 70% 是正例。兩個模型都用強化學習配合嚴格適當的評分規則(Jev 叫 RLCD)來訓練校準,這正是置信度能用來做門控的前提 —— 未經校準的置信度只是數字,不能拿它設閾值。

⚠️ 但「訓練時用了校準目標」不等於「輸出的機率已經校準」。 這一點目前有公開的反面證據:有獨立實驗讓 Jev 猜一顆公平骰子 400 次,它 400 次選同一個面、平均自報 82.9%,而實際正確率是 19.0%;也有預註冊的分佈外測試測出不同原語的偏差方向相反。落地時請把置信度當作待校準的先驗,並在自己的資料上量出可信區間 —— 見指南里的實測與閾值選擇。

相關專案 SemIf4,162★ · NanoJev2,159★ →

See also confidence · noul

原文 置信度

escalation升級(轉人工)

置信度落在中間帶時,把決策交給人的做法。它不是「失敗分支」,而是設計出來的一檔 —— 高置信度自動處理、低置信度丟棄,中間那一帶交給人。兩個容易漏掉的點:中間帶是人力成本(頻寬越寬,人處理的越多);升級必須有兜底,否則沒人來看時這件事就永遠停在那裡,而面板上看起來和「一切正常」一模一樣。

相關專案 fast-jev-compaction6,653★ · foreman540★ →

See also confidence · calibration

原文 置信度門控路由

cascade級聯

先讓便宜的一檔做判斷,只把它不確定的部分交給更貴的模型。省下來的比例等於高置信區間的覆蓋率(有實測:在 ≥90% 確信的那 37% 上定案,就省掉 37% 的大模型呼叫),而不是某個固定的百分比。前提是小模型的錯誤是隨機噪聲 —— 如果它系統性地在某一類輸入上過度自信,那一類就永遠不會被升級。

相關專案 jev-review (devagrawal09)586★ · jev-search446★ →

See also escalation · fan-out

原文 SDE 級聯

fan-out併發提問

一次請求裡問很多問題,讓程式碼挑出有用的答案。省下來的主要是輸入:同一份 state 只發一次,所以問題越多,每個請求那份固定開銷被攤得越薄(有實測:8 個問題並行時輸入 token 中位數省 76–86%)。⚠️ 它適合彼此獨立的判斷(分類、打分、過濾),不適合需要互相比較的排序 —— 有基準測出按批處理會過不了排序質量門。

相關專案 jev-review (devagrawal09)586★ · jev-search446★ →

See also cascade · question

原文 推測性扇出

guardrail護欄(門控)

在內容進入或離開一個系統之前,用一次結構化的判斷決定「放行 / 複核 / 阻斷 / 改道」。它的關鍵取捨不在閾值,而在出錯時往哪邊倒:擋風險的護欄(許可權、金鑰、危險操作)應當 fail-closed(出錯就攔),擋效率的護欄(收尾檢查、格式檢查)應當 fail-open(出錯就放)。另一個反覆出現的做法是確定性規則先跑,只把規則判不了的灰區交給模型。

相關專案 fast-jev-compaction6,653★ · foreman540★ →

See also escalation · noul

原文 LLM 的防護欄

abstention棄答

模型對自己的答案不夠確定時,不丟棄它、只做標記的機制。請求裡給一個 min_confidence 閾值,低於它的答案會被標上 low_confidence,而答案本身照常返回 —— 決定權留給呼叫方。門控狀態有三種:passed(過線)、abstained(低於閾值)、unevaluated(答案沒有可用的置信度,門控無從判斷)。沒有設閾值就一個狀態也不寫:「沒有這三個鍵」本身就是「這一輪沒開門」的報告,而不是第四種狀態。

See also confidence · calibration · guardrail

原文 HTTP API

local deployment本地部署

把開源決策模型跑在自己機器上的做法,Ollaya 是其中一套現成方案。要點:權重拉到本地磁碟、服務監聽在本機地址(如 127.0.0.1:11435)、沒有按量計費、資料不出自己的環境。它與模型是兩層:同一套部署可以裝多個模型,而準確率是模型的,不是部署方式的。

See also System One

原文 Ollaya · Quickstart