文件導航

專案清單

60 個專案,按「你要解決什麼」分類。每條一句話,附 star 數與快照日期。

每一行怎麼讀

  • star 數反映的是熱度和使用量,不是質量;數字旁的日期是它取值的那天。
  • 證據檔(可復算 / 有實現)回答的是「有多少東西可以查」,不是好不好。 一個只有幾行程式碼但公佈了原始結果的專案,和一個功能全面但數字全出自作者之手的專案, 會落在不同檔位上 —— 那和它們有沒有用無關。

60 個專案。star 數為 2026-09-24 的取值。

可復算
公佈了原始產物、資料集或可重跑的評測
有實現
程式碼可讀、有測試;數字出自作者自己

介面與瀏覽器

每一步都在點東西的場景。判斷便宜,所以可以每步都問一次。

  • Jev Ultrafast19,456★有實現

    browser-use 的超快 agent:決策模型在一次請求裡同時挑出操作與 DOM 元素,只有在需要輸入文字時才動用一個小模型。

  • jev-chat-jarvis5,561★有實現

    手機上的對話副駕:在微信 / QQ / X / 飛書裡讀懂對方,給出候選回覆並填進輸入框,發不發由你。只讀螢幕,不 hook 也不改包。

  • typesafe-computer-use937★有實現

    macOS 上的計算機操作:截圖做 OCR、用決策模型分類下一步動作、點選。作者報每步約 $0.0002。

  • hermes-jev-skills726★有實現

    給 Hermes agent 用的一套技能:模型路由、記憶、上下文壓縮、技能選擇、計算機與瀏覽器操作,也都裝得上 Claude Code 和 Codex。

  • jev-browser-use453★有實現

    「決策模型點、Codex 想與驗」的分工,作者報瀏覽器操作快 5–10 倍。

  • typesafe-mario383★有實現

    玩超級瑪麗的 agent —— 輸入不是畫面畫素,而是模擬器給出的結構化狀態。

  • mobile-jev380★有實現

    安卓上獨立的 agent:每一步都由決策模型做,另有一個即時的工作室介面顯示決策遙測。

  • jev-chat-jarvis-mac346★有實現

    微信訊息的意圖識別懸浮窗(macOS):看屏 + 本地小模型判斷意圖與風險,再按話術生成回覆候選。純只讀,不注入微信。

  • jev-voice-browser271★有實現

    用語音控制真實瀏覽器:每說出一個詞,約 300 ms 內定出意圖與目標元素,再由 Playwright 執行 —— 往往在你把話說完之前動作就已經發出去了。

  • jev-browser257★有實現

    用決策模型驅動瀏覽器操作。

  • unclutter227★有實現

    瀏覽器擴充套件:用決策模型判斷頁面上哪些是雜物並去掉,規則可以存成模板複用。

  • embodied-jev221★有實現

    MuJoCo 裡的機器人決策工作臺。

  • jev-drone170★有實現

    MuJoCo 裡只用攝像頭的自主無人機,判斷環節以 2.5 Hz 跑。

給 agent 裝剎車

編碼 agent 的第二層判斷:要不要放行、做完了沒有、上下文裡哪些還留著。

  • fast-jev-compaction6,653★有實現

    Claude Code 外掛:把「壓縮成摘要」換成「逐條打分」—— 一次請求裡給每個工具呼叫與結果判「還需要嗎」,過期的丟掉或截斷,留下的逐字保留。

  • foreman540★有實現

    agent 監工:用決策判斷把編碼 agent 拉回任務上。

  • JevHarness191★有實現

    讓大模型為具體任務寫出一個決策 harness,可選地對整條軌跡做獎勵反思並用 GEPA 演化。

  • jev-dsh-decision163★有實現

    面向 agent harness 的結構化決策外掛,原生支援 DeepSeek Harness,通過 iPolloWork 也支援 OpenCode、Codex Harness。

  • jev-pruner144★有實現

    Claude Code 外掛:在模型看到之前就把冗長的 Bash 輸出裁掉。

  • pi-jev (y0usaf)144★有實現

    給 Pi 編碼 agent 的決策層:一個測過的工具呼叫門,外加一個 jev_ask 拿型別化、帶校準的答案。

  • pi-warden138★有實現

    給 Pi 的護欄,取向是引導而不是打斷:判不可逆與跑偏的工具呼叫、發現卡住的迴圈、檢查「說做完了但其實沒驗證」,全部由決策模型來做。

  • building-with-jev-skill131★有實現

    一個技能:教你怎麼寫、怎麼改那些呼叫決策模型的程式。

路由、檢索與程式碼審查

決定「誰來處理這件事」,或者從一堆候選裡挑出該看的那些。

  • jev-review (devagrawal09)586★有實現

    分階段的程式碼審查工作流,帶一個本地看板。

  • jev-search446★有實現

    用決策模型做網頁搜尋:選源、理解查詢、相關性排序。

  • jev-router (gargpratyush)377★有實現

    讓決策模型在候選裡選一個,把 Claude Code 的任務路由到夠用且最便宜的模型上。

  • pg-jev329★有實現

    PostgreSQL 擴充套件:用平白的語言問你的表。

  • jev-codex-router263★有實現

    Codex 的逐輪路由:每一輪都重新決定用哪個模型、思考深度和速度模式。

  • jev-review (NiazMorshed2007)218★有實現

    local-first 的 MCP 外掛:讓編碼 agent 持續做軟體質量審查。

  • notra215★有實現

    營銷分析平臺:把一個「品牌曝光分類器」從大模型遷到決策模型的布林判斷上,由 feature flag 控制切換。

  • JevRouter190★有實現

    輕量路由:模型、工具、子 agent 三個都可以由它來選。

  • perch171★有實現

    命令列工具:把倉庫解析成方法級呼叫圖,再讓決策模型標出可能的缺陷、並檢查用白話寫的專案規則。

  • jev-semgrep134★有實現

    按意思而不是按模式搜尋:給每一行打一個「像不像這個意思」的分,再用 AND / OR / NOT 組合多個意思。

  • neo4jev129★有實現

    在 Neo4j 圖上一跳一跳地走:對候選的每條出邊做一次分類,用 beam search 在答案的 log 機率上搜索。

本地與開放替代

同一套 HTTP 介面下的開放權重與本地執行時。

  • SemIf4,162★可復算

    在自家一張 3090 上跑語義 if:把開源模型改造成決策模型。獨立專案,與官方無關。

  • NanoJev2,159★可復算

    0.6B 的復刻:並行決策、候選可變,不生成任何 token,訓練流水線一併放出。

  • jevlike1,279★可復算

    訓練一個小模型:在會變長變短的選項列表裡選一個,一次前向給每個選項一個機率。附帶 Doom、國際象棋、Wikispeedia 三個演示。

  • von610★可復算

    395M 的非自迴歸模型,15 ms 以內給出型別化答案與校準機率,定位是本地直替。

  • simple-jev507★可復算

    把任意開源模型變成分類器,或者變成一個相容端點。

  • AnyJev440★可復算

    把任意大模型變成決策模型:從下一個 token 的 prefill 分佈裡讀型別化答案與校準機率,不需要訓練。

  • openjev386★可復算

    開源的相容決策服務端,架在 DiffusionGemma 上。

  • decider351★可復算

    基於一個 2B 模型微調:一次前向給出型別化判斷與校準機率。

  • LLM2Jev300★可復算

    把本地模型改造成相容的結構化決策引擎,三種原語的輸出全靠 prefill-only 的二值推斷得到。

  • agent-jev286★可復算

    0.6B 的復刻,專給 agent 用:把 diff、trace、日誌這類非結構化狀態喂進去,一次約 50 ms 的前向換回機率分佈,不產生輸出 token。

  • openJev-verdict-2.0283★可復算

    151M 的非自迴歸決策引擎,作者報在公開榜單上同時超過官方模型與 Laya:77.10% 準確率、0.0636 Brier、0.0144 ECE。

  • jev-visual271★可復算

    在 Apple Silicon 上做的教學性實驗:共享上下文、直接給候選打分,帶本地視覺化演示。

  • jeff238★可復算

    自託管的替代實現。

  • reflex133★可復算

    一個小型的開放決策模型:狀態加型別化問題,換回校準機率。

接入與 SDK

讓判斷變成你語言裡的普通控制流,或者接進你已經在用的框架。含官方 SDK。

  • eve5,342★有實現

    Vercel 的開放 agent 框架:在它實驗性的 evaluate 路徑裡,把決策模型作為預設的評測模型。

  • TypeSafe agent skills2,060★有實現

    官方技能:給 Claude Code、Codex 及相容 agent 講三種原語、常見模式,以及怎麼設計評測。

  • ai-cli813★有實現

    Vercel Labs 的終端 CLI,可以把它當成 evaluate 命令的評測模型。

  • jev-mcp (jkudish)320★有實現

    MCP 的概念驗證:把決策模型接進支援 MCP 的客戶端。

  • typesafe-mcp292★有實現

    Go 寫的單檔案 MCP 服務端,把型別化判斷暴露給 Claude Desktop、Claude Code 與 Codex。

  • System One adapter (Python)287★有實現

    官方的直替介面卡:把客戶端換掉,背後接 OpenAI、Anthropic 或相容的大模型介面 —— 用來把決策模型和聊天模型放在同一套評測裡比。

  • TypeSafe JavaScript SDK232★有實現

    官方 JS/TS 客戶端,回傳值的型別是推斷出來的。

  • TypeSafe Python SDK220★有實現

    官方 Python 客戶端,同步與非同步兩套。

應用與實驗

直接做成一件事給人用的:交易、檢索、寫作、給想法判死刑。

  • jev-trader2,240★有實現

    在 Monad 的每個區塊上做一次交易決策。

  • shapeshift491★有實現

    一個會變成你意思的輸入框:隨著你打字,這個文本框長成合適的介面。可以離線跑。

  • JevRev304★有實現

    一個「大模型 + 決策模型」的工作流。(公開描述只有這一句,沒有更具體的說明。)

  • jev-align (Sutro)284★有實現

    用主動學習改進判斷定義:拿人工標註當反饋,用 GEPA 把「怎麼問」迭代得更好。

  • killmyidea159★有實現

    描述你的創業想法,它來判斷:砍掉、修一修、還是可以開做。

  • jev-trade131★有實現

    在 Hyperliquid 上實盤跑的決策交易。