文档导航

项目清单

60 个项目,按「你要解决什么」分类。每条一句话,附 star 数与快照日期。

每一行怎么读

  • star 数反映的是热度和使用量,不是质量;数字旁的日期是它取值的那天。
  • 证据档(可复算 / 有实现)回答的是「有多少东西可以查」,不是好不好。 一个只有几行代码但公布了原始结果的项目,和一个功能全面但数字全出自作者之手的项目, 会落在不同档位上 —— 那和它们有没有用无关。

60 个项目。star 数为 2026-09-24 的取值。

可复算
公布了原始产物、数据集或可重跑的评测
有实现
代码可读、有测试;数字出自作者自己

界面与浏览器

每一步都在点东西的场景。判断便宜,所以可以每步都问一次。

  • Jev Ultrafast19,456★有实现

    browser-use 的超快 agent:决策模型在一次请求里同时挑出操作与 DOM 元素,只有在需要输入文字时才动用一个小模型。

  • jev-chat-jarvis5,561★有实现

    手机上的对话副驾:在微信 / QQ / X / 飞书里读懂对方,给出候选回复并填进输入框,发不发由你。只读屏幕,不 hook 也不改包。

  • typesafe-computer-use937★有实现

    macOS 上的计算机操作:截图做 OCR、用决策模型分类下一步动作、点击。作者报每步约 $0.0002。

  • hermes-jev-skills726★有实现

    给 Hermes agent 用的一套技能:模型路由、记忆、上下文压缩、技能选择、计算机与浏览器操作,也都装得上 Claude Code 和 Codex。

  • jev-browser-use453★有实现

    「决策模型点、Codex 想与验」的分工,作者报浏览器操作快 5–10 倍。

  • typesafe-mario383★有实现

    玩超级玛丽的 agent —— 输入不是画面像素,而是模拟器给出的结构化状态。

  • mobile-jev380★有实现

    安卓上独立的 agent:每一步都由决策模型做,另有一个实时的工作室界面显示决策遥测。

  • jev-chat-jarvis-mac346★有实现

    微信消息的意图识别悬浮窗(macOS):看屏 + 本地小模型判断意图与风险,再按话术生成回复候选。纯只读,不注入微信。

  • jev-voice-browser271★有实现

    用语音控制真实浏览器:每说出一个词,约 300 ms 内定出意图与目标元素,再由 Playwright 执行 —— 往往在你把话说完之前动作就已经发出去了。

  • jev-browser257★有实现

    用决策模型驱动浏览器操作。

  • unclutter227★有实现

    浏览器扩展:用决策模型判断页面上哪些是杂物并去掉,规则可以存成模板复用。

  • embodied-jev221★有实现

    MuJoCo 里的机器人决策工作台。

  • jev-drone170★有实现

    MuJoCo 里只用摄像头的自主无人机,判断环节以 2.5 Hz 跑。

给 agent 装刹车

编码 agent 的第二层判断:要不要放行、做完了没有、上下文里哪些还留着。

  • fast-jev-compaction6,653★有实现

    Claude Code 插件:把「压缩成摘要」换成「逐条打分」—— 一次请求里给每个工具调用与结果判「还需要吗」,过期的丢掉或截断,留下的逐字保留。

  • foreman540★有实现

    agent 监工:用决策判断把编码 agent 拉回任务上。

  • JevHarness191★有实现

    让大模型为具体任务写出一个决策 harness,可选地对整条轨迹做奖励反思并用 GEPA 演化。

  • jev-dsh-decision163★有实现

    面向 agent harness 的结构化决策插件,原生支持 DeepSeek Harness,通过 iPolloWork 也支持 OpenCode、Codex Harness。

  • jev-pruner144★有实现

    Claude Code 插件:在模型看到之前就把冗长的 Bash 输出裁掉。

  • pi-jev (y0usaf)144★有实现

    给 Pi 编码 agent 的决策层:一个测过的工具调用门,外加一个 jev_ask 拿类型化、带校准的答案。

  • pi-warden138★有实现

    给 Pi 的护栏,取向是引导而不是打断:判不可逆与跑偏的工具调用、发现卡住的循环、检查「说做完了但其实没验证」,全部由决策模型来做。

  • building-with-jev-skill131★有实现

    一个技能:教你怎么写、怎么改那些调用决策模型的程序。

路由、检索与代码审查

决定「谁来处理这件事」,或者从一堆候选里挑出该看的那些。

  • jev-review (devagrawal09)586★有实现

    分阶段的代码审查工作流,带一个本地看板。

  • jev-search446★有实现

    用决策模型做网页搜索:选源、理解查询、相关性排序。

  • jev-router (gargpratyush)377★有实现

    让决策模型在候选里选一个,把 Claude Code 的任务路由到够用且最便宜的模型上。

  • pg-jev329★有实现

    PostgreSQL 扩展:用平白的语言问你的表。

  • jev-codex-router263★有实现

    Codex 的逐轮路由:每一轮都重新决定用哪个模型、思考深度和速度模式。

  • jev-review (NiazMorshed2007)218★有实现

    local-first 的 MCP 插件:让编码 agent 持续做软件质量审查。

  • notra215★有实现

    营销分析平台:把一个「品牌曝光分类器」从大模型迁到决策模型的布尔判断上,由 feature flag 控制切换。

  • JevRouter190★有实现

    轻量路由:模型、工具、子 agent 三个都可以由它来选。

  • perch171★有实现

    命令行工具:把仓库解析成方法级调用图,再让决策模型标出可能的缺陷、并检查用白话写的项目规则。

  • jev-semgrep134★有实现

    按意思而不是按模式搜索:给每一行打一个「像不像这个意思」的分,再用 AND / OR / NOT 组合多个意思。

  • neo4jev129★有实现

    在 Neo4j 图上一跳一跳地走:对候选的每条出边做一次分类,用 beam search 在答案的 log 概率上搜索。

本地与开放替代

同一套 HTTP 接口下的开放权重与本地运行时。

  • SemIf4,162★可复算

    在自家一张 3090 上跑语义 if:把开源模型改造成决策模型。独立项目,与官方无关。

  • NanoJev2,159★可复算

    0.6B 的复刻:并行决策、候选可变,不生成任何 token,训练流水线一并放出。

  • jevlike1,279★可复算

    训练一个小模型:在会变长变短的选项列表里选一个,一次前向给每个选项一个概率。附带 Doom、国际象棋、Wikispeedia 三个演示。

  • von610★可复算

    395M 的非自回归模型,15 ms 以内给出类型化答案与校准概率,定位是本地直替。

  • simple-jev507★可复算

    把任意开源模型变成分类器,或者变成一个兼容端点。

  • AnyJev440★可复算

    把任意大模型变成决策模型:从下一个 token 的 prefill 分布里读类型化答案与校准概率,不需要训练。

  • openjev386★可复算

    开源的兼容决策服务端,架在 DiffusionGemma 上。

  • decider351★可复算

    基于一个 2B 模型微调:一次前向给出类型化判断与校准概率。

  • LLM2Jev300★可复算

    把本地模型改造成兼容的结构化决策引擎,三种原语的输出全靠 prefill-only 的二值推断得到。

  • agent-jev286★可复算

    0.6B 的复刻,专给 agent 用:把 diff、trace、日志这类非结构化状态喂进去,一次约 50 ms 的前向换回概率分布,不产生输出 token。

  • openJev-verdict-2.0283★可复算

    151M 的非自回归决策引擎,作者报在公开榜单上同时超过官方模型与 Laya:77.10% 准确率、0.0636 Brier、0.0144 ECE。

  • jev-visual271★可复算

    在 Apple Silicon 上做的教学性实验:共享上下文、直接给候选打分,带本地可视化演示。

  • jeff238★可复算

    自托管的替代实现。

  • reflex133★可复算

    一个小型的开放决策模型:状态加类型化问题,换回校准概率。

接入与 SDK

让判断变成你语言里的普通控制流,或者接进你已经在用的框架。含官方 SDK。

  • eve5,342★有实现

    Vercel 的开放 agent 框架:在它实验性的 evaluate 路径里,把决策模型作为默认的评测模型。

  • TypeSafe agent skills2,060★有实现

    官方技能:给 Claude Code、Codex 及兼容 agent 讲三种原语、常见模式,以及怎么设计评测。

  • ai-cli813★有实现

    Vercel Labs 的终端 CLI,可以把它当成 evaluate 命令的评测模型。

  • jev-mcp (jkudish)320★有实现

    MCP 的概念验证:把决策模型接进支持 MCP 的客户端。

  • typesafe-mcp292★有实现

    Go 写的单文件 MCP 服务端,把类型化判断暴露给 Claude Desktop、Claude Code 与 Codex。

  • System One adapter (Python)287★有实现

    官方的直替适配器:把客户端换掉,背后接 OpenAI、Anthropic 或兼容的大模型接口 —— 用来把决策模型和聊天模型放在同一套评测里比。

  • TypeSafe JavaScript SDK232★有实现

    官方 JS/TS 客户端,返回值的类型是推断出来的。

  • TypeSafe Python SDK220★有实现

    官方 Python 客户端,同步与异步两套。

应用与实验

直接做成一件事给人用的:交易、检索、写作、给想法判死刑。

  • jev-trader2,240★有实现

    在 Monad 的每个区块上做一次交易决策。

  • shapeshift491★有实现

    一个会变成你意思的输入框:随着你打字,这个文本框长成合适的界面。可以离线跑。

  • JevRev304★有实现

    一个「大模型 + 决策模型」的工作流。(公开描述只有这一句,没有更具体的说明。)

  • jev-align (Sutro)284★有实现

    用主动学习改进判断定义:拿人工标注当反馈,用 GEPA 把「怎么问」迭代得更好。

  • killmyidea159★有实现

    描述你的创业想法,它来判断:砍掉、修一修、还是可以开做。

  • jev-trade131★有实现

    在 Hyperliquid 上实盘跑的决策交易。