项目清单
60 个项目,按「你要解决什么」分类。每条一句话,附 star 数与快照日期。
每一行怎么读
- star 数反映的是热度和使用量,不是质量;数字旁的日期是它取值的那天。
- 证据档(可复算 / 有实现)回答的是「有多少东西可以查」,不是好不好。 一个只有几行代码但公布了原始结果的项目,和一个功能全面但数字全出自作者之手的项目, 会落在不同档位上 —— 那和它们有没有用无关。
60 个项目。star 数为 2026-09-24 的取值。
- 可复算
- 公布了原始产物、数据集或可重跑的评测
- 有实现
- 代码可读、有测试;数字出自作者自己
界面与浏览器
每一步都在点东西的场景。判断便宜,所以可以每步都问一次。
Jev Ultrafast19,456★有实现
browser-use 的超快 agent:决策模型在一次请求里同时挑出操作与 DOM 元素,只有在需要输入文字时才动用一个小模型。
jev-chat-jarvis5,561★有实现
手机上的对话副驾:在微信 / QQ / X / 飞书里读懂对方,给出候选回复并填进输入框,发不发由你。只读屏幕,不 hook 也不改包。
typesafe-computer-use937★有实现
macOS 上的计算机操作:截图做 OCR、用决策模型分类下一步动作、点击。作者报每步约 $0.0002。
hermes-jev-skills726★有实现
给 Hermes agent 用的一套技能:模型路由、记忆、上下文压缩、技能选择、计算机与浏览器操作,也都装得上 Claude Code 和 Codex。
jev-browser-use453★有实现
「决策模型点、Codex 想与验」的分工,作者报浏览器操作快 5–10 倍。
typesafe-mario383★有实现
玩超级玛丽的 agent —— 输入不是画面像素,而是模拟器给出的结构化状态。
mobile-jev380★有实现
安卓上独立的 agent:每一步都由决策模型做,另有一个实时的工作室界面显示决策遥测。
jev-chat-jarvis-mac346★有实现
微信消息的意图识别悬浮窗(macOS):看屏 + 本地小模型判断意图与风险,再按话术生成回复候选。纯只读,不注入微信。
jev-voice-browser271★有实现
用语音控制真实浏览器:每说出一个词,约 300 ms 内定出意图与目标元素,再由 Playwright 执行 —— 往往在你把话说完之前动作就已经发出去了。
jev-browser257★有实现
用决策模型驱动浏览器操作。
unclutter227★有实现
浏览器扩展:用决策模型判断页面上哪些是杂物并去掉,规则可以存成模板复用。
embodied-jev221★有实现
MuJoCo 里的机器人决策工作台。
jev-drone170★有实现
MuJoCo 里只用摄像头的自主无人机,判断环节以 2.5 Hz 跑。
给 agent 装刹车
编码 agent 的第二层判断:要不要放行、做完了没有、上下文里哪些还留着。
fast-jev-compaction6,653★有实现
Claude Code 插件:把「压缩成摘要」换成「逐条打分」—— 一次请求里给每个工具调用与结果判「还需要吗」,过期的丢掉或截断,留下的逐字保留。
foreman540★有实现
agent 监工:用决策判断把编码 agent 拉回任务上。
JevHarness191★有实现
让大模型为具体任务写出一个决策 harness,可选地对整条轨迹做奖励反思并用 GEPA 演化。
jev-dsh-decision163★有实现
面向 agent harness 的结构化决策插件,原生支持 DeepSeek Harness,通过 iPolloWork 也支持 OpenCode、Codex Harness。
jev-pruner144★有实现
Claude Code 插件:在模型看到之前就把冗长的 Bash 输出裁掉。
pi-jev (y0usaf)144★有实现
给 Pi 编码 agent 的决策层:一个测过的工具调用门,外加一个
jev_ask拿类型化、带校准的答案。pi-warden138★有实现
给 Pi 的护栏,取向是引导而不是打断:判不可逆与跑偏的工具调用、发现卡住的循环、检查「说做完了但其实没验证」,全部由决策模型来做。
building-with-jev-skill131★有实现
一个技能:教你怎么写、怎么改那些调用决策模型的程序。
路由、检索与代码审查
决定「谁来处理这件事」,或者从一堆候选里挑出该看的那些。
jev-review (devagrawal09)586★有实现
分阶段的代码审查工作流,带一个本地看板。
jev-search446★有实现
用决策模型做网页搜索:选源、理解查询、相关性排序。
jev-router (gargpratyush)377★有实现
让决策模型在候选里选一个,把 Claude Code 的任务路由到够用且最便宜的模型上。
pg-jev329★有实现
PostgreSQL 扩展:用平白的语言问你的表。
jev-codex-router263★有实现
Codex 的逐轮路由:每一轮都重新决定用哪个模型、思考深度和速度模式。
jev-review (NiazMorshed2007)218★有实现
local-first 的 MCP 插件:让编码 agent 持续做软件质量审查。
notra215★有实现
营销分析平台:把一个「品牌曝光分类器」从大模型迁到决策模型的布尔判断上,由 feature flag 控制切换。
JevRouter190★有实现
轻量路由:模型、工具、子 agent 三个都可以由它来选。
perch171★有实现
命令行工具:把仓库解析成方法级调用图,再让决策模型标出可能的缺陷、并检查用白话写的项目规则。
jev-semgrep134★有实现
按意思而不是按模式搜索:给每一行打一个「像不像这个意思」的分,再用 AND / OR / NOT 组合多个意思。
neo4jev129★有实现
在 Neo4j 图上一跳一跳地走:对候选的每条出边做一次分类,用 beam search 在答案的 log 概率上搜索。
本地与开放替代
同一套 HTTP 接口下的开放权重与本地运行时。
SemIf4,162★可复算
在自家一张 3090 上跑语义 if:把开源模型改造成决策模型。独立项目,与官方无关。
NanoJev2,159★可复算
0.6B 的复刻:并行决策、候选可变,不生成任何 token,训练流水线一并放出。
jevlike1,279★可复算
训练一个小模型:在会变长变短的选项列表里选一个,一次前向给每个选项一个概率。附带 Doom、国际象棋、Wikispeedia 三个演示。
von610★可复算
395M 的非自回归模型,15 ms 以内给出类型化答案与校准概率,定位是本地直替。
simple-jev507★可复算
把任意开源模型变成分类器,或者变成一个兼容端点。
AnyJev440★可复算
把任意大模型变成决策模型:从下一个 token 的 prefill 分布里读类型化答案与校准概率,不需要训练。
openjev386★可复算
开源的兼容决策服务端,架在 DiffusionGemma 上。
decider351★可复算
基于一个 2B 模型微调:一次前向给出类型化判断与校准概率。
LLM2Jev300★可复算
把本地模型改造成兼容的结构化决策引擎,三种原语的输出全靠 prefill-only 的二值推断得到。
agent-jev286★可复算
0.6B 的复刻,专给 agent 用:把 diff、trace、日志这类非结构化状态喂进去,一次约 50 ms 的前向换回概率分布,不产生输出 token。
openJev-verdict-2.0283★可复算
151M 的非自回归决策引擎,作者报在公开榜单上同时超过官方模型与 Laya:77.10% 准确率、0.0636 Brier、0.0144 ECE。
jev-visual271★可复算
在 Apple Silicon 上做的教学性实验:共享上下文、直接给候选打分,带本地可视化演示。
jeff238★可复算
自托管的替代实现。
reflex133★可复算
一个小型的开放决策模型:状态加类型化问题,换回校准概率。
接入与 SDK
让判断变成你语言里的普通控制流,或者接进你已经在用的框架。含官方 SDK。
eve5,342★有实现
Vercel 的开放 agent 框架:在它实验性的 evaluate 路径里,把决策模型作为默认的评测模型。
TypeSafe agent skills2,060★有实现
官方技能:给 Claude Code、Codex 及兼容 agent 讲三种原语、常见模式,以及怎么设计评测。
ai-cli813★有实现
Vercel Labs 的终端 CLI,可以把它当成
evaluate命令的评测模型。jev-mcp (jkudish)320★有实现
MCP 的概念验证:把决策模型接进支持 MCP 的客户端。
typesafe-mcp292★有实现
Go 写的单文件 MCP 服务端,把类型化判断暴露给 Claude Desktop、Claude Code 与 Codex。
System One adapter (Python)287★有实现
官方的直替适配器:把客户端换掉,背后接 OpenAI、Anthropic 或兼容的大模型接口 —— 用来把决策模型和聊天模型放在同一套评测里比。
TypeSafe JavaScript SDK232★有实现
官方 JS/TS 客户端,返回值的类型是推断出来的。
TypeSafe Python SDK220★有实现
官方 Python 客户端,同步与异步两套。
应用与实验
直接做成一件事给人用的:交易、检索、写作、给想法判死刑。
jev-trader2,240★有实现
在 Monad 的每个区块上做一次交易决策。
shapeshift491★有实现
一个会变成你意思的输入框:随着你打字,这个文本框长成合适的界面。可以离线跑。
JevRev304★有实现
一个「大模型 + 决策模型」的工作流。(公开描述只有这一句,没有更具体的说明。)
jev-align (Sutro)284★有实现
用主动学习改进判断定义:拿人工标注当反馈,用 GEPA 把「怎么问」迭代得更好。
killmyidea159★有实现
描述你的创业想法,它来判断:砍掉、修一修、还是可以开做。
jev-trade131★有实现
在 Hyperliquid 上实盘跑的决策交易。