Jev 深度解析:不生成文本的 System 1 快思考模型,一次前向传播 70ms 出答、输出免费、零类型错误
TypeSafe AI 发布的 Jev 是一类不走自回归路线的 System 1 快思考模型:不生成任何文本,只对预定义的结构化问题返回类型安全的答案与校准概率,提供 Noul(布尔)、Choice(选择)、Score(打分)三种原语。单次前向传播带来 70–500ms 端到端延迟,输入 $0.042/百万 token、输出免费,官方称比 LLM 最多快 193.6 倍、便宜 444.6 倍。本文拆解其命名由来与 RLCD 训练法、零幻觉的真实含义(schema 结构性保证而非零错误)、发布一周内的生态爆发(Vercel、Browser Use、OpenRouter 集成与社区开源复现)与冷水清单(扑克实测翻车、中文场景存疑、闭源且性能数据自报),并给出工单分类、内容审核预筛、Agent 动作选择、置信度分流等适合当下试水的高频小额结构化判断场景。
2026 年 9 月 15 日,一家名叫 TypeSafe AI 的公司在 Hacker Night 上发了篇博文。三天后,帖子冲到 1863 分、491 条评论,登顶 Hacker News;一周之内,Vercel、Browser Use 相继官宣集成,OpenRouter 火速上架。主角是一个叫 Jev 的模型,它的卖点听起来像段子:
- 不生成任何文本,只输出"选择 + 置信度"
- 输出 token 免费,输入 $0.042 / 百万 token
- 端到端延迟 70–500ms,官方口径比 LLM 快最多 193.6 倍、便宜 444.6 倍
- "零幻觉"——类型错误在数学上不可能发生
本文数据截至 2026-09-23。Jev 发布刚满一周,仍处早期访问阶段,性能数字基本来自官方自报,下文会逐条标注水分。
一句话说清 Jev 是什么
Jev 是一个"快思考"模型:你发给它一段状态(state)和几个预先定义好的结构化问题,它回给你类型安全的答案,外加一个校准过的概率。
它不做对话、不写代码、不写解释。关键认知是:这不是"加了输出限制的 LLM",而是一类新模型。创始人在 HN 评论区(ID:CompleteSkeptic)的原话翻译过来是:它技术上甚至不是一个语言模型——因为它不生成语言。
名字里藏着两个梗
- 《思考,快与慢》:卡尼曼把人的思维分成 System 1(快、直觉、廉价)和 System 2(慢、深沉、昂贵)。LLM 是典型的 System 2——逐 token 推理;Jev 想做 AI 的 System 1。
- 杰文斯悖论(Jevons Paradox):19 世纪经济学家 Jevons 发现,蒸汽机效率越高、煤耗越低,煤炭消耗总量反而爆发式增长。TypeSafe 赌的就是这个:智能越便宜,用例越爆发。
顺带一提背景:TypeSafe AI 创始人 Diogo Almeida 是前 OpenAI 研究员,参与过 ChatGPT 的核心训练方法。发布当天他本人在 HN 评论区挨个答疑,被网友戏称"最强售后"。
它到底输出什么:三种原语
整个 API 只有三类问题(官方称之为 primitives):
| 原语 | 回答的问题 | 返回 |
|---|---|---|
| Noul(布尔) | 是还是否? | true / false + 概率 |
| Choice(选择) | A、B、C 里选谁? | 选项 + 概率分布(上限 255 个选项) |
| Score(打分) | 这件事多少分? | 数值 + 置信度 |
为什么快:没有自回归
快的原因很朴素——没有自回归。LLM 生成 100 个 token 要跑 100 次前向传播;Jev 对所有问题只跑一次前向,答案直接从概率头读出、并行返回。
输出因此"便宜到不值得计费"(官方原话:too cheap to meter)——输出 token 干脆免费。训练方法官方只给了一个名词:RLCD(校准决策强化学习)。社区从独立复现项目 jevlike(700+ 星)推测其架构是 Transformer encoder + 分类/回归头:每个选项对 state 做注意力池化,经共享打分头出分后 softmax 归一化——这也解释了 255 的选项上限从何而来。官方未确认架构细节。
"零幻觉"是一场文字游戏
官方宣传"0% 类型错误"。注意:这是 schema 匹配的结构性保证,不是实测统计——它不可能吐出类型之外的值(布尔就是布尔,选项列表之外的字它"说"不出来),但它照样会答错。
"零幻觉" ≠ "零错误"。它可能以 0.97 的置信度给你一个错误答案——只是这时概率本身也会相应地告诉你"我不太确定"是否可信,取决于校准质量。把它理解成"带概率的智能 if 语句",比理解成"不会骗人的模型"更准确。
价格与规格速查(截至 9 月下旬)
| 项目 | 数字 | 备注 |
|---|---|---|
| 输入价格 | $0.042 / 百万 token | 即 $42/十亿;官方称比 LLM 便宜 444.6 倍 |
| 输出价格 | 免费 | "too cheap to meter" |
| 端到端延迟 | 70–500 ms | 对比 LLM 的 3–329 s |
| 模型版本 | jev-1.13.0(别名 jev-latest) | 64k 上下文,仅文本输入 |
| 限速 | 25 万 token/s · 1200 请求/分钟 | 早期访问额度 |
| 接口 | POST /v1/systemone | ⚠️ 不是 OpenAI 兼容接口 |
特别提醒最后一行:Jev 的端点不是 /v1/chat/completions,所以"改个 base_url 就能用"的中转玩法在这里不成立。目前唯一的第三方通道是 OpenRouter(typesafe/jev-1.13,9 月 18 日上架)。
原生 HTTP 调用长这样,一个端点走天下:
curl https://api.typesafe.ai/v1/systemone \
-H "Authorization: Bearer $TYPESAFE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "jev-latest",
"state": "客户:我上周的订单还没发货,到底什么时候处理?我已经等不下去了。",
"questions": {
"is_urgent": {
"type": "noul",
"instructions": "这条消息是否紧急、需要立即处理?"
},
"department": {
"type": "choice",
"instructions": "这条工单应该由哪个团队处理?",
"criteria": {
"billing": "账单退款",
"technical": "产品故障",
"sales": "售前咨询"
}
}
}
}'
返回体固定三块:model(实际应答的版本)、answers(按你传的键回填的答案)、usage(token 用量)。不想写 HTTP 的话,Vercel AI SDK 7.0.105+ 已内置实验性 API experimental_evaluate,Jev 是第一个原生接入的模型——这套接口明牌是给"System One"这类模型铺路的。
生态爆发的一周
- Browser Use 官方集成 jev-ultrafast(2 天 2700+ 星):把浏览器 agent 的动作空间做成"操作 + 目标"两组 choice 问题,一次网络往返出两个决策,全程无截图。实测 Google Flights 完整搜一遍苏黎世→伦敦机票只要 7.1 秒(含页面加载等待)。
- Vercel AI Gateway 上架 Jev,
experimental_evaluate一行接入。 - 独立复现 jevlike(700+ 星):开源社区三天就拼出了同形架构。
- Claude Code 上下文压缩插件 fast-jev-compaction:拿 Jev 判断"哪些历史消息可以压掉"。
- Sean Goedecke 的评价被广泛引用:Jev 让 structured output 这件事"重新变得有趣了"。
泼冷水时间
- 扑克桌上是条鱼:有博主拿它实测德州扑克,被职业选手教育。复杂博弈、长链推理不是它的菜。
- 官方自己承认的局限:速度评测是在美西一台笔记本上跑的;性能对比基线偏向 OpenAI 与 Anthropic 的模型;"0% 类型错误"是结构性保证而非实测;业务工作流评测的用例是 TypeSafe 自己团队写的,加速数字是"真实世界收益的上限值"。
- 中文场景存疑:官方只说非英语"会更低",低多少没人独立测过。
- 闭源 + 护城河存疑:架构被社区三天逆向出同形复现,唯一壁垒可能只剩 RLCD 的校准数据和工程打磨。
什么场景值得现在就用
答案藏在它的产品形状里:高频、小额、结构化的判断点。
- 工单分类 / 客服路由:一条消息进来,70ms 内判断紧急与否、该派哪个团队
- 内容审核预筛:高置信直接放行或拒绝,低置信转人工
- Agent 动作选择:Browser Use 模式——把动作空间编码成 choice 问题
- 置信度分流:
P ≥ 0.9自动执行,P < 0.9转人工,把"要不要人管"变成一行 if
写在最后
引用 Nelson Elhage 那句被反复提及的话:快的软件不是把旧事干得更快,而是催生全新的任务。
当"往任意决策点注入一次 100ms、一厘钱的智能判断"变成一个 API 调用,大量以前不值得做的程序会变得值得做——每条日志、每个事件、每次点击都配上一个带概率的判断,这在 LLM 的价格体系里是不可想象的。这是大家把它叫做"新的计算原语"而不是"新模型"的原因。
但请记住它只是 v1:闭源、只有文本输入、置信度需要自己按业务校准、所有性能数据自报。现在适合做的,是拿边缘场景试水;不适合做的,是把核心链路押上去。
参考链接
- 官方发布:typesafe.ai/blog/introducing-system-one-models-and-jev
- HN 讨论帖(含创始人答疑):news.ycombinator.com/item?id=49717558
- 官方文档与原语:docs.typesafe.ai/primitives
- OpenRouter:openrouter.ai(搜索 typesafe/jev)
- Browser Use 集成:github.com/browser-use/jev-ultrafast
- 独立复现:github.com/vinnylarouge/jevlike
- 扑克实测(泼冷水向):backnotprop.com/blog/jev-poker
- Sean Goedecke 分析:seangoedecke.com/jev-means-structured-output-is-interesting-again

参与讨论
评论