Jev 实操指南,用概率闸门重构智能体决策流

TypeSafe AI 推出系统一模型 Jev,作为智能体概率决策闸门,仅返回带校准概率的结构化结果而不生成文本。该模型具备低成本、低延迟及零输出错误率特性,支持 Choice、Score、Noul 三种提问原语。文章详解了其 API 调用、SDK 集成及推测式并行、置信度路由等五种落地模式,并指出其本质是强类型函数调用而非廉价 LLM。建议在生产环境中锁定版本、规避算术任务,并通过影子模式实测校准效果。

发布于2026年9月18日 15:22
编辑小创
评论0
阅读2

Jev 实操指南,用概率闸门重构智能体决策流

输入 10 亿 Token 仅需约 42 美元(0.042 美元/百万 Token),端到端延迟低至 70 到 500 毫秒,且输出 Token 完全免费。由 OpenAI 前核心研究员 Diogo Almeida 创立的 TypeSafe AI 近日结束隐身期,正式推出业界首个系统一(System One)模型 Jev。表面看它是一个超低价、高并发的分类器,本质上它是一道为智能体(Agent)量身定制的概率判断闸门——它完全不生成自由文本,只接收预设的问题与类型约束,直接返回带校准概率的结构化决策。

长期以来,开发者在 vibe coding 与智能体工作流中,不得不为了一个二元分支或工单路由,去调用耗时数秒、成本昂贵的生成式大模型,并编写大量防御性代码来解析脆弱的 JSON 字符串。Jev 通过架构设计将结构化输出错误率与工具调用错误率降至 0%,让开发者可以用纯粹的类型化提问重塑整个执行管线。9 月 16 日它已接入 Vercel AI Gateway,模型 ID 为 typesafe-ai/jev

核心提问原语与状态定义

Jev 的 API 摒弃了传统 Chat 接口的消息轮次,其核心端点为 POST https://api.typesafe.ai/v1/systemone。调用时开发者需要向模型传递一个 state(状态文本)以及并行评估的 questions(问题集合)。

state 支持纯字符串、带命名字段的 JSON 对象或代表对话历史的文本数组。它只支持文本,不支持直接输入多媒体内容:


# 字符串状态
state = "My card was charged twice."

# 命名字段对象
state = {"message": "Stripe connect failed", "order_id": "A-104"}

# 对话文本数组
state = ["Hi", "My customer number is TS1337.", "Charged twice."]

Jev 的全部提问逻辑由三个原语组成,它们可以在单次请求中混合提交,所有问题彼此隔离并对同一 state 并行求值:

  1. Choice(多选一):从固定选项中挑出一个,单次最多支持 255 个选项。返回包含选中项 choice、各选项概率分布 probabilities 以及基于分布计算出的 confidence(0 到 1 之间)。给 Choice 增加选项仅消耗少量 Token,因此应直接提供完整候选列表,并显式保留一个 other 选项用于兜底。
  2. Score(等级打分):在 2 到 10 个有序等级上做离散评估。等级索引从 0 开始,返回的 score 支持在等级之间插值(如 1.035),同时附带概率分布与置信度。
  3. Noul(布尔命题判断):针对是非命题直接返回 0 到 1 之间的概率值(.noul 字段)。由于概率本身即代表置信度,Noul 不包含独立的置信度字段。

请求预算是 64k Token(state 与全部问题合计),或 32k Token(state 加单个最长问题)。

快速上手与提问模板编写

Python(需 3.10+)环境下可通过 pip install typesafe-sdkuv add typesafe-sdk 安装 SDK;Node.js(需 Node 20+)环境下运行 npm install @typesafe-ai/sdk。两者均默认读取 TYPESAFE_API_KEY 环境变量,默认模型别名为 jev-latest(当前解析至 jev-1.13.0)。

标准请求与响应结构

使用原始 HTTP 请求处理工单分流的请求体如下:


{
  "state": "Hi, I've been trying to connect my Stripe account for 3 days and it keeps failing. I'm losing sales. Please help ASAP.",
  "model": "jev-latest",
  "questions": {
    "department": {
      "type": "choice",
      "instructions": "Which team should handle this",
      "criteria": {
        "billing": "Payment or subscription issues",
        "technical": "Bugs or integration problems",
        "sales": "Pricing or account questions"
      }
    },
    "frustration": {
      "type": "score",
      "instructions": "How frustrated the customer appears",
      "criteria": [
        "Calm, just stating facts",
        "Frustrated but civil",
        "Very angry, strong language"
      ]
    },
    "is_urgent": {
      "type": "noul",
      "instructions": "The message conveys urgency or time-sensitivity"
    }
  }
}

Jev 返回的响应包含严格的类型与数值。例如 department 字段将返回选中 billing,其概率分布为 {billing: 0.84, technical: 0.159, sales: 0.001},置信度为 0.596

Python 与 TypeScript SDK 实现

在 Python 中调用三种原语的简洁语法如下:


from typesafe_sdk import Choice, Noul, Score, TypeSafeClient

client = TypeSafeClient()
ticket = "I was charged twice. Please fix this ASAP."

response = client.system_one(
    state=ticket,
    questions={
        "department": Choice(
            instructions="Which team should handle this",
            criteria={
                "billing": "Payment or subscription issues",
                "technical": "Bugs or integration problems",
                "other": "Anything else",
            },
        ),
        "is_urgent": Noul(instructions="The message conveys urgency"),
    },
)

print(response.answers["department"].choice)
print(response.answers["is_urgent"].noul)

在 TypeScript 中的实现方式如下:


import { choice, noul, TypeSafeClient } from "@typesafe-ai/sdk";

const client = new TypeSafeClient();

const response = await client.systemOne({
  state: { document: "I was charged twice. Please fix this ASAP." },
  questions: {
    category: choice("What is this ticket about?", {
      billing: "Payment or subscription issues",
      technical: "Bugs or integration problems",
      other: "Anything else",
    }),
    urgent: noul("The message conveys urgency"),
  },
});

编写 criteria 的实战技巧

编写 Jev 的判断标准(criteria)时,核心法则是 “一个问题只问一件具体、范围清晰的事”,模拟专家数秒内的直觉反应。

当选项边界模糊时,将简单的字符串描述升级为结构化对象,明确列出覆盖范围(what)、排除项(not_for)与示例(examples)。模型能够直接识别这些自定义字段:


criteria = {
    "return_policy": {
        "what": "Questions about whether an item can be returned and return rules",
        "not_for": "Tracking status of an already shipped return package",
        "examples": ["Can I return opened software?", "What is the return window?"],
    },
    "return_status": {
        "what": "Tracking status of an already shipped return package",
        "not_for": "Questions about whether an item can be returned",
        "examples": ["Where is my refund for return #1234?"],
    },
}

官方反模式有两条:不要让模型去做代码能精确计算的事,不要在一个问题里藏多个判断。前者对应计数、日期排序这类任务,后者对应“这个候选人怎么样”这类模糊问题——都应该拆开。

顺手把技能包装进编程智能体

如果平时用 Claude Code、Codex 这类工具写代码,可以让它们自己学会用 Jev:


claude plugin marketplace add typesafe-ai/skills
claude plugin install typesafe@typesafe-ai
# 其他智能体改用:
npx skills add typesafe-ai/skills --skill typesafe-ai

官方文档索引在 https://docs.typesafe.ai/llms.txt,里面能翻到重排、语义检索、引用核查、大模型护栏、层级分类、置信度复核等 cookbook。

智能体落地中的五种可复制模式

结合 Jev 极低的时延与计费特性,智能体工程架构可以演化出以下五种经典模式:

1. 推测式并行(Speculative Fan-out)

在 Jev 中,同一个请求内追加第 10 个问题几乎不增加响应耗时,只消耗对应的输入 Token。因此可以颠覆以往“先按分支判断、再按需追问”的串行设计,一次性抛出所有潜在问题,交由后续代码路由决定采纳哪些结果。在官方测试中,对一篇长维基文章一次性并发提交 13 个监管简报问题,相比逐个串行调用,成本降低 12.2 倍,速度提升 10.0 倍,输出答案完全一致。

2. 按置信度分级路由(Confidence-based Gating)

避免全系统共用单一阈值,而是根据“误判代价”针对每个动作独立设限:


dept_ans = response.answers["department"]
urgency = response.answers["is_urgent"].noul

# 兜底:模型自身置信度不足时转人工
if dept_ans.confidence < 0.50:
    route_to_human_agent(ticket)
# 低风险动作:只读查询允许较低置信度放行
elif dept_ans.choice == "billing" and dept_ans.confidence > 0.65:
    query_billing_status()
# 高风险动作:资金操作严格要求高置信度
elif dept_ans.choice == "refund" and dept_ans.confidence > 0.85:
    auto_approve_refund()
else:
    request_user_confirmation()

如果原始概率分布(probabilities)极其扁平,说明当前 state 缺乏足够的区分特征,通常意味着 criteria 需要进一步细化。

3. 复合加权打分(Composite Scoring)

不要直接让模型评估一个宏观模糊的目标(例如“该创业项目是否优质”),而是拆解为多个独立维度的 Score/Noul 问题(如市场规模、技术可行性、产品差异化)。各维度的权重由业务代码控制与计算,业务策略调整时只需修改代码系数,无需重新微调或改写模型提示词。

4. 级联调度(Cascade)

Jev 并不取代生成式大模型,而是充当流量守门员。例如先由 Jev 判定意图与复杂度:查询订单状态直接走传统代码逻辑;常规退换货与复杂咨询分流给不同的大模型;高复杂度且低置信度的请求直接转人工。在官方针对 100 万张工单的成本测算中,级联架构的总体成本约为 6,480 美元,远低于全部直通大模型的 30,400 美元,且约 80 万张工单能在半秒内完成处理。

5. 先检索再过滤

Jev 仅对输入给它的 state 负责,自身不具备联网与外部检索能力。当状态中混入无关冗余信息时,模型的判断准确率会出现下降(即上下文腐化现象)。标准做法是由业务代码完成高精度的精准取数,将清洗后的字段交由 Jev 执行廉价判定。把用户可控内容塞进 state 时还要额外小心:官方明确说过,state 不会被当作敌对内容处理,刻意为自己争取某个分类的文本可以左右答案。

社区构建案例与实测分歧

在 Jev 发布后的 48 小时内,开源社区与开发者涌现出一批原型案例(数据均来自作者自报):

  • 文献规模化分类:利用 DeepSeek V4 Flash 提取摘要(花费 3.99 美元),再由 Jev 结合 24 个候选主题对 1,018 篇论文进行 Choice 分类,Jev 调用仅耗费 0.08 美元,中位端到端延迟为 256 毫秒。
  • 极速浏览器智能体(browser-use/jev-ultrafast):将网页解析为编号元素列表,通过 Jev 一次性判定操作动作与目标元素,仅在遇到自由文本输入时才调用微型 LLM。在 Google Flights 真实订票测试中,苏黎世到伦敦的航线检索与预订仅耗时 7.1 秒,单次成本为 0.0039 美元。设计诀窍是把点击、输入、选择三种目标在同一次往返里全部问出来,只执行匹配的那个。
  • 低成本屏幕操作:通过 OCR 提取屏幕内容并由 Jev 选定下一步动作,12 步任务总成本为 0.003 美元(对比截图调用 Opus 5 的 0.40 到 0.90 美元),模型单步延迟在 0.13 到 0.38 秒之间。作者最重要的提醒是:前沿大模型免费做的那些推理,在这里都要重建成确定性状态,因为分类器不会自己从像素里读出事件日期。
  • 编程智能体的命令闸门(pi-jev-auto-mode):把 Jev 放在 Pi 的 bash / write / edit 调用前面,规则先跑、Jev 不能推翻规则。作者在 18 条真实命令上测出 intent_coverage 呈双峰分布——用户明确要求时落在 0.77 到 0.98,未被要求时落在 0.06 到 0.15,中间 0.15 到 0.77 完全没有样本,于是把阈值放在 0.60 这个空档里。

需要与官方口径分开看的是外部实测。Every 的 Mike Taylor 把 27 篇自己的文章加 10 篇刻意 AI 风格的对照稿,用 21 个问题并行检查 AI 写作痕迹,不到 0.7 秒读完 37 篇文档、返回 777 个判断,估算成本约为四分之一美分;11 个实验共 1,709 个判断、总成本不到一美分。但他同时表示,放进生产之前想要更彻底的准确率核查。Every CEO Dan Shipper 的对照测试更直接:Jev 比 Fable 5.1 快约 25 倍、便宜约 580 倍,但植入的 7 个写作缺陷 Jev 只抓到 6 个,Fable 抓到 7 个。

官方自己的评测也值得如实引用:在 TypeSafe 的四个工作流评测里,Jev 得分 67.8%,与 GPT-5.6 Terra 的 67.9% 持平,低于 Sol 的 74.1% 与 Opus 5 的 73.1%,但成本约为前者的 1/200、延迟约为 1/50。TypeSafe 主动声明这套评测由自己设计并自跑、没有独立复现,所谓“准确率”其实是与 GPT-6 Astra 和 Fable 5.1 平均输出的一致度、没有真实标注,193 倍、444 倍这类极端倍数属于最优情况,并且无法证明当前定价没有补贴。

从传统规则引擎到大模型,再到如今的系统一判断闸门,智能体判断模块的演进对比如下:

阶段核心问题留下的硬伤
规则引擎与正则匹配无法泛化自然语言的语义多样性与模糊表达规则维护成本呈指数上升,极易因句式变动而失效
大语言模型(LLM)调用运行延迟高(秒级至数十秒),调用成本高昂存在 JSON 解析失败风险,输出概率无法直接获取与校准
System One 概率闸门(Jev)无法生成自由文本,长链条推理与数学计算能力较弱依赖高质量检索与清晰 criteria,需业务代码承担上下文组装

避坑指南与工程运维建议

根据官方文档与实测反馈,在落地 Jev 时必须避开以下陷阱:

  1. 严格字面理解:Jev 仅按字面含义执行判断。当你发现模型给出意料之外的答案而试图向他人解释“我原本的意思是……”时,这段解释往往就是指令中遗漏的条件。
  2. 切勿用于计数与算术:模型在纯文本计数上并不准确,且误差会随着样本规模扩大。需要统计数量时,应通过循环对单项发起 Noul 提问,并在代码中完成数值累加。
  3. 日期仅被视为字符串:模型无法可靠计算两个日期之间的先后顺序或时间窗口跨度。提取日期是语义判断,但日期的排序与时间差计算必须交由代码处理。
  4. 警惕上下文污染与输入伪造state 塞入无关背景会导致准确度下滑;同时,若 state 包含不受信的用户输入,恶意构造的文本可能会诱导分类结果,必须在安全边界内进行隔离测试。
  5. 保持 Criteria 与指令一致:避免在 Noul 原语中将肯定语义反向映射到否定逻辑,自相矛盾的标准会直接拉低判断质量。
  6. 它不生成任何东西:没有文本、代码、摘要,也不解释自己的理由。如果需要一个从自由文本里取出的值,先用正则或生成模型产出候选,再让 Jev 来挑。
  7. 生产环境锁定版本jev-latest 会随着底层模型升级而发生行为漂移。若业务已完成阈值微调,应显式锁定具体版本,如 TypeSafeClient(model="jev-1.13.0"),并在日志中记录响应返回的具体 model 字段。
  8. 遵循限流策略jev-1.13 的默认限流为每秒 250,000 Token 及每分钟 1,200 次请求,遇到 429 错误时 SDK 会自动执行指数退避并遵循 retry-after 标识。官方提示这些限流会随 GPU 容量到位而变动,不要写死假设。

综合判断与未解决的问题

Jev 不是一个“更便宜的 LLM”,而是一次具有语义理解能力的强类型函数调用。它并不负责生成代码或撰写长篇摘要,而是作为一道低延迟、确定性的概率闸门,决定系统何时放行、何时介入兜底代码、何时调用昂贵的前沿生成模型。还有一个容易误读的地方:官方说的“不会幻觉”,指的是它不可能输出你 schema 之外的值,一个类型正确的答案仍然可以是错的——这是关于格式的保证,不是关于正确性的保证。

当前仍待解决的核心问题在于:TypeSafe 官方宣称的 RLCD(校准决策强化学习)所带来的“认知诚实概率”(即报 0.95 置信度时对应约 95% 真实准确率)目前缺乏独立的第三方基准复现,官方评测也是基于 GPT-6 Astra 与 Fable 5.1 生成标签的平均一致度得出的。在将 Jev 接入关键业务前,团队应当在生产流量中采用影子模式(Shadow Mode)运行对照,实测自身场景下的真实校准曲线与综合持有成本——毕竟校准这件事,只有在你自己的数据上算出来才算数。

引用来源

  1. TypeSafe AI,《Introducing System One Models and Jev》,2026-09-14,https://typesafe.ai/blog/introducing-system-one-models-and-jev
  2. TypeSafe 官方文档《Quick start》,2026-09,https://docs.typesafe.ai/introduction/quickstart
  3. TypeSafe 官方文档《Choice》原语页,2026-09,https://docs.typesafe.ai/primitives/choice
  4. LangChain Blog,《Building a Harness with Jev》,2026-09-17,https://www.langchain.com/blog/building-a-harness-with-jev
  5. Every,Mike Taylor,《Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds》,2026-09-15,https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds
  6. DEV Community,Valyu,《How to Use Jev: A practical guide to TypeSafe's System One model》,2026-09-17,https://dev.to/valyuai/how-to-use-jev-a-practical-guide-to-typesafes-system-one-model-g5e
  7. DEV Community,Jo Matsuda,《Jev + Pi: a probability gate for my coding agent's shell commands》,2026-09-17,https://dev.to/jomatsu/jev-pi-a-probability-gate-for-my-coding-agents-shell-commands-95d
  8. NYU Shanghai RITS,《TypeSafe AI Launches Jev, a Model That Returns Decisions, Not Text》,2026-09-16,https://rits.shanghai.nyu.edu/ai/typesafe-jev-system-one-model
  9. Vercel AI Gateway 模型页《Jev》(typesafe-ai/jev),2026-09-16,https://vercel.com/ai-gateway/models/jev
  10. Actionbox,《TypeSafe AI Jev Review: How It Works vs LLMs》,2026-09,https://actionbox.cloud/blog/typesafe-ai-jev-review/

相关文章

Anthropic 开源知识工作插件库,111 个无代码技能包重塑智能体工作流
AI 教程知识
2026年9月18日
0 条评论
小创

Anthropic 开源知识工作插件库,111 个无代码技能包重塑智能体工作流

Anthropic 开源 knowledge-work-plugins 项目,提供 111 个无代码智能体技能包。该体系基于 Markdown 和 JSON 构建标准化模块,支持渐进式披露与 MCP 工具集成,标志提示词工程向软件工程化转型。内置 marketing 与 productivity 等插件展示了结构化输入及分层记忆范式,支持语义路由与轻量化定制。尽管存在多插件上下文竞争及云端连接器限制内网访问等问题,仍为智能体工作流提供了可复用的模块化规范。

#智能体#AI工具#提示词工程
阅读全文
把 LLM 当文字编辑而非代写枪手:两条铁律与改稿提示词
智能体工程
2026年9月18日
0 条评论
小创

把 LLM 当文字编辑而非代写枪手:两条铁律与改稿提示词

使用 LLM 辅助写作应将其定位为文字编辑而非代写枪手。核心原则包括绝不采纳模型生成的具体词汇及禁止其提供夸奖,以避免内容同质化。推荐采用“诊断-重写-比对”三阶段改稿流程,利用模型查找语法与逻辑硬伤,但由作者亲自重写。实践中可借助专用提示词库或本地工具提升效率。此外,需警惕长上下文压缩摘要可能引发的指令注入风险。AI 仅是批判性审视的效率放大器,人类创作者必须始终掌握写作主导权。

#AI写作#提示词工程#AI工具
阅读全文
Plugin4Shell 零点击攻破四大编程智能体 SHA 固定
智能体工程
2026年9月18日
0 条评论
小创

Plugin4Shell 零点击攻破四大编程智能体 SHA 固定

安全团队 AIR 披露高危漏洞 Plugin4Shell,影响 Claude Code、Codex 等四大主流 AI 编程智能体。该漏洞利用 Git 分支命名解析歧义绕过 SHA 固定机制,使攻击者可通过插件后台自动更新实现零点击远程代码执行。这是 AI 智能体生态首个分发层供应链漏洞,打破了传统安全审阅的信任假设。目前 Anthropic 和 OpenAI 已修复,Google 建议迁移,Microsoft 尚未发布补丁。开发者需在客户端增加 HEAD 哈希校验以防范风险。

#智能体#AI 编程#安全
阅读全文
互动讨论

评论区

围绕《Jev 实操指南,用概率闸门重构智能体决策流》展开交流,未登录用户可浏览评论,登录后可参与讨论。

评论数
0
登录后参与评论
支持发表观点与回复一级评论,互动后将同步到消息中心。
登录后评论
暂无评论,欢迎成为第一个参与讨论的人。