TypeSafe AI 的 Jev:最新动态、工作原理及替代方案 (2026)

今年发布的大多数模型都在追求“做得更多”。而这一次,则是刻意追求“做得更少”。
TypeSafe AI 发布了一款不聊天、不写作、也不自我解释的模型。它只用类型化数值和概率来回答问题。这就是该产品的全部功能界面。
本指南将介绍该模型是什么,以及它的三种问题类型是如何工作的。此外,还将涵盖定价、厂商自认的短板,以及它在大多数团队的实际工作流中所处的位置。
发布了什么
Jev 是 TypeSafe 的旗舰模型。根据厂商的官方文档,它也是“首个 System One 模型”。
这一概念源于对该领域其他模型运作方式的抱怨。文档指出,大型语言模型“旨在生成供人类阅读的文本”。而当你需要一个供代码使用的判断时,“就会产生不匹配”。
文档详细阐述了这种不匹配:你正在“强迫一个文本生成系统输出结构化的决策,然后再将结果解析回你的代码可以依赖的格式”。
现有的替代方案省去了这一往返过程。Jev “根据状态评估类型化问题,并直接返回结构化结果。无需文本生成,无需解析。”
该公司的官方网站将 Jev 置于技术演进的末端。从早期的语言模型,到预训练的 LLM,再到 RLHF 聊天模型,接着是 RLVR 推理模型。现在则是 RLCD,其全称为“用于校准决策的强化学习(reinforcement learning for calibrated decisions)”。
什么是 System One 模型
这个名字是借用来的,文档中也直接说明了这一点。它“源于丹尼尔·卡尼曼(Daniel Kahneman)在其著作《思考,快与慢》(Thinking, Fast and Slow)中普及的概念”。
系统 1(System 1)是快速且直觉的。系统 2(System 2)则较慢且深思熟虑。在这里,“重点在于快速、专注的判断”。
其功能定义比这个比喻更为狭窄。这是一类“旨在做出软件可以直接使用的快速、结构化决策的 AI 模型”。此类模型“评估状态并返回类型化答案和概率”。
一句话将 Jev 与市场上其他所有产品区分开来:“与 LLM 一样,System One 模型能够理解自然语言输入。但它返回的是类型化的决策和概率,而不是生成的文本。”
厂商也坦率地说明了其不具备的功能。System One 模型“不编写回复、不生成代码,也不对其推理进行解释”。
三种问题类型
你不需要向 Jev 提示(prompt)。你只需定义一个答案空间,它会在其中进行选择。
它包含三个原语。文档为每个原语都提供了一个示例。
| 原语 | 问题 | 答案空间 | 输出 |
|---|---|---|---|
| Choice | 哪个团队应该处理这张工单? | billing、technical 或 account | choice: "billing" |
| Score | 这位客户有多沮丧? | 0 = 平静,1 = 沮丧,2 = 非常沮丧 | score: 1.4 |
| Noul | 这条消息是否要求退款? | True 或 false | noul: 0.95 |
Choice 从定义的集合中选择一个选项。Score 根据有序且具描述性的级别进行评分。Noul 返回是/否问题为真的概率。
Score 的示例值得再看一遍。答案是 1.4,而不是 1。Jev 将案例定位在两个命名级别之间,而不是直接对齐到最近的一个级别。这与文本模型返回的任何输出形式都不同。
成本与支持的输入
定价页面异常清晰易懂。这在模型发布中并不常见。
当前模型为 jev-1.13.0。价格为每 10 亿 token 42 美元,或每百万 token 0.042 美元。文档明确指出,费用是“按输入 token”收取的,且“输出 token 免费”。
公布的速率限制为每秒 250,000 个 token,每分钟 1,200 次请求。上下文长度为每次请求 64k token。其中,32k 可用于状态加上最长的问题。
输入仅限文本。文档指出,Jev “评估字符串、JSON 对象和文本数组”。并补充道,“(目前)尚不支持图像、音频和视频”。
所有内容都通过单个端点 POST /v1/systemone 运行。model 字段用于选择处理该调用的模型。
| 属性 | 值 |
|---|---|
| 模型 | jev-1.13.0 |
| 价格 | 每 10 亿 token 42 美元 / 每百万 token 0.042 美元,仅限输入 |
| 输出 token | 免费 |
| 速率限制 | 每秒 250,000 个 token;每分钟 1,200 次请求 |
| 上下文 | 每次请求 64k;32k 用于状态加上最长的问题 |
| 输入类型 | 仅限文本 |
置信度是需要关注的部分
定价是头条新闻。而置信度的处理则是更有趣的设计决策。
每个 Choice 和 Score 答案都包含一个跨选项或级别的 probabilities 属性。文档解释了如何解读它:分布“集中在某一个结果上意味着答案是自信的,而分散则意味着不确定”。
另一个独立的 confidence 属性将该分布简化为 0 到 1 之间的一个数字。文档中说明其目的是“以便你无需自己计算即可设置阈值”。
提供该数字背后的逻辑被阐述为一个原则:“如果一个智能系统(无论是人还是机器)无法表达诚实的不确定性,那么这个系统就无法被信任。”
这为你带来的是一条路由规则,而不是更好的答案。高置信度直接通过。低置信度则转交给人工。文档将其描述为决定“何时采取行动,以及何时升级给人工或推理模型”。
任何部署过分类流水线的人都会明白为什么这很重要。决定该系统能否在真实数据中存活下来的,是升级路径,而不是准确率数字。
厂商自认的短板
TypeSafe 发布了一个名为“模型不均匀性(model jaggedness)”的页面,最后评审于 2026-09-17。它列出了该公司已知的失效模式。在发布产品的同时公布这些内容实属罕见,这省去了大家猜测的环节。
总结语非常坦率。Jev 1.13 “速度快、经过校准,且擅长常识性判断,但它并不完美”。
文中直接指出了三个弱点:它“在处理需要额外间接层级的任务时可能会感到吃力”;它“在理解上可能非常字面化”;以及它“在处理需要数值精度的任务时表现不佳”。
失效模式表为每种情况都配有补救措施。对于任何正在评估试点项目的人来说,其中两点值得重申。
- 对于数学和数字,文档建议是“将算术保留在代码中”。
- 对于包含大量无关细节的庞大状态,建议是“先过滤;只发送问题需要的内容”。
这两点都指向同一个设计假设。这是一个判断引擎,既不是计算器,也不是搜索索引。当周边系统已经缩小了问题范围时,它的工作效果最好。
这在您现有的工作流中处于什么位置
厂商自己的示例中隐藏着清晰的分工。明确这一点将决定这次发布是否与您相关。
文档中记录的退款工作流会构建一个状态,并同时提出几个独立的问题。然后,它“通过代码中的确定性检查”结合这些答案,并将案例路由“以执行操作或进行审查”。
其中的每一步都假设有开发人员、应用程序和高请求量。在这一切产生回报之前,每个 token 的成本必须是一个实际的预算项目。
大多数报告工作则是另一种形式。您拥有的是一个文件,而不是请求流。判断是手段,而不是产品。最终需要呈现的是一份供人阅读的文档。
对 4,000 行客户反馈进行分类是该工作的中间环节。而终点是一份命名了三个主题并标记出异常情况的摘要。
后半部分正是“文件优先”工作空间所处理的内容。您上传导出的文件,并用自然语言描述分类。行数据会带上标签返回,解释这些数据的报告也会在同一次处理中生成。Powerdrill Bloom 就是这样工作的,其免费层已经涵盖了基础的幻灯片、文档、表格和图像。
这两者并不是在竞争同一个生态位。一个是您接入产品的 API。另一个则是当有人需要在周四前得到答案时,电子表格该去的地方。如果您的这个问题是以文件形式呈现的,请尝试 Powerdrill Bloom。
对于电子表格端的标签任务版本,可以参考关于分类 Excel 数据的指南。对于寻找主题的版本,这里有一份客户反馈分析工具的汇总。
值得对比的替代方案
三种方法可以解决相同的问题。选择哪一种主要取决于数据量。
具有结构化输出的通用模型。现在每个主流供应商都会将响应限制在特定的 schema 中。您可以使用同一个模型进行判断和生成。代价是为判断工作支付生成的价格,并且需要自己进行校准。
传统分类器。经过微调的小模型或梯度提升树(gradient-boosted tree)成本更低,且完全可预测。前提是您拥有已标记的数据和稳定的标签集。它无法理解用散文体书写的政策。
文件优先的分析工作空间。这些工具将判断作为生成交付物的一个步骤。没有 API,没有 schema,也没有按 token 计费的预算。同样,它们也无法嵌入到请求路径中。
| 如果您的具体情况是 | 请关注 |
|---|---|
| 产品内部有数百万次判断 | 仅限决策的模型 |
| 判断与起草混合,且数据量低 | 具有结构化输出的通用模型 |
| 标签稳定且有充足的训练数据 | 传统分类器 |
| 需要将文件转化为报告 | 文件优先的工作空间 |
关于最后一种情况,有一份相关的报告生成工具汇总。
现在谁应该关注
在产品内部运行高吞吐量判断的团队最适合使用 Jev。工单路由、审核队列、线索评估和资格预审都非常契合。这种模式是每天询问数千次具体的问题,并将其输入到代码的分支中。
将偶尔的分类作为分析一部分的团队则最不适用。在只有几千行数据的情况下,使 Jev 在大规模应用中极具吸引力的经济效益将不复存在。而且,您之后仍然需要其他工具来撰写摘要。
对于其他所有人来说,这更像是一个可以借鉴的词汇表,而不是一个需要采用的工具。将快速判断与慢速综合区分开来,是审视您自身流水线的一个有用视角。无论您是否向此 API 发送过请求,它都同样有用。
给所有评估人员的最后一个实用建议:在看定价页面之前,先阅读不均匀性(jaggedness)页面。了解模型的弱点对塑造试点项目的影响,远比了解其成本要大得多。
常见问题解答
什么是 System One 模型?
这是一类旨在做出软件可以直接使用的快速、结构化决策的模型。它评估状态并返回类型化答案和概率。该名称参考了卡尼曼(Kahneman)的系统 1(System 1),即快速且直觉的思考模式。与聊天模型不同,它不编写回复、不生成代码,也不解释其推理过程。
Jev 的费用是多少?
公布的 jev-1.13.0 价格为每 10 亿 token 42 美元,或每百万 token 0.042 美元。仅对输入 token 计费,输出 token 免费。
Jev 可以接受什么作为输入?
仅限文本,格式为字符串、JSON 对象或文本数组。文档指出,目前尚不支持图像、音频和视频。每次请求的上下文为 64k token,其中 32k 用于状态加上最长的问题。
这与向 LLM 请求 JSON 有何不同?
两者都能理解自然语言输入。区别在于返回的内容以及训练方式。Jev 返回带有概率分布和置信度值的类型化决策。校准是在一组预测中进行衡量的,因此它不保证任何单个答案都是正确的。
Jev 不擅长什么?
厂商的不均匀性(jaggedness)页面列出了字面化阅读、数学和数字,以及日期和时间对比。它还列出了间接性、包含大量无关细节的庞大状态、对抗性内容以及相互矛盾的标准。文档中针对算术情况的建议是将算术保留在代码中。
来源: TypeSafe AI 文档 —— 介绍(Introduction)、System One、模型(Models)、置信度(Confidence)以及 Jev 1.13 不均匀性(jaggedness),docs.typesafe.ai,截至 2026 年 9 月 18 日。