超級促銷週Claude Skills — 20% 折扣
News

Jev by TypeSafe AI:最新功能、運作原理與替代方案 (2026)

Powerdrill Bloom·
Jev by TypeSafe AI:最新功能、運作原理與替代方案 (2026)

今年大多數的模型發布都是為了能做更多事。而這一個,則是刻意為了做更少事。

TypeSafe AI 發布了一款不會聊天、不會寫作、也不會自我解釋的模型。它只用具備型別的值和機率來回答問題。這就是該產品的全部功能介面。

本指南將介紹這款模型是什麼,以及它的三種問題類型如何運作。同時也會涵蓋價格、開發商表示其不擅長之處,以及它在大多數團隊實際工作中的定位。

發布了什麼

Jev 是 TypeSafe 的旗艦模型。根據開發商的官方文件,它也是「第一個 System One 模型」。

這種定位源於對該領域其他產品運作方式的抱怨。官方文件指出,大型語言模型「旨在產生供人類閱讀的文字」。當你需要一個供程式碼使用的判斷時,「這就會產生不匹配」。

官方文件詳細說明了這種不匹配:你正在「強迫一個文字產生系統輸出結構化的決策,然後再將結果解析回你的程式碼可以依賴的內容」。

這裡提供的替代方案省去了這種來回折騰。Jev「根據狀態評估具備型別的問題,並直接返回結構化結果。沒有文字產生,也沒有解析。」

該公司的網站將 Jev 置於技術演進的末端。早期語言模型,接著是預訓練的 LLM,然後是 RLHF 對話模型,再到 RLVR 推理模型。現在則是 RLCD,其全稱為「用於校準決策的強化學習」(reinforcement learning for calibrated decisions)。

什麼是 System One 模型

這個名稱是借用來的,官方文件也直接指出了這一點。它「源自 Daniel Kahneman 在其著作《快思慢想》(Thinking, Fast and Slow)中推廣的概念」。

System 1 快速且直覺。System 2 較慢且深思熟慮。在這裡,「重點在於快速、專注的判斷」。

功能上的定義比這個比喻更窄。這「是一類旨在做出軟體可以直接使用的快速、結構化決策的 AI 模型」。此類模型「評估狀態並返回具備型別的答案和機率」。

一句話將 Jev 與市場上的其他所有產品區隔開來:「與 LLM 一樣,System One 模型理解自然語言輸入。但它返回的是具備型別的決策和機率,而不是產生的文字。」

開發商也清楚說明了它不具備的功能。System One 模型「不會撰寫回覆、產生程式碼,也不會為其推理過程提供解釋」。

三種問題類型

你不需要對 Jev 進行提示(prompt)。你只需定義一個答案空間,它就會在其中進行選擇。

共有三種基本型態(primitives)。官方文件為每一種都提供了範例。

基本型態問題答案空間輸出
Choice哪一個團隊應該處理這張工單?billingtechnicalaccountchoice: "billing"
Score這位客戶有多沮喪?0 = 冷靜,1 = 沮喪,2 = 非常沮喪score: 1.4
Noul這封訊息是否要求退款?True 或 falsenoul: 0.95

Choice 從定義好的集合中選擇一個選項。Score 根據有序且具描述性的級別進行評分。Noul 則返回「是/否」問題為真的機率。

Score 的範例值得再看一眼。答案是 1.4,而不是 1。Jev 是將案例定位在兩個具名級別之間,而不是直接貼齊到最近的一個。這與任何文字模型返回的輸出形式都不同。

成本與支援的輸入格式

價格頁面異常清晰易懂。這在模型發布的相關報導中並不常見。

目前的模型是 jev-1.13.0。價格為每 10 億個 token $42 美元,或每 100 萬個 token $0.042 美元。官方文件明確指出,費用是「按輸入 token 計算」,且「輸出 token 免費」。

公布的速率限制為每秒 250,000 個 token,以及每分鐘 1,200 次請求。上下文長度為每次請求 64k 個 token。其中,32k 可用於狀態加上最長的問題。

輸入僅限文字。官方文件指出,Jev「評估字串、JSON 物件和文字陣列」。並補充說明「(目前)尚不支援圖片、音訊和影片」。

所有內容都透過單一端點 POST /v1/systemone 運作。model 欄位用於選擇由哪一個模型處理該呼叫。

屬性
Modeljev-1.13.0
價格每 10 億 token $42 美元 / 每 100 萬 token $0.042 美元,僅限輸入
輸出 token免費
速率限制每秒 250,000 個 token;每分鐘 1,200 次請求
上下文每次請求 64k;狀態加上最長問題共 32k
輸入類型僅限文字

信心度是需要關注的部分

價格是主打亮點。但信心度的處理方式則是更有趣的設計決策。

每個 Choice 和 Score 答案都包含一個跨選項或級別的 probabilities 屬性。官方文件解釋了如何解讀它:分佈「集中在單一結果上代表信心度高的答案,分散則代表不確定的答案」。

另一個獨立的 confidence 屬性將該分佈簡化為 0 到 1 之間的單一數字。文件中說明的目的是「以便你可以直接設定門檻值,而無需自己進行數學計算」。

提供該數字背後的原由被闡述為一項原則:「如果一個智慧系統(無論是人還是機器)無法表達誠實的不確定性,那麼該系統就無法被信任。」

這為你帶來的是路由規則,而不是更好的答案。高信心度直接通過。低信心度則轉交給人工處理。官方文件將其描述為決定「何時採取行動,以及何時呈報給人工或推理模型」。

任何部署過分類管道(classification pipeline)的人都明白這為什麼重要。決定這個系統能否在實際資料的考驗下存活下來的,是呈報路徑,而不是準確度數字。

開發商表示其不擅長之處

TypeSafe 發布了一個名為「模型不均勻性」(model jaggedness)的頁面,審查日期為 2026-09-17。它列出了該公司已知的所有失敗模式。在產品發布時同時提供這些資訊非常罕見,這為大家省去了一輪猜測。

總結非常坦率。Jev 1.13「快速、經過校準,且擅長常識性判斷,但它並不完美」。

直接指出了三個缺點:它「在需要額外間接層級的任務中可能會很吃力」;它「在理解上可能非常流於字面意思」;以及它「在需要數值精準度的任務中表現不佳」。

失敗模式表為每一項都配備了解決方案。對於任何正在評估試點專案的人來說,有兩點值得重申:

  • 針對數學和數字,文件中的建議是「將算術保留在程式碼中」。
  • 針對包含大量無關細節的龐大狀態,建議是「先進行篩選;只發送問題所需的內容」。

兩者都指向同一個設計假設。這是一個判斷引擎,不是計算機,也不是搜尋索引。當周邊系統已經縮小了問題範圍時,它的運作效果最好。

這在您現有工作中的定位

開發商自己的範例中隱藏著清晰的分工。明確指出這一點,將決定這次的產品發布是否與您有關。

文件中記載的退款工作流程會建立一個狀態,並同時提出幾個獨立的問題。然後,它「透過程式碼中的確定性檢查」結合這些答案,並將案例分流「以進行採取行動或審查」。

其中的每一步都假設有開發人員、應用程式和高請求量。在獲得回報之前,每個 token 的成本必須是一個實際的預算項目。

大多數的報告工作則是另一種形式。你擁有的是一個檔案,而不是請求串流。判斷只是手段,而不是產品。最終必須存在的是一份供人閱讀的文件。

將四千行客戶回饋進行分類只是該工作的中間步驟。終點是一份命名三個主題並標記異常情況的摘要。

後半部分正是「檔案優先」工作空間所處理的內容。你上傳匯出的檔案,並用自然語言描述類別。資料列會帶著標籤返回,而解釋這些資料的報告也會在同一次處理中產生。Powerdrill Bloom 就是以這種方式運作,且免費方案已涵蓋基本的簡報、文件、試算表和圖片。

這兩者並非在競爭同一個定位。一個是您接入產品的 API。另一個則是當有人需要在週四前得到答案時,試算表該去的地方。如果您的問題是以檔案形式呈現,請嘗試 Powerdrill Bloom

針對試算表端的標記任務,有一份關於如何分類 Excel 資料的逐步教學。針對尋找主題的部分,則有一份客戶回饋分析工具的精選推薦。

值得比較的替代方案

有三種方法可以解決相同的問題。選擇哪一種主要取決於資料量。

具備結構化輸出的通用模型。現在每個主要的供應商都將回覆限制在特定的綱要(schema)中。你得到一個同時用於判斷和產生的模型。代價是為判斷工作支付產生內容的價格,並且需要自己進行校準。

傳統分類器。微調過的小型模型或梯度提升樹(gradient-boosted tree)更便宜,且完全可預測。前提是您擁有已標記的資料和穩定的標籤集。但它無法理解用散文撰寫的政策。

檔案優先的分析工作空間。這些工具將判斷視為產生交付成果中的一個步驟。沒有 API、沒有綱要(schema)、沒有每個 token 的預算編列。但也無法嵌入到請求路徑中。

如果您的情況是請參考
產品內有數百萬次判斷僅限決策的模型
混合判斷與起草,且量少具備結構化輸出的通用模型
穩定的標籤和充足的訓練資料傳統分類器
need 轉化為報告的檔案檔案優先的工作空間

有一份關於報告產生工具的相關精選,涵蓋了最後一項。

現在誰應該關注

在產品中執行高量級判斷的團隊最適合使用 Jev。工單路由、審核佇列、潛在客戶資格審查和資格預檢都非常合適。這種模式是每天詢問數千次狹窄的問題,並將結果提供給程式碼中的分支。

將偶爾的分類作為分析一部分的團隊,最不需要考慮此方案。在只有幾千行的情況下,讓 Jev 在大規模應用中極具吸引力的經濟效益將不復存在。而且你之後仍然需要其他工具來撰寫摘要。

對於其他所有人來說,這更像是借用其概念詞彙,而不是採用該工具。將快速判斷與慢速綜合分開,是審視自身工作流程(pipeline)的一個實用視角。無論您是否曾向此 API 發送過請求,它都依然實用。

給任何正在評估的人另一個實用建議:在看價格頁面之前,先閱讀不均勻性(jaggedness)頁面。了解模型的弱點,比了解其成本更能決定試點專案的成敗。

常見問題

什麼是 System One 模型?

它是一類旨在做出軟體可以直接使用的快速、結構化決策的模型。它評估狀態並返回具備型別的答案和機率。該名稱參考了 Kahneman 的 System 1,即快速且直覺的思考模式。與對話模型不同,它不會撰寫回覆、產生程式碼,也不會解釋其推理過程。

Jev 的費用是多少?

公布的 jev-1.13.0 價格為每 10 億個 token $42 美元,或每 100 萬個 token $0.042 美元。僅針對輸入 token 收費,輸出 token 免費。

Jev 可以接受什麼作為輸入?

僅限文字,格式為字串、JSON 物件或文字陣列。官方文件指出,目前尚不支援圖片、音訊和影片。上下文長度為每次請求 64k 個 token,其中 32k 用於狀態加上最長的問題。

這與向 LLM 要求 JSON 有何不同?

兩者都能理解自然語言輸入。不同之處在於返回的內容以及訓練方式。Jev 返回帶有機率分佈和信心值的具備型別決策。校準是跨預測組進行衡量的,因此它不保證任何單一答案都是正確的。

Jev 不擅長什麼?

開發商的不均勻性(jaggedness)頁面列出了字面閱讀、數學和數字,以及日期和時間比較。它還列出了間接性、包含大量無關細節的龐大狀態、對抗性內容和矛盾的標準。針對算術情況,文件中給出的建議是將算術保留在程式碼中。

來源:TypeSafe AI 官方文件 — Introduction、System One、Models、Confidence 以及 Jev 1.13 jaggedness,docs.typesafe.ai,截至 2026 年 9 月 18 日。