スーパーセールウィークClaude Skills — 20% OFF
News

TypeSafe AIのJev:新機能、仕組み、代替ツール (2026)

Powerdrill Bloom·
TypeSafe AIのJev:新機能、仕組み、代替ツール (2026)

今年のモデルリリースの大半は、より多くのことを行うためのものでした。しかし、今回のリリースは意図的に、より少ないことを行うためのものです。

TypeSafe AIは、チャットもせず、文章も書かず、自己説明もしないモデルをリリースしました。型定義された値と確率で質問に答えます。製品のインターフェースはそれだけです。

このガイドでは、このモデルの概要と、3つの質問タイプの仕組みについて解説します。また、価格設定、ベンダーが苦手としていると公言していること、そしてほとんどのチームが実際に抱えている業務においてこのモデルがどのような位置づけになるのかについても説明します。

リリースされたもの

JevはTypeSafeのフラッグシップモデルです。ベンダーの公式ドキュメントによると、これは「初のSystem Oneモデル」でもあります。

この位置づけは、同カテゴリーの他のモデルの仕組みに対する不満から始まっています。ドキュメントによると、大規模言語モデル(LLM)は「人間が読むためのテキストを生成するように設計されています」。コードが処理するための判断が必要な場合、「そこにミスマッチが生じます」。

ドキュメントはそのミスマッチを具体的に説明しています。つまり、「テキスト生成システムに構造化された決定を出力するよう強制し、その結果をコードが依存できる形式にパースし直している」状態です。

提案されている代替案は、この無駄な往復を排除します。Jevは「状態に対して型定義された質問を評価し、構造化された結果を直接返します。テキスト生成もパースも不要です」。

同社のサイトでは、Jevを系譜の最後に位置づけています。初期の言語モデル、事前学習済みLLM、RLHFチャットモデル、RLVR推論モデル。そして現在は、同社が「調整された決定のための強化学習(reinforcement learning for calibrated decisions)」と説明するRLCDです。

System Oneモデルとは何か

この名称は借用されたものであり、ドキュメントでも直接そう述べられています。これは「ダニエル・カーネマンが著書『ファスト&スロー』で普及させた概念に由来しています」。

システム1は速くて直感的です。システム2はより遅く、慎重です。ここでは「迅速で的を絞った判断に重点が置かれています」。

機能的な定義は、この比喩よりも狭いものです。これらは「ソフトウェアが直接利用できる、迅速で構造化された決定を下すために構築されたAIモデルのクラス」です。このようなモデルは「状態を評価し、型定義された回答と確率を返します」。

市場にある他のすべてのものとJevを隔てる境界線は1つです。「LLMと同様に、System Oneモデルは自然言語の入力を理解します。しかし、生成されたテキストではなく、型定義された決定と確率を返します」。

できないことについても、ベンダーによって明確に述べられています。System Oneモデルは「返信を書いたり、コードを生成したり、推論の根拠を説明したりはしません」。

3つの質問タイプ

Jevにプロンプトを入力することはありません。回答スペースを定義すると、Jevはその中から選択します。

3つのプリミティブがあります。ドキュメントにはそれぞれの例が記載されています。

プリミティブ質問回答スペース出力
Choiceどのチームがこのチケットを処理すべきですか?billingtechnical、またはaccountchoice: "billing"
Scoreこの顧客はどの程度不満を抱いていますか?0 = 穏やか、1 = 不満、2 = 非常に不満score: 1.4
Noulこのメッセージは返金を要求していますか?True または falsenoul: 0.95

Choiceは、定義されたセットから1つのオプションを選択します。Scoreは、順序付けられた説明的なレベルに対して評価します。Noulは、はい/いいえの質問が真である確率を返します。

Scoreの例は、もう一度詳しく見る価値があります。回答は1ではなく1.4です。Jevは、最も近いレベルに無理に合わせるのではなく、2つの定義されたレベルの間に事例を位置づけています。これは、テキストモデルが返すどのような出力形式とも異なります。

コストと対応する入力

料金ページは異例なほど分かりやすいものです。モデルのリリースに関して、このようなことが書かれるのは珍しいことです。

現在のモデルはjev-1.13.0です。価格は10億トークンあたり42ドル、または100万トークンあたり0.042ドルです。ドキュメントには、課金は「入力トークンごと」であり、「出力トークンは無料」であることが明記されています。

レート制限は、毎秒250,000トークン、毎分1,200リクエストと公表されています。コンテキスト長は1リクエストあたり64kトークンです。そのうち32kトークンが、状態と最も長い質問のために使用できます。

入力はテキストのみです。ドキュメントには、Jevは「文字列、JSONオブジェクト、およびテキストの配列を評価する」と記載されています。また、「画像、音声、動画は(まだ)サポートされていません」とも付け加えられています。

すべては単一のエンドポイントPOST /v1/systemoneを経由して実行されます。modelフィールドで、どのモデルが呼び出しを処理するかを選択します。

プロパティ
モデルjev-1.13.0
価格10億トークンあたり42ドル / 100万トークンあたり0.042ドル、入力のみ
出力トークン無料
レート制限毎秒250,000トークン、毎分1,200リクエスト
コンテキスト1リクエストあたり64k、状態と最も長い質問に32k
入力タイプテキストのみ

注目すべきは「確信度」

価格設定が大きく取り上げられがちですが、確信度の処理こそがより興味深い設計上の決定です。

ChoiceとScoreのすべての回答には、オプションまたはレベル全体にわたるprobabilities(確率)プロパティが含まれています。ドキュメントでは、そこから何を読み取るべきかが説明されています。分布が「1つの結果に集中している場合は確信度の高い回答を意味し、分散している場合は不確実な回答を意味します」。

独立したconfidence(確信度)プロパティは、その分布の形状を0から1までの単一の数値に集約します。ドキュメントに記載されている目的は、「自分で計算することなく、しきい値を設定できるようにするため」です。

この数値を提示する背後にある理由は、原則として次のように述べられています。「人間であれ機械であれ、知的なシステムが誠実な不確実性を表現できないのであれば、そのシステムは信頼できません」。

これによって得られるのは、より優れた回答というよりも、ルーティングルールです。確信度が高いものはそのまま処理されます。確信度が低いものは人間に送られます。ドキュメントでは、これを「いつ実行し、いつ人間や推論モデルにエスカレーションするか」を決定するものとして位置づけています。

分類パイプラインを本番環境に導入したことがある人なら、なぜこれが重要なのか理解できるはずです。精度という数値ではなく、エスカレーションパスこそが、そのシステムが実際のデータに直面したときに生き残れるかどうかを決定するのです。

ベンダーが苦手としていると公言していること

TypeSafeは、2026-09-17にレビューされた「モデルのギザギザ(model jaggedness)」と呼ばれるページを公開しています。そこには、同社が把握している失敗パターンがリストアップされています。リリースのタイミングでこのような情報を公開することは稀であり、これによって誰もが無駄な推測をする手間を省くことができます。

要約は率直です。Jev 1.13は「高速で、調整されており、常識的な判断に優れていますが、完璧ではありません」。

3つの弱点が直接挙げられています。「さらなる段階の間接性を必要とするタスクに苦戦する可能性があります」。「理解が非常に文字通り(直訳的)になることがあります」。そして「数値的な精度を必要とするタスクに苦戦します」。

失敗パターンの表には、それぞれに対策がペアで記載されています。パイロット導入を検討している人にとって、そのうちの2つは繰り返す価値があります。

  • 数学や数値については、ドキュメントに記載されているアドバイスは「算術演算はコード内に留める」ことです。
  • 無関係な詳細が詰まった大規模な状態については、「最初にフィルタリングし、質問に必要なものだけを送信する」ことです。

どちらも同じ設計上の前提を指し示しています。これは判断エンジンであり、計算機でも検索インデックスでもありません。周囲のシステムがすでに質問を絞り込んでいる場合に、最も効果的に機能します。

既存の業務におけるこのモデルの位置づけ

ベンダー自身の例には、明確な分業体制が隠されています。それを明確にすることが、今回のリリースがあなたに本当に関係があるかどうかを判断する基準になります。

ドキュメントに記載されている返金ワークフローは、状態を構築し、複数の独立した質問を一度に行います。その後、「コード内の決定論的なチェック」によって回答を組み合わせ、ケースを「アクションまたはレビュー」のためにルーティングします。

そこでのすべてのステップは、開発者、アプリケーション、および大量のリクエスト量を前提としています。これが採算に合うようになるには、トークンあたりのコストが実際の予算項目として意味を持つレベルである必要があります。

ほとんどのレポート作成業務は、それとは異なる形態をしています。リクエストストリームではなく、ファイルが存在します。判断は製品そのものではなく、手段にすぎません。最終的に存在しなければならないのは、誰かが読むためのドキュメントです。

4,000行の顧客フィードバックを分類することは、その業務の中間プロセスにすぎません。最終ゴールは、3つのテーマを挙げ、例外を特定した要約を作成することです。

その後半部分こそが、ファイルファーストのワークスペースが処理する領域です。エクスポートしたファイルをアップロードし、自然言語でカテゴリを説明します。すると、行にラベルが付けられて戻ってき、同時にそれらを説明するレポートも作成されます。Powerdrill Bloomはこのように動作し、無料プランでも基本的なスライド、ドキュメント、スプレッドシート、画像をカバーしています。

この2つは同じ枠を争っているわけではありません。一方は製品に組み込むAPIです。もう一方は、木曜日までに回答が必要なときにスプレッドシートをアップロードする場所です。この問題がファイルという形で発生している場合は、Powerdrill Bloomをお試しください

スプレッドシート側でのラベル付けタスクについては、Excelデータのカテゴリ分け方法に関する解説があります。テーマ特定については、顧客フィードバック分析ツールのまとめをご覧ください。

比較検討すべき代替案

3つのアプローチが同じ領域をカバーしています。どれが適切かは、主に処理量によって決まります。

構造化出力に対応した汎用モデル。 現在、すべての主要プロバイダーがレスポンスをスキーマに制限できるようになっています。判断と生成の両方に1つのモデルを使用できます。コスト面では、判断業務に対して生成価格を支払うことになり、独自の調整を行う必要があります。

古典的な分類器。 ファインチューニングされた小規模モデルや勾配ブースティング木は、さらに安価で、完全に予測可能です。これは、ラベル付きデータと安定したラベルセットがある場合に有効です。ただし、文章で書かれたポリシーを理解することはできません。

ファイルファーストの分析ワークスペース。 これらは、成果物を作成するプロセスの一ステップとして判断を処理します。APIもスキーマも、トークンごとの予算管理も不要です。ただし、リクエストパスに組み込むことはできません。

状況が以下の場合検討すべきもの
製品内で数百万件の判断を行う決定専用モデル
判断とドラフト作成が混在し、処理量が少ない構造化出力に対応した汎用モデル
安定したラベルと豊富なトレーニングデータがある古典的な分類器
ファイルをレポートにする必要があるファイルファーストのワークスペース

最後の項目については、レポート作成ツールのまとめに関連する記事があります。

今すぐ注目すべき人

製品内で大量の判断処理を行っているチームは、Jevを導入する最も明確な理由があります。チケットのルーティング、モデレーションキュー、リードの選別、資格の事前チェックなどがすべて当てはまります。このパターンは、1日に数千回も行われる限定的な質問であり、コード内の分岐に反映されます。

分析の一環として時々分類を行う程度のチームは、導入する理由が最も薄いです。大規模運用でJevを魅力的にする経済的メリットは、数千行程度では実感できません。また、その後で要約を作成するためのツールが依然として必要になります。

それ以外のすべての人にとっては、採用すべきツールというよりも、借用すべき語彙(考え方)と言えます。迅速な判断と時間のかかる統合を切り離すことは、自身のパイプラインを見直す上で有用な視点です。このAPIにリクエストを送信するかどうかにかかわらず、この視点は役立ち続けます。

評価を行うすべての人への、もう1つの実用的なアドバイスです。料金ページの前に、まず「ギザギザ(jaggedness)」のページを読んでください。モデルの弱点を知ることは、コストを知ることよりも、パイプラインの設計にはるかに大きな影響を与えます。

よくある質問

System Oneモデルとは何ですか?

ソフトウェアが直接利用できる、迅速で構造化された決定を下すために構築されたモデルのクラスです。状態を評価し、型定義された回答と確率を返します。この名称は、速くて直感的な思考モードであるカーネマンのシステム1に由来しています。チャットモデルとは異なり、返信を書いたり、コードを生成したり、推論の根拠を説明したりはしません。

Jevの料金はいくらですか?

公表されているjev-1.13.0の価格は、10億トークンあたり42ドル、または100万トークンあたり0.042ドルです。課金は入力トークンのみで、出力トークンは無料です。

Jevはどのような入力を受け付けますか?

文字列、JSONオブジェクト、またはテキストの配列としてのテキストのみです。ドキュメントには、画像、音声、動画はまだサポートされていないと記載されています。コンテキストは1リクエストあたり64kトークンで、そのうち32kトークンが状態と最も長い質問に使用できます。

LLMにJSONを要求するのとどう違うのですか?

どちらも自然言語の入力を理解します。違いは、返される内容とトレーニング方法にあります。Jevは、確率分布と確信度を伴う型定義された決定を返します。キャリブレーション(調整)は予測グループ全体で測定されるため、個々の回答が正しいことを保証するものではありません。

Jevが苦手なことは何ですか?

ベンダーの「ギザギザ(jaggedness)」ページには、文字通りの解釈、数学と数値、日付と時間の比較が挙げられています。また、間接性、無関係な詳細が詰まった大規模な状態、敵対的なコンテンツ、矛盾する基準も挙げられています。算術演算のケースについてドキュメントに記載されているアドバイスは、算術演算をコード内に留めることです。

情報源: TypeSafe AI ドキュメント — Introduction、System One、Models、Confidence、および Jev 1.13 jaggedness、docs.typesafe.ai、2026年9月18日時点。