Jev開発者向けシステムモデルとLLMの違い
JevはTypeSafe AIが開発した、構造化された判断のためのモデルです。選択値と確率をコードに接続する仕組みで、実際の導入では出力形式と判断精度を分けて考える必要があります。
Jevは自由な説明文ではなく、あらかじめ定義した回答と確率を返します。
ChoiceとScoreには信頼度がありますが、Noulには個別の信頼度フィールドがありません。
2026年9月15日に発表された入力料金は、100万トークンあたり0.042ドルです。
公開されている速度比較は、特定の作業と測定環境で得られた結果です。
日本語業務では、実際の事例を使って精度とレビューへ切り替える基準を検証してください。
JevはTypeSafe AIが開発した、ソフトウェア判断用のモデルです。説明文ではなく、選択値と確率を返します。分類と処理の分岐に適するよう設計されています。出力形式が正しくても、判断は誤っている場合があります。
料金と速度の数値は、TypeSafeが2026年9月15日に発表した内容に基づきます。
JevとSystem One Modelの意味
Jevは、コードがそのまま利用できる判断結果を出力するAIです。正式な製品名はJevです。TypeSafeはこの系列をSystem One Modelと呼んでいます。
入力には、判断対象であるstateと質問であるquestionsが含まれます。stateは、顧客からの問い合わせや業務記録など、判断に必要な情報です。質問には、許可する回答と評価基準を指定します。
System Oneという名前は、速く直感的な思考に由来します。製品の役割を説明するために会社が用いている名称です。自然言語の入力を理解する機能も備えています。概念と入力範囲は、TypeSafeのSystem Oneドキュメントで確認できます。
LLMとは何が違いますか?
主な違いは、出力できる回答の範囲です。LLMは、説明文やコードのような自由な内容を生成します。Jevは、開発者が定めた回答範囲の中で判断します。
比較項目 | 一般的なLLMの活用 | Jevの活用
主な結果 | 説明文、要約文、生成コード | 選択値、評価スコア、確率
回答の範囲 | 自由な生成または構造化出力 | 質問であらかじめ定めた範囲
ソフトウェアとの連携 | 応答形式に合わせた解釈と検証 | 戻り値を条件分岐と分類に接続
説明の生成 | 判断理由を文章で作成可能 | 自由な説明文の生成は未対応
適した役割 | 対話、作成、複合的な問題の解決 | 分類、担当経路の選択、基準別評価
LLMも構造化された形式で回答するよう構成できます。そのため、JSON出力自体はJevだけの機能ではありません。Vercelのドキュメントでは、構造化LLMとの連携方法も説明しています。ただし、同じ応答形式であっても、同じ評価動作を意味するわけではありません。VercelのJev解説で説明されている区分です。
ソフトウェアでは、出力仕様が正しくなければ次の処理を実行できません。たとえば、担当部署の値には許可された名称が必要です。そこに説明文が混ざると、別途解釈する処理が発生します。Jevは、このような判断結果を直接返すよう設計されています。
Choice・Score・Noulの条件別整理
質問への回答がどのような形式かに応じて、種類を選択してください。Jevの基本的な質問タイプはChoice、Score、Noulです。同じ状態に対する独立した質問は、1回の呼び出しにまとめられます。構成方法はTypeSafe Introductionに記載されています。
必要な判断 | 質問タイプ | 戻り値 | 活用例
定められた選択肢から選択 | Choice | 選択値、選択肢別の確率、信頼度 | 問い合わせを担当部署へ転送
順序のある基準で評価 | Score | スコア、段階別の確率、信頼度 | 障害の深刻度を評価
ある命題が正しいか判断 | Noul | 「はい」である確率を示す0-1の値 | 返金要求が含まれているか判別
Scoreの数値は、設定した評価段階における位置を示します。必ずしもパーセントを意味するわけではありません。Noulは、「はい」である確率を返すタイプです。ScoreドキュメントとNoulドキュメントが、それぞれの解釈基準です。
互いに依存する質問は、処理順序を定めてください。後の質問に前の回答が必要な場合は、コードで接続する必要があります。同じ呼び出し内の質問は、共通の状態を独立して評価します。
レストラン対応事例の数値はどう読み取りますか?
レストラン対応のデモに登場する数値は、製品全体の精度とはみなせません。紹介動画の説明には、次の値が登場します。元のAPIリクエストと測定条件は確認されていません。
紹介された値 | 説明上の意味 | 解釈時に確認する事項
0-1尺度の0.09 | 客の行動の正当性評価 | スコアか、「はい」である確率かを確認
選択肢の適合度94% | 代金を支払う理由を説明する案に付与された値 | 提示された選択肢と質問基準を確認
信頼度92% | その判断に対する信頼度の表示 | 実際の正答率として読み取らない
処理時間0.1秒未満 | デモで紹介された応答時間 | 通信時間を含むかを確認
この事例は、出力形式を理解するための例です。数値だけで現実のトラブルを判定することはできません。特に、選択肢の構成が変わると、質問自体が変わります。
確率と信頼度を混同するよくある誤り
確率と信頼度は異なる値です。Choiceの確率は、各選択肢に割り当てられた値です。信頼度は、その確率分布がどの程度集中しているかを要約します。
したがって、信頼度92%を正答率92%と読み取ってはいけません。実際の正答率は、正解が確認された事例を使って測定する必要があります。Noulには、独立したconfidenceフィールドがありません。この区分は、TypeSafe Confidenceドキュメントに明記されています。
· 形式と精度の混同: 許可された部署を選んでも、担当部署を誤る場合があります。
· スコアと確率の混同: Scoreの値は、評価段階における位置を示す場合があります。
· 信頼度と正答率の混同: 信頼度が高いだけでは、個別の回答が正しいことは保証されません。
· 選択肢の不足: 必要な回答が選択肢にない場合、適切な判断が難しくなります。
較正は、複数の予測を集め、確率と結果の関係を評価する概念です。個別の回答1件の正確性を保証する手順ではありません。出力仕様への準拠と意味上の正確性は、分けて評価してください。
公開料金と速度比較の条件
公開料金は、入力トークンを基準に計算します。トークンは、モデルがテキストを処理する単位です。2026年9月15日の発表では、出力トークンの料金は無料と案内されました。
項目 | 公開内容 | 適用範囲
入力料金 | 100万トークン当たり0.042ドル | 発表当時のTypeSafe料金
出力料金 | 無料 | 発表当時のTypeSafe料金
応答時間 | 70-500ミリ秒 | 会社が発表した測定範囲
測定環境 | 主に米国西部のノートパソコン | 会社発表に記載された評価環境
この数値は、すべてのリクエストの性能を保証する値ではありません。会社の評価には、外部モデルの予測を基準とした比較があります。これを実際の業務における正答率と同一視することはできません。測定条件は、TypeSafeのリリース発表で公開されています。
公開単価の計算例
入力10億トークンの基本利用料は42ドルです。計算式は1,000,000,000 ÷ 1,000,000 × 0.042です。これは公開単価の換算例です。
判断1件当たりの価格は、入力の長さによって異なります。実際の費用には、再試行や後続モデルの呼び出しも影響します。最新の単価は、TypeSafe Modelsドキュメントで確認してください。
Doomのデモが示す活用範囲
Doomのデモは、構造化されたゲーム状態から行動を選択する事例です。ゲーム画面の画像を直接理解したデモではありません。TypeSafeは、テキスト形式の状態データを使用したと説明しています。この条件は、リリース発表のDoomに関する説明に記載されています。
業務に適用する場合は、判断を繰り返す箇所が候補になります。次の表は、機能に基づく設計例です。個別の業務における性能は、別途検証する必要があります。
業務条件 | 可能な役割 | 併せて必要な処理
問い合わせを所定の部署に分類 | Choiceで担当経路を選択 | 曖昧な問い合わせの確認経路
文書を共通の基準で評価 | Scoreで基準別のスコアを返す | 評価基準の明確な定義
特定の要求が含まれているか確認 | Noulで命題を評価 | 実行するかどうかを決めるコード
ユーザー向けの説明文を作成 | 生成モデルに接続 | 原文の根拠と承認済みの判断を伝達
韓国語業務と数値処理の限界
韓国語の業務では、独自の検証が必要です。TypeSafeは、英語が主な学習言語だと案内しています。他言語の性能は同じではないと説明しています。言語サポートの条件は、Modelsドキュメントで確認できます。
数値を返すからといって、計算まで正確であるとは限りません。これは、2026年9月17日に確認した制限事項のドキュメントに記載された説明です。ドキュメントでは、計算をコードで処理するよう推奨しています。
Jev is not a calculator.
上記の文言は、Jev 1.13 jaggednessの原文です。
既知の制限 | 開発時の対応
正確な数量計算 | コードで項目数を計算
日付と時刻の比較 | 抽出した値を日付型に変換して比較
関係のない長い入力 | 判断に必要な内容だけを選別
複雑な否定文と間接的な条件 | 明確で短い質問に分割
曖昧または矛盾する評価基準 | 質問と選択肢の意味を整合
韓国語の検証資料には、実際の業務表現を含めてください。敬語や省略された主語も確認対象です。処理結果が確定している事例と、モデルの回答を照合できます。
APIとSDKの利用経路の比較
TypeSafeに直接接続する経路のほかに、ゲートウェイ経路も確認されています。リリース発表では、待機リストを通じた初期利用を案内していました。アカウントごとの利用可否は、各サービスで確認してください。
経路 | 確認された提供形態 | 確認するドキュメント
TypeSafe | コンソール、API、クライアントSDK | Quick start
Vercel AI Gateway | Jev評価リクエストへの接続 | Evaluation
OpenRouter | Jev 1.13モデルの登録 | Jev 1.13モデルページ
TypeSafeのQuick startでは、直接呼び出す手順を説明しています。次は、その経路の基本的な手順です。
· コンソールでアカウントのアクセス権限を確認してください。
· Playgroundで判断対象と質問をテストしてください。
· ダッシュボードでAPIキーを発行してください。
· SDKまたはHTTP APIでリクエストを送信してください。
· 戻り値と確率をコードの処理ルールに接続してください。
VercelのEvaluationドキュメントには、接続例があります。「はい」か「いいえ」で答える質問は、この経路ではBooleanとして表示されます。OpenRouterのJev 1.13ページでもモデルを確認できます。経路ごとのリクエスト形式と上限については、それぞれのドキュメントを基準にしてください。
判断記録を残すための設計基準
自動化の結果を検証するには、入力の根拠も併せて記録してください。選択値だけを保存すると、誤判断の原因を見つけにくくなります。次の項目は、公式インターフェースに基づいてまとめた設計上の提案です。
記録項目 | 確認できる問題
判断に使用した原文と時点 | 古い情報または欠落した情報
質問と選択肢のバージョン | 基準変更による結果の違い
実際に応答したモデルID | モデル変更の影響
回答と確率分布 | 曖昧な事例の処理理由
コードが実行した処理 | 判断と実行の間の不一致
人が確認した結果 | 実際のエラーと修正内容
モデル名のエイリアスは、新しいバージョンを指すよう変更される場合があります。検証したバージョンは、モデルIDで固定できます。TypeSafeのModelsドキュメントで説明されている運用方法です。
人による確認へ切り替える基準は、実際の事例を基に定めてください。誤分類によるコストと、人が確認する負担を併せて評価します。普遍的に適切な信頼度の基準値はありません。検証方法については、Confidenceドキュメントの案内を参考にできます。