Jev決定モデルの分岐設計と限界
Jevは、定められた選択肢と確率を返すTypeSafe AIの決定モデルです。質問の種類ごとにコードへ接続する方法や型推論、信頼度の解釈、韓国語への適用時に検証すべき項目をまとめています。
- Jevは自由な文章ではなく、コードで利用する選択肢と確率を返します。
- Choiceはカテゴリの選択、Scoreは段階別の評価、Noulは真である確率を問う形式です。
- TypeScript SDKは質問の定義から回答の型を推論します。
- confidenceは確率分布を要約した値であり、正答率そのものではありません。
- 韓国語のサービスでは、独自のデータを使って自動処理率と誤判定率を併せて評価する必要があります。
Jevは、定められた選択肢と確率を返すTypeSafe AIの判断モデルです。自然言語による判断をコードの分岐条件につなげる場合に適しています。出力形式は制限しますが、判断の正確さは保証しません。
価格は2026年9月15日の発表、限界は9月17日に確認した文書に基づきます。
Jevはどのような役割を担うモデルですか?
Jevは入力内容を読み、あらかじめ定義した質問に構造化された答えを返します。評価する内容はstateに入れます。判断基準はquestionsで定義します。返された答えは分類や優先順位の決定に使えます。
TypeSafe AIはこの方式をSystem Oneモデルと呼びます。学習方式はRLCDという名前で説明しています。これは判断確率の補正に重点を置いた強化学習です。ただし、サービスごとの正確さは別途検証する必要があります。
公式のIntroduction文書では、設計原則を次のように表現しています。
個々の質問をコードで組み合わせます
TypeSafe AI, Introduction
これは、質問ごとに1つの判断を担わせるという意味です。複数の判断の組み合わせはコードで処理します。1つのリクエストに含まれる質問は、同じ状態をそれぞれ独立して評価します。詳しい構造はTypeSafe AI Introductionで確認できます。
Choice·Score·Noulの比較
質問の種類は、返された答えをコードでどう使うかに応じて選んでください。担当部署はカテゴリーを選ぶ問題です。深刻度は順序のある評価に当たります。特定の要求の有無は真と偽に分けられます。
| 種類 | 問う内容 | 主な戻り値 | コードでの利用 |
|---|---|---|---|
| Choice | 定められたカテゴリーのどれに当たるか |
choice, probabilities, confidence
|
switchによる分岐 |
| Score | 説明された段階のどの水準か |
score, probabilities, confidence
|
スコアとしきい値の比較 |
| Noul | 特定の条件が真か | noul |
確率を比較してからifで分岐 |
Choiceの選択肢はどう決めますか?
Choiceでは、1つの質問に最大255個の選択肢を指定できます。選択肢の名前と説明を併せて評価します。一覧にない入力もあり得る場合は、otherのような項目を検討してください。これは無理な分類を減らすための設計です。
Choiceは与えられた候補から1つを選びます。すべての候補が不適切かどうかも別途判断するには、質問を追加する必要があります。返される確率の合計は1です。定義と制限はChoiceの文書に記載されています。
ScoreとNoulはどう違いますか?
Scoreは、説明が付いた段階の中で位置を評価します。段階番号は0から始まります。結果は段階番号の確率加重平均です。そのため、整数ではないスコアを返すこともあります。
Noulは、条件が真である確率を0から1の間で返します。0.5付近は、真と偽の確率が近いことを意味します。不満の程度が中くらいという意味に解釈してはいけません。程度を測るならScore、有無を問うならNoulを使ってください。
通常のコード・生成モデルとの役割比較
正確な計算はコードに任せ、意味の判断だけをモデルに任せてください。文章を新たに作成する作業は生成モデルの役割です。Jevは答えの範囲が決まった判断に適しています。この区分を基準に、既存機能を置き換える範囲を決められます。
| 作業の条件 | 適した処理方法 | 理由 |
|---|---|---|
| 日付の間隔や項目数の計算 | 通常のコード | ルールに従って正確に計算できるため |
| 顧客からの問い合わせの担当部署への分類 | Jev Choice | 選択肢が決まった意味判断のため |
| 障害報告の深刻度評価 | Jev Score | 説明された段階の中での判断のため |
| オペレーターへの接続要求の確認 | Jev Noul | 特定の意図の有無を判断するため |
| 回答の作成や自由な要約 | 生成モデル | 新しい文字列の生成が必要なため |
文字列の出力を処理する際には、形式を検証するコードが必要になることがあります。Jevは定義された答えの形式を直接返す仕組みです。だからといって、すべての検証や再試行が不要になるわけではありません。公式SDKも通信エラーなどに備えた再試行ポリシーを提供しています。
外部入力の検証と業務ルールのチェックは、引き続き分けて設計してください。モデルの答えが型に合っていても、業務上は間違っている可能性があります。この区分は、公式のClient SDKsとモデルの限界に関する文書に基づく設計上の解釈です。
TypeScriptの質問定義と答えの型
TypeScript SDKは質問の定義から戻り値の型を推論します。Choiceの選択肢のキーが、答えとして許される値に結び付きます。その結果、許されていない文字列との比較をコンパイル時に検出できます。SDKに必要な環境はNode.js 20以上です。
次は、公式SDKの呼び出し形式を応用した説明用のコードです。実行結果や正確さを測定した例ではありません。環境変数TYPESAFE_API_KEYの設定が必要です。
import { TypeSafeClient, choice } from "@typesafe-ai/sdk";
const api = new TypeSafeClient();
async function classifyMessage(message: string) {
const result = await api.systemOne({
model: "jev-1.13.0",
state: { message },
questions: {
topic: choice("Classify the subject of message.", {
account: "Account access or password problems",
delivery: "Shipment tracking or delivery problems",
other: "Any subject outside those categories",
}),
},
});
return result.answers.topic;
}
この例のchoiceの型はaccount | delivery | otherです。文字列は実際のTypeScriptでは引用符で表記されるリテラル型です。ただし、型チェックでは問い合わせを正しく分類したかどうかは判断できません。インストール方法と呼び出し仕様はJavaScript SDKの文書で確認してください。
信頼度の計算例とよくある間違い
confidenceは返された確率を要約した値です。選ばれた答えの確率と同じ数値ではありません。実際の正答率としてそのまま解釈してもいけません。この違いは、自動実行の基準を作る際に特に注意が必要です。
Choiceの公式の計算式は次のとおりです。
confidence = (最大確率 - 1 / 選択肢の数) / (1 - 1 / 選択肢の数)
公式文書の確率分布は0.6, 0.3, 0.1です。選択肢は3個です。最大確率0.6を代入すると、confidenceは0.4になります。選択された答えの確率60%と信頼度0.4は異なる指標です。
| よくある解釈 | 正しい解釈 |
|---|---|
| confidence 0.4は正答率40% | 計算式に従って確率分布を要約した値 |
| Noul 0.5は普通の水準 | 真と偽に近い確率を割り当てた状態 |
| Scoreの小数点は精密な実測値 | 定義した段階番号の確率加重平均 |
| 信頼度が高ければ権限チェックを省略できる | 業務上の権限と実行条件は別のコードでチェック |
数値の意味は公式のConfidenceの文書に基づきます。権限チェックを分けるという内容は、それを運用に適用した設計上の提案です。
価格と応答時間はどう比較しますか?
発表された価格は入力トークン100万個あたり0.042ドルです。出力トークンは無料と案内されています。発表された応答時間の範囲は70~500ミリ秒です。これらの数値は2026年9月15日の会社発表に基づきます。
会社による倍率の比較は、特定のワークフローの評価から得られたものです。実際の正解ではなく、別の大規模モデルの平均予測を基準にしました。速度の評価は主に米国西部で実施されました。したがって、あらゆる業務での正確さや韓国内での応答時間を示すものではありません。
| 比較項目 | 確認する内容 |
|---|---|
| API費用 | 実際の入力トークン使用量と適用単価 |
| 応答時間 | サービスが稼働する地域での往復時間 |
| 正確さ | 実際の業務で正解を付けたサンプルの結果 |
| 運用費用 | 再試行と人による確認まで含めた費用 |
価格だけを比較すると、確認作業が増える状況を見落とす可能性があります。導入の判断には、処理結果まで含めた費用が必要です。発表数値の条件はJevの公開発表文に明記されています。
Jev 1.13の9つの限界
公式文書は、Jev 1.13の失敗の種類を9つにまとめています。この一覧は2026年9月17日に確認した内容に基づきます。一部の事例で成功しても、その作業での信頼性が保証されるわけではありません。
| 失敗の種類 | 設計上の対応 |
|---|---|
| 文言を文字どおりに解釈 | 暗黙の条件を指示に明記 |
| 計算と個数のカウント | 算術はコードで処理 |
| 日付と時刻の比較 | 日付を組み立ててからコードで比較 |
| 二重否定と複数段階の推論 | 直接的な質問に分割 |
| 無関係な内容が多い入力 | 必要なフィールドだけを渡す |
| 判断を誘導する入力 | 誘導する文章を含めて事前に評価 |
| 指示と選択基準の衝突 | 質問と基準の意味を一致させる |
| 質問間での数学的な整合性の不足 | 論理関係をコードで管理 |
| 自由なテキスト生成 | 生成モデルを使用 |
同じ意味でも、NoulとChoiceでは確率が異なることがあります。ある種類で調整したしきい値を、別の種類にそのまま移さないでください。根拠はJev 1.13 jaggednessです。
韓国語サービスへの適用条件
韓国語の入力は処理しますが、英語と同等の性能は保証されません。公式文書では、主な学習言語は英語だと説明しています。韓国語を含むCJK文字圏での性能差も明記しています。一般的な韓国語の正確さを示す数値は提示していません。
韓国語への適用可否は、自社のサンプルで判断してください。遠回しな表現や省略のある問い合わせも含めるとよいでしょう。翻訳文だけを評価すると、実際の顧客の文体との差を見落とす可能性があります。これは言語ごとの性能差を考慮した評価上の提案です。
- 明確な要求と曖昧な要求を分けて評価
- 部署の分類と感情の評価を別々に集計
- 英語で決めたしきい値を韓国語で再検証
- モデル変更の前後で同じサンプルを使って比較
jev-latestは新しいバージョンが出ると、参照するモデルが変わります。しきい値を特定のバージョンに合わせた場合は、バージョンの固定を検討してください。言語とバージョンの方針は公式のModelsの文書で確認できます。
モデルの切り替え評価で見落としやすい自動処理率
モデルを切り替える際は、全体の正確さと自動処理率を併せて見る必要があります。曖昧な案件をすべて人に回すと、自動処理量は減ります。自動処理の範囲を広げると、誤って実行する事例が増える可能性があります。以下は、公式文書の信頼度による分岐を拡張した評価方法です。
| 指標 | 計算または記録の方法 | 確認する目的 |
|---|---|---|
| 自動処理率 | 自動処理件数 / 評価件数全体 | 実際に減る手作業 |
| 自動処理の誤判定率 | 自動処理中の誤判定件数 / 自動処理件数 | 自動化した結果の品質 |
| 人による確認率 | 確認に回した件数 / 評価件数全体 | 残る確認作業の負担 |
| 最終処理時間 | 入力から最終的な完了までを測定 | 確認を含む待ち時間 |
自動処理件数がなければ、自動処理の誤判定率は計算できません。この場合は0%ではなく、計算不可と記録してください。指標の分母を残すことで、モデル間の比較が可能になります。
評価は次の順序で進められます。
- 実際の業務サンプルに人が正解を付けてください。
- 質問の文言と選択肢の定義を固定してください。
- モデルのバージョン、確率、最終的な分岐を記録してください。
- しきい値ごとの自動処理率と誤判定率を比較してください。
- 許容するエラーの水準に合わせて運用基準を決めてください。
普遍的に適切なしきい値はありません。誤って実行した場合の影響を基準に反映する必要があります。出発点となる分岐の原則はConfidenceの文書で確認できます。
FAQ
Jevは一般的な生成AIの代わりになりますか?
決められた答えの中から判断する作業に適しています。自由な回答の作成や要約には生成モデルが必要です。
Choiceには選択肢を最大いくつ入れられますか?
公式のChoiceドキュメントで定める上限は、1つの質問につき255個です。リストにない入力を処理する必要がある場合は、「その他」の選択肢を検討してください。
Noulが0.5なら、普通のレベルという意味ですか?
真と偽の確率が近いという意味です。程度や水準を評価するには、説明のある段階を使うScoreが適しています。
Scoreの小数点以下の数値は何を意味しますか?
定義した各段階の番号に確率を掛けて合計した値です。精密な実測値や、その顧客の割合を意味するものではありません。
confidenceが高ければ、正解とみなしてもよいですか?
confidenceは確率分布を要約した値です。実際に正解かどうかは、業務データのサンプルで確認する必要があります。
TypeScript SDKは何をチェックしますか?
質問の定義から回答の型を推論します。許可された選択肢以外の文字列との比較を見つけるのに役立ちます。分類内容の正確性まではチェックしません。
Jevを使えば再試行は不要ですか?
出力形式の処理と通信エラーの処理は別です。公式SDKにはデフォルトの再試行ポリシーがあるため、APIエラーの処理も確認する必要があります。
韓国語の精度はどのくらいですか?
公式のModelsドキュメントには、一般化できる韓国語の精度の数値は示されていません。実際の韓国語の入力を使い、質問ごとの性能を評価してください。
Jevの料金はいくらですか?
2026年9月15日に発表された価格は、入力トークン100万個あたり0.042ドルです。出力トークンは無料と案内されていました。適用される価格は公式のModelsドキュメントで改めて確認してください。
運用環境でjev-latestを使ってもよいですか?
使えますが、新しいバージョンが出ると、紐づくモデルが変わります。しきい値を検証したバージョンを維持するには、そのバージョンIDを指定してください。
Sources
Images

