---
title: "Jev 決策模型的分支設計與限制"
locale: zh-hant
category: knowledge_base
category_name: "知識庫"
translation_status: reviewed
license: cc_by
author: "injoys"
source_url: https://injoys.com/en/articles/jev-decision-model-branching-design-and-limitations
published_at: 2026-10-02T23:30:14+09:00
---

# Jev 決策模型的分支設計與限制

> Jev 是 TypeSafe AI 的決策模型，會回傳預先設定的選項與機率。本文說明各類問題與程式碼的串接方式及型別推斷，並整理信賴度的解讀方式，以及應用於韓語時需驗證的項目。

## Key Points

- Jev 不回傳自由形式的句子，而是回傳可供程式碼使用的選項與機率。
- Choice 用於選擇類別，Score 用於分級評估，Noul 則用於詢問為真的機率。
- TypeScript SDK 會根據問題定義推斷答案的型別。
- confidence 是機率分布的摘要值，並非正確率本身。
- 韓語服務應以自有資料同時評估自動處理率與誤判率。

Jev 是 TypeSafe AI 的判斷模型，會回傳預先設定的選項與機率。當需要將自然語言判斷連接到程式碼的分支條件時，很適合使用。它會限制輸出格式，但不保證判斷準確。

價格以 2026年9月15日的公告為準，限制則以 9月17日審閱的文件為準。

## Jev 負責什麼工作？

Jev 會讀取輸入內容，並針對預先定義的問題回傳結構化答案。要評估的內容放在 `state`，判斷標準定義在 `questions`。回傳的答案可用於分類或決定優先順序。

TypeSafe AI 將這種方式稱為 System One 模型，並以 RLCD 說明其訓練方式。這是一種著重於校準判斷機率的強化學習。不過，各項服務的準確性仍須另外驗證。

官方 Introduction 文件如此表述設計原則：

> Atomic questions, composed in code
>
> TypeSafe AI, Introduction

意思是每個問題只負責一項判斷，多項判斷的組合則由程式碼處理。同一個請求中的各個問題會獨立評估相同的狀態。詳細結構可參閱 [TypeSafe AI Introduction](https://docs.typesafe.ai/introduction)。

## Choice·Score·Noul 比較

請依回傳答案在程式碼中的用途選擇問題類型。負責部門屬於類別選擇問題；嚴重程度屬於有順序的評估問題；特定要求是否存在，則可分為真或假。

| 類型 | 詢問內容 | 主要回傳值 | 程式碼銜接方式 |
| --- | --- | --- | --- |
| Choice | 屬於預先設定的哪個類別 | `choice`, `probabilities`, `confidence` | `switch` 分支 |
| Score | 處於已描述階段中的哪個程度 | `score`, `probabilities`, `confidence` | 將分數與閾值比較 |
| Noul | 特定條件是否為真 | `noul` | 比較機率後以 `if` 分支 |

### Choice 的選項該如何設定？

Choice 的每個問題最多可設定 255 個選項。它會一併評估選項名稱與說明。如果也可能收到不在清單中的輸入，請考慮加入 `other` 之類的選項。這是為了減少勉強分類。

Choice 會從提供的候選選項中選出一個。如果還要另外判斷所有候選選項是否都不合適，就必須新增問題。回傳機率的總和為 1。定義與限制請見 [Choice 文件](https://docs.typesafe.ai/primitives/choice)。

### Score 與 Noul 有什麼不同？

Score 會評估輸入在附有說明的各階段中處於什麼位置。階段編號從 0 開始。結果是階段編號的機率加權平均值，因此也可能回傳非整數分數。

Noul 會回傳條件為真的機率，數值介於 0 到 1 之間。接近 0.5 表示真與假的機率相近，不能解讀為不滿程度處於中等。要衡量程度，請使用 [Score](https://docs.typesafe.ai/primitives/score)；要詢問是否存在，請使用 [Noul](https://docs.typesafe.ai/primitives/noul)。

## 與一般程式碼及生成模型的角色比較

精確計算交給程式碼，只有語意判斷交給模型。撰寫新句子是生成模型的工作。Jev 適合答案範圍已確定的判斷。可以依此區分，決定要替換現有功能的哪些部分。

| 工作條件 | 適合的處理方式 | 原因 |
| --- | --- | --- |
| 計算日期間隔或項目數量 | 一般程式碼 | 可依規則精確計算 |
| 將客戶詢問分配給負責部門 | Jev Choice | 選項固定的語意判斷 |
| 評估故障報告的嚴重程度 | Jev Score | 在已描述的階段之間進行判斷 |
| 確認是否要求轉接客服人員 | Jev Noul | 判斷特定意圖是否存在 |
| 撰寫回答或自由摘要 | 生成模型 | 需要產生新的字串 |

處理字串輸出時，可能需要驗證格式的程式碼。Jev 的設計是直接回傳符合定義的答案格式。但這不代表所有驗證與重試都不再需要。官方 SDK 也提供因應通訊錯誤等情況的重試政策。

請繼續將外部輸入驗證與業務規則檢查分開設計。即使模型的答案符合型別，也可能在業務上有誤。這項區分是根據官方 [Client SDKs](https://docs.typesafe.ai/sdk) 與[模型限制文件](https://docs.typesafe.ai/model-jaggedness/jev-1.13)提出的設計解讀。

## TypeScript 問題定義與答案型別

TypeScript SDK 會從問題定義推導回傳值的型別。Choice 的選項鍵會對應到答案的允許值，因此能在編譯階段找出與不允許的字串進行比較的情況。SDK 要求的環境為 Node.js 20 以上。

以下是改寫官方 SDK 呼叫形式的示意程式碼，並非測量執行結果或準確性的範例。需要設定環境變數 `TYPESAFE_API_KEY`。

```typescript
import { TypeSafeClient, choice } from "@typesafe-ai/sdk";

const api = new TypeSafeClient();

async function classifyMessage(message: string) {
  const result = await api.systemOne({
    model: "jev-1.13.0",
    state: { message },
    questions: {
      topic: choice("Classify the subject of message.", {
        account: "Account access or password problems",
        delivery: "Shipment tracking or delivery problems",
        other: "Any subject outside those categories",
      }),
    },
  });

  return result.answers.topic;
}
```

此範例的 `choice` 型別為 `account | delivery | other`。在實際的 TypeScript 中，這些字串是以引號標示的字面值型別。不過，型別檢查無法判斷詢問是否被正確分類。安裝與呼叫規格請以 [JavaScript SDK 文件](https://docs.typesafe.ai/sdk/javascript)為準。

## 信心度計算範例與常見錯誤

`confidence` 是回傳機率的摘要值，不等於所選答案的機率，也不能直接當作實際答對率。制定自動執行標準時，尤其需要注意這項差異。

Choice 的官方計算公式如下：

`confidence = (最高機率 - 1 / 選項數) / (1 - 1 / 選項數)`

官方文件中的機率分布為 `0.6, 0.3, 0.1`，共有 3 個選項。代入最高機率 0.6，confidence 為 0.4。選項機率 60% 與信心度 0.4 是不同的指標。

| 常見解讀 | 正確解讀 |
| --- | --- |
| confidence 0.4 代表答對率 40% | 依公式得出的機率分布摘要值 |
| Noul 0.5 代表普通程度 | 賦予真與假相近機率的狀態 |
| Score 的小數點是精密的實測值 | 已定義階段編號的機率加權平均值 |
| 信心度高就能省略權限檢查 | 業務權限與執行條件須由程式碼另外檢查 |

數值的意義依據官方 [Confidence 文件](https://docs.typesafe.ai/confidence)。將權限檢查分開處理，則是據此提出的營運設計建議。

## 如何比較價格與回應時間？

公告價格為每 100 萬個輸入 token 0.042 美元，輸出 token 則標示為免費。公布的回應時間範圍為 70~500 毫秒。這些數值以該公司 2026年9月15日的公告為準。

該公司公布的倍數比較來自特定工作流程的評估。評估以其他大型模型的平均預測為基準，而不是實際正確答案。速度評估主要在美國西部進行。因此，這些結果不代表所有業務的準確度或韓國境內的回應時間。

| 比較項目 | 須確認的內容 |
| --- | --- |
| API 成本 | 實際輸入 token 用量與適用單價 |
| 回應時間 | 服務執行地區的往返時間 |
| 準確度 | 實際業務中已標註正確答案的樣本結果 |
| 營運成本 | 包含重試與人工審查的成本 |

只比較價格，可能會忽略審查工作增加的情況。評估是否導入時，需要計入處理結果的成本。公告數值的適用條件載於 [Jev 公開公告](https://typesafe.ai/blog/introducing-system-one-models-and-jev)。

## Jev 1.13 的九項限制

官方文件將 Jev 1.13 的失敗類型整理為九項。此清單以 2026年9月17日審閱的內容為準。即使在部分案例中成功，也不保證該工作的可靠性。

| 失敗類型 | 設計上的因應方式 |
| --- | --- |
| 逐字解讀措辭 | 在指示中明確寫出隱含條件 |
| 計算與計數 | 以程式碼處理算術 |
| 比較日期與時間 | 組成日期後以程式碼比較 |
| 雙重否定與多步驟推論 | 拆分成直接的問題 |
| 輸入含有大量無關內容 | 只傳送必要欄位 |
| 引導判斷的輸入 | 將引導性句子納入事前評估 |
| 指示與選擇標準衝突 | 讓問題與標準的意思一致 |
| 問題之間缺乏數學一致性 | 由程式碼管理邏輯關係 |
| 自由文字生成 | 使用生成模型 |

即使意思相同，Noul 與 Choice 得出的機率也可能不同。不要把針對某一類型設定的閾值直接套用到另一類型。依據為 [Jev 1.13 jaggedness](https://docs.typesafe.ai/model-jaggedness/jev-1.13)。

## 韓語服務的適用條件

Jev 可以處理韓語輸入，但不保證效能與英語相同。官方文件說明，主要訓練語言是英語，也明確指出韓語等 CJK 文字語系的效能差異。文件未提供通用的韓語準確度數值。

請以自行蒐集的樣本判斷是否適用於韓語。最好也納入語氣委婉或有所省略的詢問。若只評估翻譯文字，可能會漏掉真實客戶用語風格的差異。這是考量語言間效能差異而提出的評估建議。

- 分開評估明確與模糊的請求
- 分別統計部門分類與情緒評估
- 重新驗證英語所設定的閾值是否適用於韓語
- 模型變更前後使用相同樣本比較

新版本推出時，`jev-latest` 指向的模型會改變。如果閾值是針對特定版本設定的，請考慮固定版本。語言與版本政策可參閱官方 [Models 文件](https://docs.typesafe.ai/models)。

## 評估模型替換時容易忽略的自動處理率

替換模型時，必須同時檢視整體準確度與自動處理率。如果把所有模糊案例都交給人工處理，自動處理量就會減少；擴大自動處理範圍，則可能增加錯誤執行的案例。以下是擴充官方文件信心度分支原則的評估方法。

| 指標 | 計算或記錄方式 | 確認目的 |
| --- | --- | --- |
| 自動處理率 | 自動處理件數 / 評估總件數 | 實際減少的人工工作量 |
| 自動處理誤判率 | 自動處理中的誤判件數 / 自動處理件數 | 自動化結果的品質 |
| 人工審查率 | 送交審查件數 / 評估總件數 | 剩餘的審查負擔 |
| 最終處理時間 | 測量從輸入到最終完成的時間 | 包含審查的等待時間 |

如果沒有自動處理件數，就無法計算自動處理誤判率。此時請記錄為無法計算，而非 0%。保留指標的分母，才能比較不同模型。

評估可依下列順序進行。

1. 請人員為實際業務樣本標註正確答案。
2. 固定問題措辭與選項定義。
3. 記錄模型版本、機率及最終分支。
4. 比較各閾值的自動處理率與誤判率。
5. 依可接受的錯誤程度訂定營運標準。

不存在普遍適用的閾值。標準必須反映錯誤執行時的影響。作為起點的分支原則可參閱 [Confidence 文件](https://docs.typesafe.ai/confidence)。

## FAQ

### Jev 會取代一般的生成式 AI 嗎？
適合用於從既定答案中做出判斷的工作。撰寫開放式回答或摘要則需要生成式模型。

### Choice 最多可以放入多少個選項？
Choice 官方文件規定，每個問題的上限為 255 個。如果需要處理清單以外的輸入，請考慮加入「其他」選項。

### Noul 是 0.5，就代表一般水準嗎？
表示真與假的機率相近。若要評估程度或水準，使用各級別均有說明的 Score 較合適。

### Score 的小數點代表什麼？
是將已定義的各級別編號分別乘以機率後加總所得的值。不代表精確的實測值，也不代表該客戶的比例。

### confidence 高就可以視為正確答案嗎？
confidence 是對機率分布的摘要值。實際是否正確，必須透過業務樣本確認。

### TypeScript SDK 會檢查什麼？
會從問題定義推導答案的型別，有助於找出拿允許選項以外的字串來比較的情況。但不會檢查分類內容是否正確。

### 使用 Jev 就不需要重試了嗎？
處理輸出格式與處理通訊錯誤是兩回事。官方 SDK 設有預設的重試政策，因此也必須確認 API 錯誤的處理方式。

### 韓文的準確率有多高？
官方 Models 文件沒有提供可概括適用的韓文準確率數據。請使用實際的韓文輸入，評估各問題的表現。

### Jev 的價格是多少？
2026 年 9 月 15 日公布的價格為每 100 萬個輸入權杖 0.042 美元。輸出權杖標示為免費。實際適用價格請再次查閱官方 Models 文件。

### 可以在正式環境中使用 jev-latest 嗎？
可以，但推出新版本時，所連接的模型會變更。若要繼續使用已驗證過閾值的版本，請指定該版本的 ID。

## Sources

- [TypeSafe AI 簡介](https://docs.typesafe.ai/introduction)
- [TypeSafe AI Choice](https://docs.typesafe.ai/primitives/choice)
- [TypeSafe AI Score](https://docs.typesafe.ai/primitives/score)
- [TypeSafe AI Noul](https://docs.typesafe.ai/primitives/noul)
- [TypeSafe AI Confidence](https://docs.typesafe.ai/confidence)
- [TypeSafe AI 客戶端 SDK](https://docs.typesafe.ai/sdk)
- [TypeSafe AI JavaScript SDK](https://docs.typesafe.ai/sdk/javascript)
- [介紹 System One Models 與 Jev，2026年9月15日](https://typesafe.ai/blog/introducing-system-one-models-and-jev)
- [Jev 1.13 的鋸齒度，2026年9月17日檢視](https://docs.typesafe.ai/model-jaggedness/jev-1.13)
- [TypeSafe AI 模型](https://docs.typesafe.ai/models)

## Images

![客服辦公室裡，兩名戴耳麥的員工看著螢幕討論，桌上亮著藍綠色指示燈，後方還有其他客服人員。](https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MjQwNDYsInB1ciI6ImJsb2JfaWQifX0=--ea906281db18091febeba00926fa1dd9ebe90294/ai-cb0d0c3f.webp)
![一名女子在有分支箭頭的測試板上，將詢問卡移向人工審查區。](https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MjQwNTIsInB1ciI6ImJsb2JfaWQifX0=--d07e76337161b074535590d09b1f479ecd50d738/ai-893d1efb.webp)