{"content_id":"ardq66qm2e","slug":"claude-opus-5-verification-and-migration-guide","locale":"zh-hant","schema_type":"TechArticle","category":"how_to","category_name":"操作教學","title":"切換至 Claude Opus 5 前的提示詞與執行框架檢查方法","summary":"本文將資料中宣稱的 Claude Opus 5 特點與可驗證資訊加以區分，並說明導入新一代模型時，應如何重新設計提示詞、執行框架與評估體系。發布與否、價格及模型名稱都必須查閱 Anthropic 官方模型清單與價目表確認。","author":{"name":"injoys","url":"https://injoys.com/ko/about"},"key_points":["使用資料中提到的 Claude Opus 5、Fable 5、Sonnet 5 發布日期、價格與效能資訊前，必須透過官方資料獨立確認。","與其將既有提示詞原封不動地複製到新模型，不如使用實際業務資料重新衡量品質、成本與延遲時間。","重複的驗證指示與無限制呼叫子代理，可能在無法改善結果的情況下增加成本與執行時間。","將系統指示、專案規則、需要時才載入的 Skill，以及技術參考資料分開，有助於管理上下文。","相較於基準測試排名，納入組織實際工作與失敗成本的內部評估，更能成為選擇模型的直接依據。"],"content_markdown":"所提供的資料將 Claude Opus 5 介紹為適合日常企業與代理工作使用的模型，並主張在新一代 Claude 中，必須重新設計既有提示詞與執行框架。然而，資料中提及的 **Claude Opus 5、Fable 5、Sonnet 5 的發布日期、價格、效能及合作夥伴發言，無法僅憑本文提供的資訊進行獨立驗證。** 尤其應先從官方模型清單確認 `Fable` 是否為 Anthropic 的正式模型名稱。\n\n因此，本文不會將上述發布資訊當作已確定的事實重複陳述，而是分別整理需要透過官方文件確認的項目，以及可套用於實際模型轉換的驗證程序。\n\n## 首先需要確認的發布資訊\n\n在將新模型套用至 API、Claude 應用程式或 Claude Code 之前，應將以下項目與 Anthropic 官方文件及目前使用服務中的模型選擇畫面進行核對。\n\n| 確認項目 | 所提供資料的主張 | 必要的驗證 |\n|---|---|---|\n| 模型名稱 | Claude Opus 5、Fable 5、Sonnet 5 | 官方模型清單中的正確產品名稱與模型 ID |\n| 發布日期 | 分別為 6月 9日、6月 30日、7月 24日 | 官方公告與變更記錄中的年份及日期 |\n| Opus 5 價格 | 輸入 5美元、輸出 25美元／100萬 token | 官方 API 價目表，以及批次、快取、長篇上下文的另行計費 |\n| 產品內的預設模型 | Claude Max 的新預設模型 | 是否依地區、方案、用戶端而適用 |\n| 模型間的角色 | 區分為長期自主工作、日常工作、輕量工作 | 官方模型說明與實際業務評估結果 |\n| 效能改善 | 相較於先前模型提升特定比例 | 評估任務、樣本數、衡量標準、合作夥伴原文 |\n\n若官方文件中沒有模型名稱或價格，就不應將其用於 API 設定及預算計算。若使用雲端服務供應商或轉售服務，其模型 ID、價格及供應時間也可能與 Anthropic 直接 API 不同。\n\n## 模型轉換時應改變的判斷標準\n\n### 1. 衡量每項工作的效率，而非最高效能\n\n當代理重複呼叫多個工具與 subagent 時，讓最昂貴的模型處理所有請求，可能迅速增加成本。選擇模型時，不應只看名稱或等級，而應綜合考量以下指標。\n\n- **成功率：** 無需人工修改即可滿足要求的比例\n- **總成本：** 不僅包含首次請求，也包含重試、工具呼叫及 subagent 呼叫的成本\n- **完成時間：** 包含等待時間以及人工審查、修改時間\n- **失敗成本：** 安全漏洞、錯誤部署、分析遺漏等失敗所造成的影響\n- **一致性：** 重複執行同類工作時，結果出現波動的程度\n\n不能只根據 token 單價判斷每項工作的成本。概念上可按以下方式計算。\n\n`每項工作的總成本 = 主要模型成本 + subagent 成本 + 工具成本 + 重試成本 + 人工審查成本`\n\n### 2. 將公開基準測試與內部評估分開\n\n公開基準測試是比較模型一般特性的起點，但無法保證模型在特定程式碼庫、文件格式及業務規則下能夠成功。組織應將實際工作匿名化，建立自己的評估集。\n\n良好的評估集應同時包含以下案例。\n\n- 應能正常完成的代表性工作\n- 模型經常出錯的邊界案例\n- 要求模糊、需要進一步提問的工作\n- 需要呼叫工具或確認外部資料的工作\n- 應停止執行或取得人工核准的高風險工作\n- 長時間執行期間需要儲存並復原狀態的工作\n\n必須對每個模型套用相同的輸入、工具、時間限制及成功標準，才能進行比較。與一兩次令人印象深刻的結果相比，記錄多次重複執行後的成功率與成本分布更為安全。\n\n### 3. 將模型與執行框架視為單一系統進行評估\n\n**執行框架（harness）**是指模型周圍的執行環境。其中包含系統提示詞、專案指引、搜尋、記憶體、工具、Skill、subagent、權限管理、驗證及重試邏輯。\n\n即使是相同模型，結果也可能因執行框架而異。例如，若模型本身會撰寫並執行測試，而執行框架又強制進行相同驗證，就可能重複執行同一項工作。相反地，若連部署核准或安全檢查等需要確定性控制的階段，也交由模型自行判斷，則會帶來風險。\n\n核心原則是**區分模型擅長的推理，以及系統必須確保執行的控制措施**。\n\n## 提示詞與執行框架中應檢查的 6 個項目\n\n### 1. 透過實驗移除重複的驗證與再次確認指示\n\n直接刪除 `完成後務必再次確認` 之類的句子，並不一定是正確答案。應先追蹤新模型自主執行的驗證是否與執行框架的驗證階段重疊。\n\n- 若模型只是不斷重複自行審查，品質卻沒有改善，就應精簡提示詞。\n- 測試、結構描述驗證、靜態分析等可自動化的檢查應保留在執行框架中。\n- 付款、部署、資料刪除等高風險工作的核准，不應由模型的自行驗證取代。\n\n### 2. 設定 subagent 的呼叫條件與上限\n\nsubagent 適合用於平行調查或劃分專業領域，但若連小型工作都委派出去，成本與延遲時間便會增加。可明確制定以下政策。\n\n- 僅對能夠獨立拆分的工作使用 subagent。\n- 限制單次請求中可同時執行的數量。\n- 為每個 subagent 設定明確的產出物與終止條件。\n- 避免多個代理重複搜尋相同資料。\n- 若預估成本或時間超過臨界值，則須取得人工核准。\n\n### 3. 將細部禁止規則改為判斷標準\n\n冗長的禁止清單可能彼此衝突，也可能無法處理新的情況。對於風險較低的領域，例如風格，可讓模型閱讀周邊上下文後自行判斷。\n\n- 規定型：`絕對不要撰寫包含多個段落的 docstring。`\n- 委派判斷型：`遵循既有程式碼的註解密度、docstring 格式、命名方式與慣用寫法。`\n\n但對於個人資料處理、安全及法律義務等違規成本較高的規則，仍應保留明確限制及程式化檢查。\n\n### 4. 直接指定回應長度與輸出格式\n\n用於推理的資源與使用者看到的回答長度並非同一概念。即使用戶端提供 `effort` 或類似的推理強度選項，若需要簡短回答，仍應另行撰寫輸出條件。\n\n範例如下。\n\n- `先寫結論，依據整理為三項以內。`\n- `最終回答請控制在 500字以內。`\n- `僅傳回有效的 JSON 物件，不要提供說明。`\n- `只報告變更檔案、核心原因與剩餘風險。`\n\n### 5. 根據實際工作重新校準推理強度\n\n不要將先前模型使用的推理強度或 effort 預設值原封不動地套用至新模型。應從較低設定開始，僅在品質不足時提高設定，以衡量成本曲線。\n\n| 工作類型 | 初始設定方向 | 提高條件 |\n|---|---|---|\n| 分類、格式轉換 | 從低設定開始 | 結構描述錯誤或遺漏反覆發生時 |\n| 一般文件、程式碼修改 | 比較中等範圍 | 遺漏多個檔案間的相依關係時 |\n| 複雜除錯 | 測試中等以上設定 | 原因分析與驗證成功率不足時 |\n| 長期代理工作 | 分階段衡量 | 需要重新規劃、復原的高難度區段 |\n\n選項的正確名稱及支援範圍可能依 API 版本與產品而異，因此必須查看官方文件。\n\n### 6. 依角色劃分上下文並逐步揭露\n\n若將所有指引都放入單一系統提示詞或 `CLAUDE.md`，則每次請求都可能包含無關資訊。以下階層結構較為實用。\n\n1. **系統、產品指引：** 角色、安全界線、輸出契約等始終需要的規則\n2. **精簡的專案指引：** 建置命令、目錄結構、共同工作方式\n3. **需要時載入的 Skill：** 部署、資料庫變更、特定框架等條件式程序\n4. **技術參考資料：** API 結構描述、程式碼範例、設計文件、可測試的規格\n\n這可稱為**逐步揭露**。應讓模型搜尋或載入目前階段所需的資料，但必須記錄使用了哪些資料，才能確保可重現性與可稽核性。\n\n## 建議的遷移程序\n\n### 第 1 階段：固定目前狀態\n\n儲存既有模型的提示詞、工具版本、成功率、token 使用量、延遲時間及失敗案例。若沒有基準線，就難以判斷新模型是否確實有所改善。\n\n### 第 2 階段：驗證模型資訊與權限\n\n確認官方模型 ID、價格、上下文限制、工具支援及資料保留政策。在測試環境中，應限制寫入、刪除及部署權限。\n\n### 第 3 階段：原樣測試既有執行框架\n\n起初不要一次改變所有項目。只替換模型並與基準線比較，即可單獨評估模型變更所造成的影響。\n\n### 第 4 階段：逐一移除重複指示\n\n依類別逐一移除驗證指示、冗長的風格規則、不必要的範例及每次都注入的參考資料。每次變更後都應重新衡量品質與成本。\n\n### 第 5 階段：建立路由政策\n\n根據業務難度、風險、預期上下文及時間限制選擇模型。所提供資料建議的各模型角色，應在確認正式名稱與效能後作為假設進行測試，不應直接採納為營運政策。\n\n### 第 6 階段：從有限流量開始部署\n\n先套用於部分使用者或非高風險工作。觀察失敗率、重試次數、subagent 數量、工具錯誤及人工修改時間後，再擴大適用範圍。\n\n## 營運檢查清單\n\n- [ ] 已確認官方模型名稱與 API 模型 ID。\n- [ ] 已確認輸入、輸出、快取、批次等實際適用費用。\n- [ ] 已具備由實際業務組成的內部評估集。\n- [ ] 模型與執行框架的驗證階段沒有重複。\n- [ ] 已設定 subagent 呼叫標準、同時執行數量及預算上限。\n- [ ] 已明確指定回應長度與輸出結構描述。\n- [ ] 已比較不同推理強度下的品質、成本及延遲時間。\n- [ ] 高風險工作仍保留確定性檢查與人工核准。\n- [ ] 上下文已分為常駐指引、Skill 及參考資料。\n- [ ] 已備妥可供復原的既有模型與設定。\n\n## 結論\n\n轉換新模型的核心，並不在於一味縮短提示詞或一味擴大自主性。核心是**先確認官方產品資訊，再透過實際業務評估重新劃分模型與執行框架的角色**。\n\n在確認官方依據之前，所提供資料中與 Claude Opus 5 有關的數值及名稱都應視為暫定資訊。不過，移除重複驗證、限制 subagent、訂立明確的輸出契約、逐步揭露上下文，以及依據內部評估進行路由，都是不受模型世代影響、可普遍套用的轉換原則。","content_html":"\u003cp\u003e所提供的資料將 Claude Opus 5 介紹為適合日常企業與代理工作使用的模型，並主張在新一代 Claude 中，必須重新設計既有提示詞與執行框架。然而，資料中提及的 \u003cstrong\u003eClaude Opus 5、Fable 5、Sonnet 5 的發布日期、價格、效能及合作夥伴發言，無法僅憑本文提供的資訊進行獨立驗證。\u003c/strong\u003e 尤其應先從官方模型清單確認 \u003ccode\u003eFable\u003c/code\u003e 是否為 Anthropic 的正式模型名稱。\u003c/p\u003e\n\u003cp\u003e因此，本文不會將上述發布資訊當作已確定的事實重複陳述，而是分別整理需要透過官方文件確認的項目，以及可套用於實際模型轉換的驗證程序。\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#%E9%A6%96%E5%85%88%E9%9C%80%E8%A6%81%E7%A2%BA%E8%AA%8D%E7%9A%84%E7%99%BC%E5%B8%83%E8%B3%87%E8%A8%8A\" class=\"anchor\" id=\"首先需要確認的發布資訊\"\u003e\u003c/a\u003e首先需要確認的發布資訊\u003c/h2\u003e\n\u003cp\u003e在將新模型套用至 API、Claude 應用程式或 Claude Code 之前，應將以下項目與 Anthropic 官方文件及目前使用服務中的模型選擇畫面進行核對。\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003e確認項目\u003c/th\u003e\n\u003cth\u003e所提供資料的主張\u003c/th\u003e\n\u003cth\u003e必要的驗證\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"確認項目\"\u003e模型名稱\u003c/td\u003e\n\u003ctd data-label=\"所提供資料的主張\"\u003eClaude Opus 5、Fable 5、Sonnet 5\u003c/td\u003e\n\u003ctd data-label=\"必要的驗證\"\u003e官方模型清單中的正確產品名稱與模型 ID\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"確認項目\"\u003e發布日期\u003c/td\u003e\n\u003ctd data-label=\"所提供資料的主張\"\u003e分別為 6月 9日、6月 30日、7月 24日\u003c/td\u003e\n\u003ctd data-label=\"必要的驗證\"\u003e官方公告與變更記錄中的年份及日期\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"確認項目\"\u003eOpus 5 價格\u003c/td\u003e\n\u003ctd data-label=\"所提供資料的主張\"\u003e輸入 5美元、輸出 25美元／100萬 token\u003c/td\u003e\n\u003ctd data-label=\"必要的驗證\"\u003e官方 API 價目表，以及批次、快取、長篇上下文的另行計費\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"確認項目\"\u003e產品內的預設模型\u003c/td\u003e\n\u003ctd data-label=\"所提供資料的主張\"\u003eClaude Max 的新預設模型\u003c/td\u003e\n\u003ctd data-label=\"必要的驗證\"\u003e是否依地區、方案、用戶端而適用\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"確認項目\"\u003e模型間的角色\u003c/td\u003e\n\u003ctd data-label=\"所提供資料的主張\"\u003e區分為長期自主工作、日常工作、輕量工作\u003c/td\u003e\n\u003ctd data-label=\"必要的驗證\"\u003e官方模型說明與實際業務評估結果\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"確認項目\"\u003e效能改善\u003c/td\u003e\n\u003ctd data-label=\"所提供資料的主張\"\u003e相較於先前模型提升特定比例\u003c/td\u003e\n\u003ctd data-label=\"必要的驗證\"\u003e評估任務、樣本數、衡量標準、合作夥伴原文\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003e若官方文件中沒有模型名稱或價格，就不應將其用於 API 設定及預算計算。若使用雲端服務供應商或轉售服務，其模型 ID、價格及供應時間也可能與 Anthropic 直接 API 不同。\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#%E6%A8%A1%E5%9E%8B%E8%BD%89%E6%8F%9B%E6%99%82%E6%87%89%E6%94%B9%E8%AE%8A%E7%9A%84%E5%88%A4%E6%96%B7%E6%A8%99%E6%BA%96\" class=\"anchor\" id=\"模型轉換時應改變的判斷標準\"\u003e\u003c/a\u003e模型轉換時應改變的判斷標準\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#1-%E8%A1%A1%E9%87%8F%E6%AF%8F%E9%A0%85%E5%B7%A5%E4%BD%9C%E7%9A%84%E6%95%88%E7%8E%87%E8%80%8C%E9%9D%9E%E6%9C%80%E9%AB%98%E6%95%88%E8%83%BD\" class=\"anchor\" id=\"1-衡量每項工作的效率而非最高效能\"\u003e\u003c/a\u003e1. 衡量每項工作的效率，而非最高效能\u003c/h3\u003e\n\u003cp\u003e當代理重複呼叫多個工具與 subagent 時，讓最昂貴的模型處理所有請求，可能迅速增加成本。選擇模型時，不應只看名稱或等級，而應綜合考量以下指標。\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\n\u003cstrong\u003e成功率：\u003c/strong\u003e 無需人工修改即可滿足要求的比例\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003e總成本：\u003c/strong\u003e 不僅包含首次請求，也包含重試、工具呼叫及 subagent 呼叫的成本\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003e完成時間：\u003c/strong\u003e 包含等待時間以及人工審查、修改時間\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003e失敗成本：\u003c/strong\u003e 安全漏洞、錯誤部署、分析遺漏等失敗所造成的影響\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003e一致性：\u003c/strong\u003e 重複執行同類工作時，結果出現波動的程度\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003e不能只根據 token 單價判斷每項工作的成本。概念上可按以下方式計算。\u003c/p\u003e\n\u003cp\u003e\u003ccode\u003e每項工作的總成本 = 主要模型成本 + subagent 成本 + 工具成本 + 重試成本 + 人工審查成本\u003c/code\u003e\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#2-%E5%B0%87%E5%85%AC%E9%96%8B%E5%9F%BA%E6%BA%96%E6%B8%AC%E8%A9%A6%E8%88%87%E5%85%A7%E9%83%A8%E8%A9%95%E4%BC%B0%E5%88%86%E9%96%8B\" class=\"anchor\" id=\"2-將公開基準測試與內部評估分開\"\u003e\u003c/a\u003e2. 將公開基準測試與內部評估分開\u003c/h3\u003e\n\u003cp\u003e公開基準測試是比較模型一般特性的起點，但無法保證模型在特定程式碼庫、文件格式及業務規則下能夠成功。組織應將實際工作匿名化，建立自己的評估集。\u003c/p\u003e\n\u003cp\u003e良好的評估集應同時包含以下案例。\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e應能正常完成的代表性工作\u003c/li\u003e\n\u003cli\u003e模型經常出錯的邊界案例\u003c/li\u003e\n\u003cli\u003e要求模糊、需要進一步提問的工作\u003c/li\u003e\n\u003cli\u003e需要呼叫工具或確認外部資料的工作\u003c/li\u003e\n\u003cli\u003e應停止執行或取得人工核准的高風險工作\u003c/li\u003e\n\u003cli\u003e長時間執行期間需要儲存並復原狀態的工作\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003e必須對每個模型套用相同的輸入、工具、時間限制及成功標準，才能進行比較。與一兩次令人印象深刻的結果相比，記錄多次重複執行後的成功率與成本分布更為安全。\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#3-%E5%B0%87%E6%A8%A1%E5%9E%8B%E8%88%87%E5%9F%B7%E8%A1%8C%E6%A1%86%E6%9E%B6%E8%A6%96%E7%82%BA%E5%96%AE%E4%B8%80%E7%B3%BB%E7%B5%B1%E9%80%B2%E8%A1%8C%E8%A9%95%E4%BC%B0\" class=\"anchor\" id=\"3-將模型與執行框架視為單一系統進行評估\"\u003e\u003c/a\u003e3. 將模型與執行框架視為單一系統進行評估\u003c/h3\u003e\n\u003cp\u003e**執行框架（harness）**是指模型周圍的執行環境。其中包含系統提示詞、專案指引、搜尋、記憶體、工具、Skill、subagent、權限管理、驗證及重試邏輯。\u003c/p\u003e\n\u003cp\u003e即使是相同模型，結果也可能因執行框架而異。例如，若模型本身會撰寫並執行測試，而執行框架又強制進行相同驗證，就可能重複執行同一項工作。相反地，若連部署核准或安全檢查等需要確定性控制的階段，也交由模型自行判斷，則會帶來風險。\u003c/p\u003e\n\u003cp\u003e核心原則是\u003cstrong\u003e區分模型擅長的推理，以及系統必須確保執行的控制措施\u003c/strong\u003e。\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#%E6%8F%90%E7%A4%BA%E8%A9%9E%E8%88%87%E5%9F%B7%E8%A1%8C%E6%A1%86%E6%9E%B6%E4%B8%AD%E6%87%89%E6%AA%A2%E6%9F%A5%E7%9A%84-6-%E5%80%8B%E9%A0%85%E7%9B%AE\" class=\"anchor\" id=\"提示詞與執行框架中應檢查的-6-個項目\"\u003e\u003c/a\u003e提示詞與執行框架中應檢查的 6 個項目\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#1-%E9%80%8F%E9%81%8E%E5%AF%A6%E9%A9%97%E7%A7%BB%E9%99%A4%E9%87%8D%E8%A4%87%E7%9A%84%E9%A9%97%E8%AD%89%E8%88%87%E5%86%8D%E6%AC%A1%E7%A2%BA%E8%AA%8D%E6%8C%87%E7%A4%BA\" class=\"anchor\" id=\"1-透過實驗移除重複的驗證與再次確認指示\"\u003e\u003c/a\u003e1. 透過實驗移除重複的驗證與再次確認指示\u003c/h3\u003e\n\u003cp\u003e直接刪除 \u003ccode\u003e完成後務必再次確認\u003c/code\u003e 之類的句子，並不一定是正確答案。應先追蹤新模型自主執行的驗證是否與執行框架的驗證階段重疊。\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e若模型只是不斷重複自行審查，品質卻沒有改善，就應精簡提示詞。\u003c/li\u003e\n\u003cli\u003e測試、結構描述驗證、靜態分析等可自動化的檢查應保留在執行框架中。\u003c/li\u003e\n\u003cli\u003e付款、部署、資料刪除等高風險工作的核准，不應由模型的自行驗證取代。\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3\u003e\n\u003ca href=\"#2-%E8%A8%AD%E5%AE%9A-subagent-%E7%9A%84%E5%91%BC%E5%8F%AB%E6%A2%9D%E4%BB%B6%E8%88%87%E4%B8%8A%E9%99%90\" class=\"anchor\" id=\"2-設定-subagent-的呼叫條件與上限\"\u003e\u003c/a\u003e2. 設定 subagent 的呼叫條件與上限\u003c/h3\u003e\n\u003cp\u003esubagent 適合用於平行調查或劃分專業領域，但若連小型工作都委派出去，成本與延遲時間便會增加。可明確制定以下政策。\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e僅對能夠獨立拆分的工作使用 subagent。\u003c/li\u003e\n\u003cli\u003e限制單次請求中可同時執行的數量。\u003c/li\u003e\n\u003cli\u003e為每個 subagent 設定明確的產出物與終止條件。\u003c/li\u003e\n\u003cli\u003e避免多個代理重複搜尋相同資料。\u003c/li\u003e\n\u003cli\u003e若預估成本或時間超過臨界值，則須取得人工核准。\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3\u003e\n\u003ca href=\"#3-%E5%B0%87%E7%B4%B0%E9%83%A8%E7%A6%81%E6%AD%A2%E8%A6%8F%E5%89%87%E6%94%B9%E7%82%BA%E5%88%A4%E6%96%B7%E6%A8%99%E6%BA%96\" class=\"anchor\" id=\"3-將細部禁止規則改為判斷標準\"\u003e\u003c/a\u003e3. 將細部禁止規則改為判斷標準\u003c/h3\u003e\n\u003cp\u003e冗長的禁止清單可能彼此衝突，也可能無法處理新的情況。對於風險較低的領域，例如風格，可讓模型閱讀周邊上下文後自行判斷。\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e規定型：\u003ccode\u003e絕對不要撰寫包含多個段落的 docstring。\u003c/code\u003e\n\u003c/li\u003e\n\u003cli\u003e委派判斷型：\u003ccode\u003e遵循既有程式碼的註解密度、docstring 格式、命名方式與慣用寫法。\u003c/code\u003e\n\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003e但對於個人資料處理、安全及法律義務等違規成本較高的規則，仍應保留明確限制及程式化檢查。\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#4-%E7%9B%B4%E6%8E%A5%E6%8C%87%E5%AE%9A%E5%9B%9E%E6%87%89%E9%95%B7%E5%BA%A6%E8%88%87%E8%BC%B8%E5%87%BA%E6%A0%BC%E5%BC%8F\" class=\"anchor\" id=\"4-直接指定回應長度與輸出格式\"\u003e\u003c/a\u003e4. 直接指定回應長度與輸出格式\u003c/h3\u003e\n\u003cp\u003e用於推理的資源與使用者看到的回答長度並非同一概念。即使用戶端提供 \u003ccode\u003eeffort\u003c/code\u003e 或類似的推理強度選項，若需要簡短回答，仍應另行撰寫輸出條件。\u003c/p\u003e\n\u003cp\u003e範例如下。\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\u003ccode\u003e先寫結論，依據整理為三項以內。\u003c/code\u003e\u003c/li\u003e\n\u003cli\u003e\u003ccode\u003e最終回答請控制在 500字以內。\u003c/code\u003e\u003c/li\u003e\n\u003cli\u003e\u003ccode\u003e僅傳回有效的 JSON 物件，不要提供說明。\u003c/code\u003e\u003c/li\u003e\n\u003cli\u003e\u003ccode\u003e只報告變更檔案、核心原因與剩餘風險。\u003c/code\u003e\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch3\u003e\n\u003ca href=\"#5-%E6%A0%B9%E6%93%9A%E5%AF%A6%E9%9A%9B%E5%B7%A5%E4%BD%9C%E9%87%8D%E6%96%B0%E6%A0%A1%E6%BA%96%E6%8E%A8%E7%90%86%E5%BC%B7%E5%BA%A6\" class=\"anchor\" id=\"5-根據實際工作重新校準推理強度\"\u003e\u003c/a\u003e5. 根據實際工作重新校準推理強度\u003c/h3\u003e\n\u003cp\u003e不要將先前模型使用的推理強度或 effort 預設值原封不動地套用至新模型。應從較低設定開始，僅在品質不足時提高設定，以衡量成本曲線。\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003e工作類型\u003c/th\u003e\n\u003cth\u003e初始設定方向\u003c/th\u003e\n\u003cth\u003e提高條件\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"工作類型\"\u003e分類、格式轉換\u003c/td\u003e\n\u003ctd data-label=\"初始設定方向\"\u003e從低設定開始\u003c/td\u003e\n\u003ctd data-label=\"提高條件\"\u003e結構描述錯誤或遺漏反覆發生時\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"工作類型\"\u003e一般文件、程式碼修改\u003c/td\u003e\n\u003ctd data-label=\"初始設定方向\"\u003e比較中等範圍\u003c/td\u003e\n\u003ctd data-label=\"提高條件\"\u003e遺漏多個檔案間的相依關係時\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"工作類型\"\u003e複雜除錯\u003c/td\u003e\n\u003ctd data-label=\"初始設定方向\"\u003e測試中等以上設定\u003c/td\u003e\n\u003ctd data-label=\"提高條件\"\u003e原因分析與驗證成功率不足時\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"工作類型\"\u003e長期代理工作\u003c/td\u003e\n\u003ctd data-label=\"初始設定方向\"\u003e分階段衡量\u003c/td\u003e\n\u003ctd data-label=\"提高條件\"\u003e需要重新規劃、復原的高難度區段\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003e選項的正確名稱及支援範圍可能依 API 版本與產品而異，因此必須查看官方文件。\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#6-%E4%BE%9D%E8%A7%92%E8%89%B2%E5%8A%83%E5%88%86%E4%B8%8A%E4%B8%8B%E6%96%87%E4%B8%A6%E9%80%90%E6%AD%A5%E6%8F%AD%E9%9C%B2\" class=\"anchor\" id=\"6-依角色劃分上下文並逐步揭露\"\u003e\u003c/a\u003e6. 依角色劃分上下文並逐步揭露\u003c/h3\u003e\n\u003cp\u003e若將所有指引都放入單一系統提示詞或 \u003ccode\u003eCLAUDE.md\u003c/code\u003e，則每次請求都可能包含無關資訊。以下階層結構較為實用。\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003e\n\u003cstrong\u003e系統、產品指引：\u003c/strong\u003e 角色、安全界線、輸出契約等始終需要的規則\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003e精簡的專案指引：\u003c/strong\u003e 建置命令、目錄結構、共同工作方式\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003e需要時載入的 Skill：\u003c/strong\u003e 部署、資料庫變更、特定框架等條件式程序\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003e技術參考資料：\u003c/strong\u003e API 結構描述、程式碼範例、設計文件、可測試的規格\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003e這可稱為\u003cstrong\u003e逐步揭露\u003c/strong\u003e。應讓模型搜尋或載入目前階段所需的資料，但必須記錄使用了哪些資料，才能確保可重現性與可稽核性。\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#%E5%BB%BA%E8%AD%B0%E7%9A%84%E9%81%B7%E7%A7%BB%E7%A8%8B%E5%BA%8F\" class=\"anchor\" id=\"建議的遷移程序\"\u003e\u003c/a\u003e建議的遷移程序\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#%E7%AC%AC-1-%E9%9A%8E%E6%AE%B5%E5%9B%BA%E5%AE%9A%E7%9B%AE%E5%89%8D%E7%8B%80%E6%85%8B\" class=\"anchor\" id=\"第-1-階段固定目前狀態\"\u003e\u003c/a\u003e第 1 階段：固定目前狀態\u003c/h3\u003e\n\u003cp\u003e儲存既有模型的提示詞、工具版本、成功率、token 使用量、延遲時間及失敗案例。若沒有基準線，就難以判斷新模型是否確實有所改善。\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#%E7%AC%AC-2-%E9%9A%8E%E6%AE%B5%E9%A9%97%E8%AD%89%E6%A8%A1%E5%9E%8B%E8%B3%87%E8%A8%8A%E8%88%87%E6%AC%8A%E9%99%90\" class=\"anchor\" id=\"第-2-階段驗證模型資訊與權限\"\u003e\u003c/a\u003e第 2 階段：驗證模型資訊與權限\u003c/h3\u003e\n\u003cp\u003e確認官方模型 ID、價格、上下文限制、工具支援及資料保留政策。在測試環境中，應限制寫入、刪除及部署權限。\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#%E7%AC%AC-3-%E9%9A%8E%E6%AE%B5%E5%8E%9F%E6%A8%A3%E6%B8%AC%E8%A9%A6%E6%97%A2%E6%9C%89%E5%9F%B7%E8%A1%8C%E6%A1%86%E6%9E%B6\" class=\"anchor\" id=\"第-3-階段原樣測試既有執行框架\"\u003e\u003c/a\u003e第 3 階段：原樣測試既有執行框架\u003c/h3\u003e\n\u003cp\u003e起初不要一次改變所有項目。只替換模型並與基準線比較，即可單獨評估模型變更所造成的影響。\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#%E7%AC%AC-4-%E9%9A%8E%E6%AE%B5%E9%80%90%E4%B8%80%E7%A7%BB%E9%99%A4%E9%87%8D%E8%A4%87%E6%8C%87%E7%A4%BA\" class=\"anchor\" id=\"第-4-階段逐一移除重複指示\"\u003e\u003c/a\u003e第 4 階段：逐一移除重複指示\u003c/h3\u003e\n\u003cp\u003e依類別逐一移除驗證指示、冗長的風格規則、不必要的範例及每次都注入的參考資料。每次變更後都應重新衡量品質與成本。\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#%E7%AC%AC-5-%E9%9A%8E%E6%AE%B5%E5%BB%BA%E7%AB%8B%E8%B7%AF%E7%94%B1%E6%94%BF%E7%AD%96\" class=\"anchor\" id=\"第-5-階段建立路由政策\"\u003e\u003c/a\u003e第 5 階段：建立路由政策\u003c/h3\u003e\n\u003cp\u003e根據業務難度、風險、預期上下文及時間限制選擇模型。所提供資料建議的各模型角色，應在確認正式名稱與效能後作為假設進行測試，不應直接採納為營運政策。\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#%E7%AC%AC-6-%E9%9A%8E%E6%AE%B5%E5%BE%9E%E6%9C%89%E9%99%90%E6%B5%81%E9%87%8F%E9%96%8B%E5%A7%8B%E9%83%A8%E7%BD%B2\" class=\"anchor\" id=\"第-6-階段從有限流量開始部署\"\u003e\u003c/a\u003e第 6 階段：從有限流量開始部署\u003c/h3\u003e\n\u003cp\u003e先套用於部分使用者或非高風險工作。觀察失敗率、重試次數、subagent 數量、工具錯誤及人工修改時間後，再擴大適用範圍。\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#%E7%87%9F%E9%81%8B%E6%AA%A2%E6%9F%A5%E6%B8%85%E5%96%AE\" class=\"anchor\" id=\"營運檢查清單\"\u003e\u003c/a\u003e營運檢查清單\u003c/h2\u003e\n\u003cul\u003e\n\u003cli\u003e 已確認官方模型名稱與 API 模型 ID。\u003c/li\u003e\n\u003cli\u003e 已確認輸入、輸出、快取、批次等實際適用費用。\u003c/li\u003e\n\u003cli\u003e 已具備由實際業務組成的內部評估集。\u003c/li\u003e\n\u003cli\u003e 模型與執行框架的驗證階段沒有重複。\u003c/li\u003e\n\u003cli\u003e 已設定 subagent 呼叫標準、同時執行數量及預算上限。\u003c/li\u003e\n\u003cli\u003e 已明確指定回應長度與輸出結構描述。\u003c/li\u003e\n\u003cli\u003e 已比較不同推理強度下的品質、成本及延遲時間。\u003c/li\u003e\n\u003cli\u003e 高風險工作仍保留確定性檢查與人工核准。\u003c/li\u003e\n\u003cli\u003e 上下文已分為常駐指引、Skill 及參考資料。\u003c/li\u003e\n\u003cli\u003e 已備妥可供復原的既有模型與設定。\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch2\u003e\n\u003ca href=\"#%E7%B5%90%E8%AB%96\" class=\"anchor\" id=\"結論\"\u003e\u003c/a\u003e結論\u003c/h2\u003e\n\u003cp\u003e轉換新模型的核心，並不在於一味縮短提示詞或一味擴大自主性。核心是\u003cstrong\u003e先確認官方產品資訊，再透過實際業務評估重新劃分模型與執行框架的角色\u003c/strong\u003e。\u003c/p\u003e\n\u003cp\u003e在確認官方依據之前，所提供資料中與 Claude Opus 5 有關的數值及名稱都應視為暫定資訊。不過，移除重複驗證、限制 subagent、訂立明確的輸出契約、逐步揭露上下文，以及依據內部評估進行路由，都是不受模型世代影響、可普遍套用的轉換原則。\u003c/p\u003e\n","tags":["提示詞工程","AI 代理人","Anthropic","Claude","模型評估"],"faqs":[{"question":"Claude Opus 5 是正式推出的模型嗎？","answer":"所提供的資料中雖然列出了發布日期和價格，但僅憑本文提供的資訊，尚無法獨立確認。在 Anthropic 官方模型清單、公告、API 控制台中確認確切的模型名稱和模型 ID 之前，最好不要將其視為已確定的產品資訊。"},{"question":"Fable 5 是 Anthropic 的官方模型名稱嗎？","answer":"僅憑所提供的資料無法確認。即使產品名稱相似，Anthropic 的 API 模型 ID 或各服務中的標示也可能不同，因此必須在官方模型清單中驗證 `Fable 5` 這個名稱是否確實存在。"},{"question":"改用新的 Claude 模型後，必須刪除所有現有的提示詞嗎？","answer":"不必。應先使用現有設定進行基準評估，接著逐一移除重複的驗證指示或不必要的風格規則，同時比較品質和成本。對於安全檢查、輸出結構描述驗證、部署核准等必須由系統保障的管控措施，則應予以保留。"},{"question":"什麼是執行框架？","answer":"執行框架是環繞 AI 模型、使其能在實際工作中運作的系統。其中包括系統提示詞、專案指引、工具、搜尋、記憶體、技能、子代理程式、重試、權限管理和自動驗證流程。"},{"question":"應如何限制子代理程式的使用量？","answer":"僅用於能夠獨立拆分的工作，並為同時執行數量和總呼叫次數設定上限。可明確規定各子代理程式的產出和終止條件，並設計成當預估成本或時間超過臨界值時，必須取得人工核准。"},{"question":"為什麼自行評估比公開基準測試更重要？","answer":"公開基準測試無法如實反映組織的程式碼庫、文件格式、工具環境和失敗成本。必須透過實際工作案例衡量成功率、總成本、完成時間和結果一致性，才能判斷哪種模型適合營運環境。"},{"question":"如果模型具備自我驗證功能，就可以取消測試嗎？","answer":"不可以。模型的自我檢查是輔助手段，不能取代測試、結構描述檢查、靜態分析和安全政策。尤其是部署、付款、資料刪除等高風險工作，需要確定性檢查和人工核准。"},{"question":"調低 effort 後，回答也會自動變短嗎？","answer":"不一定。推理強度和最終輸出長度可能是分開控制的項目。如果需要簡潔的回答，應在提示詞中直接指定字數、項目數、輸出結構描述等回應格式。"}],"sources":[{"url":"https://docs.anthropic.com/en/docs/about-claude/models/overview","title":"Anthropic 文件：模型概覽","type":"source"},{"url":"https://www.anthropic.com/pricing","title":"Anthropic 定價","type":"data_point"},{"url":"https://docs.anthropic.com/en/docs/build-with-claude/prompt-engineering/overview","title":"Anthropic 文件：提示詞工程概覽","type":"source"},{"url":"https://docs.anthropic.com/en/docs/claude-code/memory","title":"Anthropic 文件：Claude Code 記憶體","type":"source"}],"images":[{"id":324,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MzY5MCwicHVyIjoiYmxvYl9pZCJ9fQ==--f44d725b558668593419631e29f28834deb66ecc/ai-95ae89bc.webp","is_representative":true,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"체크 항목과 경고 장벽 사이에서 AI 큐브를 돋보기로 점검하는 일러스트","caption":"모델 전환 전 프롬프트와 하네스의 성능, 보안, 비용을 점검하는 과정을 나타낸다.","description":null},"en":{"alt":"Illustration of AI cubes being inspected beside a warning barrier and checklist icons","caption":"The scene represents checking prompts, harnesses, performance, security, and cost before a model switch.","description":null},"ja":{"alt":"警告バリケードと確認項目のそばでAIキューブを虫眼鏡で点検するイラスト","caption":"モデル移行前にプロンプトやハーネスの性能、安全性、コストを確認する工程を表している。","description":null},"es":{"alt":"Ilustración de cubos de IA inspeccionados junto a una barrera de alerta e iconos de control","caption":"La escena representa la revisión de prompts, arneses, rendimiento, seguridad y costes antes de cambiar de modelo.","description":null},"id":{"alt":"Ilustrasi kubus AI yang diperiksa di dekat penghalang peringatan dan ikon daftar cek","caption":"Adegan ini menggambarkan pemeriksaan prompt, harness, kinerja, keamanan, dan biaya sebelum beralih model.","description":null},"pt":{"alt":"Ilustração de cubos de IA inspecionados junto a uma barreira de alerta e ícones de verificação","caption":"A cena representa a revisão de prompts, harnesses, desempenho, segurança e custos antes da troca de modelo.","description":null},"zh-hant":{"alt":"在警示柵欄與檢查圖示旁以放大鏡檢視 AI 方塊的插圖","caption":"此圖呈現模型切換前檢查提示詞、工具框架、效能、安全性與成本的流程。","description":null}}},{"id":325,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MzY5NiwicHVyIjoiYmxvYl9pZCJ9fQ==--5ddddd2dfbbbcedb1849fbdfe606aca94f9a98af/ai-b298a672.webp","is_representative":false,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"중앙 AI 모델에 보안, 문서, 사용자, 도구와 에이전트 차단 장치가 연결된 점검 구성도","caption":"모델 전환 전 프롬프트와 에이전트 하네스의 연결, 안전장치, 평가 항목을 점검하는 흐름을 나타낸다.","description":null},"en":{"alt":"AI model linked to security, documents, users, tools, agent controls, and evaluation indicators","caption":"The diagram contextualizes checks for prompts, agent harnesses, safeguards, and evaluations before a model switch.","description":null},"ja":{"alt":"中央のAIモデルにセキュリティ、文書、ユーザー、ツール、エージェント制御が接続された構成図","caption":"モデル移行前にプロンプトやエージェントハーネス、安全策、評価項目を確認する流れを示している。","description":null},"es":{"alt":"Modelo de IA conectado con seguridad, documentos, usuarios, herramientas, controles de agentes e indicadores","caption":"El diagrama representa la revisión de prompts, arneses de agentes, salvaguardas y evaluaciones antes de cambiar de modelo.","description":null},"id":{"alt":"Model AI terhubung ke keamanan, dokumen, pengguna, alat, kontrol agen, dan indikator evaluasi","caption":"Diagram ini menggambarkan pemeriksaan prompt, harness agen, pengaman, dan evaluasi sebelum pergantian model.","description":null},"pt":{"alt":"Modelo de IA ligado a segurança, documentos, usuários, ferramentas, controles de agentes e indicadores","caption":"O diagrama representa a verificação de prompts, harnesses de agentes, proteções e avaliações antes da troca de modelo.","description":null},"zh-hant":{"alt":"中央 AI 模型連接安全、文件、使用者、工具、代理控制與評估指標的架構圖","caption":"此圖呈現模型切換前對提示詞、代理框架、安全機制與評估項目的檢查流程。","description":null}}}],"published_at":"2026-07-28T11:42:11+09:00","updated_at":"2026-07-28T11:42:11+09:00","license":"cc_by","translation_status":"reviewed","available_locales":["ko","en","ja","es"],"data_locales":["ko","en","ja","es","id","pt","zh-hant"],"url":"https://injoys.com/en/articles/claude-opus-5-verification-and-migration-guide"}