Claude Opus 5.5の料金と性能比較

Claude Opus 5.5の標準的な入力・出力トークン単価は、Opus 5より20%低くなりました。作業コストの40%削減はAnthropicの評価結果であり、実際の費用はトークン使用量とキャッシュの活用状況によって異なります。

Claude Opus 5.5は、標準のトークン単価を20%引き下げたモデルです。コーディングとコンピューター操作の評価スコアも向上しました。作業コストの40%削減はAnthropicの試験結果です。

価格と評価の数値は、Anthropicが2026年9月22日に発表した時点のものです。

Claude Opus 5.5の価格比較

標準API料金は100万トークン当たり入力が4ドル、出力が20ドルです。トークンは、モデルが文章などを処理する単位です。入力はモデルに送る内容、出力はモデルが生成する内容を指します。

課金項目 Opus 5 Opus 5.5 単価の引き下げ率
通常の入力100万トークン 5ドル 4ドル 20%
出力100万トークン 25ドル 20ドル 20%
キャッシュ読み取り100万トークン 0.50ドル 0.20ドル 60%

金額は米ドルです。キャッシュは、繰り返し使う入力を保存して再利用する機能です。キャッシュの作成費用は、読み取り費用とは別に計算します。

作業コスト40%削減の条件

40%は、すべてのリクエストに適用される割引率ではありません。Anthropicがデフォルト設定での一般的な作業について算出した削減幅です。単価の引き下げと、作業当たりのトークン使用量の減少を合わせて反映しています。

使用条件 コストを左右する項目 確認する内容
毎回新しい内容を入力 通常の入力・出力の使用量 両項目の実際のトークン数
同じ文書や指示を繰り返し使用 キャッシュの作成・読み取りの使用量 キャッシュが実際に再利用されたか
複数の手順を実行するコーディングエージェント 繰り返しの呼び出しと再試行 作業完了までにかかった総コスト
月額定額制のサブスクリプション サブスクリプション料金と利用上限 トークン単価とサブスクリプション料金の区別

API単価の引き下げだけで、月額定額制のサブスクリプション料金も下がるわけではありません。自社サービスでの削減率を調べるには、同じ作業の使用量を比較してください。AnthropicのOpus案内でも、40%はトークン課金の作業に関する推定値として説明されています。

計算例

入力と出力をそれぞれ100万トークン使用すると、標準料金は24ドルです。比較のため、両モデルの使用量が同じだと仮定します。キャッシュと別途かかるツール費用は除いた計算です。

計算項目 Opus 5 Opus 5.5
通常の入力100万トークン 5ドル 4ドル
出力100万トークン 25ドル 20ドル
合計 30ドル 24ドル

差額は6ドルで、削減率は20%です。この計算には、作業当たりのトークン数が減る効果は含まれていません。そのため、単価だけを適用した結果は、発表された40%とは異なります。

キャッシュ読み取り100万トークンの差額は0.30ドルです。ただし、この金額は読み取り項目だけを比較した結果です。請求額全体には、キャッシュの作成やほかのトークン費用も反映する必要があります。

エージェントによるコーディングとコンピューター操作の性能

Anthropicの発表では、コーディングとコンピューター操作のスコアがともに向上しました。エージェントによるコーディングは、ツールを使いながら複数の手順にわたる開発作業を実行する方式です。コンピューター操作は、画面を見てインターフェースを操作する能力です。

評価 Opus 5 Opus 5.5 スコアの差
Terminal-Bench 4.0 52.3% 66.4% 14.1ポイント
CursorBench 4.0 46.6% 57.8% 11.2ポイント
OSWorld 2.1 74.0% 81.8% 7.8ポイント

公式発表に記載された評価名はOSWorld 2.1です。このスコアにはpartialの表示が付いています。ほかの結果と混同しないよう、バージョンと採点に関する表示を併記する必要があります。

Terminal-Bench 4.0のOpus 5.5の結果はxhigh設定によるものです。発表にあるデフォルト設定でのコスト推定値とは、評価条件が同じではありません。スコアの上昇だけで、実際のプロジェクトの成功率は計算できません。

速度と文章作成の変化

Anthropicは、出力の生成速度がOpus 5より30%を超えて速くなったと発表しました。これは文章が生成される速度に関する数値です。検索やテストを含む作業全体の所要時間がどれだけ減るかは、別途測定する必要があります。

文章作成については、要点を先に示し、読みやすく説明できるよう改善したとしています。ただし、韓国語文書の品質がどれだけ向上したかは、別途示されていません。チームで使う文書で、次の項目を確認してください。

安全性評価での約85%減少の意味

約85%の減少は、隔離された環境の境界を回避しようとする試みの減少率です。比較対象はOpus 5またはClaude Mythos 5.1です。実際のサービスでの事故率が同じ割合で下がったという意味ではありません。

サンドボックスは、プログラムのアクセス範囲を制限する実行環境です。モデルの安全性評価と、この環境によるアクセス制限は別のものです。評価スコアが向上しても、運用上の権限を自動的に拡大する根拠にはなりません。

Anthropicは、デプロイ前にすべての失敗を見つける評価は、まだ難しいと説明しています。数値が示す範囲は、Claude Opus 5.5の発表にある安全性の項目で確認できます。運用時には、ファイルへのアクセス範囲と実行記録を併せて点検してください。

API移行時に確認する設定

既存のAPI連携では、モデル名以外の設定も確認する必要があります。Claude APIのモデル識別子はclaude-opus-5-5です。ほかのクラウドでは、各プラットフォームのモデル識別子を使用します。

公式の移行文書には、推論設定の変更について次のように明記されています。

Thinking can't be disabled

出典はAnthropicのMigrating to Claude Opus 5.5です。これは、推論をオフにする設定には対応していないという意味です。

  1. 既存のリクエストに、推論をオフにする設定がないか確認してください。Opus 5.5はその設定を拒否します。
  2. 推論の強度を表すeffortを明示してください。Opus 5.5のデフォルト値はmediumです。
  3. 特定のツール呼び出しを強制する設定を点検してください。対応していない設定はリクエストエラーを引き起こします。
  4. レスポンスはブロックのtypeで区別して処理してください。最初のブロックが常に回答のテキストとは限りません。
  5. 同じ作業でコストと完了までの時間を再測定してください。推論トークンも出力料金に含まれます。

公開当時、AWS、Google Cloud、Microsoft Azureへの対応も発表されました。モデル識別子やツールの対応条件は、プラットフォームによって異なる場合があります。既存の連携で使用していたモデルに合わせて、移行文書を確認してください。

よくある間違い

価格と性能の数値は、何を測定したものかを区別して読む必要があります。単価、作業コスト、評価スコアはそれぞれ異なる指標です。次のように区別すると、比較条件を保てます。

混同しやすい解釈 確認された意味
すべての請求額が40%減少 デフォルト設定での一般的な作業に関する推定値
キャッシュを使うと全体のコストが60%減少 キャッシュ読み取りの単価のみ60%引き下げ
性能が14.1%向上 Terminal-Benchのスコアが14.1ポイント向上
すべての作業が30%早く完了 出力の生成速度が30%を超えて向上
実際の事故が85%減少 特定の評価で境界を回避しようとする試みが約85%減少

完了した作業当たりのコスト比較

モデルを選ぶ際は、レビューに合格した作業当たりのコストを比較してください。トークン単価だけでは、再試行や修正にかかる負担は分かりにくいものです。これは、発表された数値を実際の業務に当てはめるための比較方法です。

計算では、実行にかかった総コストを、レビューに合格した作業の数で割ります。失敗した試行のコストも総コストに含めてください。人によるレビューの時間を別項目として記録すると、比較に役立ちます。

FAQ

Claude Opus 5.5はいつ公開されましたか?

Anthropicは2026年9月22日にClaude Opus 5.5を公開しました。

Claude Opus 5.5の標準API料金はいくらですか?

公開当時、100万トークンあたり入力が4ドル、出力が20ドルです。どちらの単価もOpus 5より20%低くなっています。

費用は常に40%削減されますか?

40%はAnthropicが一般的なタスクについて算出した推定値です。実際の削減率はトークン使用量とキャッシュの活用状況によって変わります。

キャッシュの読み取り料金はどれくらい下がりましたか?

100万トークンあたり0.50ドルから0.20ドルに下がりました。読み取り単価の引き下げ率は60%です。キャッシュの作成費用は別途確認する必要があります。

コンピューター操作評価の正確な名称は何ですか?

公式発表での評価名はOSWorld 2.1です。Opus 5.5のスコアは81.8%で、partialの表示が付いています。

安全性に関する数値の85%は事故の減少率ですか?

特定の評価で、隔離境界を回避しようとする試みが約85%減ったという意味です。実際のサービスにおける事故の減少率を意味するものではありません。

既存のAPIではモデル名を変えるだけでいいですか?

既存のリクエスト設定によっては追加の修正が必要です。推論設定、ツール呼び出しの強制、応答ブロックの処理方法を移行ドキュメントで確認してください。

AWSとGoogle Cloudでも使えますか?

リリース発表にはAWS、Google Cloud、Microsoft Azureへの対応が含まれていました。モデル識別子と機能のサポート条件は各プラットフォームで確認してください。

出力速度の向上と作業時間の短縮は同じ意味ですか?

異なる指標です。出力の生成以外にツールの実行やテストが含まれると、全体の完了時間は変わります。

Sources

Images

サーバールームでタブレットを持ち、開いたサーバーラックを確認するエンジニア
サーバールームでタブレットを持ち、開いたサーバーラックを確認するエンジニア
開発者がテスト室で、接続された複数のスマートフォンを前にタブレットを確認している。
開発者がテスト室で、接続された複数のスマートフォンを前にタブレットを確認している。