TITLE

Claude Opus 5.5発表 ― 性能の伸びと20%値下げ、コストを決めるのは単価だけではない

投稿日:2026.09.23

CATEGORY

  • AI開発
Claude Opus 5.5発表 ― 性能の伸びと20%値下げ、コストを決めるのは単価だけではない

Anthropicは2026年9月22日、フラッグシップモデルの新版「Claude Opus 5.5」を発表しました。要点は2つです。ベンチマークで測った性能がOpus 5から大きく伸びたこと、そして価格は逆に20%下がったことです。性能が上がって値段が下がる組み合わせは歓迎したくなりますが、実際の導入判断では、ベンチマークの中身と、値下げが自社のコストにどう効くかを分けて見る必要があります。

ベンチマークが示す性能の伸び幅

Anthropicが公式に示した比較(Opus 5.5 / Opus 5)は次のとおりです。

  • Terminal-Bench 4.0(ターミナル操作タスク): 66.4% / 52.3%
  • GDPval-AA v2.1(汎用タスクのElo評価): 1846 / 1708
  • OSWorld 2.0(OS操作タスク): 81.8% / 74.0%

Terminal-BenchとGDPval-AAは二桁ポイント以上、OSWorldも7.8ポイントの伸びで、いずれも一方向に改善しています。開発者テストでは、68万行規模のコード移行を1日未満で完了したという報告もあります。従来なら数週間規模の作業に相当する分量です。これとは別に、Opus 5と比べてステップ数が半分未満で多くのterminalタスクを解決したとも報告されており、Webアプリのページ読み込み時間短縮タスクでは40件中39件が成功しています。エージェントに複数手順の作業を任せる場面で、少ない試行回数で完了まで到達する力が上がったことを示す数字です。

独立検証との整合性 ― 性能は本物、価格は「安くはない」

公式発表の数字は発表元が選んだベンチマークです。第三者の検証も確認しておく価値があります。Artificial Analysisは2026年9月時点で、Opus 5.5がIntelligence Index(複数ベンチマークを合成した総合指数)で58点を記録し、計測対象212モデル中1位だったと報告しています。同種モデルの中央値は25点なので、単独の高スコアではなく相対的な位置づけとしても裏付けが取れています。

一方で同じ調査は、価格面では入力$4.00/出力$20.00(100万トークンあたり)がいずれも同種モデルの中央値(入力$2.00・出力$10.00)より高い水準だとも示しています。Opus 5.5は「値下げされた」モデルではありますが、市場全体で見れば「安いモデル」ではなく「上位性能帯に見合う価格帯のモデル」という位置づけです。値下げのニュースだけを見て「他より安くなった」と早合点しないための確認ポイントです。

価格改定と、実際のコストを決めるもの

価格改定の内容は、入力トークンが100万あたり$4(旧$5、20%減)、出力が$20(旧$25、20%減)、キャッシュ読込は$0.20(旧$0.50、60%減)です。Anthropicは典型的なワークロードで総コストが約40%下がると説明しています。

ただし、この値下げが自社の請求にどれだけ効くかは、単価だけでは決まりません。私たちはClaudeの利用実績を確認したことがあり、2026年8月の請求内訳はキャッシュ読込が61.3%、1時間キャッシュの書込が31.1%で、合わせて92%がコンテキストの再読込代でした。実際に生成される出力トークン代は7.1%にとどまっています。つまり請求の大半を占めているのは「何を生成したか」ではなく「毎ターン何を読み込み直しているか」でした。

強調表示された1行がある請求書のイラスト

今回60%引き下げられたのはキャッシュ読込の単価で、私たちの請求で言えばこの61.3%の部分にあたります。同じ1時間キャッシュの書込(31.1%)は今回の価格改定リストに単価の記載がなく、値下げの直接的な対象かどうかはこの発表だけでは確認できません。つまり「請求の92%がコンテキスト代」という構造のうち、値下げの効果が確実に及ぶと言えるのはキャッシュ読込の分だけです。値下げのアナウンスを見て「40%安くなる」と一括りに捉えるのではなく、自社の請求のうちキャッシュ読込・キャッシュ書込・出力それぞれの比率がどうなっているかを先に確認するほうが、実際の効果を見積もる近道です。

安全性の強化と、ベンダー発表を鵜呑みにしない運用

価格と同じように、性能・安全性の公表数値も自社の実タスクでそのまま再現するとは限りません。Anthropicは今回、安全性の改善もあわせて発表しています。自動行動監査で同社モデル中最高スコアを記録し、プロンプトインジェクション耐性が向上、サンドボックス脱出の試行は85%減少したとしています。エージェントに実行権限を渡す場面が増えるほど、この種の指標は無視できません。

こうした公表数値を採用判断の唯一の根拠にするのは早計です。以前、私たちが開発した脆弱性診断ツールのセキュリティレビューにOpus 5とOpus 4.8を並走させ、実際の所見を突き合わせたことがあります。結果はOpus 5が中程度以上の所見を4件多く検出し、4.8が見落としていた実際のバグを2件捕捉しました。これは安全性そのものの比較ではなく、コードレビューの精度・網羅性を自分たちで測った結果ですが、「新しいモデルが優れている」というベンダーの主張を鵜呑みにせず自社の実タスクで検証したという点は、安全性の数字を評価する時にも同じように使えます。重要な判断に新しいモデルを使う前に、自社の実タスクで旧モデルと並走させて所見を比較する、という運用のほうが、発表内容をそのまま信じるよりも確実です。

まとめ

ここまでの3点の確認は、Opus 5.5に限った話ではありません。次にどのベンダーが新モデルを発表しても、同じ手順が使い回せます――①公式ベンチマークだけでなく第三者の独立検証があるか、②値下げが自社のトークン利用構造(出力中心かキャッシュ中心か)にどう効くか、③重要な判断に使う前に旧モデルと並走比較する余地があるか。Opus 5.5はベンチマーク・価格の双方で裏付けのある改善ですが、その効果の大きさは各社の使い方次第で変わります。

関連

AI エージェントを業務で回すときの設計と運用については、CTO の note に書いています。

出典

※ この記事は AI を使用しています。Leadeas が自社開発した AI エージェント基盤で下書きを作成し、人間のレビューを経て公開しています。AI ネイティブ開発会社として自社の技術をそのまま実演する目的で、この手法を用いています。(詳しくは AI 利用ポリシー)

AI

AI導入やシステム開発の ご相談を承っています。

お気軽にお問い合わせください

無料相談する

お問い合わせには1営業日以内にご返信します