Claude Opus 5.5(クロード・オーパス5.5)の性能【主要ベンチマークと得意な仕事】

新しいAIを試すなら、いつもの仕事のどこを任せるか決めておくと、性能の違いを見つけやすくなります。
Claude Opus 5.5の評価値には、開発や資料づくりで期待できることと、人が確認すべきことの両方が表れています。

Claude Opus 5.5(クロード・オーパス5.5)の性能【主要ベンチマークと得意な仕事】

Claude Opus 5.5(クロード・オーパス5.5)の性能を見るときは、コードの修正、資料づくり、画面操作を分けて評価すると、任せたい仕事が見えてきます。公開スコアを自社の成功率に置き換えず、比較条件まで確かめましょう。

Claude Opus 5.5の性能は何が変わったか

Anthropicが2026年9月22日に発表したClaude Opus 5.5は、公開評価で旧Opus 5を上回る成績を示しました。特に注目したいのは、指示を読んで複数の作業を進め、成果物を仕上げる力です。

要点試す仕事は「完成形」で選ぶ

たとえば、修正済みのコード、根拠を追える月次資料、確認済みの入力内容。何が出来上がれば合格かを先に決めると、モデル変更の効果を見比べられます。

Claude Opus 5.5をどの分野でも一律に最強と捉えるのは早計です。
以下は2026年9月23日に確認した評価値であり、評価に使う道具や推論設定も結果を左右します。

Claude Opus 5.5の主要ベンチマーク

ベンチマークは、決められた課題で性能を測るテストです。
Claude Opus 5.5とOpus 5について、仕事との関係を読み取りやすい6指標を抜き出しました。

評価指標Opus 5.5Opus 5
Terminal-Bench
4.0
66.4%52.3%
FrontierCode
1.1 Main
54.4%48.0%
CursorBench
4.0
57.8%46.6%
GDPval-AA
2.1(Elo)
18461708
AutomationBench40.0%26.9%
OSWorld 2.0
部分点あり
81.8%74.0%
Anthropic発表値から抜粋。指標ごとに課題・採点方式が異なります。

出典: Anthropic「Introducing Claude Opus 5.5」(英語)

上の3指標は開発作業GDPval-AAは資料などの成果物、AutomationBenchは業務の一連の処理、OSWorldは画面操作に関わる評価です。Eloは比較評価のレーティングであり、1846%という意味ではありません。

Opus 5.5の値は、考える深さを調整するeffortを最大のmaxにした成績です(Terminal-Benchのみxhigh)。APIの標準はmediumのため、標準設定で毎回この成績が出るとは限らず、異なるテストの%同士も足したり平均したりできません。

Claude Opus 5.5が得意な仕事と活用例

Claude Opus 5.5を試す候補は、途中の作業と最後の成果物を確認できる仕事です。以下は公開評価から考えられる活用例であり、自社での実測効果を保証するものではありません。

開発・修正
変更内容をテストで確かめる
資料の下書き
元データと照合する
業務の補助
操作結果を人が確認する

複数ファイルにまたがる開発・修正

Cursorの独自評価でも、max設定のClaude Opus 5.5はCursorBench 4.0で57.8%。実際の開発に近い課題を使う評価なので、既存コードを読み、変更箇所をまたいで直す仕事の検証候補になります。

出典: Cursor「CursorBench 4.0」(英語)

たとえば問い合わせフォームの改修なら、入力・送信・エラー表示まで動くことを合格条件にします。説明が流暢でも、テスト前のコードを本番へ反映しない運用は必要です。

文書・スライド・表計算の下書き

GDPval-AA 2.1は44職種・9業種の220課題を扱い、文書やスライドなどの成果物を比較します。名前を伏せた一対一の比較から算出した評価で、個社の資料作成時間を直接測った数字ではありません。

出典: Artificial Analysis「GDPval-AA 2.1」(英語)

検証例なら、過去の月次報告に使った資料を渡し、数値の変化と説明の食い違いを探す下書きを作らせる方法があります。引用元まで追えるかを見てから、文章の整え方を比べてください。

文書で試す方はClaude Docsの使い方、会議資料に落とし込む方はClaude Slidesの使い方も併読すると、試したい成果物を具体化できます。

複数の操作をつなぐ業務の補助

画面操作や業務フローの評価は、入力・確認・記録を組み合わせる仕事を試す判断材料になります。ただし、モデルの性能と、利用中のシステムへ接続できるかは別に確かめる必要があります。

AIに試してもらう作業

入力候補や下書きを作る
確認すべき差異を並べる

人が確認・決定すること

数値・宛先・権限を確認する
送信・公開・支払いを承認する

Claude Opus 5.5の性能評価で見落とせない限界

Claude Opus 5.5のOSWorld 2.0は部分点ありで81.8%ですが、System Cardで示された、すべての確認項目を満たす採点では48.7%です。「パソコン業務の約8割を完遂できる」と読み替えることはできません。

また、公開評価は安全対策を有効にして実施され、サイバー関連ではOpus 4.8、生物学・最先端LLM開発関連ではOpus 5への切り替えを含みます。製品としての処理結果と、単一モデルだけの能力を区別する視点も欠かせません。
AutomationBenchは切り替えを使わず、安全対策による介入を失敗として扱った別条件の評価です。

出典: Anthropic「Claude Opus 5.5 System Card」第8章(英語)

開発の得点が上がっても、すべての課題が改善するとは限りません。Sonarの発売前モデルを使ったJava評価では、実行テスト付き544課題の合格率は87.68%で、Opus 5の88.6%をわずかに下回りました。

出典: Sonar「Claude Opus 5.5: An evaluation」(英語)

注意評価の範囲を広げすぎない

特定の言語・課題・設定で得た結果を、日本語の社内文書や全プログラミング業務へそのまま当てはめないようにしてください。確認にかかる人の時間も、導入判断の一部です。

自社業務で試すときの合格基準

Claude Opus 5.5の導入を検討するなら、答えが分かっている過去の仕事で、普段使うモデルと比べるのが始めやすい方法です。同じ資料・同じ指示・同じ利用環境に揃えれば、違いを見つけやすくなります。

過去の仕事で試す
資料と指示を固定
修正時間まで測る
合格した範囲から使い、失敗した箇所は条件を見直す

合否は、完成品として使えるか確認・手直しの負担で決めます。次の項目を記録しておけば、回答の速さだけに引っ張られずに判断できます。

  • 正確さ:元データ、計算、出典、固有名詞が一致しているか
  • 完成度指定した形式で開けるか、必要な項目が揃うか
  • 手直し:再指示と人による修正に、どれだけ時間がかかったか
  • 運用:待ち時間と利用量が、日常の仕事で許容できるか

性能差があっても手直しが減らなければ、その仕事での切り替えは保留でよいでしょう。モデルを選ぶ考え方はClaudeのOpusとSonnetの違いも参考にしつつ、自社の成果物を基準にすることが判断の近道です。

試す環境の選び方はClaude Opus 5.5の使い方、Opus 5から移すときに変わる思考設定はClaude Opus 5.5とOpus 5の違い、費用の見積もり方はClaude Opus 5.5の料金解説にまとめています。

よくある質問

QClaude Opus 5.5は何ができるモデルですか?

AClaude Opus 5.5は、開発作業、資料づくり、画面操作などで評価されているモデルです。実務では修正済みコードや報告資料の下書きなど、完成形を確認できる仕事から試すと判断しやすくなります。

Qクロード・オーパス5.5の性能は旧Opus 5より高いですか?

A公開された主要ベンチマークでは、Opus 5.5がOpus 5を上回っています。ただし、特定のJava課題では合格率がわずかに下がった評価もあり、すべての仕事で改善するとは限りません。

Qベンチマークの%は自社業務の成功率ですか?

Aベンチマークの%は、そのテストの課題と採点方法に基づく値です。自社業務の成功率へ置き換えず、元データや完成品が揃う過去の仕事で確かめてください。

QGDPval-AAの1846という数字は何ですか?

AGDPval-AAの1846は、成果物の比較から算出するEloレーティングです。正答率や作業時間の削減率ではありません。

Q高性能なら人のチェックは省けますか?

A高性能なモデルでも、人のチェックは必要です。数値・出典・宛先を確認し、送信・公開・支払いは人が承認する運用から始めてください。

GLOSSARY

AI用語集

2364 語を収録

意味の解説から背景の意外な逸話まで、AIの専門用語を一語ずつ。非エンジニアの視点で噛み砕いた、引くほど詳しくなる用語集です。

用語集を見る