本文へ移動
ISEGORIABenjamin Haire
English

ソフトウェアエンジニアリング · 2026年9月

作品の形状を表すモデルを選択してください。

Claude Opus 5、Claude Fable 5、およびすべてのGPT-5.6の階層および努力レベルを比較しました。ベンダーのベンチマーキングが完全なランキングを形成するとは言っていません。

測定された証拠

公表されたコーディングエージェントインデックス

これらはOpenAIの共有Artificial Analysis表で報告されたハイエンド構成です。Opus 5については測定データがありません。そのモデルは含まれていませんでした。

GPT-5.6 Sol80.0
GPT-5.6 Terra77.4
Claude Fable 577.2
GPT-5.576.4
GPT-5.6 Luna74.6

運用ガイド

推論の努力は職務プロファイルを変化させます。

低

小さな修正やスコープ内のサブエージェントの存在

中

通常機能とテスト修復。

高

曖昧なバグと複数ファイル作業。

極高

大きな移行と深い検証。

最大

最も深い単一エージェントの推論。

超

並列研究、実装、および検証。

SolとTerraは現在のCodexラインアップでUltraをサポート。Luna、Opus 5、およびFable 5は最大まで止まる。

Ultraを詳細に検証

より多くのエージェントがトポロジーを変更する。

OpenAIはTerminal-Bench 2.1で、Solが最大時88.8%からUltra時91.9%に上昇、3.1ポイントの改善を報告している。

88.8%Sol max+3.1 pp91.9%Sol 超

ブランチが独立して進む場合や、インターフェース、衝突、最終証明を1つの統合者が担当する場合にUltraを使用する。緊密に結合されたホットスポットでは最大版を使用する。

ルーティングガイド

どこから始めたいか

高速ループLuna 中
日次デフォルトTerra 高
最も難しい作業Sol max
大規模プロジェクトファンブルハイ/xハイ
6ページのレポートをダウンロード(英語PDF)

主要な出典

OpenAI GPT-5.6 · Anthropic Fable 5 · Anthropic Opus 5

英語原文