小さな修正やスコープ内のサブエージェントの存在
ソフトウェアエンジニアリング · 2026年9月
作品の形状を表すモデルを選択してください。
Claude Opus 5、Claude Fable 5、およびすべてのGPT-5.6の階層および努力レベルを比較しました。ベンダーのベンチマーキングが完全なランキングを形成するとは言っていません。
測定された証拠
公表されたコーディングエージェントインデックス
これらはOpenAIの共有Artificial Analysis表で報告されたハイエンド構成です。Opus 5については測定データがありません。そのモデルは含まれていませんでした。
運用ガイド
推論の努力は職務プロファイルを変化させます。
通常機能とテスト修復。
曖昧なバグと複数ファイル作業。
大きな移行と深い検証。
最も深い単一エージェントの推論。
並列研究、実装、および検証。
SolとTerraは現在のCodexラインアップでUltraをサポート。Luna、Opus 5、およびFable 5は最大まで止まる。
Ultraを詳細に検証
より多くのエージェントがトポロジーを変更する。
OpenAIはTerminal-Bench 2.1で、Solが最大時88.8%からUltra時91.9%に上昇、3.1ポイントの改善を報告している。
88.8%Sol max+3.1 pp91.9%Sol 超
ブランチが独立して進む場合や、インターフェース、衝突、最終証明を1つの統合者が担当する場合にUltraを使用する。緊密に結合されたホットスポットでは最大版を使用する。
ルーティングガイド
どこから始めたいか
主要な出典