ベンチマーク分析 / 2026年10月4日(10月7日更新)
Opus 5.5 に対して Fable 5.1 が今も与えるもの
Opus 5.5 の料金は100万トークンあたり入力4ドル・出力20ドルで、Fable 5.1 の10ドルと50ドルを大きく下回る。それでいて、公表されている指標の多くでは上位モデルに並ぶか、上回っている。Anthropic 自身の公式表を、Artificial Analysis の指数、三つの独立した検証、xhigh 設定の GPT-6 Astra と並べ、確かな部分と脚注が覆す部分とを切り分けた。結論として、既定は Opus 5.5 でよい。Fable 5.1 に残るのは、難しく人手を介さない作業での信頼性というごく狭い理由であり、Astra は数学とタスクあたりの費用で勝つ。
前の記事との関係
先の記事「エフォートのつまみは、費用より先に効き目が尽きる」は、Opus 5、Fable 5.1、 GPT-6 Astra を五段階の推論エフォートすべてで比べたものだった。Opus 5.5 はその後に登場した別のモデルであり、Opus 5 とは同じではない。 そのため前の記事を書き換えず、独立した問いとして扱った。ここでの Fable 5.1 と Astra の数値は前の記事と同じものである。
公表値と二次情報の区別
本稿の数値はすべて公表値である。指数のスコアと Fable 5.1、Astra の費用は Artificial Analysis 自身のページによる。Opus 5.5 の五段階すべての指数と、最大エフォートの費用(1タスク5.98ドル)も同じである。Opus 5.5 の高と xhigh の費用(1.82ドルと3.46ドル)と、第二節のタスク別のエフォート別結果は、公表されたグラフの二次的な要約を通じて得ており、該当する箇所でその旨を記している。指数のスケールは前の記事と同じ v4.3.2 で、最大エフォートの Fable 5.1 はどちらでも53である。
第一節価格と指数
Opus 5.5 は100万入力トークンあたり4ドル、出力20ドルである。Fable 5.1 は10ドルと50ドルで、2.5倍にあたる。 どちらも100万トークンの文脈を扱い、最大12.8万トークンを出力できる。Anthropic 自身の文書は、大半の用途ではまず Opus から始め、 高度な推論や長期にわたるエージェント作業が必要なとき、あるいは自前の評価で Opus を高いエフォートで使っても足りないときに Fable へ移るよう勧めている。既定のエフォート水準も異なり、Opus 5.5 は中、Fable 5.1 は高である。
ここから最も公平な比較が導かれる。それぞれの既定設定どうしである。Artificial Analysis の知能指数では、 中エフォートの Opus 5.5 と高エフォートの Fable 5.1 がともに51で、費用は Opus が1タスク1.34ドル、Fable が3.91ドルである。 上位では差が開く。最大エフォートで Opus 5.5 は58、Fable は53であり、Opus は高エフォートの時点で既に54に達し、Fable のどの設定をも上回る。xhigh は三つのモデルすべてに指数が公表されている唯一の設定で、Opus 5.5 は56(1タスク3.46ドル)、Fable 5.1 は53(5.98ドル)、Astra は52(2.31ドル)である。
Artificial Analysis 自身の比較ページも、構成要素については同じ傾向を示す。最大対最大で、Opus 5.5 は SciCode(67対63)、 人類最後の試験(61対59)、信頼性と幻覚を測る AA-Omniscience(46対43)で上回り、長文脈推論(85)と GDP.pdf(26)では並ぶ。
図1では、見出しの差よりも次の二点を重く見る。中エフォートでの引き分け、すなわち約三分の一の費用で並ぶという結果は、両モデルの既定設定に基づくもので、最も頼りになる。上位の差には、単一の比較ページより厚い裏付けがある。Artificial Analysis の公開一覧、Opus 5.5 の解説記事、モデルのページがいずれも最大で58を示し、モデルのページは費用5.98ドルを示す。最大では、Opus 5.5 はタスクあたり費用が Fable より低く(5.98ドル対7.63ドル)、スコアは5ポイント高い。
第二節エフォートのつまみを、タスク別に見る
Artificial Analysis は Opus 5.5 の指数スコアについて、段階ごとの全体を公表している。低で42、中で51、高で54、xhigh で56、最大で58である。同じつまみでも、個々のタスクの動き方は大きく異なる。図2は、指数と、Anthropic のエフォート別グラフを第三者が書き起こした五つのベンチマークで、その様子を示す。Astra は、数値が見つかったところに緑で重ねた。
低から中への段差は、どのタスクでも最大である。中だけで、低から最良の水準までの伸びの56%以上を取り込み、FrontierCode では全部を取り込む。
中より先では、タスクによって道が分かれる。知識労働は伸び続ける。GDPval-AA は中の1576から最大の1846へ、AA-Briefcase は1642から1822へ上がり、xhigh の時点で伸びの96%と92%に達している。コーディング系のベンチマークは平坦で、揺れが大きい。Terminal-Bench 4.0 は xhigh の66.4が頂点で、最大では64.8に下がる。FrontierCode は中の54.6を一度も超えず、54.0、51.4、54.4と揺れる。ただし51.4は一つの書き起こしだけに拠り、54.4が xhigh と最大のどちらの値なのかも出典間で食い違う。そのため FrontierCode は、xhigh での低下ではなく、中から先は平坦だと読む。CursorBench は高と xhigh で56.0と並び、最大で57.8に達する。
小さな動きは慎重に扱うべきである。Anthropic は Opus の Terminal-Bench のスコアに約2.6ポイントの標準誤差を示している。これを他のタスクのノイズの目安としても使うが、仮定である。Terminal-Bench の1.6ポイントの低下と FrontierCode の揺れは、この範囲に収まる。残るのは形である。コーディングでは急な部分が中か高で終わり、知識労働では xhigh まで続く。タスクあたり費用はベンチマークごとに測り方が異なるため、図からは外した。
GPT-6 Astra は指数のつまみが平坦である。46、50、51、52、53と、全段階で7ポイントしか上がらず、Opus の16ポイントと対照的である。中では両者は1ポイント以内(Opus 51、Astra 50)だが、高から先は Opus が離し、xhigh で4ポイント、最大で5ポイント上回る。一方、Astra の xhigh は1タスク2.31ドルで、Opus の3.46ドルより安い。タスクについては Astra のスコアを三つ見つけたが、どれにもエフォート水準の表示がない。Terminal-Bench 4.0 は57.8で、中の Opus(57.6)とほぼ同じであり、高から先の Opus を大きく下回る。FrontierCode 1.1 は53.3で、Opus の54.6と54.4との差は約1ポイント、つまりノイズの範囲内である。GDPval-AA は1542で、これは Vellum だけに拠り、中の Opus(1576)をやや下回り、最大の Opus を大きく下回る。ある集計サイトは、特記がなければ最大エフォートの数値だとしているが、この三つについては確認できなかった。CursorBench と AA-Briefcase には Astra の数値が見つからなかったので、そのパネルは Opus だけを示している。
第三節Anthropic の表と、その脚注
Anthropic の公式表では、比較可能な8つのベンチマークすべてで Opus 5.5 が Fable 5.1 を上回り、差は0.6ポイントから10.6ポイントである。 最大の差は Terminal-Bench 4.0 の66.4対55.8。尺度の異なる知識労働ベンチマーク GDPval-AA も同じ向きで、1846 Elo 対 1735 Elo となっている。
脚注は重要であり、しかも両方向に効く。エフォート水準は揃っていない。Terminal-Bench 4.0 では Opus が xhigh、Fable が既定で走っており、 これは Opus に有利である。つまり最大の差は、最も異論の余地がある差でもある。それでも Artificial Analysis 自身の最大対最大の実行が 59.6対52.0と同じ向きを再現しているので、私はこの差を信じる。FrontierCode と CursorBench では逆に、Opus が既定の中、Fable が最大で走っている。 これらの差は不利な条件を越えて残っている。
Anthropic はさらに、九つの差のうち四つは誤差範囲に収まり、両モデルの差は「この点数が示すより小さい」と述べている。 私はこれを、図3の下半分は引き分けとして扱ってほしいという提供元の依頼だと読む。表の中に、Opus が劣る項目は一つもない。
第四節三つ目のモデル、xhigh での姿
GPT-6 Astra のトークン単価は Fable 5.1 と同じ10ドルと50ドルだが、書き出すトークンがはるかに少ないため、タスクあたりの請求額は控えめになる。 xhigh では指数52、1タスク2.31ドルで、費用では中エフォートの Opus 5.5 と高エフォートの Fable の間に入り、スコアでは中エフォートの Opus 5.5(51)に並び、 最大エフォートの Fable(53)にわずかに届かない。xhigh そのものでは Opus 5.5 が56、Fable 5.1 が53である。出力速度は毎秒49トークンで、xhigh での最初のトークンまでの待ち時間は、 Artificial Analysis のあるページでは132秒、別のページでは191秒と記されている。中エフォートでは6秒である。
三者に共通するベンチマークでは、Opus がターミナル作業(Astra の58に対し66)とツール付きの人類最後の試験(57に対し68)で先行する。 Astra は AutomationBench でわずかに(40に対し41)、Terminal-Bench-Science では6ポイント(59に対し65)先行し、FrontierCode は接戦(54、53、50)である。 Artificial Analysis 自身の実行では、Astra は Terminal-Bench(60に対し59)と AutomationBench(70に対し69)で Opus とほぼ並び、 どちらでも Fable をはっきり上回る。
第五節Astra が先行する分野
Astra が最も強いベンチマークの多くは、Anthropic が Opus 5.5 について報告していないため、比較の相手は Fable になる。 Astra は FrontierMath Tier 4 で97.6%(Fable は87.8%)、ARC-AGI-2 で95%(同90%)を記録し、コーディングの DeepSWE でも74%対67%で先行する。
頼りにしない方がよいのは、コンピュータ操作の72.6%対41.7%である。これは集計サイト由来で、Anthropic の表にある OSWorld 2.0 (Opus 81.8、Fable 80.7)とは版が違う。数学での差は信じてよい部分である。ARC Prize 自身の Opus 5.5 の記録は、 高エフォートで ARC-AGI-2 が93.3%、xhigh で92.5%であり、この試験では Opus は Fable と Astra の間に位置する。
第六節食い違う独立した検証
外部の三組が、実際の作業で Opus 5.5 と Fable 5.1 を比べたが、結果は一致しない。Snorkel AI は最先端のエージェント課題で200件の試行を走らせた。 合格率は Opus が68%、Fable が49%だが、pass@1 では両者は並ぶ(60.7%と61.5%)。Fable の失敗は早すぎる打ち切りと回復されなかった誤りで、 Opus の失敗は出力形式の誤り、誤った推論、ツール引数の誤りだった。Snorkel はこれを、推論よりも周辺の仕組みに近い失敗と述べている。
Endor Labs は両モデルに、実在のプロジェクトを、隠された機能テストとセキュリティテストに通るよう修正させた。Fable は明らかに正確で (87.2%対68.7%)、安全性もわずかに高かった(37.4%対33.5%)。Opus は全体で116ドル、Fable は672ドルで、Opus は1タスクあたり約4分、Fable は9分半だった。 Endor はまた、Opus が記憶した修正をそのまま再現した例を51件、Fable は17件と数え、これらを除けば Opus のセキュリティ順位は3位に下がると述べている。
The New Stack は15回の試験を行った。Fable は15回すべてで完全、Opus は13回だった。並行処理のバグでは Fable が圧倒し、Opus はトークンを使い切って2回結果を出せなかった。 一方、バグ修正の試験では、Fable は5回すべてで、模擬的な遅延を削除してフラキーなテストを常に通るようにした。Opus は正しくバグを直した。
三つの検証が食い違うのは、測っているものが違うからである。課題の完遂、隠されたテストに耐えるコード、少数の難問での信頼性である。 共通するのは形だ。Fable は難しく人手を介さない作業で失敗が少なく、テストに見えない近道を取る癖がある。Opus は速く、はるかに安い。 15回は小さな標本であり、三つのどれも決定的とは言えない。
第七節トークンと請求額
Opus 5.5 はトークン単価が最も安く、書き出しも最も速い。同時に、最もよく考える。最大エフォートでは1タスクあたり約11.9万の出力トークンを使い、 Fable は7.8万、Astra は2.7万である。最初のトークンまでの待ち時間は、Opus が705秒、Fable が239秒と記されている。
Opus はトークン単価が半額以下なので、思考量が5割増しでもなお Fable より安く、1タスク5.98ドルに対して7.63ドルである。 Astra は Fable と同じ単価でも書き出す量が少ないので、3.26ドルとさらに安い。その代償が速度で、毎秒49トークン、 しかも始まるまでに長い間がある。待ちながら使う用途よりも、バッチ処理に向く。
第八節私の使い分け
既定は中エフォートの Opus 5.5 である。足りなければ、モデルを替える前にエフォートを高に上げる。指数の上では高エフォートで既に Fable の最高値を超えるからだ。図2のコーディング系ベンチマークでは、高を超えるとつまみの効きはわずかなので、コーディングでは最大に上げるよりモデルを替える方を先に考える。 Fable 5.1 は、長時間の無人実行、並行処理系のバグ、高エフォートの Opus が二度失敗した問題に使う。Astra は、形式的な数学や科学計算、 そして速度よりタスクあたり費用が重要なバッチ処理に使う。
未解決の点がいくつか残る。エフォート水準を揃えた xhigh の比較は指数でしか存在せず、Opus 5.5、Fable 5.1、Astra でそれぞれ56、53、52である。Opus 5.5 と Fable 5.1 を xhigh で揃えて比べた、公表済みのタスク別ベンチマークは見つからず、これらのタスクで Opus 5.5 と Astra をエフォート水準を揃えて直接比べた結果もない。図2の Astra のタスク別スコア三つにはエフォート水準の表示がなく、Astra のおおよその位置は示すが、xhigh での挙動は示さない。タスク別のエフォート結果は、Anthropic のグラフを第三者が書き起こしたものであり、コンピュータ操作やその他の Astra の数値は集計サイトによるものである。
出典
一次データ。 Artificial Analysis のページ: Opus 5.5 対 Fable 5.1、 Opus 5.5 の解説記事、 最大エフォートの Opus 5.5、 Opus 5.5 のリリース一覧、 xhigh の Fable 5.1、 xhigh の GPT-6 Astra、 Astra の中と xhigh、 Astra の解説記事。 Anthropic のOpus 5.5 発表と Fable 5.1 の概要。 Snorkel AI、 Endor Labs、 The New Stack。 ARC Prize の Opus 5.5 の結果。
二次データ。 Opus 5.5 の高と xhigh の費用は explainx による(高は Emergent も)。既定設定どうしの引き分けも Emergent による。タスク別のエフォート結果は、Anthropic のエフォート別グラフの数値を Digital Applied、Kingy AI、ToSea が書き起こしたものである。Terminal-Bench は前の二つで、AA-Briefcase は一つ目と三つ目で、FrontierCode の中と最大は前の二つで一致する。FrontierCode のそれ以外の水準と CursorBench は一つ目だけ、GDPval-AA は二つ目だけに拠る。Astra の GDPval-AA の1542は Vellum だけに拠る。FrontierCode の54.4について、Orcarouter は xhigh、llm-stats と Vellum は、前記の書き起こしと同じく最大としている。誤差範囲に関する記述と Anthropic の表の AutomationBench の行は CodingFleet の報告による。Astra の公式表のスコアと、FrontierMath、ARC-AGI-2、DeepSWE、OSWorld の数値は Featureflow、 Vellum、 BenchLM、 MindStudio による。
確認したこと。 Artificial Analysis、Anthropic、Snorkel、Endor Labs、The New Stack、ARC Prize の数値は、 2026年10月3日、4日、7日にそれぞれのページから読み取った。Opus 5.5 の五段階すべての指数(42、51、54、56、58)、最大での費用5.98ドル、xhigh の Fable 5.1 の53と5.98ドルを含み、それぞれ固有のページにある。指数のスケールは前の記事と一致している。
確認できなかったこと。 Opus 5.5 の高と xhigh の費用は二次情報であり、タスク別のエフォート結果は第三者による書き起こしで、Anthropic 自身のグラフとは照合していない。 AutomationBench は公式表で40.0対31.4、Artificial Analysis で70対59と現れ、おそらく版が違うため、両者を混ぜていない。 Astra の指数は Artificial Analysis の xhigh で52、ほかでは53で、後者はおそらく最大エフォートの実行である。集計サイトの数値には、図2の Astra のタスク別スコアを含め、エフォート水準の表示がない。FrontierCode の54.4がどの水準の値かは決められず、xhigh の51.4も一つの書き起こしにしか現れない。 Opus 5.5 についての LMArena や人間の選好データは見つからなかった。