本文へ移動
ISEGORIABenjamin Haire
English

AI・ソフトウェア工学 · 操作できる解説

AIモデル・ベンチマーク図鑑

Astra、Fable 5.1、Opus 5を比較。推論レベルによる品質・費用・応答時間の変化と、ゲーム開発に役立つ評価を確かめます。

01 / モデル比較

推論を増やすと何が得られ、何を払うのか

指標と推論レベルを選んでください。メインの図は1つの指標を追い、その下の小さな図は15指標すべてを一度に示します。最後の図では、品質を費用や待ち時間と対比します。

推論レベル

    同じ推論レベル名でも、計算量は同じとは限りません。数値は取得日の記録であり、リアルタイム更新ではありません。

    縦軸の範囲は指標ごとに変わります。線は5つの離散的な設定を結んでおり、中間レベルを測定したものではありません。ポインタや矢印キーで各設定の値を読み、クリックで選択できます。

    全指標を一度に見る

    各図の縦軸はそれぞれ独立しています。図にポインタを重ねると、同じ推論レベルの値を15指標で見比べられます。選択するとメインの図に表示されます。

    品質

    費用と時間

    品質と費用の関係

    各モデルの5つの推論レベルを、低から最大まで線で結んでいます。左上ほど有利です。破線の階段はフロンティアで、両方の軸で同時に上回る設定が図中にないものを結んでいます。値は丸めた単一時点の記録のため、僅差には意味がありません。

    比較する軸
    • フロンティア
    • フロンティア上の設定
    • 大きな印:選択中の推論レベル

    正確な数値
    指標AstraFable 5.1Opus 5

    トークン単価と実際の課題費用

    2026年9月15日に記録した通常のAPI料金です。単位は100万トークンあたりの米ドル。定額プランとは別です。単価は請求額の一要素で、課題あたりの費用には消費トークン量も反映されます。

    モデル入力キャッシュ読込出力
    Astra$10$1.00$50
    Fable 5.1$10$0.25$50
    Opus 5$5$0.50$25

    Astraは入力272kトークン以下の料金です。キャッシュ書込、ツール料金、長文入力区分、その他のサービス形態で料金が異なる場合があります。予算を決める際は提供元の資料を確認してください。

    Astra ↗ · Fable ↗ · Opus ↗

    02 / 評価内容を知る

    何を測定しているのか

    ベンチマークは、課題の定義・実行環境・採点方法の組み合わせです。似た数値でも、測る能力は大きく異なります。

    SciCode:科学知識を動くコードにする

    ベンチマーク全体は80の科学的な主問題を338の小問に分けています。Artificial Analysisはテスト集合の288小問を使い、科学者が書いた背景情報を与え、Pythonコードを単体テストで採点します。科学的な仕様を理解し、アルゴリズムに変換し、正しく実装する能力を組み合わせた評価です。

    説明用の例(実際の出題の引用ではありません):単位、配列の形、境界条件を正しく扱う数値計算関数を実装する。物理を美しく説明できても、関数が誤った値を返せば合格にはなりません。

    小問合格率56%は、研究プロジェクトの56%を完遂できるという意味ではありません。C++、エンジン設計、シェーダー品質、フレーム時間も直接測りません。後発のSciCode-Verified監査は元の評価の欠陥を報告しています。この図鑑では改訂版の結果に置き換えず、Artificial Analysisが公開したSciCode値を保持しています。

    SciCode ↗ · SciCode-Verified ↗

    GDPval:知識クイズではなく実務成果物

    GDPval-AA v2は44職種にまたがる220の公開課題を評価します。エージェントはツールを使い、報告書、表計算、プレゼンテーションなどのファイルを作成します。複数のモデル審査員が提出物を比較し、専門家の成果物を1000とするElo尺度で報告します。v2では最大250ターンを利用できます。

    説明用の例:参考資料を読み、計算に基づく提案を作り、実用的な表計算ファイルとメモを納品する。事実知識に加えて、ファイル操作、要件遵守、計算の確認、結果の伝達も影響します。

    Eloはこの評価内での相対的な成績です。1700という値は「人間より70%優れる」ことや、代替できる職業の割合を意味しません。環境、ツール、審査方法も結果の一部です。

    GDPval-AA v2 ↗ · 評価方法 ↗

    主力モデルなのに知識労働で負けるのはなぜか

    「主力」は製品の位置付けであり、全試験での首位を意味しません。今回のxhighの記録では、丸めた総合指数はAstraとFable 5.1がともに53、Opus 5が50です。しかしGDPval-AAではOpus 5がAstraを上回ります。一方、同じ設定のGDP.pdfとAutomationBench-AAではAstraがOpusを上回ります。成果物作成、文書推論、業務自動化は異なる能力です。

    この観測から分かるのは成績の傾向であり、内部的な原因ではありません。学習の重点、ツール利用、推論資源の配分、採点基準などが候補ですが、公表スコアだけでは原因を切り分けられません。必要な作業に近い評価を選び、代表的な実課題で確認することが大切です。

    Terminal-Bench 4.0 · 端末上の課題を完遂できるか

    ツールを使う課題を、実行可能なテストで確認します。設定された環境での課題達成を示す値であり、コードの作法や美的品質を直接測るものではありません。

    評価方法 ↗
    AA-Omniscience · 事実に信頼できる回答を返せるか

    自由回答の事実問題に対し、誤った断言も考慮した指数を用います。指数43は正答率43%ではありません。スライドの品質より、事実回答の信頼性に近い評価です。

    評価方法 ↗
    Humanity’s Last Exam · 非常に難しい学術問題を解けるか

    多分野にまたがる高度な学術問題です。難しい推論の参考になりますが、試験問題の回答と、動くソフトウェア変更の納品では必要な行動が異なります。

    評価方法 ↗
    GDP.pdf · 長い実務文書に基づいて推論できるか

    PDFに根拠を置いた回答を評価します。表示する全基準合格率では、採点基準をすべて満たす必要があります。GDPval-AAとは課題も尺度も異なります。

    評価方法 ↗
    AA-LCR v1.1 · 離れた場所の情報を探し、統合できるか

    長い入力全体に分散する情報を活用できるかを確認します。公称のコンテキスト長が大きくても、その文脈を十分に使いこなせるとは限りません。

    評価方法 ↗
    AutomationBench-AA · 業務手順を実行できるか

    ソフトウェアAPIを通じた操作が必要です。ツール利用と正しい状態変更を評価し、視覚デザインの品質は測りません。

    評価方法 ↗
    CritPt · 研究水準の物理問題を解けるか

    科学的推論を要求する物理問題です。実装の数値安定性、速度、ゲームエンジンへの統合を直接検証するものではありません。

    評価方法 ↗
    AA-Briefcase · 役立つ実務成果物を作れるか

    複雑な業務の課題達成、分析、提示品質を評価します。統合Elo値を、GDPval-AAと同一尺度のように数値比較することはできません。

    評価方法 ↗

    03 / ゲーム開発

    ゲーム開発

    エンジンや描画の開発では、動くプロジェクトや実測したGPU処理を要求する評価から考えます。もっともらしい説明や美しい画面は、証拠の一部分にすぎません。

    エンジンの動作

    GameDevBench ↗

    Godotの333課題

    シーン、シェーダー、スプライト、アニメーション、UI、ゲームロジックを変更します。エンジン内の視覚的な反復作業に関連しますが、ネイティブ描画系の性能評価一式ではありません。

    GameEngineBench ↗

    Unreal C++の110課題

    ネットワークやオブジェクトのライフサイクルを含む、統合されたC++の動作。実行時テストとモデル審査を用います。性能とプラットフォームの範囲は意図的に限定されています。

    視覚的な制作

    BlenderGym ↗

    コードによるグラフィックス編集

    コードを通じて3Dグラフィックスを再構成・編集します。シーン操作の参考になりますが、リアルタイム描画エンジンの開発能力を保証しません。

    Shader Frontier v1 ↗

    19試行・2つの対象

    シェーダー制作の出力、経過時間、費用を記録します。各項目は1回の試行で、反復時の信頼性や広い一般化は未確認です。

    GPU計算

    KernelBench ↗

    正しさと高速化

    PyTorchの処理に対応するGPUカーネルを生成します。fast₁は、正しく、基準実装より速い課題の割合です。AI計算の評価であり、描画全体やゲームのFPSではありません。

    SOL-ExecBench ↗

    CUDA最適化の235課題

    NVIDIA BlackwellのAI処理で、解析的なハードウェア性能限界への接近を測ります。Metal、レンダーグラフ、映像の時間的一貫性を直接証明するものではありません。

    確認できた関連分野の公開結果

    GameDevBench・333課題の合格率・0〜100%の尺度

    Astra · high · Codex68.8%
    Fable 5 · xhigh · Claude Code67.3%

    95%信頼区間は両者とも±5.0パーセントポイント。モデルごとに最良の視覚フィードバックとエージェント環境を使用しており、同一設定ではありません。

    Fable 5とFable 5.1は別モデルです。2026年9月17日の確認時点で、このランキングにFable 5.1とOpus 5の項目はありません。ここでの1.5ポイント差だけで、総合的な勝者を断定することはできません。

    GameDevBench ↗

    実際の描画系を評価するには

    以下は評価設計の提案であり、既存の公開スコアではありません。同じリポジトリ版、課題、ハードウェア、ツール、予算を各モデルに与え、試行を繰り返し、失敗も記録します。

    1. 正しさ

      ビルド・実行時テスト、基準画像、カメラ移動、時間方向のアーティファクト、回帰の確認。

    2. 性能

      GPU処理時間、フレーム時間の中央値と遅い側の分布、メモリ使用量、対象機器で再現できるキャプチャ。

    3. 納品コスト

      完了までの実時間、API費用、人間の修正工数を、最終変更が実用になるかと合わせて記録。

    04 / 出典と限界

    この図鑑の読み方

    英語版と日本語版は同じデータと操作機能を共有します。

    1. Artificial Analysis · 評価方法 ↗
    2. SciCode · 評価 ↗
    3. GDPval-AA v2 · 評価 ↗
    4. SciCode-Verified · ベンチマーク監査 ↗
    5. GameDevBench · プロジェクト・ランキング ↗
    6. GameEngineBench · 論文 ↗
    7. BlenderGym · 論文 ↗
    8. Shader Frontier v1 · 試行記録 ↗
    9. KernelBench · 評価とコード ↗
    10. SOL-ExecBench · 論文 ↗
    11. Astra · APIモデル資料 ↗
    12. Fable · 提供元ページ ↗
    13. Opus 5 · 提供元発表 ↗
    14. Astra / Fable 5.1 · low ↗
    15. Astra / Fable 5.1 · medium ↗
    16. Astra / Fable 5.1 · high ↗
    17. Astra / Fable 5.1 · xhigh ↗
    18. Astra / Fable 5.1 · max ↗
    19. Opus 5 · low / max ↗
    20. Astra / Opus 5 · medium ↗
    21. Astra / Opus 5 · high ↗
    22. Astra / Opus 5 · xhigh ↗