GameDevBench ↗
シーン、シェーダー、スプライト、アニメーション、UI、ゲームロジックを変更します。エンジン内の視覚的な反復作業に関連しますが、ネイティブ描画系の性能評価一式ではありません。
AI・ソフトウェア工学 · 操作できる解説
Astra、Fable 5.1、Opus 5を比較。推論レベルによる品質・費用・応答時間の変化と、ゲーム開発に役立つ評価を確かめます。
01 / モデル比較
指標と推論レベルを選んでください。メインの図は1つの指標を追い、その下の小さな図は15指標すべてを一度に示します。最後の図では、品質を費用や待ち時間と対比します。
同じ推論レベル名でも、計算量は同じとは限りません。数値は取得日の記録であり、リアルタイム更新ではありません。
各図の縦軸はそれぞれ独立しています。図にポインタを重ねると、同じ推論レベルの値を15指標で見比べられます。選択するとメインの図に表示されます。
各モデルの5つの推論レベルを、低から最大まで線で結んでいます。左上ほど有利です。破線の階段はフロンティアで、両方の軸で同時に上回る設定が図中にないものを結んでいます。値は丸めた単一時点の記録のため、僅差には意味がありません。
| 指標 | Astra | Fable 5.1 | Opus 5 |
|---|
02 / 評価内容を知る
ベンチマークは、課題の定義・実行環境・採点方法の組み合わせです。似た数値でも、測る能力は大きく異なります。
ベンチマーク全体は80の科学的な主問題を338の小問に分けています。Artificial Analysisはテスト集合の288小問を使い、科学者が書いた背景情報を与え、Pythonコードを単体テストで採点します。科学的な仕様を理解し、アルゴリズムに変換し、正しく実装する能力を組み合わせた評価です。
説明用の例(実際の出題の引用ではありません):単位、配列の形、境界条件を正しく扱う数値計算関数を実装する。物理を美しく説明できても、関数が誤った値を返せば合格にはなりません。
小問合格率56%は、研究プロジェクトの56%を完遂できるという意味ではありません。C++、エンジン設計、シェーダー品質、フレーム時間も直接測りません。後発のSciCode-Verified監査は元の評価の欠陥を報告しています。この図鑑では改訂版の結果に置き換えず、Artificial Analysisが公開したSciCode値を保持しています。
SciCode ↗ · SciCode-Verified ↗GDPval-AA v2は44職種にまたがる220の公開課題を評価します。エージェントはツールを使い、報告書、表計算、プレゼンテーションなどのファイルを作成します。複数のモデル審査員が提出物を比較し、専門家の成果物を1000とするElo尺度で報告します。v2では最大250ターンを利用できます。
説明用の例:参考資料を読み、計算に基づく提案を作り、実用的な表計算ファイルとメモを納品する。事実知識に加えて、ファイル操作、要件遵守、計算の確認、結果の伝達も影響します。
Eloはこの評価内での相対的な成績です。1700という値は「人間より70%優れる」ことや、代替できる職業の割合を意味しません。環境、ツール、審査方法も結果の一部です。
GDPval-AA v2 ↗ · 評価方法 ↗「主力」は製品の位置付けであり、全試験での首位を意味しません。今回のxhighの記録では、丸めた総合指数はAstraとFable 5.1がともに53、Opus 5が50です。しかしGDPval-AAではOpus 5がAstraを上回ります。一方、同じ設定のGDP.pdfとAutomationBench-AAではAstraがOpusを上回ります。成果物作成、文書推論、業務自動化は異なる能力です。
この観測から分かるのは成績の傾向であり、内部的な原因ではありません。学習の重点、ツール利用、推論資源の配分、採点基準などが候補ですが、公表スコアだけでは原因を切り分けられません。必要な作業に近い評価を選び、代表的な実課題で確認することが大切です。
ツールを使う課題を、実行可能なテストで確認します。設定された環境での課題達成を示す値であり、コードの作法や美的品質を直接測るものではありません。
評価方法 ↗自由回答の事実問題に対し、誤った断言も考慮した指数を用います。指数43は正答率43%ではありません。スライドの品質より、事実回答の信頼性に近い評価です。
評価方法 ↗多分野にまたがる高度な学術問題です。難しい推論の参考になりますが、試験問題の回答と、動くソフトウェア変更の納品では必要な行動が異なります。
評価方法 ↗PDFに根拠を置いた回答を評価します。表示する全基準合格率では、採点基準をすべて満たす必要があります。GDPval-AAとは課題も尺度も異なります。
評価方法 ↗長い入力全体に分散する情報を活用できるかを確認します。公称のコンテキスト長が大きくても、その文脈を十分に使いこなせるとは限りません。
評価方法 ↗複雑な業務の課題達成、分析、提示品質を評価します。統合Elo値を、GDPval-AAと同一尺度のように数値比較することはできません。
評価方法 ↗03 / ゲーム開発
エンジンや描画の開発では、動くプロジェクトや実測したGPU処理を要求する評価から考えます。もっともらしい説明や美しい画面は、証拠の一部分にすぎません。
シーン、シェーダー、スプライト、アニメーション、UI、ゲームロジックを変更します。エンジン内の視覚的な反復作業に関連しますが、ネイティブ描画系の性能評価一式ではありません。
ネットワークやオブジェクトのライフサイクルを含む、統合されたC++の動作。実行時テストとモデル審査を用います。性能とプラットフォームの範囲は意図的に限定されています。
コードを通じて3Dグラフィックスを再構成・編集します。シーン操作の参考になりますが、リアルタイム描画エンジンの開発能力を保証しません。
シェーダー制作の出力、経過時間、費用を記録します。各項目は1回の試行で、反復時の信頼性や広い一般化は未確認です。
PyTorchの処理に対応するGPUカーネルを生成します。fast₁は、正しく、基準実装より速い課題の割合です。AI計算の評価であり、描画全体やゲームのFPSではありません。
NVIDIA BlackwellのAI処理で、解析的なハードウェア性能限界への接近を測ります。Metal、レンダーグラフ、映像の時間的一貫性を直接証明するものではありません。
GameDevBench・333課題の合格率・0〜100%の尺度
95%信頼区間は両者とも±5.0パーセントポイント。モデルごとに最良の視覚フィードバックとエージェント環境を使用しており、同一設定ではありません。
Fable 5とFable 5.1は別モデルです。2026年9月17日の確認時点で、このランキングにFable 5.1とOpus 5の項目はありません。ここでの1.5ポイント差だけで、総合的な勝者を断定することはできません。
GameDevBench ↗以下は評価設計の提案であり、既存の公開スコアではありません。同じリポジトリ版、課題、ハードウェア、ツール、予算を各モデルに与え、試行を繰り返し、失敗も記録します。
ビルド・実行時テスト、基準画像、カメラ移動、時間方向のアーティファクト、回帰の確認。
GPU処理時間、フレーム時間の中央値と遅い側の分布、メモリ使用量、対象機器で再現できるキャプチャ。
完了までの実時間、API費用、人間の修正工数を、最終変更が実用になるかと合わせて記録。
04 / 出典と限界
英語版と日本語版は同じデータと操作機能を共有します。