本文へ移動
ISEGORIABenjamin Haire
English

研究ノート · 扩張版 · 可視化が2026年9月10日に更新

コーディングのパフォーマンス、コスト、待ち時間

私はGPT-6 Astra、GPT-5.6 Sol、Claude Fable 5.1を、選択された論理的レベルで並べて比較しました。この拡張版では、Astraの中規模/高規模/極高規模、Solの極高規模/最大規模、Fableの極高規模(xhigh)を含め、完全なAstra/Fableの努力スケールを統合しました。

7ページのPDF(9月9日版)を参照(英語PDF)6方向比較完全な努力曲線ソースとデータ

対話的な作業なら、私は Astra medium から始める。high は表示されたターミナル操作のスコアを改善するが、最初の待ち時間がかなり長い。今回選んだ六つの設定では、ターミナルでのコーディングは Astra xhigh、科学分野のコーディングは Fable xhigh が首位となった。ただし、後者は混合スイートでのトークン使用量と費用がかなり高い。これは各自の作業で試すための観察結果であり、普遍的な最適設定を発見したという主張ではない。

6つの設定の比較

2026年9月10日のスナップショット · Fableは適応的推論を用い、デフォルトでフォールバックを実施。

Astra highは、中レベルに対して5パーセントの終端値を上回り、約12%の混合スイートコスト増加および最初の回答までの待機時間の17.2倍に達する。Fable xhighはAstra highを1点の終端値で上回り、6点のSciCodeを上回るが、混合スイートコストは3.48倍となる。1点のリードを有意とは読まない。Astra xhighは60%の終端値および56%のSciCodeを達成し、17kの出力トークン、$2.31の混合スイートコスト、および208.73秒の最初の回答までの待機時間を記録する。

6つの値をテーブルとして読む
2026年9月10日選定の構成
構成終端値SciCode出力推論サブセットUSD/タスク最初の回答
Astra medium49%54%10k3k$1.545.42s
Astra high54%55%12k5k$1.7293.34s
Astra xhigh60%56%17k9k$2.31208.73s
Sol xhigh25%57%20k10k$1.1854.15s
Sol max40%57%29k17k$1.99140.25s
Fable 5.1 xhigh55%61%61k34k$5.98138.38s

完全なAstra/Fable推論の連鎖

元の8月9日2026年スナップショット・ローカル、中、ハイ、xハイ、マックス。

両方の終端曲線を観察したところ、すべてのケースでxハイでピークを迎える。ファブルの科学的コーディングスコアはマックスでさらに上昇している。努力は順序的設定であり、つながり線を視覚的ガイドとして描いた。ここではAstraとFableのみをスキャン。ソルは上記の2つの設定でしか出現せず、その他の設定では出現しない。

私はこのデータをどのように解釈したか

作業負荷を分離して扱う。 Terminal-Bench v4.0 および SciCode はコーディング評価に用いられる。コストおよびトークンの値は、より広範なツールセットにおけるインテリジェンスインデックスv4.3の加重平均値である。最初の回答までの遅延は、別々のAPIパフォーマンスプロンプトから得られたものであり、テストされたパッチを完成させるまでの経過時間とは異なる。論理的トークンはすでに総出力に含まれている。

スナップショットの日付は意図的に明記している。Fable xhigh の最初の回答までの時間は、9月8日の一連の測定では 99.86 秒、9月10日の比較では 138.38 秒だった。これを性能低下の測定結果とは読まない。応答時間は変動するため、この標本から完了時間の安定した倍率は決められない。

私が書いたPDFでは、Astra/Fableの単トークン価格、努力の代替のトレードオフ、手法、限界、そして私が提案するペア評価プロトコルについて記載している。新たに有料モデルの試験は実施していない。APIコストは直接的にサブスクリプション使用許容量に換算されない。

ソースと再利用可能なデータ

選抜比較には、9月10日に取得した Artificial Analysis の測定値を用いた。全設定の比較では、9月8日の元データと、その時点での私の解釈を保持している。

英語原文