コーディングのパフォーマンス、コスト、待ち時間
私はGPT-6 Astra、GPT-5.6 Sol、Claude Fable 5.1を、選択された論理的レベルで並べて比較しました。この拡張版では、Astraの中規模/高規模/極高規模、Solの極高規模/最大規模、Fableの極高規模(xhigh)を含め、完全なAstra/Fableの努力スケールを統合しました。
対話的な作業なら、私は Astra medium から始める。high は表示されたターミナル操作のスコアを改善するが、最初の待ち時間がかなり長い。今回選んだ六つの設定では、ターミナルでのコーディングは Astra xhigh、科学分野のコーディングは Fable xhigh が首位となった。ただし、後者は混合スイートでのトークン使用量と費用がかなり高い。これは各自の作業で試すための観察結果であり、普遍的な最適設定を発見したという主張ではない。
6つの設定の比較
Astra highは、中レベルに対して5パーセントの終端値を上回り、約12%の混合スイートコスト増加および最初の回答までの待機時間の17.2倍に達する。Fable xhighはAstra highを1点の終端値で上回り、6点のSciCodeを上回るが、混合スイートコストは3.48倍となる。1点のリードを有意とは読まない。Astra xhighは60%の終端値および56%のSciCodeを達成し、17kの出力トークン、$2.31の混合スイートコスト、および208.73秒の最初の回答までの待機時間を記録する。
6つの値をテーブルとして読む
| 構成 | 終端値 | SciCode | 出力 | 推論サブセット | USD/タスク | 最初の回答 |
|---|---|---|---|---|---|---|
| Astra medium | 49% | 54% | 10k | 3k | $1.54 | 5.42s |
| Astra high | 54% | 55% | 12k | 5k | $1.72 | 93.34s |
| Astra xhigh | 60% | 56% | 17k | 9k | $2.31 | 208.73s |
| Sol xhigh | 25% | 57% | 20k | 10k | $1.18 | 54.15s |
| Sol max | 40% | 57% | 29k | 17k | $1.99 | 140.25s |
| Fable 5.1 xhigh | 55% | 61% | 61k | 34k | $5.98 | 138.38s |
完全なAstra/Fable推論の連鎖
両方の終端曲線を観察したところ、すべてのケースでxハイでピークを迎える。ファブルの科学的コーディングスコアはマックスでさらに上昇している。努力は順序的設定であり、つながり線を視覚的ガイドとして描いた。ここではAstraとFableのみをスキャン。ソルは上記の2つの設定でしか出現せず、その他の設定では出現しない。
私はこのデータをどのように解釈したか
作業負荷を分離して扱う。 Terminal-Bench v4.0 および SciCode はコーディング評価に用いられる。コストおよびトークンの値は、より広範なツールセットにおけるインテリジェンスインデックスv4.3の加重平均値である。最初の回答までの遅延は、別々のAPIパフォーマンスプロンプトから得られたものであり、テストされたパッチを完成させるまでの経過時間とは異なる。論理的トークンはすでに総出力に含まれている。
スナップショットの日付は意図的に明記している。Fable xhigh の最初の回答までの時間は、9月8日の一連の測定では 99.86 秒、9月10日の比較では 138.38 秒だった。これを性能低下の測定結果とは読まない。応答時間は変動するため、この標本から完了時間の安定した倍率は決められない。
私が書いたPDFでは、Astra/Fableの単トークン価格、努力の代替のトレードオフ、手法、限界、そして私が提案するペア評価プロトコルについて記載している。新たに有料モデルの試験は実施していない。APIコストは直接的にサブスクリプション使用許容量に換算されない。
ソースと再利用可能なデータ
選抜比較には、9月10日に取得した Artificial Analysis の測定値を用いた。全設定の比較では、9月8日の元データと、その時点での私の解釈を保持している。