芸術を見ることは、ある心についての推論である。生成画像に対する反応は、その推論が不可能になると同時に安全でもなくなったときに起こることである。よくある二つの説明はいずれも失敗する。質を持ち出す議論が失敗するのは、価値の下落が表面に見えるものではなく帰属によって引き起こされるからである。純粋な労働代替の議論が失敗するのは、それが嫉妬を予測するのに対し、実際に観察されるのは憤怒だからである。以下に示すのは、分離可能な三つの層からなる理論であり、そのうち二つを私は正しいと考え、一つについてはより緩やかに保持している。
第一節芸術を見ることは、生成する心についてのベイズ推論である
鑑賞者を、人工物を生み出した過程について推論するエージェントとして扱う。そうすると美的な関与は、おおよそベイズ的驚き、すなわち作品 x を観察したあとの生成者 θ についての事後分布の移動として表される。
S(x) = DKL( P(θ | x) ‖ P(θ) )
絵画において θ は一人の人間であり、事後分布は大きく動く。生成画像においては、尤度は鑑賞者がすでに知っている公開モデル M に支配されるため、人間についての事後分布はほとんど動かない。その移動量は、プロンプトの長さによって上から抑えられている。
第二節複雑性の主張は「他人による再現可能性」として述べるのが正しい
形式的な主張は、検証がきわめて容易な不等式である。公開モデル M によって、プロンプト p、シード s、サンプラー設定 c から生成された拡散モデルの出力 x について、
K(x | M) ≤ |p| + |s| + |c| + O(1)
が成り立ち、しかもこの上界は構成的である。これらのビットを誰かに渡せば、その人は x をそのまま再生成できる。絵画にはそのようなプログラムは存在しない。最小記述が事実上、画家の脳状態を要求するからであり、それは公開でも譲渡可能でもない。
とはいえ、生の K は汎関数として誤りである。一様なノイズが K を最大化するが、それには何の価値もないからである。標準的な修正が二つある。ベネットの論理的深さ(1988)は、ほぼ最小のプログラムの実行時間を測るので、生の非圧縮性ではなく蓄積された計算量を数える。人間の人工物が深いのは、何十年もの反復された修練が一つの表面へと放出されているからである。ゲルマンとロイドの有効複雑性(1996)、および同等のものとしてコッペルの洗練度(1987)は、最小記述を構造的な部分とランダムな部分に分け、構造的なビットだけを数える。重要なのは、特定可能な行為者に帰属できる構造的な深さであり、一回の生成についてはそれはほぼゼロである。深さは M の中にあり、M はあらゆる出力に共有されているからである。
実用上有効な形は再現可能性として述べたものであり、それは二値ではない。ファン・メーヘレンはフェルメールを再現できた。贋作の事例の要点はまさにそこにある。したがってこの量は二つのパラメータをもつ。すなわち、どれだけの割合の行為者がこれを再生成できるのか、そしてそれぞれにどれだけの費用がかかるのか、である。
第三節エネルギーは通貨として誤りであり、還元不能な直列的注意こそが正しい
物理的な直観は正しいが、単位が誤っている。出力あたりのジュールとして述べると、この議論は自らの土俵で負ける。画家がおよそ 20 W で四百時間働けば消費は数十キロワット時であり、一回の生成は数ワット時、そして学習実行はその双方を圧倒する。さらに悪いことに、同一の媒体の中では、出力あたりのエネルギーは技能と逆相関する。名人は一時間で描き、初心者は三十時間かけてより多く消費する。もし出力あたりのジュールが効いている変数であるならば、我々は初心者をより高く評価すべきであり、サージェントの速さは彼の欠点として数えられることになる。
実際に効いている三つの性質
問題となる費用は、特定可能な個人によって負担され、代替不能な予算から引き出され、そして示されようとしている形質に対して単調でなければならない。人間の注意はこの三つをすべて満たす。脳は体重のおよそ 2% でありながら基礎代謝のおよそ 20% を消費し、注意は直列的で代謝的に上限があるため、四百時間は借りることも並列化することも購入することもできない。データセンターの費用は現実のものだが、代替可能であり(貨幣)、償却可能であり(学習費用は N → ∞ の利用回数で割られる)、負担者を問わない。ジュールを燃やしてはいても、三つすべてに失敗している。ランダウアー限界はここでは的外れである。神経計算はそれより何桁も上で動いており、効いているのは熱力学的効率ではなく稀少性だからである。
第四節誠実さ:単一交差条件は成り立っていた、そして今は成り立たない
スペンスの単一交差条件は、シグナルが型を分離するのは、それを産出する限界費用が送り手の質に対して減少する場合に限る、と述べる。技芸についてはこれが成り立つ。一定の水準の作品を仕上げるのに要する時間は技能とともに減少するので、作品は誠実なシグナルであり、市場は分離均衡にある。生成については、限界費用は送り手を通じてほぼ一定である。誰もが同じ一セントの何分の一かを払うからである。質についての微分はゼロへ向かい、単一交差条件は破れ、分離均衡は一括均衡へと崩れ落ちる。
一括均衡と代替を区別する予測
一括均衡のもとでは、疑いようもなく人間が作った作品もまた価値を失う。観衆がもはや人工物を条件として推論できないからである。損害は、一部の買い手がより安い供給者へ移ることだけではない。どの芸術家をも読み取り可能にしていたチャネルが、そこにいる全員にとって劣化したということであり、これには一件の依頼も失っていない者も含まれる。
第五節怒りはどこにあるのか
芸術家は十年をかけて、譲渡不可能な予算を、自分を非芸術家から分離するシグナルへと変換する。資産であったのは個々の絵ではない。シグナリング均衡の中に占める地位である。プールが汚染されるとき、その資産は誰にも奪われることなく破壊される。相手方も、窃盗も、救済の手続きも存在しない。ただ機能しなくなるのである。
これは、最も強い怒りを確実に生む種類の被害の形である。別の場合と比べてみればよい。より優れた芸術家が現れて自分を打ち負かすなら、自分は負けるが、均衡は保たれ、序列は依然として何かを意味している。それが生むのは嫉妬である。一括均衡は序列そのものを、自分の十年が何かを意味していたというその部分も含めて、無効にする。
被害が構造的で目に見えないため、怒りは手に入る唯一の具体的な事例、すなわち個々の生成画像に向かう。公の議論が質についての主張、余分な指やスロップ、に支配されるのはこのためである。それらは訴えの内容を実際には捉えておらず、年ごとに弱くなっていく。それらは代理指標であり、誰もが半ばそれを知っている。この議論が当事者の誰をも満足させない理由の一つはそこにある。
1. 情報の層(公開された圧縮器に対するコルモゴロフ複雑性)
この人工物から、特定の心について何を推論できるか。利用可能な証拠の上限を定める。再現可能性として測る。すなわち、何人が、それぞれどれだけの費用で。
2. 誠実さの層(スペンスの単一交差条件、保証人としての生物物理)
その推論は信頼できるのか、それとも誰でも安く偽装できるのか。直列的注意が個人に属し、代替不能で、技能に対して単調であることによって成り立っていた。
3. 均衡の層(一括均衡)
層2が破れたとき、全員の人工物に何が起こるか。チャネルは参加者全員にとって劣化する。怒りがあるのはここであり、それは偏りではない。
第六節贋作は自然実験であり、芸術はすでにその実験を走らせている
ファン・メーヘレンの《エマオの晩餐》は、1937年にフェルメール作としてボイマンス美術館に取得された。金額は五十万ギルダー前後と伝えられることが多く、アブラハム・ブレディウスが誌上で真作と認定した。1945年に絵具が変わったわけではない。評価は帰属だけで崩壊した。
これは変数をきれいに切り分ける。物理的な人工物は同一、表面の特徴は不変、そしてあらゆる鑑賞者のそれまでの美的経験も変わらないまま、しかし事後的に無効化された。ファン・メーヘレン自身の技量は並外れていたが、それが作品を救うことはなかった。価値は初めから技量にあったのではなく、その表面が誰の心についての推論を許すのか、にあったからである。
本質主義の研究は、素朴な心のモデルがこうした事態のはるか以前からこの形に作られていたことを告げる。ニューマンとブルーム(2012)は、人々が物理的に同一の複製よりも原作を高く評価すること、そしてそれが知覚された質ではなく、制作者との接触や創造的な遂行についての信念によって媒介されることを見出した。ブルームの伝染についての研究も並行している。有名人が所有していた衣服への支払意思額は、その品が洗濯されたと告げられると下がる。生成画像は新種の心理を起動するのではない。聖遺物と贋作のためにすでにそこにあった機構の上に着地しているのである。
ただ一つの構造的な違いが、予測を鋭くする。贋作では事後分布は別の人物へと移る。生成では、それはいかなる人物でもないところへ潰れる。したがって AI に対する減価は贋作に対する減価を上回るはずであり、これを直接測定した者はまだいない。
第七節三つのチャネルとその解離
人間の構造的な寄与は、生成に対して異なる関係をもつ三つの要素に分かれる。
| チャネル | それが何であるか | 生成がそれに何をするか |
|---|---|---|
| 技能の顕示 | 譲渡不可能で、代謝的にも時間的にも費用がかかり、能力に対して単調である。古典的なザハヴィ型のシグナル。 | 消滅する。費用はゼロへ向かい、技能に対して単調でなくなる。 |
| 同一性としての様式 | 一つの神経系に固有の圧縮方式。十点のロスコは十一点目を予測する。様式が同一性として機能するのはまさにそのためである。 | 反転する。公開モデルはあらゆる公開された様式を取り込み、求めに応じてそのいずれをも出力するので、様式は人を指し示さなくなる。模倣が敬意ではなくなりすましとして読まれるのはこのためである。 |
| 見える選択肢空間に対する選択 | 選択の複雑性を、観衆に見えている選択肢に対して測ったもの。デュシャン、ケージ、ミニマリズム、コンセプチュアル・アート。 | 生き残る。ただし現在は使われていない。三語では選択肢空間は見えず、選択に費用もかからない。 |
第三行は、「プロンプトこそが芸術である」という主張が自動的に偽ではない理由である。それは原理として偽なのではなく、現在の入力の規模において経験的に偽なのである。選択肢空間が読み取れるようになり、選択に費用がかかるようになったとき、それは真になる。
第八節二つの扉、そのいずれも今は開いていない
写真はまさに同じ理由で退けられた。機械的で魂がないというボードレールの1859年の非難は、語彙を替えた現在の反論そのものである。写真の復権は二つのチャネルを通って進んだ。いま利用できるのも同じ二つである。
K(x | M公開) を上げること。自前のコーパスによる学習、数百回の反復、合成、出力の上に加える手作業。これは個人に帰属できる構造的なビットを回復させる。同時に時間費用も回復させるが、それは偶然ではない。注意こそが稀少な予算であるために、両者は連動して動く。
譲渡不可能な制約を導入すること。写真は強い指標的制約をもつ。撮影者はそのとき、そこにいなければならなかった。現在することは代替不能な予算から引き出されるので、単一交差条件を回復させる。戦場写真やストリート写真が誠実なシグナルであるのはこのためである。生成における対応物は、ライブでの上演、物理的な制作、そして反復不可能な条件へのリアルタイムの応答である。
その双方を欠くなら、生成芸術はおおよそ1860年の写真が置かれていた場所にいる。
第九節この理論が予測するもの
| 検証 | 各結果が意味するもの | |
|---|---|---|
| 1 | 段階的な来歴。同一の画像に、異なる説明文を付す。三語のプロンプト、四十回の反復、あるいは数百時間をかけた自前のコーパスでの学習。 | 主張された入力量に単調に追随するなら、複雑性による説明が支持される。AI か否かの二値的な反応であれば、本質主義が支配的であり複雑性は随伴現象にすぎない。これが最も診断力の高い研究であり、段階的な版はまだ適切に実施されていない。 |
| 2 | 同一の減価パラダイムにおける贋作と生成の比較。 | 理論は生成に対するより大きな減価を予測する。事後分布が移動するのではなく崩壊するからである。 |
| 3 | 様式の署名に対する感受性。存命の特定の芸術家の様式と、一般的な様式とを、質を統制して比較する。 | 名指された様式でより鋭い減価が生じるなら、同一性のチャネルが技能のチャネルに加算的であることが確認される。 |
| 4 | 汚染された市場における、人間の作と検証された作品の価値。 | 一括均衡は、来歴が保たれ収入が保護されていてもなお損失を予測する。純粋な代替説は損失を予測しない。 |
| 5 | 収入上のリスクを揃えたうえでの、実作者における勾配。 | 代替説は一様であることを予測し、同一性の脅威は急な勾配を予測する。略式の観察は勾配を支持しており、これは経済的な項にとって問題となる。 |
最も明快な思考実験はこうである。来歴が完全かつ安価に検証でき、分離均衡が完全に回復し収入も保護されたとしよう。怒りは消えるか。経済学はおおむね消えると答える。同一性の脅威は消えないと答える。なりすましは依然として成立しているからである。私の予想は、怒りは大きく下がるがゼロには達せず、残余は様式模倣の項である、というものである。
第十節この議論の弱い箇所
三つの留保を、埋め込むのではなく明示しておく。
K は計算不可能であり、ここで測っているものは何もない。実際に理論化されているのは、圧縮可能性と帰属についての観衆の素朴なモデルである。形式論は仮説の形を与え、段階的来歴の予測を生む。経験的な内容は、知覚された労力、知覚された選択肢空間、来歴についての信念にあり、いずれも測定可能であり、いずれも K ではない。K そのものを効いている変数だと主張するのは擁護できない。
この理論は無関心を説明しない。個人差を別の項として必要とする。シグナリング均衡に最も深く組み込まれている者ほど一括均衡から失うものが大きく、最も強く反応するはずである。これは予測であり、検証可能である。
三つの効果はモデルの外に置くべきである。取り込んでしまえば、この説明は正当な訴えの合理化として読まれる。すなわち、盗用と職の代替。これらは道徳的かつ経済的な問題であり、認知的な物語を必要としない。モード崩壊。これは出力分布が集中していることについての真正な質の主張であり、反論が本当に表面についてである唯一の場合である。そして混雑。これは純粋な外部性であり、たとえ個々の人工物に問題がなくとも、量が探索費用を押し上げる。
第十一節残余
労力のヒューリスティックは二十年前からデータに現れている。同一の作品でも、制作に長い時間がかかったと告げられた被験者はより高く評価する(Kruger et al. 2004)。ラベリング研究は生成作品についてこれを再現しており、効果は画像から検出できる何かではなく、知覚された労力と意図性に乗る(Chamberlain et al. 2018; Bellaiche et al. 2023)。そのいずれも、本当は労力についての話ではなかった。労力は、ある一種類の行為者だけが支払える費用の代理指標であり、人工物は初めから、その行為者の痕跡としてのみ興味深かったのである。
生成画像が嫌われるのは、それが悪いからではない。その向こう側に誰もいないからであり、そして、かつて確かに誰かがいたということを見分けるのを、その存在が難しくするからである。