第3章報酬システムと予測誤差
期待された結果と実際の結果との差、すなわち予測誤差の信号としてのドパミンについて、そして関与を最大化するのが報酬そのものではなく構造化された不確実性である理由について。
3.1 脳は予測機械である
現代神経科学の基礎的な洞察は、脳が感覚入力の受動的な受け手ではないという点にある。脳は能動的に予測を生成する装置である。網膜神経節細胞から前頭前皮質まで、神経階層のあらゆる水準で、脳は次に何が起こるかのモデルを構築し、それを実際に起こったことと照合する。予測と現実の差、すなわち予測誤差こそが、神経計算の基本通貨である。
この洞察は予測処理(Friston, 2010; Clark, 2013)という枠組みのもとで定式化され、知覚から行為、情動に至るまでの見取り図を描き替える。知覚とは脳が世界を「見る」ことではない。脳が世界についての仮説を立て、入力される感覚データに照らしてその仮説を検証することである。行為とは脳が何かを「する」ことではない。脳が世界を自らの予測に合致させようとする試みである。情動は出来事への反応ではない。脳の予測がどれだけうまくいっているかを伝える信号である。
ゲームにとって、この枠組みは基礎をなす。脳の本領が予測と誤差修正にあるのだとすれば、ゲームとは、構造化され解消可能な予測誤差を制御された速度で生成するために設計された環境である。そこで問いはこうなる。これらの誤差を処理するのはどの神経系か。そして、ある誤差のパターンを報酬に感じさせ、別のパターンを苛立たしく感じさせるものは何か。
3.2 ドパミンは報酬予測誤差をエンコードする
その答えは、中脳に存在する小さな神経細胞群から始まる。これらの細胞は神経伝達物質であるドパミンを放出する。
ウォルフラム・シュルツ、ピーター・ダヤン、P・リード・モンタギューは、1997年の画期的な論文「A Neural Substrate of Prediction and Reward」(Science)で現代の枠組みを打ち立てた。マカクザルの中脳ドパミンニューロンを単一細胞で記録し、彼らは三つの典型的な反応パターンを同定した。
- 報酬が予想外に得られると、ドパミンニューロンは基礎水準を超える一過性のバースト発火を起こす。これは正の予測誤差、すなわち現実が予想より良かったことを意味する。
- 報酬が予測どおりに得られると、ニューロンの発火頻度は変化しない。予測誤差はゼロであり、モデルが正しかったことを意味する。
- 予測していた報酬が得られないと、ニューロンの発火は基礎水準より低く抑えられる。これは負の予測誤差、すなわち現実が予想より悪かったことを意味する。
この信号が表すのは報酬そのものではなく、予想と実際の出来事の差である。音の後にジュースが出ると学習したサルは、予定どおりにジュースが出てもドパミン反応を示さない。報酬は完全に予測されており、新しい情報をもたらさないからである。しかし音の後にジュースが出なければ、ドパミンニューロンの活動は積極的に抑制される。脳のモデルが誤っていたためであり、この抑制信号がモデルの更新を促す。
このパターンは、モンタギュー、ダヤン、セイノフスキー(1996)が定式化した時間差分(TD)学習アルゴリズムを実装している。誤差信号は δ(t) = r(t) + γV(t+1) - V(t) である。この信号の見事さは、それが評価(期待より良かったか悪かったか)であると同時に、教師信号(それに応じてモデルを更新せよ)でもある点にある。学習が進むにつれ、ドパミン反応は時間軸上を前方へ移る。バーストは報酬の瞬間から、報酬を予測する最も早い手がかりへと移動する。連合が完全に学習されると、手がかりがバーストを引き起こし、報酬そのものは反応を生まず、報酬の省略が抑制を生む。シュルツによる1998年のJournal of Neurophysiology誌のレビューは、このパターンが報酬の種類や実験パラダイムを越えて一般的に成り立つことを確認した。
ゲームにとっての含意は、ただちに、そして広範に及ぶ。
3.3 ゲームにおける意味
予測された結果だけを生み出すゲームは、ドーパミン系の報酬信号を生成しない。プレイヤーが優れていて、完璧に操作を行っており、すべての戦闘で勝利し、すべての障害を克服している場合でも、驚きがなければドーパミン系は何の報告もしない。このため、完全にマスターされたゲームは、プレイヤーが高水準でプレーしているにもかかわらず、つまらないと感じられる。驚きのないパフォーマンスは信号を生成しない。ゲームは「解かれた」という状態に達しており、かつてエンゲージメントを支えていた予測誤差はゼロにまで減少している。
予想より悪い結果を生むゲームは、ドパミンの活動を抑制する。これは、プレイヤーが「不公平」と表現する体験の神経化学的な特徴である。ゲームが、プレイヤー自身の誤りでは説明できない形で、そのモデルを裏切ったのである。壁越しにプレイヤーを倒す敵、正しいタイミングでも当たり判定の不具合で失敗するジャンプ、回避不能な攻撃を持つボス。これらは「この仕組みの動作についてのあなたのモデルは誤っている」という負の予測誤差を生むが、プレイヤーは修正できる原因を見いだせない。抑制は嫌悪的に経験され、解消されない負の予測誤差が繰り返されると、ゲームから離れるようになる。
予測より良い結果、または予測と異なっていても学びにつながる結果を定期的に生むゲームだけが、没入に伴う神経化学的な特徴を維持する。エリートの背後に手榴弾を投げれば敵が回避して自分の射線へ飛び込んでくる、と発見したプレイヤーは、正の予測誤差を経験している。結果が自分のモデルの予測より良かったのである。特定のカードの組合せが予想外の相乗効果を生むと気づいたプレイヤーも、同じことを経験する。「思った以上にうまくいった」「予想しなかったが、今なら理由がわかる」という瞬間こそ、没入の素材となる。ドパミン系はそれぞれの瞬間をバースト発火で印づけ、「モデルを更新し、このような体験をもっと探せ」と伝える。
3.4 変動報酬はドーパミンを刺激し、固定報酬はそうしない
ゲームデザインに特に関係する知見として、Zald ら(2004, Journal of Neuroscience)の研究がある。PET を用い、予測不能な変動比率スケジュールによる金銭報酬は内側尾状核で有意なドパミン放出を引き起こす一方、同等の予測可能な固定比率報酬では測定可能な増加が生じないことを示した。脳の報酬系は、とりわけ予測不能性に反応する。固定された報酬は、どれほど大きくても完全に予測されるようになり、ドパミン信号を生まなくなる。
これは、ゲームにおいて変動報酬システムが普遍的に効果的である理由を説明する。一定の確率で追加ダメージを与えるクリティカルヒット、開けるまで中身のわからない戦利品ドロップ、見慣れた要素を新しい配置で提示するプロシージャル生成の環境。これらのシステムはいずれも、どの行動の結果もプレイヤーが完全には予測できないようにすることで予測誤差を保っている。報酬はアイテムでもダメージの数値でもない。何が起こるか分からないという驚きそのものである。
もちろん危険もある。変動報酬システムは、学習を伴わないまま関与を持続させうる。スロットマシンは還元可能性ゼロのまま高い予測誤差を生み出す。乱数生成器についてのモデルを、プレイヤーは改善しようがないからである。関与は不確実性に対するドパミン系の応答によって保たれるが、それは空虚な関与である。真のスキルの成長を伴わない「欲しがること」にすぎない。ここで、還元可能な不確実性と還元不能な不確実性の区別が決定的になる。
3.5 不確実性そのものが報酬となる:Fiorillo信号
シュルツの枠組みは、意外な結果が快く感じられる理由を説明する。だがゲームの本体は報酬を受け取ることではない。ゲームとは不確実性のもとで行為することである。結果はまだ定まっておらず、プレイヤーは自分が成功するかどうかをまだ知らず、システムは未解決の宙づり状態にある。
Fiorillo、ToblerおよびSchultz(2003、Science)は、不確実性そのものが特異なドパミン信号を生成することを示した。同じ中脳ニューロンからの記録により、報酬を予測する手がかりから報酬が与えられうる時点までの遅延期間に、持続的なランプ状の活動が生じることを彼らは同定した。このランプは、予測誤差を伝える瞬間的なバーストとは別物である。遅延のあいだに徐々に高まり、最大の不確実性であるP = 0.5でピークに達し、P = 0(報酬が確実に来ない)とP = 1.0(報酬が確実に来る)の双方に向かって対称的に減少した。この関数はベルヌーイ分布の分散、すなわち p(1 - p) に従う、最大の予測不能性を頂点とする逆U字であった。
P = 0.5に固定したまま報酬の大きさの分散を操作すると、取りうる結果の幅が広がるほどランプは高まった。信号が期待値ではなく不確実性を追跡していることが、これによってさらに裏づけられた。この知見には議論もある。ニヴ、ダフ、ダヤン(2005)は、逆伝播するTD誤差による別解釈を提出した。しかしメカニズムがどうであれ、機能的含意は変わらない。ドパミン系は、還元可能な不確実性が最大となるときに最も強く活動する。ゲームデザイナーが「最適な挑戦」あるいは「均衡のとれた難易度」と呼ぶ条件は、関与の神経化学的基盤が最も強力に働く条件なのである。
この知見は、難易度に基づくゲームデザインのモデルでは解けない謎を解く。難易度が同一でありながら、まったく異なる体験を生む二つの状況がありうる。コイン投げと接戦のチェスは、どちらもP = 0.5の不確実性を含む。しかしチェスは人を引き込み、コイン投げは引き込まない。違いは、チェスの不確実性が学習によって還元可能であるという点にある。プレイヤーの予測は改善しうる。コイン投げの不確実性は還元不能である。どれだけ研究を重ねても的中率は50%を超えない。正しく理解するならば、ドパミン系は単に不確実性に報酬を与えるのではない。行為を通じて不確実性を減らす機会に報酬を与えるのである。
3.6 脳は情報を報酬として扱う
これを補う知見が、ブロンバーグ=マーティンとヒコサカ(2009年、Neuron)から得られている。彼らは、報酬の大きさを予告する手がかりが結果を変えられない場合でも、マカクザルがその情報を与える手がかりを好むことを示した。これから来る報酬の大きさを明かす(しかし変えはしない)手がかりと、何も明かさない手がかりのどちらかを選ばせると、サルは圧倒的に情報のある方を選んだ。期待報酬を信号化するのと同じドパミンニューロンが、情報の期待をも信号化していた。ブランチャード、ヘイデン、ブロンバーグ=マーティン(2015)は、サルが前もって情報を得るために実際の報酬を犠牲にすることさえあることを示した。
脳は不確実性の減少を、それ自体として価値あるものとして扱う。何かの手段としてではなく、目的そのものとしてである。これが好奇心の神経的基盤であり、ゲームの最も際立った特徴の一つを説明する。すなわち、いかなる外的な見返りが現れるよりも前に、探索そのものが報酬に感じられるという事実である。扉を開けて新しい区画を見つけたプレイヤーは、ゲーム内通貨も経験値も受け取っていない。受け取ったのは情報であり、ゲーム世界についての不確実性の減少である。そしてそれは、食物や水や社会的報酬を扱うのと同じドパミン回路によって処理される。
3.7 報酬の分布的エンコード
ダブニーら(2020年、Nature)は、シュルツの枠組みを大きく拡張した。異なるドパミンニューロンが報酬分布の異なる分位点を同時に符号化しており、正の誤差と負の誤差に対する感受性が非対称であることを示したのである。楽観的なニューロン(期待を上回る結果により強く応じる)もあれば、悲観的なニューロン(期待を下回る結果により強く応じる)もある。それらは全体として、単一の期待値ではなく、起こりうる結果の確率分布そのものを保持している。
この分布的な符号化は、ゲームデザインに直接かかわる。結果が変動するゲーム、すなわちクリティカルヒットや戦利品ドロップやプロシージャル生成を備えたゲームが、決定論的なゲームと違って感じられる理由を説明するからである。脳は平均的な結果を追跡しているだけではない。不確実性の形そのものをモデル化している。すべての攻撃がちょうど10ダメージになるゲームと、1から19ダメージ(平均10)になるゲームは、期待ダメージは同じでも、分布としての予測誤差は異なる。変動するゲームはより豊かな誤差の地形を生み、上振れに驚き続けるニューロンと下振れに驚き続けるニューロンとを併存させ、より広い神経反応を持続させる。そして主観的にも、より人を引き込む体験になる。
3.8 ゲームとドーパミン系:直接的な証拠
ドパミンとゲームへの関与を結ぶ理論的枠組みは、直接の実測によって裏づけられている。
ケップら(1998年、Nature)はこの分野の基礎となる研究を行い、[11C]ラクロプライドPETを用いて、戦車を操縦するビデオゲームのプレイ中に腹側線条体で放射性トレーサー結合が約13%低下することを示した。ゲームプレイ中に内因性ドパミンが放出されている直接的な証拠である。成績スコアはドパミン置換量と相関しており、中脳辺縁系経路がゲームの成功度をパラメトリックに追跡していることが確かめられた。
その後のfMRI研究も、線条体の関与を一貫して再現している。ヘフトら(2008年、Journal of Psychiatric Research)は、単純な陣地侵入型のゲームが側坐核、眼窩前頭皮質、扁桃体を賦活することを見出した。クラーゼンら(2012年、Social Cognitive and Affective Neuroscience;2020年、Brain Structure and Function)は、一人称シューティングゲームの自由プレイ中に、成功イベントが尾状核、側坐核、被殻を賦活すること、そして非暴力的な成功では腹側線条体、暴力的な成功では背側線条体という解離が生じることを示した。
決定的に重要な知見は、能動的な主体性が報酬信号を増幅するという点である。ケッツュリら(2013年、Frontiers in Human Neuroscience)は、線条体の報酬反応が、同一のゲーム映像を受動的に観察するときよりも、実際に自分でプレイするときのほうが実質的に強いことを示した。とりわけ前部被殻では、能動的プレイ中の勝利イベントに対する差が最も鋭く現れた。他人がプレイするのを見ているときのドパミン信号は、自分で同じゲームをプレイするときより弱いのである。ゲームが映画より人を引き込む理由も、「実況プレイ」動画が面白くはあっても実際のプレイの神経化学的な強度を再現できない理由も、ここにある。強固な線条体ドパミン放出には主体性が必要なのだ。
3.9 「欲求」があるが「喜び」はない:ゲーム報酬の暗黒の側面
ベリッジとロビンソンのインセンティブ・サリエンス理論は、ゲームへの関与を十全に説明しようとするかぎり避けて通れない重要な精緻化をもたらす。三十年に及ぶ基礎的なレビュー(Robinson & Berridge, 1993、Brain Research Reviews;Berridge & Robinson, 2016、American Psychologist;Robinson & Berridge, 2025、Annual Review of Psychology)を通じて、彼らはゲームデザインにとって重大な帰結を持つ解離を確立した。ドパミンは、大きく頑健な中脳辺縁系の投射を介して「欲しがること」(インセンティブ・サリエンス)を媒介する一方で、快としての「好むこと」は、側坐核シェルと腹側淡蒼球にある、はるかに小さなオピオイドおよび内因性カンナビノイドのホットスポットに依存する。
この解離が意味するのは、変動報酬に対するドパミン系の応答が反復曝露によって感作されうるということである。その結果、「欲しがること」(渇望、強迫的な関与)は昂進していく一方で、「好むこと」(実際の快の享受)は横ばいか、むしろ低下する。これは行動嗜癖の典型的なパターンであり、楽しさが薄れたのに続けずにいられないというゲームプレイヤーの訴えに、そのまま対応している。シンガーら(2012)とマシアら(2018年、Neuropsychopharmacology)は、慢性的な変動比率強化がドパミン系の感作を生むことを示した。
「欲しがること」と「好むこと」の解離は、二種類のゲームを分かつ神経化学的な根拠である。ひとつは、学習を通じて真正な関与を保つゲームであり、そこでは報酬は不確実性の減少であり、「好むこと」が「欲しがること」に追随する。もうひとつは、変動強化スケジュールによって強迫的な関与を保つゲームであり、そこでは「欲しがること」だけが昂進し「好むこと」は停滞する。本書が提案する統合モデルが扱うのは前者であり、後者は同じ回路の病的な搾取である。
3.10 移行
ドパミン予測誤差の枠組みは、統合モデルの第一の柱を与える。予測が外れたとき、脳は特有の神経化学的信号を生成し、その信号こそが関与の基盤となる。変動的で還元可能な不確実性は、この信号を最大化する。
主体性はそれを増幅する。そして脳は、情報そのものを内在的に報酬として扱う。
しかし予測誤差だけでは足りない。ドパミン系は、意外な結果がなぜ快く感じられるかを説明する。だが、不確実な状況が生じたときに応答するだけでなく、脳がなぜみずから不確実な状況を求めに行くのかは説明しない。それを理解するには好奇心が要る。外的な見返りが何ひとつ示されていなくとも、プレイヤーを探索させ、試させ、情報を追わせる動因である。
第4章好奇心と探索
内発的動機づけと外発的動機づけの区別について、不確実性を解消しようとする脳の動因について、そして外的な見返りが訪れる前に探索が報酬に感じられる理由について。
4.1 好奇心という動機状態
好奇心は贅沢品ではない。空腹や渇きと神経的な構造を同じくする生物学的な動因状態であり、生物に情報を求めさせ、環境についての不確実性を減らさせる。前章で述べた予測誤差系と好奇心との違いは、反応的な関与と能動的な関与の違いである。予測誤差は期待が裏切られたときに起こることであり、好奇心は、期待が裏切られうる状況を生物に探させるものである。
グルーバー、ゲルマン、ランガナス(2014年、Neuron)は、好奇心と報酬回路をつなぐ重要な実証的な環を与えた。fMRIの最中に、彼らは好奇心の喚起度を調整した雑学問題を提示した。好奇心の高い状態では、目当ての答えだけでなく、好奇心が続いていた期間にたまたま目に入った顔刺激の記憶までもが強化された。問題と答えのあいだに提示された顔は、その問題が参加者の好奇心を引くものであった場合に、よりよく記憶されたのである。雑学の内容とは何の関係もない顔であるにもかかわらず。この増強は、中脳(黒質・腹側被蓋野)と側坐核における先行的な活動によって予測され、中脳と海馬の機能的結合がその効果を媒介していた。
その含意は際立っている。好奇心は、特定の情報を学ぶ準備を脳にさせるだけではない。学習全般が増強される時間の窓を開き、ドパミン作動性の調節によって海馬の記憶系をあらかじめ整えるのである。ゲームデザインの言葉に直せば、次の扉の向こうに何があるのか、新しいメカニクスが何をするのか、二つのシステムがどう噛み合うのかと考えているプレイヤーは、あらゆる学習にとって神経化学的に増強された状態にある。その好奇心の元の対象とはまったく関係のない学習についても、である。
グルーバーとランガナスのPACEモデル(2019年、Trends in Cognitive Sciences)はこれを定式化した。好奇心は有意な予測誤差によって引き起こされ、次に評価を受け(この誤差は興味深いのか、脅威なのか)、安全かつ情報をもたらしうると評価された場合に、海馬へのドパミン作動性調節を通じて記銘を強化する。この評価の段階はゲームにとって決定的である。同じ予測誤差が、プレイヤーがその環境を探索しても安全だと感じるかどうかによって、好奇心にも不安にもなる。ホラーゲームが脅威を慎重に較正しなければならないのはこのためである。現実味のある危険が強すぎれば好奇心は恐怖に転じ、探索による学習勾配は崩壊する。
4.2 ゴルディロックス効果
好奇心は、不確実性のあらゆる水準に一様に分布しているわけではない。キッドとヘイデン(2015年、Neuron)は、彼らが「ゴルディロックス効果」と呼ぶものの証拠を概観した。生物は中程度の複雑さを持つ刺激に優先的に注意を向ける。予測しやすすぎて退屈でもなく、意外すぎて混乱を招くのでもない刺激である。乳児は確率が中程度の視覚系列をより長く注視する。成人は中程度の難度の雑学問題を最も好奇心をそそるものと評価する。尾状核と下前頭回(Kang et al., 2009、Psychological Science)は、興味を引くには十分大きく、解決できそうに思えるには十分小さい情報ギャップに対して、最大の賦活を示す。
ゴットリーブ、ウデイエ、ロペス、バラネス(2013年、Trends in Cognitive Sciences)、およびゴットリーブとウデイエ(2018年、Nature Reviews Neuroscience)は、これを期待情報利得によって探索が導かれるという枠組みに統合した。脳は、ある経験がどれだけモデルを改善しうるかを見積もり、不確実性の減少が最も見込める経験へ注意を向ける。これは単なる新奇性の追求ではない。自分が何を理解していて何を理解していないかについての現在のモデルに導かれた、戦略的な不確実性の削減である。
ゲームデザインにとってこれは、最も好奇心をそそる要素が、最も新奇なもの(理解不能かもしれない)でも最も馴染み深いもの(退屈である)でもなく、プレイヤーの現在の理解の境界に位置するものだということを意味する。取りつくには十分に馴染みがあり、新しい学びを約束するには十分に未知であるような要素である。これは好奇心におけるフロー・チャンネルの対応物であり、優れたレベルデザインが新要素を一度にではなく段階的に導入する理由を説明する。
4.3 内在的動機と外在的動機
ライアンとデシの自己決定理論(SDT)は、人がなぜ自発的に活動に関わるのかを理解するための、最も影響力のある枠組みである。SDTは三つの基本的心理欲求を挙げる。自律性(自らの行動の源泉であるという感覚)、有能感(自分の関わりが有効であるという感覚)、関係性(他者とつながっているという感覚)である。活動がこれらの欲求を満たすとき、その活動は内発的に動機づけられる。人は外的な誘因を必要とせず、その活動自体のために取り組む。
リグビーとライアン(2011)はSDTをゲームに適用し、プレイヤーの動機づけがこの三つの欲求の充足を追跡することを示した。選択肢を与えるゲームは自律性を満たす。適切な挑戦とフィードバックを与えるゲームは有能感を満たす。意味のある社会的相互作用を可能にするマルチプレイヤーゲームは関係性を満たす。
この枠組みは、大づかみな動機づけのパターンを正しく予測する。プレイヤーは、選択肢を与え、適切に挑戦させ、他者とつないでくれるゲームを好む。
しかしSDTは、フロー理論と同じく静的な枠組みである。何が人を動機づけるかを特定はするが、時間のなかで展開する動的な過程を記述しない。三つの欲求をすべて満たしていても、瞬間ごとの予測誤差率が適切でなければ、ゲームは人を引き込みそこねる。SDTは、プレイヤーが自律性と有能感と関係性を感じている必要があると教えてくれる。だが、その感覚を持続させるために次の10秒のゲームプレイで何が起こるべきかは教えてくれない。それは学習勾配の役割であり、のちの章で展開する。
4.4 アンダーマイニング効果
動機づけ研究において最も頑健な知見の一つがアンダーマイニング効果である。外発的報酬は内発的動機づけを損ないうる。デシ(1971)は、パズルを解くことに報酬を支払われた参加者が、その後に無報酬でパズルを解こうとする意欲を低下させることを示した。行動に外的な理由(「金のためにやっている」)が導入されると、内的な理由(「面白いからやっている」)が押しのけられ、外的報酬が取り除かれたとき、その行動は報酬導入前の水準を下回るところまで落ち込む。
ゲームデザインにおいてこの効果は、真正な学習によって関与を保つゲームと、トークンの蓄積によって関与を保つゲームとの差として現れる。明示的な報酬システム、すなわち経験値バー、実績通知、デイリーログインボーナス、達成率表示は、不確実性の減少という内発的報酬を押しのけかねない外的な指標を与える。ダンジョンの中に何があるのかを知るために探索するプレイヤーは内発的に動機づけられている。関与を駆動するのは好奇心であり、報酬は理解である。進捗バーを埋めるためにダンジョンを攻略するプレイヤーは外発的に動機づけられている。その関与はバーに依存しており、バーを取り去れば動機も消える。
ここから導かれる設計上の含意は、外発的報酬を一切使うなということではない。それが内発的な学習に従属すべきだということである。外発的報酬が最もよく働くのは、真正な達成(この技能を修めた)を刻むときであり、最も悪く働くのは単なる活動量(ここに時間を費やした)を刻むときである。そして最悪なのは、それが関与の主たる理由になってしまい、好奇心に導かれた探索を、トークン集めの用事へと変質させてしまうときである。
Breath of the Wildと、Ubisoft流のマーカー偏重なオープンワールドの定型との対比が、この点をよく示している。Breath of the Wildは、世界を視覚的に読めるものにするために膨大な設計努力を注いでいる。目印となる建造物は遠方からも見え、異様な構造物は隠されたコンテンツを告げ、地形の起伏はUIのマーカーなしに視線を目的地へ導く。「クエストマーカー」の仕事をプレイヤー自身の知覚系が担うため、探索の過程そのものが能動的な注意を要求する。これに対しUbisoftの定型的な手法、すなわち地図を開放する塔、目標マーカー、達成率のトラッカーは、不安を和らげる代わりに自己目的的な動機を殺し、探索をやることリストへと変えてしまう。アイコンがすべて地図上に見えているとき、探索はもはや発見ではない。お使いである。
4.5 探索と活用
探索と活用のトレードオフは適応的行動における基本問題であり、強化学習では多腕バンディット問題として定式化されている。生物は、報酬が既知の選択肢を活用し続けるべきか、それとも、より良いかもしれない未知の選択肢を探索すべきか。
脳内でこのトレードオフを媒介するのが青斑核・ノルアドレナリン(LC-NE)系である。アストン=ジョーンズとコーエン(2005)は、二つの動作モードからなるモデルを提案した。
- 位相性モード。ノルアドレナリンの基底水準は低く、課題に応じた一過性のバーストが生じる。注意は絞られる。生物は既知のものを活用する。よく理解された課題への持続的な関与、すなわちフローと結びついたモードである。
- 緊張性モード。ノルアドレナリンの基底水準は高く、注意は広くサンプリングされる。生物は探索する。注意は頻繁に移る。好奇心、注意散漫、そしてより良い選択肢の探索と結びついたモードである。
ゲームはこの両方のモードを管理しなければならない。位相性モードを際限なく続けさせるゲームはフローを生むが、現在の課題が尽きたときにプレイヤーを退屈させる。緊張性モードを際限なく続けさせるゲームは、持続的な集中がもたらす深い関与を欠いた、落ち着かない探索を生む。最良のゲームはこの二つのあいだを振動する。探索の局面(緊張性モード)が新しい課題を見つけ出し、その課題が習熟のための持続的な関与(位相性モード)を要求する。
Breath of the Wildの構造はこの振動を体現している。祠や目を引く地点のあいだの移動は探索的である(緊張性モード)。プレイヤーは地平線を走査し、遠くの目印に気づき、調べに行くことを決める。祠のパズルは集中的である(位相性モード)。注意は単一の課題に絞られ、フィードバックは即座に返り、プレイヤーはフロー状態に入る。戦闘もまた、探索のあいだに集中的な関与の挿話を打ち込む。このゲームの非凡さは、どちらのモードにも長くとどまることを決して強いない点にある。移行はプレイヤー自身が引き起こし、だからこそ自然に感じられる。
4.6 ゲームが好奇心をどのように構築するか
ゲームは情報ギャップを体系的に構築することで好奇心を生み出す。問いを立てられるだけの知識はあるが、それに答えられるだけの知識はない、という状況である。
戦場の霧は地図の一部を覆い隠し、空間的な情報ギャップを作る。施錠された扉は、その向こうに何かがあることだけを告げ、構造的な情報ギャップを作る。部分的にしか開示されない戦利品テーブルは、より良いアイテムが存在することは知らせながらどれがそうなのかは伏せ、報酬についての情報ギャップを作る。スキルツリーはまだ解放されていない能力を見せ、能力についての情報ギャップを作る。物語の引きは、登場人物と対立を導入しながら解決を与えず、物語的な情報ギャップを作る。
これらのシステムはいずれも同じ機構で働く。ゲーム世界についてのプレイヤーのモデルは不完全であり、知っていることと知らないこととのあいだの隙間が予測誤差を生み、好奇心のシステムがその誤差を追う価値ありと判定する。この隙間は、興味を引くだけの大きさを持たねばならないが(ゴルディロックス効果)、同時に、解決は可能だとプレイヤーが信じられる程度に限られていなければならない。
Outer Wildsは、好奇心駆動のゲームデザインの最も純粋な実装である。このゲームには戦闘も、アップグレードも、恒久的な進行も存在しない。ループのあいだで変化するのは、プレイヤーが何を知っているかだけである。ゲーム内のあらゆる情報は最初の一分から手に入る。「進行」は完全に認識論的なものだ。学習勾配は、太陽系の仕組みとノマイに何が起きたのかについてのプレイヤーの理解が深まること、ただそれだけによって維持される。そして本作は、大半のゲームが依拠する従来型の報酬構造を一切持たないにもかかわらず、この十年で最も優れた設計の一つとして広く評価された。
4.7 移行
好奇心は、反応的な予測誤差システムに対する能動的な補完物である。両者は相まって、ゲームがなぜ注意を引きつけ、それを持続させるのかを説明する。予測誤差は意外な結果に出会ったプレイヤーに報酬を与え、好奇心はそもそもそうした出会いを求めさせる。
しかし、引きつけることと報いることは話の半分にすぎない。残りの半分は、関与を続けるプレイヤーの脳に何が起きるかである。技能がどのように獲得され、知識がどのように固定され、初心者の努力を要する処理が熟達者の自動的な流暢さへとどう変貌するのか。意識された無能から無意識の有能へというこの変貌が、次章の主題である。
第5章学習システムとスキルの獲得
努力を要する宣言的な処理から、自動的な手続き的実行への移行について、反復的な相互作用が神経回路をどのように再編するかについて、そして熟達を定義づける皮質から皮質下への転移について。
5.1 二つの記憶システム
脳は単一の学習システムを持たない。少なくとも二つを持ち、両者は並行して働き、計算上の性質も神経基盤も異なっている。
マイケル・ウルマンの宣言的/手続き的(DP)モデルは、Nature Reviews Neuroscience(Ullman, 2001a)で最初に提示され、Cognition(Ullman, 2004)とNeurobiology of Languageハンドブック(Ullman, 2016)で拡張された、最も明快な枠組みである。宣言記憶システムは海馬を中心とする側頭葉の構造に根ざし、事実とエピソードを扱う。何が起きたか、物がどこにあるか、規則が何を定めているかである。意識的かつ明示的で、獲得は速いが、時間的圧力のもとでの検索は遅い。手続き記憶システムは前頭皮質と大脳基底核(具体的には尾状核、前部被殻、ブローカ野)に根ざし、技能と習慣を扱う。物事のやり方、規則の自動的な適用、意識的な監視なしに複雑な系列を実行する能力である。無意識的かつ潜在的で、獲得は遅いが、いったん学習されれば実行は速い。
この解離はゲームの認知にそのまま重なる。ゲームについての事実、すなわちこの敵の体力は200、あの武器は火属性のダメージを与える、ボスは3秒ごとに攻撃する、といったものは宣言的である。ゲームの技能、すなわちボスの三番目の攻撃を回避ローリングでかわす、コンボを決める、対戦ゲームで相手の位置取りを読む、といったものは手続き的である。ゲームについて知っている状態から、うまくプレイできる状態への移行は、海馬による処理から線条体による処理への移行にほかならない。
特に重要なのは、DPモデルが手続き的システムが領域一般であると主張している点である。Ullman (2004) はこれを「運動および認知スキル、特にシーケンスを含むスキルの学習と処理を支える」と説明している。これにはナビゲーション、運動シーケンス、ルール、カテゴリ、および習慣が含まれる。Ullman (2016) はさらに、手続き的システムが「予測学習(特に確率的結果)に特化している可能性がある」と指定しており、たとえばシーケンス内の次のアイテムやルールの出力といったものに該当する。この予測機能は、ルール制約の下で行動の結果を予測しなければならないゲーム認知と直接対応している。
臨床的証拠は領域一般性という主張を支持する。線条体へのドパミン作動性投射を変性させるパーキンソン病は、運動系列の処理と文法処理の双方に並行した障害を生じさせる。Ullmanら(1997年、Journal of Cognitive Neuroscience)は、パーキンソン病患者が、規則的な過去形(規則の計算を要する)で不規則形(語彙の検索を要する)よりも不釣り合いに多くの誤りを犯すことを示した。海馬の宣言的システムのほうが変性しているアルツハイマー病患者では、これと逆のパターンが現れる。もし同じ回路がゲームの規則の適用を支えているのなら、パーキンソン病患者はゲームの規則の学習と適用にも並行した障害を示すはずである。実証的な検証に値する予測である。
5.2 運動学習の三段階
フィッツとポズナー(1967)は運動技能の獲得を三つの段階に分けて記述した。その区分は二重システムの枠組みにきれいに対応する。
認知段階では、学習者は自分が何をしようとしているかは分かっているが、それを滑らかに実行できない。動作は言語的で宣言的な過程に導かれ、プレイヤーは自分に向かって「Xで回避、それからYで攻撃」と唱えている。注意は運動課題に食い尽くされ、高次の戦略に割く余裕は残らない。誤りは頻発し、パフォーマンスは安定しない。この段階を支配するのはシステム2であり、前頭前皮質、前帯状皮質(ACC)、背外側前頭前皮質(dlPFC)が強く動員され、課題の規則を作業記憶に保持し、誤りを監視している。
連合段階では、パフォーマンスはより流暢で安定したものになる。行為と結果とのあいだに結びつきが形成され、誤りは減る。神経活動は前頭前野から離れ、感覚運動皮質と線条体の関与を増していく。皮質小脳ループは、内部モデルの改善とともに徐々に退いていく(Doyon et al., 2002)。壁ジャンプについてはもう考えないが、それでもときおりダッシュの角度を読み違えるCelesteのプレイヤーは、この過渡的な段階にいる。
自動段階では、パフォーマンスは正確で一貫し、おおむね自動的になる。活動は感覚運動性の線条体(被殻)、一次運動野、補足運動野、小脳核に集中する。dlPFCの活動は著しく減少する。決定的に重要なのは、プレイヤーがこの段階で、ゲームの戦略や環境の手がかりや対戦相手の挙動といった、より高次の情報に注意を向けられるようになることである。運動の遂行がもはや監視的な注意を必要としないからである。Guitar Heroの熟達者が初見の曲をExpert難易度で演奏できるのは、この領域である。
Kimら(2015年、PLOS Biology)は、初期の段階では注意、空間的作業記憶、運動計画にかかわる前頭および頭頂の領域が動員され、熟達したパフォーマンスでは感覚運動回路と小脳回路へ移行することを確認した。
5.3 皮質から皮質下への転移:熟達の神経メカニズム
技能の獲得に伴うシステム2からシステム1への移行は、比喩ではない。それは測定可能な皮質から皮質下への転移であり、複数の研究プログラムによって詳細に地図化されてきた。
Poldrack et al. (2005, Journal of Neuroscience) は、系列反応時間課題の最中にfMRIを用い、二重課題干渉の消失を指標として自動化を測定した。訓練前には、系列的なパフォーマンスが広範な前頭領域と線条体領域を賦活していた。訓練後には、dlPFC、腹側運動前野、下前頭回、右尾状核の活動が減少した。自動化は前頭前野の関与の低下によって特徴づけられ、その一方で背側運動前野と補足運動野は安定した活動を保った。基本的な運動プログラムの層は残り、監視の層だけが退いていくのである。
Lehéricy ら(2005, PNAS)は、運動系列の学習を 4 週間追跡し、大脳基底核そのものの内部で処理が移行することを発見した。初期学習では、dlPFC と運動前野に加え、吻背側の連合性被殻が活動した。熟達すると、活動は尾腹側の感覚運動性被殻へ移った。誤り率は初期学習領域の活動と正に相関し、反応時間は後期学習領域の活動と負に相関した。大脳基底核は大脳皮質から制御を引き継ぐだけでなく、内部でも認知回路から感覚運動回路へと再編される。
Haier 他(1992)は、おそらく最も鮮明な証拠を提示した。PET画像を使用して、Tetrisの練習が7倍のパフォーマンス向上をもたらすと同時に、皮質のグルコース代謝を低下させることを示した。脳は課題を劇的にうまくこなすようになりながら、使うエネルギーは劇的に減らしたのである。これは自動化の神経的な指紋であり、熟達の主観的経験を説明する。難しかったことが容易になるのは、必要な処理が減ったからではない。処理が、代謝的に安く計算的に速い回路へ移住したからである。
ゲームデザインにとって、皮質から皮質下への転移は、すべてのゲームが隠れた時計の上で動いていることを意味する。プレイヤーが練習を積むにつれ、処理は皮質(遅く、努力を要し、注意を食う)から大脳基底核と小脳(速く、自動的で、注意を解放する)へと移っていく。ゲームは、既存の課題が皮質下の自動性へ移住していくのとおよそ同じ速度で、皮質を再び動員する新しい課題を投入しなければならない。新しい課題の到来が遅すぎれば、プレイヤーの皮質はやることを失い、退屈が生じる。速すぎれば、皮質は自動化されていない要求に圧倒され、苛立ちが生じる。課題投入の最適な速度とは、そのプレイヤーの皮質から皮質下への転移速度に一致する速度である。
5.4 チャンク化の機構
アン・グレイビールの研究は、大脳基底核がどのように自動性を獲得するのかについて、機構的な枠組みを与えている。げっ歯類の習慣形成をめぐる数十年の仕事を通じて、彼女は線条体がチャンク化の機構を実装していることを示してきた。複雑な行為の系列が、次第に単一の自動化されたルーチンへと統合されていくのである。
鍵となる知見は、課題の括り出し(task-bracketing)と呼ばれる線条体の特徴的な活動パターンである。ニューロンは学習された系列の開始時と終了時に強く発火し、その実行中は沈黙する。ラットが迷路を覚えていく過程で、線条体ニューロンは当初、走行の全区間にわたって発火する。練習を重ねると、活動は開始点と終了点に凝縮し、系列の中間部は単一の自動化されたチャンクとして実行される。一連の個別の判断だったものが、単一の習慣的行為へと「コンパイル」されたのである。
これは、対戦格闘ゲームの複雑なコンボが、ボタン入力の連なりではなく一つの行為として感じられはじめるときに、プレイヤーが経験していることの神経的な実装である。当初は各方向入力を意識的に監視する必要のあった波動コマンドとパンチの系列が、単一の運動プログラムとして一塊に実行されるようになる。チェイスとサイモン(1973年、Cognitive Psychology)によるチェスのチャンク化実験は、認知の水準で同じ原理を明らかにした。熟達者は5秒間の一瞥のあと、およそ16個の駒の配置を再現できたが、初心者は約4個だった。ところが駒をランダムに配置すると、熟達者の成績は初心者と変わらなかった。専門性とは優れた記憶力ではない。長期記憶に蓄えられた約5万から10万の領域固有のパターンからなる蔵書であり、そのそれぞれが妥当な応手に結びついているのである。
5.5 専門的認知:転換の最終段階
ゲームにおける二系統理論の最も有力な証拠は、専門的パフォーマンスの研究から得られている。
Wan 他(2011, Science)は、fMRIを用いて、プロ棋士11名とアマチュア17名の将棋指しを比較した。1秒以内に最善の次の一手を生成させる(直観的処理を強いる)条件では、プロは尾状核に特異的な賦活を示した。これは大脳基底核の構造であり、同じ課題中のアマチュアではまったく沈黙していた。8秒の熟慮的な探索時間を与えると、プロにおいても尾状核は沈黙したままだった。また盤面の知覚時には、プロに特異的な賦活が楔前部に現れ、楔前部と尾状核の活動が共変した。パターン認識から直観的な行動選択へと至る回路の存在を示唆する所見である。Wanらの追跡研究(2012年、Journal of Neuroscience)は初心者を15週間訓練し、尾状核の賦活が直観的なパフォーマンスの向上と並行して現れることを見出した。これが生得的なものではなく学習されるものであることの確認である。
これは熟達者と初心者のあいだの漸進的な差ではない。課題を担う脳のシステムそのものが質的に切り替わるということである。完全な初心者(あらゆる判断がシステム2)から中級者(基本的な戦術がシステム1のパターン認識になる)を経て、名人(約5万から10万のチャンクからなる蔵書によって局面を瞬時に評価する)へ至る道のりは、数年の実践にわたる二重過程の軌跡を最も鮮明に描き出している。
カーネマン自身がサイモンを引きながらこう定式化している。「直観とは認識にほかならず、それ以上でもそれ以下でもない」。熟達者のシステム1は、かつてシステム2を要したものをすでに吸収しきっているのである。
5.6 競合する記憶システム
フォーデ、ノウルトン、ポルドラック(2006年、PNAS)は決定的な知見を加えた。学習中に副次課題を課すと、依拠する記憶が宣言的記憶(海馬系)から習慣学習(線条体系)へと移るのである。二つの記憶システムは競合する。海馬系が並行課題に占有されると線条体系が引き継ぎ、その結果生じる学習は、より習慣的で柔軟性に乏しいものになる。
これは、マルチタスクを要求するゲームに直接の含意を持つ。拠点運営と戦闘の同時進行を求めるリアルタイムストラテジーは、線条体の手続き学習経路を強いる。自動化は加速するかもしれないが、明示的な戦略理解を代償にしてである。プレイヤーは、なぜそれが効くのかを知らないまま良い習慣を身につけうる。一方、熟考の時間を許すターン制ストラテジーは海馬系を動員し、より柔軟だがより遅い学習を生む。
5.7 ゲームと言語は手続き的回路を共有している
本書の新しい理論的貢献の一つは、ゲームと言語が、階層的な系列構造を扱うために進化した前頭・大脳基底核回路を共有しているという主張である。その証拠はかなりの厚みを持つ。
文法規則を計算する手続き記憶システム、すなわち尾状核、被殻、ブローカ野(BA 44/45)は、ゲームの規則の学習、戦略的なチャンク化、熟達者の直観をも下支えしている。ゲームと言語はともに離散無限を示す。有限の規則が、限りのない組合せ空間を生成するのである。再帰的な規則を備えた有限の文法は無限の文を生成する。有限のゲーム規則の集合は、天文学的な大きさのゲーム木を生成する(チェスは約10^120ノード、囲碁は約10^360ノード)。両者はともに、巨大な空間を階層的なチャンク化とヒューリスティック探索によって渡り歩くという、同一の計算的課題に直面している。
Thibault、Py、Gervasi ら(2021, Science)は、道具使用に伴う階層的な運動計画と言語の統語処理に、大脳基底核の共通する神経機能基盤があることを示した。一方の機能を訓練すると他方も改善し、双方向の転移が認められた。ここから示唆される進化の道筋は、階層的な行動計画(霊長類に存在)→ 道具使用(下前頭回と大脳基底核を動員)→ 言語(同じ回路を記号の組合せへ転用)→ ゲーム(階層的で規則に従う系列行動を文化の領域へ拡張)である。
リギンズ(2020年、IEEE Conference on Games)は、ゲームのための文法的な形式体系を明示的に定義し、ゲームシステムを文法に類比的な形式構造として扱った。ブラウン(2016)は汎用ゲームシステムLudiiのための文脈自由文法を構築し、ゲームを「ルデーム(ゲームの原子)」の木として記述した。文が統語的構成素の木として記述されるのと、そのまま並行する。ゲームの規則と形式文法とのあいだの形式的な並行性は、比喩ではない。計算論的に厳密な対応である。
5.8 ゲームが変換エンジンとして機能する
あらゆるゲームは、その核心において、システム2の熟慮をシステム1の自動性へと変換する機械である。この変換の質、すなわち適切な速度でシステム2を動員する課題を投入すること、パターンの抽出を支えるフィードバックを与えること、自動性の獲得に合わせて難易度を調整することは、プレイヤーの体験を決める第一の要因である。
この変換をうまく捌いたゲームは、フローと熟達、そしてコスターが「学習」と名指したあの独特の快をもたらす。捌きそこねたゲームは、退屈(システム1が飽和し、学ぶべきものが残っていない)か、苛立ち(システム2が変換能力を超えて圧倒される)を生む。
最も息の長いゲームは、複数の時間スケールにまたがる入れ子になった自動化サイクルを作り出す。秒単位の瞬間的な運動学習、分単位の遭遇レベルでのパターン獲得、時間単位のシステムレベルの戦略理解、そして週から年の単位に及ぶメタレベルの領域専門性。そのそれぞれが独立したシステム2からシステム1へのパイプラインとして働き、次の階層へと供給していく。脳はどちらか一方のシステムでゲームを遊ぶのではない。両方で遊ぶ。そしてゲームデザインの技芸とは、その相互作用を振り付けることにほかならない。
5.9 移行
報酬、好奇心、技能獲得の神経メカニズムは、一つの像へと収斂する。脳は不確実性を減らす機械であり、しかも不確実性を減らすというその過程自体を内在的に報酬と感じる機械である。ドパミンは予測誤差を信号化する。好奇心は情報をもたらす経験の探索を駆動する。そして手続き記憶システムは、努力を要する学習を自動的な技能へと変換し、次の階層の課題のために認知資源を解放する。
ゲームはこの三つのシステムを同時に利用する。不確実性が較正され、フィードバックが即座に返り、技能の獲得が測定可能な速度で進む、構造化された環境を与えることによってである。次の部では、この構造が遊びの主観的経験、すなわちプレイヤーが実際に報告する現象学とどう対応するのかを検討する。