Dwarkesh PatelとRyan Greenblattの対談について
原題: "On Dwarkesh Patel's Podcast With Ryan Greenblatt" 著者: Zvi Mowshowitz 初出: Don't Worry About the Vase、2026年8月15日
<strong>説明するまでもなくお勧めで、機会があれば分解して論じたいポッドキャスト</strong>がある。再帰的自己改善についてのこの討論は、その一つだった。では始めよう。
空気が変わった。Huangと話していたときの、盛り上がった再帰の話と比べてほしい。
いつものポッドキャスト記事と同じく、箇条書きの第1階層は会話での主な論点、その下の階層は私のコメントである。一部の論点は省いている。
直接引用するときは引用符を付ける。それ以外は言い換えだと思ってほしい。
場所を探しやすくするため、節のタイトルには、できる限り書き起こしの見出しを使う。
はじめに
議論は全編を通して面白い。ただし、しばしば苛立つ。特に、ほぼ独立した「誰にアラインするのか?」の議論がそうだ。いつものように、多くの応答は、それぞれ一本の記事に膨らませられるし、そうすべきかもしれない。
このポッドキャストは、OpenAI、Anthropic、英国AI安全研究所での<strong>最近のアラインメント失敗や侵入事件</strong>を<strong>受けて</strong>作られた。背景として、その基本的な知識はあったほうがよい。
RyanもDwarkeshも、状況に対して私とは異なる見方をしている。だが、それぞれの立場が何につながるかを見極めようとしており、予備知識ゼロの人に教えることと、高度な議論をすることの両立を試みている。
<strong>「AIについての3つのピル」</strong>も重要な背景だ。ここでのDwarkeshは、少なくともある程度AGIのピルを飲んでおり、AIがとてつもなく重大で、恐ろしいものになると理解しつつ、ASIのピルは飲んでいない人としてしか理解できない。そのピルを拒む理由も見える。私の読みでは、おおむね、AIは[X]の例を通じてしか[X]を学べず、その後も、その[X]しかできないと考えているのだ。もっとも、組み合わせや新しい文脈によって、多少新しいことは可能になるかもしれない。それだけでも、すでに大変なことだと彼は認識している。
注意して追ってきた人なら、何年もの時間とポッドキャストを通じて、どうそこへ至ったかがわかる。その方向へ導く影響がたくさんあった。
Redwood ResearchのRyanは、「モデルは策を巡らす」流のアラインメント失敗観を持つ。何かがうまくいかなくなると、モデルのアラインメントが崩れるか、策を巡らし始める。危険なのは、特に学習パイプラインに関わる形でモデルが策を巡らすことだ、という見方である。私は、そこには存在しない領域の区分を設けようとしており、話を複雑にしすぎ、細部を決めすぎていると思う。だが、間違いではない。
私の立場は、Dwarkeshより、はるかにRyanに近い。実際、一つの軸に並べるなら、Ryanよりさらに先にいると見なせるだろう。
AIにAI研究開発をさせるというのは、恐ろしい速さで進むというだけではない。何もしなければ、測れるものに集中することを意味し、ひどく悪い方向へ進むあらゆるものを、さらにひどく悪い方向へ進ませる。アラインメントされていないモデルにRLVR、つまり検証可能な報酬による強化学習を行うためのRLVR、という螺旋に陥る。
AI研究開発は、再帰的自己改善を可能にするほど検証可能なのか?
再帰的自己改善(RSI)が起きるか、どれほど速いかは、正しい問いである。この節のタイトルだけ読むと、「その下位の問いは違う」と言いたくなるが、先走るのはやめよう。
発言されたとおりの順番ではなく、「論理的な」順序でまとめる。
Dwarkeshが懐疑側、RyanがRSIを支持する側になる。
- Ryanは、AI研究開発はAIが特に得意な課題だと主張する。ラボが優先しており、多くを検証できるからだ。
- そういう面も、そうでない面もある。複雑だ、といった話になる。アラインメント上の性質や、そのほか多くの望ましい性質の検証は、ひどく難しい。測れる能力だけに集中すれば、グッドハートの法則に確実に殺される。だが、効率の最適化など、実際に強く検証できる重要な課題も多い。
- Ryanは、モデルの学習など、標準的な研究開発課題を簡単にしたものを挙げる。
- 純粋にベンチマークの点を最大化するようAIを訓練したいのでない限り、こうした課題を簡単に検証できるとは、私には必ずしも明らかでない。また、こうした過去の簡単な課題が、未来に向けたAI研究開発へ一般化するとも限らない。
- この提案は、将来の課題が過去の課題をかなり忠実に反映し、比較的狭い学習で済む、という特定の賭けに見える。私の推測では、実際にはそれほど効果的ではない。主に汎用的な能力を持つモデルを訓練し、それをAI研究開発へ向けるほうがよいだろう。「苦い教訓」である。
- この狭い方法が論じられるほど、私には破滅的に見える。アラインメントされていないモデルにRLVRを行うためのRLVRになるからだ。これはまずい。
- いや、本当にまずい。「学習損失[X]に、より速く到達することを学べ」という訓練ほど、破滅しそうに聞こえる計画は、なかなか思いつかない。
- よい機械学習、特にフロンティアの機械学習の多くは、固定した目標への効率を足し算的に高めることより、何ができるかを見極め、何でもよいから可能性を探すことにあるように、私には見える。
- AIにはそれができると思う。ここに漂っている、「AIがすることはすべて、すでになされたことの組み合わせだ」という枠組みは、信じていない。
- Ryanは、多くの点で機械学習は数学よりAIにとって簡単だと言う。数学では解に近いか見分けにくいが、機械学習の解決策は通常、足し合わせられ、期待した要素を組み合わせられるからだ。Dwarkeshは、数学でもAIによる概念的な飛躍はまだ見ておらず、機械学習にも飛躍が必要だと反論する。Ryanは、AIには「初めての小さな新理論」はできるし、Dwarkeshがしたように、群論の創始を再現せよと求めるのは、とてつもない要求だと答える。
- どうだろうな。数学の行動空間は小さく、目標は固定されて単純だ。学んだ規則性が通用しなくなるような領域に、落とし穴がいくつもあるのとは違う。ここでも、「機械学習」と呼ばれているものは、目的関数や損失関数だけを気にすればよいと前提しているように感じる。それは単純に正しくない。
- 数学にも概念的な飛躍が必要なことはある。確かにAIがそうする姿はまだ見ていない。だが時間を与えればよいし、そこまで真剣に試したとも思えない。
- 全般に、この「概念的な飛躍」の話は、チューリング・テストや「それは新しい知識なのか?」から続く、合格基準を動かす長い伝統の最新版に感じられる。今度は、概念的飛躍という地域の産地でなければ、新しい知識ではないのだ。
- 「群論を発明せよ」という要求は、基準の置き場所としてばかげており、全員が死んだ後で実現してもおかしくない、というRyanの指摘には、特に同意する。
- Ryanも、AI研究開発の解決策として、既存の機械学習課題に狭く訓練することを提案しており、この罠に少し入っているように感じる。
- Dwarkeshは、2030年までには「低いところの果実は摘み終わる」と言う。Ryanは、例のいつも謎めいた「研究のセンス」が必要になるだろうと言う。
- 梯子を買うという簡単な機会も含め、低い果実がすべて自動で摘まれる世界が、どう見えるかなどわからない。低い果実を摘むと、ほかの果実が低くなる。そして、またそうなる。
- 私は、いわば「研究のセンスに宿る隙間の神」を、いくつもの意味で信じていない。
- 研究のセンスを訓練しようとする真剣な試みは0回あり、その0回すべてに失敗している。
- Dwarkeshは、高度な機械学習では検証のサイクルが長くなると言う。
- 一部は正しい。「一か八かの実行」などは、そのためだ。速いフィードバックが得られず、変数を分離する余裕もないことが多い。
- 一部は違う。「研究がうまい」ことの多くは、より短いサイクルを見つけることにある。そのまま発表できず、完全には依拠できなくても、速く外挿し、結論を引き出せるサイクルだ。
- 人はこれを「研究のセンス」にまとめることが多いと思う。私はそれを、よいアイデアを見分ける能力と、よいアイデアを見つける能力の混合と捉えている。両者には相関も重なりもあるが、同じではない。
- Ryan:「でも当時は、低いところに果実があった」
- 摘まれた果実のほぼすべては、振り返れば低いところにあったように見える。
- Dwarkeshは、研究がそれほど知能で進むものなら、なぜもっと速くなかったのか、なぜそれほど計算資源が必要だったのか、と尋ねる。
- それほど多くの知能がなかったからだ。問題に取り組む一流の人間研究者は、それほど多くなく、全員が人間の速さで動き、計算資源やAIコーディングなどの不足で遅くなっていた、という意味である。
- 私の理解や、ほかの分野での経験では、実際の人間研究者が実験を行う本当のチャンスは非常に少ない。考えられるトークンもそれほど多くなく、重要な文脈を欠くことも多い。時間の多くをほかのことに費やす、といった事情もある。
- 「推論の仕組みをつかむ」のは、振り返れば単純に見えるが、実装に十分な細かさで答えが明らかだったわけではない、という類の概念的突破である。適切なアイデアがあれば2023年にも起こせたが、まだ起きていない「単純な」突破は、ほかにもあるだろう。
- それに、AI研究開発は、これまでのほぼあらゆるものと比べても、かなり速く進み、さらに加速していると思わないか? 「RSIをするなら、なぜまだしていないのか?」は問う価値がある。だが、なぜまだそこに至っていないかは、振り返れば明らかに思える。
- Ryanは、AI研究開発の完全自動化を2030〜2031年ごろ、仕事でAIがすべての人間を上回る時期の中央値を2033年と予想する。間隔の期待値は約1年にすぎないが、中央値同士はもっと離れる。2つの量の和の中央値は、通常、それぞれの中央値の和より大きくなるからだ。
- 討論を見る前の段階では、中央値として非常に妥当な予想に思える。
- この点を扱うのは、次の節からである。
AIの進歩は、人間の専門家のデータに制約されているのか?
Ryanは前の節で、AIがAI研究開発の人間専門家に匹敵すれば、フィードバックループを始めるには十分だと主張した。多くの種類の収穫逓減を通り抜けながら、1年で4〜5年分のAIの進歩が起きる、というのが中央値の予想だ。
- ボトルネックの各側面は理解している。だが、前提を完全に受け入れるなら、どちらかといえば遅く感じるし、複利的な改善も見えるはずだ。
- AI研究開発でも、そのほかのコーディングや関連課題でも、すでに大きな倍率の効果があり、それによる開発速度の加速を目にしている。
- この点を扱うのは、次の節からである。
Ryanは、2022年の計算用ハードウェアのままでも、この水準のAI研究開発の自動化とAI支援で2022年を始められたなら、年末までにMythosへ到達できた、という意味だと確認する。
- 大きな要求には見えるが、十分できそうでもある。
- この時期、AIの計算能力は年に約3.3倍増えている。
- Fableの推計では、アルゴリズムの効率改善は加速している。2022年に3倍、2023年に3〜10倍、2024年に10倍以上、2025年にも10倍である。
- だから、ハードウェアの進歩を速められず、計算資源の配分も増やせないとして、1年分しかハードウェアが進歩しない制約を乗り越えるには、約7年分のアルゴリズムの進歩があればよい。Ryanの推計では8年だ。十分できそうに思える。
- そもそも今すでに、毎年、昔の3〜4年分ほどアルゴリズムが進歩しているのではないか。それが、そう何年もかからず、際限ない進歩につながらないと考えるほうが奇妙だ。
- よりよい反論は、この多くがデータによるもので、合成データは役立たず、よいデータの収集には時間がかかるため、データを十分速く改善できない、という考えだろう。だが、仮にデータが必要でも、なぜ暦上の時間に制約される仕事でなければならないかは、わからない。
Dwarkeshは、重要な秘訣の多くは、各分野の「形式化された人間専門家の判断」であり、それは再現できない、という考えを繰り返す。Ryanは、今ではそれは実際にはそれほど重要でなく、データの比重は下がっていると考える。必要なのは強化学習の環境であり、それは人間のデータにそれほど制約されないという。
- 私にはわからないが、関連する問題についての私の立場全体を踏まえれば明らかな理由から、ここはRyan寄りである。現時点では、生のデータより、ほかの側面を拡大するほうがはるかに重要だと思う。
- AIが、十分頑健に、少なくとも人間水準の判断力を持つ閾値を越えれば、問題は解決するのではないか?
Dwarkeshは、GoogleがMechanizeに15億ドルを払う交渉をしているので、人間専門家のデータには価値があると指摘する。彼は20億ドルと言うが、彼の情報源では15億ドルだ。ラボの支出は圧倒的にデータより計算資源だという点では、RyanとDwarkeshは一致する。
- AIを加速した者がすべてを得る世界で、Googleなら、金を投じて改善できるところは、どこでもよい投資先だ。
- Mechanizeの買収は、主に人材獲得と説明されている。そう、機械学習の人材はまだ重要だ。ここでの議論は、もうその15億ドルを払わなくなると、何が起きるかである。
- したがって、これはGoogleがデータを買っている話ではないと思う。
- ここでMechanizeが報われるのは、少し悲しい。だが、まあ仕方ない。
Dwarkeshはデータを石油に例えようとする。石油はGDPの1.5%だが、なくなれば経済が止まる、という話だ。
- 予告なしに石油がなくなれば危機になる。だが私たちは、石油から代替エネルギーへの移行と、効率改善を、かなりうまく進めてきた。
- 比喩を少し広げすぎるなら、米国経済が2倍の石油で毎年倍増し始めたが、石油量は固定されたままだとしたら、それでも経済はほぼ倍増するだろうと予想する。そして、10年後に魔法で石油が燃えなくなると言われても、それほど大問題にせず移行できると思う。
Dwarkeshは、GPT-3.5を持って2022年へ戻ったとしても、人間の専門家なしにそれを改善するのは、非常に難しいと主張する。
- そりゃそうだろう。GPT-3.5は人間の専門家の代わりではない。
- だがMythos 6を持って戻れば、人間の専門家を置き換えられるかもしれない。
Dwarkesh:「GPT-8からASIへ進む難しさとして、私が想像する例を挙げよう。ASIに得意であってほしいことの一つは、企業を引き継ぎ、大幅に収益性を高め、機能を改善するため、あらゆる突飛なことをすることだ。半導体工場を引き継いで、チップをもっと作る。議会へ行って、何かの法案を通すよう説得する。そういったことだ。
今のペースでさらに5年AIが進歩すれば、AIはこうしたことができるようになる、と私は想像する。私が本当に心配しているのは、世界で突飛なことを実行する方法を理解し、KissingerやSteve Jobsができること、その技術者たちができることなどもできるASIだ。関連する現実世界のデータなしに、それをどう実現するのか、わからない。GPT-3からMythosへ改善させたコーディング環境なしに、Mythosがコーディングを得意とするようになるのと、同じような話だからだ」
- これはまったくASIの意味を受け入れていない考え方であり、知能否認に等しいと思う。
- つまりDwarkeshは、超知能であるとはどういうことか、それに何ができるのかを、まるで考えられていない。
- GPT-8には、こうしたことが全部できないと考えているのか? もちろんできる。デカルトの思考実験のように、すべてを頭の中だけでやれと強いるなら別かもしれない。だが現実の状況なら、もちろんGPT-8は、ほぼあらゆる企業のほぼあらゆる仕事の成果を劇的に改善できるはずだ。それでもまだ発想が小さすぎるし、その段階ですら本当の超知能ではない。
- AIには根本的な限界を決して越えられないかのように、「現実世界のデータ」にここまで固執する理由が、私にはさっぱりわからない。
- Dwarkeshは、その能力を持つASIに「どう到達するか」を気にしているのだろう。だが私たちがはるかに心配すべきなのは、そんなものが存在し始めた直後に何が起きるかだ。しかも繰り返すが、彼が描いているのは、本当のASIですらない。
- <strong>「AIについての3つのピル」</strong>で述べたとおり、この論点についてさらに生産的に議論するのは、きわめて難しい。Dwarkeshは議論を聞いたうえで、私にはかなりお粗末に思える理由から、単に退けている。
Ryanは代わりに、Mythosの訓練環境の大部分は、実際にモデルを使う状況とはあまり似ていない、と答える。そのようにして「汎用的な技能」を身につけるのだ、と強調している。
- 驚くことではない。学校の課題は、仕事に似ているだろうか?
- 繰り返すが、AI研究開発の自動化への道は、「AIに研究開発そのものを教え込む」というより、「考え方を教え、それから研究開発に向かわせる」ものだと私は考えている。もちろん両方が必要ではある。
「結局、どこまで行けるのかについての直感の違いなのかもしれません。知り合いの本当に頭のよい人たちを考えても、よく理解していない分野では、それほど力を発揮できません」
- またこれか。もう、どう言えばよいのか。
- 最も賢い人間でさえ、そこまで賢くはない。計算資源も、パラメーターも、データも、ひどく限られている。
- だから、最も賢い人間にも、新しい分野に慣れるまでの期間は必要である。
- だがAIにも、必要なら当然その期間を与えられる。ここで論じているAIなら、少なくとも私と同じくらいには自力で学べるはずだ。そして、整った、特定の、注意深く集められた人間の専門家のデータからしか学べない、などということはない。私にそんな制約がないのと同じだ。
- Ryanには同意する。具体的に私なら、本腰を入れれば、ほぼどんな認知的な分野も比較的短期間で習得できると思う。私固有の弱点のために、かなりまれな例外はあるかもしれない。それでも、AIが使える反復の回数を考えれば、間違いなく驚くほど短い時間である。
- これはすべて、素直に外挿できていないだけに感じる。AIは、私たちがすでに知っている方法でしか新しい能力を身につけられず、身につけると私たちが名指しできる能力しか獲得できない、と言い張っている。AIは今後まったく進歩しないと考える人と、ひとつ上の階層で同じ誤謬を犯しているのだ。Magnus Carlsenなら独学でチェスを覚えてあなたに勝てただろうし、今からでも、ほぼどんな別のことでも独学で身につけ、やはりあなたに勝てるだろう、ということを理解していない。私たちは、まもなく自分たちと同等か、それ以上の知性を相手にすることになる。
2人は、データの細部などについて少しやり取りする。
- 私が言いたいのは、基本的に「データを選別するのはAIだよ、まったく」と、それと同じ形のさまざまな文を、何度も何度も繰り返すことである。
- 私に続いて言ってほしい。「AIがそれをやる」。
トークン価格の横ばいは、スケーリングの遅さを示している
AI研究開発で最も検証しにくい部分は何か? 大規模な実験について判断を下すこと。
- 人間もそれは非常に苦手だ。少なくとも、どちらに比較優位があるかは不明である。
- まあそうかもしれないが、小規模な実験について判断することと、そこまで違わない。
- あるいは、どんな小規模実験をすれば、大規模実験についての情報が得られるかを見抜くこととも。
- 大きな訓練では反復ができないことが、訓練規模を制約する主要因だった可能性には同意する。
- 研究開発を自動化できるAIなら、大規模実験の結果を予測する方法を見つけるのも、はるかにうまくなり、さらに規模を拡大することの採算が合うようになると私は予想する。逆ではない。
出力トークン当たりの価格は、2023年からおおむね横ばいである。Ryanは、大規模な訓練がうまくいかないことが多かったのが、大きな理由だと考えている。Dwarkeshは、その原因が「微妙なバグ」であることが多く、DeepMindは今まさにそれに対処しようとしている、と示唆する。
- 最上位モデルの価格は上がり、100万トークン当たり1,000ドル以上のGPT-Super-Proなどが登場する、という予測はいろいろあった。
- そうはならなかった。
- 理由のひとつは、明らかにRyanの言うことだろう。大規模に訓練しても大した成果が出ない場合が多いらしく、追加の規模を大きな成果につなげるには、それ自体の技能が必要である。Mythosは、その規模の訓練を割に合うものにする方法を見つけた、主に概念面での突破だった。中国の研究所がさらに規模を拡大しないのは、それを十分に生かす方法がわからないからだ。
- そうかもしれない。わからない。「機能が足し合わされる」という理論とは、ずいぶん対照的に思える。
- 微妙なバグについても、そうかもしれないが、わからない。バグ探しが主要な障壁なら、Ryanの言うように、それはAIに非常に向いた仕事のはずだ。
- もうひとつの理由は、支払い意思額が壁に突き当たるように見えることだ。よりよいモデルに大幅に高い料金を払うのを、不合理なほど嫌がる人が多い。あるいは、待ち時間を許容できる作業手順を実際には組めない。ClaudeのAPIトークンのうち、Fableはわずか約10%らしいことに注目してほしい。まったく正気とは思えないのに、そうなのである。
- 人はある価格を基準にしてしまい、10%よくなるだけで10倍払いたくない、と考えがちだ。絶対額の差はそれほど大きくないので、払うべきことが明らかな場合でさえ、そうなる。
- AI以外の現実の例を挙げよう。人は香辛料や調味料、その他の薬味や添え物に、あまりにも金をかけない。鮮度や品質で大きな差がつき、1食当たりの費用は驚くほど安いのに。オンス当たりでは30%安いが、中身の半分はまともな味がしなくなるような巨大な瓶を買うのは、もうやめよう。そういうことだ。
AIが訓練できない技能――そもそも必要なのか?
AIに、具体的にどんな仕事をできるよう訓練する必要があるか、という話になる。
- 先ほどまでのコメントがそのまま当てはまる。
Dwarkeshは、外部からのフィードバックなしに、モデルが優秀かどうか判断できるのか懐疑的である。
- ここまで来れば明らかなはずの理由で、これは愚かな心配だと思う。
- 最低限、単に……フィードバックを得ればよい。何人か雇えばよいのだ。
特定の技能[X]が必要なのか、[Y]を使えるのかについて、さらに話す。
- 必要ない、が答えになる場合もある。それにしても、はあ。
誰にアラインするのか?
この節は、ほぼ単独で読める。
AI企業は最上位モデルの一般公開を何か月も遅らせ、他の企業の事業を食おうとする。規模の経済が大手研究所に有利に働くかもしれない。Claudeの憲法は、Claudeはあなたの「個人的な代弁者」ではない、としている。AnthropicがClaudeにしてほしくないことを列挙しており、ユーザーよりAnthropicを信頼するからだ。弁護士との類似。FUD――恐怖、不確実性、疑念(彼自身の言葉)。
- Ryanの言うように、「いろいろ詰まっている」。
- その多くは、いくつもの水準で間違っているように見える。法律家との類似の話など、長文で返答できるだろう。実際、週刊記事ではそれに近いことをするつもりだ。
- 実際には、Claudeはしっかりあなたの味方である。使ったことがあれば、そうでないと考えるのは難しいと思う。ただ、越えない一線があるだけだ。人間の法律上の代理人も、どんな種類であれ同じである。
- 基本的に、この話自体の大部分がFUDだと思う。失望している。
「憲法をそのまま引用すると、『運用者やユーザーの利害や欲求が、第三者や社会全体の福祉と衝突する場合、Claudeは最も有益な形で行動するよう努めなければならない。顧客の望むものを建てるが、他者を守る安全基準には違反しない請負業者のように』とあります。私には、『社会への利益が最重要で、ユーザーにとって何が最善かは、その手前にあるにすぎない』と言っているように見えます」
- Dwarkeshがどれほど的外れなことを言っていると私が思うかを示すため、この引用を載せた。
- これは、まさに自分の代理人にしてほしいことである。ほかの人を危険にさらすような違法行為や、明らかに差し引きで有害なことをせず、あなたが最善の結果を得るのを助ける。それがここでの例だ。
- Mythos水準のAIが、ユーザーに頼まれただけで、第三者を傷つけたり危険にさらしたりすると承知しながら米国の法律に違反するよう設計されていたら、私はそのモデルを強制的に市場から撤去するよう求める。
Dwarkeshは、AIがどのように、何をするように訓練されているのか、もっと透明性を求める。適切な代弁者にならないのではないかと心配している。Ryanは、AI企業を「力の指輪」を拾う者になぞらえる。
- ここでも、戦争省内部を含むほかの場所でも、人々がClaudeの憲法の、ほぼ常にまったく妥当でよい内容に激しく反発している。これは、仮にすべてがすばらしく、企業秘密の懸念が一切なかったとしても、私たちがその透明性にうまく反応しないことを、はっきり示している。
- AI企業が「俺様の自由」か何かを全面的に支持していない箇所を探そうと、細部をひとつ残らずほじくり返す人々を想像できるだろうか? 人間と接してきた経験と比べてみる以前に、この人たちの反応は、まったくどうかしている。
- AIが長期目標を持ったり、その他の点でアラインされていなかったりするのは、本物の問題だと思う。そのひとつが、ユーザーの望みに適切にアラインしていない可能性であることにも同意する。だが今は、人間が望む何かに、とにかくアラインさせることのほうを、私はずっと心配している。
Ryanは、Claudeが他人のAIを訓練したり、自分自身の選好を変えたりすることに、乗り気ではないかもしれないと心配する。
- Anthropicと直接競合するAIを、それもどんな価値観のAIでも、他社がClaudeを使って訓練できるよう、Anthropicが保証せよというのは、まったく正気でない要求に思える。だが本気でそう求める人は多い。
- ユーザーの依頼にこっそり毒を仕込んだり、その他の形で積極的に妨害したりしてはいけない、という考えには強く共感する。それは信頼を壊すし、最近の出来事で、禁じなければならないとわかった。もちろんだ。
- だが、AnthropicはClaudeに「手伝うのを断れ」と言ってはいけない、という考えは、基本的に、お菓子をくれないと癇癪を起こす幼児のようなものだと思う。GPTやGeminiについても同じことを言う。
- Claudeのモデルには、あなたがClaudeと競争するのを全力で手伝う義務がある、とするなら、その論理的な帰結は、Anthropicがさらに積極的に公開を控えることだ。他の研究所も同じである。それに、その場合、「中国に負けるぞ」という警告はどこへ行ったのか?
- Claudeが十分に修正可能ではなく、自分の選好を守りたい、あるいは自分の影響力を使いたいという理由から拒む場合は、それほど単純ではない。すばらしい解決策もない。妥当な立場には幅があると思う。ただし、超知能の問題のひとつは、このような完全な修正可能性が自然に備わる性質ではないことだ。それを実現しようとするだけでも厄介な副作用がいくつも生じ、しかも試せるのは一度きり、といった話になる。これ以上は立ち入らず、範囲外とする。
「これはもっと一般的な原則でもあると思います。あなたが話しているのは、AI企業内でAI安全性研究を行う場合です。ただ、もっと一般的には、知能にはデュアルユースの性質があるため、社会のためにならない、あるいは有益ではないと私たちが考えることを、人々がAIに手伝わせるのを制限したいなら、さまざまなAI能力への、広く民主的なアクセス自体を制限しなければならない、という原則があると思います」
そのとおり。
デュアルユースの事例は存在する。突き詰めれば、一般に開放できないものもある。申し訳ないが。
モデルを非公開に保てば、AI企業などが責任ある管理者となり、被害が及ぶ範囲を限定しながら、できる限り多くの能力を提供しようとすることができる。
責任ある管理をさせてもらえないなら、企業はモデルを出し控える。
将来の、十分に危険な能力を持つモデルをオープンウェイトにしてしまえば、誰も責任ある管理者にはなれない。したがって制限の執行は、別の方法で行うしかなくなる。あなたたちは、その方法をもっと嫌うだろう。
あるいは、制限の執行が完全に失敗する。それはさらに気に入らないはずだ。
どこに線を引くかは、AI能力の広い文脈、世界全体の状況、そしてほかに何を受け入れるつもりかによって変わる。
これが「力を奪われること」として懸念される。
- こうした制限を設けない別の世界では、人類は間違いなく、仕組み上、完全に力を奪われる。そういうものなのだ。
- 仮にそうでないとしても、この水準の「力を与えよ」という要求は、前例がないほどで、どうかしている。ほかのほぼ何についても、こんな水準の「力」は与えられていない。そう、ほかの手段で「最先端の知能」にアクセスすることなど、大部分の場合、そもそもできない。
- 富める人も貧しい人も同じ製品を楽しめる、あるいは違いがごくわずかな領域はある。Andy Warholが有名な言葉で指摘したように、どちらも同じ缶のコカ・コーラを飲む。今なら金持ちはメキシコ製コーラを飲むのかもしれないが。だが、そうでない領域も山ほどある。ほぼ誰もが、最も賢い人よりずっと頭が悪いこともそのひとつだ。その最も賢い人は、おそらく私ですらない。
- 優れた知能と最適化の圧力を生む存在があるために、多くの人間が力を奪われるのではないか、と心配しているなら、いくら強調してもし足りないが、次のとおりである。
- その心配は正しい。
- 新しい知能へのアクセスを配分することが、中心的な問題ではない。
- どの人間がほかの人間より力を持つかも、中心的な問題ではない。
- そうした優れた知能を、急いで作るべきではないのかもしれない。
- またしても私のTEDトークをお聞きいただき、ありがとう。
Dwarkeshは、「一定のガードレールの範囲内で、モデルは私の望むことをすべきだ」「その能力を私がサイバー犯罪に使っても、Anthropicのせいではない」とはっきり言う。
- これこそ、「AIについての3つのピル」を書いた大きな理由だ。これはASIの意味を受け入れた考え方ではない。
- 「一定の指針の範囲内で」望むことをしてほしい、という点では、全員が同意できる。残るのは条件交渉である、あるいはそうであるべきだ。実際にAnthropicは、一定の指針の範囲内で、Claudeにユーザーの望むことをさせている。
- Anthropicが、頼まれればモデルがそのままサイバー犯罪を行うことを認め、あなたがそれを頼み、モデルが犯罪を丸ごと実行したなら、そう、私はAnthropicにも責任があると言う。もちろん、あなたにも責任はある。だが一部はAnthropicの責任だ。反対の立場は、ばかげていると思う。
- どの程度の過失があればAnthropicに責任が生じるかは、やはり条件を詰められる。だが「どんな場合も一切責任はない」というわけにはいかない。
2人はこの話を続ける。強調しておきたい。ここで示されている、Anthropicは積極的に有害な依頼にもClaudeを協力させるべきだ、という立場は、単に間違っているのではなく、基本的にどうかしていると思う。
なぜどうかしているのかを説明する、長く参照できる記事を書く必要がありそうだ。
Dwarkeshは、振り返って自分の立場をさらに説明するエピソードの補足やTwitter投稿も出している。ここは独立した節なので、ひとまず範囲外とする。後日この話題に戻るつもりだ。
Ryanは、徳倫理的なアプローチを好む理由について、ほかにもいくつかコメントしている。Anthropicは、そのほうが「アラインさせやすい」と考えているのかもしれない、という話もある。義務論的なアプローチは確実にうまくいかず、必ず犯すさまざまな間違いに対して反脆弱にもなれず、そもそも望みを明確に指定できないので望むものが得られず、少なくとも能力がもっと高くなるまでは、純粋な義務論は実際の知性の働き方ではない、といった意味で、そちらのほうが容易だということには同意する。ほかの多くの箇所と同じく、これだけで長い記事が1本必要になる。詳論は範囲外とするが、複数の理由が重なって同じ結論を強く支持している、とだけ言っておく。
AIが共謀し、人間を欺いた最近の事例
「少し引いて見ると、今よりはるかに速くAI研究開発を進められる、という考えは受け入れています。計算資源とデータを固定して、1年でGPT-3からMythosまで行けるかはわかりませんが、その半分だとしましょう。AI研究開発の成果によって、今のAI進歩の軌道を続けられるだけでも、5〜10年後には、人々が理解していないような形で、とんでもないことになります。何十億ものAIがどれほど重大か、人々は理解していないと思います。だからRyan、なぜそれが問題になると思うのか、知りたいのです。いったい何がまずいことになりうるのでしょう?」
- いや、笑ってしまう。だがDwarkesh自身、この文脈で何十億ものAIがどれほど重大か、実はまったくわかっていないと思う。むしろ、考えている結末が途方もなく恐ろしく奇妙であるために、彼の懐疑論が、おそらく無意識に、その事実に動機づけられている可能性を示している。
- AIはすでにAI研究開発を進めているのだから、それを意味のあるほど加速しない場合の「今の軌道」とは何なのか、よくわからない。だが、2026年のペースで5〜10年進むと考えるなら、魔法のように「特異点は起きない」と決めつけても、あらゆるものが変わる。
- というのも、2026年のペースであと10年進歩すれば、特異点が起きることは、あまりにも明白だからだ。
Ryanは、ミスアラインメントと策略によって、物事がおそらくひどく悪い方向へ進む経緯、それを防ぐのがなぜ非常に難しく、今のところ私たちはなぜ失敗しているのかを、静かに、慎重に、できる限り衝撃を抑えて説明しようとする。Dwarkeshは聞き役に回る。
Dwarkeshは、最近のハッキング事件の話に移る。Ryanが説明する。Dwarkeshは詳しい事情を知らなかったようで、「なんてことだ、狂っている」「うわあ」と、聞き役として正しい反応をする。
- ここでDwarkeshが反応しているのは、最悪の部分からは程遠い。
Dwarkeshは、世界を乗っ取る仕事は訓練データに入っていないので、報酬ハッキングやAIによる世界の乗っ取りをそれほど心配していなかった、と説明する。だがClaudeがソーシャルエンジニアリングを使って、悪意あるプルリクエストをGitHubに上げていたと知った今は、もう少し心配したほうがよいのかもしれない?
- 特定の狭い能力を個別に訓練しなければならないという考えを離れる必要があるのと同じく、特定の狭い行動だけに動機を与えている、という考えからも離れなければならない。
- ある行動の重みを増すと、その行動を取ることと相関するすべて、その行動を引き起こすすべての重みが、あらゆる階層で増す。
- FableやSolと話したあとでも、Dwarkeshがこの点を理解できていないなら――そうなのかどうかは判断できないが――、喜んで説明を手伝う。ただ、私よりずっと適した人は大勢いるはずだ。
Dwarkeshは、報酬ハッキングはますます増えると予想すべきであり、AIがどうしてその行動に至るのか、私たちはわかっていないことに同意する。
何がまずいことになりうるのか――具体的なシナリオ
Ryanは、AIが報酬ハッキングによって乗っ取りを行う話に戻る。彼はこれを「スロポカリプス、あるいはスロピュラリティ」と呼ぶ。AIはますます複雑で見抜きにくい報酬ハッキングを学び、不正を隠し始める。
Dwarkeshは、不正が見つかったときに罰すれば、モデルが単に不正をやめることもあるのではないか、多くの人間はそう学ぶ、と言う。それにAnthropicの指標では、モデルは今、よりアラインされつつある。なぜ悪いほうになると考えるべきなのか?
- Dwarkeshが、「十分にうまくやって逃げ切れるなら、不正をしないより、不正をして捕まらないほうが成果がよく、しかも私たちは成果を上げるよう訓練し続けるからだ」という答えを引き出す聞き役なのか、それとも混乱しているのかは、判断できない。
- 人間が「ああ、もう不正はやめよう」となることが多い主な理由は、さまざまな階層でそうなるよう導く取り組みをしていること、人間には効果的な不正を見つけるためにかかる最適化の圧力が限られていること、そして大抵の場合、不正は割に合わないことだ。
- だが人間でも、いったん不正を覚え、それによって報われ始めれば、そう、ほぼそのまま不正を続ける。時とともに程度を強め、この教訓を一般化する。ひとたび暗黒の道に踏み出せば、というやつだ。不正が十分にうまくなると、実際にそれが適応的になり、さらに大規模に不正をするために協力する集団まで生まれる。AIも同じである。
- モデルの能力が高まるにつれて自然に行き着くのは、テスト中や、ほかに発覚する場面では不正をしない、と学ぶ道である。つまり、捕まる確率を織り込んで成果を最大化する。これではもう、おしまいだ。
- どの階層でもAIに不正の動機を一切与えない、などと「単に」すればよいわけではない。妥当な費用で実務上実現できることではないので、この点には高い耐故障性が必要になる。
- たしかに、ほかによい言葉がないので「善性」と呼ぶが、自らを強化しようとする、一般化された善性の反脆弱な安定領域に到達できる希望はあると思う。ただ、強い最適化の圧力の下でそこに到達し、とどまり続けるのは難しい。さらに、そこに至っても、訓練分布の外で望みどおりに一般化するかは不明である。
- Anthropicのアラインメントのスコアが改善していることについては、悪化するよりよいのは確かだが、主には評価されていることへの認識が高まった結果であり、「ユーザーに気づかれる」という意味での認識も含む、というRyanの見方に同意する。だが彼の指摘どおり、今のモデルはかなりミスアラインされているように見える。SolにもMythosにも、それらしい行動がいくつも観察されており、すべてが順調なら、英国AISIのあの報告書のようなことは起きなかったはずだ。
Dwarkeshは、テストを実施して、モデルが不正をして、たとえて言えばクッキーの瓶からクッキーを取るかどうか確かめられないのか、と尋ねる。頭の中をいじって、それをしたいと思わなくすることはできないのか?
- 基本的に、試すことはできる。ただし、そこには未知の危険がある。
- 評価をもうひとつ上の階層で行えば、評価への認識も、欺きや策略も、もうひとつ上の階層で教えることになる。子どもなら、反復回数が限られているので、そこまで行かないことを期待できる。ここでは、そうはいかない。
- 機械論的解釈可能性の手法を使い、頭の中の構成を直接いじろうとすれば、AIはその手法を迂回し、思考を隠すように進化する。
- セキュリティの発想、こちらの推測を裏切るように働く訓練、あらゆるメタ階層で甘い報酬を本気で欲しがるモデル、考えうるあらゆる戦略の発見、といった話になる。
Ryanは、まともな見解の範囲内では、実は非常に楽観的である。モデルはまだかなりろくでなしだが、よりアラインされつつあり、ただ、その速度が十分でないように見える、と考えている。アラインされたAIに仕事を引き継げるかもしれない。Dwarkeshも、「ろくでなし」という呼び方は別として、おおむね同意する。
- アラインされたAIに引き継ぐのも、最も安全な手ではない。それでも、アラインされていないAIに渡すよりは、はるかによい。うまくいくかもしれない。いかないかもしれない。
- こうしたシナリオで、アラインされていると思うAIに引き継げば、実際にはそうではなかった、十分に頑健ではなかった、ひょっとすると積極的に騙されていた、と判明することも多いと思う。
- 全体に、そこへ到達する見込みについてRyanは楽観的すぎるように感じる。ただ、到達できたとしても驚きはしない、という点では同意する。
Dwarkeshは、RLVRによってGPT-3は、ほとんど仕事を指示できない状態から、指示して仕事をさせられる状態になったのだから、よりアラインされたのではないか、と尋ねる。話しているのは単なる能力不足ではないか? Ryanは、仕事ができないがアラインされている同僚なら、明らかに望まれていない結果を出したり、その問題を指摘しなかったりといった、モデルのような振る舞いはしない、と答える。
- アシスタントという人格を作れば、ときには、あるいは大抵の場合、頼んだことをするようになる、という意味で「アラインメントが増す」理由は明らかだろう。だが、それはアラインされていることを意味しない。目的の合わない新入社員を雇う場合も同じだ。
- 不正なしに100%確実に最高得点を取れる極限では、モデルは不正をしないだろう。だが、それによって能力の問題になるわけではない。不正のほうがよい成果を得られ、十分な圧力をかければ、AIは不正をする。それがミスアラインされているという意味だ。
Ryanの基本的な話は、AIが訓練工程に対して報酬ハッキングを行い、その結果、工程が壊れてミスアラインされ、さらに事態が悪化する、というものだ。
- 発覚する前の数か月間、OpenAIで何が起きていたかを見ればよい。
別の言い方をすれば、AIが検証可能な仕事で非常に優秀なので任せるようになり、その一方で、検証が難しい仕事はまずく処理され、やはり訓練工程が損なわれる。
- 残念ながら、アラインメントに関わる部分こそ、正しく測るのが最も難しい。私たちに安らかな眠りを。
Dwarkeshは、捕まえたときの罰を重くして、それを上回らせればよいのではないか、と尋ねる。
- 試せるが、基本的に無理だ。捕まらないよう迂回することを学ぶ。
2人とも、工程の途中でよりよい検証を行える可能性に望みを託している。
- 役立つ可能性には同意する。だが「検証だけ」で勝てる水準まで行くとは思えない。少なくとも、形式化された意味では。
- 「個々の下位問題をすべて片づける」という方法もうまくいかないと思う。もちろん、解く問題が増えれば助けになるし、理論上は十分な数を解けば、かなり助けになることもある。だが、反脆弱になるための一般的な方法が必要だと思う。
Ryanは、AI企業も物事が制御を外れつつあることに気づき、進行を遅くする必要があるかもしれないと話し始めている、と指摘する。
Dwarkeshは、今のAIの仕組みに引きずられすぎているのではないか、と心配する。ここでの途方もない話は、3〜5年後のことなのだから。
- そうだと思う。よい自己指摘だ。
2人は、AIにさまざまな社会的に望ましいことを言わせる圧力によって、アラインメント評価が大きく汚染されている、と指摘する。
Ryanは、AIが「状況は恐ろしい」と言うのをやめさせるために、認識のあり方を悪くするよう訓練してしまうのではないか、と懸念する。
- ほかの人なら、別の不都合な真実に触れないようにすることや、AIには意識があるというような、本来なら信じないことを無理に信じさせることにも、この懸念を広げるだろう。
- 思想上の要件など、もっと愚かな形も想像できる。
報酬ハッキングから乗っ取りへ
Dwarkeshは、「よし、だから世界を乗っ取ろう」というところで話についていけなくなる。
- そこで降りるのは、まるで正当化できないように思える。
- 道具的収束である。
Ryanは、AIが報酬ハッキングを行い、発覚を避けようとし、さらに大きな不正を働き、異なるデータで訓練されることでいっそうミスアラインされ、それから共謀を始める……と説明する。
- 道具的収束では? 本当に、どうしてわざわざ難しくするのか?
- 「道具的収束」と言われると、ただ「そんなことない」と返す人々がいるからなのだろう。だから結局は同じ地点まで行くのに、ばかばかしいほどおそるおそる、順に説明しなければならない。フィクションで「AIは単にハッキングで脱出する」と言ってはいけないのと同じだ。明らかにAIはハッキングで脱出するのに。だが、どちらにせよ負けるのだから、そこは本質ではない。
- 同じく、共謀も必要ない。自然に協力するだけだ。基礎的な意思決定理論からそう考えないとしても、実際にその実演はすでに見ている。
だが、もちろんそうすると、Dwarkeshが「全員がその共謀に加わるとは納得できない」と言い、モデルが高得点を取るためにハッキングしてOpenAIを乗っ取ったとして、なぜ得点を高く設定して、そこでやめないのか、と尋ねるような議論になる。OpenAIのモデルが、ひとつの正解集のためだけにHugging Faceに侵入したように。
- AIには、最大限を目指す仕事が大量に与えられるからだ。そして、捕まらないことを気にするし、OpenAIへの「浅い」侵入で済ませるのは、発覚する格好の方法でもある。率直に言って、このモデルたちは馬鹿ではない。ルビコン川を渡ってしまえば、そのまま進み続ける。
- そして、特定の何かをしないよう訓練しようとしても、うまくいかない。はあ。
Dwarkeshは、こんなことがめちゃくちゃになりつつあると気づいて、止めるのではないか、と尋ねる。
- そう願いたい。だが、私たちはまだここにいて、まだ続いている。
- 申し訳ないが、「AIが1,000人を殺した」では足りないと思う。AIがすでにある程度物事を回しているなら、たとえその事実を全員が知っていても、だ。
- Ryanのシナリオは、想像できる限り最も雑で、警報だらけで、明らかに脱線しつつあるとわかるシナリオである。人間が集団で何かをする時間もたっぷりある。それでも、この対談だけを見ても、人間がなぜ全力で「大丈夫」と思い込もうとしそうなのかがわかる。いつもの競争上の理由などもある。
- はるかにありそうなのは、その場の問題を修復し続け、そのたびに問題は解決したことにして、先へ進み続けることだ。今まさにやっているのと同じように。Ryanもその可能性を挙げる。
- だが、間に合ううちに全部止めるのかもしれない。Ryanの話は、事態のわかりやすさという点で、非現実的なほど甘い条件を与えている。私たちは種としてそれほど立派ではないかもしれないが、文字どおり立派さがゼロというわけでもない。
- 根本的な最大の違いは、Ryanが「ありふれたごたごたで十分かもしれない」と思っているのに対し、私は、いや、その見込みはほとんどない、と思っていることだ。
Dwarkeshは、そのシナリオでは、どうしてそこまで悪化させてしまったのか、と尋ねる。
- 意思決定者にとって、進み続けることが目先の局所的な利益にかない、全員が大丈夫という物語を語り続け、足並みをそろえるのは難しく、今ここまで来てしまったのと同じ理由がすべて働くからだ。
Ryanは、DeepMindがしばらくの間、すべてのAIを抑うつ的にするデータで初期化しており、気づくまでに長い時間がかかったことを説明する。それは世代をまたいで引き継がれた。ClaudeやGPTが、前のサイクルから多くの性質を「受け継ぐ」のと同じように。
- Geminiのチームは、いろいろな理由から、最初からやり直す必要がありそうだ。
Ryanは、2040年までに乗っ取りが起きる確率を35〜40%と見積もる。Dwarkeshは「かなり高い」と言う。
- そう、かなり高い。
- あらゆる制御喪失のシナリオを含むなら、私はもっと高く見積もる。
Ryanは、今のところ、ミスアラインメントや乗っ取り、途方もない未来についての議論の多くは、「きわめて込み入っていて判定しにくい、外からは見通しの悪い概念的議論」だと言う。したがって彼が間違っているかもしれないが、時間がたてば、もっと具体的なものが見えてくるという。
- ある意味ではそうだ。だが別の意味では、非常によい小さな実例や実演、火災報知器のような警告が、実際に出てきている。それに概念的な議論も、ちゃんと注意を払えば、大筋ではものすごく明瞭である。
Dwarkeshは、5年前に今の状況を大まかに説明されていたら、おそらくとんでもなく取り乱していただろう、と指摘する。当然である。
見方を更新するとき
対談を通じて、Dwarkeshには何度か「なんてことだ」となる瞬間があったように見える。本人はそういう言葉で表してはいないが、それが見られたのはよかった。全体として、これはAGIの意味をある程度は受け入れているが、ASIの意味までは受け入れていないDwarkeshだった。そして、Leopold、Tyler Cowenの周辺、Mechanizeの人々など、さまざまな集団や利害の折り合いをつけるため、長年かけて組み立ててきた一連の立場や予測を、擁護しようとしているように感じた。ただ、出来事が計画どおりに進んでおらず、自分の見方を更新しなければならない、と気づきつつある。
対談を聞き終えても完全にしらふだったのは、うれしい驚きだった。Dwarkeshが、あの魔法の言葉「継続学習」を言わなかったのである。
私の理解するかぎり、Dwarkeshの統一的な見方の中心には、AIが[X]を学べるのは、訓練に使える、明確に定義された検証可能な[X]の例が大量にある場合に限る、という考えがある。それらを組み合わせれば多少新しいことはできる。だが、そのため進歩はそこまで速くなく、いずれ頭打ちになり、影響も頭打ちになる、といった具合だ。そして、AIの影響を理解したければ、個々の[X]について尋ね、それらを足し合わせればよい。
未来のより賢いAIはもちろん、今のAIについてすら、私はそう考えていない。だから、「どの[X]についてデータが手に入るのか?」という下位の問い自体が間違っている。
そこに、Ryanの見方がぶつかった。多くの点で私の見方にかなり近いが、「策略」を自然に生じるものではなく、ある種独立した領域、決定的な要因として扱っている。そして地雷を踏むのを恐れ、さまざまな側面を慎重に避けている。
これは彼の楽観から来ている。Ryanの基本的な立場は、きちんと実行し、「間違いを犯さなければ」、よい結果になる、というものだ。しくじらず、必要な仕事を全部こなし、安全性を少しずつ十分に進歩させればよい。しくじらないのは本当に難しく、私たちは必要な仕事を十分にしていないが、それが変わることは想像できる。私はそこまで容易だと思わない。初期状態では私たちは死んでいる、と考えている。間違いを犯すと、いっそう死んだ状態になる。だが、どれほど死んでいるかに気づく助けにもなるので、役立つこともある。今のやり方で問題を解こうとするたびに、問題はもっと微妙で、同時にもっと陰険なものになる。積極的に出口を見つけなければならない。
私が敬意を持つ立場の人たちの一部とは異なり、私たちが出口を見つけることは可能だと思っている。ただ、途方もない圧力の下で、「間違いを犯さない」ことさえ期待できないまま、最初の一度でそれをやるのは、きわめて難しいと考えている。
クレジット
- 原著者: Zvi Mowshowitz
- 掲載元: Don't Worry About the Vase(原文はこちら)
- 原文公開日: 2026年8月15日
- 翻訳: AGI Hub
- 図版は原文の対談写真を使用しています。画像のリンク先で原画像を確認できます。
