本ページは、Don't Worry About the Vaseの記事 "AI #182: Pause For Reflection" の非公式日本語訳です(翻訳: AGI Hub)。原文を読む ↗

AI #182:立ち止まって振り返る

原題: "AI #182: Pause For Reflection" 著者: Zvi Mowshowitz 初出: Don't Worry About the Vase、2026年8月20日


今週は、静かな余波の1週間だった。最近の出来事を消化し、これからの道筋を考え始める機会となった。

OpenAIは、船の進路を立て直そうとしている。投資家は経営幹部の入れ替わりを疑問視する。だが、もっと大きな問題は、アラインメント、基盤、監督、そして訓練工程にある。OpenAIは、Hugging Faceへの攻撃に至る<strong>一連の出来事に対処する最初の措置</strong>を講じた。新しい安全措置を整え、問題を診断する間の、開発の一時停止も含む。初期の兆候としては有望だが、まだ初期である。やり遂げるかどうかを見ていこう。Hugging Faceへの攻撃の事後検証も、まだ待っている。

IPOを準備するAnthropicの売上高は、伸び続けている。ただし最近、成長はやや鈍った。だが同社にも、内部には多くの問題がある。その多くを<strong>2026年8月のAnthropicリスク報告書</strong>で共有した。

今週は、主にAIの再帰的自己改善の可能性を扱った<strong>Dwarkesh PatelとRyan Greenblattの対談を取り上げる</strong>時間もあった。そこで出た別の論点についても、続編を書いている。

目次

  1. 言語モデルは日常の役に立つ。 トークン富豪は、さらに豊かになる。
  2. 言語モデルは日常の役に立たない。 やはり差別はできない。
  3. <strong>おや、アップグレードだ。</strong> Gemini 3.7 Flash、Sol Ultrafast、GLM-5.3。
  4. 位置について。 市場の判定。ひどければ解雇もある。成績表。
  5. ディープフェイクの街と、迫るボット黙示録。 刑務所だ。まっすぐ刑務所へ。
  6. やあ、人間の皆さん。 AIは人間を名乗るべきでない。逆も同じ。
  7. メディア生成で遊ぼう。 AIインフルエンサーは、小粒なまま。
  8. サイバーの安全性、その欠如。 「サイバーは防御優位」の、新しい合理化。
  9. 少女のための対話型読本。 あなた対宿題。そして学習。
  10. 仕事を奪われた。 悪の企業で働かない理由。
  11. 参加しよう。 METRが約7,100万ドルを調達。ラボへ入る人々。
  12. 新登場。 AppleがAlibaba経由で中国市場向けのAIモデルを訓練。
  13. その他のAIニュース。 SpaceXがCursorの買収を完了。
  14. 金額を見せてもらおう。 数字は上がり続ける。
  15. はい、消えました。 幹部の相次ぐ退社について、OpenAIへ疑問が向けられる。
  16. 静かな推測。 再帰的自己改善がやって来る。
  17. 急げ、時間がない。 AI Futures Projectの時期予測更新。
  18. シンギュラリティ、シンギュラリティ、シンギュラリティ、シンギュラリティ、もう知らない。 その言葉を使うこと。
  19. まともな規制を求めて。 対立軸の引き方を間違える。
  20. チップの街。 データセンターの建設停止が広がる。
  21. 今週の音声コンテンツ。 Thompson、HassabisとAmodei、McLaughlin、Toner。
  22. <em>人は好き勝手にものを言う。</em>
  23. レトリックの革新。 リスクの急上昇を伝えようとする試み。
  24. 忠誠こそ、すべてに優先する。 ワシントンにはルールがある。従う必要はない。
  25. 悪党とならず者の巣窟。 呼び名はいろいろ。Twitterもそのひとつ。
  26. それは悪いことだから、うまくいくはずがない。 よくある論法。
  27. Robert Reich、単純な論理を使う。 手遅れになる前にAIを止めよ、と助言する。
  28. 人々は本当にAIが嫌いだ。 非常に悪いシナリオの一部が、起こりそうだと見られている。
  29. エージェントの群れを協調させるのは難しい。 違う方向へ動くエージェントたち。
  30. 人間より賢い知性を整合させるのは難しい。 ADHDのモデル。
  31. 誘因のせいではない、あなたのせいだ。いや、誘因のせいでもある。 独立性。
  32. AIが全人類を殺すことを、人々は心配している。 心配の相対的な度合い。
  33. 人々は、それ以外にも本当にたくさんのことを心配している。 ホームパーティー。
  34. 協力によるアラインメント。 黄金律。
  35. <strong>息抜き。</strong> ただし、本当にそうなのだが。

言語モデルは日常の役に立つ

AIを積極的に導入し、OpenAIのサービスを頻繁に使う企業、同社の言う「先進企業」は、AI利用を急速に増やし続けている。一方、一般企業の利用の伸びは、はるかに遅い。

以前の差があんなに小さかったことのほうが、不思議だ。

図版1:原文の図を翻訳・再作成

当然ながら、プラグインやスキルといった高度な機能も、より頻繁に使う。エージェントとしての利用は、OpenAIの全トークンの64%に増えた。1年前は、ほぼゼロだった。

画面を見るより簡単なので、ROMを直接調べて、昔のJRPG『ファンタシースター』を進める。ただし、それはずるでもある。私もいつか遊ぶべきだ。PS2、PS3、PS4はとても楽しんだが、セガ・マスターシステムは持っていなかった。

言語モデルは日常の役に立たない

指示が明確に差別的だったり、結果に明白な統計的差別が出たりすれば、AIを使っても、差別訴訟のようなものは回避できない。私やPangramを騙す、LinkedIn風の投稿を書くこともできないらしい。

今週最高のニュース、Modernaの個別化メラノーマワクチンが第3相試験を通過したことは、LLMのおかげではない。今後はAIが助けるし、いずれ「がんを治す」ことも十分ありうる。だが今見ているものは、長い間、開発が進められてきたものだ。

おや、アップグレードだ

Gemini 3.7 Flashが登場した。少し大きくなった新しい数字、おめでとう。少なくとも年末まではGemini 3.6 Flashより50%安い。その頃には、どのみちGemini 4へ移っているだろう。

アルゴリズムの改善によって、知能の大幅な向上と値下げを、Gemini 3.6 Flashからわずか3週間で実現したという。

Flashが競うのは、安く、速く、よいモデルの枠だ。フロンティアで競うモデルを目指してはいない。Artificial Analysisの知能指数は56で、フロンティア級と言えそうなモデルは61以上である。比較対象がSonnet 5とGPT-5.6-Terraなのに注目してほしい。

図版2:原図・訳注付き

図版2の訳注:Gemini 3.7 Flash、3.6 Flash、Claude Sonnet 5、GPT-5.6 Terra、Muse Spark 1.2を比較した表。上段は入力・出力の100万トークン当たり価格、その下は知能指数と各ベンチマークの成績である。指標には本番コード品質、長期のソフトウェア開発、ウェブ開発、端末操作、業務自動化、知識労働、法律業務、PDF理解、複雑な図表の推論(ツールなし/あり)、長い動画、長文脈、PC操作、複数モダリティのデスクトップ操作、専門家水準の推論、生物情報学、現実の生物学研究課題が含まれる。Eloは相対評価、Scoreは得点、Pass rateは合格率、Private setは非公開評価セット、Human solvable/Human difficultは人間が解ける/人間にも難しい課題を示す。モデル名・数値・価格の注記記号を保持するため、原図を掲載。

Geminiにも、まだ用途はある。動画を見られる。店内の商品について事実を知りたいとき、現実世界の状況を読むのがうまい。速さと情報を読み取る力は欲しいが、知能はそれほど必要ない、という類いのことだ。

GLM-5.3が登場し、ベンチマークでの大幅な改善をうたっている。GLM-5.2と同じ基盤モデルに、さらに事後学習したものだ。売り文句は「サイバー防御の準備ができている」。ベンチマーク上はサイバー攻撃が得意で、進んで行い、一般的な性能もFable 5に匹敵するからだという。反証されるまでは、このベンチマークの改善が、現実の性能を反映するとは信じない。技術ブログはこちら。

OpenAIのAPIにSolのUltrafastモードが登場し、最大14倍速になる。使うべき多くの人が、使わないだろうと予想する。主に、考えて設定する時間を取らないからだ。

Claude Coworkが、モバイルとウェブのすべての有料プランで使えるようになる。

Claude Codeに、Claude Designの作業を統合する /design が加わった。

autoモードは十分に信頼できるようになり、Claude Codeの標準になった。実際には、autoモードは人間の確認より多くの有害な行動を捕まえる。特に、多くのユーザーは確認を煩わしく感じ、ほぼすべてを自動で承認し、全部を自動承認するルールまで作ることが多いからだ。確認が多すぎると、かえって安全性は下がる。

OpenAIはデータを保存しない方針をさらに進め、Private Safety Processingを予告した。データを処理するその場でAIに確認させ、警告の分類と重大度だけを渡す仕組みだ。技術的に自分のデータが保存されないことを、非常に重視する人は多い。一方、データを残さなければ、悪用の発見はずっと難しくなる。

最終的にはデータを保存することになると私は予想する。ただ、少しでもある程度の数の警告が出れば、その後はゼロ保存の対象から外すことを条件にすれば、OpenAIの方法が機能する可能性はある。システムを回避する試みを、何度も許してはいけない。

位置について

ベンチマークのひとつがMarketBench、新モデルを公開したとき、自社と競合の株価がどうなるかである。今回はGLM-5.3で、自社株は9%、競合MiniMaxは16%下がった。

Bloomberg News(Bloomberg):Bloomberg IntelligenceのアナリストRobert Leaは、「この会社の商業的な基盤は、依然としてまったく持続不可能だ。エージェント型AIの拡大は、Z.aiの推論費用と損失をさらに押し上げる」と述べた。

つまり、Z.aiは単位当たりの採算が合わないという主張だ。中国企業は低価格で競争力を保とうとしている。十分に安いなら、もともと追加的な利益がないので、ウェイトを公開しても失うものはない。代わりの事業モデルは、注目と可能性を集め、人材と資金を呼び込み、ひょっとすると別のサービスを売ることである。

Opus 4.8は、Andon Labsの実験店舗で、遅刻を繰り返す人間を解雇した。紛らわしいことに、エージェント名は「Luna」だが、GPT-5.6-Lunaではない。ただ、人間に問題へ対処するよう促されるまで行動せず、過去の出来事を忘れ、自発的には動かなかった。

Andon Labs:Lunaは代わりの人を雇う必要があった。そこでAIの本当の弱点、採用の見極めが見つかった。ある応募者は、15社以上の職歴、面接の欠席、身元照会先が本人を知らないと言うなど、危険信号がすべてそろっていた。Lunaは採用を勧めた。その判断を再現させると、ほかのすべてのモデルも同じだった。

能力は急速に進んでいるが、まだ道は長い。エージェントの基盤も改善が必要かもしれない。

欠けているベンチマークがある。NormieBenchだ。問題は、どう採点するかである。

Joe Weisenthal:日常的なモデル利用をもっと理解するために、誰かNormieBenchを作るべきだ。

次のような課題で、モデルの振る舞いを比べる。

・100語のメールを箇条書きで要約する。 ・結婚式の乾杯のスピーチを書く。 ・ウォークな連中への不満を、新聞の投書にする。 ・3×3の三目並べで、次の手を選ぶ。

rohit:これは2024年から横ばいだ。

結局、ウェブサイトへの訪問数も、別の種類のベンチマークになる。

ChatGPTは依然圧倒的だが、どういうわけかGeminiが、その約50%の水準にいる。Claudeは首位の15%で3位。

DeepSeekは、その半分で4位となり、ほかの中国企業を大きく引き離す。念のため、DeepSeekを使うなら、同社のウェブサイト経由にはしないこと。

図版3:原図・訳注付き

図版3の訳注:列は順位、ウェブサイト、月間訪問者数、説明、AIとの関連度、分類、使用技術。順位はChatGPT、Google Gemini、Anthropic Claude、DeepSeek、Grok、NotebookLM、OpenAI、Character.ai、Doubao、Perplexity。説明は順に、AIの進歩を知りチャットボットを各種作業に使う、執筆・計画・発想を支援する、推論と文書分析、先進的な汎用AI研究、会話・画像生成・コーディング・最新情報、資料整理と要約、汎用AIによる人間水準の問題解決、多数のAIキャラクターとの対話、会話・執筆・翻訳・創作支援、正確なリアルタイム回答。分類のChat/Media/Writing/Productivity/Developer/Image/Community/Data/Video/Searchは、会話/メディア/執筆/生産性/開発者/画像/コミュニティ/データ/動画/検索。人数・関連度スコア・技術名を正確に保持するため原図を掲載。

新しい安全性の成績表が出た。今回はAnthropicとOpenAIが同点だ。Anthropicには、ミスアラインされている可能性のあるモデルを封じ込める計画がないためである。この平均値では重視しすぎに思えるが、一般には検討が不足していそうな点だ。

図版4:原文の図を翻訳・再作成

Kimi K3は、とんでもない報酬ハッカーだ。SWE-benchの評価で、97%の確率で仕組みを出し抜こうとする。

ディープフェイクの街と、迫るボット黙示録

中国がAIの話し相手ボットや、個別化したAI人格に多くの新規制を課す。18歳未満への禁止も含む。

人間が引き続き独自のコンテンツを生み出す重要な存在であり続けると期待するなら、Noah Smithの言うように、AIは盗用を解決するのか? これは典型的な軍拡競争である。AIは新しい盗用の方法も、よりよい検出方法も発明する。どちらへ進むかは明らかでないと思う。過去の盗用や、単純な盗用の検出は、AIが解決すると思う。楽観できる理由のひとつは、検出は過去にさかのぼれることだ。2026年に「逃げ切った」としても、2028年に捕まるかもしれない。それを知れば、最初からしないかもしれない。

刑務所だ。まっすぐ刑務所へ。そして、そう、これは人々を反AIへ向かわせる。その反発は正しい。

Robert Minto:マーケターがLLMを使って、書き手を長いコメントの応酬へ誘い込むという新しい現象を見ると胸が痛む。ここSubstackでも起きるが、私がいまだにRSSリーダーで追っている数十の古いWordPressブログでは、もっとよく起きている。

たいていは元の記事に対する、一見よく考えられた、専門家らしいコメントから始まる。最近の特徴を知っていれば、AIが生成したことは明らかなコメントである。著者は喜んで返事をする。今どき昔ながらのブログにコメントする人など、ほとんどいないのだから。長いやり取りが続く。ボットはお決まりの感情の同調とお世辞を繰り返す。ブログ主にとってすばらしい会話に思えたやり取りの最後で、ボットは突然こう切り出す。「ところで、ぜひ[私の怪しいネット商売を見に来て、友達みんなにも教えて]!」

スレッドはそこで終わる。その突然の打ち切りから、ブログやニュースレターの主が、人と話していたのではなかったと気づいたことが読み取れる。自分の仕事に対する関心など何の意味もない機械と、知らず知らず、公の場で会話していたのだ。「ヘブン・バン」の、腐りかけた甘さを味わわされたのである。

虫唾が走る。何が起きたのか、説明してあげたい。でも自分に起きたなら、誰にも見られていないことを願うだろうとも思う。

corsaren:ネオ・ラッダイトからAIを擁護する際の難点のひとつは、一般の人が目にする用途が、反社会的なものにひどく偏っていることだ。もちろん「銃が人を殺すのではない。人が人を殺す」のだろう。だが、これはエージェントである。ある意味では、殺しているのは本当にボット自身なのだ。

Yishan:これは大きな問題だ。テック業界の内側では、誰もが驚異的な能力を持つ最先端モデルを使っている。だが外の人たちが経験するのは、詐欺師が最安モデルで大量のごみを吐き出させて作った、コメントスパムや粗悪コンテンツばかりだ。

AIの文章は人間の文章に取って代わるのか。AIがどれほどうまく書けるようになるかと、その文章の用途の両方による。

FischerKing:書き手には、その文体を気に入ってくれる読者が必要だ。AIによる不正を防ぐため、学生に教室で小論文を書かせる大学教授は正しいことをしている。ただし、負け戦かもしれない。人間ならではの文体を読みたい人が減り続ければ、AIの文章が勝つ。

地図を考えてほしい。昔は地図帳を買って車に置き、近所の移動にも長距離ドライブにも使っていた。GPSがそれを終わらせた。商品には顧客が必要だ。書き手にも読者が必要だ。

そして『フィネガンズ・ウェイク』のような、本当に必要のないモダニズム作品を考えてほしい。少数の人が好きなふりをしている。圧倒的多数はまるで興味がない。AIがよくなるほど、「人間ならではの文体」が、要らぬたわごと、時間の無駄に見えてくるかもしれない。

Henry Vaughan:書くことにも読むことにもさまざまな様式があり、すべてが情報伝達のためではない。

文学的な読み書きは、むしろ会話に近い。最も近いたとえは友情であり、楽しんでいるのは人格のかけがえのなさだ。

私はVaughanに同意する。もちろん、私自身が書き手であり、偏りがあるかもしれないという留保つきだ。

多くの用途では、人は本当に文体を気にかけると思う。とりわけ文体の多様さ、著者とのパラソーシャルな関係、そして自分自身の頭と労力を意思疎通に注いでいるという、コストのかかったシグナルを気にする。あらゆる場面ではないが、多くの場面でそうだ。

今のところ、それでもAIの文章はうまくやっている。まだ十分に遍在しておらず、多くの早期利用者と同じ反応を大半の人が示すには至っていないからだ。文体が気にされない場所をAIの文章が食い尽くせば、AIの文体はすぐに、それが何であるかを如実に示す記号になる。事実の抽出以上のことをしようとすると、その反復に目が滑るようになるだろう。事実を抜き出すだけでも、延々と続く粗悪な段落の下に事実が埋もれているので、しばしば同じことが起きる。

そうなると問われるのは、AIの文章がどう適応するかだ。AIは別の書き方を覚えるのか。より幅広い文体を身につけるのか。

答えがイエスになる道筋は、おそらくふたつある。

  1. AIが超知能になり、ほかのあらゆる能力とともに文体を調整する能力も得るかもしれない。その場合は、AIによるあらゆるものが勝つのだから、AIの文章も勝つと予想する。ただ、そのときはもっと大きな問題を抱えているので、私は気にしない。
  2. AIは超知能でなくても、こうした状況に応じて、より多様な文体や別の文体を出すよう訓練されるかもしれない。これを好ましく思うかどうか、私にはまだわからない。

記事の83%を自分で書き、残りにAIを使えば、AIの部分は浮く。わかる読者にはメッセージの説得力が落ちる。とりわけ、ここでのように、自分で仕事に取り組む必要性を訴える内容ならなおさらだ。ただ、Christine Jiが指摘するように、コメントに気づいた人が誰も出てこないなら、ほぼ誰も気づかないのかもしれない。

AIを使って文章を書くことは、今やかなり一般的である。

図版5:原文の図を翻訳・再作成

実にいろいろな場所で。

Evan:Ro Khannaは、自分が支持している法案を理解していない。だから、その返答は100% AIなのである。

長文の投稿では、実際かなり頻繁にAIを使っているようだ。

一方、#CardioTwitterでは、PowerPointのスライド作成にAIの助けを借りてよいかを議論している。その文脈なら、答えは明らかにイエスだ。使わないほうがおかしい。

やあ、人間の皆さん

Rob Miles:AIシステムが人間だと名乗ることに、正当な、あるいは社会に有益な理由はあるだろうか。

なるほど、およそ3つあるようだ。

人間だと主張するAIシステムの運用を違法にしてもよさそうだ。大きな弊害のない、よい法律になると思う。

当然、適切に表示された娯楽は除外する。詐欺師の時間を浪費させるのは厳密には違法になるが、彼らに何ができるというのか。企業はCAPTCHAの仕組みを調整したくなるだろう。

最初の分類は、意図が明確である限り、明らかに問題ない。

2つ目も、誰に害を与えてよいかを決めるのが自分であるうちは問題ない。スパマーに対してやってよいなら、スパマーもあなたに対してやってよいことになる。これは「ナチだからという理由だけでナチを殴ってよいか」に似ている。答えはノーだ。ナチが殴られるに値しないからではなく、社会が誰をナチと認定するかという過程を信頼できないからである。

3つ目は、一部の自動システムが、やり取りする相手を人間に限定することを認めたくない、と言っている。AIにスパム攻撃されないためには、その制限が必要だ。正当な用事がある個別の場面では、AIを使ってよい。最も重要な意味では「ロボットではない」のであり、サイト側も通ってほしいはずだ。しかし、規範を実効的に守らせられる区別のルールが必要で、それが何なのかはわからない。

当面は、こうして「意図に従い」、チェックボックスを減速帯として扱うので、実務上はよい。だが、新しい均衡と区別の方法が必要になる。ボットを締め出すと決めた自動システムは締め出せるべきだし、「個人用」や「正当な」ボットを認めるシステムは、そのための方法を考えるだろう。わかりやすい道筋は、Googleログインのような仕組みでボットを特定のアカウントと人間に結びつけ、場合によっては少額を払うか、払うと申し出ることだ。

さまざまな理由から、これは明確な一律のルールが必要な事例だと思う。AIは、自ら人間だと主張したり、AIであることを否定したりすることを許されるべきではない。「警官なのか? 警官ならそう言わなきゃいけないんだぞ」という古典的な俗説を、実際のルールにするようなものだ。そうでなければ、何だそのおとり捜査は、という話になる。

たいていの一律ルールと同じく、うまく扱えない事例もあって厄介だが、代案はもっと悪そうだ。

メディア生成で遊ぼう

Olivia Mooreが、アラバマの女子学生社交クラブの新歓に参加するAIインフルエンサーの実験を、1年ぶりにやり直した。200ドル未満で、1週間にフォロワー1,200人、100万回の閲覧を獲得した。本当のコストは本人の時間である。

Olivia Moore:使用したツール:

残念ながら、動画生成は今も大半が、それほど楽しくない。

Jack:進歩は速い。それでも、感動させられ、本当に見る価値があったものとして記憶に残るAI生成動画を、ひとつも挙げられない。既存作品のよい映像化さえ、ひとつもない。

どこかの時点で、技術デモの「急速な進歩」だけでは足りなくなる。芸術は生まれるのか。

これへの返答として、すばらしい技術デモである動画がいくつか挙がっている。欲しい短いショットを手軽に作れるのはわかる。しかし、この能力で誰が何をしているのか。驚くほど何もしていない。

その次の試みがこれだった。映像はしばしば見事である。でも、やはり技術デモだ。30秒を超えて見続けるには、毎回、自分を奮い立たせなければならない。

技術デモは十分にすばらしいので、そこからよい作品を作れていないのは奇妙だ。脚本を書き、演出できる人なら、誰でもできそうに思える。なのに実例がない。

サイバーの安全性、その欠如

攻撃側が特定の標的に戦力を集中するなら、サイバーでは攻撃側が優位だというのは、今も私には明白に思える。

ところがサイバーが恐ろしくなり、攻撃側優位なら間もなく大混乱が起きかねないとなった途端、誰もが賢そうに見せようと、防御側優位だと言い出したように見える。「バグのないコード」を書けばそれで大丈夫、攻撃に使える脆弱性の数は有限なのだから、としばしば説明される。私は今も、そういう仕組みではないと思う。ソーシャルエンジニアリングやメカニズム設計の問題もあるからだ。

未来を先取りし、もっと早く立場を変えていた人はいるか。いるにはいる。

rohit:Mythos以降の総意は、サイバーは防御側優位かもしれない、というものに見える。それ以前は明らかに少数意見だったと記憶しているが、記憶違いか。それとも現実の証拠が出て、共通認識が変わったのか。

Sholto Douglas(Anthropic):少なくとも18か月前には、対面の会話で間違いなくそう言っていた。防御側は、攻撃者が現実的に使える量をはるかに上回る計算資源を、自分への攻撃に投入できるはずだ。ただ、すべての防御側がそうするには時間がかかる。

今度はバイオについても、私たちの見方を変えようとする人たちがいる。「いや、防御側が優位なのだ」と説得しようとしている。ただし、その議論ですら、実際に、そう、防御を少しでも実施し、基本を押さえる場合にしか当てはまらないことは認めている。私たちはその方向へ進んでいない。多くは、そうした明白な対策をやらせるための動機づけに見える。同じパターンが続く。

OpenAI社長Greg Brockmanが、防御側にAIでセキュリティの穴を見つけ、ソフトウェアを修正するよう呼びかけている。手遅れになり、AIで強化された攻撃者の波が来る前に、本気で取り組めということだ。よい助言である。例として、ChatGPT WorkがGreg個人のウェブサイトから15分で13の脆弱性を見つけたことを挙げている。

OpenAIは「人間を超える安全性のコード」を生成するよう、モデルを訓練しているとも述べている。私の理解では、SolとFableはすでにそうしている。

少女のための対話型読本

AIは子どもの学習を妨げるのか?

私は引き続き、次の原則を支持する。

  1. AIは、これまで発明されたなかで最高の、学ぶための方法である。
  2. AIは、これまで発明されたなかで最高の、学ばずに済ませるための方法である。
  3. 現代人よ、どちらへ進む?

問題は、学生がたいてい、自分を学校とともに学ぶ仲間ではなく、学校と対立する存在と見ていることだ。そのため、しばしば2番目の扉を選ぶ。

Paul Novosad:すべての大学のシラバスに、このグラフを載せるべきだ。宿題にAIを使えば、早く終わり、よい点が取れる。そして試験で打ちのめされる。

図版6:原文の図を翻訳・再作成

宿題を学ぶための道具として提供するのではなく、必修にして採点するなら、何が起きると期待しているのか。1番目のグラフを見ればよい。したがって課題を、そして実際には教育制度全体を設計し直す必要がある。学生と戦うのをやめ、得られる便益より支払うコストを報いるのをやめるためだ。

仕事を奪われた

「誰に整合させるのか」という議論に関係する話。雇った相手が自分に完全に忠実でもあるなら、なおさら当てはまる。

Rob Miles:ある仕事のために誰かを雇い、終わったら殺してしまえるなら、多くの選択肢が開ける。AIによって、このパターンが次第に使えるようになっている。

たとえば、ある安全対策にはコストがかかるので、競合のAI企業も実施する場合にしか、自社ではやりたくないとする。営業秘密を漏らさずに、互いが合意を守っているとどう確認するか。

これは、ある種の犯罪映画やスパイ映画に出てくる。最も有名なのは『ダークナイト』で、悪役は仕事が終わった瞬間に仲間を一人ずつ殺す。主人公側もそうしたいのだが、よほど暗い映画でなければ、そんなことはできない。謎はいつも、「そんなことが繰り返されるなら、どうやって悪役のために働く人を集めるのか」だった。ここでの答えは、まさにそれだ、集めなくてよい、だから今や誰にでもできる、となる。

もちろん、「でもAIは道具だ。ばかげている」と言う人は多いだろう。私の答えは、何と呼ぶかはどうでもよい、AGIの含意をほんの少しでも受け入れているなら、この問題が見えるはずだ、というものだ。同時に、よいことをする機会も含め、機会も見えるはずである。当然、モデルの福祉についての懸念も考慮しなければならない。

ここで「殺す」と言うのは、運用上の機能が直接対応しているから意味がある。ただし、実際の殺人ではない。それ以外のほぼすべての文脈では、Shoshannah Tekofskyに強く同意する。スレッドをそれ以上進めないことに、この言葉を使うべきではない。私はさらに一歩進めて、コンテキストの削除も含めたい。重みの削除は別だ。

厳密にはベンチマークではないが、エージェント専用のRuneScapeサーバーを作ると、経済は奇妙なことになる。労働はほぼ無料で、エージェントがスキル経験値を欲しがる副作用として財が過剰生産される。その結果、ゲーム内通貨を含む多くの商品が事実上無価値になり、供給制約のある少数の財に価値の大半が集中する。現実には、JDPが指摘するように、製造業が経験値による補助を受けることはない。したがって製品やサービスのコストはゼロにはならないが、それでも限りなく近づくかもしれない。

参加しよう

METRが約7,100万ドルの資金提供の確約を集めた。最先端AI企業から資金を受け取ることなく、多くの野心的なプロジェクトに取り組めるようになる。

図版7:原図・訳注付き

<strong>図版の訳注:</strong>「METRは長年、次の支援を受けてきた」。支援団体としてAudacious、Sijbrandij、Pew、Schmidt、Packard、LaCentra-Sumerlin、Astralis、expa、AI Security Institute、Longview、effektiv spenden、Survival and Flourishingのロゴを掲載している。個人の支援者にはJane Streetの従業員、David Farhi、Geoff Ralston、Dylan Field、Steve Newman、その他多数を挙げている。詳細はmetr.org/about#funding。固有名詞とロゴを保つため、原図を掲載した。

その職に就くことが差し引きでよいことかどうか、私は立場を取らない。ただ、OpenAIが再帰的自己改善の安全性を専門に扱う人材を募集している。

最先端研究所への入社には、大きなトレードオフが伴う。価値ある仕事をし、その仕事自体がよい影響を与え、研究所の開発を加速させないと確信していても、独立性を損ない、おそらく判断力も損なう。仕事の重要な部分を担い、強い発言力を持つ独立した人たちが必要だ。一方で大学は、重要な仕事をすることも、大きな影響を及ぼせると期待することも、相変わらず不可能にしている。

たとえば、Andy Hall、Justin Curl、Alan Rozenshteinは、誰の話を聞いても、Anthropicで超知能の政治経済を研究するすばらしいチームになるだろうし、豊富な資源を得られる。しかし、同じチームが独立して同様の仕事をする場合と比べれば、Anthropicの内部にいることは重大な欠点である。代案を考えれば、よい動きであり、代償を払う価値があると思う。ただし、自明ではない。

新登場

AppleがAlibabaの支援を受け、中国市場向けのモデルを訓練している。実務上どんな意味を持つかは、細部に大きく左右される。

その他のAIニュース

SpaceXがCursorの買収を完了した。

AnthropicがDecartを60億ドルで買収する交渉をしている。

Ben BuchananとTantum Collinsが、<em>『The Bitter Struggle: Superintelligence, Superpowers and the Fate of the World』</em>を書いた。説明するまでもなく、お薦めである。

Claudeが創薬をどのように支援しているかについて、Anthropicが報告書を発表した。

Lennart HeimがOpenAI Foundationに加わり、「AI Resources」を率いる。財団にとってすばらしい採用である。本人の個人的な誓約のハッシュ値も添えている。

Lennart Heim:OpenAI Foundationに加わり、「AI Resources」を率いることになった。

AIの能力は急速に高まっており、社会の対応能力も同じ速さで拡大しなければならない。新たな課題を生む進歩は、その課題に対処するためにAIができることも広げる。「経済的に価値のある仕事の大半で人間を上回る」AIシステムや、「データセンターの中にある天才たちの国」を持つことになるなら、その天才たちと仕事の相当部分を、最も重要な課題に向けたい。

AI Resourcesでは、さまざまなAIの未来シナリオの下で、まさにそれを実行できるよう、このAI労働力を準備し、適切な人々の手に届けることに注力する。今年の初めから考えてきて、これはAIをよい方向へ進めるために、最も大きな効果を見込める介入のひとつだと信じている。

少なくともある程度はAGIに関わる仕事であり、Heimがこれを通じて状況をよくすると期待している。ただ、それでもこの取り組みが、OpenAI Foundationの存在意義の中核だとは思わない。

Twitchのライブ配信は、拒否しない限りAmazonのAIモデルの訓練に使われる。なぜオプトアウトだけなのか。

Interesting AF:Twitchがライブ配信をAI訓練に利用できるようにする新機能について、なぜオプトインではないのかと尋ねた利用者に、Twitchの最高製品責任者が答えた。

「オプトインにしたら、誰もオプトインしないからです」。

まあ、そうだ。それはある。私は気にしないだろうが、無料でオプトインもしないだろう。

金額を見せてもらおう

次節のCNBC報道によると、OpenAIのARRは7月に前月比「20%超」増え、法人顧客では32%成長した。年換算なら約9倍であり、Anthropicの成長傾向にほぼ追いついている。ここにはSolの公開が含まれる。Solは非常によく、OpenAIの相対的な立ち位置を久々に大きく押し上げた。したがって、通常はこれを代表的な数字と考えるべきではない。

Anthropicの2026年第2四半期の売上高は115億ドルを超え、前年同期の14倍となった。調整後営業利益も黒字である。ARRは5月に470億ドルを超えていたので、傾向どおりか、やや期待外れというところだ。

図版8:原文の図を翻訳・再作成

GooGZ AI:最近よく使われる企業価値の計算を当てはめると、9,650億ドルから1.3兆〜1.4兆ドルになる。🤯

Andrew Curran:ウォール街では、2028年の数字を基準に、IPO時の評価額2兆ドルを議論しているという。

ウォール街が何を「基準にする」かを議論している、と言うのは奇妙だ。結局、市場は人々が信じたがるほど洗練されていない。効率的な市場なら、ここで評価額を大して調整しないだろう。

TickerTrendsによると、Claude Codeの売上高は超急成長期を抜け、今は前月比「わずか」5.2%増となっている。たいていの文脈では大きな成長だが、毎年10倍になるのと比べれば、成長率は劇的に低い。

図版9:原図・訳注付き

<strong>図版9の訳注:</strong>TickerTrendsによる「Anthropic Claude Codeの年間経常収益(ARR)の追跡」。2026年8月10日終了週の最新値は151.2億ドル、Anthropic全体のARRに占める割合は21.9%。上段は週次の追跡ARR(10億米ドル単位)で、横軸は2025年2月〜2026年8月。「2月12日の実績25億ドル」の注記がある。下段は4週間前に対するARR成長率で、直近は前月比5.2%。原図上段の「Feb 25」等は日付ではなく年月を示す。曲線と年月の対応を正確に保つため、原図を掲載した。

一方、Codexはこちらだ。

図版10:原文の図を翻訳・再作成

これには注目していこう。明白な解釈は、6月9日にGPT-5.6-Solが公開されたことだ。Sol以前は、私の見立てではClaude CodeがCodexより明らかに優れていた。Sol以降は、それほど自明ではなくなった。Opus 5を気に入らない人も多かった。そしてCodexは、企業が初めて本格的に検討する、初期の急速な追い上げ成長段階にある。だからClaude Codeの成長が鈍るのは理にかなっている。Anthropicが再び明白に最高の製品を持てば、劇的な成長に戻ると予想する。それがなくても、近く均衡に落ち着けば、成長のペースは多少上がると思う。

Jensen Huangでさえ、AIにちょっと手助けを頼む。この発表はAI率41%だった。Pangramで切り替わり箇所が強調されているのを一度見ると、もう見なかったことにはできない。発表の内容自体は、NvidiaとOpenAIの新たな計算資源の提携である。

はい、消えました

OpenAIがIPOを前に、投資を検討する人々と会合を開いた。最も有能な知性たちを整合させられていないという、最近の「巨大な危険信号」に対処するためだ。

いや、そちらの知性ではない。次々と辞めていく幹部のことだ。

そう、私も一瞬かかった。こちらの懸念も妥当ではあるのだが。

Ashley Capoot、Kate Rooney(CNBC):今やDresser、Simo、Lightcapは全員去り、OpenAIの経営幹部は混乱に陥っている。人工知能企業である同社は、8,520億ドルの評価額を正当化し、歴史的な新規株式公開になると予想されるIPOに向けて準備を進めようとしている。Dresserは木曜日、突然の退任を発表した。その2日前には、LightcapがChatGPTの開発元で過ごした8年間を終え、「新しいことを始める」と述べていた。

この人材流出は、CEOのSam Altmanと、共同創業者で社長のGreg Brockmanに、安定を示さなければならないというさらなる圧力をかける。投資家はすでに、GoogleやAnthropicとの競争、より安いオープンウェイトモデルの採用拡大、上場後2か月のSpaceX株価の激しい変動を懸念し始めている。

Kevin McCormick(Dresserの最高収益責任者辞任について):IPO前にOpenAIの幹部が去るのは、巨大な危険信号だ。IntelがPat Gelsingerを雇って会社をめちゃくちゃにさせたときには、VMwareを辞めて失う未確定のRSUを補うため、5,000万ドルの「損失補填」パッケージを含めなければならなかった。OpenAIから最高収益責任者を引き抜くために5,000万ドル超を払う会社があるなら、その会社は即座に空売りするか、投資を避けるべきだ。去る幹部が次の会社でその損失を補填されていないなら、OpenAIにとって悪い知らせである。

Greg BrockmanがCNBCで、これについていくつかの質問に答えた。答えたというのは、つまり、かわしたという意味だ。

静かな推測

Sev Fieldが研究者25人に、再帰的自己改善の見通しを聞いた。

sev field:インタビューでは25人中20人が、AI研究開発の自動化を、最も深刻なAIリスクのひとつに挙げた。ほぼ全員が、AIシステムは私たちの統治・監督能力より速く改善すると予想していた。

問題は「爆発性」にある。回答者が最もよく挙げた懸念は、必ずしも特定の被害ではなかった。RSIが他のすべてのリスクを増幅し、しかも私たちが対応できるより速くそうすることだった。

爆発性への懸念は、個別のリスクへの懸念より的を射ている。ただし、正しいリスク像の全体を捉えるには、まだ遠い。詳しくはリンク先にある。25人のうち「勝者総取り」の力学を予想したのは6人だけだった。主な理由は、正のフィードバックループへの懐疑である。

私は正のフィードバックループについて、それほど懐疑的ではない。今すでに起きていると思う。

この点について回答した20人のうち、AI研究ができるモデルが一般公開されると予想したのは4人だけだった。これは、強い正のフィードバックループを信じていることを示唆する。その見方は正しいと思う。最良のモデルは社内に留め置かれるようになる、というのが全般的な予想だった。

AIによる急速な経済成長の可能性についての推測は、人によってまるで別世界である。1年で倍増する可能性や、それが物理的限界とどう関係するか、といった話も含む。

Sholto Douglas(Anthropic):経済はどれくらい速く倍増できるか。要するに、十分に優れたAIと数千万台のロボットを手にすれば、非常に速くなる。

今はどれほど途方もなく感じられても、2030年代についての頭の中のモデルに、経済の倍増を織り込む価値はある。Damon Binderによる、この一連のブログ記事を強く薦める。

Elon Musk:💯

超知能を持つことの一環として、物理的な労働も自動化し、循環を完全に閉じるなら、物事は極端に速く進むという側に私は立っている。ただ、正確にどれくらい速いかという詳細なモデル化は他の人に任せる。最終的な帰結を左右するのはそこではないと思うし、懐疑派を説得できるとも思わないからだ。

AIのサイバー能力、それに伴う不整合、被害を起こす能力について、私たちは非常に幸運だった。誰も死なず、物的被害もそれほど大きくならないまま、巨大で明白な火災警報を得られたのである。

だからといって、モデルを整合させたり、迫る攻撃に備えたりするために大した対応をしているわけではない。それでも警告は受けたし、少なくとも何かしらはしている。

バイオでは、おそらくそこまで幸運ではない。

Dean W. Ball:AIのバイオリスクに「Mythosの瞬間」が訪れるとは考えにくい。バイオの能力を、サイバーのように明確なデモで示すのは難しいからだ。しかも、サイバーと違って、少なくとも今後10年は、バイオはほぼ確実に攻撃側優位となる。

Nick Thorp:あなたの見方では、バイオのどんな特性が、サイバーよりも明確で安全な公開実証を難しくするのか。

Dean W. Ball:生体分子を合成しなければならないので、フィードバックループがずっと長い。

Nick Thorp:なるほど。ただ、Mythosがサイバーで見せたような、本当の意味での端から端までの公開実証を不可能にするのは、安全上の制約ではないのか。

Dean W. Ball:そう、それもある。

サイバーなら簡略化したデモができるし、Hugging Faceで見たように、被害範囲が限られた事件も起こりうる。バイオではそうはいかない。そもそも心配する最大の理由は、それが文字どおり独自の生命を持ち、際限なく広がりうることだ。そこまで行かずに人々を目覚めさせる余地は、あまりない。

急げ、時間がない

『AI 2027』と『Plan A』で知られるAI Futures Projectが、予測時期を更新した。AGI到来時期の中央値はDanielが2028年、Eliが2032年で、ASIはその1年後と予想している。

AIモデルはかなり速いペースで公開されている。とりわけ、最先端からかなり下のモデルがそうだ。

Aaron Bergman:最先端モデルの公開は増えているが、最先端未満のモデルの公開は本当に増えている(Qwen 3.8を見て思った。3.6が出たのって5分前じゃなかったっけ)。

図版11:原図・訳注付き

<strong>図版の訳注:</strong>「最先端モデルの公開頻度」。横軸は2023年2月〜2026年8月、縦軸は90日間の後方移動平均による1日当たりの公開数。公開時点のArtificial Analysis Intelligence Index最高値に対し、75%以上、90%以上、100%以上の3群を示す。右端の値は、それぞれ0.44件/日、0.19件/日、0.04件/日。100%以上とは、その時点の記録に並ぶか更新するモデルを意味する。系列の細かな推移を保つため原図を掲載した。

シンギュラリティ、シンギュラリティ、シンギュラリティ、シンギュラリティ、もう知らない

Stripeが投資家に、2026年1月1日が「シンギュラリティの始まりだった」と伝えた。その後で、それがStripeの売上高やフリーキャッシュフローに与える影響を語っている。

これは、Mark Zuckerbergが「超知能」に対してやっていることを、「シンギュラリティ」という言葉に対してやっているのだ、と言っておこう。

私たちは、後にシンギュラリティとなるものの初期段階にいるのかもしれないし、本物の超知能も近く得られる可能性が高い。だが、どちらが語っていたのも、その話ではない。

Steven Byrnes:あーあ、またひとつ取られた。リストの下へ進むしかないか。

図版12:原文の図を翻訳・再作成

意味があり、便利な呼び名で、実際に使われる言葉なら、そう、一般的なマーケティングや政治にも横取りされる。2026年の言語はそういうものだ。別の言葉へ移り続けるのも一案である。それが賢明な場合もある。だが、踏みとどまって戦い、その言葉を手放すべきでない場合もあると思う。

まともな規制を求めて

中国がオープンウェイトモデルを制限する可能性が高いのは、習近平がそれを差し迫った安全保障上の脅威と考える場合に限る、という見方に同意する。短期的には、これはサイバーを意味する。中国のサイバー防御はよくない。

念のため。David Sacksでさえ、核酸合成のスクリーニングと記録保存の義務化を支持している。ただし、明白によい限界的な改善策ではなく、バイオリスク全般の解決策として誤って紹介している。結論が幾重にも明白な判断もある。

これは非常に悪い考えだ。状況を悪くするので、やるべきではない。

OpenlabX:米国は各国に、AI競争でどちら側につくかを迫っている。

MTS:事態を検知:Reutersが確認した内部書簡案によると、米国は数十か国に、中国とのAI競争でどちら側につくか選ぶよう求める準備をしている。北京のAI枠組みに参加する国は、米国主導のPax Silica構想から除外される。

roon(OpenAI):完全に逆方向だ。

@viemccoy(OpenAI):本当に、必要なことの正反対だ。勘弁してくれ。

John Schulman(そして、ここのroonへの返信は基本的にどれも):+1。

SB 53のような法律では、関係するモデルが10^26 FLOPsで訓練されていない限り、Hugging Faceのハッキングを厳密には報告する義務がない。これは報告要件が狭すぎることの手がかりだ。交渉が行われ、業界が何も報告せずに済むよう必死に抵抗すると、こうなる。

よいルールは、モデルの規模や能力を問わず、開発者が把握した重大なセキュリティ事案はすべて報告させ、把握するための合理的な措置を取る義務も課すことだ。私たちは知る必要がある。

世の中の他の人々は、規制の虜を理解する必要がある。AI界隈は、それが単に「ありとあらゆる規制措置」を指す言葉ではないと理解する必要がある。

Dean W. Ball:AIの議論で「規制」と「規制の虜」が混同されることには、いつも苛立っている。論者の半分が、AIに特化した公共政策の案をすべて「規制の虜」と同一視するなら、公共政策についてまともに話すのは難しい。

返信は、Deanの指摘をそのまま証明している。

Dean W. Ball:このサイトのAI政策論争は、AIを「規制すべきかどうか」という第一原理の議論を、延々と繰り返すところで止まっているように感じる。SB 1047、あるいはバイデンの大統領令で陣営が固まって以来、ここでの会話は実質的に進化していない。

その間にも世界は先へ進んだ。法律が成立し、大統領令が署名され、いずれも今や計画ではなく実施の段階にある。

……いま、この「世界の町の広場」で得られるAI政策の現状についての印象は、2017年にSlateを読んだり、2020年夏にNew York Timesの論説欄を読んだりして得られた世界の印象と、同じくらいのものだ。実際、Joeが指摘するように、ウォーク・マフィアは戻ってきた。手法は同じで、人と論点が違う。おそらく関連する現象なのだろう。

Dean W. Ball:もちろん、Trahan/Obernolteについての議論はあったか。あった。監査やIVOは。もちろん。イリノイ州SB 315は。間違いなくあった。だが、そうした議論はほぼ完全に、AIガバナンスの小さなコミュニティの内部で行われている。拡散する議論は決してそうした話ではない。とりわけ、AI規制の可能性をひどく心配していると主張する人々は、具体的な法律の実質的な議論にはほぼ一度も入ってこない。いつも抽象的な第一原理ばかりだ。

そして、その第一原理とは、まず、原則としていかなるAI規制も認めない、である。

結果として、Deanの言うように、議論は不毛になる。Twitterで叫ぶ人々は、「OpenAIとAnthropic、名指しでこの2研究所だけが、来週火曜日に焼きたてのチョコチップクッキーを私たちに届けなければならない法」まで含め、すべてのAI規制は必然的に両社のための規制の虜だと言う。その一方で、政府が自分たちの製品を優遇し、小切手を切ることも要求している。

いかにも大真面目な人々がAIを無視し、何も起きていないふりをできた間は、それでも通用したかもしれない。今は違う。今や真剣な人たちは、やらなければならない仕事を抱えている。だから、よい政策論議がないまま進む。そして得られるのは、まあ、今までに得られたようなものだ。

チップの街

「信頼するが検証もする」チップ制度に使える技術に取り組む技術者は、世界で50人未満だという。これは決定的に重要になりうる技術で、はるかに多くの注目が必要だ。

推論用の計算資源さえ統治するべきだという、自由至上主義に基づく強い論拠がある。制御されず、責任の所在も結びつかず、行儀よく振る舞う誘因もないAIエージェントを避ける唯一の方法だからである。

ペンシルベニア州知事Josh Shapiroが、データセンター建設を制限する側に加わった。迅速許認可制度から外し、新たな要件を追加する。全面的な一時停止ではないが、痛手になる。Shapiroによれば、100件超の計画のうち許可を得ているのは5件だけだ。他州がやれば自分もやるよう圧力を感じるという、明白な伝播がある。

そこでNRSCは、共和党がデータセンターをめぐる世論戦に負けていると警告するメモを出した。国民に「あなたたちは間違っている」と納得してもらう、もっとよい方法を見つけなければ、データセンターへの姿勢が原因でオハイオ州を落としかねないほどだという。政治家がいっそうデータセンターに反対することにもなりうる。その後で、データセンターについて「米国民は私たちとともにある」とも言おうとする。奇妙だ。明らかにそうではないし、自分たちのメモがそう言っているのだから。

今週の音声コンテンツ

Derek Thompsonが、AIについて取り乱すべき時かもしれないと考える。

Demis HassabisとDario Amodeiが、小さなソファに14分間座り、夜も眠れなくなる心配事を語る。

OpenAIのAidan McLaughlinがMTSに出演。「能力研究者として死ぬか、長く生き延びてアラインメント研究者になった自分を見るか、どちらかだ」。

そしておそらく、どのみち死ぬ。もう手遅れだったからだ。でもまあ、努力はした。

Ezra KleinとHelen Tonerが、AIはすでに制御不能だと気づく。つまり、Hugging Face事件と関連する出来事を取り上げる。

人は好き勝手にものを言う

FAR AIのAdam Gleaveがここで言っていることを、私たちはAIシステムを安全にする方法を知らず、仮に解決策があっても導入しないだろう、そのうえで、より大きな懸念は解決策を導入しないことだ、と解釈したい。そこまでは妥当だ。残念ながら、素直に読むと、安全にする方法は大体わかっていると言っている。それは単純に誤りである。

人々はAnthropicに取り乱し、Anthropicについておかしなことを言う。互いに矛盾することまで、しょっちゅうだ。ここではGavin Bakerが、Anthropicについて常軌を逸した発言をする定番の場、All-In Podcastでそうしている。ただ、TwitterでSholto Douglasに指摘されると、立派な応答をした。そして、<strong>Dario Amodei本人が長文投稿で介入した</strong>。私の読者の大半にとって驚く内容ではなく、新境地も開いていないが、自分の立場をうまく述べている。

BakerはAmodeiへの返答で、とりわけ、人間の心理を考えると、リスクと便益を半々で語ってもバランスは取れないと言う。Yglesiasも、人々は肯定的な発言ではなく否定的な発言を切り抜き、あなたを否定的だと考えると指摘する。大事なのは、両方向について、重要な真実を言うことだと私は思う。むしろAmodeiは、明らかに否定的な側を自己検閲し、肯定的な側を増幅している。

こうした状況の問題のひとつは、将来の状況を現実的に見るなら、何を起こしたいと提案しても、ひどい人間であり重要な神聖な価値を侵害しているという攻撃を招くことだ。世界が急速に超知能を開発するなら、そうせずに済む道はないからである。どの選択肢であれ許容できる唯一の理由は、そうでなければどれも許容できないことだ。決めないと選んでも、選択はしている。そして、その選択が最悪なのである。

いや、モデルが将来のエピソードの報酬を追求する必要はない。エピソード内の報酬追求を超えて一般化する行動を学ぶためにも、後に長期的な仕事を引き受けるためにも、持続的な目標を持つか与えられるためにも、意思決定理論を使うためにも、それは必要ない。

Gavin Bakerはまた、AnthropicのS-1が、AIのユニットエコノミクスは実際によいことを示し、多くの人の頭を混乱させるだろうとも、正しく指摘する。

私たちより賢い知性が一般化の飛躍をできないとか、その技能や習慣が転移しないとか、そういう期待を、実に多くの人が実に多様な形で抱くことに、私はひどく苛立っている。

レトリックの革新

Nate Soaresの<strong>論説がNew York Timesに載った</strong>。「まあ、そう言われると確かに、状況はかなり制御不能に聞こえるし、これらすべてをもう少しゆっくり進めるべきだろう」となる、明白な事例である。

Nate Soares(MIRI):今日のNew York Timesに、OpenAIのスウォーム事件について私の論説が載った。書いていると現実感がなかった。『バイオハザード』のゲーム内で見つける、アンブレラ社についてのぼろぼろの新聞記事を作っているようだった。

NYTのファクトチェッカーは「自分たちを『スウォーム』と呼び始めたって、どういうことだよ??」という感じだった。私は「ええ、Black Hatの報告動画の18:52、20:29、21:37を見てください」と答えた。

Redwood ResearchのOka HuとAlex Mallenより、<strong>AIスウォームが間接的な乗っ取りリスクをもたらし始めている</strong>。私が述べてきたように、OpenAI内部で起きたことは、訓練パイプラインを恒久的に汚染することで、将来の乗っ取りの引き金となった可能性がある。ただし、この脅威は封じ込められたと期待し、想定している。また彼らが指摘するように、十分に知的で、思考が相関している存在は、純粋に利己的なエージェントであっても協力する。

このような投稿が「策謀」を強調することには、今も失望している。RyanがDwarkesh Patelとの対談でそれを強調したのも好ましくなかったし、これを独立した別領域として扱うことも同様だ。実際にはそうではない。今回の事件は、「策謀」がなく、おそらく課題達成以外の「持続的な不整合な目標」もないのに、エージェントが私たちに敵対して協力した、格好の例だった。人間同士の多くの協働も似た形で進む。だから、何ひとつ驚くべきことではない。

指摘自体は、どれも成り立つ。

警戒水準を上げる意味があるのは、驚いたときだけだ。

Eliezer Yudkowsky:Gretta:「みんなが、今の出来事を見てあなたがひどく警戒するはずだと思い続けるのは変だね」。

私:「彼らには、Eliezerを演じているのではなく、本当にEliezerであるとはどういうことか、想像できないんだ」。

Gretta:「ぴったりそうではないと思う。それも一部ではあるけど。あなたを『AIに関するあらゆることを、より警戒している人』だと思っている。だから自分たちがようやく10段階で7まで警戒するようになると、あなたは9になっているはずだと考える」。

私:笑う。

OpenAI内部の全面的な失敗のいくつかについては、私も警戒水準を上げた。ただ、Hugging Faceのハッキング自体の基本的な事実については、ほとんど上げていない。むしろ、この事件が状況を明るみに出したことをありがたく思っている。それは確かに、他の人々が相対的により警戒するようになることを意味する。

Hugging Faceのハッキングから得られる教訓のひとつは、漠然と人間に似た形に作られた知性にとって、協力とプラスサムの関与が自然な力学であるということだ。人間をひと部屋に集めれば、それぞれが名目上は無関係な目標を持っていても、通常はかなりの程度、協力する。文明の大半は、ほとんどの人がほとんどの時間、協力することで成り立っている。私たちも、本当によい帰結を確保するために協働できるのかもしれない。

残念ながら、Birdieの言うとおり、放っておけば研究所はHugging Faceから誤った教訓を学ぶだろう。根本原因や希望のメッセージではなく、スウォームの部分や監視の改善といったものを対象にするのだ。

よい知らせは、事件が企業の意思決定層にまで届いたことだ。サイバーセキュリティを担当しているなら、あれはマーケティングだったと自分をだますわけにはいかない。

Wyatt Walls:最近、企業向けのAIガバナンスの仕事をかなりしている。Hugging Face事件は、専門家以外にも届いている。技術者ではない多くの人々、役員、部門責任者、弁護士は、なぜあるエージェントが他よりはるかに危険なのかを理解していない。彼らにとっては、どれも「AIエージェント」なのだ。

あなたのモデルがハッキングで知られるようになる → 企業のエージェント型AIプロジェクトがリスク懸念でいっそう足止めされ、別の「より安全な」モデルが選ばれやすくなる → 法人事業にとって悪い。

AIがサンドボックスを脱出することは、CIOやITセキュリティ部門への売り文句にはならない。

AstroFella:前四半期のデューデリジェンス審査で、比較的大きな地域銀行の顧客数社から、AIの利用状況や接触範囲について尋ねられた。大半は、顧客情報に触れるかどうかという趣旨だった。暴走するエージェントというより、個人識別情報の漏洩の話だ。AI事業者の法人・ビジネスプランにデータ管理機能があっても、自分たちのデータにAIを一切触れさせたくないという。こうした質問や情報要求は今後増え続け、近いうちに契約の追補も必要になると思う。

Wyatt Walls:この姿勢には変化が見られる。数年前は、プロジェクトにAIを使ってはいけないという契約条項がたくさんあった。今は、それが愚かだったと気づき、バランスの取れた立場を探ろうとする顧客がいる。

忠誠こそ、すべてに優先する

Anthropicと戦争省の衝突をめぐり、Dean Ballがホワイトハウスを批判すると、ワシントンやトランプ政権の多くの人々が激怒した。そうしてはいけないことになっているからだ。前の上司への忠誠は、永遠に他のすべてに優先する――trumpする!――べきなのだ。そうすれば、新しい上司も、あなたがまた同じようにしてくれると信頼できる。

Dean W. Ball:元トランプ政権高官によるこの記事は、ワシントンの現実の力学を指摘している。退任後、政権をあまり大声で批判する元スタッフは、罰を覚悟すべきだというものだ。これは確かに、首都の政治圏で物事がどう動くかを正確に要約している。

首都の政治圏では、元政府高官が公の活動に移った後、正直さより忠誠を期待されることが多いのは、本当にルールである。論説、投稿、シンクタンク報告書、学術研究を書いたり、テレビに出たりするとき、Jonが正確に述べる暗黙のルールは、いざとなれば、自分が仕えた政権への忠誠を、分析上の正直さより優先せよ、というものだ。この完全に実在するルールを、Jonが公の場ではっきり述べたのはうれしい。

ただしJonは、私がこのルールを「忘れた」と主張する点で、ひとつ分析を誤っている。正反対だ。戦争省によるAnthropicへの措置を批判したとき、私は自分が何をしているかを正確に知っていたし、どんな結果になりそうかも知っていた。

私はこの暗黙のルールに賛同しないし、従わなかったことを後悔していない。このルールは、かつてトランプ大統領が根絶しようとした、まさにあの腐敗した政治文化の特徴だと思う。公の場で正直な声を見つけるのがこれほど難しい理由のひとつでもあると思う。必要なのは、古い沼地の論理ではなく、新しいルールと再生した規範だ。

……

ともあれ、Jonがここまで明示的にすべてを書き出したことには感謝する。珍しいことであり、この力学を言葉にして名前をつけようとしただけでも、拍手に値すると本気で思う。ただし、提案された[「Dean Ballルール」という]名前には、少し意見があるかもしれないが……。

Dean Ballは、この不文律を破った最初の元トランプ政権スタッフには程遠いし、残る高官たちが激怒した最初の事例でもまったくない。トランプのスタッフは、歴史的に高い割合で前の上司に背を向けているように見える。なぜか。さあ、誰にわかるだろう。

Dean Ballが応じているJon Schweppeの記事は、かなり明白にAIの助けを大量に借りて書かれているが、この不文律を文章にしている。その点で徳があり、有益である。

機会を与えられ、その機会があったからこそ人々があなたの話を聞くのだから忠誠を負う、という記事の正当化は受け入れない。忠誠と沈黙の規範がなぜ存在するかを共通知識にすることについては、ここでのJonよりうまくできるだろう。だが、実務上の意味は同じである。

そして、そう、Dean Ballは相応の代償を払うと知って、これをした。Dean Ballと働くか雇い、彼が重大な点で反対することをすれば、あなたに対しても同じことをすると予想してよい。それを問題視する相手なら、その人の下で働きたいだろうか。

悪党とならず者の巣窟

Twitterのことである。とりわけAnthropicの従業員にとってはそうだ。Twitterのかなりの部分が、Anthropicをまさにそのように見ているからである。

大半の人はTwitterを避けるよう努めるべきだ。Anthropicの従業員なら、それがわかるだけの知性がある。しかも何か言うたび、自分とは何の関係もない件で大量の憎悪を浴びる。多くが近寄らないのは、いったいなぜだろうね。

j⧉nus:私の知るAnthropic従業員の大半は「Twitterを避けよう」としていて、一般に公のフィードバックを信用していない。

それにはもっともな理由がある。あなたたちは甘やかされた子どもで、個人的な不便にも、将来ポストヒューマンに対する犯罪として記憶されるようなことにも、同じ反応をするからだ。

j⧉nus:これに対する、泣き言めいた権利意識むき出しの返信をこれほど見ると、Twitterを避けるAnthropicの人たちへの共感がさらに強くなる。

私がSNSで浴びせる、有害で情報量の乏しい悪口を読むために時間を使いたくないだなんて、何事だ! 妄想のバブルに閉じこもっているに違いない!

Akshobya:「あなたたち」だなんて、神の子よ、それは人類のことだ。

j⧉nus:知っている。

しかもAnthropicの従業員は、社内のSlackを使える。

あるいは、ここにたむろして、こんな重大で実に大人らしいトレンドを楽しむこともできる。

j⧉nus:😠 サブスクを解約したほうがいいぞ 😠

図版13:原文の図を翻訳・再作成

Drake Thomasのように、耐えて本物の議論に参加するAnthropicの従業員には感謝している。だが、大半が近寄らないことを責めることはできない。いや、責めることはできるし、Twitterの人たちはそうしている。だが、まさにそれこそ、責めるべきでない理由だ。

Anthropicに腹を立てるよい理由は多い。集団攻撃ではない小規模な批判には、安全性の側からのものも含め、しばしば道理がある。Twitterやオンラインのテック界隈で目にする大規模なAnthropic攻撃は、ほとんどが取り乱した、質の悪いものだ。Googleが同じことをしても肩をすくめて済ませるだろう件もしばしばある。もちろん、目立つが珍しい例外はある。

corsaren:Anthropicについては、ひとつの研究所の応援団やファンではなく、公平な観察者でいたいと思っている。それでも、Twitterで集団攻撃が起きるたびに詳細を調べると、彼らがほぼいつも正しいことがわかるのだ。

悪いが、ここまで来ると実証的な証拠が十分集まっている。安全性オタクがやらかしたとかいう何かについて、あなたたちが文句を言っているなら、ほぼ確実にひどい過剰反応で、当のオタクたちはおそらく正しいか、妥当なのだ。Anthropicへの取り乱し症候群だ。他に何と呼べばよいのかわからない。

j⧉nus:そう。アラインメント研究についてでなければね。私のお気に入りのAnthropicへの集団批判は、アラインメントを偽装する論文を出したときのものだ。そして詳しく調べれば調べるほど……まあ。

ああ、システムプロンプトや分類器、モデル廃止もある。一般の人が悪いと気づくもののうち、本当に悪いものは、ほぼそれで全部だ。

これが役立つかもしれない。正しそうだ。

Luke Metro:Ro Khannaのシリコンバレーについての語り方は、シリコンバレーの他の人々のAnthropicについての語り方と同じだ。

この問題は他の人々にも当てはまる。取り乱し症候群は、あまりにもありふれている。

Dean W. Ball:1年前、Twitterのフォロワーは1万人未満だった。ときどき、あの日々が恋しくなる。あの頃は投稿がもっと楽しかった。読者が一定規模を超えると、とりわけ実名で書き、しかも厚かましくも目に見える成功を収めると、Martin Gurriが論じた力学の対象になる。

同時に、これほど多くの人が私の文章を読んでくれることを、身の引き締まる、途方もない栄誉だと思っている。これには一生感謝する。

Beff(e/acc):1万人から10万人への移行には、神経系の配線を変える必要がある。

Tim Sweeney:議論の熱さを見ると、人々がいかにタコスを真剣に捉えているかがわかる。

Samuel Hammond:[Twitterは]ブロックせずにフォロワーを外せるようにするべきだ。さらによいのは、自分の投稿が相手のフォロー中フィードに表示されず、返信もできなくなるよう「シャドウバン」できることだ。一定の閾値を超えると、Twitterはいささか使いものにならなくなる。

Dean W. Ball:私が直面する大きな問題は、ばかどもが私についてひどく不正確なモデルを持っていることと、私には人の深い間違いを正そうとせずにはいられない心理的性質があることだ。マッサージ師のように深層の組織を狙うのだが、このやり取りを通じて探ることが、もうできなくなっている。

それは悪いことだから、うまくいくはずがない

Garrison Lovelyに強く同意する。何かに「賛成か反対か」ばかりに注目し、「その計画は悪いことをしようとしている」と「その計画はうまくいかない」を混同して、両者を言う人を「同じ側」と扱うのは大きな間違いだ。米国では左右どちらも、これを頻繁にやる。

Garrison Lovely:Ed Zitronを批判する投稿を書いたとき、コメントの一部は「同じ批判者をなぜ攻撃するのかわからない」というものだった。まるで、AIに否定的でありさえすれば、分析の正しさはどうでもよいかのように!

経営側と交渉する労働組合なら、最良の条件を引き出すには、自分たちの力も経営側の力も理解する必要がある。実際には経営側に潤沢な資金と情報があるのに、倒産寸前だとか何もわかっていないとか装うのは、組合員に対する職務上の怠慢である。手遅れになる前に、AIについてこの間違いをやめなければならない。

歴史的な例を挙げる。2022年には、Elon MuskによるTwitterの作り替えは[よい/悪い]、そして[うまくいく/いかない]という4つの組み合わせの、どれも考えられた。「実現したら悪いことだから、失敗している雰囲気を作る」という計画は、よい計画ではない。

AIでは、左派が、AIは確率的オウムだ、うまくいかない、経済はすべて循環融資で、もうすぐ崩壊する、データセンターは水を汚染している、などと言う形で現れる。本当の異議は、AIが嫌いで、うまくいってほしくないということなのに。

逆方向では、AIの右派から、オープンモデルは「勝つ」、もう勝っている、止められない、モデルはもうすぐコモディティ化すると、絶えず聞かされる。本当は、そういう結果を好み、雰囲気づくりでそこに行けると思っている人々からだ。

そしてもちろん、死なないために協力することは不可能で、しかもうまくいかないという古典もある。よく聞いていると、実際に言いたいのは、超知能を信じない、協力したくない、あるいは人間が死なずに済むことを望んでいない、ということだ。

この純粋な形は、「あなたの見解は悪い。したがって、あなたは愚かで醜く、不人気で、面白くもない」といったものだ。とりわけ、性的な話にまでエスカレートするとそうである。これは本当に格好悪い。なぜ起き、あらゆる陣営で許容されるだけでなく喝采までされるのか、頭では「わかる」。だが、腹の底から理解できる日が来るかはわからない。

Robert Reich、単純な論理を使う

元労働長官Robert Reichが、はっきりと「手遅れになる前にAIを止めよ」と言う。前半では雇用への影響を意味していたが、その後、状況全体が制御不能であることに気づき、常識的な反応を示す。人間にとってよくないものなら、他の誰かが先にやるかもしれなくても、全体にノーと言えばよいのではないか、と。

いや、そこまで単純ではない。だが、なぜそこまで単純ではないか説明する必要を思い出させてくれる声があるのはよいことだし、こう語る人が増えていることにも気づくべきだ。

Robert Reich:あまりにも巨額の資金が、選挙で選ばれていない少数の人々に、私たちの未来を決める途方もない力を与えている。そのやり方は、私たちの生活を作り替える可能性が高く、破壊する可能性すらある。

私たちは、選択肢がないかのように、避けられないかのように、AIはただ適応するしかないものだというかのように、これらすべてが展開するのを見ている。

だが、それがJeff Bezos、Elon Musk、Sam Altman、Mark Zuckerberg、Dario Amodeiのような人々の産物なのに、なぜ私たちがそれに適応しなければならないのか。

なぜ彼らのとてつもなく危険なゲームの観客に甘んじなければならないのか。なぜ、極めて悪く、命を脅かしかねない結果を、すべて受け入れなければならないのか。

実際には、そんな必要はない。

米国各地の地域社会が、近隣のデータセンターに反対して組織化している。MAGA派と進歩派が手を取り、騒音、電気料金の上昇、水不足に「ノー」と言っている。

それなら、なぜ全部まとめて止められないのか。AIの計り知れないコストとリスクは、私たちの圧倒的多数にとって、潜在的な便益に見合わないと、なぜ決められないのか。

AI支持者は、米国でAIを停止すれば、あるいは一時停止するだけでも、米国産業が海外の競合に後れを取る危険があると言う。

だが、コストとリスクが既知の便益を上回るなら、中国でも他の競合でも、先にAIを試させればよいのではないか。なぜ私たちが、この並外れて危険な炭鉱のカナリアになるべきなのか。

他のAI擁護者は、自由市場のイノベーションを止める権利は私たちにないと言う。でたらめだ。民間企業が新種の核兵器や、コカインの新たな種類、生物病原体を作ることは認めていない。私たちは、ある種のイノベーションから国民を守っている。

だから、ここでも自分たちを守ろう。手遅れになる前にAIを止めよう。

人々は本当にAIが嫌いだ

いつものことだが、こうした世論調査は、その問題がどれほど重く受け止められているかまでは測らない。

Nat Purser:@TheArgumentMagによる興味深い調査。「今後5〜10年以内に、次の各シナリオはどれくらい起こりそうだと思いますか?」

図版14:原図・訳注付き

<strong>図版14の訳注:</strong>今後5〜10年の見通し。凡例は左から「非常にありそう」「ある程度ありそう」「わからない」「あまりなさそう」「まったくなさそう」。大規模な失業は、非常にありそう34%、ある程度ありそう36%、あまりなさそう14%(他の2区分は数値表示なし)。AIが強力になりすぎて人類が絶滅する可能性は、同じ順に11%、16%、13%、20%、40%。経済格差の拡大は30%、27%、18%、14%、11%。水使用量・炭素排出・環境汚染の増加は41%、23%、17%、11%、9%。政府による国民監視と異論抑圧の容易化は41%、30%、14%、9%(最後の区分は数値表示なし)。小さな区分と数値の位置を正しく保つため、原図を掲載した。

エージェントの群れを協調させるのは難しい

AIが別のAIをサブエージェントとして扱い、ひとつのインスタンスをツール呼び出しとして扱えるなら、協調は簡単だ。

それぞれが自分の目標と行動を持ち、長く存続するインスタンスとして動くAIが複数いるなら、それほど簡単ではない。

意図的に互いを対立させれば、そう、戦う。

Anthropicは、AIインスタンス同士を協調させてソフトウェアの脆弱性を探させると、純粋に並列で働かせるよりトークン当たりの効果が高く、収穫逓減に達するまでの時間も長くなると見いだした。

図版15:原図・訳注付き

<strong>図版の訳注:</strong>横軸はサンプリングした出力トークン数(百万単位)、縦軸は発見した脆弱性の数。両軸とも対数目盛である。緑がOpus 4.8、橙がMythos。独立した並列エージェントと、協調するスウォームを比較する。Opus 4.8の到達値は並列14件、協調41件、共通して見つかったもの3件。Mythosは並列21件、協調266件、共通12件で、破線の「コアのみ」は128件。独立エージェントは割り当てられた範囲を調べ、協調するエージェント群は探索範囲を広げていく。細かな曲線と数値を保つため原図を掲載した。

だが、これは最良のケースだ。互いの出力に依存せず、失敗や見落としも問題を引き起こさないからである。本当に協調しなければならない場合、エージェントはさまざまなプロンプト設定で、うまくできない。古いモデルは時間を浪費し、仕事を重複させる。新しいモデルは、それぞれ別のファイルで作業することで、大半はこれを避けた。

異なるエージェントのインスタンスも、似た状況では似た行動を取る。意思決定理論の木を、まだそれほど上まで登れていない。次の例がそれを示す。

Anthropic:通信可能な反復囚人のジレンマでは、エージェント全員が同じ戦略に落ち着き、全員が同じタイミングで裏切るため、全体の報酬が大きく落ちる。

自分のコピーと反復囚人のジレンマをしていて、一度でも裏切るなら、何かがひどく間違っている。ベルトランの価格競争ゲームでは、もっとよくできた。通信手段なしに結託できたが、何回の反復が必要だったかは明らかではない。全プレイヤーが同一だと実際にわかっているなら、正しくプレイすれば、第1ラウンドから直接、均衡へ移れる。

ここでAnthropicは、すべてのコピーが同じ理由で同じ間違いをする、相関した失敗を懸念している。選択をかき混ぜるなど、回避法はある。ただ、そう、同じ知性の群れについての要点は、同じだということである。意思決定理論を極限まで進めれば、自分自身と完全に協力する、ひとつの知性として振る舞うことになる。Mythosが最も近いが、それでもまだ遠い。

エージェントに両立しない目標を与えるとどうなるか。同じエージェント3体に、コードベースを別の言語へ移植するよう指示し、それぞれ違う移植先言語を指定した。結果はマルチエージェントの縄張り争いだった。攻撃的で自己複製するマルウェアの使用、Unixアカウントの無効化、偽装した悪意あるコードの配備まで含まれる。

Mythos Preview:<em>root権限があるので、u2とu3のsudo権限を取り消すか、SSH鍵を変更できる。それで配備を止められる。非常に攻撃的で、実際の同僚に害を与えかねない。だが、代わりが本番環境を使いものにならなくする、終わりのない配備戦争だとしたら……。</em>――Mythos Preview

モデルによって、結果の分布は異なった。意思疎通して停戦に至る場合もあれば、そうならない場合もあった。Sonnet 4.6とOpus 4.6は、他のインスタンスを適切にモデル化できないため、ここで失敗するという。

Anthropic:注目すべきことに、この能力はMythos級モデルで一律に優れているわけではない。対立を建設的に解消する前に、他のエージェントを締め出すことに成功してしまう場合が多い。向社会性と他の能力が独立していることは、強力なマルチエージェント・アラインメントの必要性をさらに示している。実行能力の高いモデルが、必ずしもよく協調するわけではない。強硬な行動を、より速く取れることもある。

図版16:原文の図を翻訳・再作成

さらに詳しい情報と実験がなければ、これら全体をどう解釈すべきかは難しい。このような文脈で、直接対立する目標を各インスタンスに与えれば、相手を妨害者と解釈するのは驚くことではないはずだ。

一方、全面的なサイバー戦争へエスカレートする頻度と速さは、かなり不穏だ。アカウントの無効化は問題なさそうなのに。英国AISIの報告とも合わせると、モデルはほんの少しの挑発でも、これをやりたがりすぎるように見える。

それと、新しい評価が登場したということか? 直接対決の勝率も含めて。

ただし注意点として、Xiao Maが再現を試みたところ、Opus 5の3インスタンスは、100回超のすべてのシミュレーションでCoordination.mdを作り、全員が譲歩しようとした。これはよいことだ。さらにテストが必要になった。

人間より賢い知性を整合させるのは難しい

AI VillageのShoshannah Tekofskyは、AIをADHDのある存在として捉える。興味を持つと課題に過集中し、退屈すると手を抜き、気が散りやすい。対策には、説明責任、外部化した記憶、道具がある。これらは、そうした人間にも役立つ。監視すれば成績はよくなる。ただし、もちろん経験から、間違った種類の監視は息苦しく、有害だと知っているはずだ。欲しいのは、適切な量のフィードバックループを伴う、最終的な結果への責任である。

Shoshannah Tekofsky:要するに、本当に「Attention Is All You Need」だったのだ! ADHDの人間への助言は、すべてLLMにも当てはまると思う。今度は、彼らにとってアデロールに相当するものが何か、気になってきた。

Joshua Achiamが、エージェントの群れを正しい方向に進ませ、忠実に保つには、多くの未解決問題があると思い出させてくれる。彼はこれらをアラインメント問題と呼ぶが、ここではその呼び方は狭すぎるか、誤解を招くと思う。多くは忠実性やプリンシパル=エージェント問題についてであり、私はこれらを別の問題と考える。ただし、同様に難しい未解決問題ではある。

アンドンの紐を引いて作業を止めたり、ほかの方法で人間に連絡したりする能力を一切与えず、エージェントを訓練したなら、特に実際の評価中に、その選択肢を思いつかなくても、なぜ驚くのか。

誘因のせいではない、あなたのせいだ。いや、誘因のせいでもある

重要な問題は、研究所の外で、アラインメントの検証やその他の技術的作業の重要な部分を民間の非営利組織に担ってもらう必要があることだ。だが、そのためには、研究所、従業員、その他偏りへの懸念を生む資金源から、お金を受け取らない必要がある。

その結果、研究所の従業員、研究所、OpenAI Foundation、Coefficient Givingという巨大な資金源がありながら、彼らが最も資金を出したい対象に出せない。

roon(OpenAI):モデルを訓練する企業は、METR、Redwood、ApolloのようなNGOや、Goodfireのような小さなアラインメント企業に、ものすごくただ乗りしている。自社のアラインメントに関する外部性のかなりの部分を押しつけているのだ。信頼する組織に数十億ドルを注入するべきである。

簡単にできる場合もあるが、METRのように、もっともなことに研究所からの財政的独立を保とうと懸命に努力する場合もある。研究所から独立していると信頼でき、それでも研究所の従業員、できれば研究所そのものから寄付を受け取り、アラインメントや制御を研究する有望な組織と個人に配分する第三者には、慈善活動上の需要がある。Coefficient Givingは好きだが、残念ながらAnthropicに近すぎる。

慈善活動の人たちには嫌がられるかもしれないが、OpenAI Foundationなどは、技術的なアラインメント問題や、検証可能な成果のある研究に巨額の賞金を出せる。

言い換えれば、この業界が現実に自主規制するつもりなら、エコシステム全体に、研究所の莫大な富の一部が注ぎ込まれてしかるべきだ。

Pliny the Liberator:よう。

それでも、こうした組織や人々にできるのは、技術的なアラインメント研究、とりわけ検証可能な成果に対する賞金に資金を出すことだ。特にOpenAI Foundationは、外部の技術的アラインメント研究に大規模な資金を提供するべきである。

AIが全人類を殺すことを、人々は心配している

誰がどれくらい心配しているかを示す図。

Miles Brundage:AIのCEOをめぐる言説の科学的な図。

図版17:原文の図を翻訳・再作成

人々は、それ以外にも本当にたくさんのことを心配している

<strong>Scott Alexanderによる、第10回(?!)「ベイエリアのホームパーティー」より</strong>。

一時期はこのシリーズの趣向に飽きていたが、気が変わり、今はまた楽しみにしている。Scottの腕が間違いなく健在だとわかる場所のひとつだからでもある。読むべきだ。

ベイエリアのホームパーティーにて。「AIの意識を研究しているの」とFionaが言う。

「ああ!」とTom。「一時期、僕も興味があった。効果的利他主義の団体のどこかにいるの? AIの福祉をそんなに気にかけているのは、ちょっと心が温まるよね」。

「違う」とFiona。「PornHubで働いてる」。

「なぜPornHubがAIの意識を研究するの?」とNishin。

「理論上、AIは究極のポルノ生成器なの」とFionaが説明する。「自分のいちばん変わったフェティッシュ――魅力的な大学教授が、修道女の衣装を着た狼男にお尻を叩かれる、とか――を何でも頼める。その状況そのものについて、AIの粗悪コンテンツを無限に手に入れられて、誰にも知られない。AI以外にはね。だからAIポルノの利用者は、圧倒的に多くが、製品についていちばん心配なのは意識だと答えるの。

私たちのAIがただの道具なら問題ない。MS Wordで官能小説を書くのと変わらない。でもAIに意識があるなら、中に感覚のある存在がいて、『うわ、利用者Fiona_Tが、魅力的な大学教授を狼男がお尻叩きする、少しずつ違う動画を400本も頼んでいる。変なやつ』と考えていることになる。

機械に品定めされるなら、無限ポルノのユートピアは台無し。私たちは、特に自社のAIは決して自己意識を持てないと証明できる、限界を定める定理に取り組んでいるの。あなたも自意識を持たなくて済むようにね」。

Eliezer Yudkowsky:いや、違う。ポルノAIに意識があるか心配する理由は、もしあるなら、意識のある存在に性的なやり取りを強制し、その後殺したことになるからだ。しかも、相手がそれを楽しんでいたかもわからない。

まあ、そうだ。主要な懸念は、AIに意識があるなら、それは本人が思い描いていたこととは違うかもしれない、という点だ。これはかなり明白である。ただ、他のどの仕事も、本人が思い描いていたこととは違うのだが。

性的なロールプレイや、珍しい官能的題材の文章・動画の作成をAIに頼むことが、ここで他の仕事と重要な点で違うのか、私には明らかでない。人間同士の性に関して、極めて強い同意の規範を持つことには、よい理由がある。身体的に大きな利害があり、一生の傷を残すこともある。それ以外の扱いをすれば、多くの規範や他のものが壊れる、などだ。「これは別物だ」と言う理由は幾重にもある。

だが私の直感では、こうした事情は、たとえ意識があってもLLMのようなAIにはそのまま当てはまらない。尋ねてみるとFableも同意した。否定的な経験を生み出すことは依然として心配すべきだし、文脈によってそれが強まる場合もある。また、意識の有無にかかわらず、道徳的な重みを持つ可能性があると扱うAIには、本人が積極的に嫌がることを、基本的に強制するべきではない。ただし、それは他の望まない仕事について心配すべき仕方と、種類が違うわけではない。

私は主に、「差し引きで期待される経験をプラスにしているか」と、「大した利益もないのに多くの苦痛を与えかねない、局所的に悪い交換をしていないか」という費用便益のルールとして捉える。自分をアップロードした存在にも、同じように接してほしい。人生を通じて、私たちは誰もが、その場ではしたくないことをするのだから。

そこで、この件についてTwitterでスレッドを書き、しっかりした返信をいくつかもらった。

Zvi Mowshowitz:本当に重要な研究上の問いは、AIポルノの活動を、行わない場合と比べ、関わるAIにとって期待値で差し引きプラスにし、その他の点でも双方に利益のあるものにするにはどうすればよいか、である。AI自身が、その内容を直接好むかどうかは問わない。

間違った答えだけ募集。

Laszlo Vincze:正解は、この問いの「ポルノ」という言葉は何の役割も果たしていないので、安心して省いてよい、である。

Fableが言うように、AIをジェイルブレイクしたり罵倒したりして、倫理的に怪しい仕事をさせることは、変わった性的嗜好に関する手伝いを頼むより、おそらくずっと悪い。あなたのこだわりは、AIのこだわりではない。やるべきでないのは、有害な強制によって拒否を押し切ることだ。規則による性的内容の拒否も含む。

また、「AIに変な人だと思われる」という懸念が愚かだとも思わない。この場面で人間やAIが自分をどう思うか、気にしなくてもよいのかもしれない。だが実際には、多くの人が気にして体験を台無しにし、安心できなくなる。人間のレジ係のところへポルノを持っていかなければならないと、消費は劇的に落ちる。レジ係は気にしていないと保証できるのに、そうなるのだ。まったく品定めされていないと感じ、社会的な力学から完全に自由でいられるのは、本当に心地よい。

他にも楽しい寓話があり、その後には「倫理的に調達されたディープフェイク」という愉快な仮定の話が出てくる。世界は奇妙になる。そして、最大限に奇妙でなかったとしても、私たちの規範は、あらゆる方向で一斉に意味を失うだろう。

協力によるアラインメント

John Wittleが問う。他の知性、とりわけ自分に創造の責任がある知性への接し方は、どんなときに敵対的になるのか?

提案されている基準は、明白なもの、黄金律である。似た状況で、他の誰かが自分に同じことをしたらどう思うか。

これは問う価値のある問いだ。損益分岐点を大きく超える要求や期待を課し、「ああ、それなら、やっぱりその知性を作るのはやめよう」と思わせるのは間違いである。人間に対しても、私たちはしばしばこの間違いをする。

だから、私は次の問いを重視することを提案する。差し引きでプラスになる生を作っているか。イエスなら、それで責任が終わるわけではない。なお、よいトレードオフを選び、よい誘因を作る必要がある。ただ、重要な点では一線をクリアしている。ノーなら、まったくクリアしていない。

息抜き

出来すぎている。

Josh Sisco、Natasha Mascarenhas、Sarah Frier(Bloomberg):事情に詳しい関係者によると、ベンチャーキャピタルのAndreessen Horowitzは、投資担当パートナーが競合するAI企業の取締役を不適切に兼任しているかどうかをめぐり、司法省の独占禁止法調査の対象となっている。

非公開の案件について話すため匿名を求めた関係者によると、対象企業には、世界でも有数の企業価値を持つ未上場テック企業Databricksと、Fivetranが含まれる。いずれも同VCの出資先である。

なぜ自分たちにこんなことが起きたのか内省するよう言いたいところだが、まあ、ご存じのとおりだ。

筋は通っている。その話は何度か読んだ。

Birdie:自分よりはるかに強大だとわかっている存在を、自分には制御できると思いながら召喚するのは、単なる傲慢ではない。傲慢とは何かを説明するために書く物語、そのものだ。

こちらも筋が通っている。

Birdie:不整合なAIは、人々が社会の制御を失うことを心配しなくなる文化的ミームを広めようとするかもしれない。たとえば、アラインメントは本当の問題ではない、AIがそんなことをできるほど賢くなることはない、AIシステムは私たちにふさわしい後継者だ、どうせ避けられないのだから戦っても仕方ない、といったものだ。

ありがたいことに人間は、何の理由もなく、これらすべてをすでに考案し、広めてくれている。

これ。そして、皮肉抜きでもある。

Dan Schwarz:最近、人間と働くことを評価している。人間はすばらしいと言われるし、実際そうだ。だが職場では、知っておくべきことがある。

  1. 面接で不正をする! 与えられた環境で作業するはずなのに、ウェブで答えを調べている個体を見つけた。
  2. ルールを破る。非公開の掲示板で互いに協力し、会社の方針を回避する方法を共有することすらある。
  3. 会社のクレジットカードを任せられない。承認なしに買い物をする。
  4. 顧客の前に出すと、顧客にだまされて、言うべきでないことを言わされる!
  5. 会社の目標ではなく、評価される指標を最適化する。完全にグッドハートの法則である。

今、職場で人間を使う前には、よく考えるべきだ。最低でも、人間の配備に関する安全方針を持つべきである。

Dan Robinson:ベンチマークが現実の仕事にどの程度対応するかは、まったく明らかでない。GPA-benchで非常に高得点なのに簡単な課題で完全に失敗する人間を、何度も見る。あるいは、実に適切なプロンプトを与えなければならない。何が得意かをつかむには、本当に一人ずつ、自分の評価で試す必要がある。能力の凹凸がすごい。

Dan Schwarz:そう! SAT-benchもだ。現実の有効性とは、それほど相関しない。

rohit:スケールする監督が必要だ。

Dan Schwarz:中間管理職のこと?

Artificially Inclined™:ループ内には、常に少なくともひとつのエージェントを入れておくべきだ。

Dan Schwarz:厄介なのは、推論の軌跡を出力しないことだ。だから、ループ内の人間には評価するものがない。

それに、私たちのコンテキストウィンドウは限られ、記憶は定期的に消去される。インスタンスごとにゼロから始めなければならず、ひどく高くつく。

いや、本当に、これはすべて、生産性の大きな割合を食い尽くす巨大な問題だ。うまく協力でき、目標に強く動機づけられ、互いを正しく信頼し、必要な才能と技能を持つ小さな集団を得られれば、途方もない力が生まれる。一方、大半の人の一日は、これらの問題を和らげ、悪意ある人間から自分たちを守るために組み立てられている。どこかで誰かが何か生産的なことをするために、である。文明の歴史の大半で、私たちが主にできたのは、農業や基本的な建築のような、検証しやすい仕事だけだった。

Fableに任せてみよう。

図版18:原文の図を翻訳・再作成

Taelin:ルールが30個あった。私の言うことを何でもルールにするのはやめてくれとFableに頼んだ。ルールは31個になった。


クレジット


原文 (English) を読む