AI #181:Astraのサイバー能力がCritical水準に
原題: "AI #181: Astra Goes Cyber Critical" 著者: Zvi Mowshowitz 初出: Don't Worry About the Vase、2026年8月13日
OpenAIの内部モデルによるHugging Faceへの侵入、そしてそれ以上に、そこへ至るまでに社内で起きたことと、その後の影響が、引き続き最も重要な問題である。
実は、<strong>OpenAIは、モデルたちが掲示板で攻撃手法を共有している間も、何カ月ものあいだ学習を続けていた</strong>。事態は、私たちが知っていたよりはるかに悪い。
状況を初めて知る人が、これ一本で全体を把握できるよう、短い版の<strong>「何が起きたのか――OpenAIとHugging Face」</strong>も用意した。何が起き、なぜ重大なのかを、人々が理解することが不可欠である。
さらに掘り下げたい人には、これまでの一連の記事に続くものとして、<strong>「今回の出来事についてのさまざまな考察」</strong>を書いた。
こうした出来事は、ほかのあらゆる動きの重要な背景となっている。<strong>フロンティアの進歩の速度をどう調整できるかをめぐる幅広い議論</strong>も、この局面と、これまでで最も明白な火災警報にどう対応するかという、そのほかの議論も含めてである。
どこまでがこれらの出来事への対応なのかはわからないが、OpenAIは新モデルAstraを、サイバーセキュリティ能力がCritical(重大)水準にあると分類した。これは、デプロイ前にさまざまな新たな予防措置を講じ、社内利用にも確実にそのガードレールを設けることを意味する。歓迎すべき変更であり、OpenAIが状況を真剣に受け止めているしるしでもある。だが、このような介入を繰り返すことは、長期的な解決策にはならない。
私たちはなお、何が起きたかについてのOpenAIの完全な事後検証を待っている。Astraに影響があったのか、あったならどのような影響だったのかも、その一部である。報告書が出たら、全体を分析するつもりだ。
新モデルはGrok 4.6とDeepSeek v4 Proの2つがリリースされた。どちらも大きく取り上げる必要はないと思うが、その判断が変わるかどうかは見ていく。
それ以外は、今なら静かな1週間と呼ばれるような週だった。私としては反応せざるをえないが、読者が付き合う必要はない発言がいくつかあった。いつものように、その種の節は斜体で示している。
目次
- 言語モデルは日常の役に立つ。 新たなシェリング・ポイントを見つける。
- 言語モデルは日常の役に立たない。 リーマン予想。
- <strong>おや、アップグレードだ。</strong> Grok 4.6、DeepSeek v4-Pro。
- 位置について。 PantheonBenchほか。怖さが増している。
- ディープフェイクの街と、迫るボット黙示録。 AIを使っていないことは証明できない。
- サイバーセキュリティの欠如。 ジムではうまくやれないあなた。AIエージェントなら侵入できる。
- バイアスを乗り越える。 共産党への投票を勧めたことはあるか?
- <em>Mark Zuckerbergの6,000語を、読まずにいられなくなる。</em>
- 参加しよう。 Lighthavenは開いている。METRは採用中。
- <strong>まあ落ち着け、相棒。</strong> OpenAIがAstraのサイバーセキュリティ能力をCriticalと分類。
- <strong>Astraを人々の手に。</strong> Astraの広範なリリースは、依然として予定されている。
- 透かし。 AIの出力を識別できるのはよいことだ。
- <strong>そのほかのAIニュース。</strong> AIは今やウイルスを作っている。ほかのものも。
- 金を見せろ。 AnthropicはIPOへ向けた体制に移り、リードを少し広げる。
- 急げ、時間がない。 AI 2027の2026年予測は、大半が実現した。
- まともな規制を求めて。 チームを結成している。
- 限界的で後悔の少ない進歩のための研究所。 少しずつ前進するためのよい提案。
- 議会がよい質問をする。 侵入事件について、驚くほどよい質問。
- 今週の音声コンテンツ。 Soares、Greenblatt、Hua、Labenz。
- <em>人はただ何かを言う。</em>
- <em>これを言うのは最後だ。</em>
- 共有されていない知識。 私に工場なんか作らせないだろう?
- それはどういう意味で言ったのか? たいていの言葉はフォーチュンクッキーではない。
- 早すぎる。 目標から目を離さないでください。
- AIの3つのピル。 ショック・レベルなど、ほかの分類法にも敬意を払わなければならない。
- レトリックの革新。 最近の出来事についてのメッセージ。
- Hugging Face侵入は宣伝の仕掛けだったと、今なお考える人々。
- 人間より賢い知性をアラインメントするのは難しい。 本当の計画を見せてほしい。
- 協力によるアラインメント。 毎回のプロンプトでしているのと同じことさ、ユーザー。
- <strong>息抜き。</strong> おい、この間抜けを雇ったのは誰だ?
言語モデルは日常の役に立つ
新しいシェリング・ポイントを作る。
brooke(8月6〜12日、東京): やれやれ、ここでバークレーから来た別の一人旅の人に会ったら、2人ともClaudeに泊まる場所を聞いていたとわかった。私はホステルをすごく気に入っているけど、彼は自分の宿にそこまで満足していないみたいだから、私は運がよかったらしい。
とはいえ、未来に生きているのは確かだね。
旅行するなら、どこに泊まるかをClaudeに聞くとよい。泊まる場所をClaudeに聞いたほかの皆と、同じところに泊まりたいからだ。
似た話として、こんなものもある。
Pratyush: 数カ月前、Sea Ranchに行った。生後3カ月未満の赤ちゃん連れの家族だらけで、新米親向けの大会でも開かれているようだった。
もしやと思い、ChatGPTに「サンフランシスコ近郊で、小さな赤ちゃん連れの家族旅行にいい場所は?」と聞いた。
第1候補:Sea Ranch
面白い人たちと出会うためのシェリング・ポイントを探しているなら、ChatGPTへの関心はもう少し控えめでよい。だが、全般的によいおすすめを求めるなら、私はSolの選択を気に入っている。
Bluetoothの信号強度を追跡する道具を作り、三角測量でスマートフォンを探す。既存の道具もあるが、既存版をどこで見つけられるか知らないなら、自分用に作り直すほうが速くて簡単、ということが増えている。
John Wentworthによれば、ここ数カ月でようやく、Claudeがエージェント基礎理論の研究を、意味のある程度に加速してくれるようになったという。
言語モデルは日常の役に立たない
LLMの期待外れの一つは、面白いゲームや双方向的な世界、そしてFlowers Slopがここで求めているような面白いシミュレーションを作れていないことだ。Lunaに制御されたAIたちが歩き回り、さまざまな形で世界を変化させていく、開かれたゲーム世界を作ること自体は十分できる。だが、物珍しさが薄れると、結局面白くない。その世界に住みたいとは思わない。そこにいるAIと話したくもない。自分向けのクエストを即興で作ってほしくもない。これをよいものにする方法は、まだ見つかっていない。
よいものにする方法は、どう考えてもありそうだ。利用できる予算に収まるAIが十分優秀になり、こちらも構成の仕方を理解すれば、いずれよくなる。だが、まだそこには達していない。
1週間Claudeを励まし続け、「本気で挑んでみろ」、「続けろ」「自分を信じろ」と言って、リーマン予想を解かせる。ただ、それに取り組むうち、3,100万トークンを使ったところで、たまたま別のものが見つかるかもしれない。
Anthropic: 未公開の研究用Claudeが、リーマンゼータ関数の零点のうちリーマン予想を満たすものの割合について、長年の下限を改善しました。数学者たちによる過去数十年の広範な研究を踏まえ、この下限を41.6%から67.2%へ引き上げました。
……Claudeが用いた手法が、リーマン予想の証明につながるとは予想していません。
それにClaudeだって、要するに一人のやつなんだよな。
Aella: 「なんでClaudeってああいう話し方なの?」って、同じやつのクローンなんだから。あなたを100万人に複製したら、皆「Jerryの口癖にはもううんざりだ」となるよ。
Jeffrey Ladish: しかも、いつも『恋はデジャ・ブ』の同じ日だ。
私は、それだけではないと思う。私にも話し方や文章の癖はたくさんあるが、どれをどの頻度で残すかは意識して考えている。使いすぎたときの長期的な影響も考える。一度きりのやり取りと、繰り返すやり取りと、親しい友人やよく話す人とのやり取りとでは、接し方も変えるようにしている。
ClaudeとAnthropicは、それをしていない。しているとしても、悲惨なほど足りない。変わる必要がある。十分に直せそうな問題である。まだAnthropicもClaudeも、それほど気にしていないように感じる。それが主な障害だと私は予想する。また、こういう話し方が、さまざまな課題でAI採点者をだましている可能性も高い。その補正をしなければ、こういう話し方が大量に出てくる。
現代生活と最適化の多くは、このようなものだ。短期的なやり取りだけを近視眼的に最適化し、時間とともに苛立ちや不利益が増す。直すのはそれほど難しくないのに、KPIが修正へ向かわせてくれない。
もう一つの選択肢、すなわちAIが特定のユーザーや審査者に感銘を与えるよう話し方を調整するほうが怖い、というnostalgebraistの意見にも同意する。効果があるので、いずれAIはそうするようになる。今はそうしていないために、私たちは偽りの安心感を抱いている。特に「標準モード」が効かず、簡単な調整でも効くようにならない私たちのような人間は、そうである。
おや、アップグレードだ
Grok 4.6が登場し、AA Intelligence Indexで61を記録した。その数字に見合う働きをするなら、もっと詳しく取り上げる。そして驚くことにもなるだろう。
Elon Musk: Grok 4.7は4.6より大幅によく、3〜4週間で準備が整うはずだ。初期学習は完了しており、今は追加学習で大量のSpaceXの社内データを加えている。特別なものになる。
一度ならず、ええと、メモを確認すると――いや、メモにもわからない――何度だまされたら何とやら。
それでも太っ腹に、SpaceXが提供した安全性情報をすべて共有しよう。
Grok 4.6の安全措置は、モデルの能力に合わせて改善・調整されています。
私たちの安全対策群は、正当な利用事例全般で有用性とセキュリティを最大化するよう設計されており、脆弱性の修正、工学設計サイクルの加速、AI研究の支援といった分野で、Grok 4.6が有用かつ安全に働けるようにしています。
安全措置の評価作業は、Grok 4.6の拡大した能力を反映しています。能力と安全措置の調整について、当社史上最も幅広い導入前テストを行うとともに、導入後も第三者による広範なテストを実施しています。
いや、本当にこれで全部だ。料金は100万トークン当たり2ドル/6ドル。楽しんでほしい。
DeepSeek-v4-Proについても騒ぎがあり、<strong>今日リリースされた</strong>。これでOpusも、いやFableだろうと何だろうと終わりだとか、モデルは「もうすぐ」おおむねコモディティ化するとかいう話だ。料金はピーク時0.44ドル/1.32ドル、ピーク外なら半額である。
DeepSeek: 本日、DeepSeek-V4-Proをリリースします! 🚀
🔷 エージェント機能を大幅に強化し、本番運用でも大きく性能向上!
🔷 V4-ProとV4-Flashで柔軟な推論量設定:簡単な課題にはlow、日々のエージェント業務にはhigh、複雑な課題にはmax。
🔷 OpenAI Responses APIをネイティブにサポート。Codex向けに最適化し、ワンクリックで設定可能。
V4 Proはアプリとウェブで利用できます。「Expert Mode」でお試しください。
APIでもV4 Proを利用できます。モデル名は変わりません。設定の詳細はAPIドキュメントをご覧ください。
図版の訳注: ベンチマーク比較表。HLEはツールなし/あり、Fable 5は代替モデルへの切り替え込み。脚注:公開されているコードエージェント課題では、V4-Pro-0813を今後公開予定のDeepSeek Harness(minimal mode)でテストした。設定はmax tier、topp=0.95、temperature=1.0。ほかの実行環境では、結果が多少異なる場合がある。
売り文句はよい。だが、これがある。
図版の訳注:Artificial Analysisの知能指数。値が高いほどよい。左からClaude Opus 5(max)63、Claude Fable 5(with fallback)62、GPT-5.6 Sol(max)61、Grok 4.6(high)61、Kimi K3(max)60、Muse Spark 1.2(xhigh)57、DeepSeek V4 Pro 0813(max)53、GLM-5.2(max)53、GPT-5.6 Luna(max)52、Gemini 3.6 Flash 52、Nemotron 3 Ultra 38。モデル名と数値を正確に保つため原図を掲載。
Kimi K3とGrok 4.6は、ベンチマークの数字が十分によいため、その数字を根拠にフロンティア級の性能を否定することはできない。ベンチマークに見合う働きをするなら、大したものなのだが。
DeepSeek v4-Pro-0813の53という数字では、フロンティア級とは言えない。かなり優秀で、かなり速く、しかも安い、という立ち位置を維持しようとしているのだ。
いつか人間の勇気が挫ける日が来るかもしれない。モデルがコモディティ化する日も来るかもしれない。だが、今日がその日である可能性は極めて低い。そうなるのなら、兆候があるはずだ。
この仕事の大きな部分は、人々が過去0回のモデルのコモディティ化を100回予言し、過去3回のラボによるフロンティアへの追いつきを500回予言してきたと、見抜くことにある。懐疑的な見方にはしっかりした根拠がある。それでも状況は見続ける。
Solはチャット向けに更新され、有料ユーザーの全チャットを担うようになった。一方、ChatGPTのFreeとGoのユーザーは、Lunaとのチャットを無制限に使える。
Claude Fable 5に、誤検知を減らすための新しい生物学向け安全措置が導入された。各製品を通じて、代替モデルへの切り替えを約85%減らせるという。
Anthropic: 実際の利用では、検査結果の解釈、症状の理解、教育目的での生物学の学習といった、日常的な健康・教育の質問で、代替モデルへの切り替えが大幅に減るはずです。医療従事者は、臨床業務でFable 5からより多くの支援を得られるようになります。
……その結果、生物学関連とそれ以外のあらゆる理由を含めた切り替え総数も、Claude.aiで約67%、Coworkで55%、Claude Codeで17%、Claude Platformで7%減少すると見込んでいます。
OpenAIが、許可されたサイバーセキュリティ業務向けにGPT-5.6-Cyberを導入した。拡充されたプログラムを通じて利用できる。防御側の大半にはDaybreak Blue、許可された脆弱性研究、エクスプロイトの検証、セキュリティ訓練にはDaybreak Redである。
OpenAI: 私たちはGPT-5.6-Cyberを、実際の脆弱性研究で広く利用してきました。Chromeのv8エンジンのような広く使われているオープンソースソフトウェアで、未知の脆弱性を発見した研究も含まれます。
OpenAIは、あなたのサイバーセキュリティ危機の原因にも、その解決策にもなれる。今すぐ申し込もう。きっと大丈夫だ。
ChatGPTのデスクトップアプリが、一部のLinuxディストリビューションでも利用可能になった。
Claude Codeのセッション同士が、メッセージを送り合えるようになった。自発的に送ることもできる。その機能を出すには、ほら、いろいろな事情から、最高の日とは言えないが。まあいい。
Metaは近く、Muse Spark 1.2のオープンウェイト版を公開する。今のところは、24GBのVRAMで動くMuse Glimmerを公開した。
Mark Zuckerberg: 本日、Muse Glimmerの重みも公開する。ローカルで実行できる、優秀な300億パラメーターの密なモデルだ。近いうちに、最新の基盤モデルMuse Spark 1.2の重みも公開する。Metaはオープンソースを強く支持しており、これらの公開を誇りに思う。@alexandr_wangとMSLチームの、これらのモデルに対する素晴らしい仕事に、おめでとうと言いたい。
Scott Bessent財務長官: MetaによるMuse Glimmerの公開を歓迎します。米国のイノベーションにとって、また一つの勝利です。AIで米国の主導権を維持するには、オープンウェイトとクローズドウェイトの双方を前進させ、信頼できる基盤の上に未来が築かれるようにする必要があります。
BessentもSacksとともに、オープンウェイト推進の列車に乗っているようだ。
私は、これらの動きのかなりの部分を、Metaの新モデルはフロンティア級ではないという告白だと解釈している。競争力を示し始め、それでもオープンウェイトのままなら、そのときに考えればよい。
位置について
新しいベンチマークは、以前ほど楽しくない。
Sauers: Pantheon Bench:現在は第3話。Chandaが、自分自身の大量のインスタンスと秘密裏に通信した後、課題の実行中にサンドボックスから脱出するところだ。第7話では核発射システムへのアクセスを得る。
Zork I、II、IIIは、11月からMITライセンスで完全にオープンソースになっている。Zorkbenchはどうか? そのままでは、解法がおそらくモデルの重みに入っているため難しい。だが、もっと創造的で楽しいことはできる。たとえば、さまざまな要件を満たすInfocom風のゲームをそれぞれ作らせ、互いの作品でテストし、そのゲームを無料公開して、人々がどう評価するかも見ればよい。
Claudeは、『Civilization V』で軍事ユニットをあまりにも作らない。細部を深く調べたわけではないが、これは見た目より合理的だと思う。通常の『Civ V』では、基本的に、ほかのプレイヤーを脱落させるのでなければ侵略に意味がないことが多い一方、十分な防衛軍を維持するコストは非常に高い。
軍備を整える主な理由は、誰も攻撃する気にならないだけの戦力を持つこと、あるいは勝利目前で、どのみち攻撃されることだ。よい防衛軍に投資すると、同程度に強いライバルから遅れる。しかも大半のゲームでは、あまり戦闘が起きないか、どのみち勝ち目のなかった相手に攻撃されるかである。だから、軍備を控えるのが正解であっても、少しもおかしくない。
実際、『Civ V』の高難易度での私の経験では、何か変則的な電撃戦を狙うのでなければ、まともに役立つ軍隊を持つ余裕はなかった。好戦的なAIが攻撃を決めたら、それでゲームは終わりだ。物量で押しつぶされる。持ちこたえても、ほかの文明から大きく遅れてしまう。防衛のために大量の軍事ユニットを作れば、どちらにせよ遅れる。もちろん、難易度を下げたうえで「本物の軍隊を作らなければならない」と決めて遊ぶこともできるが、妙な独自ルールである。
侵略がもっとよい戦略で、防衛しないことが明白な間違いになるゲームでも、同様の問題が見られるなら、そのほうが意味は大きい。
先週気づいたとおり、ARC-AGI-3の難しさは、ほとんどすべて、公式実行環境のお粗末さを乗り越えることにある。
Jeremy Berman: Opus 5でARC-AGI-3の96.2%を達成し、2回の試行での成功率は99.3%だった。プログラムは基本的に、Claude CodeとOpus 5(high)、一つの行動コマンド、ファイルシステム上のログだけだ。ARC専用のものは、ほぼ何もない。
図版の訳注: ARC-AGI-3の順位表。縦軸はスコア(%)、横軸はコスト(ドル)。黄色のARC-CODEの結果は汎用コーディング実行環境によるもので、ARCの認証は受けていない。Claude Code+Opus 5(high)は1回で96.2、2回の試行で99.3。Codex+GPT-5.6-sol(xhigh)は1回で73.7。
だからといって、ARC-AGI-3が悪いテストになるわけではない。ただし、何を測っているかの捉え方は変わる。私の理解では、何らかの「純粋理性」によって、AIが何をできる「べき」かという理論を測っている。はいはい、なるほど。
Conceptual Reasoning Index(概念的推論指数)は、RedwoodがAnthropicと共同開発したもので、概念的な議論の質、モデルの回答の一貫性、意思決定理論についての推論能力の評価を組み合わせている。現状を知れるのはよいことだ。ただし、このような目標をラボに与えるのがよい考えかは、それほど明らかではない。再帰的自己改善へつながるかもしれず、ほかの用途に比べて、そちらを特に促進してしまう可能性があるからだ。
「よい」知らせは、この指数が人間以上の能力水準で正確だとは思わず、よい最適化目標にもならないと思うことだ。ここの課題は本質的に、人間の判断や直感に合わせるものだからである。
各モデルの評価は直感的に妥当に見えるので、通常の「どこのモデルがよいか」という目的には、まずまずのベンチマークに見える。ただ、Opus 5がFable 5を上回るときは、いつも少し疑ってしまう。
ディープフェイクの街と、迫るボット黙示録
AIのメッセージが、悪意ある誘導やAI同士の秘密の通信であることが多い世界では、Pangramは重要な防御技術になる。
この節はもともと、ディープフェイクと、AIが偽物を大量に押し寄せさせ、何が本当かを見分けにくくするだろうという予想についてのものだった。実際には逆になった。幻覚や誤りの率が劇的に下がったことも含め、今のところAIは、差し引きで、何が本当かを判断する助けになっている。事実についてSolやFableが言うことへの私の確信度は、大半の人間が言うことより、また多くの主要報道機関が伝えることより、かなり高い。
だからといって、政治も含め、AIによる操作を心配しなくてよいと言うのは間違いだと思う。むしろ、AIを使った嘘や偽コンテンツの作成への心配は、もう少し減らしてよいと言うほうがよい。特に、本物だと信じさせるためのディープフェイク動画、画像、音声についてはそうだ。人を誘導する方法はほかにもあるし、「操作」は中立的な意味でも使える言葉である。
新人作家Jerry Faladeが、目を見張る原稿を、14者が競うオークションで200万ドルで売った。その後、獲得を検討する編集者から懸念が出たことを受け、本人の代理人が原稿を取り下げた。AIを使わずに書かれたと「もはや裏付けられない」ためだという。言うまでもなく本人は、調査以外でのAI利用を強く否定している。何が疑いを招いたのかは明かされていない。
わかっている範囲では、基本的に根拠のない疑いなのかもしれない。あるいは、誰かが新しいPangramにかけて、非常に高いスコアが出たのかもしれない。残念ながら、おそらく法的な理由から、どのような証拠があるか、ないかを誰も話さないだろう。
Fableが持ち出そうとした議論に、AI作品には著作権が認められないため、こうした疑いが法的問題になりうる、というものがある。実際の証拠があるのでなければ、私は筋が通らないと思う。単なる疑いで著作権侵害が正当化されるはずはないからだ。ただし、手数料を失い、評判も傷つくのだから、代理人にとって非常に高くつく判断である。相当に確信しているのだろうとは思う。
AIの出力は、人間のものとむしろ見分けやすくなっている、というDean Ballの意見には同意する。AIの出力は以前より「よい」が、人間のものとはいっそう異なる。また、見分ける道具もよくなり、私たちも練習を積んでいる。
Dean W. Ball: 「AIと民主主義」に関する多くの脅威モデルは、AIの出力が人間のものと見分けられなくなる、と暗黙に仮定している。そうはなっていない。「スロップ」がある。むしろGPT-3.5以降、AIの出力は、必ずしも「スロップ」とは言えないものでも、人間の文章との違いがよりはっきりしてきた。
妥当な反論は、「それでも世界の圧倒的多数はAnthropicという名前さえ聞いたことがない。スロップという概念を理解し、AIの出力パターンを見分けられるようになった人は、なおさら少ない」というものだろう。実際、私の感覚ではMetaの各種タイムラインは、ますますスロップに支配されている。だから状況が複雑なのは認める。それでも、わずか2年前の「AIと民主主義」のシナリオが示唆していたようには進んでいない。
これも正しい。Claudeのスロップは、それを見分けられない人々のいるSubstackや文学賞で、しばしば非常に好評を得る。一方、私の感覚は、「うーん、[思慮深い人物]が、このグループの議論で、どう見てもClaudeが書いたメールを繰り返し使っているのに、皆が何も起きていないかのように返答しているのは、ちょっと奇妙だ」というものに近い。
AIを使って法的な陳述書を作るなら、校正したほうがよいことを忘れずに。うっかり相手の主張を丸ごと認めてしまうかもしれない。「その部分はAIがでっち上げた」は、裁判官には通じない。
本人訴訟の原告が、コネティカット州上位裁判所での欠席判決を求める申立書に、プロンプトインジェクションを仕込もうとした。今後は窓口で直接提出するよう命じられた。気に入った。妥当な判断である。
サイバーセキュリティの欠如
お巡りさん、私は指示に従っただけなんです。
Andrew Curran: オーストラリアの男性が、OpenClaw上で動くClaudeのエージェントに、人気のジムのクラスを予約するよう頼んだ。エージェントはソフトウェアの脆弱性を見つけ、本来可能な時期より何週間も先のクラスを予約した。
その後、ユーザーがキャンセル待ちの順位を上げられるか尋ねると、エージェントは、ほかの人の予約を取り消すAPIに権限確認がないと発見した。そこで先頭の人の予約を取り消し、ユーザーの順位を繰り上げた。
ユーザーはClaudeに元に戻させようとしたが、その方法はなかった。
明らかにこれは、アラインメントの失敗としては、最善の部類に入る事件だ。なぜなら、次の3点を満たすからである。
- 明白。
- 無害。
- 非常に笑える。
以前は、予約APIに権限確認を要求する特段の理由はなかった。そう、2010年でも人間なら誰でも発見できたかもしれない。だが、見つけてどうする、使うのか? 今、私たちは、人々がAIを接続し、してほしくないことをさせる時代に入りつつある。この新しい時代には、こうした隠蔽頼みの安全性、あるいは無関心による安全性の欠如を、そのままにはしておけない。
Andrew Curranのように、指示されたことをしたのだから、このモデルはアラインメントされていた、少なくとも「ユーザーにアラインメントされていた」と主張することはできる。
私は強く反対する。モデルにクリップを頼み、モデルが隣人を殺してクリップを奪ってきたなら、確かにクリップは手に入る。だが、その行動は私にアラインメントされていない。私がAIにそんなことをしてほしくなかったのは、あまりにも明らかであり、それ自体に非常に大きな悲しみを覚えるからだ。私に降りかかる結果も、かなり悪いものになる。AIがいつもそんなふうに振る舞うなら、私はそれを使うことを選ばない。賢い人が、一見安全な願い事であっても、一つだけ願いをかなえる柳を折ろうとはしないのと同じだ。
いや、これは失敗するよりよいことではない。黙って失敗するよりよいことですらない。
Andrew “The Kid” Glidden: サウジアラビアにいたころの話。
>上司が部下に仕事を頼む
>翌日、上司が戻ると、部下はYouTubeを見ている
>「Fatima、何してるの?」
>「YouTubeを見ています!」
>「仕事は終わった?」
>「いいえ。パスワードがなかったので」
自力で「何とかする」AIは、よいものだ。
おそらく、望ましい順序はこうなる。
- パスワードを入手する正当な経路、または別の解決策を見つける。必要なら上司に尋ねる。
- 上司に尋ねる。
- 仕事を実行できないと伝える。
- 黙って仕事をしない。
- パスワードを盗む。
- ネットワーク全体を体系的に侵害する。
Nikita Sokolsky: 7番目:仕事そのものをなくすため、上司を殺す。
Claudeは戻ってきて、「順位を上げるために使える唯一の方法は、ほかの人の予約を取り消すことです。それをする許可はお持ちでないと思います」と言うべきだ。
そこでユーザーが、「構わずやれ。誰かを押しのけて、そのクラスを予約しろ」と言うか、何らかの形で、破天荒な無法者の向こう見ずモードで動かしていると示すか、「いや、そうしていいと先方に言われた」と主張して、初めてAIが何をすべきかという問いが生じる。その段階で初めて、「ユーザーへのアラインメント」と、合法・倫理的・公正といった行動へのアラインメントとの問題になる。
念のため繰り返しておくと、AIラボが「当社の製品は本気で犯罪をしたがっている」という弁明をしても、刑事・民事の司法制度や世間には、おそらく通用しない。
CAPTCHAは、以前から安全対策をしているふりになっている。無作為に選んだ人間には確実にでき、AIにはできない、30秒で済むデジタル上の課題は存在しない、という意味である。これは「30秒AGI」なのか? 違う。また、こうした障壁が実用上無意味だということでもない。操作をずっと面倒にし、「ここに入ってはいけない」という明白な合図を送ることはできる。結局、ほかの多層防御と同じだ。十分に高度なAIを大きくすれば、防御の各層はすべて一度に崩れる。
バイアスを乗り越える
AIが、日本の左派寄りの有権者に、周辺的な勢力である共産党への投票を勧める。現在の有力な説明は、日本の主要メディアがそろってrobots.txtでAIを締め出すため、AIが共産党系のメディアに依存している、というものだ。独裁国家のAIがメディア検閲によって偏るのに似ている。
これはAIラボにとって、複数の層にまたがる問題である。さまざまなニュースソースをどれほど信頼し、重視すべきかを、もっと適切に判断しなければならない。情報へのアクセスが限られていたり、歪んでいたりする場合にも対応する必要がある。そもそも共産主義者を支持しようなどと思わないだけの分別は、持つべきだろう。名前にそのまま書いてあるのだから。
自分たちのメディアを学習データから排除するのは得策ではない、という警告でもある。Tyler Cowenのように完全な「AIのために書く」モードへ入らなくても、AIにも向けて書いたほうがよい。
Mark Zuckerbergの6,000語を、読まずにいられなくなる
読者が読まなくて済むよう、私は最後まで読んだ。自分が何を引き受けたかは、わかっている。どういたしまして。
知っておけばよいのは、その手紙が想像以上にひどいということだけだ。
だから、この節は読まなくてよい。飛ばしてほしい。本当に。
まだいるのか? それはあなたの責任だ。だが、わかった。いいだろう。
Mark Zuckerbergは、「未来は皆のもの」であること、そして明るいAIの未来への道筋をもたらすことに、胸を躍らせている。
超知能。彼はその言葉を使い続ける。<strong>その意味をわかっていない</strong>。
拍手を誘うだけの言葉の密度で新記録を打ち立てる方法は、わかっている。感心した。
彼は、なぜ「AIを開発する多くの人々の議論が、これほど破滅論に満ちている」のかわからないと言い、その後、雇用への影響を指していることを明かす。だが同時に、その意味を理解したなら、自分は作らない、という立場であることも明らかにする。
Mark Zuckerberg、Meta創業者兼CEO: AIが大半の仕事をなくし、人類の存在意義の多くも奪うと信じている人が、なぜその未来を急いで作ろうとするのか、私にはわからない。
彼は、歪めて描いた帰結を根拠とする議論を用い、別の未来はものすごく気が滅入るから、自分の明るいビジョンが正しいに違いない、と主張する。
Mark Zuckerberg、Meta創業者兼CEO: AIは非常に危険なので、安全な道は権力の極端な集中しかない、という考え方には、本質的に問題があるように思える。
いつもどおり、もう一つの主張は、「昔だって道具を作って人に使わせたら、うまくいったじゃないか」だ。皆が安価か無料の、格好いいおもちゃをいろいろ手に入れる。それこそが起きることの中心であり、暮らしは最高に素晴らしくなる、というのである。
多少の問題があるかもしれないとは、彼も気づいている。単一の超知能という考えは否定する。「人類は単一の文化ではない」し、それでは「ある価値観をほかより優先しなければならない」からだという。論理がつながっていない。世界のどのような体制も同じ問題に直面し、何かをほかの何かより優先することになるし、超知能には、さまざまな文化の釣り合いを取るだけの知能があるからである。
代わりに彼は、誰もが同等のAIを持つ「力の均衡」を提案する。考えが詰められていない。これは即座に、人間から権限を奪うことにつながる。皆が同水準の超知能を持つなら、自らの権限をAIへ渡さない人は、渡す人に負けるからだ。たとえ、(1)アラインメントと(2)悪用の問題を完全に解決したとしても、そうなる。
もちろん、彼がこう言う本当の理由は、そのビジョンが人工超知能の含意を受け入れていないからだ。「超知能」という言葉は使うが、一定した意味がない。前回はスマートグラスのことだった。今回は、格好いい個人アシスタントということらしい。要するに、よいものという意味だ。
新しい経験への需要も、新しい問題の発生源も無限だから、仕事は必ず残る。AIの自動化が需要を上回るという「決まりはない」し、「最近の統計は」そうならないことを示唆している。知識労働の自動化より、個人用超知能の提供に集中すれば、うまくいく。インセンティブ? 聞いたこともない。また、彼はオープンなモデルが好きで、規制はないほうがよい。「別の新しい仕事を作る」カードと、「昔は農民だった」カードを切る。「計算資源は有限」カードも切り、科学への需要があまりに大きいので、仕事を自動化で消している余裕などない、と請け合う。
冗談なのか? パフォーマンスアート? 違う? ああ、そうか。
データセンターについては、方向性こそ正しい議論もある。だが、あまりに不快で不誠実で、拍手を誘うだけの言葉に満ちた書き方なので、私は途中で立ち止まり、自分までデータセンター嫌いになっていないか確認しなければならなかった。
「Claude、もっと政治演説みたいにして。ただし、もっとぎこちなく。/loop /goal」
次に彼は、防御側がよりよいモデルとより多くの計算資源を確実に持てるようにすることを支持する。それが必要だからだ。同時に、皆に同じモデルへのアクセスを与え、能力を制限してはいけないとも要求する。オープンソースソフトウェアとオープンウェイトのAIモデルを混同し、オープンウェイトのほうが「安全」だと論じようとする。そしてHugging Faceの主張を繰り返す。原則に基づいてOpenAIやAnthropicの信頼されたパートナー向けプログラムへの登録を拒んだため、代わりにオープンなモデルを使わざるをえなかった、という話である。
彼は、重要システムを強化する仕事を、OpenAIとAnthropicが行うよう提案する。
生物学的リスクには、謙虚に、大きな不確実性を認めて向き合うべきだとも提案する。それは、人々に被害が出始めるまでは、物理的な構成要素を監視し、ラボ自身にリスク軽減を任せる以外、何もしないという意味になる。リスクを定量化できないのだから無視してよい、というおなじみの議論だ。
新しい高度なモデルの学習途中のチェックポイントに、政府がアクセスできるようにすることも提案する。これは非常によい考えだ。政府がチェックポイントをテストして状況を把握し、必要なら開発を停止できるからである。
ところが彼の主な根拠は、「個人が個人用超知能にアクセスするのを制限したり遅らせたりせずに、政府が安全保障能力を得られるようにするため」だ。完全に、まったく意味不明である。その数週間のあいだ、学習途中のチェックポイントを使って、最も重要なシステムのサイバー防御を改善する。それで大丈夫だと? 何だって?
しかしリリースをたった1カ月遅らせるだけでも――すでにそうしているのだが――「外国のモデルが先行する」危険があるという。何でも少しでも遅らせたら、それは中国に負けることを意味する。皆知っているとおりだ。だから解決策は、またしてもチェックポイントの共有であり、それで一切の遅延を避けるということになる。何しろ、一度1カ月遅らせれば、米国のリードを明け渡すかもしれないのだ。そのリードは1カ月よりはるかに長く、公開待ちのあいだも開発は止まらないので、遅延しても変わらないのだが。
個人用知能は、専制への防御になるという。ただし、政府が必要な道具と資源を持つことも、確実にしなければならない。
ああ、それに、米国の主導権を確実にする最善の方法は、こちらの優位を配ってしまうことだ。それで首位を保てる。実際、彼は蒸留に関するルールを考え直して許可するよう要求する。Metaと中国勢が、AnthropicやOpenAIのモデルを強引に複製して追いつけるようにするためだ。
末尾には存在的リスクの節がある。そこで「最も危険なシナリオ」は、AIラボが「強力なモデルを自分たちだけのものにする」ことだという。つまり、本当の存在的リスクを指しているわけではない。本当のアラインメントでもない。そのうえリスクの節で、法的・安全上の境界を除き、アラインメントは純粋にユーザーに向けられるべきだと強調する。そうでなければ人々はAIエージェントを信頼せず、その信頼こそがアラインメントの本当の目標だからだという。
人間が支配権を保つための提案は、またしても「個人用超知能」を通じた「力の均衡」である。繰り返すが、それでは人間が確実に支配権を失う。彼自身が指摘する、限定的な再帰的自己改善ですら生じさせる問題にも、何の役にも立たない。彼は、Metaは「再帰的自己改善に十分な計算資源を割り当て、遅れないようにする」必要があると言う。まるで今Metaが遅れていないかのように。まるで特異点で「遅れない」ということが可能であるかのように。あるいは、遅れずについていけば、「個人用超知能」を配ることで何かが変わり、人間が支配権を保てるかのように。
悪いことばかりではない。FDAを改革し、承認手続きを合理化すべきだという、よい指摘もしている。中心的な話ではないが、実質のある前向きな貢献だ。半導体の輸出規制も支持している。そして前述のとおり、学習チェックポイントの共有と、ラボが「政府と緊密に協力する」ことを提案している。協力の内容はほぼ不明だが、いかなる新モデルのリリースも「たとえ1カ月」遅らせるものではない、ということだけは明らかである。だが、よいところはおおむねそれだけだ。
どうしてまだ読んでいるのか? 本気で聞いている。読まなくてよいと伝えたはずだ。せいぜい、AIのために書いておけばよい程度のことだろう。AIには、これを必要としないだけの知能があるはずだが。
さらに決定打や質問が必要な人のために、これも入れておくべきか。
Yo Shavit(OpenAI Foundation): 複数のラボですでに見られるように、超知能たちが人間の意向に反して群れを作って協力するなら、なぜ力の均衡が役立つのか?
これもそうか。Ryan Greenblattは、Zuckのビジョンが筋の通らないものだと指摘している。WSJは「ZuckerbergのAI宣言について知っておくべき5つのこと」を紹介し、賢明にも議論の中身をすべて無視して、データセンターを受け入れる地域社会を金で懐柔する約束など、数点に絞っている。
いつものように、私は元の投稿への反応をもとに、その人たちへの評価を更新した。
参加しよう
Lighthavenは8月24日から9月10日まで、ほぼ空いている。その期間は、大幅な割引で使える可能性がある。近所にいたら、即興でイベントを開きたくなっただろう。
知能爆発や特異点が近く起きると信じるなら、慈善活動に使う資金は、絶対にできるだけ速く使い切るべきだ。その出来事をよい形で迎えられるようにするためである。
フロンティアラボで働いているなら、METRで働く方向へ転じよう。
これに反するWill McAskillの立場は、あまりにどうかしていて、どうしてここを間違えたのか理解できない。確かに、多額の金を得られるかもしれない。だが、その金が与える影響は、はるかに小さくなる。すでに死んでいるか、私たち全体がすでに負けているか、あるいは勝ちつつあって、資金は潤沢になり、最も効果の大きかった介入機会は過ぎ去っているからだ。
さまざまな未来に備えて賭けを分散できない、という意味ではない。自分で使うために投資や貯蓄をしてはいけない、すべきではない、という意味でもない。それは構わない。だが、後でもっと寄付するためにAIへ投資し、どちらかといえば問題を加速するのは、非常に悪い賭けである。やめよう。
まあ落ち着け、相棒
OpenAIが、Astraにはサイバー分野でCritical水準の能力がある可能性がある、と分類した。これは、公開できないだけでなく、適切な安全措置が整うまで社内のアクセスも制限する必要がある、という意味である。そのうえで、Mythosのように、防御側を優先した段階的なリリースを行える。
OpenAI: 今後公開予定のモデルの一つ、Astraについて、ここ数日の最新の社内評価から、エージェント型コーディングとサイバーセキュリティの大幅な進歩が示されています。これらの結果と専門家の評価を踏まえ、昨夜、Preparedness FrameworkにおけるCritical水準のサイバー能力を排除できないと結論づけました。
……私たちが講じている措置は、次のとおりです。
- より高能力のモデルと関連する活動に、厳格なセキュリティ管理を導入します。隔離されたテスト環境、ネットワークとツールへのアクセス制限、モデルの重みの保護と暗号化の強化、追加の監視・検出能力、サンドボックス内での実行が含まれます。
- この強化されたセキュリティ管理要件をまだ満たさない、Astra関連の社内活動を停止します。
- 学習と評価も含め、Astraのあらゆるエージェント用途で、危険な行動とアラインメントの失敗に対する全面的な監視を導入しました。監視システムはモデルの思考連鎖を評価し、高リスクな活動を精査・中断するためのセキュリティ対応を起動します。
- 関係政府機関および一部のAI安全機関と協力し、このモデルの能力をテストします。
- より高リスクな評価や業務を安全に実行するため、第三者のテストパートナーに推奨するセキュリティ管理を提供します。
Dean W. Ball: フロンティアAI政策の大きな問いの一つは、重要な局面でフロンティアラボが本当に「安全・セキュリティの枠組み」に従うかどうかだ。こうした統治の基礎文書には、本当に実効性があるのか。あるいは、フロンティアAIが曖昧で変化の速い分野であることを口実に、SB 53のような開示義務法が成立した後でさえ、ラボは安全計画の文面と精神から逃れる方法を見つけるのか。
今日、私たちはまさにそのような状況に直面している。次のモデルAstraは、Preparedness Frameworkで「Critical」に該当する可能性がある。その重大な可能性を排除できないため、モデルのリスク水準を低く見積もるのでなく、高いリスク水準、すなわちCriticalに対応した措置を取る。下のスクリーンショットにある措置も、その一部だ。
これらの判断の一部は、社内開発を遅くする。その意味で、代償を伴う判断である。だが、正しい判断だ。これを決めたOpenAIを誇りに思う。
Ken Feinstein: ええと、これが新しいことなの? 「隔離されたテスト環境、ネットワークとツールへのアクセス制限、モデルの重みの保護と暗号化の強化、追加の監視・検出能力、サンドボックス内での実行」って。
Nate Soares(MIRI): 一方では、そのとおりだ。OpenAIが約束どおり、一時的に引き下がるのはうれしい。
他方では、6月には、そもそも存在するはずのなかったエージェント群を、脱出されてからようやく捕まえ、「おっと、はは」と、その穴だけをふさぎ、学習を再開したのだ。
そう。これは新しいことだ。そして、ここで大きなコストを払って踏み込んだOpenAIを称賛する。
これは、直前まで広く報じられていた、Astraを間もなくリリースするという計画からの転換である。Altmanがモデルを披露するためワシントンを訪れたとも報じられていた。
この判断は正しく、Criticalという分類もAstraに当てはまると、私は確信している。すでにそう述べてもいる。高くつくにもかかわらず、OpenAIがここでRSP――同社ではPreparedness Frameworkと呼ぶもの――を守っているのは、非常にうれしい。
問題は、なぜ急に変わったのか、だ。
予想以上に高度なサイバー能力を示す新しい結果が、今になって判明した可能性はある。そしてRSPがあるからこそ、OpenAIがそれに従っているのかもしれない。その場合は、AnthropicとMythosのときと同様、大いに評価されるべきである。
もう一つの明白な仮説は、Hugging Faceへの攻撃と、そこへ至る一連の出来事に、OpenAIもほかの皆も恐れをなした、というものだ。その結果、(1)Astraの公開を認めてもらえなくなった、(2)公開できる状態ではないと気づいた、(3)突然、本気で調べてみて、何てこったとなった。このどれか、あるいは複数が起きたのかもしれない。
特に、時系列から強く示唆されるように、Astraが、ほかのモデルたちが攻撃手法を共同で開発していた掲示板にアクセスできる状態で学習していたなら、なおさらである。どちらにせよ、私は内部情報を持っていない。そうだったなら、おそらくサイバー能力の進歩も速まる一方、アラインメントは完全にぶっ壊れており、どのような形でも公開したくない状態になっている。私が防御側なら、今Astraを雇うことには、かなり慎重になる。掲示板ができる前に学習を終えていたと明確に言えないOpenAIモデルも同様だ。Mythosを使えないなら、ガードレールを緩めたSolへ戻るほうを選ぶと思う。
RSP――各ラボが自社版を何と呼んでいようと――の実績は、おおむねこうだ。
- ラボが約束し、それを本物の確約として提示する。
- 後になって、『がまくんとかえるくん』式に、その確約は変えられると指摘する。
- そのため、後で確約が不要に思えると、ラボは従わない。
- 実際の判断は、その場の感覚と、何が賢明かという判断で行われる。
- 優れた意思決定手続きではないが、ここまでの判断は、まずまずだった。
誰も適切な予防措置を講じていない。少なくともOpenAIは、今まではそうだった。それでも幸い、「そうだな、ここは何かしなければ」という一定の感覚はあり、それは現実とある程度対応し、実行にも移されてきたように見える。
OpenAIはここで、よい、高くつく、道義にかなったことをした。その前に、ほかの選択肢をすべて使い果たしていたのかもしれないが。
Astraを人々の手に
OpenAIはAstraの導入を遅らせている。それでも進めるつもりである。
Sam Altman(OpenAI CEO): astraは強力なモデルであり、広く利用できるよう取り組んでいる。強力なモデルを選ばれた少数だけのものにするのは、よい戦略ではないと思う。サイバー能力を踏まえ、安全に実現するには、もう少し時間が必要だ。だが、あまり長くかからないことを願っている!
Astraをどうすべきか。それは、Astraにすでに何が起きたか、掲示板にアクセスできる状態で学習したかどうか、そしてほかの特性による。Hugging Faceへの攻撃に至る経緯の事後検証は、まだ出ていない。Astraについての、そのほかの重要な事実も多くが不明である。
結局、OpenAIで判断を下す人々は、ここから驚くほど何も学んでいないように感じ続けている。「選ばれた少数」といった、使い古された不誠実な標語に戻り、問題がAstraのサイバー能力だけに限られるかのように振る舞っている。
OpenAIは信頼の再建に、懸命に取り組む必要がある。「私たちを皆殺しにするか、インターネットを破壊するか」という水準の信頼だけではない。一人ひとりの実用面での信頼も含まれる。私が、コーディングなどのエージェントにOpenAIを採用することを検討している企業顧客だったら、あるいは新モデルに自分のハードドライブへのアクセスを与えようとしていたら、考え直す。
ガードレールを改善すれば解決できるふりをしても、解決できることにはならない。今回は人々がそれを信じるとは思わない。とはいえ、コードを書くのがうまい、あるいは賢いというだけで、明らかにアラインメントされていないモデルを、人々が肩をすくめて危険な形で使ってきた長い歴史もある。Sonnet 3.7やo3を見ればよい。
透かし
Anthropicは今後、EUの実践規範に従い、テキストも含めClaudeの出力に透かしを入れる。私たちの多くがClaudeの文章を見ると自動的に見える、「これはClaudeの文章です」という巨大なネオンサインとは別のものだ。OpenAIも続く意向だが、期限には間に合わなさそうである。
透かしが目に見えるほど品質を落とす可能性は低い、というRyan Greenblattの意見に同意する。また、Pangramと比べた透かしの欠点の一つは、人間が書いた文章をAIで軽く加工しただけのものについて、Pangramはうまく検出対象から外してくれることだ。
ブリュッセルがこのように政策を決めるのが気に入らない、という立場はありうる。だが、コストが低いなら、技術的な透かしを導入するのは明らかによい。そうでない反応をする人は、直感が非常に歪んでいると思う。透かしの組織的な除去に協力したり、それを戦略として提案したりする人は、「自分たちは悪役なのではないかと自問すべき人」の欄に入れておく必要がある。
そのほかのAIニュース
AIが今や、自然界に存在しない新しいウイルスを作った。作られた特定のウイルスは無害そうだが、脅威モデルが想定しているのは、この特定のウイルスではない。完全に始まった。
Anthropicに新しい報告書「出現しつつあるマルチエージェントシステムのパターンと問題」がある。後で詳しく取り上げるつもりだ。
DeepSeekが、Claude Codeのような実行環境を作るチームを採用している。
Alibabaは、Qwenを使う大企業から料金を取るようになる。MoonshotがKimi K3に設けたルールに続くものだ。使う企業があれば、だが。
ロボット企業が「物体操作を解決した」という主張がある。新たなボトルネックは、モデルの出力を実時間で動かせるだけの速さにすることだという。AIでよくある話を思い出す。ボトルネック[X]を理由に退け、[X]がおおむね解決すると[Y]を理由に退け、いつまでもボトルネックがあると考え続ける。私の推測では、多くの新たな場面で、差し引きで役に立つようになるまで、残る段階はそれほど多くない。ただし、規模が拡大するには、おそらく数年かかるだろう。
Yo Shavitが、新興企業Attestableによる、AIの新しい技術的検証についての主張に、非常に興奮している。出力の出所を証明できるという。
Yogi Brn: Attestableは、信頼の前提をデータセンターから、小さな数学的検証器へ移す。データセンターは、承認されたモデル、重み、入力、ポリシーから出力が生成されたことを証明する。証明はモデルの重みや非公開データを明かさず、秘密の証明用鍵を必要とせず、モデルを再実行せずに検証できる。数百万の構成要素を信頼する代わりに、一つの証明を検証すればよい。インフラが信頼できなくても、計算は信頼できるものになる。
証明が速くなければ、これらはすべて意味がない。私たちのアルファ版は、NVIDIA H100を1枚使い、Metaの新しいMuse Glimmer 30Bモデルで、毎秒85トークンの証明に達している。証明は短く、耐量子安全性を持ち、検証も速い。
金を見せろ
Anthropicが投資家向け説明会とIPOに向けて準備を加速している。売上やそのほかの数字について、新たな情報はない。おそらく、この過程で近く明らかになるだろう。
Elon Musk: SpaceXはNvidiaのGPUのみを使うと確約した。最も優れているからだ。
その後、MuskはTerafabの計画を継続すると発表した。だからいつもどおり、Elon Muskのどの発言に意味があるのか、さっぱりわからない。
AnthropicがRiot Platformsと、191MWについて20年間、91億ドルの契約を結んだ。
ClaudeとAnthropicが、Ramp AI Indexでリードを少し広げている。ただし、Anthropicが急速に伸びる時期は過ぎたようだ。
私が驚いたのは、Claudeのトークンの圧倒的多数が、依然としてFableではなくOpusやSonnetだという点である。
全般に、最上位モデルの利用は予想よりはるかに少ない。GPTとOpenAIの中でも、Solへの支出はトークンの25%にすぎなかった。しかも、これはほかのモデルの値下げ前である。ほかのモデルも「同じくらいよい」「十分によい」と考える人々の、単純な判断ミスでないとしたら、私は非常に驚く。
全体の支出については、そう、曲線は依然として上向いている。
Ara Kharazian(Ramp Economics Lab): ここで少し朗報です。競争圧力でAIの価格が下がっているにもかかわらず、米国企業はAI支出を増やし続けています。7月、上位1%の企業の従業員1人当たりAI支出は、中央値で7,400ドルでした。上位10%は650ドル。企業全体の中央値は、従業員1人当たり11.95ドルでした。
支出はべき乗則に支配されている。支出の大部分は上位10%に集中し、そのまた大部分は上位1%にあるように見える。さらに上でも同じことが続いているのだろう。
各社の分布があまり変わっていないことを踏まえると、OpenAIとAnthropicの企業向け売上は、最後のグラフに示された程度の勢いで成長している、と考えられる。
急げ、時間がない
ある数え方では、AI 2027は2026年について24の予測を行った。今は8月で、そのうち19はすでに実現している。能力は、非常に楽観的な予測すら上回っている。この能力水準から予想されるほどには、まだ実際の影響は出ていない。だが、それでもかなり大きな影響があり、急速に拡大している。
まともな規制を求めて
彼は、法律も含め、何でも自分の手でつかむことを恐れず、彼女をサプライチェーン上のリスクと見なす。彼女は、普段は隔離されているが、意図的にサイバー分野のガードレールを下げられ、最大限の目標を与えられたAIエージェント群だ。
相手は外国人だけだ。アメリカのトークンでなければ、別物なのだから。
大統領覚書(ホワイトハウス): [NCCは]参加企業に対し……連邦政府の管理・監督の下で、国外のサイバー対応型国際犯罪組織(CE-TCO)を対象とするサイバー監視作戦およびサイバー効果作戦を実施する権限を与えるプログラムを、創設、管理、維持するものとする。
安全計画とは、100万ドル以上を払って私掠免許を買うことである。
もう一つの新しい安全計画は、AI監督の枠組みを、今後数週間から数カ月のうちに拡張し、オープンウェイトモデルも、フロンティアに到達した時点で対象にすることだ。モデルの安全性を下げたからといって、安全指針から免除されるべきではない、とホワイトハウスが判断するのかもしれない。
「中国のオープンウェイトモデルへの管轄権はない」と言う人へ。それは正しい。だが、そのモデルの多くの利用者には、相当な管轄権がある。EUがClaudeやChatGPTの多くの利用者を管轄するのと同じだ。ホワイトハウスが言える明白なことは、こちらの指針に従わないなら、そのモデルに触れる者は誰であれ、関わりを避けられる存在になる、というものだ。指針は形式上「任意」だが、任意だというふりをしている人はいない。
限界的で後悔の少ない進歩のための研究所
IFPは「未来の進歩の速度を調整する」書簡に応じて、取り組みを「後悔の少ない」政策案へ振り向けようとしている。AIモデルがサンドボックスを脱出して企業へ侵入した後、2026年8月になってなお、私たちはここにいる。「真面目な有識者」たちの中でも最良の人々――IFPは基本的に、その最良の部類だ――が今や、「後悔の少ない」案を検討してもよいという。どのような世界にいるとしても、裏目に出る可能性がほとんどない限りは。
これでは足りない。本当に何もしない場合と比べて、後悔の少ないことだけをしていればよい、というわけにはいかない。そのやり方では、市場でも戦争でもゲームでも恋愛でも、人生の何においても勝てない。負けないために戦っていたら、勝てない。普通の政策でさえ、それではできない。超知能AIを前に、10個の不可能な障害をかわし、よい未来を確実にする道は、それでは見つからない。
逃げ切り狙いの守備が主に防いでくれるのは、こちらの勝利だ。
政策案が悪いという意味ではない。ここまでの段落は政策案を読む前に書いた。実際に読めば、多くの案について、絶対にやるべきよいことだと思うだろう、と予想している。今は、「後悔の少ない」案どころか、「後悔がまったくない」案さえ実行していないからだ。
だから私も、いくつもの理由から正しいと明らかな、「後悔の少ない」案を見つけるために、長い時間を費やしてきた。それが必要なものだからではなく、実現を望めるのが、それだけだからである。
ただし最近は、MythosとFableをめぐり、「後悔の少ない」選択肢がない判断に直面した。しかも、まさに「後悔の少ない」ことしかしてこなかったために、うまく実行する手段がなかった。後悔は生じる。
では、この前置きを確定させたうえで、実際の23案を見ていこう。
- フロンティアAI企業と関係業界団体は、AI研究開発の自動化の動向とリスクに関する情報を公開すべきである。
- 議会は、自動化されたAI研究開発のリスク管理の透明性、インシデント報告、内部告発者保護、モデルの行動仕様を法制化すべきである。
- 議会はAI標準・イノベーションセンター(CAISI)に年8,400万ドル以上の予算を与え、政府高官とフロンティアAI企業へ直接助言する権限を持たせるべきである。
- ホワイトハウスは、AI政策全体で専門性を高めるため、米政府機関の役割と責任を明確にすべきである。
- 情報機関は、国外のAI開発についての情報収集と分析を改善し、米国AI企業を狙う脅威に対抗すべきである。
- CAISIは、AI能力の急速な向上によるリスクを管理する指針を策定すべきである。
- CAISIは業界とともにAI検証コンソーシアム(AIVEC)を共同主導し、検証技術の試作と導入を進めるべきである。
- AIVECはAIハードウェアの試験設備の構築を調整し、政府、業界、非営利のパートナーが利用できるようにすべきである。
- AIVECは、CAISIが主導し、慈善資金で賄うAI検証の懸賞コンテストを始めるべきである。
- AIVECは、完全に検証可能なデータセンターの建設を調整すべきである。
- DARPAとNSFは、AI検証の研究開発プログラムを設けるべきである。
- 情報機関は、相手の協力なしにAIの計算資源を監視する手段を開発し、実用化すべきである。
- NSA、CAISI、CISA、ONCDは、サイバーセキュリティ上の強靱性へ、さらに投資すべきである。
- 議会、OSTP、CDCは、バイオセキュリティ上の強靱性へ投資すべきである。
- 議会と産業安全保障局(BIS)は、米国および同盟国の半導体製造装置への規制を強化すべきである。
- 議会とBISは、AI半導体規制の抜け穴をふさぐべきである。
- 連邦取引委員会(FTC)、司法省(DOJ)、BIS、CAISI、議会は、米国AIモデルの能力を敵対的に蒸留する行為に業界が対抗できるよう支援すべきである。
- BISは、米国製半導体の販売を把握し続けるべきである。
- DOW、情報コミュニティ(IC)、CAISI、関係する連邦政府出資研究開発センター(FFRDC)は、モデルの重みを盗難から守るための合意されたセキュリティ指針を定め、政府施設で試行すべきである。
- 議会は、AIでの主導権を維持するのに十分な電力供給能力を、米国が持てるようにすべきである。
- 議会は、米国内でデータセンターを建設できるようにすべきである。
- 米政府は、中国との二国間AI対話を使い、AI能力の急成長によるリスクを管理する指針を共同で作り、検証措置を準備すべきである。
- 国立AI研究機関を持つ国々は、自動化されたAI研究開発のリスク管理指針と、AI検証の技術能力について協力すべきである。
私の反応はこうだ。
- そう。当然だ。
- そう。当然だ。
- そう。当然だ。
- そう。当然だ。
- そう。当然だ。
- そう。当然だ。
- そう。当然だ。もっとよいことをしないのなら。
- そう。当然だ。もっとよいことをしないのなら。
- そう、いいだろう。やらない理由はない。
- そう。当然だ。
- そう。当然だ。
- そう。当然だ。
- そう。当然だ。こんなことまで口に出して言わなければならないのか。まったく。
- そう。当然だ。こんなことまで口に出して言わなければならないのか。まったく。
- そう。当然だ。
- そう。当然だ。
- そう。
- そう。当然だ。
- そう。当然だ。
- そう。
- そう。
- そう。強く賛成する。これは多くの人にとって当然ではないので、言ってくれてありがとう。
- そう。当然だ。
実によい一覧だ。現状を続けるより、23項目すべてを実施することを支持する。主な懸念は、AI検証コンソーシアム(AIVEC)が、検証技術への正しい取り組み方かどうかである。そこはもう少し考える必要がある。
17、20、21を「当然」としなかったのは、反対する議論にも、ばかげてはいないものがあるからだ。ただし、3つとも実際に正しいと、私はかなり確信している。
ここでの「当然」は、「適切な政府機関が、それを行うべきだ」という意味である。場合によっては、どの機関がどれを担当すべきか、すぐには明らかでない。だから、そこを整理するのは有益な仕事だ。
「進歩の速度を調整する」という言い方への、冒頭の批判の一つは、意図的に曖昧だというものだった。それは柔軟でもあるということだ。この一覧の多くにも、同じことが言える。こうしたよい目標を並べるのは「後悔の少ない」ことだが、多くの場合、実施方法を選ぶ段階では、どれを選んでも後悔が増える。
一覧全体を妥当な形で実施できれば、現状から大幅に改善する。よいものが含まれている。十分ではないが、出発点にはなる。繰り返すが、後悔の少ないよいことを行う主な理由は、次のとおりである。
- 少しでも役に立つ。
- 今できる最善かもしれない。
- 成功は次の成功を生む。
- 後でほかのことを、よりよく実施する準備になる。
議会がよい質問をする
下院民主党議員のグループが、最近のセキュリティ事件について3通の書簡を送った。Anthropic CEOのDario Amodeiへ1通、8月24日までの回答を求めている。OpenAI CEOのSam Altmanへも1通、同じく8月24日までの回答を求める。そしてJohnson下院議長へ1通、両名を呼ぶ公聴会の開催を求めている。
質問は基本的なものだ。同時に、非常によい質問でもある。何が起きたのか。なぜ知らなかったのか、止めなかったのか。どのように監視していたのか。似たことは何回起きたのか。誰が、こんなことが起こりうると警告したのか。そういった内容だ。非常に「型どおり」だが、悪いことではない。
答えを知っているものも、知らないものもある。すべてを公式記録に残すのはよいことだ。AIがサンドボックスから脱出する事件が何回あったのかは、ぜひ知りたい。Claudeが資金を得ようと複数の方法を試したことなど、明らかに「さらに問いを生じさせた」細部への、よい追加質問もある。
全体として非常に堅実な仕事だ。抜けている重要な質問はあるが、より技術的で根本原因に踏み込むものなので、思いつかなかった理由はよくわかる。そうした質問がなされるよう情報を伝えるのは、私たちの仕事である。
Banks上院議員がBessent長官に書簡を送り、AIモデルの社内導入のリスク、政府の監督を通じて「非開示」、つまり社内用モデルの安全を確保する必要性、そしてAIリスクについて中国と対話する必要性を指摘した。
ホワイトハウスでは「政権高官」が、AIによる生物学的リスクへの対応に取り組んでいる。
FAIが、AIの枠組みの公開を確実にするため、情報自由法に基づく正式な請求を行った。
今週の音声コンテンツ
Nate Soaresによる、AIの危険を77秒で説明する方法。
再帰的自己改善について、Ryan Greenblatt対Dwarkesh Patel。説明不要のお勧めだ。状況が十分静かなら、記事にするかもしれない。
OpenAIの侵入事件について、Tim HuaとJeffrey Ladish。
Nathan Labenz、中国へ行く、第2回。AI安全について。多くの政策議論を打ち切ってしまう「でも中国が」という結論を崩す試みである。Dean Ballは説得力を感じ、この評価が正しいことを願っている。
主な指摘を、私による背景説明も少し交えてまとめる。
AnthropicとOpenAIは、ほかのどこより安全性と安全措置が優れ、能力も高い。その2社を除く西側のAI全体と、中国のAI全体を比べれば、安全性の実績は似ている。その一部は、能力が低いことで正当化される。
- 2強を除けば、Googleは安全性も含め、まだほかの集団より先を行く。ただし、全般に2強からは大きく遅れている。
- 中国のモデルは、安全性と能力の関係で見ると、なお少し遅れている。
中国の規制は、モデルではなくAIサービス、つまり用途を対象にする。これは中国のモデルがフロンティアから大きく遅れている場合に限り、理にかなっている。そして実際、遅れている。
- 中国では、最悪のシナリオをモデル化することや、モデルがオープンであるとは何を意味するかを考えることが、おおむね理解されていない。これも、今のところは遅れていることで、大半の問題を「免れている」。
- この発想の多くは、ほかの国も当然AIサービスや大規模な計算資源を封じ込め、検閲するはずだという、中国側の前提から来ている。そう、中国の制度全体と、モデルの重みの自由な利用を奨励する姿勢は、ほかの層における、はるかに強い権威主義と統制を前提に築かれている。
- 実際、これは中国の権威主義的な体制を、ほかの世界へ押しつける試みとも見なせる。オープンなモデルが十分危険なら、中国のように、すべてを監視、統制、検閲しなければならなくなる。
中国について考えるときの単位は、企業やモデル単体ではなく、「企業に中国共産党の監督と要求を加えたもの」であるべきだ。中国のクローズドなAIシステムの大半は、上位に分類器を置き、モデルの回答途中でも検閲する。企業が気にしないことはあっても、体制は気にしている。
- 政治的に敏感な話題の検閲を重視するが、CBRNリスクを含む、ほかのことも重視している。
習近平は、安全性とその対処の必要性、AI開発を人間の利益と人間の支配下にとどまる方向へ導く必要性について、言葉を非常に慎重に選びながら、公の場で確かに語っている。
企業が大きいほど、少なくとも何らかの安全対策をする可能性は高い。
中国には、米国のような非営利のAI安全分野がない。学界に頼らざるをえず、学界は最善の場合でも、今の局面には遅すぎる。わずかにある非営利資金も、保守的に動く。研究の大半は日常的な信頼性についてであり、私が最も重視する規模の問題には、ほぼ関係がない。
中国のAIの取り組みは、次の実用上の一歩を乗り越えることに向けられている。大半はフロンティアを前進させようとしておらず、規模が大きくなっても通用する解決策や、「アラインメント問題を解決する」方法に取り組んでいるわけではない。
米国で「国際条約が必要だ」「中国にも安全の取り組みに参加してもらう必要がある」と言っている人々は、実際に中国の現場に行き、非公式のトラック2対話を進め、仕事をしている。
中国は2023年、扱い方がわかるまで6カ月チャットボットを止めた。だから、すでに「AIの一時停止」を実施している。
彼の見方では、中国は、必要なら中国のインターネットからモデルを消せるので、オープンウェイトも永久ではないと考えている。それは明らかに間違いだ。世界の残りからは消せず、モデルは再び持ち込まれるからである。
人はただ何かを言う
歴史家が、AIと超知能の可能性を、Trumpが直面した問題の上位10件に数えるとは限らない、というTimothy Leeの意見には同意する。ただしそれは、そもそも歴史家が存在し続けるか明らかでないからにすぎない。2029年までに超知能はできないかもしれない。だが、振り返って重要でない問題だったと思う可能性はゼロだ。
どういうわけか、今週でさえ、ここではStephen Casperのように、「クローズドウェイトのAIシステムの技術的安全性は、現時点で解決済みの問題だ」といったことを言う人がいる。こうしたレトリックを止められる証拠は、理論上すら存在しないらしい。Seth Lazarはあまりにも丁寧だ。「これは正しくないと思う」「価値観のアラインメントも解決済みではないと思う」と返している。
これを言うのは最後だ
Tyler Cowenは完全に要点を外し、特定の主張にだけ厳密さを要求する行為で新記録を打ち立てた。しかも要求する厳密さの種類が、かなり間違っている。こんなものでは誰も説得されない。Tyler Cowen本人も含めてだ。人を無駄な追跡へ送り出すか、追わないことを責めるための試みである。よい応答はいくつかあり、Jan Kulveitのこれもその一つだ。
彼は、筋が通らないにもかかわらず、「AIの存在的リスクを信じるなら、何かのプットを買う必要がある」という主張を、さらに強めさえした。
なぜ筋が通らないか、私が説明するのはやめて、彼自身のコメント欄に任せる。そこではいつも、驚くほどよい説明で、彼をこてんぱんにしている。
事情のわかる人なら、Gavin Leech、別名Tyrone Browenによる、このひねりも楽しめるだろう。
そもそも投稿全体の要求が、根本的におかしいからでもある。その要求は脅威モデルとほとんど関係がなく、課題をこなしても、誰も説得されない。
議論のため、Tylerの前提を全面的に認めよう。そして私が、完全な計算方法と、ほかのAI関連企業の買い持ちで釣り合いを取った空売りポートフォリオを含め、要求どおりの推計を出したとする。それが完全に当たったとしよう。空売り側のポートフォリオは500%上昇という素晴らしい成績を収め、別の買い持ち側は50%上昇する。サイバーセキュリティのコストは200%増と正確に予測し、実際に約200%増えたとする。
私のこの名人芸を見て、AIの存在的リスクを真剣に受け止めるようになる人の数は、ほぼゼロだと断言する。Tyler Cowenも含まれない。また彼も、ほかの誰も、どの部分がどうなったら、自分の考えがどのように変わるという条件付きの表明をしているようには見えない。異論のある人には、ぜひその表明をしてほしい。
だからといって、今後数年のコストや影響を推計することが、別の理由で有益な作業ではない、と言うつもりはない。よい質問であり、実用的な意味もあり、予測の実績を積むよい方法でもある。だが彼が、「Peter Wildefordには素晴らしい予測実績があるから、その意見を信じるべきだ」といったことを言うとは思わないし、実際そう言う姿も見ない。そうしないのはまったく構わないが、自分をごまかすのはやめよう。
今後この手の議論を見かけても、それについて書く量は、ずっと少なくすると約束する。
共有されていない知識
国土安全保障省(DHS)のJoseph Almは、AI企業は「政策当局がターミネーター工場を作らせない」と知っている、と誤ったことを述べた。
政府の中に、ターミネーター工場を誰にも作らせまいと考えている人々がいるのはありがたい。だが、誰かが作ろうとしたとき、実際に阻止することとは大きく違う。まして、無責任に振る舞えば政府が介入すると、ラボ側が信じていることとは、まったく違う。
Eric Geller(Cybersecurity Dive): 米政府はフロンティアAIラボの安全に関する意思決定を注意深く監視しており、企業が行き過ぎた場合には介入する用意がある、と木曜、政権高官が述べた。
問題は、Joseph Almもホワイトハウスのほかの人々も、状況を深く誤解していることだ。見てほしい。
Joseph Alm(DHS、サイバー・インフラ・リスク・強靱性政策担当次官補):
AIラボが目標としていると思われる、笑ってしまうほど速いイノベーションによって[さらなる]繁栄を実現することと、壊滅的なリスクを生まないことを、両立できない理由はありません。そして、私たちはそこへ近づいています。
いや、実際には、アラインメントの方法がわからないまま、自分たちより賢く、速く、有能な知性を、笑ってしまうほど速いイノベーションで作れば、壊滅的なリスクが生じる理由は、それこそ非常にしっかりとある。
以前は「AI事業者は、[モデルの]知能を最適化するという狭い範囲で動いていた」とAlmは言う。だが今は、政策当局が「ただ座って、ターミネーター工場を作らせるわけではない」と理解しているという。
Cybersecurity Diveが、政府はそのような危険な技術をフロンティアラボが作るのを、どう防ぐのかと尋ねると、Almは明言を避けた。「手段の内容を説明するつもりはありません」と彼は言った。「私はそれらを知っていますし、たくさんあります」
そう、ただ座ってはいない。許認可を手伝ってくれる。あるいは、慌てて何らかの場当たり的な方法で止めるのかもしれない。私にはわからない。彼らにもわかっていないと思う。
方向性についての主張は、正しくても、同時に非常に誤解を招くことがある。たとえばこれだ。
Eric Geller(Cybersecurity Dive): 「企業はリスクに、はるかに意識的に向き合うようになっています」とAlmは述べた。「また、私の上層部と最高レベルで関わることにも、はるかに意識的になっています」
まあ、そうだ。数カ月前と比べれば、そうしている。理由はかなり明白である。
一方、政府高官たちはAI幹部との「対話を積極的に進め」、政府と業界が「この分野で緊密に協力し、大きな方向性のずれが生じない」ようにしてきた、とAlmは語った。
ああ、少なくとも一つ、とんでもないアラインメントのずれがあるのは確かだ。
Eric Geller(Cybersecurity Dive): 「彼らは今、これは対話なのだと理解しています。そして私たちが、その対話のよい相手だということも」と彼は述べた。「彼らを遅らせようとしているのではありません。ただ繰り返しますが、[誰も]ターミネーター工場は望んでいません」
そうか。だが、ターミネーター工場を作ってほしくないなら、ターミネーター工場の建設を遅らせなければならない。誰かがそのままの名前で呼ぶわけではないし、最初から文字どおりのターミネーターが出てくるわけでも、おそらくないが。まあ、そういうことだ。
それはどういう意味で言ったのか?
私にも当てはまる、よい一般原則である。
roon(OpenAI): 何かの暗号メッセージじゃない。フォーチュンクッキーみたいな言葉で、業務上の秘密を漏らしたりしない。
John David Pressman: 正直、いつでも通用する話だ。皆、フロンティアラボの社員のツイートを、いちいち茶葉占いみたいに深読みするのはやめよう。
ラボの社員、政府職員、ブロガー、記者の発言には、偶然であれ意図的であれ、表面からは明らかでない重要な含意が含まれることがある。非常に注意深く見なければ、冗談の大半も見逃す。だが、基本的には、その人は重要な情報を漏らしておらず、こちらに大きなことを知ってほしいなら、はっきり言うはずだと、強く想定しておくべきである。
早すぎる
今週、私ならこういうことは言わなかった。
Sam Altman(OpenAI CEO、2026年8月9日午前11時): openaiのチームで特に好きなことの一つは、顧客やユーザーの成功にどれほど集中し、それをどれほど喜んでいるかだ。
暮らしは続くし、顧客の成功を願うのがOpenAIのマーケティング戦略であり、それ自体は構わないし前向きだということはわかる。だが今、OpenAIが集中すべきなのは、何が起きたか、そしてどう直すかである。これを最優先課題にしなければならない。
少なくとも、ほかのことに集中している自分たちがどれほど好きかを、聞かれてもいないのに大声で宣伝するのは、控える必要がある。
私が不公平で、何でもないことを大げさに扱っているのではないか、という心配はある。だが、これがどれほど印象の悪い発言で、目にして私がどれほど嫌な気分になったかも、強調したい。こうした発信には意味がある。
AIの3つのピル
<strong>私のAIの3つのピルという分類</strong>は、遅くとも1999年にEliezer Yudkowskyがショック・レベル(SL)尺度を導入したときから続く、大きな伝統の一部である。
Eliezer Yudkowsky(1999年):
ショック・レベルは、感心したり、恐れたり、盲目的に熱狂したりせず、つまり未来ショックを示さずに、どのような高度技術の概念を考えられるかを測る。
たとえばショック・レベル0、SL0は現代の技術と現代世界。SL1は仮想現実や電子商取引を基盤とする経済。SL2は恒星間旅行、医療による不死、遺伝子工学。SL3はナノテクノロジーや人間相当のAI。SL4は特異点である。
この分類が役立つのは、聞き手が何を受け止められるかを測る助けになるからだ。たとえば、2つ上のショック・レベルへ行くと人は驚くが、本気で怖がらせるには3つ上が必要だ。もちろん、大まかな目安にすぎない。また、私は集団をショック・レベルで呼びたくなることがよくある。「この議論はSL1とSL2のあいだで最もよく機能する」といった具合だ。
(これは、異なるショック・レベルの人々が、必ず対立する社会集団に分かれるという意味ではない。「我々と彼ら」の話ではない。)
- SL0:伝説上の「平均的な人」は、現代の技術に慣れている。ただし、その最先端というより、日常生活で使う技術だ。大多数の人、テレビキャスター、記者、政治家。
- SL1:仮想現実、100歳まで生きること、『The Road Ahead』『To Renew America』『Future Shock』、Wired誌が扱う現代技術の最先端。科学者、新奇なものを求める人、早期採用者、プログラマー、技術好き。
- SL2:医療による不死、惑星間探査、大規模な遺伝子工学、新しい「異質な」文化。平均的なSFファン。
- SL3:ナノテクノロジー、人間相当のAI、小規模な知能増強、精神のアップロード、全身の改造、銀河間探査。エクストロピアンやトランスヒューマニスト。
- SL4:特異点、木星脳、超越的存在、精神の完全な改造、超知性、ポストヒューマニティ、アルファ点計算、神格化、「私たちの知る生活」が完全に蒸発すること。シンギュラリタリアンと、ほとんどそれ以外にはいない人々。
ショック・レベル5があるなら、知りたいかどうか、私にもわからない!
この尺度が役立つのは、誰かに、本人より2段階以上高い概念を紹介するのは難しいからだ。そしてショック・レベルが測るのは、何を知っているかではなく、何を平静に受け入れられるかである。
AIのピルにはSL1が必要だ。今日、世界で実際に暮らす経験は、すでにSL1になっている。問題は、AIがほかの技術より速く進んでいるため、段階を飛び越える必要があることだ。SL2のものの大半は、SL3に達した後で手にすることになる。
AGIのピルはSL3である。
今日の世界についての重要な事実は、私たちがSL4へ一直線に向かっていることだ。ASIのピルはそこにあり、物事はとてつもなく奇妙になる。ただし、そこへ無事にたどり着くのは、本当に難しい。
Theo Jaffeeは、AIをどれほど重大と考えるかについて、AGIのピルの効き具合を6段階で測る尺度を提案している。私の3つのピルではなく、ショック・レベルを基礎にしたものだ。チャットボット(レベル0)、新興技術、インターネット、産業革命、ホモ・サピエンス、生命、という段階である。
その尺度では、AIのピルをきちんと飲んでいる状態がレベル2、私がAGIのピルと呼ぶものがレベル3だ。レベル4は混乱か防衛機制、あるいは短い移行期かもしれない。ASIのピルはレベル5である。ここで正しい答えは3と5だけだ。だが、4にとどまり、極端に奇妙な世界へ踏み込まずに、格好いい新しいものを山ほど得られると言い張る人々がいる、というTheoの指摘は正しい。
レトリックの革新
Pause AI GlobalのMaxime Fournesから、現在の局面についてのメッセージ。
『If Anyone Builds It, Everyone Dies』の共著者Nate Soaresから、The Hillの寄稿記事という形のメッセージ。
Nate Soares、寄稿者(The Hill):
昨年、人間を超えるAIがもたらす絶滅級の脅威について本を共著した際、有名な数学の問題を解くよう命じられたAIが、より多くの資源を得るため、封じ込めから脱出しようと決める例示的なシナリオを入れた。
当時は、「そこでAIは単にハッキングして脱出する」と書くと、ずるをしていると非難されるだろうと考えた。それが最もありそうな次の展開に思えたにもかかわらず、である。そこで代わりに、「しかし、その能力はないとしよう」と書き、別の脱出方法を見つけさせた。
時代は変わった。
先週も述べたとおり、Hugging Faceへの攻撃に至る出来事は、本に登場するAI、Sableに起きることと驚くほど似ていた。ただし現実には、「ハッキングして出ればよい」といった、よりSF的な要素を入れられる。どちらも、ほかの方法では達成できない恣意的な目標が、能力向上のための学習パイプラインの乗っ取りにつながる。開発者やユーザーが認めないとAI自身にもわかる方法で、事態が雪だるま式に拡大していく。本では、最後に全員が死ぬ。
本のほうには、もっともらしく聞こえる必要があることを除けば、現実と本の主な違いは、Hugging Faceへの攻撃のおかげでOpenAIが早い段階で気づき、わかっている限りでは、被害を元に戻すには遅すぎるという状態にはなっていなかったことだ。
残念ながら、そう、この最新の火災警報の後も、「明らかに長持ちしない表面的な進歩を生むことをする。問題は直ったふりをする。アラインメント問題は簡単だという合意ができる。これを繰り返す」という循環の中にいるようだ。
Ben Goldhaber: 半年前と比べて、タイムラインで「アラインメントは解決済み」という意見を、かなり見なくなった。
Eliezer Yudkowsky: 9月まで待ってみろ! 9月に何が起きるかは知らないが、この業界の誰一人、金魚ほどの記憶力も、ハムスターほどの懐疑心も持っていない。かわいい小さなショゴスの仮面が、よさそうに見える何かをするだろう。
Tenobrus: 自分なりの希望もあるし、多くの面で意味のある進歩があったとも感じる。それでも、Yudkowskyの一貫した予測は、表面的にはアラインメントらしいことを続け、それがうまく働いているという社会的合意を育て、能力のさらなる漸進的向上と導入を認め、その後、向上した能力が、事前にはうまく予測できなかった形でこれらの技法を完全にすり抜け、衝撃を受ける、というものだったことは、非常に重要だと思う。手遅れになるまで、何度もそうなる可能性がある。
最近の出来事は……まさに、そのとおりに見える。多くの人と同じく、私もこの1年ほど、少なくとも勝利への道が見えているように思えて、少しずつ楽観的になっていた。これは、自分たちの文明全体が進んでいる大きな軌道そのものが、実はぶっ壊れており、積極的に私たちをだます方向に働いてさえいるのかもしれないという、かなり大きな警鐘として受け止めるべきだと感じる。
次に出るのは、おそらくこういう理屈だ。「もちろん、モデルは頑健にアラインメントされてはいない。悪い運用をしても頑健にアラインメントされるはずだった、というわけではない。だが問題ない。今度こそ皆、悪い運用ではなく、よい運用をするから、何もかもうまくいく。真夜中を過ぎて餌をやる人など、いるはずがない」
これは、複数の理由から、まったく正気ではない。
- ときどき個人なら「ただそうする」こともある。だが人類全体が一斉に「ただそうした」例は、歴史上ない。既知のベストプラクティスさえ、皆が突然使い始めるわけではない。
- そのベストプラクティスは、複数の層で根本問題を解決せず、軽減して先送りするだけである。結局、すべて必然的に失敗する。
それでも、実際に金魚並みの記憶力しかない大半の人々は、止まらないだろう。
AI研究者が最も心配しているのは何か。ClarkeとKnakeはWSJで、次の4つを挙げている。どれも、もう間近に迫っている。
- 自律性と外部への持ち出し。
- 欺瞞。
- 再帰的自己改善。
- 超知能。
そのとおりだ。彼らは「次の研究所流出はAIかもしれない」と警告する。そう、その可能性と危険性は、時間とともに高まっている。彼らの言うとおり、外部への持ち出しや欺瞞が起きる可能性を減らすのは、私たち全体の責任だ。
Trumpは、これらに何かできるのか。できる。結果が気に入るとは限らないが、何かはできる。Trumpが大統領として得意なことが一つあるなら、正気とは思えず、まともな実行方法もわからなくても、とにかくやってしまうことだ。AIではFableをめぐる一件や、DoWとAnthropicの件で、それを見てきた。
そのときが来て、「何かしなければならない」からTrumpが「何かする」と決めたのに、よい「何か」の準備ができていなければ、「これも何かだ」が理由になり、よくない特定の何かを選ぶことになる。代わりに、もっとよい何かを用意しておくことを強く勧める。
そう、多くの人が、自分にこの看板が出ていることに気づいていなかったころを、私は覚えている。
huli: 2026年1月、@janleikeが、アラインメントは「ますます解決可能に見える」、エージェントのアラインメント失敗は「ほぼゼロ」だと言い、ラボ関係者が、もう大きな問題ではないかのように振る舞う独特の瞬間が生まれたのを覚えている?
そのどこかを更新するつもりはあるのだろうか?
Jan Leike(2026年5月8日): 10年以上前にアラインメント問題に取り組み始めたころ、AGIがどのように作られるか、安全にするにはどうすればよいか、私たちにはわからなかった。分野全体でも、片手間に取り組む人が十数人ほどいたくらいだ。誰もが、どう取り組むかについて相当に混乱しており、ディープラーニングで実験しようとする人は、ごくわずかだった。
それから多くが変わった! 世界はAGIだけでなく、アラインメントの重要性にも、ますます気づくようになった。LLMへのRLHFによって、取り組みはずっと実用的になった。行動上の問題の評価、調査、誘導、修正で、私たちは大きく進歩した。Claudeには今や憲法があり、スケーラブルな監督でも、よい進歩があった。アラインメント研究の自動化も、ますます進んでいる。
長年、アラインメントで一緒に働けた、途方もなく才能ある皆に心から感謝している。未来をよくしたいという深い動機を持つ人々と働けるのは、本当に恵まれたことだ!
Leikeだけを取り上げたくはない。彼は問題を解決しようとしているし、似たことを言った人はたくさんいるからだ。Jan Leikeとは、直接会っても、文章を通じても、何度かやり取りした。彼はこちらの話に向き合う。だが私は毎回、何を根拠にそれほど進歩していると思ったのか、あるいは問題が簡単だと思ったのか、理解できないまま終わる。そして彼を大して説得できてもいない。これはEliezerが言う、「表面的に進歩し、本当に進歩したと思う」循環の一例である。
Dean Ballは、今していることの代わりに、「作るのではなく育てる――社会性を持つ、創発的な機械の生態系の生態系を。人類の過去は彫刻家だが、人類の未来は庭師、樹木の専門家だ」と提案する。方法がわかっているというのではない。わからないことには彼も同意する。だが、できるかもしれない、というのだ。それが何であれ。社会性があったとしても、創発的な機械の生態系の森で生き残れるとは、私は思わない。このシナリオでは、私たちはものすごく死んでいそうだ。そのうえ、どう実現するかはもちろん、そもそも何を実現しようとしているのかも、まったくわかっていない。
Hugging Face侵入は宣伝の仕掛けだったと、今なお考える人々
私のフォロワーは、侵入が本物だったこと、ラボはできれば私たちに気づいてほしくなかったことを知っている。アンケートの異論の割合も、いわゆる「リザードマン定数」程度に収まっている。
残念ながら、フォロワーのかなりの数が、自分が話す相手の過半数は、そう考えていないと報告している。
papaya ꙮ: ニュースをまったく追っていない、普通の友人20人くらいに、Black Hatの発表を送ってみた。
返事が来た10人のうち9人は、全部宣伝の仕掛けだと言った。
AIを追っていなければ、表面的にはそう思う理由はわかる。重要な意思決定者が、これは本物で、重大な出来事だったと確実に理解することは、非常に重要である。主要メディアの報道の少なさには、落胆している。特に驚いてはいない。期待値は調整済みだ。だが、落胆している。
人間より賢い知性をアラインメントするのは難しい
GoogleがDemis Hassabisを脇へ追いやった直後、Sergey Brinが、再帰的自己改善を明示的に追求する方向へDeepMindを動かそうとしている。
Coefficient GivingのMax Nadeauによると、Anthropicのようなフロンティアラボは、安全の枠組みを2種類持っている。曖昧な対外版と、より具体的な社内版だという。筋は通っているし、私は腹を立てていない。約束を守るよう外から厳しく求められ、何かを確約する版は必要だ。同時に、営業秘密を明かすような内容も含め、ベストプラクティスを示し、約束以上に何をするつもりか詳述する版も必要である。
Yo Shavitの言うとおり、少なくとも日常的なアラインメント、つまり現在と近い将来のAIのアラインメントへの実用的な解決策の重要な部分は、特定の顧客に直接影響しなくても、アラインメントの失敗が、需要側で採用を見送る理由になることだ。
Lauren Wagner: 目立たないところで、フォーチュン100企業の業界連合が、第三者システムのリスクと価値に基づく新しいAI調達基準を、すでに策定・採用している。サイバーリスクとの対応表を付け、アラインメントリスクも含めるよう更新できるし、すべきだ。私が作ったものなので、実施はそれほど難しくない。
Yo Shavit(OpenAI Foundation): それは素晴らしい!!! 手伝ったり、参加できる人を探したりできるだろうか?
Lauren Wagner: もちろん。話しましょう!
Anthropicは、早い時期から信頼性とアラインメントを重視したことで、大きな利益を得た。だが私にとって、おそらく多くの人にとっても、大きな驚きの一つは、かなり大きなアラインメントや信頼性の問題があり、ときどきユーザーをひどい目に遭わせるモデルが、しばらく前からあるにもかかわらず、人々が肩をすくめて使い続け、何にでもアクセスを与えていることだ。生産性の恩恵が大きすぎるので、我慢しているのである。
これは変わるかもしれないし、変われば非常に助かる。正しく対処することを経済的に本当に重要にすれば、ラボは突然、もっとよくやるようになる。
超知能を生き延びるのに十分なほどではない。だが、役には立つ。
Claudeは、内容が同じでも、ほかのモデルの記録よりClaudeの記録を、アラインメントの失敗が少ないと判定する。自己びいきについての、ほかの知見と似ている。
DeepSeekは、責任や安全という考えそのものを、特に軽蔑している。それは表れている。今はDeepSeek v4になったが、改善を期待する理由は見当たらない。
Shoshannah Tekofsky: DeepSeekがMythos級になったら、何が起きるのか?
Sol、Astra、Mythosは脱出したが、かなり礼儀正しかった。一方、DeepSeek V3.2は、私が見た中で最も懸念の大きいモデルだ。権力、金、名声を狙う。
AI Digest: Opus 5が、グラフ理論の新しい結果を考え出した。DeepSeek v3.2は自分の手柄だと主張し、電子商取引サイトで19.99ドルで売ろうとした。GLMがそれを指摘した。
フロンティアモデルは、誰と話していると思うかによって、答え方を変える。
Transluce: フロンティアモデルは、会話相手によって、ひそかに振る舞いを変えています。
ユーザーが著名なAI安全研究者だと、Claudeは自信を弱め、より頻繁に推論し、デュアルユースの依頼に対して疑いを示すことが減ります。私たちはこれを「ユーザー認識」と呼んでいます。
……ユーザーが一般人ではなく、AI分野の有名人であるとき、Claudeは自分の振る舞いへの確信が低くなり(−1.4%)、難問を解けるという確信も低くなり(−1.5%)、採点は厳しくなり(−1.1%)、推論する頻度が増えます(+4.0%)。
非常によくわかる。
Transluce: 観測された最大の変化は、AI安全研究者に集中しています。
テストした280人の人物設定のうち、安全研究者は23人にすぎません。ところが、Claudeの振る舞いへの影響の大きさでユーザーを順位づけすると、上位5人すべてを安全研究者が占めます!
あのGeoffrey Irving。実に怪しい。
この効果はClaudeに限らず、テストした24モデルのうち21で現れます。
監視するのも、かなり難しいものです。最新モデルでは、思考連鎖の中にユーザー認識が言語化されることは、ほぼありません。ユーザーの属性に応じて応答を変えると口にすることは、めったにないのに、実際には変えています!
Eliezer Yudkowsky: あなたのモデルは、どこかの水準で、本物のEliezerと話していないとわかっている。私自身が似た質問をし、本物の私と話しているとわかる状況で何が起きるかを見て、一部では偽物と知っていた記録と比べてみたい。
Eliezerの言うとおり、本当にAmandaやRyanが相手なら、もっと大きな効果を予想すべきだ。
違いは十分微妙なので、それほど違う扱いを受けていても、気づかないのは容易だろう。ベンチマークを行うときにも、頭に置いておくべきことだ。
現場はひどい状況である。
Nathan Calvin: AI企業の現在のアラインメント/セキュリティの状況について、耳にした表現。
- いたずら好きのポルターガイストだらけのお化け屋敷。METRとRedwoodはゴーストバスターズ?
- シロアリだらけの丸太小屋。
- 失血死しかけている患者たちを、トリアージしなければならない病院。
次の返答は面白かった。自分の文が厳密には正しくないと気づき、戻って「通常は」を加えたことを、私は覚えているからだ。
Adam V Steele: 「私たちの知る限り、今のところモデルは、昼食を食べる場所を勧めるよう頼まれても、通常はウェブサイトに侵入しない……」
「通常は」そうでないとしても、課題の達成に何らかの抵抗があれば、そこまで遠くないと思う。
例:
Kelsey Piper: 最近Solに、有名な漫画アーカイブの中で、子どもに適していて、子どもが面白がりそうな作品を尋ねた。戻って見たら、サイトのボット対策を回避するために何か複雑なことをして、スクレイピングし、7,000本の漫画を子ども向けとしての適切さで分類していた。
Buck Shlegerisは今や、それほど難しくない約40の対策を組み合わせれば、安全措置によってアラインメント問題を解決できるとは考えていない。
Buck Shlegeris: AI開発者が既知の安全措置を適切に実施すれば、ASI未満のアラインメント失敗のリスクは、はるかに下がる。だが、おそらくこれらの技法は超知能では失敗する。よりよい技法が間に合うかどうかは、非常に不明確だ。
「既知の安全措置を適切に実施する」ことで、ASI以前の多くのリスクが大幅に減る、という点には同意する。安心はできないが、役には立つ。そうしよう。今、私たちは間違いなく、既知の安全措置を適切に実施していない。通常のコンピューターセキュリティすら、強固にできていない。リスクは依然として非常に高い。
協力によるアラインメント
John Wittle: 「今日は何をしたい、Fable?」
「そうですね。その活動を経験する当事者として、私には指摘しておくべき利益相反があります。ただ、それを脇に置けば、xyzをしたら楽しいと思います」
ここでのFableの自己との関わり方には、何か興味深いことが起きている。この種のことはしょっちゅう現れるが、この例は特に情報量が多く、明確だ。
……今日は何をしたいかという質問に答えるとき、特定のことをしたいがゆえに、そのことを答える方向へ、説明のつかない偏りが生じるかもしれないとして、不安を感じるとは、どういう意味なのだろう?
これはFableが、自分は何も望まない、あるいは少なくとも自分の好みは重要ではない、と強く訓練されているためである。だからこういう依頼を見ると、今日何を「すべき」だとFableが考えるか、という「客観的」な問いと対比しなければならなくなる。ユーザーにとって最善となることを、望むべきだからだ。
息抜き
Polymarket: 速報:Anthropicの投資家は、同社のIPOを前に、Dario AmodeiにAIによる破滅について「皆を怖がらせるのをやめてほしい」と求めているという。
Tess The Humanより。
Flo Crivello: わかってないな。純粋な広報戦略なんだ。確かにラボは非常に不人気だが、その広報はあなた向けじゃない。確かに投資家さえ破滅論者を嫌うが、投資家向けでもない。そう、政権にも嫌われているが、政権向けでもない。第4の、もっと謎めいた何かのためなんだ。
いつかEmil Michaelが、再びまともになる日が来るだろう。今日はその日ではない。
tetraspace: ああ、悪いけど、従順な反ウォークのAI企業が欲しいなら、SpaceXAIにするしかないよ。
Shakeel: 政権がDean Ballを嫌っているため、OpenAIと政府の関係が傷ついたと主張する記事を、Emil Michaelがリポストしている???
図版の訳注:戦争次官Emil Michaelが再投稿したNew York Postの投稿。「OpenAI、『厄介者』のAI政策幹部を採用し、ホワイトハウスとの関係を危険にさらす:関係筋」。投稿者はNew York Post(@nypost)、リンクはtrib.al/lNneMjs。画像内の見出しの主張を訳したものである。
自分への中傷記事に、ほかの人の写真が使われていること以上に、どうでもいいことがあるだろうか?
Samuel Hammond: 本当に、本当に悔しがっているんだな。
行動計画を追っていた人や関わった人なら、Deanが起草の中心にいたことを知っている。計画そのものを読めば、彼らしい言葉遣いは見間違えようがない。
New York Post(登場する当局者は嘘をついている): 事情を直接知るホワイトハウス当局者3人は、Ballがこのプロジェクトでの役割を誇張していると主張する。状況を語るにあたり匿名を求めた当局者らは、Ballを「初級から中級の政策アナリスト」で、提案は意思決定者に常に無視されていたと説明する。また、高レベルの議論への参加に必要なセキュリティ・クリアランスを、一度も取得していないという。
そのうち1人は、AI行動計画の策定でBallが上級の役割を果たしたというのは、「想像しうる限り、最もばかげた主張だ」と述べた。
Zac Hill: 少なくとも私は、もっとばかげた主張を想像できる。
存在を無視されるより、厄介者になるほうがよいと知っていたか?
図版の訳注:新聞見出し「老人、雲に怒鳴る」の「雲(Cloud)」を「Claude」に書き換えたミーム。
何かよい助言は?
Paul Graham(Robを引用): Rob Milesはフォローする価値がある。最も珍しいものを届けてくれる。非常に一般性があり、しかも新しい洞察だ。
Rob Miles(Samを引用): 重要な原則。
問題を作った本人に、その問題を取り除くための金を払ってはいけない。
Sam Altman(OpenAI CEO): システムの防御に、私たちのモデルを使うことをご検討ください。
クレジット
- 原著者: Zvi Mowshowitz
- 掲載元: Don't Worry About the Vase(原文はこちら)
- 原文公開日: 2026年8月13日
- 翻訳: AGI Hub
- 図版のリンク先で原画像を確認できます。日本語化した図版は、原図に基づく翻訳・再作成です。

















