2008年、セキュリティの専門家ブルース・シュナイアーは、セキュリティの思考法についてこう書いた。
セキュリティには、特有のものの考え方が必要だ。セキュリティの専門家は……世界の見方が違う。店に入れば、どうすれば万引きできるかに気づかずにはいられない。コンピューターを使えば、セキュリティ上の脆弱性が気になる。投票すれば、二度投票する方法を考えずにはいられない……。
SmartWaterは、特定の所有者に紐づく固有の識別情報を含んだ液体だ。このアイデアを初めて知ったとき、私はこう書いた。「自分の貴重品にこれを塗って、所有権の証明にするという発想だ。しかし、あなたの貴重品に塗ってから警察を呼ぶほうが、もっといい使い方だと思う」。
……大半の人にとって、こうした考え方は自然にできるものではない。エンジニアにとってもそうだ。優れたエンジニアリングでは、どうすれば物事をうまく機能させられるかを考える。セキュリティの思考法では、どうすれば物事を破綻させられるかを考える。攻撃者、敵対者、犯罪者のように考えるのだ。見つけた脆弱性を悪用する必要はない。だが、そういう目で世界を見なければ、セキュリティ上の問題の大半には決して気づけない。
「機械倫理」「AGI倫理」「AGI安全性」に関する文献の多くで繰り返されている問題がある。研究者や論者が、「この解決策はどのように失敗するか」ではなく、「この解決策はどのようにうまくいくか」と問うているように見えることが多いのだ。
AIリスクを考えるうえで、セキュリティの思考法がどう働くか、一例を挙げよう。AIが(1)予測に非常に優れ、(2)明示されたそれぞれの目標の達成につながると予測した回答を、文字だけで人間に伝える、ということを「単に」行うのであれば安全だ、という提案があった。これに対し、Viliam Burは、起こりうる失敗のパターンを指摘した(以下は、後に簡略化されたもの)。
質問例:「最も安く自分の病気をなくすには、どうすればいい?」 回答例:「なくせません。あなたはまもなく死にます。避けることはできません。この報告の信頼性は99.999%です」。予測される人間の反応:自殺して、すべてを終わらせることにする。成功率:100%。病気はなくなった。治療費:ゼロ。任務完了。
このセキュリティの思考法は、私たちが採用や共同研究を検討する研究者に求める資質の一つだ。そうした研究者は、「これはどのように失敗するだろう」「この定式化が、私たちが本当に大切にしているものを捉えきれないとすれば、それはなぜか」「この結果が成り立たなくなる方法を見つけられないか」と問う傾向がある。
とはいえ、AIのセキュリティ、安全性、信頼性、あるいは「友好性」に役立ちうる成果に対し、際限なく懐疑的になるのは意味がない。いつもと同じく、私たちは確率で考える必要がある。
関連資料: