WIKI CONCEPTスコア 0

場当たり的細工によるアラインメント理論

Ad-hoc hack (alignment theory)

この日本語訳は、表示本文の全体がYudkowskyまたはSoaresに帰属すると確認できたページだけを対象にしています。

「場当たり的細工」とは、AIのアルゴリズムを変更したり パッチを当てたり することをいう。その対象は、通常なら単純で原理的な、あるいは厳密に定められた構造を持つはずの事柄や、その部分には何らかの単純な答えがあるはずだと思われる事柄である。たとえば、フォン・ノイマン=モルゲンシュテルン整合的な効用関数を定義する代わりに、 ほぼ VNM効用関数でありながら、火曜日にしか発動しない特殊ケースを3行目に持つものを導入して問題を解こうとする。このようなものは、 反省的整合性や、効用関数の整合性または単純性に依存する他のあらゆる事柄を壊す可能性がことさらに高いと思われる。同様の理由から、 高度なエージェント の設計では、 暗号技術 や 宇宙探査機の設計で避けられるのと同じく、可能な限りこのような細工を避けるべきである。それでも、望む振る舞いを生むように見える奇妙な細工を探すことは、興味深く生産的かもしれない。少なくとも、望む振る舞いを生むシステムを一つ理解できるからである。そのような形で 実際にAGIを構築する のは賢明でないとしても、奇妙な細工が、後にもっと単純で整合的なシステムを見つける着想を与えるかもしれない。ただし、その細工には強い疑いも向け、失敗する仕方や奇妙な副作用を生む仕方を探すべきである。

生産的で奇妙な細工の一例は、 Benya_Fallensteinが提案した、 タイリング・エージェントのためのパラメトリック多相性である。そのような形で本物のAGIを構築したくはないが、何が 実現可能である か、すなわち奇妙な経路であっても、タイリング・エージェントの中でどの性質を確実に同時に得られるかを示すうえで役立った。これは後に、比較的細工の少ない提案を着想する助けにもなった。

Wiki専用概念

このページにはLessWrong上の関連投稿一覧がありません。