WIKI CONCEPTスコア 2

制限されたAGI

Limited AGI

この日本語訳は、表示本文の全体がYudkowskyまたはSoaresに帰属すると確認できたページだけを対象にしています。

タスクAGIが自律AGIより安全になりうる理由の一つは、タスクAGIが限られた範囲の活動だけを実行すればよいため、そのタスクを実行するために限られた物質的・認知的能力だけを必要とするかもしれないことである。非敵対的原則は依然として適用されるが、「探索が正しい答えを返すよう保証せよ」ではなく「その探索を実行するな」という形を取る。

障害

• 自らの物質的・認知的な有効性を高めることは、あらゆる場所で道具的に収束するため、おそらく至る所で回避しなければならない。

• 特定領域の能力は、より一般的なアーキテクチャから導けることが多いため、優れた制限案は見かけほど容易ではない。人工汎用知能は、手作りの「自動車について考える」モジュールと「飛行機について考える」モジュールを持つわけではないので、二つのモジュールを異なる能力水準でただ手作りすることはできない。

たとえばAGIの野心を「制限」するために「衝動」や「感情」を選択的に取り除ける、と多くの人が示唆してきた。おそらく、これらの人々は標準的な期待効用エージェントのモデルとは異なる心的モデルを使っている。どの種類の制限が容易かを知るには、どの種類のシステム能力が自然な継ぎ目に沿って切り分けられるか理解できるほど、AGIの下位過程について十分に優れた背景像が必要である。

穏健な最適化という研究経路は、一種の非常に一般的な制限を追求するものと見なせる。

行動主義は、許可リストにない詳細さでほかの心をモデル化するAGIの能力を制限するよう求める。

タスク性は、内部組織のあらゆる水準で、限られた量のことだけを望む、または試みるようAIへ求めるという意味で、アラインメントと制限の混成と見なせる。

低影響は、成功した影響ペナルティが、より大規模な計画を実行することをAIに望ませないという意味で、アラインメントと制限の混成と見なせる。

制限は、一般的なエージェントが、不完全にアラインされた一般的な下位エージェントへ組み込みたいと望む種類の予防策に思えるため、修正可能性の難問の、さらに別の下位問題と見なせる。

制限は、非敵対的原則と最小性原則の両方によって動機づけられると見なせる。

Wiki専用概念

このページにはLessWrong上の関連投稿一覧がありません。