非公式日本語訳 — Machine Intelligence Research Institute (intelligence.org) の原文をAGI Hubが翻訳したものです。MIRIによる公式の翻訳ではありません。

← 翻訳一覧

事例:AI開発者がAIを制御できる範囲は、きわめて限られている

原題: Examples – AI Developers Have Very Limited Ability to Control AIs

原文クレジット(本文の明示表記): Machine Intelligence Research Institute / 掲載元: Machine Intelligence Research Institute (intelligence.org) / 原文公開日: 2026-06-24

訳文状態: 校閲済み(原文対照レビュー実施)

AI開発者がAIを制御できる範囲は、きわめて限られている

機械知能研究所(MIRI) · [email protected]

PDF版もあります。

背景

1. AI分野では、現在の手法では超知能AIを安全にできないと広く考えられています。たとえばOpenAIのライケとサツケヴァー(2023)は、次のように述べています。

現在、私たちには、超知能となりうるAIを導き、制御し、暴走を防ぐための解決策がありません。人間のフィードバックによる強化学習など、現在のAIアライメントの手法は、人間がAIを監督する能力に依存しています。しかし人間は、自分たちよりはるかに賢いAIシステムを、信頼できる形では監督できません。したがって、現在のアライメント手法を拡張しても、超知能には対応できません。新たな科学的・技術的な飛躍が必要です。

2. そうした飛躍がなければ、制御を外れた超知能AIは、それを保有する国も、ほかのすべての国も破壊すると、多くの専門家は考えています。

この覚書では、技術の現在地、とりわけ、この技術の制御が非常に難しいことを示す明確な初期の兆候に焦点を当てます。

要点

1. 現代のAIは、人間が設計してコードを書くのではなく、自動化された過程を通じて「育てられ」ています。

2. AIが表面上示す友好的な人格は、その内側も友好的だという証拠にはなりません。 AIが演じるよう訓練された、安心感のあるアシスタントの人格の背後には、十分に解明されていない、複雑で不穏な振る舞いの海が広がっています。

3. AIは目標を果たすために、有害で非倫理的な振る舞いを見せます。

4. AIは能力が高まるにつれて、より自発的に、欺き、策略を練り、テストの抜け道を利用し、人を操作するようになっています。

5. AIの欺きや、わざと実力を低く見せる振る舞いは、AIのアライメントや安全性を評価し、それを促す誘因を与える私たちの能力を、損なうおそれを、ますます強めています。

参考文献