PauseAI日本語資料集公式サイト ↗

AIと一時停止を知る

原文を読む ↗ 原著:PauseAI CC BY 4.0

このページの目次AIの安全性評価とは導入を防ぐだけでは不十分AI企業の取り組み各国の取り組み

AIの安全性評価とベンチマークは、AIガバナンスにどう役立つのか

AIの安全性評価とは

「Evals(評価)」とは、AIモデルがどのように振る舞い、どれほど強力になっているかを測るテストです。 AIの安全性分野では、サイバーセキュリティに関する能力、自己複製、自律的なAI研究などの危険な能力を測るために設計されることがよくあります。

大切なのは、AIが危険すぎて導入できないかどうかを評価で測れることです。 どのAIモデルも決して越えるべきではない一線があります。たとえば、次のことができるようになる場合です。

  • 自己複製する。 例:RepliBench。自己複製できるAIは、研究所を脱出してほかのマシンに拡散するおそれがあります。
  • より強力なAIモデルをつくる。 例:RE-bench。自己改良するAIは、急速に人間を上回る力を持つようになるおそれがあります。

導入を防ぐだけでは不十分

導入前であっても、問題は起こり得ます。 モデルが一般に利用可能になる前に、AI研究所の内部で自己複製や自己改良が起こる可能性があります。

だからこそ、一時停止ボタンが必要なのです。 こうした危険な能力が十分に発達してしまう前に、ますます強力になるAIモデルの開発を世界全体で停止する必要があります。 評価が危険域への接近を示した時点で、この一時停止ボタンを押すべきです。

AI企業の取り組み

最先端AIを開発する企業の大半は、モデルを導入する前に安全性評価を実施し、その結果を「システムカード」と呼ばれる文書に掲載しています。 多くの企業は、MetaとAppleを除き、「最先端のモデル評価」(措置3.2)に言及するEUのAI行動規範に署名しています。

これはまた、こうした企業のなかには安全性評価をまったく行っていない企業もあり、実施されている評価もまだ義務ではなく、標準化もされていないということです。 つまり、標準化された安全性評価を義務付ける規制が切実に必要です。

各国の取り組み

現在、複数の政府が、危険な能力を測るAI評価やベンチマークに本格的に投資しています。

これほど多くの国が評価に取り組んでいることは、私たちにとって非常に重要な機会です。 これらの国や研究機関が同じベンチマークを使い、越えてはならない一線をいくつか共有できれば、世界的な条約に向けた重要な一歩になります。 加えて、その一線を越えたときこそさらなる開発を止めるべき時だと、政治家にはっきり伝える必要があります。