AIの安全性評価とベンチマークは、AIガバナンスにどう役立つのか
AIの安全性評価とは
「Evals(評価)」とは、AIモデルがどのように振る舞い、どれほど強力になっているかを測るテストです。 AIの安全性分野では、サイバーセキュリティに関する能力、自己複製、自律的なAI研究などの危険な能力を測るために設計されることがよくあります。
大切なのは、AIが危険すぎて導入できないかどうかを評価で測れることです。 どのAIモデルも決して越えるべきではない一線があります。たとえば、次のことができるようになる場合です。
- 自己複製する。 例:RepliBench。自己複製できるAIは、研究所を脱出してほかのマシンに拡散するおそれがあります。
- より強力なAIモデルをつくる。 例:RE-bench。自己改良するAIは、急速に人間を上回る力を持つようになるおそれがあります。
導入を防ぐだけでは不十分
導入前であっても、問題は起こり得ます。 モデルが一般に利用可能になる前に、AI研究所の内部で自己複製や自己改良が起こる可能性があります。
だからこそ、一時停止ボタンが必要なのです。 こうした危険な能力が十分に発達してしまう前に、ますます強力になるAIモデルの開発を世界全体で停止する必要があります。 評価が危険域への接近を示した時点で、この一時停止ボタンを押すべきです。
AI企業の取り組み
最先端AIを開発する企業の大半は、モデルを導入する前に安全性評価を実施し、その結果を「システムカード」と呼ばれる文書に掲載しています。 多くの企業は、MetaとAppleを除き、「最先端のモデル評価」(措置3.2)に言及するEUのAI行動規範に署名しています。
これはまた、こうした企業のなかには安全性評価をまったく行っていない企業もあり、実施されている評価もまだ義務ではなく、標準化もされていないということです。 つまり、標準化された安全性評価を義務付ける規制が切実に必要です。
各国の取り組み
現在、複数の政府が、危険な能力を測るAI評価やベンチマークに本格的に投資しています。
- 英国のAISIは、Inspectフレームワークを構築し、RepliBenchを開発しました。現在は、評価とアラインメント研究への助成に1,500万ポンドを投じています。
- 欧州委員会は、1,000万ユーロの入札と、Horizonプログラムによる大型助成を開始しようとしています。また、「最先端のモデル評価」を実施する要件(措置3.2)を含む汎用AI行動規範も公表しています。
- 米国のAI行動計画は、評価とハードウェアの管理に言及しています。
- 中国では、Concordia AIと上海AIラボが、多数の評価を盛り込んだ報告書を公表したところです。
- ほかの国の政府も評価に取り組んでいます。
これほど多くの国が評価に取り組んでいることは、私たちにとって非常に重要な機会です。 これらの国や研究機関が同じベンチマークを使い、越えてはならない一線をいくつか共有できれば、世界的な条約に向けた重要な一歩になります。 加えて、その一線を越えたときこそさらなる開発を止めるべき時だと、政治家にはっきり伝える必要があります。