ジョナ・シニックとの共著。
AIの研究分野は、どれほど大きいのでしょうか。過去には、どれほどの規模だったのでしょうか。
この問いは、AGIの安全性に関する戦略のいくつもの論点に関わります。例を2つだけ挙げましょう。
- AIの予測。研究の各暦年にどれほどの成果があったかを見て、AIの進歩を予測する人もいます。しかし、AIの進歩への投入量としては、暦年よりも、(1)AI研究資金、(2)質で調整した研究者・年(QARY)、(3)計算能力のほうが重要です。ほかの分野から取り入れる理論的進歩、たとえば統計学の手法も、重要な投入量の指標です。これらの指標から今後のAIの進歩を予測するには、これまでに観察されたAIの進歩を生み出すのに、過去の各時点で何ドル、何QARY、何回の計算サイクルが必要だったかを知る必要があります。
- 影響を及ぼしやすい要所。AIの研究資金の大半が比較的少数の資金提供者から来ているなら、あるいは研究の大半が比較的少数の研究グループから生まれているなら、そこが、分野全体に影響を与えるうえで価値の高い要所かもしれません。たとえば、AIが社会にもたらす長期的な影響に、もっと関心を向けてもらうための要所です。
こうした理由などから、MIRIは最近、AI分野の現在の規模と過去の成長を調査しました。この記事では、その初期調査の結果をまとめます。将来、このテーマをもっと徹底して調べるための、手早く作った粗い出発点を用意することが狙いです。
まず、以下のような指標を使って、分野の規模と過去の成長を数値化しようとしました。
- 研究者数
- 学術誌数
- 出版物数
- 会議数
- 組織数
- AI研究に授与された著名な賞
- 資金額
これらの数値を解釈するのは難しく、研究そのものの内容を調べるほうが、はるかに多くを学べるかもしれません。それでも数値には一定の意味があります。
- 成長を調べるには、統計の前年比の増加率を見て、AIの進歩量を示すほかの尺度と組み合わせ、中期的な将来にどれほどのAI研究が行われるかを見積もれます。
- AI分野の現在の規模を調べるには、対応する計算機科学(CS)の指標に対する比率で、定量的な指標を見られます。それをCS分野全体の現在の規模感と組み合わせれば、AIでどれほどの進歩があったかという全体的な感覚を形作る材料になります。ここでは次の点も押さえておくとよいでしょう。ある情報源Sから、AIに関する量Q1の推定値E1と、CSに関する量Q2の推定値E2を得られるとします。E1とE2は、それぞれQ1とQ2を過大評価、または過小評価しているかもしれません。E1、E2がQ1、Q2と何倍違うかを、それぞれF1、F2とします。F1とF2にはよい推定値がありません。しかし、比率1(E1)/(E2)を計算すると、[(Q1)/(Q2)]*[(F1)/(F2)]が得られます。(F1)/(F2)は、F1そのものより1に近くなります。E1をQ1からある程度ずらす要因の一部は、E2もQ2から同じくらいずらすからです。そのため、(E1)/(E2)の(Q1)/(Q2)に対する相対的なずれは、E1のQ1に対する相対的なずれより小さくなります。
集められたデータから、CS分野に対するAI分野の相対的な規模について、ある程度の姿は見えてきました。しかし、確かな結論を支えるには不十分で、さらに調査する必要があります。特に断りのないかぎり、この記事の基となる生データは、スプレッドシート「AI分野の現在の規模と過去の成長」を参照してください。
AI分野の規模
さまざまな指標によると、実施されているAI研究の量は、計算機科学(CS)研究の量のおよそ10%のようです。ただし、使った指標の大半が捉えるのは、研究の 質 ではなく 量 です。したがって、投入されたQARYを測る代理指標としては、弱いかもしれません。とはいえ、CS研究に対する賞のおよそ10%がAI研究に授与されていることは、CSとAIで研究の質が同程度であることを示すのかもしれません。
関連する数値の多くは、Microsoft Academic Search(MAS)から得ました。MASでは、次の分類で検索できます。
- 計算機科学
- 人工知能
- 自然言語と音声
- 機械学習とパターン認識
- コンピュータービジョン
後ろの3分野をAIに含めるかによって、数値は変わります。以下では、この3つを「近縁分野」と呼びます。「人工知能」の分類だけに該当する項目と、「人工知能」または 近縁分野のいずれかに該当する項目の、両方の数値を示します。
研究者数
MASには、CS、AI、AIの近縁分野の著者数が示されていますが、この数値は出版物数ほどには研究量を捉えません。MASの著者数はCSが160万人、AIが26万人なので、比率は16%です。AIと近縁分野に記載された著者数を合計すると39%になります。ただし、人工知能と機械学習の両方など、複数分野で論文を発表する著者もいます。
IEEE Computational Intelligence Societyの会員は約7,000人、IEEE Computer Societyの会員は約85,000人なので、前者の会員数は後者の8%です。
ほかの関連数値もいくつか挙げます。ただし、これらから一貫した全体像が得られるわけではありません。
- 労働統計局によると、米国にはコンピューター・情報科学の研究者が26,700人います。
- ACMの人工知能専門部会(SIGAI)には「1,000人を超える会員」がいます。
- 国際神経回路学会(INNS)には「2,000人を超える会員」がいます。
学術誌数
MASには、CSの学術誌が1,360誌、AIが106誌、AIまたは近縁分野が172誌登録されています。比率はそれぞれ8%、13%です。スプレッドシートのセルB96~B100を参照してください。
出版物数
2005~2010年の出版物のうち、MASの「CS」に分類されたものの約10%が「AI」に、約20%が「AI」または近縁分野に分類されていました。複数の分類に入る論文もあるかもしれないため、10%と20%のどちらが実態に近いかは不明です。1990~1995年、1995~2000年、2000~2005年の出版物でも、ほぼ同じ比率が見られます。スプレッドシートの左上がA2の表を参照してください。Google Scholarで「Computer Science」と「Artificial Intelligence」を検索すると、後者のヒット数は前者の約30%になります。検索結果は以下のとおりです。
引用符付きの「computer science」:2,650,000件
「artificial intelligence」→1,710,000件
「machine intelligence」→655,000件
2013年以降:
引用符付きの「computer science」:99,600件
「artificial intelligence」→32,300件
「machine intelligence」→11,600件
2012年:
引用符付きの「computer science」:163,000件
「artificial intelligence」→52,500件
「machine intelligence」→22,600件
2011年:
引用符付きの「computer science」:247,000件
「artificial intelligence」→66,100件
「machine intelligence」→23,000件。以上の検索結果は、AI研究の量がCS研究の10%を大幅に上回ることを意味するかもしれません。しかし、「artificial intelligence」という語句を含む論文が人工知能の研究とはかぎりませんし、計算機科学の論文に「computer science」という語句が含まれない場合もあります。
会議数
MASには、CSの「主要会議」が3,519件、AIの「主要会議」が361件登録されており、前者の数は後者の約10%です。AIまたは近縁分野の「主要会議」は561件で、CSの会議数の16%です。スプレッドシートのセルB27~B31を参照してください。
組織数
Microsoft Academic Searchには、CSの組織が11,338、AIの組織が7,125登録されており、比率は63%です。近縁分野もAIに含めると、AIの組織数は21,802で、CSの192%になります。スプレッドシートのセルB119~B123を参照してください。この数値だけを見れば、AI研究の量は10%を大幅に上回ることになります。
「組織数」は、「出版物数」などに比べて研究量を示す弱い指標のようなので、重みを下げるべきでしょう。それでも、AI組織とCS組織の比率が、調べたほかの比率よりはるかに高いのは謎です。CSとAIのコミュニティで文化的な慣行が違うためかもしれません。あるいは、MASの組織の数え方が、出版物の数え方ほど一貫していないのかもしれません。
AI研究とCS研究に授与された著名な賞
ACMチューリング賞:46回のうち6回がAI研究に対する授賞で、全体の13%です。毎年のチューリング賞は1966年に始まり、直近は2012年なので、これまで46回授与されています。そのうち6回がAI関連研究の業績に対するもので、具体的には以下です。
• 1969年 マーヴィン・ミンスキー
• 1971年 ジョン・マッカーシー
• 1975年 ニューウェルとサイモン
• 1991年 ロビン・ミルナー(機械支援による証明の構築)
• 1994年 エドワード・ファイゲンバウムとラジ・レディ
• 2010年 レスリー・ヴァリアント(おそらくほぼ正しい学習、PAC学習)
• 2011年 ジューディア・パール
46回のうち8回は2人、別の2回は3人への授賞なので、受賞者は合計58人です。そのうち8人がAI関連の業績で受賞しました。
ネヴァンリンナ賞:8回のうち1回がAI研究への授賞で、全体の12.5%です。ただし、その授賞は1986年で、かなり前のことです。ネヴァンリンナ賞は1982年以降、4年ごとに、これまで8回授与されています。
資金額
2011年、米国国立科学財団(NSF)は、CISEを通じたCS研究への助成のため、6億3,600万ドルを受け取りました。このうち1億6,900万ドルが、Information and Intelligent Systems(IIS)に配分されました。IISには、Cyber-Human Systems(CHS)、Information Integration and Informatics(III)、Robust Intelligence(RI)の3つのプログラムがあります。それぞれに約3分の1ずつ配分されたなら、Robust Intelligenceは5,600万ドルで、CS研究資金全体の9%です。CISEの資金の一部は、IIS以外、つまりACI、CCF、CNSを通じてAI研究に配分された可能性もあります。ただ、ざっと見たところ、CISE経由のIIS以外のAI資金は、ごくわずかなようです。
米国のCS研究のほかの主要な資金源には、ONR、DARPA、Microsoft、Google、IBMなどの企業がありますが、まだ調べていません。米国外の資金源も調べていません。
AI分野の成長
AI研究者数の増加率については、意味のある見積もりを出せるほど深く調べていません。ただし、あらゆる分野を合わせた科学者・技術者数の増加率は、AIやCSの成長率を測る 非常に弱い 代理指標になるかもしれません。
たとえば、1995~2005年のOECD諸国の科学・工学研究者の年増加率は、約3.3%のようです。これは23年で倍増するペースに相当します。米国国立科学財団(NSF)『科学・工学指標2010』第3章「科学・工学の労働力」には、次のようにあります。
1960年代初め、著名な科学史家デレク・J・デ・ソラ・プライスは、歴史上の非常に長い期間にわたる科学と科学者数の成長を調べ、その結果を バビロン以来の科学(1961年)という本にまとめた。複数の実証的尺度、その大半は少なくとも300年分の尺度を使い、科学と科学者数はおよそ15年ごとに倍増する傾向があると明らかにした。より質の高い科学と科学者の尺度は増加が遅く、20年で倍増し、質の低いものの尺度は増加が速く、10年で倍増する傾向があった。プライス(1961)によれば、この長期の指数関数的成長が意味することの1つは、「これまでに生きたすべての科学者の80~90%が、今日も生きている」ということである。これは、過去45年、つまり3回倍増する期間の科学者の大半が、まだ生きている可能性が高いことから導かれる。プライスは、この成長パターンのさまざまな含意に関心を持ったが、特に、この成長は無限には続かず、科学者数は「飽和」に達するはずだという考えに関心を寄せた。1961年には、すでに飽和が始まっているのではないかと懸念していた。
近年の科学者・技術者数の増加率は、プライスが過去数世紀について推定した値と、どれほど違うのでしょうか。表3-Aは、利用できるデータの期間について、米国と世界のほかの地域の科学・工学(S&E)労働力を測るいくつかの尺度の増加率を示しています。そのうち、米国の労働力に含まれるS&E博士号取得者数は、年平均2.4%と最も低い増加率でした。この率が続けば31年で倍増します。米国でS&E職に就く博士号取得者数は、年平均3.8%とより速く増え、続けば20年で倍増します。S&E分野の人の数には世界全体の集計がありませんが、経済協力開発機構(OECD)加盟国の「研究者」数は、年平均3.3%で増えています。続けば23年で倍増します。開発途上国の大半では科学者・技術者数のデータがごく限られていますが、OECDの中国の研究者データでは、年平均増加率は10.8%で、続けば8年で倍増します。これらの数値はすべて、S&E労働力の増加が、労働力全体の増加率を上回り続けていることと、おおむね整合します。この点は、研究者1人当たりの特許数、訓練に費やす時間、論文ごとの共著者数、引用文献数で測った研究者の平均的な生産性が低下しているという兆候と、併せて見る必要があります。以下は、研究者1人当たりの生産性低下に関する文献です。「科学の停滞」という記事に多くをまとめてくれたGwernに感謝します。
• Machlup, Fritz. 米国における知識の生産と分配, Princeton, NJ: Princeton University Press, 1962, 170-176
• Segerstrom, Paul. 規模効果のない内生的成長, American Economic Review, 1998年12月, 88, 1290-1310
• Terman, F.E. 電気工学教育の小史, Proceedings of the IEEE, 1998年8月, 86 (8), 1792-1800
• Adams, James D., Black, Grant C., Clemmons, J.R., and Stephan, Paula E. 科学チームと機関間共同研究:米国の大学における証拠、1981-1999, NBER Working Paper #10640, 2004年7月
• Jones (2006), 年齢と偉大な発明
• Jones, Benjamin F. 知識の重荷と万能人の死:イノベーションは難しくなっているか NBER Working Paper #11360, 2005
• National Research Council, 博士号取得までの時間:科学・工学の博士課程修了期間の長期化に関する研究, Washington, DC: National Academy Press, 1990
Tilghman, Shirley(委員長)ほか. 生命科学におけるキャリア初期の動向, Washington, DC: National Academy Press, 1998
• Zuckerman, Harriet and Merton, Robert. 科学における年齢・加齢・年齢構成, Merton, Robert, 科学の社会学 所収, Chicago, IL: University of Chicago Press, 1973, 497-559
• Cronin et al. 可視・見えにくい・不可視の仕事:20世紀の化学における協働のパターン, Journal of the American Society for Information Science and Technology, 2004, 55(2), 160-168
• Grossman, Jerry. 数学研究の共同研究グラフの進化, Congressus Numerantium, 2002, 158, 202-212
• Cronin, Blaise, Shaw, Debora, and La Barre, Kathryn. 数千人の出演者:20世紀の心理学・哲学の学術誌文献に見る共著と著者に含まれない協働, Journal of the American Society for Information Science and Technology, 2003, 54(9), 855-871
• McDowell, John, and Melvin, Michael. 共著の決定要因:経済学文献の分析, Review of Economics and Statistics, 1983年2月, 65, 155-160
• Hudson, John. 経済学における複数著者論文の動向, Journal of Economic Perspectives, 1996年夏, 10, 153-158
• Laband, David and Tollison, Robert. 知的協働, Journal of Political Economy, 2000年6月, 108, 632-662
• Jones 2010. 科学が進化するなかで、科学政策はどう進化できるか
• ソ連崩壊と米国の数学者の生産性, George J. Borjas and Kirk B. Doran, NBER Working Paper No. 17800, 2012年2月
NSFのInformation and Intelligent Systems(IIS)の予算は、1996年以降、概ね年4~20%増加し、2003年には一度だけ60%の増額がありました。1996~2011年の15年間の増加は、合計530%です。スプレッドシートの左上がA367の表を参照してください。この予算が対象とする3つのプログラム領域の1つが「Robust Intelligence」です。MASによると、AIの出版物数は1965~1995年には5年ごとに100%以上増えましたが、1995~2010年は5年ごとに約50%の増加になっています。機械学習とパターン認識でも、同じような傾向が見られます。スプレッドシートの左上がA2の表を参照してください。
今後の研究に向けたメモ
このテーマの今後の研究では、もっと深く掘り下げ、より確かな結論を出せるでしょう。ここでの目的は、そのための土台をいくらか用意することです。その観点から、AI分野の現在の規模と過去の成長を調べる研究者へ、いくつかのメモを残します。
- 引用される論文が新しいほど、進歩が速いことを示すかもしれません。一方、単に流行に左右されているだけかもしれないので、何らかの方法で両者を区別する必要があります。
- 引用パターンの分析に役立ちそうなデータベースには、Scopus、Web of Science、MS Academic Search、Science Citation Index(SSI)があります。2008年の研究では、PubMed、Scopus、Web of Science、Google Scholarを比較し、次のように結論しています。「PubMedとGoogle Scholarは無料で利用できる。[……]Scopusの収録範囲はWeb of Scienceより約20%広いが、Google Scholarの結果の正確さは一定しない。生物医学の電子的な調査には、PubMedが依然として最適な道具である。Scopusはより幅広い学術誌を収録する[……]が、Web of Scienceと比べ、現在は1995年以降に刊行された最近の論文に限られている。Google Scholarはウェブ一般と同じく、きわめて見つけにくい情報の検索にも役立つが、引用情報が不十分で、更新頻度も低いことが利用上の難点である」。Larsen & von Ins(2010)は、SSIの収録範囲が縮小していると主張しています。
- 引用数のノイズ要因には、(a)学術誌の編集者がインパクトファクターを上げるため、投稿論文の著者に同じ学術誌の別の論文への引用を追加するよう求めること、(b)著者が被引用数を増やすため、自分の論文を過剰に引用することがあります。引用を質の尺度とする際の注意点として、Wilhite and Fong(2012)は次のように述べています。「……インパクトファクターは、学者が『科学の質を数値化する』ための主要な手段であり続けている。その副作用の1つが、編集者に、自誌への引用を著者に強要する誘因を与えることだ。強制的な自己引用とは、査読中に論文の改善を目的として行う通常の引用指示のことではない。(i)原稿の出典表示が不足していると指摘せず、(ii)検討すべき具体的な論文・著者・研究群を提案せず、(iii)編集者の学術誌からの引用を加えるよう誘導するだけの要求を指す」。また、Storbeck(2012)はこう述べています。「操作の[程度]には驚く。たとえば『Review of Finance』の編集責任者が公表した数値によると、WilhiteとFongの研究で悪質さが4番目だった『Journal of Banking and Finance』のインパクトファクターは、自己引用を除くと激減する。未調整の値は2.731だが、自己引用を除けば、わずか0.748である」。
データ収集を担当したセバスチャン・ニッケルと、フィードバックを寄せたカール・シュルマンに感謝します。