Alignment Research Center (ARC)
ニューラルネットワークの挙動の機構的説明(mechanistic explanations)のための、理論的基盤を開発している。
数学的に意義のあるAIセーフティ研究を行っている、あるいは支援している団体の一覧──理論や解釈可能性から、評価(evaluations)や制御(control)まで。
ニューラルネットワークの挙動の機構的説明(mechanistic explanations)のための、理論的基盤を開発している。
理論科学・実験科学としてのAIセーフティのための、研究とフィールド構築。Iliadは研究の賭け(research bets)をインキュベートし、研修プログラムやカンファレンスを運営している。
破滅的リスクの一因となりうるフロンティアモデルの自律性と能力について、科学的な評価を開発している。
戦略的欺瞞、AI制御(AI control)、脅威評価、そして先進AIシステムのリスクに対する緩和策に取り組んでいる。
理論・実証の両面にわたるアラインメント研究のポートフォリオを拡大している非営利団体。自動化と、より高い確信を持てるアプローチに重点を置く。
特異学習理論(singular learning theory)を解釈可能性とアラインメントに応用している。発達的解釈可能性(developmental interpretability)や、感受率に基づく分光法(susceptibility-based spectroscopy)を含む。
フロンティア評価、リスク緩和、アラインメント、制御、AIセキュリティに関する、政府による技術研究。