OpenAI、AI安全性の独立評価原則を提示
評価の4重点分野
安全性根拠の独立検証
防護策の実効性検証
能力評価の網羅性確認
重大事故の独立調査
独立性を守る設計
範囲と主張の事前合意
比例的な情報アクセス
改善と公開の両立
具体的な改善点の提示
責任ある結果公表
出典:OpenAI公式
詳細を読む
OpenAIは2026年9月22日、最先端AIの安全性を第三者が厳格かつ独立して評価するための優先領域と原則を公表しました。訓練・評価・社内外での導入を通じ、評価者に深いアクセスを認め、安全性の根拠、防護策、能力評価、重大な不整合事故を検証させる方針です。企業秘密や安全保障上の情報を守りながら、説明責任と国際的な共通基準の整備を進めます。
重点分野は、安全性を裏付ける構造的な論証である「安全性ケース」、重要な防護策、化学・生物やサイバー、AI自己改善などの能力評価、重大な不整合事故の4領域です。評価者は、根拠が主張を支えるか、現実的な条件で防護策が機能するか、試験が重大リスクを十分に捉えるかを調べます。
評価は対象範囲と安全性の主張を事前に合意し、評価者が結論を独立して導けるだけの比例的なアクセスを確保します。方法、判断基準、不確実性を開示し、直接確認した事実と解釈を分けるほか、評価者には専門性と利益相反への対処を求めます。
機密性との両立も柱です。評価者は情報管理と守秘義務を整え、具体的な欠陥と改善方法を示します。必要に応じて研究所に是正期間を設けたうえで、機密情報を保護しながら可能な限り公開し、評価者の編集上の独立性を維持します。
想定する評価は数週間から数カ月に及び、主に特定の安全性主張を時間をかけて調べるため、製品投入の時期には左右されません。OpenAIは複数の第三者と協議しており、一つの組織ですべてを担うのではなく、異なる専門家による並行評価と将来の法制度・民間統治を通じて共通基準を育てる考えです。