OpenAI、心の相談AIを80人超で評価
出典:OpenAI公式
詳細を読む
OpenAIは2026年9月23日、現実的なメンタルヘルス相談に対するAIの応答を測る公開ベンチマーク「MentalHealthBench」を発表しました。22カ国の資格を持つ心理学者・精神科医80人超と共同開発し、安全性、状況確認、利用者の主体性維持、実行可能な助言などを、専門家が会話ごとに定めた基準で評価します。
評価対象には、プライバシーに配慮して作った合成会話を使い、成人、13〜17歳の若者、介護者、臨床家という4種類の利用者像を設定しました。日常的な悩みから深刻な苦痛、緊急支援が必要な状況まで3段階の緊急度を含み、複数の言語や地域、文化的背景を扱います。
各会話は少なくとも3人の専門家が確認し、2人以上が同意し、別の1人が反対しなかった評価項目だけを採用しました。項目には臨床上の重要度に応じてマイナス10からプラス10の重みを付け、GPT-5.6 Solがモデル回答を専門家作成の基準に照らして自動採点します。
OpenAIは、近年の高性能モデルほど総合的な応答力が向上し、特に適切な状況確認が改善したと説明しています。一方、16カ国のAI利用経験者44人による非緊急会話の評価では、利用者は具体的な次の行動と語り口を、専門家は背景把握と曖昧な状況の慎重な解釈をより重視しました。
この評価軸は、開発者が総合点だけでなく、モデルごとの強みや改善点を行動別に把握する手掛かりになります。ただしOpenAIは、ChatGPTは治療や専門的ケアの代替ではなく、危機時には地域の相談窓口や信頼できる人など現実の支援につなぐ必要があると明記しています。