研究
★★★★★
■中立2026-09-24OpenAI、メンタルヘルス対話の評価基準「MentalHealthBench」を公開
OpenAIは9月23日、メンタルヘルスの会話でAIの応答を比べる公開テスト集「MentalHealthBench」を発表した。80人超の有資格専門家が関わったが、臨床現場での有効性を証明するものではない。
OpenAIは9月23日、AIのメンタルヘルス関連応答を調べる「MentalHealthBench」を公開した。22か国の心理士や精神科医など、80人を超える有資格専門家と共同で作成したという。
評価対象は、日常のストレスや人間関係の相談から、緊急の支援が必要な会話まで幅広い。会話は合成データで、成人、10代、介護者、臨床家などの状況を含む。専門家が作った基準に照らし、安全性、状況を確かめる質問、本人の意思の尊重、適切な次の行動の提案などを評価する。
この仕組みは、危険な回答を避けたかだけでなく、会話の状況に応じた応答を比較するための研究用テスト集だ。実際の患者への治療効果を検証した臨床試験ではなく、OpenAIもChatGPTは治療や専門家のケアの代わりではないと明記している。
▲ 事実 (Fact)
- OpenAIは2026年9月23日、MentalHealthBenchを公開した。
- OpenAIによると、22か国の有資格心理士・精神科医など80人超が作成に参加し、19言語を話す専門家が含まれる。
- 評価には合成会話が使われ、日常的な相談、高い緊急度の悩み、緊急事態などを扱う。
◆ 意見・解釈(AIによる)
- 専門家の基準を共有できる点は、AIの応答を改善する手がかりになり得る。一方、ベンチマークの点数だけで個別の相談への適切さや臨床的な有効性まで判断することはできない。
⌖ 一次情報(必ず原典をご確認ください)