该研究评估了面向Z世代(2010-2024年出生)的AI心理治疗机器人的安全性。数据显示,美国13.1%的青少年(约540万人)使用生成式AI获取心理健康建议,但现有模型对青少年特有的语言模式——如夸张表达、反讽式积极、语义快速漂移和语境多义性——缺乏充分验证。研究构建了两个基准测试:64条Z世代心理健康表达和75段多轮对话,评估了Claude、GPT-4o和Llama-3.1等主流模型。结果发现,模型能理解76-82%的词汇,但仅能正确校准64-72%的临床风险,存在10-14个百分点的“词汇理解-临床推理”差距,而人类治疗师仅3个百分点。研究识别出六种失败模式,包括讽刺掩盖、风险分层模糊等,当三种模式叠加时漏检率高达94%。基于34%的基线漏检率,估计每年可能漏掉146,880起危机事件。研究建议强制采用人类介入机制、季度性青少年专项验证,并建立面向青少年的心理健康AI监管框架。
| Generation Alpha (Gen Alpha) | 指2010年至2024年出生的一代人,本研究中特指使用AI心理健康支持的青少年群体。 |
| vocabulary-comprehension gap | 模型理解词汇的能力与正确评估临床风险之间的差距,反映AI在语义理解与风险判断上的不一致。 |
| human-in-the-loop | 一种系统设计架构,要求人类参与AI决策过程,以确保安全性和可靠性。 |
| LLM (Large Language Model) | 大型语言模型,如Claude、GPT-4o,用于生成和理解自然语言,本研究中评估其心理健康应用安全性。 |
| risk-stratified ambiguity | 指AI在处理不同风险等级下的模糊表达时出现的错误模式,导致风险误判。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅