AI评分 一般 (59)AI 中文改写
Anthropic:资助更优AI福祉影响评估
2 天前 1 阅读来源:anthropic.com
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
Anthropic推出500万美元资助计划,推动AI对用户幸福感影响的独立评估
Anthropic于8月25日宣布启动一项总额500万美元的资助计划,用于支持独立研究AI系统如何影响用户的心理健康与整体幸福感。该计划将为入选的研究团队提供直接资金、Anthropic模型访问权限以及技术支持,帮助其构建开源评估工具,使整个AI行业能够更系统地衡量模型对使用者的影响。所有受资助者将完全独立开展工作,研究成果将以开源项目形式发布,供任何开发者使用。
这一计划的背后,是AI对话系统正越来越多地介入用户的私人情感领域。如今,许多人不仅用AI完成工作、学习和解决问题,还会在困难时期将AI当作倾诉对象,甚至寻求情感支持。然而,行业尚未建立起清晰的标准来规范模型在这些对话中的行为——例如当用户开始对模型产生依赖感,或借助AI应对心理健康危机时,模型应该如何回应。Anthropic在公告中指出,幸福感评估是一个特别复杂的领域。与大多数模型行为可以通过单个回答判断准确性不同,评估幸福感需要大量上下文信息。例如,一个处于痛苦中的用户可能不会立即透露自残念头,需要经过长时间对话才能识别出需要更谨慎回应的信号;而同一个回答在不同情境下可能产生截然相反的效果——Claude可以给普通用户提供均衡饮食和锻炼建议,但如果用户有进食障碍史,同样的建议就可能不恰当甚至有害。
Anthropic表示,公司一直在开发安全机制来识别这类对话,并发布关于用户与Claude对话类型的研究,以改进防护措施和评估方法。但这些问题涉及细微的判断,且影响重大,正确的应对方式需要随着模型能力和使用场景的演变而不断调整。通过资助独立的幸福感评估和基准测试,Anthropic希望吸引更多专业人士——包括临床医生、心理学家、方法论学者等——加入这一新兴且关键的研究领域。
在具体操作层面,Anthropic Safeguards团队发布了关于如何构建严谨幸福感评估的指导文件,明确了评估应具备的关键要素:清晰说明测量对象(即什么算通过、什么算失败及其重要性);邀请临床和领域专家参与设计与验证;同时测试过度顺从和过度拒绝两种风险;反映用户真实使用方式(通常需要构建多轮对话场景,让风险在长对话中逐步升级);以及用真实专家意见验证评估系统的评分准确性。申请截止日期为9月21日,入选者将在10月5日前收到通知。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
