我们仍不知人们如何真正使用AI
10 小时前 1 阅读来源:MIT Technology Review
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
人工智能公司Anthropic和OpenAI定期发布报告,展示用户如何使用Claude和ChatGPT等产品,但斯坦福大学可信AI研究(STAIR)实验室的博士生Anka Reuel指出,这些数据完全由公司单方面提供,缺乏独立来源进行验证。Reuel正联合领导一个名为“AI观察站”的新研究项目,旨在填补这一空白。该项目是一个公共平台,通过七个现有数据集,在获得用户同意的前提下,聚合并分析了与Claude、Gemini等主流模型的真实对话,为研究人员和政策制定者评估生成式AI的实际使用情况提供独立信息源。Reuel强调,当前利益相关方正基于非常有限的数据,对AI的收益和风险做出影响深远的决策。
AI观察站的研究发现,不同模型间的AI使用情况差异显著,且随时间推移发生变化。其研究显示,用户行为中存在大量比主流AI公司报告所捕捉到的更敏感的行为,这些公司报告往往更侧重于工作场景而非个人使用。以Anthropic经济指数为例,这是最知名、引用最广泛的AI使用数据来源之一,但它存在盲区——正如其名称所示,它只关注Claude AI在工作与生产力相关的用途,过滤掉了与此无关的对话。当AI观察站团队将Anthropic的方法应用于自己的数据集时,发现近一半(48%)的对话会被过滤掉。这些被过滤的非工作相关对话更可能涉及健康与关系(44.2%对比Anthropic分析中的31.2%)、成人或非法话题(7.9%对比2.1%)、骚扰与仇恨言论(27.5%对比5.66%)以及性内容(16.7%对比2.4%)。OpenAI 2025年的ChatGPT使用报告也类似,显示消费者使用中仅30%与工作相关。德克萨斯大学奥斯汀分校信息学院助理教授David Widder表示,Anthropic虽已发布关于用户将Claude用于情感支持、陪伴甚至生成儿童性虐待材料的单独博客文章,但像AI观察站这样提供全局视角的分析,而非将内容分割在独立报告中,能帮助研究人员更一致地理解不同使用场景。
AI观察站分析的数据集涵盖2023年至2025年间的对话,发现了用户使用AI方式以及各AI平台响应方式的差异。在WildChat(AI观察站研究包含的最大、最详细的数据集之一)中,对话随时间推移变得更长、更复杂,体现在提示词token、响应token和对话轮次的增加上。同时,闲聊内容显著增多,这表明AI陪伴使用在增加;而AI助手自我披露(即表明自己是聊天机器人)的行为却在减少。此外,被研究人员标记为敏感使用(可能包含有害或受限内容,如性骚扰和仇恨言论)的交流有所下降,这可能表明平台普遍部署了更有效的防护措施。AI观察站还发现,AI使用因模型不同而大相径庭,用户在话题、互动风格、对话结构以及敏感用例的可能性和类型上均存在差异。例如,研究人员发现用户更频繁地使用Grok和Gemini进行信息检索,Grok尤其受用于获取新闻和政治信息,但同时也是错误信息集中的地方,这一发现与其他研究结果一致。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
