谷歌员工对新一代Gemini 4存疑
13 小时前 1 阅读来源:japantimes.co.jp
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
谷歌内部正面临一场关于新一代AI模型Gemini 4的信心危机。据彭博社援引知情人士消息,尽管Gemini 4在业界通用的基准测试中表现亮眼,但谷歌员工在实际工作场景中使用该模型时,反馈却明显不如测试数据那么乐观。这种“跑分好看、干活拉胯”的落差,正在公司内部引发对模型真实能力的质疑。
问题的核心在于基准测试与实际应用之间的鸿沟。基准测试通常采用标准化的题目和评分体系,衡量的是模型在特定任务上的理论能力;而员工在日常工作中遇到的往往是多步骤、跨领域、需要结合上下文判断的复杂任务,这些恰恰是当前大模型容易暴露短板的场景。对于谷歌而言,这种内部质疑并非小事——Gemini系列是谷歌在AI竞赛中对抗OpenAI和Anthropic的核心武器,如果连自家员工都对它缺乏信心,外部开发者和企业客户的信任度也会受到波及。更深层的影响在于,这一事件折射出整个AI行业的普遍困境:模型在演示和评测中的表现,与真实生产力场景中的可靠性之间,仍存在不小的距离。对于正在将AI工具接入客服、内容生成、数据分析等业务的中国出海团队来说,这也是一个提醒——选型时不能只看跑分,更要关注模型在自己具体业务场景中的实际表现。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
