AI评分 头条 (72)AI 中文改写
谷歌Gemini 3.8 Flash发布,提醒业界其仍在赛道
3 天前 2 阅读来源:theregister.com
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
谷歌周三发布了Gemini 3.8 Flash,试图借此重振其作为顶级AI模型开发商的声誉。自8月初谷歌DeepMind首席执行官Demis Hassabis卸任转任董事长、Koray Kavukcuoglu以SVP头衔接掌帅印以来,外界对谷歌是否还有决心留在前沿模型竞赛中的质疑就一直没停过。谷歌CEO桑达尔·皮查伊的安抚言论也没能打消疑虑——毕竟6月承诺的Gemini 3.5 Pro跳票了,而3.5 Flash虽然速度快、成本低,但在智能水平上过去几个月被中国AI公司的开源权重模型压了一头。
但谷歌迭代速度确实在加快。Gemini 3.8 Flash是四个月内的第四款Flash系列模型,智能水平已提升到能与最高分模型比肩,同时保持高性能和相对亲民的价格——至少在新年促销价(输入每百万token 0.75美元,输出每百万token 3.75美元)翻倍之前是这样。谷歌产品管理高级总监Tulsee Doshi和DeepMind Gemini安全负责人Raluca Ada Popa在博客中表示,3.8 Flash相比3.7 Flash有大幅提升,在多项基准测试中接近更高成本前沿模型的水平。在DeepSWE v1.1(长周期软件工程)测试中,3.8 Flash以极低的成本在自主解决复杂工程问题上超越了大多数更大的前沿模型。
核心变化:Gemini 3.8 Flash在高推理模式下,Artificial Analysis智能指数得分59分,比前代高出3分,与GPT-5.6 Sol(超高推理,59分)和Grok 4.6(中推理,59分)持平。当前智能排名(基于九项基准测试)依次为:GLM-5.3(最高推理,60分)、Kimi K3(最高推理,60分)、Grok 4.6(高推理,61分)、GPT-5.6 Sol(最高推理,61分)、Claude Opus 5(最高推理,63分)、Claude Fable 5.1(最高推理,66分)。按每项智能指数任务0.58美元计算,Gemini 3.8 Flash是"同智能水平下最便宜的模型"。作为对比,Anthropic最新旗舰模型Fable 5.1每项任务成本约3.76美元,是前者的6倍。
Gemini 3.8 Flash每项任务的成本比前代高出约40%,原因是它在执行智能体任务时倾向于输出更多token、执行更多轮次。"3.8 Flash更努力地工作,"Doshi和Popa解释称,"在复杂任务上它表现出更强的勤勉度——执行额外推理步骤,迭代调用工具。有时模型会使用更多token来最大化性能,尤其是在高努力级别下。"两位谷歌高管还指出,Gemini 3.8 Flash在企业知识工作相关基准上也有提升,如Vals Finance Agent V2、Harvey法律智能体基准和HLE-Verified。
Gemini 3.8 Flash现已面向开发者开放,可通过Google Antigravity、Google AI Studio和Android Studio中的Gemini API以及界面设计服务Stitch使用。企业用户可通过Gemini Enterprise接入,订阅Google AI Pro和Ultra的消费者也可使用。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
