AI工具AI评分 头条 (69)AI 中文改写

梁文锋硬刚马斯克:大胆立场曝光 - 36氪

5 小时前 1 阅读来源:eu.36kr.com

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

梁文锋与马斯克的正面交锋,在8月12日夜间悄然上演。DeepSeek V4-Pro先在API文档中低调上线,官网横幅和公告却“神秘”消失,直到次日晚间19点19分,官方公众号才正式官宣。从4月24日预览版亮相到正式版登场,历时111天,原定7月中旬发布,几经跳票后终于在8月中旬落地。几乎同一时刻,马斯克的SpaceXAI推出了Grok 4.6。两款SOTA模型同台竞技并不稀奇,但这次双方在多个维度上的直接对标,火药味十足。 这场对决并非简单的版本迭代,而是两家公司在模型、智能体和算力三条战线上的全面碰撞。从基准测试来看,DeepSeek V4-Pro在AI安全(Cybergym)和工作流自动化(AutomationBench)等特定领域优势明显;Grok 4.6则在通用智能指数(Artificial Analysis)和软件工程(DeepSWE)等测试中表现更优,且在成本效率上占据显著优势。但真正的重头戏在次日早晨上演——当部分开发者质疑DeepSeek V4-Pro能力时,DeepSeek突然放出大招:Harness。而就在前一天,马斯克也发布了智能体Grok Bot。智能体成为这轮对决中最激烈的部分,DeepSeek Harness上线半小时GitHub星标破万,12小时内突破5万,以“万物皆插件”的理念构建Agent生态;Grok Bot则走云端全能助手路线,主打7x24小时“跟随式学习”。 但较量远未结束。在模型正面交锋的同时,DeepSeek自建数据中心计划已经启动,试图从底层弥补算力短板;马斯克则放出豪言,五年内SpaceXAI的算力容量将超过其他所有公司的总和。一边是专注自建算力底座、靠工程效率追赶的DeepSeek,一边是手握超算集群、野心勃勃的xAI。基础模型的竞争考验硬实力,智能体的竞争争夺下一代应用入口,算力则决定长期发展的上限。模型、智能体、算力三大战场环环相扣,梁文锋与马斯克的三轮对决就此展开。 基础模型:马斯克的产品更便宜更好用 Anthropic推出的Claude Fable 5目前被公认为AI行业复杂智能体能力的天花板:长链路任务处理、超大工程代码重构等顶级能力,长期占据Agent赛道基准测试榜首。在DeepSeek V4-Pro和Grok 4.6同台首秀之夜,两款模型直接出现在Fable 5眼皮底下,从不同方向发起冲击。基准分数方面,官方公布的基准测试直接对标目前业界公认的两大标杆,DeepSeek V4-Pro在多项指标上与Fable 5大体持平。Grok 4.6则聚焦长程智能体、复杂编程和知识工作,SpaceXAI公布的数据显示,其在真实世界专业任务评估GDPVal-AA v2中拿到1753 Elo,高于Claude Fable 5 Max的1741分,Artificial Analysis智能指数达到61。有用户实测后发现,DeepSeek依然保持一贯的速度优势,大幅领先Grok 4.6。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · eu.36kr.com

内容版权归原作者及 eu.36kr.com 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容