AI工具AI评分 一般 (66)AI 中文改写

初创企业竞逐大语言模型新风口

5 小时前 1 阅读来源:MIT Technology Review

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

谷歌2017年那篇著名的论文《Attention Is All You Need》奠定了Transformer架构的基础,九年后,它仍是所有主流大语言模型(LLM)的引擎。但如今,这项核心技术正成为瓶颈,一批初创公司正试图用新思路来颠覆它。 Transformer的核心优势在于“密集注意力”机制,通过将文本中每个词与其他所有词进行乘法运算来捕捉语义。这种方式精度极高,但计算量随文本长度呈指数级增长——处理一万字的文档可能需要5000万次乘法运算。这正是大模型耗电惊人的主因:OpenAI今年预计在算力上投入500亿美元,国际能源署预测数据中心耗电量到2030年将翻倍。更棘手的是,Transformer逐词处理的方式让上下文窗口难以扩大,而推理模型(通过“思维链”自我对话)和智能体恰恰需要处理海量输入。随着模型越做越大,Transformer的短板愈发明显。 面对这一困局,一批初创公司正从四个方向寻找突破口。首先是改造注意力机制本身,用“稀疏注意力”替代“密集注意力”,只计算部分词对而非全部,大幅降低计算量。其次是彻底抛弃Transformer架构,探索循环神经网络(RNN)的变体,如Mamba等状态空间模型,它们能以固定计算量处理任意长度文本。第三是混合架构,将Transformer与其他机制结合,取长补短。最后则是从工程层面优化,通过更聪明的数据流管理减少计算浪费。 这些探索背后是巨大的商业机会。当前AI行业的赢家——OpenAI、Anthropic、谷歌——都建立在Transformer之上,但新架构一旦成熟,可能从根本上改变竞争格局。初创公司Subquadratic的CEO Justin Dangel直言:“整个AI行业都建立在Transformer上,它们是计算机科学史上最重要的创新之一,但时代正在变化。”这些新玩家或许多数会失败,但一旦成功,将重新定义大模型的效率上限和智能边界。对于依赖AI能力的跨境电商卖家而言,这意味着未来可能出现更便宜、更强大的模型,降低自动化运营和智能客服的成本门槛。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · MIT Technology Review

内容版权归原作者及 MIT Technology Review 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容