俄罗斯数学家教AI模型无需语言交流
3 天前 1 阅读来源:Wired AI

AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
一群俄罗斯数学家创办了一家名为Mostik(俄语意为“桥梁”)的初创公司,他们找到了一种让AI模型之间无需生成文字就能直接“对话”的方法——通过模型内部的数学权重进行交互。这项技术让不同模型之间能够高效协作,甚至让一个较小的模型快速获得大模型的能力。该公司用这种方法构建的模型已经在业界公认难度极高的ARC-AGI 3竞赛中登顶,但他们为了保住比赛优势,拒绝透露更多细节。
这项技术最直观的演示是:他们把中国开源模型GLM-5.2(7530亿参数)和Qwen-3.5(40亿参数,可跑在手机上)通过“桥接”组合成一个混合系统。这个混合系统的运行成本仅为完整版GLM模型的二十分之一,而性能恰好介于两个模型之间。Mostik CEO萨莎·马利舍娃在咖啡交流中解释,机器学习领域早就知道“模型集成”的效果优于单个模型——就像数学圈里那个经典玩笑:让一群普通人猜一头猪的重量,把他们的猜测平均后往往比专家的估计更准。传统做法是把一个模型的输出喂给另一个模型,这既耗时又费钱,而Mostik团队找到了让模型直接交换内部数学信号的方法,省去了生成文本的中间环节。
如果这项技术成熟,将极大提升开源模型的价值,让它们有实力与Anthropic、OpenAI等前沿实验室的闭源模型竞争。马利舍娃个人认为,未来AI不会是一个“巨无霸”单体模型,能力也不一定来自单纯扩大规模。AI软件公司Lovable的技术负责人弗拉基米尔·阿鲁斯塔米安评价说,这个团队只花了几个月就做出了他原本以为要几年才能实现的东西。前谷歌DeepMind计算机科学家卡尔·图伊尔斯也表示,这项技术意味着“不需要让大模型处理整个流程,只需在旁边运行一个小模型就能获得接近大模型的质量”,对于任何追求高效运行模型的人来说都是显而易见的选择。
Mostik的首席科学家是日内瓦大学教授、2010年菲尔兹奖得主斯坦尼斯拉夫·斯米尔诺夫。他指出,在两个AI模型之间找到共同语言其实非常困难,“目前似乎还没有合适的数学语言”。Mostik的方法本质上是在数学上架起一座桥梁。斯米尔诺夫还认为,这项研究可能揭示AI模型实际运作方式的深层规律,甚至与人类大脑处理难题的方式存在共通之处——更深入的数学分析或许能发现AI和人类在推理复杂问题时的共性。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
