改造后的大语言模型能数清“人工智能”中的字母“i” |《自然》
13 小时前 1 阅读来源:nature.com
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
大语言模型数不清"strawberry里有几个r",这个被用户调侃了两年多的经典翻车案例,如今有了来自底层架构的解法。Nature官网近日刊发的一篇研究报道指出,Minixhofer等人提出了一种名为"byteification(字节化改造)"的方法,能够把已经训练好的、基于token的大模型改造成直接在字节层面运作的模型,改造后的模型不仅保留了原有的竞争力,还重新获得了逐字符读取的能力——换句话说,它能正确数出"artificial intelligence"里有几个字母i了。
问题的根源在于主流大模型的"分词"机制。目前绝大多数LLM并不直接处理字母,而是把文本切分成token(词元),一个token可能是一个词、半个词甚至几个词。这种设计大幅提升了训练和推理效率,也是当前模型能力爆发的工程基础之一,但代价是模型"看不见"单词内部的单个字符——字符在底层被编码成称为字节的二进制序列,而token层把这一层信息屏蔽掉了。所以当被问到"strawberry里有几个r"时,模型并不是在数数,而是在凭训练中见过的模式做概率猜测,答错几乎是必然的。这也是为什么这个问题长期被当作检验模型是否真正"理解"语言的试金石,尽管它本身并不代表模型的综合能力。
字节化改造的意义在于,它试图在不推倒重来的前提下补上这块短板。按照论文的描述,byteified模型在保持与token模型相当性能的同时,恢复了字符级操作能力。这对实际应用的影响值得关注:对AI工具开发者而言,这意味着未来可能不必为了处理字符级任务而专门训练新模型,现有模型经过改造即可胜任拼写检查、代码生成中的精确符号操作、多语言文本处理等场景;对依赖大模型做内容审核、数据清洗的团队来说,字符级精度的提升也意味着更少的低级错误。当然,从论文发表到工程落地通常还有距离,改造后的模型在推理成本、长文本表现上是否会有折损,仍需后续验证。但至少,这个困扰行业已久的"数不清字母"笑话,正在从架构层面被认真对待。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
