AI评分 一般 (61)AI 中文改写

一个模型家族,两枚金牌:为IOI和IMO微调Nemotron

22 小时前 5 阅读来源:HuggingFace Blog

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

英伟达的Nemotron模型家族最近交出了一份颇为亮眼的成绩单:同一套基础模型,经过针对性微调后,分别在2026年国际信息学奥林匹克(IOI)和国际数学奥林匹克(IMO)两项赛事中达到金牌水平。IOI赛场上,Nemotron-3-Ultra-CC配合监督微调(SFT)和GenCorrect策略拿下535.4分(满分600),远超361.12分的金牌线,也高于人类选手最高分498.27分;IMO赛场上,基于Nemotron 3 Ultra的生成-验证-精炼系统提交的证明获得30分(满分42),超过29分的官方金牌门槛。值得注意的是,IOI成绩是在与人类选手相同的时间、网络访问和提交限制下完成的实时测试,属于非官方、无监督的基准测试,未计入官方排名;而IMO的证明则由官方评委打分。 这项结果的意义不在于拿了两块金牌,而在于验证了一条可复用的模型专业化路径。英伟达团队总结出的方法论只有四步:选一个足够强的Nemotron基础模型,整理领域专属题目和高质量推理轨迹,用SFT和强化学习(RL)做后训练,再搭配一个能生成、评估、迭代改进答案的推理循环。整个过程中没有为每个任务重新训练基础模型,而是把通用能力"特化"到具体领域。以IOI为例,团队整理了2.2万道竞赛编程题并生成合成推理轨迹,训练出两个专家模型:300亿总参数、30亿激活参数的Nemotron-3-Nano-CC同时接受SFT和RL,5500亿总参数、550亿激活参数的Nemotron-3-Ultra-CC只做SFT。在IOI 2025上的进展很能说明问题——Nano从后训练前的130分提升到SFT后的280分、RL后的291分,加上GenCorrect迭代策略后冲到468分,跨过438.3分的金牌线;Ultra-CC用同样的测试时策略达到502分。实验还发现,不同规模的模型适配方式并不相同:Nano的主要增益来自SFT,RL只是小幅稳定提升;而更强的Ultra模型仅需一个SFT轮次,就在IOI、ICPC和LiveCodeBench Pro上全面超过完整后训练的Nano。这一发现直接指导了IOI 2026专用系统Ultra-CC的构建。IMO项目则把同样的思路搬到奥数证明上,从Nemotron 3 Ultra出发分别训练SFT和RL两个专家,SFT语料包含15818道独特证明题、41.4万余条经过质量筛选的样本,覆盖证明生成、精炼、验证和元验证等环节,而不只是教模型给出最终答案。 对关注AI落地的人来说,这项工作的价值在于它降低了"造一个领域顶尖模型"的心理门槛。过去,要在数学或编程竞赛级别任务上达到顶尖水平,往往意味着从零训练一个专用模型,成本极高。Nemotron的案例表明,只要基础模型足够强、领域数据整理得当、后训练和推理循环设计合理,一套配方可以同时适配信息学和数学两个差异巨大的领域——前者要求算法和代码在严格时限下通过隐藏测试,后者要求严谨的自然语言证明。这种"一个模型家族、多个金牌结果"的模式,对需要构建垂直领域AI能力的团队具有直接参考意义:不必每次都从头造轮子,把通用底座特化好,可能才是更现实的路径。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · HuggingFace Blog

内容版权归原作者及 HuggingFace Blog 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0 条

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容