Granite 4.2大模型:构建之道
11 小时前 1 阅读来源:HuggingFace Blog
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
IBM发布Granite 4.2推理模型:从零训练15万亿token,支持512K上下文和工具调用
IBM的Granite团队近日在HuggingFace博客上详细披露了其最新一代推理模型Granite 4.2的技术细节。这是Granite系列首次推出专门面向推理任务的模型家族,共包含3B、8B和30B三个参数规模,全部采用Apache 2.0开源协议发布。与以往侧重指令跟随的Granite版本不同,4.2系列在架构上引入了显式的思维链(chain-of-thought)能力,每个模型都能在给出答案前先生成推理过程,并支持思考/非思考模式切换,以及一种低功耗思考模式——在简单问题上只花费较短的推理预算。所有模型均支持原生工具调用,可通过OpenAI兼容接口(如vLLM)直接输出函数调用格式,无缝接入各类智能体框架。
从技术构建路径来看,Granite 4.2采用了五阶段训练策略,每个模型都从零开始在约15万亿token上完成预训练。前两个阶段聚焦基础预训练,第三、四阶段进行中段训练并逐步引入更高质量的数据退火,第五阶段则专门进行长上下文训练,将上下文窗口扩展到512K token。每个阶段使用不同的数据混合和学习率调度,从广泛的网页数据逐渐过渡到更精选的高质量来源。在架构设计上,模型采用纯解码器密集Transformer,配备分组查询注意力(GQA)、旋转位置编码(RoPE,θ=10,000,000)、SwiGLU激活函数和RMSNorm归一化,并以bfloat16精度运行。最显著的能力差异体现在后训练阶段:8B和30B模型额外经过了一个智能体强化学习(agentic RL)模块,在真实的沙盒环境中学习调用工具、编辑和运行代码、操作终端以及搜索网页。这意味着这两个较大模型不仅具备推理能力,还能作为自主智能体在真实环境中执行复杂任务。对于中国跨境电商卖家和AI从业者而言,Granite 4.2的开源特性意味着可以免费商用,其工具调用能力和长上下文支持为构建自动化客服、供应链管理等智能体应用提供了新的基础模型选择。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
