IBM于8月25日发布Granite 4.2,新增3B、8B和30B开源语言模型,据称专为企业级智能体构建。
这些稠密模型在Apache 2.0许可证下增加了推理、工具使用和编码能力,为团队提供了另一个可测试多步工作流的开源权重选项。
IBM表示,新语言模型采用多阶段强化学习方法。其既定目标是帮助模型在智能体工作流中规划、权衡选择并验证行动方案,而非仅仅响应提示。这些模型在Apache 2.0许可证下可用,允许团队下载、调整和部署它们,无需专有许可限制。
该发布描述了预期能力和IBM的训练方法;这并非生产可靠性的独立基准。因此,考虑使用Granite 4.2的团队应在将其公告视为性能保证之前,根据自身的工具调用、延迟、安全和任务完成需求对模型进行测试。
实际意义在于,IBM提供了一个明确围绕企业级智能体(包括需要工具和多步规划的工作流)的开源模型选项。这提供了另一个可在部署灵活性和宽松许可是重要约束条件下评估的模型系列。
Granite 4.2模型概述
Granite 4.2是IBM于2026年8月25日发布的新一代开源大语言模型系列。它是IBM首个密集(Dense)、仅解码器(Decoder-only)的推理语言模型系列,专为需要复杂推理、工具使用和多步规划的企业级AI智能体(Agent)设计。
该系列模型在Apache 2.0许可证下开源,允许免费用于商业和研究目的。

模型规格与架构
Granite 4.2系列提供三种参数规模的模型:
所有模型均采用分组查询注意力(GQA) 机制,并支持英语、德语、西班牙语、法语、日语、葡萄牙语、阿拉伯语、捷克语、意大利语、韩语、荷兰语、中文等12种语言。
核心技术:原生推理与可切换思考模式
Granite 4.2的核心创新是其原生推理能力。模型经过专门训练,能够在给出最终答案前,先在内部进行逐步的“思考”或“推理”。
每个模型都提供了三种可切换的思考模式:
1、思考模式(Thinking Mode):模型的默认模式。它会在
2、非思考模式(Non-Thinking Mode):模型直接给出答案,不展示思考过程。这适用于简单查询,可以降低延迟。
3、低消耗模式(Low-Effort Mode):一种介于前两者之间的模式,对简单问题使用较短的推理预算。
这种设计让用户可以在推理深度和响应速度之间灵活权衡。
构建过程与训练数据
IBM披露了Granite 4.2详细的构建过程:
-预训练(Pre-training):所有模型均从零开始训练,使用了约15万亿(15T)个token的数据。通过一个五阶段的计划,将上下文窗口扩展至512K token。
-监督微调(SFT):在约720万条(约1000亿token)的链式思考、推理和智能体轨迹数据上进行监督微调。
-多阶段强化学习(RL):这是该模型的关键步骤。所有模型都经过了基于可验证奖励的基础强化学习,例如可检查答案的数学题和通过单元测试的代码。
-智能体强化学习(Agentic RL):仅8B和30B模型会进入一个额外的智能体强化学习阶段。模型会被置于真实的软件工程、终端和网络搜索环境中,并根据其任务完成情况获得奖励。例如,在软件工程阶段,模型需要编辑真实代码库并通过隐藏的测试套件。
-基于人类反馈的强化学习(RLHF):最后,所有模型都会进行RLHF以实现偏好对齐和安全性。
性能评估
IBM使用基于NeMo Evaluator SDK构建的框架对模型进行了评估,以下为IBM自行报告的数据:
请注意:以上所有分数均为IBM自行报告的数值,并非独立第三方测试的结果。
( 素材来自:IBM 智算芯能前沿网综合)
本文由智算芯能前沿网编辑整理,转载请注明出处。
