IBM发布Granite 4.2系列开源推理语言模型,提供3B、8B和30B三种参数规模。该系列与早期指令跟随型模型不同,核心特点是显式推理能力:每个模型在回答前可生成思维链,并配备思考/非思考切换开关及低功耗模式,用于处理简单问题。模型采用纯解码器密集Transformer架构,从零预训练于约15万亿token,随后经过多阶段强化学习训练。其中8B和30B版本包含智能体强化学习模块,能在真实沙盒环境中学习代码编辑、终端操作和网络搜索。所有模型均以Apache 2.0协议开源,支持商业使用。IBM还同步发布了两个470M参数的Granite Speech 5.0 Turbo语音模型。该系列面向软件工程、DevOps自动化、深度研究、长文档RAG等应用场景,为企业和开发者提供可本地部署的开放推理模型选择。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅