该研究提出Hermes系列可配置框架及Hermes-Learn两阶段训练方法,将测试时推理中上下文分配与信息复用的决策权从固定框架转移给模型本身,即所谓“上下文推理”能力。研究发现,能力较强的大模型能利用这种灵活性随推理算力增加而提升表现,而较小的开源模型初期难以做到;经Hermes-Learn训练后,小模型可习得随问题类型和推理进展动态调整的上下文推理策略,从而弥补差距。这些收益可跨基准和模型泛化,外推至训练时未见过的推理算力规模,并能迁移至Hermes之外的互补测试时扩展方法,表明学习上下文推理是实现有效测试时扩展的关键。
| Test-time scaling | 在模型推理阶段分配更多计算资源以提升性能的技术。 |
| Contextual reasoning | 模型在多个上下文窗口间决定如何分配新上下文和传递信息的能力。 |
| Harness | 控制模型推理过程的执行框架或配置环境。 |
| Hermes-Learn | 一个两阶段训练框架,用于学习自适应上下文推理策略。 |
| Inference-time compute | 模型在推理阶段可用的计算资源量。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅