Nexus提出了一种面向统一内存架构上智能体大语言模型的优化方案,核心目标是解决工具注册表增长带来的预填充计算瓶颈。其关键策略是将工具路由与模式预填充成本解耦:通过INT8语义查找缓冲区和校准的交叉编码器边际门控实现基于检索的工具选择,并基于压缩文本签名生成参数,而非依赖拼接的键值缓存。实验显示,在工具规模扩展至250个时,该方法的路由准确率仍保持约89%,且首参数生成速度比全模式重新预填充快1.66倍,同时节省约80%的主上下文令牌。作为次要手段,Nexus还尝试将编译好的模式键值块直接移植到活动上下文中,但受限于旋转位置嵌入的相位漂移,仅在锚点位置有效,超过阈值后需通过深度自适应后缀重新解码修复。整体上,Nexus在中等上下文深度下实现了1.1至1.7倍的TTFT加速,并保证输出保真度,但性能提升在深层上下文中趋于持平。研究还报告了两个负面结果,即离锚点RoPE保真度边界和参考自由漂移门控的预测失效。所有测量基于单一模型配置,定量结果具有特定性,但定性边界具有普适性。
| Model Context Protocol (MCP) | 一种协议,用于标准化LLM与外部工具或数据源之间的上下文交换。 |
| KV-Cache Splicing | 将预先计算的键值缓存块直接插入到当前上下文中的技术,以避免重新计算。 |
| Retrieval-Decoupled Tool Routing | 一种方法,将工具选择与模式预填充成本分离,通过检索而非重新编码所有模式来决定使用哪个工具。 |
| Rotary Position Embedding (RoPE) | 一种位置编码方法,通过旋转矩阵将位置信息融入注意力机制,但可能导致相位漂移问题。 |
| Time-to-First-Token (TTFT) | 从输入请求到生成第一个输出令牌的延迟,是衡量LLM响应速度的关键指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅