该论文提出SynLat框架,旨在解决长链式思维推理中输出token开销过大的问题。作者指出,压缩的关键在于边界划分:token级和固定长度边界会割裂短语、公式等连贯语义单元,而步骤级边界又可能将需要不同压缩策略的内容捆绑在一起。为此,SynLat引入不重叠的“句法对齐单元”,使压缩边界与句法结构对齐,并由答案条件化的教师模型为单一压缩条件学生模型构建渐进式KEEP/LATENT目标,使推理时仅凭问题和指定压缩级别即可生成混合推理内容。在两种Qwen3学生模型规模、标准与长链式思维分组及三档压缩级别下,SynLat在全部12项任务组汇总中达到或超过最强基线,其中11项严格领先。中等压缩下增益达3.6/2.6分,高压缩下达7.0/5.5分,压缩越强优势越明显,长链式思维场景尤为突出。
| Chain-of-Thought (CoT) | 思维链,一种让模型逐步展示推理过程以提升复杂任务表现的方法。 |
| Syntax-Aligned Units (SAUs) | 句法对齐单元,根据句法结构划分的非重叠文本片段,用于对齐压缩边界。 |
| Text-Latent Compression | 文本-潜在压缩,将文本推理步骤压缩为潜在表示以减少输出token开销的技术。 |
| KEEP/LATENT Targets | 保留/潜在目标,教师模型为学生模型生成的两种压缩目标:保留原文或转为潜在表示。 |
| Achieved-CR Selection Protocol | 实际压缩率选择协议,一种根据实际达到的压缩率来评估和选择模型配置的准则。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅