🔥 今日值得一读 16个模型两两互测,树状推理经语言瓶颈后还剩多少?
The Communication Bottleneck: A Round-Trip Study of Tree-Structured Expression Serialization in Language Models
Apple ML Research 🔥 重点 论文方法大模型推理 🕐 09-29 08:00

📖 AI 总结

该研究探讨语言模型在链式思维推理或文本中间交换中,将结构化信息序列化为自然语言时所面临的信息瓶颈。作者提出一种往返协议,通过生成器将算术表达式转为文字题、提取器再从文字题还原表达式,并以符号等价作为精确评判标准,系统评估了十六个模型的全部两两组合。结果显示,这一通信通道存在明显有损性和不对称性:交换生成与提取角色可使准确率相差高达60.4个百分点,最佳组合由不同模型搭配实现,达到92.9%。至少73.6%的失败源于生成端,且难度主要由树结构特征驱动,而非模型家族。研究还发现该通道可通过约3600条微调样本显著改善,使所有开放权重模型超过未训练的Gemini-3.1-Pro,并在新算子与词汇的跨域设定中同样有效。该工作将树结构表达式序列化识别为模型通过自然语言传递层次结构时的关键限制因素。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅