🔥 今日值得一读 大模型分析结构化数据新突破:令牌保留率仅1%还能保持高准确率!
TEFM: Token-Efficient Faithful Modeling for Structured Data
arXiv CL (cs.CL) 🔥 重点 #LLM#结构化数据#Token压缩#可解释性 🕐 09-10 12:00
👨‍💼 主理人解读 · 为什么值得关注
处理日志、表格等结构化数据时,可用它压缩输入省token,同时让模型推理更可信。

📖 AI 总结

TEFM 是一套面向关键领域结构化数据分析的建模框架,旨在同时解决大语言模型应用中的两大障碍:token 效率与忠实性。该方法通过将冗长的结构化观测压缩为紧凑的“行为代码”token,在大幅降低 token 消耗的同时将信息损失控制在较低水平;并通过双重保真目标,联合优化代码级重构与预测级保真,从而识别出基于输入数据的最小充分特征子集,实现忠实的推理依据生成。在临床与安全等多个领域数据集及 Qwen3、Gemma-2、Phi-4 等模型骨干上的实验表明,TEFM 在保持有竞争力的分类精度的同时实现了显著的 token 缩减,临床领域 token 保留率约为 1%,安全领域约为 2%,并能输出忠实的推理依据。该工作为 LLM 在高风险场景中的高效、可信应用提供了可行路径。

🔑 关键词速览

TEFM令牌高效忠实建模,一种用于关键领域结构化数据分析的框架,旨在同时提升令牌效率和模型忠实性。
Behavioral Code tokens行为代码令牌,将冗长的结构化观测压缩成的紧凑表示,用于减少令牌消耗。
Dual-fidelity objective双保真度目标,联合优化代码级重建和预测级保真度的训练目标,以生成忠实的推理依据。
Token efficiency令牌效率,指在保持模型性能的同时减少输入或输出中令牌数量的能力。
Faithfulness忠实性,指模型生成的推理依据或解释真实反映其预测依据的程度。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅