TEFM 是一套面向关键领域结构化数据分析的建模框架,旨在同时解决大语言模型应用中的两大障碍:token 效率与忠实性。该方法通过将冗长的结构化观测压缩为紧凑的“行为代码”token,在大幅降低 token 消耗的同时将信息损失控制在较低水平;并通过双重保真目标,联合优化代码级重构与预测级保真,从而识别出基于输入数据的最小充分特征子集,实现忠实的推理依据生成。在临床与安全等多个领域数据集及 Qwen3、Gemma-2、Phi-4 等模型骨干上的实验表明,TEFM 在保持有竞争力的分类精度的同时实现了显著的 token 缩减,临床领域 token 保留率约为 1%,安全领域约为 2%,并能输出忠实的推理依据。该工作为 LLM 在高风险场景中的高效、可信应用提供了可行路径。
| TEFM | 令牌高效忠实建模,一种用于关键领域结构化数据分析的框架,旨在同时提升令牌效率和模型忠实性。 |
| Behavioral Code tokens | 行为代码令牌,将冗长的结构化观测压缩成的紧凑表示,用于减少令牌消耗。 |
| Dual-fidelity objective | 双保真度目标,联合优化代码级重建和预测级保真度的训练目标,以生成忠实的推理依据。 |
| Token efficiency | 令牌效率,指在保持模型性能的同时减少输入或输出中令牌数量的能力。 |
| Faithfulness | 忠实性,指模型生成的推理依据或解释真实反映其预测依据的程度。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅