本文提出一种面向企业结构化数据智能体的“潜在等价学习”框架,旨在解决智能体在复杂数据环境中反复重建跨模式结构、效率低下的问题。作者将持久化的任务相关身份与其在具体数据集中的实现相分离:由支持性与反对性证据塑造的高斯原型学习身份在特定环境中的表达方式,软隶属度剖面则保留硬分配所丢失的区分信息;另一套查询原型系统表示反复出现的证据需求,并通过学习到的兼容函数映射到同一身份结构。这种身份因子化、查询条件化的路由机制为下游推理直接提供已组织的证据状态。在涵盖12个异构数据集、54条查询的Data Agent Benchmark上,完整实现取得94.67%的数据集宏分层Pass@1(五次完整试验),原始查询成功258/270,显著高于基准参考智能体的55.51%,并在提交时位列40个榜单条目之首。该工作表明,将语义推理与结构预测分工,可有效提升企业数据智能体的准确率与稳定性。
| Latent Equivalence Learning | 一种将持久性任务身份与数据集特定实现分离的学习框架,用于桥接语义推理与结构预测。 |
| Support-Realized Gaussian Prototypes | 由支持性和反对性证据塑造的高斯原型,学习任务身份在特定数据环境中的表达方式。 |
| Soft-Membership Profiles | 软隶属度剖面,保留硬分配下丢失的区分信息,用于更精细地表示身份归属。 |
| Query-Prototype System | 一个学习系统,表示反复出现的证据需求,并通过兼容性函数映射到持久身份结构。 |
| Data Agent Benchmark | 一个包含 12 个异构数据集、54 个查询的基准测试,用于评估数据智能体的性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅