苹果研究团队提出Glyph系统,旨在解决企业数据湖中列描述缺失与治理标签未标注的“文档债务”问题。该系统将列描述生成与列类型标注两个耦合任务建模为协作式LLM智能体,并以有状态图进行编排。描述器通过主动检索增强生成,从企业GitHub按需获取生成该列的管道源代码,使生成内容有据可依;标注器则并行运行描述标注、业务线正则标注和元数据标注三种策略,其中元数据标注依托经对比学习微调的编码器与向量数据库,再通过倒数排名融合整合排序结果,从受治理的275叶数据分类本体中分配标签。研究显示,微调后的六层MiniLM编码器在同分布留出集上将同标签检索的NDCG@10从0.55提升至0.92,MAP@100从0.19提升至0.90。论文还报告了以召回加权F2为目标的端到端多标签标注质量、各策略与融合机制的消融实验,以及无值化、代码溯源、逐标签来源追踪和优雅降级等工程决策。这些设计使多智能体LLM编目具备可审计性,并可作为生产服务稳定运行。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅