本文提出GVD框架,旨在解决文档库持续演化过程中版本管理、重复检测与矛盾识别相互割裂的问题。现有研究通常将这三类任务视为孤立的成对比较,且仅停留在标注层面。GVD通过双向规则对齐将新文档归入版本家族,并与家族记忆比对,识别重复、矛盾、非对称细化和新增知识,同时引入反事实跨度探测(CSP)纠正被误判为中立的关联对。该框架依据关系类型制定策略,抑制重复内容,仅将实质性变更提交人工审核,并保留版本谱系作为审计线索。整个流程完全本地运行,无需大语言模型。在120份企业文档、59个版本家族、140次入库的测试中,版本家族构建F1达0.97,规则级一致性F1达0.94,CSP将后者从0.90提升至0.94。该工作为文档库治理提供了统一、可审计且不依赖大模型的解决方案。
| GVD (Governed Versioning and Deduplication) | 一种在可审计更新策略下统一跨文档版本链接与规则级冲突解决的框架。 |
| Counterfactual Span Probing (CSP) | 一种用于解决推理误分类为中立的相关对的反事实跨度探测方法。 |
| Version Family | 通过双向规则对齐将传入文档分组形成的版本集合,用于追踪文档的版本谱系。 |
| Rule-level Consistency | 衡量文档规则之间在重复、矛盾、细化等关系上保持一致性的指标。 |
| Bidirectional Rule Alignment | 一种将传入文档的规则与版本家族记忆进行双向比对,以确定其所属版本家族的方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅