该研究针对扫描邮件、上传PDF等页面流需拆分文档的实际需求,提出多拆分边界决策(MSBD)方法。传统零样本大模型虽无需专门训练即可检测文档边界,但标准页面分类与边界决策每次调用仅能识别一个边界,效率受限。MSBD允许在单次调用中预测页面窗口内的多个边界,从而减少推理请求次数。研究在多种语言模型、文档集合、输入模态和窗口尺寸下进行评估,发现存在依赖模型与语料的操作区间:在该区间内MSBD保持较强分割准确率并显著提升推理效率,窗口过大则性能急剧下降。MSBD整体取得最佳的准确率与效率权衡,但大窗口下不同模型呈现过度分割与分割不足的差异行为。结果表明,针对目标语料选择合适窗口尺寸时,多边界预测可使零样本页面流分割更高效。
| Multi-Split Boundary Decision (MSBD) | 一种在单次模型调用中预测页面窗口内多个文档边界的方法,旨在减少推理请求次数。 |
| Page Stream Segmentation | 将连续的页面流(如扫描邮件或PDF)分割成独立文档的任务。 |
| Zero-shot Large Language Models | 无需针对特定任务进行训练即可直接用于文档边界检测的大语言模型。 |
| Page Classification (PC) | 一种标准的文档边界检测方法,每次模型调用仅判断一个页面是否属于边界。 |
| Boundary Decision (BD) | 另一种标准的文档边界检测方法,每次模型调用仅决定一个边界的位置。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅