华为团队在EMNLP Industry Track 2026发表PrismAlign工作,针对视觉语言模型在复杂版式、低质扫描和跨语言混排场景下稳定产生幻觉的问题,提出多视角立体对齐框架。该方法借鉴人类双目立体视觉先验,以多个VLM对同一版面做差异化观测,再通过贝叶斯决策层进行一致性对齐,仅在多视角达成高置信共识时输出结果,否则回退至保守标记。文章指出,文档结构化提取的字段级错误率正从10⁻¹向10⁻²乃至更低量级收敛,每一次数量级下降都意味着幻觉风险的实质收缩。这一思路将文档感知从单模型蛮力优化转向多通道共识,与通信、计算领域的范式演进同构,为提升结构化提取精度提供了系统层解法。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅