Periscope是一种无需训练的推理方法,旨在让冻结参数的语言模型突破上下文窗口限制。其核心思路是将长文本切分为N个片段并排列成K×K网格,向模型提出关于连续片段和跨文本采样片段的相同问题,通过读取单一token的对数几率获得答案,并据此生成证据图,定位答案对应的片段。该方法使每个探测仅需约√sc个token,在s个token的文本上以s^1.5的计算成本实现W²/c的有效覆盖。在LongBench v2上,仅读取证据图排名最高的9k token即可匹配模型在32k至1M窗口下的最佳表现;在InfiniteBench上领先最佳窗口读取5个百分点,并在BRIGHT长文档检索任务中取得六种方法中最高的NDCG@10。由于每次调用仅缓存一个探测,27B模型可在单张80GB GPU上处理4.5M token上下文,而单次前向传播需296GB缓存。该工作表明长文本推理所需的是能容纳模型的GPU,而非能容纳文本的GPU。
| Periscope | 一种免训练的推理方法,通过将长文本分块排列成网格并探测局部与跨步片段,实现超越上下文窗口的长文本读取。 |
| 上下文窗口 (Context Window) | 语言模型单次前向传播能处理的最大 token 数量,超出后模型无法直接读取。 |
| 证据图 (Evidence Map) | 通过为每个文本块的两个片段评分生成的映射,其峰值指示答案所依据的文本块。 |
| LongBench v2 | 一个评估长上下文语言模型能力的基准测试数据集。 |
| NDCG@10 | 归一化折损累计增益,一种衡量排序质量的指标,此处用于评估文档检索性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅