本文提出 LongSocialBench,一个用于评估长上下文大模型理解在线讨论串结构与社会语境的基准。该基准包含 1,462 道经人工验证的选择题,取材于 Hacker News、Stack Exchange 和 Reddit r/ChangeMyView 的 94 个完整讨论帖,中位长度约 73K token。题目要求模型追踪父子回复关系、转折点、局部子树、跨分支对比及参与者行为轨迹,而非仅阅读长文本。研究测试了 18 个模型、29 种评估设置,结果显示当前长上下文工作流远低于人类水平:最佳单模型 Claude-Opus-4.7 在提示先排除错误选项后达到 63.0%,而独立人类读者为 72.4%;全上下文基线平均仅 43.9%,即使提供金标证据范围也只提升至 55.0%。这表明模型欠缺的不是上下文访问或提示技巧,而是对结构化回复树的社会性理解能力。
| LongSocialBench | 一个用于评估长上下文大语言模型理解在线讨论帖中社会话语能力的基准测试。 |
| 长上下文大语言模型 | 能够处理极长输入序列(如数万词元)的大语言模型,但可能仍缺乏对结构化社会信息的推理能力。 |
| 结构感知的社会推理 | 模型理解讨论中回复树结构(如父子关系、分支对比)并进行社会话语推理的能力。 |
| 金标准证据范围 | 在评估中,人工标注的与问题相关的讨论区域,用于测试模型在已知相关范围时的表现。 |
| 全上下文基线 | 模型在接收完整讨论帖上下文时的平均表现,作为评估的基准参考。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅