GLARE新方法让AI预测会议走向,人类评估胜率高达0.66!
GLARE: Generative Learning via Adversarial Reward Estimation For Social Dynamics Forecasting
arXiv AI (cs.AI) 重要 #生成模型#社会动态#评测基准 🕐 09-14 12:00

📖 AI 总结

该研究针对多方会议中长程动态预测的难题,提出了会议动态预测基准MDFB,该基准由2207场真实会议和24794条面向未来的查询构建而成。任务要求模型在给定对话前缀和当前问题的条件下,一次性生成合理的多轮对话延续,并从效用性(向问题推进的程度)和拟人性(对话流畅度与角色一致性)两个维度进行评估,而不要求精确复现真实未来。为此,作者提出GLARE方法,将对抗式模仿学习引入条件语言生成:判别器将真实延续排在当前策略采样之上,其评分经KL正则化后作为策略奖励,并通过在当前策略生成的负样本上重新训练,使奖励景观随策略演化。实验显示,GLARE在效用性和拟人性上的人工评估胜率分别达到0.66和0.70,优于SFT和SPIN,但仍低于真实人类延续。该工作同时表明MDFB可作为社会推理评测平台,用于比较包括闭源系统在内的通用模型。

🔑 关键词速览

MDFB会议动态预测基准,由真实会议记录和未来导向查询构成,用于评估模型生成多轮会议续写的能力。
GLARE一种生成学习方法,通过对抗性奖励估计将对抗模仿学习应用于条件语言生成,以提升会议续写的效用和拟人性。
对抗性模仿学习一种模仿学习框架,通过判别器区分专家演示和生成样本,并利用其反馈来训练生成策略。
KL正则化策略奖励在强化学习中,对策略更新施加KL散度约束的奖励信号,以防止策略偏离参考策略过远。
社会推理竞技场指MDFB作为评估平台,通过参考辅助判断来比较不同通用模型(包括闭源系统)在会议行为上的社会推理能力。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅