提出ActReview,基于反驳引导的训练数据和评分奖励生成可操作同行评审。
| ActReview | 一个基于反驳引导的后训练框架,用于生成可操作的同行评审反馈。 |
| Actionable Peer-review Generation | 生成不仅指出弱点还提供具体修改建议的评审反馈的任务。 |
| Rebuttal-guided | 利用作者对审稿意见的反驳来指导模型训练,以提取可行的修改行动。 |
| GRPO | 一种强化学习优化算法,用于根据特定评分奖励微调语言模型。 |
| ActReview-Bench | 一个包含1000个人工策划实例的基准,用于评估评审生成的诊断质量和修改有用性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅