CriticGen提出了一种面向大语言模型的细粒度、生成感知评估框架,旨在解决现有评估方法粗粒度且与生成过程脱节的问题。该框架首先在主观、客观及自设约束等高层类别下生成样本特定的评估维度和评分标准,再以此为动态准则,联合产出分数、理由、可执行的改进建议及改进后的答案。实验表明,细粒度评估需兼具实例特异性和可操作性:CriticGen生成的高质量准则将相关性/覆盖率从3.33/4.03提升至3.97/4.24,评分相关系数达0.9556(Pearson)和0.9560(Spearman),准则依据的理由与可执行建议的F1值分别从0.6369/0.5994升至0.7554/0.7900。其反馈能有效转化为答案改进,73.17%的答案得到提升,且93.28%的答案未出现退化,验证了该框架将评估转化为可操作控制信号的实用价值。
| CriticGen | 一种提出的细粒度、生成感知的评估框架,用于生成可操作的反馈以改进答案。 |
| generation-aware evaluation | 一种评估方法,考虑生成过程本身,使评估与生成任务紧密耦合。 |
| actionable feedback | 能够直接指导模型改进的具体建议,而非泛泛的评论。 |
| dynamic rubric | 根据具体样本动态生成的评分标准,用于指导评估和答案改进。 |
| non-degradation rate | 在改进过程中,答案质量未下降的比例,衡量改进的可靠性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅