该研究指出,随着大语言模型在编程任务上普遍达到基线性能,传统的pass@k等指标已难以区分模型差异,因此转向探究模型编码行为的本质区别。作者提出CLIC方法,将代码样本表示为token频率特征向量,并训练可解释决策树来区分不同模型的代码集,同时定义了两个新指标:鲁棒性(衡量在逐步移除最具区分度token后模型是否仍可区分)和集中度(衡量差异由少数主导token还是大量token共同驱动)。为处理跨模型对、任务和分词层级的多尺度比较,研究还开发了交互式可视分析系统。通过对10个模型在22个Kaggle机器学习任务上的案例研究,揭示了可用于模型选择与提示工程的实际洞见。
| CLIC (Code Learning for Identification and Comparison) | 一种通过词元频率分析来刻画和比较LLM编码行为的可视分析方法。 |
| pass@k | 评估代码生成模型性能的常用指标,表示模型生成的k个代码样本中至少有一个通过测试的概率。 |
| token frequency | 代码样本中每个词元(token)出现的次数,用于将代码表示为特征向量。 |
| robustness | 本文提出的指标,衡量当最具区分性的词元被逐步移除时,两个LLM是否仍可区分。 |
| concentration | 本文提出的指标,衡量两个LLM之间的差异是由少数主导词元驱动,还是分散在许多词元上。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅