LLM编码行为差异大揭秘:CLIC用词元频率分析10个模型在22个任务上的表现!
Token Signatures of Code: Comparing Coding Behaviors Across Large Language Models
arXiv CL (cs.CL) 重要 代码生成评测基准论文方法 🕐 今天 12:00

📖 AI 总结

该研究指出,随着大语言模型在编程任务上普遍达到基线性能,传统的pass@k等指标已难以区分模型差异,因此转向探究模型编码行为的本质区别。作者提出CLIC方法,将代码样本表示为token频率特征向量,并训练可解释决策树来区分不同模型的代码集,同时定义了两个新指标:鲁棒性(衡量在逐步移除最具区分度token后模型是否仍可区分)和集中度(衡量差异由少数主导token还是大量token共同驱动)。为处理跨模型对、任务和分词层级的多尺度比较,研究还开发了交互式可视分析系统。通过对10个模型在22个Kaggle机器学习任务上的案例研究,揭示了可用于模型选择与提示工程的实际洞见。

🔑 关键词速览

CLIC (Code Learning for Identification and Comparison)一种通过词元频率分析来刻画和比较LLM编码行为的可视分析方法。
pass@k评估代码生成模型性能的常用指标,表示模型生成的k个代码样本中至少有一个通过测试的概率。
token frequency代码样本中每个词元(token)出现的次数,用于将代码表示为特征向量。
robustness本文提出的指标,衡量当最具区分性的词元被逐步移除时,两个LLM是否仍可区分。
concentration本文提出的指标,衡量两个LLM之间的差异是由少数主导词元驱动,还是分散在许多词元上。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅