HakemBench 是一个土耳其语“类型化决策”基准,要求被测模型在给定文本、问题和固定选项后,为每个选项输出概率。其 1.0 版以 CC BY 4.0 协议完全开放,包含 2,346 个条目、4,275 道选择题、是非题和评分题,覆盖事实核查分流、教育、护栏、法律路由、内容审核、垃圾与钓鱼邮件、客户支持七个领域。评测框架同时衡量决策质量(宏 F1)、校准度(归一化 Brier 分数)和选择性自动化(归一化广义风险—覆盖率曲线下面积),以几何平均合成,并用 2,000 次自助抽样给出区间,另附选项顺序、改写、英译和替换人名等探针。多数金标签来自单一 AI 模型家族的盲测与其他家族大模型投票的比对,未经人工核验。在 16 行榜单上,最高综合分为 0.888,而作者所在实验室的模型以 0.660 位列第七,且其成绩并非盲测:早期测试结果影响了其训练数据,因此护栏、审核和客户支持三项被标记;若仅按其余四个领域计分,其综合分为 0.678,在 16 个模型中排第六。
| HakemBench | 一个土耳其语的类型化决策基准,用于评估模型在给定文本、问题和选项下返回概率的能力。 |
| 宏 F1 | 一种评估指标,计算每个类别的 F1 分数后取未加权平均值,适用于多分类问题。 |
| Brier 分数 | 衡量概率预测校准程度的指标,值越小表示预测概率越接近实际结果。 |
| 风险-覆盖率曲线 | 用于评估选择性预测性能的曲线,展示在不同覆盖率下模型的风险(错误率)。 |
| 自助抽样 | 一种重采样技术,通过有放回地抽取样本估计统计量的分布,常用于计算置信区间。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅