该研究关注韩国方言语料因不可再分发而导致的训练与评估复现难题,并提出基准KoDialectBench,包含五个地区、三个维度共1000个条目,以标识符哈希和评分代码形式发布,用户可基于自有授权副本重建数据。研究发现,合成数据的恢复效果高度依赖评估维度:最佳合成方案在地区识别上达到真实数据增益的91.2%,但在理解任务上仅为63.7%。生成任务的结果则取决于所用指标,部署的标记词典在方言度上报告92.3%,在地区匹配上高达119.3%,甚至超过真实数据参考值,而基于参考的生成仅为72.4%。作者进一步通过构造-不相交实验发现,当从规则中剔除20%标记类型后,方言度恢复率从91.8%骤降至8.1%,地区匹配从101.9%降至25.6%,但三项与流程无关的测量未下降。研究据此提出指标-构造覆盖度(MCC),并证明测量恢复率随MCC升高而单调上升,表明共享构造与评估清单会显著夸大合成数据的恢复估计。
| KoDialectBench | 一个韩语方言基准测试集,包含五个地区、三个评估轴的1,000个条目,以哈希和评分代码形式发布以保护数据许可。 |
| Metric-Construction Coupling | 指评估度量指标与数据构造过程共享相同的特征清单,导致测量结果被系统性高估的现象。 |
| Metric-Construction Coverage (MCC) | 一个量化评估度量与构造规则之间重叠程度的指标,范围从0到1,用于衡量度量偏差的风险。 |
| Construction-Disjoint Arm | 一种实验设置,通过从转换规则中扣留部分标记类型,使构造过程与评估清单不相交,以测试构造访问的影响。 |
| Synthetic Dialect Recovery | 指使用合成数据替代真实方言数据时,在各项任务上恢复真实数据性能增益的程度。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅