该研究针对波斯语缺乏统一对话基准的问题,提出了TALKFA基准,包含三个互补数据集:用于知识引导生成的4.2K维基百科对话、标注对话行为和情感的6.6K日常对话,以及带情感标签的2.1K戏剧对话。数据构建借助大语言模型辅助,但所有对话均经母语者多阶段审核修订,仅发布人工最终批准的版本。实验表明,LoRA微调仅需25%-50%训练数据即可恢复90%以上的性能提升;分类任务中FABERT在对话行为识别上最优,LoRA-MISTRAL-7B在情感识别上领先,MISTRAL-24B在情感分析上得分最高。人工评估与外部验证确认了基准可靠性,同时发现自动评估指标明显高估对话质量。零样本测试显示前沿大模型在该基准上仍具挑战性,研究将公开全部数据、标注指南、代码和模型权重。
| TALKFA | 一个统一的波斯语对话生成与理解基准,包含三个数据集。 |
| LoRA | 一种参数高效的微调方法,通过低秩适配器减少训练参数。 |
| FABERT | 一个针对波斯语优化的BERT模型,用于分类任务。 |
| LLM judge | 使用大型语言模型作为自动评估器来评判生成质量。 |
| Zero-shot evaluation | 在未见过的任务上直接评估模型性能,不进行额外训练。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅