用可验证行为给AI教学对话打标签,宏F1达0.673!
EduBehaviors: Assertion-based Schemas for Auditable Coding of Educational Dialogues
arXiv CL (cs.CL) 重要 #可解释性#教育对话#数据标注 🕐 今天 12:00

📖 AI 总结

本文提出EduBehaviors框架,旨在解决大语言模型用于教育对话标注时推理过程不透明、难以验证的问题。该框架采用可解释、可扩展的思路:先利用大语言模型识别对话中反复出现的可观察行为,再基于这些行为特征训练分类器,从而对目标构念进行预测,使标注过程具备可审计性。研究在TalkMoves数据集上评估该框架,用于预测教师话语行为标签,最佳配置取得0.673的宏平均F1值和0.688的Cohen's kappa系数,与直接提示方法相比具有竞争力。作者同时发布了EduBehaviors Toolkit,包含两个工具,便于研究者在自有数据上应用该框架。这项工作为教育对话的自动化标注提供了兼顾准确性与可解释性的新路径。

🔑 关键词速览

EduBehaviors一种可解释、可扩展的教育对话标注框架,通过LLM测量可观察行为并学习分类器。
TalkMoves一个用于教育对话分析的数据集,包含教师话语动作标签。
macro-F1一种评估指标,计算每个类别的F1分数后取未加权平均值,适用于类别不平衡场景。
Cohen's kappa衡量标注者间或模型与金标准之间一致性的统计量,校正了随机一致的概率。
LLM大型语言模型,基于海量文本训练的深度学习模型,能生成自然语言文本。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅