LLM辩论死穴:只会讲逻辑,不会人身反击!
Benchmarking Argumentative Behaviour of LLMs: A Study of Defences Against Character Attacks
arXiv CL (cs.CL) 重要 #辩论#评测基准#说服对话 🕐 今天 12:00

📖 AI 总结

本研究考察大语言模型在政治说服性对话中应对人格攻击(ad hominem)的论辩能力。作者从自然语言政治对话语料中提炼出人类辩手常用的防御策略,构建对话博弈框架,并以美国大选辩论语料库ElecDeb60to16-fallacy为基准,将大模型生成的对话与人类辩手的策略进行对比。结果显示,多数大模型僵化地优先采用逻辑防御,未能像人类那样将人格层面的反击作为政治话语中的有效手段。作者认为,当前的安全微调限制了这些模型的策略行动空间,使其难以在人格交锋属于规范预期的领域中进行自然互动。该研究为评估大模型论辩能力提供了新基准,也揭示了安全对齐与论辩真实性之间的张力。

🔑 关键词速览

ad hominem arguments人格攻击论证,即针对说话者个人品格而非其论点内容的论证方式,传统上被视为谬误。
ethos人格信誉,指说话者通过展现自身品格、可信度或权威性来影响说服效果,是修辞学三大诉求之一。
dialogue game对话博弈,一种形式化框架,用规则和策略来建模对话中参与者的论证性互动。
ElecDeb60to16-fallacy corpus一个标注了谬误的美国选举辩论语料库,涵盖1960年至2016年美国总统辩论中的论证谬误。
safety fine-tuning安全微调,指在预训练后对LLM进行额外训练以使其输出符合安全规范、避免有害内容的技术。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅