本研究评估了大语言模型在决策任务中对提示扰动的鲁棒性,重点关注偏见与幻觉问题。研究发现,与以往研究结论不同,提示扰动在某些模型中有助于减轻偏见和幻觉,而非加剧问题。在多个数据集的任务表现上,Claude 3 整体效果最佳,GPT-3.5 则表现参差不齐,部分任务可与之相当,部分任务明显落后。该研究为理解基于大语言模型的决策辅助工具在实际部署中的可靠性提供了重要参考,强调在关键决策场景中需进行严格的测试与验证,以确保AI助手的可信度与有效性。
| Prompt Perturbation | 对原始输入提示进行微小修改(如改写、增删词),以测试模型输出的稳定性与鲁棒性。 |
| Bias | 模型输出中系统性地偏向某些群体、观点或答案,导致不公平或不准确的结果。 |
| Hallucination | 模型生成看似合理但实际错误或虚构的内容,与事实不符。 |
| Robustness | 模型在输入发生扰动或变化时,仍能保持性能稳定的能力。 |
| Decision-making Tasks | 需要模型基于信息做出选择或判断的任务,如问答、推荐、分类等。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅