该研究提出将大语言模型的“幻觉”能力视为一种特征而非缺陷,并设计了一个基于Rust的多智能体架构,将高熵生成智能体与基于网络检索的评估智能体相结合,通过低熵语义瓶颈实现“认识论摩擦”循环,以生成可检验的科学假设。实验在物理和社会科学领域生成了多样且可行性评级的假设,并进行了包含六种条件的配对基线与消融研究。结果显示,直接提示在所有指标中表现最弱,但完整系统并未普遍优于简单的自我反思方法;各架构在原创性、可行性、多样性和实证基础之间各有侧重。完整系统的主要优势体现在假设需满足严格的物理、实证或制度约束时。研究结论强调,幻觉本身并非孤立有用,只有在架构约束、实证基础和明确评估的共同作用下,推测性生成才具有价值。
| Hallucination | 在LLM中,指模型生成不基于事实或输入信息的虚构内容。 |
| Multi-agent orchestration | 一种系统设计,通过多个智能体协作完成任务,每个智能体负责不同功能。 |
| Epistemological Friction loop | 本文提出的机制,通过高熵生成与低熵评估之间的对抗性交互来优化输出。 |
| Semantic bottleneck | 一种低熵过滤器,用于减少生成内容中的噪声和重复,提高信息密度。 |
| Ablation study | 一种实验方法,通过移除系统组件来评估其贡献。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅