本研究比较了两种知识表示方式在机器学习课程问答中的表现:一是向量检索增强生成(RAG),二是基于LLM编译的维基索引(Karpathy框架),后者在内容摄入阶段将课程语料合成为带交叉引用和来源标注的关联概念页面。研究基于同一课程语料,用59个问题测试,涵盖单事实回忆、跨单元概念关联、综合解释及大纲修订后的时效性,由LLM评委按人工评分标准打分。结果显示,两种方式在单事实问题上表现相当(9.33对9.96),但在需要跨单元关联的问题上差异显著:维基索引保持高准确性和来源可溯性(9.93,100%有据可查),而向量检索得分较低且依据性明显不足(8.14,64%)。研究表明,语料在摄入阶段的结构化方式可能比查询时的检索量更为关键,基于维基的结构有助于学生和教师追溯知识来源,对AI辅助机器学习教学具有实践参考价值。
| Retrieval-Augmented Generation (RAG) | 检索增强生成,一种将信息检索与语言模型生成相结合的技术,先从外部知识库检索相关文档,再基于检索结果生成回答。 |
| LLM-compiled wiki | 由大语言模型编译的维基,指在摄入阶段将语料库自动合成为相互链接的概念页面,并带有交叉引用和引文的知识表示形式。 |
| Grounding | 依据性/接地,指模型生成的回答有可靠来源支撑,而非凭空捏造,通常通过引用或检索到的材料来保证。 |
| Vector RAG | 向量检索增强生成,一种使用向量嵌入进行语义检索的RAG实现方式,将查询和文档映射到向量空间以查找相关内容。 |
| LLM judge | 大语言模型评判员,指使用大语言模型按照评分标准对回答质量进行自动评估的方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅