该文对圣训计算科学在大语言模型时代的发展进行了批判性叙事综述。研究发现,该领域进展不均衡:数据资源有所扩充,文本分割任务趋于成熟,叙述者与来源验证问题得到更清晰的界定,大语言模型辅助工作流已支持语料库规模扩充、多语言访问和基于证据的评估。然而,进展仍受限于语料库范围狭窄、基准可比性薄弱、从合成数据到真实应用的迁移差距、叙述者身份消解困难、预处理脆弱、可复现性有限以及缺乏专家验证等问题。作者指出,关键缺口存在于主流基准之外,包括非正典语料、注释性文献、与古兰经和先知传记的跨源关联,以及教法证据支持。文章主张,圣训计算不应被孤立地视为模型性能问题,而应作为证据基础设施问题来评估,需要知识整合、来源追踪和专家监督,并据此提出了强化方法论和提升对伊斯兰学术实用性的研究议程。
| Hadith computational science | 圣训计算科学,利用计算方法研究伊斯兰圣训文本的学科。 |
| Transformer models | Transformer模型,一种基于自注意力机制的深度学习架构,广泛用于自然语言处理。 |
| Retrieval-grounded pipelines | 基于检索的流水线,结合信息检索与生成模型,以提高输出准确性和可追溯性。 |
| Large language models (LLMs) | 大型语言模型,如GPT系列,通过海量数据预训练,能执行多种语言任务。 |
| Benchmark-bound | 受限于基准测试,指研究仅针对特定数据集优化,缺乏泛化能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅