该研究提出了一套完整、可扩展的开源流程,用于层级结构因果模型(HSCM)的因果效应识别与估计,并以1985年美国田纳西州的STAR实验(班级规模对学生成绩的影响)为应用案例。研究将符号识别与数值估计相结合,利用图变换和pyAgrum的do-calculus自动识别因果效应,并将识别出的符号表达式转化为封闭式HSCM公式,再通过适配的抽象语法树(AST)分解为独立的密度、期望和边际化任务,实现并行计算。在基准场景验证后,应用于STAR幼儿园数学成绩数据,发现忽略层级结构的扁平化基线虽能恢复关联,却无法编码班级层面的干预效应;同时,仅靠符号识别不足以支撑实际推断,可扩展的估计方法与数值稳定性检验是科学分析的核心环节。
| Hierarchical Structural Causal Models (HSCM) | 分层结构因果模型,一种扩展了结构因果模型以处理嵌套数据(如学生嵌套于班级)的框架,用于编码层级间的干预效应。 |
| do-calculus | do演算,一种用于从因果图中推导干预效应的符号推理规则系统,由Pearl提出,用于识别因果效应。 |
| Abstract Syntax Tree (AST) | 抽象语法树,一种树形数据结构,用于表示表达式的语法结构,此处被改编以分解因果公式,便于并行计算。 |
| pyAgrum | 一个开源Python库,提供概率图模型和因果推断工具,包括do-calculus的实现,用于自动识别因果效应。 |
| Project STAR | 学生-教师成就比率实验,一个著名的随机实验,研究班级规模对教育成果的影响,数据具有分层结构。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅