数据融合新突破:跨群体误差变量校正,相关系数偏差竟如此小!
Data Fusion for Errors-in-Variables
arXiv ML (stat.ML) 重要 #变量误差#数据融合#因果推断 🕐 今天 12:00

📖 AI 总结

本文研究变量含误差(errors-in-variables)问题:目标研究仅含未观测暴露的单一易错替代变量,而外部来源研究提供了来自不同总体的重复替代测量。作者允许测量误差分布依赖于已观测的无误差变量,且无误差变量分布本身可在研究间存在差异,并提出条件可迁移性假设,使外部重复测量能在源—目标异质性下被利用,结合额外的重复误差条件识别出目标的条​​件测量误差分布。基于该识别结果,作者构建了适用于广泛目标泛函的数据融合估计量,融合条件反卷积、灵活冗余参数估计与正交校正以降低一阶敏感性。理论上给出统一谱理论,覆盖扩散谱与有限原子谱两类目标泛函,建立渐近展开、相合性及依赖于测量误差、潜在暴露与目标泛函谱性质的收敛速率界;对有限原子谱目标进一步建立联合高斯与自助极限。模拟显示Fuse-EIV在主要暴露相关系数上偏差较小,应用于美国国家健康与营养调查表明,考虑总体异质性与误差异方差性可能改变实证结论。

🔑 关键词速览

Errors-in-Variables变量误差问题,指回归模型中自变量存在测量误差的统计问题。
Conditional Transportability条件可迁移性,一种允许在源总体和目标总体异质性下借用外部信息的假设。
Conditional Deconvolution条件反卷积,一种从观测到的替代变量分布中恢复潜在变量条件分布的方法。
Orthogonal Correction正交校正,一种减少估计量对冗余参数估计一阶敏感性的技术。
Spectral Theory谱理论,研究算子谱性质以分析估计量收敛速率的数学框架。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅