本文研究在条件独立性检验中,用嵌入表示替代原始文本或图像变量所引入的偏差问题。作者指出,当以嵌入ψ(Z)代替Z进行检验时,若Z在给定ψ(Z)下与X或Y不独立,则原假设下的拒绝概率可能趋近于1,而这一前提无法从数据中验证。针对残差相关性检验,作者证明检验的有效性仅需被嵌入遗漏的E[X|Z]与E[Y|Z]部分不相关,并将被丢弃的信息视为遗漏变量,推导出原假设下偏差等于遗漏部分绝对相关性与两个偏R²几何均值的乘积。据此提出一种在给定容差下稳健的检验方法,该容差类似敏感性参数,无法由数据识别。合成数据与文本嵌入实验表明稳健检验能近似保持水平,但在语言模型生成的文本上,即使原假设精确成立,任何嵌入(包括生成器自身状态)都会使检验产生偏差。
| 条件独立性检验 | 检验在给定第三个变量(如文本或图像)时,两个变量是否相互独立。 |
| 嵌入偏差 | 当用嵌入表示代替原始变量进行条件独立性检验时,由于嵌入丢失信息而导致的检验偏差。 |
| 广义协方差测度 | 一种用于检验条件独立性的方法,基于残差的相关性。 |
| 偏 R² | 衡量一个变量在控制其他变量后对另一个变量的解释程度。 |
| 稳健检验 | 在模型假设不完全成立时仍能保持良好性质的统计检验。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅