本研究探讨了能否从脑电图(EEG)信号中重建视觉刺激,针对头皮测量空间分辨率有限、配对数据稀缺的难题,在THINGS-EEG2数据集上建立了一个可复现的单被试基线。研究首先检验EEG能否在视觉嵌入空间中检索所观看的刺激,采用紧凑的时空卷积编码器将重复平均后的EEG映射到ViT-B/32图像特征。结果显示,在三个训练种子下,模型在Top-1、Top-5和Top-10的图像召回率分别达到12.83%、39.17%和58.00%,显著高于0.5%、2.5%和5.0%的随机水平。消融实验表明增加测试重复次数可提升排序性能,而跨被试迁移则导致性能急剧下降,凸显被试特异性。直接条件生成器的探索性测试产生噪声主导的输出,训练早期改善后迅速反转。研究表明,在闭集、重复平均协议下可实现高于随机的粗略语义解码,但尚不支持对刺激像素的忠实恢复。
| EEG | 脑电图,通过头皮电极记录大脑电活动,具有高时间分辨率但低空间分辨率。 |
| THINGS-EEG2 | 一个公开的EEG-图像配对数据集,包含多名被试观看THINGS图像库中物体图片时的脑电记录。 |
| ViT-B/32 | 一种视觉Transformer模型,将图像分割为32×32像素块并提取512维特征表示。 |
| 图像召回率(Image Recall) | 在检索任务中,正确图像出现在前K个检索结果中的比例,常用Recall@1、Recall@5等衡量。 |
| 扩散先验(Diffusion Prior) | 预训练的扩散模型,用于从语义嵌入生成图像,此处用于语义渲染而非直接像素重建。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅