本文提出 AdapToC,一个面向视觉重建的自适应视觉 token 通信框架,旨在突破现有方法依赖静态策略、且以 token 级准确率为优化目标却未必提升图像重建质量的局限。该框架在发送端联合建模图像内容、信道状态与通信预算,实现实例级资源分配,动态决定传输 token 数量,并依据 token 重要性和信道条件分配差异化保护等级;在接收端引入自适应 MaskGIT 接收器,将信道可靠性纳入上下文 token 建模,区分不同可靠程度的 token,保留高置信观测、纠正可能受损的 token,并迭代重建缺失内容。通过协同设计 token 数量、非等重保护与可靠性感知恢复,AdapToC 在相同通信开销下相较最强静态基线取得最高 4.20 dB 的平均 PSNR 增益,在所评估的视觉 token 通信方法中达到领先水平。该工作表明,以重建质量为导向、兼顾内容与信道的自适应策略,比单纯追求 token 准确率更能有效提升视觉传输性能。
| 视觉令牌通信 | 将图像编码为离散令牌进行传输的通信范式,可提升传输效率。 |
| AdapToC | 本文提出的自适应、面向重建的视觉令牌通信框架。 |
| MaskGIT | 一种基于掩码生成式图像Transformer的模型,用于迭代重建图像。 |
| 不等保护 | 根据令牌重要性分配不同保护级别的信道编码策略。 |
| PSNR | 峰值信噪比,衡量图像重建质量的常用指标,值越高表示质量越好。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅