ZipTok3D提出了一种面向3D生成的高保真token化方法,核心目标是解决极短token序列下重建质量严重退化的问题。该方法将物体几何组织为渐进信息增强的全局token前缀,并通过迭代解码展开这些紧凑表示。训练中采用嵌套dropout随机截断潜在序列,要求每个保留前缀都能重建完整物体,从而迫使前置token优先承载关键几何信息;解码器则通过参数共享的Transformer块反复细化几何细节,无需额外生成采样阶段。实验表明,在相同token维度下,ZipTok3D仅用1个token即可达到COD-VAE用32个token在ShapeNet上的重建质量,在TRELLIS上则用4个token实现同等效果,token序列分别缩短32倍和8倍,显著提升了3D生成的效率与保真度。
| 3D tokenizer | 将3D对象(如网格或点云)转换为离散令牌序列的模型,用于3D生成任务。 |
| token prefixes | 令牌序列的前缀部分,ZipTok3D利用前缀逐步携带更丰富的信息以重建完整对象。 |
| nested dropout | 一种训练策略,随机截断潜在序列,强制每个前缀都能重建完整对象,从而优先编码重要信息。 |
| COD-VAE | 一种现有的3D分词器基线,使用固定数量的令牌(如32个)进行重建。 |
| Transformer block | 基于自注意力机制的神经网络模块,ZipTok3D中用于迭代解码以恢复细粒度几何。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅