本文提出了一种名为"模态动态字体"(Modal Kinetic Typography)的新方法,旨在让矢量字形在表达语义概念的同时保持可读性。其核心思路是从字形自身的自然振动模态出发构建运动:通过对矢量轮廓构建有限元特征值问题,提取整个字母及各组成部分的最软模态,使字形能够弯曲变形;同时利用零能量解(即刚性平移和旋转)以闭式解驱动各部件作为整体移动。在动画生成阶段,冻结的视频扩散模型仅监督各模态的振幅与相位。该方法针对已有工作的两大缺陷做出改进:一是自由形式的点优化在视频分数蒸馏下会沿噪声梯度独立移动各点与各帧,导致轮廓撕裂和抖动,而模态方法沿轮廓平滑且仅由少数整周期谐波驱动,从而限制梯度产生平滑、无缝循环的运动;二是依赖骨架或关键点的结构化方法需要类别特定的先验,而本方法的模态直接来自字形本身,唯一先验是由语言模型为整个字母表一次性生成的各字母运动部件列表。该方法在构造上实现了形状与运动的解耦,单一基础轮廓被塑造以贴合概念,而模态驱动不会改变轮廓,因此字母也可在不变形的情况下被动画化。实验表明,与Dynamic Typography和AniClipart相比,本方法生成的运动更具关节感和流畅性,概念对齐度相当或更优,字形撕裂更少,并在人类评估中更受偏好,包括在冻结形状、仅靠运动传达概念的设定下;其结果在人类评分中也优于Astra(GPT-6)。
| 模态动态字体 | 一种利用字形自身振动模态来生成动画的字体设计方法,旨在表达语义概念的同时保持可读性。 |
| 有限元特征值问题 | 一种数值方法,用于计算字形轮廓的振动模态,得到其最软的变形模式。 |
| 视频分数蒸馏 | 一种优化技术,利用预训练视频扩散模型的分数函数来指导点或帧的移动,但可能导致轮廓撕裂和抖动。 |
| 冻结视频扩散模型 | 一个预训练且参数固定的视频生成模型,用于监督模态的振幅和相位,而不更新其权重。 |
| 形状与运动解耦 | 在模态动态字体中,基础轮廓的雕塑与模态驱动的运动相互独立,使得字母可以在不改变形状的情况下被动画化。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅