PyTorch 对其媒体处理技术栈进行了整合,将原本分散在 TorchVision 和 TorchAudio 中的解码与编码能力统一收拢至 TorchCodec。过去,媒体 I/O 存在多个入口和多种后端,仅部分开箱即用,维护成本高且优化方向不明。整合后,TorchCodec 成为图像、视频、音频在 CPU 和 CUDA 上统一的编解码入口,旧有 API 被弃用或移除。这一调整带来三方面收益:用户无需再判断该用哪个库的解码器;开发资源集中,性能优化更高效,尤其在 CUDA 视频解码上表现更优;依赖管理更简单。与此同时,媒体变换仍由 TorchVision 负责图像和视频、TorchAudio 负责音频,而模型、数据集等功能则交由 HuggingFace 等更广泛生态承担。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅