火山引擎多媒体实验室推出全新语音内容编辑模型,将语音编辑从传统的波形处理推进到语义级修改。用户只需用自然语言指令表达修改意图,如“把败血症改成坏血病”,模型即可实现词级替换,无需整段重录。该模型基于自研底座构建,通过音频Tokenizer将声音转为离散Token,结合指令进行CoT式语义规划,再生成修改后的语音,同时引入原音频声学与说话人特征作为参考,以保持音色、韵律和衔接的自然度。这一能力补上了“语音内容可编辑”的关键环节,适用于口播纠错、广告改词、配音调整及存量素材再编辑等场景,有望将音视频修改从“重新制作一次”变为“直接说明要改哪里”,显著降低内容生产的返工成本。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅