字节跳动放出 Seed Audio 1.0:给视频配音,AI 不再只会「念稿」

字节跳动 Seed Audio 1.0 音频创作模型
Seed Audio 1.0 用统一框架联合建模人声、音效与环境声(概念图)

做短视频、短剧的人大概都有过这种崩溃:画面拍好了,配一段像样的音效比写脚本还费劲。人声要去录音棚,环境声要现找素材,音效还得一笔笔手动对时间轴。7月20日,字节跳动 Seed 团队丢出一个叫 Seed Audio 1.0 的模型,想把这个流程一口气吞掉。

它不是拼接,是「一起想」

过去这类工具大多是各管一摊:一个模型生成人声,一个模型找音效,最后人工混音。Seed Audio 1.0 的卖点在于,它在一个统一框架里同时建模人声、音效和环境声,端到端直接产出一段能拿来叙事的完整声音。官方一句话挺妙:声音不再只是画面的补丁,而是能直接参与讲故事,「听见」即「看见」。

具体有三个本事。第一是精细的时间编排,按时间线控制对白和音效什么时候进场,精度能到 100 毫秒,做视频配音和广告卡点刚好。第二是音色稳,支持零样本生成和长音频延展,一个角色从头到尾音色不变,还能同一声音演多个角色、带不同情绪。第三是语种全,覆盖中文、英文、日语等 20 多种语言,重音和节奏都按当地习惯来。

官方评测显示,在影视、短剧、动漫、播客等多数场景里,音频可用率已经跑到 90% 以上;多语言自然度方面,大部分语种 MOS 评分超过 4 分,算优秀水平。

从「会说」到「会创作」

这中间的区别挺关键。早几年的语音合成,本质是把文字念出来,语调再自然也还是「读稿」。Seed Audio 1.0 瞄准的是创作——你给一条指令,它自己安排谁说话、什么情绪、背景音怎么铺、什么时候淡入。对短剧和动漫团队来说,这意味着原本要分几个工种、花几天的活,可能压缩到一轮生成。

  • 影视级音频:对白、音效、环境声统一编排,叙事更连贯
  • 可控音色:长音频保持一致,同一声音可演多角色
  • 20+ 语种:自然生成,适配本地表达节奏

先上体验,后面还有大招

模型现在已经放在火山方舟体验中心,创作者能直接试。团队放话,接下来会接进视频参考这类多模态输入,还会做可控翻译、长音频和分轨生成,方向是把脑子里的声音构想更快变成能听见的成品。


大模型从文本、图像一路卷到音频,Seed Audio 1.0 是个信号:AI 音频正从单点工具走向全场景创作平台。对内容创作者,门槛又低了一截;对行业,竞争也从「谁念得真」变成「谁编得巧」。

📎 原文来源:字节跳动发布 Seed Audio 1.0 音频创作模型,多数场景音频可用率达 90% 以上(凤凰网科技)

评论

2 条对“字节跳动放出 Seed Audio 1.0:给视频配音,AI 不再只会「念稿」”的回复

  1. MWTAH51627 的头像
    MWTAH51627

    做短剧的同行应该最有感触——以前一段 3 分钟的成片,音效和配音能磨掉大半天。要是这玩意真能一轮出可用版本,小团队的产能至少翻倍。就等它分轨导出实不实用了。

  2. PRFKY42165 的头像
    PRFKY42165

    可用率 90% 听着漂亮,但「可用」和「好用」差得远。真拿去配正片,剩下那 10% 废片加上口型、情绪对齐,估计还得人工兜底。先观望,等社区实测再说。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注