标签: AI音频

  • 字节跳动放出 Seed Audio 1.0:给视频配音,AI 不再只会「念稿」

    字节跳动 Seed Audio 1.0 音频创作模型
    Seed Audio 1.0 用统一框架联合建模人声、音效与环境声(概念图)

    做短视频、短剧的人大概都有过这种崩溃:画面拍好了,配一段像样的音效比写脚本还费劲。人声要去录音棚,环境声要现找素材,音效还得一笔笔手动对时间轴。7月20日,字节跳动 Seed 团队丢出一个叫 Seed Audio 1.0 的模型,想把这个流程一口气吞掉。

    它不是拼接,是「一起想」

    过去这类工具大多是各管一摊:一个模型生成人声,一个模型找音效,最后人工混音。Seed Audio 1.0 的卖点在于,它在一个统一框架里同时建模人声、音效和环境声,端到端直接产出一段能拿来叙事的完整声音。官方一句话挺妙:声音不再只是画面的补丁,而是能直接参与讲故事,「听见」即「看见」。

    具体有三个本事。第一是精细的时间编排,按时间线控制对白和音效什么时候进场,精度能到 100 毫秒,做视频配音和广告卡点刚好。第二是音色稳,支持零样本生成和长音频延展,一个角色从头到尾音色不变,还能同一声音演多个角色、带不同情绪。第三是语种全,覆盖中文、英文、日语等 20 多种语言,重音和节奏都按当地习惯来。

    官方评测显示,在影视、短剧、动漫、播客等多数场景里,音频可用率已经跑到 90% 以上;多语言自然度方面,大部分语种 MOS 评分超过 4 分,算优秀水平。

    从「会说」到「会创作」

    这中间的区别挺关键。早几年的语音合成,本质是把文字念出来,语调再自然也还是「读稿」。Seed Audio 1.0 瞄准的是创作——你给一条指令,它自己安排谁说话、什么情绪、背景音怎么铺、什么时候淡入。对短剧和动漫团队来说,这意味着原本要分几个工种、花几天的活,可能压缩到一轮生成。

    • 影视级音频:对白、音效、环境声统一编排,叙事更连贯
    • 可控音色:长音频保持一致,同一声音可演多角色
    • 20+ 语种:自然生成,适配本地表达节奏

    先上体验,后面还有大招

    模型现在已经放在火山方舟体验中心,创作者能直接试。团队放话,接下来会接进视频参考这类多模态输入,还会做可控翻译、长音频和分轨生成,方向是把脑子里的声音构想更快变成能听见的成品。


    大模型从文本、图像一路卷到音频,Seed Audio 1.0 是个信号:AI 音频正从单点工具走向全场景创作平台。对内容创作者,门槛又低了一截;对行业,竞争也从「谁念得真」变成「谁编得巧」。

  • AI语音越来越像真人,ElevenLabs悄悄给音频打上了「隐形水印」

    AI生成的语音越来越逼真,普通人根本分不清哪些是真人录的、哪些是机器合成的。这个问题不只是”听不听得出来”——当诈骗电话开始用AI克隆亲人的声音,当假新闻用合成语音煽动情绪,你才发现”能分辨”和”不能分辨”之间隔着巨大的安全隐患。

    看不见的水印,埋在声音里

    6月26日,AI音频平台ElevenLabs宣布接入Google DeepMind的SynthID隐形水印技术。这个技术的思路很聪明:不是在外层贴标签,而是把标识信息直接编织进音频信号本身——人耳听不到,但检测器可以准确识别。

    更重要的是,这个水印经得起折腾。剪辑、压缩、换格式、删元数据——这些操作过去能让溯源信息直接消失,但SynthID埋得够深,上述操作基本奈何不了它。

    AI音频水印技术概念图
    SynthID水印直接嵌入音频信号,人耳无法察觉,但可以被检测器识别

    免费用户先用,几周内全覆盖

    ElevenLabs的部署节奏是先覆盖免费用户的文本转语音生成,然后”在未来几周内”扩展到所有音频生成类型。同步推出的还有一个免费工具:ElevenLabs Audio Detector,任何人都可以把一段音频传上去,检测它是不是ElevenLabs生成的。

    根据Google DeepMind的数据,SynthID技术已经在全球范围内标记了超过1000亿条AI生成内容。这次扩展接入ElevenLabs,是继OpenAI、NVIDIA之后的又一重要落地。

    不只是打假,还有版权归属

    水印技术的意义不止于”识别假内容”。对创作者来说,持久的水印意味着他们可以证明某段AI生成音频确实出自自己——即使这段音频被下载、转码、再上传到YouTube或TikTok。内容溯源(provenance)正在成为AI平台的标配能力。

    当然,这套方案也不是万能的。水印标准如果只在少数平台间互通,效果就会打折扣。而且,真正想作恶的人总会想办法绕过检测——这是一场持续的猫鼠游戏。


    • SynthID水印直接嵌入音频信号,剪辑压缩后依然可检测
    • ElevenLabs免费用户率先覆盖,全平台几周内上线
    • Audio Detector免费开放,可检测任意音频是否为AI生成
    • 水印技术同时服务于内容溯源和版权保护两个目标