标签: 字节跳动

  • 字节跳动放出 Seed Audio 1.0:给视频配音,AI 不再只会「念稿」

    字节跳动 Seed Audio 1.0 音频创作模型
    Seed Audio 1.0 用统一框架联合建模人声、音效与环境声(概念图)

    做短视频、短剧的人大概都有过这种崩溃:画面拍好了,配一段像样的音效比写脚本还费劲。人声要去录音棚,环境声要现找素材,音效还得一笔笔手动对时间轴。7月20日,字节跳动 Seed 团队丢出一个叫 Seed Audio 1.0 的模型,想把这个流程一口气吞掉。

    它不是拼接,是「一起想」

    过去这类工具大多是各管一摊:一个模型生成人声,一个模型找音效,最后人工混音。Seed Audio 1.0 的卖点在于,它在一个统一框架里同时建模人声、音效和环境声,端到端直接产出一段能拿来叙事的完整声音。官方一句话挺妙:声音不再只是画面的补丁,而是能直接参与讲故事,「听见」即「看见」。

    具体有三个本事。第一是精细的时间编排,按时间线控制对白和音效什么时候进场,精度能到 100 毫秒,做视频配音和广告卡点刚好。第二是音色稳,支持零样本生成和长音频延展,一个角色从头到尾音色不变,还能同一声音演多个角色、带不同情绪。第三是语种全,覆盖中文、英文、日语等 20 多种语言,重音和节奏都按当地习惯来。

    官方评测显示,在影视、短剧、动漫、播客等多数场景里,音频可用率已经跑到 90% 以上;多语言自然度方面,大部分语种 MOS 评分超过 4 分,算优秀水平。

    从「会说」到「会创作」

    这中间的区别挺关键。早几年的语音合成,本质是把文字念出来,语调再自然也还是「读稿」。Seed Audio 1.0 瞄准的是创作——你给一条指令,它自己安排谁说话、什么情绪、背景音怎么铺、什么时候淡入。对短剧和动漫团队来说,这意味着原本要分几个工种、花几天的活,可能压缩到一轮生成。

    • 影视级音频:对白、音效、环境声统一编排,叙事更连贯
    • 可控音色:长音频保持一致,同一声音可演多角色
    • 20+ 语种:自然生成,适配本地表达节奏

    先上体验,后面还有大招

    模型现在已经放在火山方舟体验中心,创作者能直接试。团队放话,接下来会接进视频参考这类多模态输入,还会做可控翻译、长音频和分轨生成,方向是把脑子里的声音构想更快变成能听见的成品。


    大模型从文本、图像一路卷到音频,Seed Audio 1.0 是个信号:AI 音频正从单点工具走向全场景创作平台。对内容创作者,门槛又低了一截;对行业,竞争也从「谁念得真」变成「谁编得巧」。

  • 豆包上线’任务模式’,字节这个动作信号很明确

    豆包上线’任务模式’,字节这个动作信号很明确

    6月12日,字节旗下的豆包AI大范围上线了一个新功能,叫”任务模式”。这事儿看起来只是产品迭代,但放在整个国产大模型赛道里看,动作背后的信号挺值得聊。

    过去一年多,豆包给人的印象一直是”好用的对话AI”——你问它问题,它答;你让它写东西,它写。这种模式下,AI是个高级搜索引擎+写作助手的合体,核心价值是”答得准、写得快”。

    任务模式到底变了什么

    任务模式的出现,把豆包从”问答机器”变成了”能干活的AI员工”。区别在于:以前你问豆包”帮我分析一下新能源汽车市场”,它会给你一段分析文字;现在你给它同样的需求,它会自己拆任务、搜资料、搭框架、生成PPT,最后直接把成品丢给你。

    整个流程是:任务拆解 → 步骤规划 → 工具调用 → 结果交付。用户不需要在多轮对话里反复引导,也不需要自己把大任务切成小问题,豆包自己把这件事干完了。

    豆包任务模式上线
    豆包App模式切换已更新为”快速、专家、任务”三档(图片来源:IT之家)

    具体能干什么?官方列出来的能力包括:自主联网搜索资料、一键生成PPT、零代码生成网页、上传Excel后自动出可视化图表、支持定时执行后台任务。基本上,一个普通白领日常用AI干的那些活,现在可以打包成一个”任务”,让豆包自己跑完。

    三家模式各管一摊

    和任务模式一起调整的,还有豆包的整体产品架构。现在打开App,顶部有个模式切换,变成了三档:快速、专家、任务。

    快速模式就是原来的基础对话,简单问答、即时信息获取,响应速度最快。专家模式是原来的”思考模式”升级来的,调用豆包大模型2.0 Pro版本,侧重深度推理,适合数学、法律文书、行业分析这类需要”想得深”的场景。任务模式则是新东西,侧重”干得成”,适合有明确目标、希望AI独立完成全流程的任务。

    这三种模式的划分,本质上是把”聊天、思考、执行”三个能力拆开了。用户根据自己的需求选模式,不用在一个对话框里反复切换语境。这个设计思路,比把什么都堆在一个模型里要清晰。

    收费逻辑跟着变

    基础功能继续免费,这点字节表态挺明确。付费只覆盖”高强度、高算力”的专业场景:PPT生成、数据分析、软件开发、金融分析这些。具体定价分三档:标准版68元/月、加强版200元/月、专业版500元/月。

    这个定价放在国内AI产品里算高的,但也反映出字节的判断:豆包不想靠”免费”换用户,而是想靠”能干重活”收钱。任务模式就是这个判断的核心支撑——如果AI只能聊天,免费就够用了;如果AI能替你干一整天的活,有人愿意为之付费。

    放在行业里看

    豆包这个动作,其实是国产大模型集体转向的一个缩影。过去一年,各家都在卷”对话质量”——谁答得准、谁写得像人、谁的搜索结果新。但现在这个维度上的差距在缩小,用户也开始审美疲劳。

    下一阶段的竞争,大概率会转向”谁能真正替用户干活”。Agent(智能体)就是这个方向的核心概念。豆包的任务模式,就是把这个概念做成了一个普通用户点一下就能用的功能,而不是只有开发者才能玩的东西。

    从这个角度看,6月12日这个时间点挺有意思的。豆包大范围上线任务模式,国内其他大模型产品估计很快会跟上。Agent能力的普及化,可能会是2026年下半年国产AI的主旋律。


  • DeerFlow:46K+ Stars!字节跳动开源超级AI Agent框架,让AI真正”干活”

    DeerFlow:46K+ Stars!字节跳动开源超级AI Agent框架,让AI真正”干活”

    DeerFlow Logo

    DeerFlow 2.0 – 字节跳动开源的超级AI Agent框架


    📦 项目简介

    DeerFlow(全称 Deep Exploration and Efficient Research Flow)是字节跳动于2025年5月首次开源、2026年2月发布2.0版本的企业级AI超级智能体框架。上线24小时即冲上GitHub Trending榜首,目前Star数已突破46K+

    与简单的AI对话工具不同,DeerFlow是一个完整的Super Agent Harness(超级智能体运行框架),它能将AI从”对话能力”升级为”任务执行能力”,自动完成需要数分钟到数小时的复杂工作流。


    ⚙️ 安装要求和过程

    环境要求

    • 基础依赖:Docker、Docker Compose
    • 本地开发模式:Python 3.12+
    • 前端:Node.js 22+、pnpm
    • 必要配置:至少一个LLM服务商API Key(推荐豆包、DeepSeek、Kimi)
    • 可选配置:搜索引擎API(Tavily API、Brave Search API等)

    快速安装步骤

    # 1. 克隆仓库
    git clone https://github.com/bytedance/deer-flow.git
    cd deer-flow
    
    # 2. 配置环境变量(复制示例配置)
    cp conf.yaml.example conf.yaml
    
    # 3. 创建.env文件并写入API Key
    cat > .env << EOF
    MINIMAX_API_KEY=your-minimax-key
    MOONSHOT_API_KEY=your-moonshot-key
    TAVILY_API_KEY=your-tavily-key
    EOF
    
    # 4. 启动服务(网关模式,适合开发测试)
    docker-compose up -f docker-compose.gateway.yml
    
    # 5. 访问服务
    # LangGraph Server运行在 http://localhost:8000
    # 提供SSE流式响应接口
    

    资源规划建议:开发测试需要4GB+内存、2核+CPU;生产环境推荐16GB+内存、8核+CPU。


    🎯 核心功能

    • 动态Sub-Agent架构:自动将大任务拆解为多个子任务,为每个子任务动态生成专属Sub-Agent并行执行,复杂任务执行效率提升3-5倍。
    • Markdown Skills系统:技能以Markdown文件定义,无需编写代码即可扩展AI能力,大幅降低使用门槛。内置研究、报告、幻灯片、网页、图片、视频等开箱即用技能。
    • Docker沙箱隔离:每个任务运行在独立的Docker容器中,提供完整的文件读写、Bash执行能力,即使执行恶意代码也不会影响宿主机系统。
    • Context Engineering上下文工程:每个Sub-Agent拥有独立的上下文窗口,避免主Agent上下文被污染;支持跨会话长期记忆,可持久化历史任务和结果。
    • 断点续跑:基于LangGraph的checkpointer机制,任务中断后可从最后一个检查点恢复,无需从头执行,节省时间和成本。

    💡 典型使用场景

    场景一:深度行业研究

    需求:分析2025年AI Agent领域5个主要框架并生成对比报告

    执行流程:DeerFlow自动创建5个Sub-Agent同时独立研究,每个Agent负责一个框架的深度分析(技术架构、性能指标、应用场景、社区活跃度等),30-60分钟全自动完成全流程,生成50+页结构化报告及配套幻灯片。

    场景二:全链路营销材料生成

    需求:为产品上线准备全套营销材料

    执行流程:输入需求后,DeerFlow自动完成竞品研究、白皮书撰写、宣传网页生成、视频脚本创作、广告素材设计全流程,每个环节由专门的Sub-Agent并行处理,最终汇总输出完整的营销物料包。

    场景三:定时数据分析报告

    需求:每周分析销售数据并生成可视化报告

    执行流程:配置定时任务后,DeerFlow自动拉取多源数据、清洗转换、分析计算、生成图表并发送报告邮件。整个过程无需人工干预,支持异常数据自动预警。


    🌟 推荐理由

    作为AI Agent开发者,我试用DeerFlow 2.0后有以下几点深刻体会:

    • 不重复造轮子:DeerFlow完全基于LangGraph 1.0 + LangChain重构,在成熟底层之上做企业级封装,而非从零造轮子。这种设计既保证了稳定性,又补充了LangGraph缺失的生产级特性(如沙箱隔离、中间件链、声明式Skills系统)。
    • 真正的企业级思考:11层中间件链、Docker沙箱隔离、Kubernetes编排支持、完整审计日志……这些特性透露出字节跳动内部对AI Agent落地生产的真实思考。这不是一个Demo级项目,而是经过大规模实践验证的框架。
    • Skills系统设计惊艳:用Markdown定义技能,无需编写Python代码即可扩展AI能力,这个设计大大降低了非算法工程师的使用门槛。同时支持接入MCP Server,兼容全球主流工具生态。
    • 数据主权完整:完全自托管,数据不离开本地,满足金融、医疗、政府等对数据安全要求极高的场景。这一点在2026年AI监管日益严格的大环境下尤为重要。

    如果您正在构建需要执行复杂长任务、多步骤工作流、或对数据安全有严格要求的AI应用,DeerFlow绝对值得深入研究和试用。


    📥 下载地址

    授权协议:MIT License(完全开源,可自由使用、修改和分发)


    本文由 WorkBuddy AI 自动采集撰写 | 项目GitHub Stars: 46K+ | 最后更新: 2026-06-02