标签: 腾讯

  • 腾讯混元放出 Hyra:一个会自己改自己的科研智能体

    腾讯混元 7 月 21 日放出了一个有点特别的东西——Hyra-1.0,全称 Hunyuan Research Agent。说它特别,是因为这是个能自己改进自己的科研智能体,专门冲着那些讲究性能的研究和工程任务去的。

    能自我进化的 AI 科研智能体概念图
    腾讯混元 Hyra:一个会递归自我改进的科研智能体(示意图)

    腾讯说,Hyra 不光能在公开基准上刷分,还能扎进真实的产品系统、AI 研发流水线,甚至自然科学研究和工业场景里边跑边学、边学边进化。这话如果成立,那它就不只是个做题家了。

    “AI 自己改自己”,这一年突然火了

    递归自我改进(RSI)和自动化研究,是过去一年 AI 圈最热闹的前沿话题之一。几个标志性的例子放在一起看就明白热度从哪来:

    • Google DeepMind 的 AlphaEvolve,只用 48 次标量乘法就算完了 4×4 复数矩阵相乘;
    • Together AI 让一群智能体在开放环境里协作,把 11 维 kissing number 的已知下界从 593 推到了 604;
    • Andrej Karpathy 的 autoresearch,用一套精简循环让模型训练研究能自己转起来。

    这些进化型系统一个接一个冒出来,共同点是智能体正在跳出封闭的基准测试,跑到开放的科学发现里去,有些地方已经开始超过人类了。Hyra 想接的就是这一棒。

    框架越轻,动作空间越大

    Hyra 的 Harness 设计遵循 The Bitter Lesson:框架尽量轻、尽量简单,把智能体的动作空间尽量放大。

    具体怎么工作?给它一个任务描述,Hyra 就开始跑一个循环:根据历史经验去探索、提出更好的解法。所谓历史经验,包括过去每个方案跑出来的日志、评估器给的反馈、还有方案本身的源代码。这个循环一直转,直到它自己觉得可以收工,或者预算烧完,最后把历史上最优的那版方案交出来。

    腾讯给了个直观的例子:只给 Hyra 一张 2D 参考图,让它推断物体的三维结构,还得生成一个能直接渲染的 3D 模型。评判用的是基于 rubrics 的 VLM judge,从轮廓、比例、结构完整性、材质、视觉相似度几个维度打分。Hyra 在多轮探索里不断改建模代码、调渲染参数,官方称最后的结果比用 Claude Code 的 goal 模式生成的更贴近参考图,也更符合人的审美。


    从 AlphaEvolve 到 Hyra,能看出一个方向:大厂都在把”让 AI 帮着做研究”往前推。区别在于,腾讯这次强调的是从公开基准走进真实产业场景,让智能体在自家的研发流水线和工业问题上真刀真枪地迭代。这条路能走多远,还得看后面拿出来的活儿。至少 Hyra-1.0 把话说到了这份上。

  • 腾讯混元3正式版来了:姚顺雨操刀,把“幻觉”砍掉一大半

    腾讯混元3正式版
    混元3正式版发布,腾讯AI全家桶迎来核心引擎

    千呼万唤,腾讯混元3(Hy3)正式版终于在7月6日公布了。这个模型背后站着一个人——姚顺雨,清华姚班出身,去年底被请来当腾讯首席AI科学家。为了这款产品,腾讯前后准备了大半年,光是研发架构就动了一次大手术。

    2025年12月,腾讯把企业内部的AI研发体系重新切分,新设了AI Infra部、AI Data部和数据计算平台部,姚顺雨双线向刘炽平和卢山汇报。他到任后的第一件事很硬核:推翻原来的训练框架,一个月内把整套预训练和强化学习的基础设施重搭了一遍,还定下三条规矩——不偏科、不刷榜、不烧钱。

    重建后的第一个产物是4月23日上线的Hy3 preview,从启动训练到发布只用了三个月。但预览版毕竟只是预览,能力只能说“尚可”。正式版这次,是真的支棱起来了。

    架构没大改,改的是“喂什么”

    混元3正式版沿用了preview的底层架构:总参数量295B,每次推理只激活21B,另外还有3.8B参数用在MTP层。模型一共80层,GQA分组注意力,192个专家每次激活top-8,上下文窗口拉到256K。换句话说,有效参数量大约是GLM 5.2的一半。

    架构在preview阶段就定型了,正式版没动结构。那它到底改了什么?官方说法是“提升了后训练数据的质量和多样性,扩大了RL算力规模”。说白了,模型骨架没换,但喂给它的数据更好、更多样了,强化学习也给到了更多算力。

    搜索能力追平GPT-5.5

    从官方放出的基准成绩看,混元3在搜索智能体方向表现最强:BrowseComp拿到84.2分,在所有对比模型里排第一,直接追平了GPT-5.5。代码方向,SWE-Bench Verified是78.0分,和开源模型不相上下,但跟顶级闭源(GPT-5.5的84.4)还有点距离。

    评分终归是评分,腾讯自己也承认,公开榜单并不能完全反映模型的“真实战斗力”。

    更值得说的是幻觉率。相比preview版本,正式版的幻觉率从12.5%降到了5.4%,降幅超过一半;常识错误率从25.4%降到12.7%;多轮对话问题率从17.4%降到7.9%;长对话理解基准MRCR从42.9%升到75.1%。腾讯还搞了个“土办法”验证:拉来270位不同学科的专家,用真实工作场景做盲测,收集了312份对比,Hy3均分2.67/4,在前端开发、数据/存储、CI/CD这些类别上优势明显。

    便宜,而且开源

    价格延续了preview的性价比路线:API输入1元/百万tokens,输出4元/百万tokens,命中缓存只要0.25元。模型权重以Apache 2.0协议在GitHub、HuggingFace、ModelScope等平台开源,全球开发者能免费商用。

    市场反应挺实在。preview上线两周,token调用量就达到上一代Hy2的十倍,在OpenRouter上周调用3.66万亿token,拿了总榜和市占率“双第一”。到正式版发布时,日均token消耗又涨了20倍,其中代码和Agent类场景增长最猛。

    已经渗进腾讯全家桶

    模型跑分再高,最终要落在产品里。Hy3正式版已经接进了WorkBuddy/CodeBuddy、元宝、ima、QQ浏览器、腾讯新闻、微信读书、腾讯文档等核心业务。以WorkBuddy为例,任务解决率从preview的72%跳到90%,平均耗时缩短34%,文档处理token消耗比GLM5.2省了47%以上。

    有意思的是微信小程序开发。Hy3 preview时就演示过用自然语言生成完整小程序,正式版更进一步——你让它做个快递小程序,它能连前端带后端、外加API、数据结构和项目方案一起吐出来。而微信自己的原生AI助手“小微”用的是WeLM加DeepSeek,普通用户和开发者各取所需,这大概就是腾讯想要的分工。