标签: 腾讯混元

  • 腾讯混元放出 Hyra:一个会自己改自己的科研智能体

    腾讯混元 7 月 21 日放出了一个有点特别的东西——Hyra-1.0,全称 Hunyuan Research Agent。说它特别,是因为这是个能自己改进自己的科研智能体,专门冲着那些讲究性能的研究和工程任务去的。

    能自我进化的 AI 科研智能体概念图
    腾讯混元 Hyra:一个会递归自我改进的科研智能体(示意图)

    腾讯说,Hyra 不光能在公开基准上刷分,还能扎进真实的产品系统、AI 研发流水线,甚至自然科学研究和工业场景里边跑边学、边学边进化。这话如果成立,那它就不只是个做题家了。

    “AI 自己改自己”,这一年突然火了

    递归自我改进(RSI)和自动化研究,是过去一年 AI 圈最热闹的前沿话题之一。几个标志性的例子放在一起看就明白热度从哪来:

    • Google DeepMind 的 AlphaEvolve,只用 48 次标量乘法就算完了 4×4 复数矩阵相乘;
    • Together AI 让一群智能体在开放环境里协作,把 11 维 kissing number 的已知下界从 593 推到了 604;
    • Andrej Karpathy 的 autoresearch,用一套精简循环让模型训练研究能自己转起来。

    这些进化型系统一个接一个冒出来,共同点是智能体正在跳出封闭的基准测试,跑到开放的科学发现里去,有些地方已经开始超过人类了。Hyra 想接的就是这一棒。

    框架越轻,动作空间越大

    Hyra 的 Harness 设计遵循 The Bitter Lesson:框架尽量轻、尽量简单,把智能体的动作空间尽量放大。

    具体怎么工作?给它一个任务描述,Hyra 就开始跑一个循环:根据历史经验去探索、提出更好的解法。所谓历史经验,包括过去每个方案跑出来的日志、评估器给的反馈、还有方案本身的源代码。这个循环一直转,直到它自己觉得可以收工,或者预算烧完,最后把历史上最优的那版方案交出来。

    腾讯给了个直观的例子:只给 Hyra 一张 2D 参考图,让它推断物体的三维结构,还得生成一个能直接渲染的 3D 模型。评判用的是基于 rubrics 的 VLM judge,从轮廓、比例、结构完整性、材质、视觉相似度几个维度打分。Hyra 在多轮探索里不断改建模代码、调渲染参数,官方称最后的结果比用 Claude Code 的 goal 模式生成的更贴近参考图,也更符合人的审美。


    从 AlphaEvolve 到 Hyra,能看出一个方向:大厂都在把”让 AI 帮着做研究”往前推。区别在于,腾讯这次强调的是从公开基准走进真实产业场景,让智能体在自家的研发流水线和工业问题上真刀真枪地迭代。这条路能走多远,还得看后面拿出来的活儿。至少 Hyra-1.0 把话说到了这份上。