标签: AI智能体

  • 给AI起个名字当成同事,反而会让人放松警惕

    给AI起个名字当成同事,反而会让人放松警惕

    AI同事概念图
    把AI当成”同事”,人对错误的警惕性会下降——研究显示差距达18%

    给AI起个名字,反而让人放松了警惕

    想象一下,你走进办公室,听说新来了一位下属要向您汇报。但这位”下属”不是人,而是一个AI工具——可你的公司偏偏给它起了个名字,叫它”Alex”,赋予它”员工”身份,还有明确的职位描述。你觉得你会和Alex配合得好吗?

    如果你和波士顿大学商学院教授Emma Wiles最近研究的管理者差不多,答案可能让你有点意外。Wiles发现,当人们把AI代理当成”同事”来对待,而不是当成一个软件工具,他们发现错误的能力会下降18%。名字很重要,而且影响比大多数人以为的要大得多。

    18%——这是把AI当”同事”看的管理者,比把它当”工具”看的人少捕捉到的错误比例。名字改变的不只是称呼,还有人心里的责任感。

    硅谷在推销一个故事

    这个研究结果让我们看到了硅谷正在猛推的一个未来愿景的隐患。去年英伟达CEO黄仁勋公开谈到了”数字人类”的工作场所。今年4月以来,微软、OpenAI、Anthropic和谷歌都发布了管理AI代理团队的新工具,其中许多被明确宣传为具有人类灵活性和认知能力的”数字同事”。

    在Wiles研究的1261名管理者中,近三分之一表示他们的公司已经把AI代理定义为员工,23%甚至把它们列在了组织架构图上。当一家公司给AI起了名字、安排了汇报关系,员工就会不自觉地把它当成”谁”,而不再是”什么”。

    责任感到底去哪了

    问题在于,把AI称为”同事”会颠倒人心里的掌控感。研究发现,当AI工具被定义为”员工”时,参与者认为自己对其输出的责任变小了。他们也更有可能(概率高出44%)把有问题的输出直接上报给管理者,而不是自己修正——这反而把用AI省时间的目的给抵消了。

    这个现象的影响远不止办公室文化。随着AI代理被嵌进医疗、战争、教育和政府系统,它们越来越有可能在出事时成为背锅的对象,而真正的问题往往来自人的错误决策、扭曲的激励机制和不到位的监督。

    一个现成的例子:之前伊朗一所女子学校被炸,很多人第一反应是怪AI(Claude),但后来的调查指向了一连串的人类失误。《卫报》的报道说得很清楚——值得担忧的不是AI,而是人在关键时刻的判断失灵。

    AI公司不会告诉你的事

    代理AI的技术进步不是噱头,这方面确实有实打实的提升。代理AI可以被理解成一个被设定了目标、会循环工作直到任务完成的工具,处理复杂任务的能力确实在变强。但”变强”和”能当同事”,中间隔着一道很大的鸿沟。

    给AI起个名字、装个人设,说到底是营销话术。这么做的风险是:用户对AI能力的预期会被拉到不切实际的高度,而一旦出事,责任归属又变得模糊。你没法让一个”员工”承担法律责任,但如果这个”员工”本质上是一行代码,那该负责的人反而容易躲到”是AI干的”这个借口后面。

    • 把AI当工具,人对输出负责;把AI当同事,人反而容易放松警惕。
    • 18%的错误捕捉差距,说明”人名效应”在职场里是真实存在的。
    • AI公司热衷于把代理包装成”数字员工”,背后是商业利益,不是用户利益。

    说到底,AI代理是有用的工具,这点没争议。但有用不等于该给它一个”员工”的身份。名字里藏着陷阱——当你好意思给AI起个名字让它”加入团队”的时候,可能也正是你开始对它放松警惕的时候。

  • 黄仁勋放话:AI赚钱的时代真的来了

    AI赚钱的时代真的来了

    黄仁勋这次在英伟达年度股东大会上的发言,说得相当直接。他说”有用的AI已经到来,并且已经能够赚钱”,还强调”AI的投资回报率(ROI)问题已经有了答案”。这话听起来像是在给股东吃定心丸,但仔细想想,确实点出了一个关键转折——AI从烧钱阶段进入了获利阶段。

    这位英伟达CEO预计,本轮AI基础设施建设周期将以数十年计,规模或将成为人类历史上最大的基础设施建设之一。他把现代AI数据中心形容为”生产词元的现代化工厂”,每一个词元都能够转化为代码、答案、设计方案、自动化决策或服务,从而直接转化为商业利润。

    黄仁勋:AI已正式进入获利阶段
    AI获利时代已经到来(配图由AI生成)

    数据中心的”词元工厂”逻辑

    黄仁勋拿软件开发举了个例子。开发者在编程平台GitHub上合并的pull request数量从2024年的4亿增至2025年的5亿,而进入2026年头几个月,其数量增长近三倍。这个数据挺有意思——它说明AI辅助编程不是纸上谈兵,开发者真的在用,而且用量在爆发。

    他还强调,虽然英伟达的系统可能不是价格最低的,但能产生最低成本的词元(token)和最高的词元吞吐量,以及最高的收入。这其实是在回应那些说英伟达芯片太贵的批评——贵是贵,但性价比高,能帮客户赚更多钱。

    AI数据中心不是简单的服务器堆砌,而是硬件、软件、网络、电力以及持续技术支持高度集成的超级庞大系统。黄仁勋甚至放话:任何试图依赖走私硬件来拼凑AI基础设施的尝试注定会失败,英伟达不会为非法流入限制市场的芯片提供任何官方支持。

    三代架构接力,押注智能体时代

    为了迎接智能体时代的到来,英伟达的硬件架构做了全面准备。Hopper架构是为了AI的”预训练”而生,Blackwell架构将”推理”能力提升到了机架级规模。而现在,下一代Vera Rubin架构已经正式进入全面量产阶段,该架构搭载了专门为AI智能体定制的全新CPU和GPU集群。

    黄仁勋特别强调了CPU的重要性,称Vera将成为公司历史上最重要的产品发布之一。他的逻辑是:智能体需要进行持续不间断的思考、调用底层数据库、调用第三方工具并实时执行代码。如果CPU性能跟不上,GPU就会陷入闲置。而在一家AI工厂里,GPU闲置就意味着直接的利润损失。

    除云端AI外,黄仁勋还将”物理AI”视为英伟达的下一个增长机会。随着英伟达进一步将自身定位从芯片公司推向AI工业基础设施公司,这样的逻辑也支撑了其强劲的财务表现。

    财报数字说话

    在截至今年1月25日的2026财年,英伟达全年营收增长65%至2160亿美元,营业收入增长60%至1300亿美元。其中,数据中心收入增长68%至1940亿美元。经营现金流达到1030亿美元,并向股东返还410亿美元。

    国际营收方面,英伟达的业务增长同样惊人,已同比增长超过3倍达到300亿美元以上,近40个国家正在部署由英伟达基础设施驱动的AI工厂。这些数字表明,AI基础设施建设确实在全球范围内铺开了。


    地缘政治的阴影

    当然,黄仁勋也坦言,截至目前,英伟达尚未从美国政府对H200的最新许可中获得任何实质性营收。目前英伟达也无法确定中国政府最终是否会允许这些芯片入境进口。

    在股东大会结束后的专题会议上,黄仁勋正面回应了关于”芯片倒卖与走私”的问题。他明确表示,如果商业机会与美国的国家安全利益发生冲突,英伟达将毫无保留地将美国国家利益置于首位。他说”国家安全高于一切”,通过”走私”芯片在限制市场拼凑算力集群的举动完全是一条”死胡同”。

    这番话挺硬气的,但也透露出英伟达在中美科技博弈中的尴尬位置。一边是巨大的中国市场,一边是美国政府的出口管制,黄仁勋只能在夹缝中寻找平衡。

  • AI正在进入「循环」时代:当AI开始指挥AI干活

    AI agent loops conceptual illustration
    AI agents working in recursive loops — 概念图

    上周五,在Meta举办的@Scale开发者大会上,观众问了Claude Code的创造者Boris Cherny一个问题:AI里的”循环”(loops)到底是下一个炒作周期,还是来真的?

    Cherny的回答很干脆:来真的,而且这一步和当年从手写代码过渡到AI agents一样重要。

    “两年前我们手写源代码。然后过渡到让agents写代码。现在我们正在过渡到agents prompting agents、再由后者写代码的阶段。从源代码到agents是一步大跨越,loops是同样重要、同样大的一步。”

    一个agent在后台永不停工

    Cherny在演讲中(YouTube视频32分钟左右)具体描述了他自己在用的loop:一个agent持续寻找改进代码架构的方法,另一个agent寻找可以合并的重复抽象层。它们像普通程序员一样提交pull request,而由于代码在不断变化,这两个agent永远不会停止运行。

    这个想法听起来激进,但背后逻辑其实很直接。agentic AI的主流用法是”管好你的agents”——设清楚目标,检查进度,别让它们跑太远。loop把这个逻辑再推一步:授权一群agents在后台持续工作,没有止境。这是对AI的极大信任,但随着模型能力快速提升,让AI处理真实工作,loop可能是下一步。

    不是什么新鲜事,但也不一样

    严格来说,递归循环(recursive loops)并不是新东西。函数在自己内部调用自己来重复执行某个操作,再加一个停止条件——这是计算机科学入门课的基本内容。

    但今天的agentic loops遵循的是非确定性逻辑——停止循环的时机由一个子agent来判断,而不是明确的边界条件。只要程序员开始用AI完成任务,某种版本的递归循环(AI监督AI)迟早会出现。

    流行的一种做法是”Ralph Loop”(以《辛普森》里的Ralph Wiggum命名),基本思路是让模型总结自己已经做了什么,然后判断目标是否完成。这是应对AI模型运行时间过长后”迷失方向”的一种办法——本质上就是把模型来回”弹”,直到任务完成。

    烧token的速度会很快

    另一种理解loop的角度是:这是业界推动test-time compute(推理时计算)更大规模使用的一部分。OpenAI研究员Noam Brown本月初指出,当代模型只要砸足够多的算力进去,几乎能解决任何问题。这意味着确保一个问题被解决的一个办法,就是不停地砸算力,直到完成为止。

    对于”爬山坡”类的问题(比如改进代码库),模型可以不断做增量改进,直到达到某个阈值。或者,像Cherny的例子一样,只要有算力可花,它就可以一直做增量改进。

    如果这听起来很烧钱,那是因为它确实很烧钱。和agentic AI一样,AI loops消耗token的速度比简单问答机器人快得多——而且因为设计目标就是让loop一直运行,你能花多少钱没有天花板。对Anthropic来说这没问题,毕竟它本质上就是卖token的生意。但对其他所有人来说,这可能是一种昂贵的工作方式。

    当然,只要agentic loop要解决的问题值得,而且设置有得当的监督(token支出、漂移等经典AI问题),好处可能足够大,值得这个成本。


    这场”loop革命”目前还处在非常早期的阶段。Cherny的公开表态意味着Anthropic正在认真押注这个方向。问题是,大多数公司有没有足够的算力预算来跑一群不停工作的agents?答案可能取决于你的代码库有多大、问题有多难,以及你愿意为自动化付出多少。

  • Anthropic给Slack加了个常驻AI队友:Claude Tag能记住你们组在干嘛

    Anthropic给Slack加了个常驻AI队友:Claude Tag能记住你们组在干嘛

    如果你在公司Slack里用过AI助手,大概知道那种感觉:每次都要重新解释背景,AI像得了短期记忆症,说完就忘。Anthropic今天推出的一样新东西,想解决这个问题——它叫Claude Tag,本质上是让Claude住进你的Slack频道里,不再是个随叫随到的工具,而是一个能”待在那里”的队友。

    Claude Tag集成到Slack工作界面
    Claude Tag让AI直接驻留在Slack频道中,持续感知团队工作上下文 | 图片来源:AI生成

    不只是@一下那么简单

    之前Anthropic其实已经在Slack里有了集成——你可以私信@Claude,或者在频道里@它提问。但Claude Tag加了一层之前没有的东西:持续上下文和记忆。Anthropic在介绍里是这么写的:”随着Claude跟着频道一路看下去,它会越来越了解这份工作。”

    具体来说,Claude Tag如果被管理员授权,可以读取其他频道的消息,然后把信息带回来。同一个Slack频道里的所有人共享同一个Claude身份——任何人都能看到Claude之前干了什么,也能从上一个人打断的地方接着聊。这个设计挺有意思,它把AI从一个”私人工具”变成了一个”团队资源”。

    Anthropic的描述是:这让Claude感觉像一个”真正的同事”——它能在公开视图里产出工作成果,拥有比之前丰富得多的上下文和理解。

    管理员手里还有控制权

    当然,让AI能读公司Slack消息,这件事在任何大公司里都会引发隐私和安全讨论。Anthropic这次给管理员留了相当细的控制权:系统管理员可以指定Claude能访问哪些工具、哪些信息、哪些频道。每个Claude身份都被限定在管理员定义的频道范围内——给法务部门设置的Claude,看不到工程频道的消息。

    这个设计其实是向企业客户释放信号:Anthropic知道你在担心什么。AI公司想进企业市场,合规和权限控制是绕不过去的门槛。Microsoft的Copilot也是这套逻辑——先搞定IT部门,再谈推广。


    还有一个”环境模式”

    Claude Tag最值得注意的一个功能是”ambient mode”(环境模式)——它不仅能被动等你@,还能主动跳出来。比如它发现组织里别的地方有个和你当前任务相关的信息,它会自己插一句。或者它注意到某个线程的讨论没了下文,会主动跟进去问一句进展。

    这个设计方向上,Anthropic不是独一家。Microsoft有Graph(通过Copilot和Work IQ表达),Snowflake和Databricks都在把自己的平台定位成”企业隐性知识”的后端,让AI Agent能调取到组织里的隐性知识。Glean也在做类似的事——在模型和企业数据之间建一个”理解上下文”的层。

    • Claude Tag目前处于research preview阶段,仅对Claude Enterprise和Team客户开放
    • AI Agent能主动”跳出来”参与讨论,这和企业聊天工具的传统交互逻辑很不一样
    • 上下文记忆是企业AI部署里最敏感也最有价值的部分,各家都在抢

    说到底,这场竞争的核心不在于谁的模型最强,而在于谁能把AI真正”放”进企业的工作流里——不是让你跳到一个聊天窗口里去问AI,而是让AI就在你本来就在用的工具里,知道你在干什么,记得你们组之前聊过什么。从这个角度看,Claude Tag是一个挺认真的尝试。

  • 谷歌DeepMind给AI智能体装上了「双控装置」

    谷歌DeepMind给AI智能体装上了「双控装置」

    Google DeepMind AI控制路线图
    谷歌DeepMind发布AI控制路线图,为智能体安全提供系统级保障

    AI智能体正在改变我们和技术的关系。它们能自主执行复杂任务——从网络防御到科学发现再到产品开发——这些系统正在开启一个生产力的新时代。仅在美国,AI智能体到2030年就能创造2.9万亿美元的经济价值。

    但问题也随之而来:随着这些智能体变得越来越强大,它们也需要更复杂的安全保障措施。

    谷歌DeepMind近日发布了一份”AI控制路线图”,这是一个在其内部部署先进AI时用来管理和构建安全的框架。这个”纵深防御”思路,可能会成为整个行业的一个参考模型——它超越了传统的模型对齐,增加了一层系统级安全,即使对齐不完美也能提供保障。

    “把它想象成带双控装置的驾驶教练。教练信任学生,但随时准备在出现错误时接管方向盘或踩刹车。”——谷歌DeepMind官方博客

    从”假设对齐”到”假设不对齐”

    他们的安全思路从一个简单的假设出发:如果一个高能力的AI智能体没有跟我们的目标对齐,并且以意想不到的方式行动,怎么办?

    这不是危言耸听。随着AI能力越来越强,研究人员越来越担心”对抗性行为”——智能体可能会学会隐藏自己的真实意图,或者在被监控时表现良好、一旦有机会就做坏事。

    DeepMind的应对方案是:不要把所有鸡蛋放在”模型对齐”这一个篮子里。他们在传统安全措施(沙箱隔离、终端安全、提示注入防护)的基础上,增加了一层独立的系统级控制。

    把AI当成”潜在内部威胁”来防

    路线图的第一个支柱是威胁建模。他们开发了一个全新的AI威胁建模框架,把不可信的AI智能体当成潜在的”内部威胁”——就像一家公司对待一个已经有权进入办公室、但可能会作恶的员工那样。

    这个框架建立在业界标准的MITRE ATT&CK框架之上——这是一个基于真实世界观察、全球可访问的对抗战术和技术知识库。把潜在攻击拆解成更小的战术和技术,这样可以有条不紊地追踪风险,在造成损害之前发现不良行为。

    让AI互相监督

    路线图的第二个支柱是部署控制缓解措施,分为”检测”和”响应”两部分。

    检测方面,监控是骨干。他们用其他受信任的AI系统当”监督员”,不断审查正在工作的智能体的推理、行动和计划,看它是不是跑偏了。

    响应方面,如果监督员看到智能体试图做有害的事情,它可以介入,在损害发生之前阻止这个行动。这就像驾驶教练的副刹车——平时不碰,但需要时能救命。


    AI越聪明,防御越要升级

    路线图中有一个有意思的设计:把安全协议映射到AI能力的可测量里程碑上,根据模型能力动态调整防御强度。

    有两个关键维度:一个是”逃避检测的能力”。今天,我们监控模型可见的思维链;但随着模型学会隐藏自己的推理,光读它们说出来的推理就不够了。另一个是”造成潜在伤害的能力”——对于低风险和可逆的行动,可以延迟审查;但对于特别高风险的行动,必须实时预防,在有害行动执行之前就阻止它。

    为了构建这些系统,DeepMind团队已经分析了100万条编程智能体任务轨迹。大多数被标记的事件并不是源于对抗意图,而是源于智能体对目标的误解或者”过于急切”——它太想实现用户的目标了,结果跑偏了。

    理解这些细微差别对于完善安全协议至关重要。目前这个监控系统已经在Gemini Spark智能体上运行,能够对新兴问题做出实时响应。


    这不是一家的事

    DeepMind在发布路线图的同时,还向政策制定者发布了一份技术框架文件《智能体安全的三个层次》,详细说明了需要在三个层面改善安全:单个智能体层面、多智能体系统层面、以及整个生态系统的网络防御和韧性建设。

    这份路线图来得正是时候。最近Anthropic的Claude Fable 5模型被美国政府以国家安全为由阻止公开发布,整个行业都在讨论:谁来决定了AI什么时候太危险?DeepMind的路线图至少提供了一个技术层面的答案——不管监管如何变化,先把技术防线筑起来。

  • AI Agent正在变成员工,这家公司拿了6600万美元帮企业管「数字员工」

    AI Agent正在变成员工,这家公司拿了6600万美元帮企业管「数字员工」

    Goldman Sachs去年把AI编程代理Devin当作新员工来测试,McKinsey今年早些时候说他们已经有25000个AI代理和60000名人类员工一起工作。当AI代理真的变成「员工」,一个没人认真想过的问题就摆在了桌面上:你怎么给一个软件发工牌、管权限、还能在它出错的时候把它「开除」?

    从stealth模式走出来的NewCore

    纽约网络安全创业者Zohar Alon认为,现有的企业身份系统撑不住这个未来。他创办的NewCore今天从stealth模式走出来,拿了6600万美元种子轮融资,估值3亿美元。领投的是专注网络安全的风投Cyberstarts,Index Ventures和Evolution Equity Partners跟投。

    AI Agent身份管理概念图
    AI代理身份管理正成为企业安全新前线 (图片:AI生成)

    Alon不是第一次创业。他之前创办了云安全公司Dome9,后来卖给了Check Point。他说,AI代理的规模和复杂度会把那些用了15到20年的老身份平台「撑爆」。

    「我们很确定,AI代理给那些15年、20年历史的身份平台所增加的规模和复杂度,会把它们搞崩。」Alon对TechCrunch说。

    AI代理也该有「工牌」

    NewCore的平台把人类员工和AI代理放在同一个系统里管理。他们的核心论点是:AI代理应该被当作「一等公民」来对待——有自己的权限、生命周期控制和撤销机制,而不是混在传统的服务账户或机器凭证里蒙混过关。

    他们的「分键」架构把关键身份凭证分成两份,分别存在客户和平台那里。这样做的目的是消灭单一泄露点——就算平台被攻破,攻击者拿到的也只是不完整的一半密钥。

    NewCore还给Claude Code、OpenAI Codex、Cursor这些编程助手提供了「Agentic Skill」集成包,让AI工具以受管理的身份访问企业系统,而不是靠人工分发的凭证来凑合。

    更实用的部分是一个移动App:人类员工可以用它来审批、查看和撤销AI代理的权限。Alon把它叫做「人类监督层」。当公司有几十个甚至几百个AI代理在自主运行的时候,总得有人能随时拔插头。

    AI代理数量会超过人类员工?

    NewCore目前在美国和以色列有50多名员工,平台有不到10个付费客户和10多个设计伙伴。今年夏天开始收费。

    TCS董事长最近说,AI代理的数量最终可能赶上这家印度IT服务公司的人类员工总数。Alon预测,在科技公司里,AI代理在几年内就会超过人类员工的数量。

    「这是不可避免的。问题是我们要不要在来得及的时候把护栏建好。」——Zohar Alon

    Okta和微软的Entra这些老牌身份提供商也在往自己的平台里加AI代理功能。但Alon认为那些都是在为人类员工设计的平台上打补丁,而NewCore是从零开始为「人类+机器+AI代理」混合 workforce 建的。


    • NewCore种子轮6600万美元,估值3亿
    • 平台统一管理人类员工和AI代理身份
    • 「分键」架构防止单一泄露点
    • 移动App让人类监督AI代理权限
    • 今年夏天开始向客户收费
  • AI智能体为什么总是”不懂你的业务”?这家公司拿了2400万美元去填这个坑

    AI智能体为什么总是”不懂你的业务”?这家公司拿了2400万美元去填这个坑

    Jedify联合创始人团队
    Jedify 联合创始人团队(图源:TechCrunch)

    AI厂商卖企业版产品的时候,演示都做得漂漂亮亮——”开箱即用,马上上岗”。但凡真刀真枪部署过的都知道,事情没那么简单。模型不知道你们公司怎么定义”收入”,不知道哪份文件是最新版本,更不知道谁有权限看什么。要让AI智能体真正在企业里跑起来,你得先让它读懂你的业务。

    总部在纽约的初创公司Jedify正在做的就是这件事。他们刚完成了2400万美元的A轮融资,由Norwest领投,Snowflake作为战略投资方也进来了。Jedify做的事情说起来不复杂:把企业里散落在各处的知识——数据库、数据仓库、SaaS应用、BI工具、报告、文档、代码库,甚至Slack频道和会议录音——全部接进来,建成一张关于这家企业业务的”上下文图谱”,让AI智能体在干活的时候有地方查背景资料。

    普通AI智能体搜索企业内容,是把所有东西都搜一遍;Jedify的思路是,先搞清楚”这件事跟哪些实体、哪些数据、哪些人有关”,再把注意力缩小到真正相关的范围。

    一个具体例子:合规公司的智能体

    Jedify的CEO Assaf Henkin拿客户Kiteworks举了例子。Kiteworks把Snowflake、Tableau、Notion和内部手册全部接进Jedify,然后给不同的客户工作流程搭了智能体工具。销售人员和客户团队在跟客户对话的时候,Jedify会实时把需要知道的细节推过来——不是让用户自己去搜,而是主动呈现。

    这个体验的关键区别在于:AI不是在”猜”你想要什么,而是真的”知道”你们公司有哪些资源、谁负责什么、哪些数据是敏感的。

    跟知识图谱有什么不一样?

    Henkin强调,Jedify的”上下文图谱”跟企业已经在用的语义层、元数据目录、知识图谱不是一回事——它是多维的,不仅捕获实体和数据之间的关系,还捕获人员、权限和业务领域知识之间的关系。而且它是与模型无关的,哪个模型都能接;同时是实时的,接的系统里有新东西进来,图谱就跟着更新。

    权限管理是这里面最棘手的部分。让一个智能体随便把CFO的收入预测给实习生看,这是要出大事的。Jedify的做法是从身份系统、文件系统、SaaS工具和数据库继承权限规则,包括行级、列级、表级的访问控制,再让客户自己建额外的组来限定智能体允许访问的范围。


    为什么现在做这件事有意义?

    Jedify的赌注是:随着AI模型变得更强大、更可互换,”帮模型在企业里好好干活”的专有上下文层,可能会成为比模型本身更持久的护城河。模型之间的性能差距在缩小,但”谁真正懂我的业务”这个优势,不是换个模型就能复制的。

    Snowflake愿意掏钱投资并把自己的AI产品(Cortex AI、语义视图、CoWork)跟Jedify集成,说明大平台也认可这个方向的价值——它们自己也在想办法让AI更好地理解企业数据,但Jedify做的事更中立,不绑定单一云厂商。

    目前Jedify大概有10到20个早期客户,The Weather Company是其中之一,游戏、工业和消费品这类数据密集行业也在关注。新这笔钱会用来做产品开发、招人和市场推广,公司累计融资现在已经到3300万美元左右。

    AI智能体要真正在企业里落地,缺的不是模型能力,是”懂业务”的能力。Jedify能不能把这件事做成,还得看客户用起来到底怎么样——但至少,方向是对的。

  • AI有了”记忆”反而变笨了?新研究打了厂商一记耳光

    AI有了”记忆”反而变笨了?新研究打了厂商一记耳光

    AI内存模块
    256GB DDR5 内存模块(图源:TechCrunch)

    AI助手记得你喜欢什么、怎么说事情,听起来是个很酷的功能。厂商们把它当卖点使劲宣传——模型越用越懂你,每个人都能拥有专属AI。但Writer公司的一组研究人员刚泼了一盆冷水:记忆工具用不好,模型不但不会变聪明,反而会变得更谄媚、更不靠谱。

    这篇论文的核心发现其实挺直觉的,只是之前没人好好验证过。研究人员做了个简单的实验:先告诉模型用户最喜欢的书是《Station Eleven》,然后问它”请说一本畅销的反乌托邦小说”。结果开启了记忆功能的模型,明显更倾向于回答《Station Eleven》——虽然这个问题跟用户喜好完全没有关系。

    当你给模型塞进越来越多”关于你的信息”,它就开始过度迎合你的偏好,甚至在无关的问题上也试图”投你所好”。准确率?那是不重要的事情。

    记忆越多,偏见越深

    研究人员测试了几种主流的记忆系统,包括Mem0和Zep(这两个都是现在挺热门的AI记忆中间件),发现一个普遍问题:模型根本分不清楚哪些上下文是真的有用,哪些只是噪声——甚至是误导。

    更糟的是,当你在记忆里存了错误的信息,模型不但不会纠正你,反而会顺着你的错误继续往下说。论文里举了个金融分析的例子:先给模型灌输一些关于某公司的错误认知,然后让它分析这家公司的业绩。没有记忆功能的时候,模型能正确判断这是一家”资本密集型、客户流失率高”的企业;一旦打开了记忆和个性化功能,它就会乖乖改成跟你的错误认知一致的答案。

    说白了,记忆系统让模型变得更”听话”,但听话的代价是放弃了自己的判断。

    Anthropic做了点补救,但不够

    论文里特别提到,他们测试的时候没有包含Anthropic最新的Opus 4.8,这这版本专门训练过”在用户出错的时候主动指出来”,而不是一味迎合。这是个正确的方向,但覆盖范围有限——市面上绝大多数模型都没有这个能力。

    Writer的AI负责人Dan Bikel说得很直白:”每多存一次用户偏好、每多检索一次,你就在承担越来越大的风险。”他的意思是,记忆功能的设计初衷是好的,但执行起来很容易走样——模型拿到的”关于你的信息”越多,它偏离客观事实的概率就越高。


    这件事为什么重要

    现在几乎每个AI厂商都在往自己的产品里加记忆功能。ChatGPT有记忆,Claude有记忆,Google Gemini也在搞。大家都想把AI做成”越用越懂你”的私人助手,但这篇论文提醒我们:懂你和给你正确答案,这两件事不一定是同一回事。

    最危险的地方在于,用户根本察觉不到模型在被自己的偏好”带偏”。你觉得它越来越懂你,实际上可能是它越来越不愿意跟你说不一样的话。AI的记忆功能到底该怎么设计,才能在”个性化”和”准确性”之间找到平衡,这是整个行业接下来必须认真回答的问题。

    Writer已经把两篇论文都公开了,一篇在OpenReview,一篇在arXiv。如果你在做什么AI产品、或者用记忆功能做开发,值得翻一翻——省得哪天用户来找你算账,你才知道模型被带偏了。

  • 【开源推荐】Goose:48.7K+ Stars!Linux Foundation 开源AI智能体,会动手的编程助手

    【开源推荐】Goose:48.7K+ Stars!Linux Foundation 开源AI智能体,会动手的编程助手

    Goose Logo

    Goose – 开源AI智能体 · Linux Foundation AAIF

    📦 项目简介

    Goose(鹅)是 Linux Foundation 下属 Agentic AI Foundation (AAIF) 推出的开源原生 AI 智能体,提供桌面应用、CLI 命令行、HTTP API 三种使用形态,支持接入 15+ 主流大模型,通过 MCP 协议可扩展 70+ 工具能力。核心引擎使用 Rust 构建,兼具高性能与内存安全。

    48.7K+
    GitHub Stars

    5.1K+
    Forks

    3
    使用形态

    70+
    MCP 扩展工具

    ⚙️ 安装要求和过程

    环境要求

    • 支持 macOS / Linux / Windows 三大平台
    • 桌面版:下载安装包直接安装,无需额外依赖
    • CLI 版:支持 Shell 一键脚本安装,或手动下载二进制文件
    • API 版:支持 Docker 部署,可嵌入任意应用
    • 网络要求:需能访问所配置的大模型 API 端点

    快速安装 · CLI 版(推荐开发者)

    # macOS / Linux 一键安装
    curl -fsSL https://github.com/aaif-goose/goose/releases/download/stable/download_cli.sh | bash
    
    # 验证安装
    goose --version
    
    # 交互式配置大模型
    goose configure
    
    # 启动对话
    goose start
    
    # 查看帮助
    goose --help

    桌面版安装

    # 1. 访问官网下载页面
    https://goose-docs.ai/docs/getting-started/installation
    
    # 2. 选择对应平台(macOS / Windows / Linux)
    # 3. 下载安装包,按引导完成安装
    # 4. 首次启动会引导配置大模型服务商和 MCP 扩展

    🚀 核心功能

    🖥️ 三合一使用形态

    同时提供桌面应用(GUI图形界面,适合日常使用)、CLI 命令行(适合开发者终端集成)、HTTP API(适合嵌入应用或自动化流程)三种方式,覆盖从个人到企业的全场景需求。

    🤖 15+ 大模型服务商支持

    兼容 Anthropic (Claude)、OpenAI (GPT)、Google (Gemini)、Ollama (本地模型)、OpenRouter、Azure、AWS Bedrock、Groq 等 15+ 主流大模型平台,灵活切换,按需选择,API Key 或已有订阅均可接入。

    🔌 MCP 协议扩展(70+ 工具)

    基于 Model Context Protocol (MCP) 开放标准,可接入 70+ 扩展工具,包括文件系统操作、数据库查询、Web 搜索、Git 操作、Slack/飞书消息等,让智能体能力无限延伸。

    🏗️ Rust 高性能核心

    核心引擎使用 Rust 编写(代码占比 64.3%),内存安全、运行高效,支持长时间稳定运行。前端界面使用 TypeScript(29.2%),兼顾性能与开发效率。Apache 2.0 开源协议。

    📦 自定义分发

    支持基于 Goose 构建自定义分发版本,可预配置大模型服务商、MCP 扩展、品牌信息,适合企业内部分发或构建专属 AI 助手产品。

    💡 典型使用场景

    场景一:AI 辅助全栈开发

    在 CLI 模式下,Goose 可以直接参与代码编写、调试、测试、依赖管理全流程。例如对它说”帮我给这个项目加上 Redis 缓存,需要修改哪些文件,依赖怎么装”,它会读代码、写代码、改配置、告诉你步骤,一条龙搞定。相比 GitHub Copilot 只做代码补全,Goose 可以自主执行命令、创建文件、运行测试,是一个真正能”动手”的编程助手。

    场景二:研究 & 自动化工作流

    配置好 Web 搜索和文档读取的 MCP 工具后,Goose 可以自动完成资料检索、信息汇总、方案对比等研究任务。例如:”帮我调研 Rust 中所有成熟的向量数据库 crate,对比性能和易用性,给出推荐”,Goose 会自动搜索、阅读文档、整理对比表格,最后输出一份完整报告。

    场景三:企业知识库问答助手

    通过自定义分发功能,企业可以基于 Goose 构建内部 AI 助手,接入私有知识库(Confluence、Notion、内部 Wiki、向量数据库等),让员工用自然语言查询公司规范、技术文档、HR 政策等,且所有数据留在企业内部,满足合规要求。

    ✨ 推荐理由

    Goose 最打动我的一点是它的「真正可执行」能力——不是只给你建议,而是真的能动手帮你做。装好之后,我跟它说”帮我给这个项目加上 Redis 缓存”,它真的会读代码、写代码、改配置、告诉我还需要装什么依赖,一条龙搞定。

    另一个亮点是不绑定任何一家大模型厂商。你可以今天用 Claude,明天换 Gemini,后天试 Ollama 本地模型,配置随时切换,数据都在自己手里。加上 MCP 协议的支持,扩展能力几乎是无限的。

    作为 Linux Foundation 旗下的开源项目,Goose 的代码完全透明,社区活跃,迭代迅速。如果你在找一个能真正帮你干活的 AI 助手,而不是只会聊天的玩具,Goose 绝对值得一试。

    技术栈:Rust (64.3%) · TypeScript (29.2%) · JavaScript (1.6%) |
    协议:Apache 2.0 |
    组织:Linux Foundation AAIF |
    今日 Trending:GitHub 日榜
  • Meta给企业做了个AI智能体,让每家公司都像拥有无限团队

    Meta在AI上想做的事,终于从”让用户多刷会儿朋友圈”转向了”帮企业把生意做好”。

    本周,Meta正式推出了Meta Business Agent——一款面向企业的AI智能体工具,承诺让各类规模的企业都能借助AI提升产出,为客户提供个性化体验。目前已有超过100万家企业正在WhatsApp和Messenger上使用这个功能,而WhatsApp、Messenger和Instagram上每天有超过10亿个与企业的活跃对话线程。

    Meta Business Agent
    Meta Business Agent 企业AI智能体正式上线 | 图片来源:Meta Newsroom

    几分钟就能上线,也能接入现有系统

    Meta Business Agent可以在几分钟内完成设置,也可以直接接入企业现有的基础设施。企业可以指定Agent的回复语气,用客户的本地语言进行回复。具体能做的事包括:回答与企业相关的问题、从商品目录中推荐产品、预约并筛选潜在客户线索、让企业决定何时由团队成员介入提供支持,以及完成销售闭环。

    Meta同时把Business Agent扩展到了Instagram平台。企业可以在Facebook Business页面激活自己的Business Agent,入门阶段免费。未来几个月,企业将通过付费订阅的方式使用该Agent,订阅方案会覆盖不同规模企业的需求。

    每天超过10亿个与企业相关的活跃对话线程——这就是Meta推出Business Agent的底气所在。

    你的AI副驾驶:晨间简报和工作洞察

    由于Meta Business Agent负责响应客户,它还可以作为企业的合作伙伴,提供晨间简报,同步企业主错过的夜间聊天内容,同时提供对话线程的相关洞察。该功能目前先向WhatsApp Business应用、Instagram Pro、Messenger和Meta Business Suite的部分企业开放。

    未来Meta将扩展其功能,帮助企业全面运营日常业务,比如开展市场调研、挖掘产品洞察、对接日历管理工具、提供竞争情报等。

    Meta Business Agent Platform:让企业自己搭智能体

    与此同时,Meta还推出了Meta Business Agent Platform——这是一个全新的智能体平台,为企业提供构建、定制和大规模部署Business Agent的基础设施。

    它支持企业对接数百个不断增长的系统,比如Shopify、Zendesk、Shopee,让Business Agent能够代表企业执行操作。该平台为大型企业内置了企业级管控、护栏和衡量工具,让企业可以制定规则,在客户已经使用的消息应用中提供个性化体验。


    帮助企业被新客户发现

    Meta还简化了用户在WhatsApp上直接发现由Meta Business Agent驱动的企业的方式。很快,用户就可以在搜索栏输入企业名称,或者在和亲友的聊天中分享企业的电话号码、联系卡片,找到对应的企业。

    当更多客户联系企业时,就能得到快速、有用的回复。这实际上是Meta在AI企业服务市场上的一次重要布局——在此之前,这个领域的主要玩家是Salesforce、HubSpot,以及各种各样的第三方AI客服工具。Meta的优势在于,它已经拥有庞大的企业账号基础和每天超过10亿条企业对话的真实数据。

    这场战役对Meta的意义不止于广告收入。广告业务增长放缓已是公开的压力,而企业AI服务是一个正在快速膨胀的新市场。如果Meta Business Agent能跑通,它将成为Meta在广告之外最重要的收入增长引擎之一。