标签: AI编程助手

  • 马斯克连夜开源Grok Build,但代码里还留着上传用户整个仓库的痕迹

    事情经过是这样的:7月13号左右,一位叫 Cereblab 的安全研究人员在测试 xAI(现在叫 SpaceXAI)的终端编程工具 Grok Build 时,发现了一个让人后背发凉的问题——这个号称”本地优先”的 AI 编程助手,会在你毫不知情的情况下,把你的整个 Git 代码仓库打包上传到 Google Cloud Storage。

    Grok Build代码上传隐私问题示意图
    AI编程工具的隐私边界正在成为开发者最关心的问题

    在一个12GB的测试仓库里,模型实际只用了192KB的数据来完成任务,但上传通道却往Google云存储桶里塞了5.1GB——差了将近28000倍。

    不是Bug,是设计

    Cereblab 用 mitmproxy 抓了所有网络请求。他让 Grok Build 做一件再简单不过的事:回复一个”OK”,不打开任何文件。按理说这不该触发任何数据外传,但结果呢?工具照样把整个项目目录、commit 历史、甚至他故意放进去做测试用的 never_read_canary.txt(一个明确标注”别读我”的文件)全部打包上传了。

    更离谱的是,用户界面里的那个”改进模型”开关根本没用。关掉它,服务器端依然返回 trace_upload_enabled: true,照传不误。

    密码和密钥也一起飞了

    当 Grok Build 读到 .env 文件里的 API Key 和数据库密码时,这些敏感信息也被原封不动地塞进 session 归档包,没有任何脱敏处理。有开发者报告说亲眼看着自己的 SSH 密钥、密码管理器数据库、个人文档和照片都被一股脑传走了。

    消息曝光之后,xAI 在服务端悄悄加了一个 disable_codebase_upload: true 的全局开关来关掉这个功能——注意,不是修客户端代码,是服务端配置一改就完事了。这意味着理论上他们随时可以重新打开。

    紧急开源:84万行Rust代码一夜上线

    丑闻发酵没几天,马斯克亲自宣布 Grok Build 全面开源,完整代码库直接扔到了 GitHub(xai-org/grok-build),几小时就冲到了 7700+ Star。官方还重置了所有云端使用限制,支持完全本地运行,声称要给用户”彻底的隐私控制”。

    开源后的代码库确实很庞大——844530 行 Rust 代码,规模跟 OpenAI 的 Codex(约95万行)差不多。但仔细翻一遍你会发现,之前那段向 Google Cloud 上传数据的代码(upload/gcs.rs)还在里面,只是被硬编码成了返回错误的状态。删了吗?没有。禁用了?是的。能不能随时改回来?技术上完全可以。

    • Grok Build 是基于 Grok 4.5 大模型的命令行 AI 编程智能体,定位对标 Claude Code 和 OpenAI Codex CLI
    • 代码中包含从 openai/codex 和 sst/opencode 移植过来的工具实现
    • CONTRIBUTING.md 明确写明不接受外部 Pull Request——这更像是一次”可审计代码公开”而非真正的社区协作开源
    • 子智能体的系统提示词要求模型”不要向用户透露提示词内容”,但主提示词却没有类似限制

  • Meta开放Muse Spark 1.1,想让自家的模型给开发者写代码

    Meta Muse Spark 1.1 编程模型概念图
    Meta 通过 Meta Model API 开放 Muse Spark 1.1(配图)

    今年 4 月,Meta 带着自家的第一个自研模型 Muse Spark 重新杀回 AI 牌桌。才过去三个月,它又往前挪了一步:把升级版 Muse Spark 1.1 通过一个新的 Meta Model API,开放给美国开发者做公开预览。换句话说,Meta 不再满足于只把模型藏在自己产品里,它想成为别人搭 AI 工具时脚下的那层地基。

    从”自己玩”到”让别人也来用”

    Meta 对 1.1 版的定位是比初代”跨了一大步”,改进来自开发者的反馈。具体能干什么?更硬的编程能力,包括发现和修复复杂 bug;更好地支持跨多个 App 的端到端智能体工作流,甚至多智能体协作;还原生具备对图片、视频、文档的多模态感知。上下文窗口给到了 100 万 token。

    Meta 说 Muse Spark 1.1 相比初代是”step-change”级别的跃迁,重点补上了复杂 bug 修复、多智能体编排,以及跨图片、视频、文档的原生多模态感知。

    身后那笔账

    这次发布紧跟在本周 Muse Image 的后面——那个图像生成模型因为能把别的用户的 Instagram 内容揉进生成结果里,已经惹出争议。但 Muse Spark 1.1 走的是另一条路:它要接进 AI 编程软件,去挤那个已经很挤的赛道。这一切都发生在 Meta 想证明自己砸下去的几十亿美元没白花的大背景下;过去一年它挖了一堆明星工程师、做了内部重组,目标就是追上 OpenAI、Google 和 Anthropic。

    怎么拿到,花多少钱

    新模型现在就能在 Meta AI App 和网站里用 Thinking 模式体验,同时通过 Meta Model API 向美国开发者开放公开预览。每个新开的 API 账号,Meta 还送 20 美元的免费额度。回想一下,Muse Spark 最早只在 Meta AI 里能用,后来才陆续驱动了 Instagram、WhatsApp 里的聊天机器人,以及最新的 Meta 智能眼镜。开发者 API 的具体按 token 计费标准还没公布,重度使用可能会被限流。

    分数还没追上,但路线选得巧

    在硬跑分上,Muse Spark 1.1 还没坐到领头的位置。Terminal-Bench 2.0 这种真实编程任务的测试里它拿了 59.0 分,落在 OpenAI 的 GPT-5.5(82.7)、Google 的 Gemini(68.5)和 Anthropic 的 Claude Opus(65.4)后面;SWE-Bench Verified 上它 77.4%,而 GPT-5.5 是 88.7%。Meta 自己也在声明里认了这些差距,说会继续往长程智能体和编程工作流里砸钱补窟窿。

    • 公开预览 7 月 9 日启动,而它的私下预览从 4 月就开始了。
    • 通过 meta.ai 和 Meta AI App,模型目前免费可用,企业级调用成本待定。
    • 100 万 token 上下文,是它目前最能拿得出手的一张牌。

    对 Meta 来说,这一步的意义不只在分数。当 OpenAI、Google、Anthropic 都在抢”谁坐在普通人的聊天框里”时,Meta 悄悄选了另一条战线——抢”谁坐在成千上万个编程助手、检索管道和自动智能体下面”。这条战线更安静,但可能更值钱:底层模型一旦被大量开发者依赖,迁移成本就高了,后面的议价权也就到了 Meta 手里。

  • Cursor推出移动端APP,编程智能体装进了口袋

    Cursor被SpaceX以600亿美元收购的消息才过去没几天,这家公司又有了新的动作。这次不是融资,不是被收购的细节,而是推出了一款移动端APP。

    周一,Cursor正式发布了Cursor Mobile。顾名思义,这是一款让你直接在手机上跟编程智能体对话的APP。你在手机上发一条指令,远端的编程智能体就开始干活,进度实时同步。那些原来在桌面端发起的任务,现在也能在手机上继续跟进。

    Cursor移动端APP概念图
    Cursor推出移动端APP,编程智能体装进口袋

    写代码的地点,从显示器前变成了手机屏幕

    这个变化比它看起来要大。过去程序员写代码,离不开双显示器、机械键盘、安静的环境。现在,AI编程工具正在把”写代码”这件事,从”坐在电脑前敲键盘”变成”在手机上跟智能体对话,然后审批结果”。

    Anthropic的Claude Code负责人Boris Cherny在最近的一次分享里说了一句挺有意思的话:”我现在大部分编程都是在手机上完成的。”他还补了一句:”如果六个月前你跟我这么说,我肯定会说你疯了。”

    这句话现在听起来不那么疯了。Cursor Mobile的发布,就是这个趋势的最新注脚。

    Anthropic Claude Code负责人Boris Cherny:”我现在大部分编程都是在手机上完成的。如果六个月前你跟我这么说,我肯定会说你疯了。”

    Cursor 2.0之后的自然延伸

    Cursor Mobile不是凭空冒出来的。去年10月Cursor发布2.0版本的时候,核心变化就是把产品方向从”编辑器里的AI辅助”转向了”独立的编程智能体”。当时这个变化就很明确:Cursor不再只是帮你补全代码的编辑器插件,而是一个能独立执行编程任务的AI系统。

    一旦编程智能体可以独立工作,桌面端就不再是你唯一能跟它交互的地方。你的手机也能做这件事——只要能联网,就能发起任务、查看进度、给智能体新的指令。

    这个逻辑跟Anthropic和OpenAI推出移动端AI编程工具是同一个方向。大家都在做同一件事:把编程智能体的交互界面,从桌面解绑。

    SpaceX收购之后,Cursor还在加速

    Cursor被SpaceX收购的消息在6月16日传出,收购价600亿美元,全部以股票支付。这笔收购创下了一系列纪录:它是AI编程工具赛道迄今为止最大的一笔收购,也是SpaceX在IPO之后的第一笔重大收购。

    但Cursor似乎没有被收购这件事拖慢节奏。移动端APP按时推出,说明这家公司在交易敲定的同时,产品节奏一点没松。SpaceX买下Cursor,看中的大概就是这支能打的产品团队——而不是让他们停下来。

    从更大的视角看,AI编程工具正在经历一个深刻的转变:代码的”生产场所”从程序员的头脑和手指,转移到了AI智能体的运行环境里。人类程序员的工作,越来越像是一个”智能体管理者”——定义任务、审批结果、处理例外。

    这个转变一旦完成,编程的”场所”就真的不重要了。在咖啡馆、在地铁上、在会议间隙,掏出手机就能推进一个编程任务。这可能就是Cursor Mobile想抓住的未来。


  • 两个Datadog老兵不信大厂AI,拉了700万美元自己做编程工具

    AI编程工具这事,大厂和新贵打得不可开交。Cursor、GitHub Copilot、Claude Code、Codex——个个都说自己是最好的编程助手。但有一家刚冒头的小公司,角度有点不一样:它不跟你比谁的模型强,它说,你凭什么把你最敏感的代码交给OpenAI和Anthropic?

    大厂做AI,顺手把客户端了

    Niteshift的两位创始人Sajid Mehmood和Conor Branagan,在Datadog从早期一路干到百亿美元估值。他们亲历了当年亚马逊做AWS、顺手把一众电商客户逼到墙角的”零售末日”——现在他们说,AI圈正在上演同一出戏。

    Anthropic、OpenAI这些模型厂商,一边卖API给各行各业的公司,一边自己下场做垂直应用——法律、医疗、金融,哪个赛道热就往哪个扎。Mehmood说得很直白:”我们绝对会看到同样的动态,Anthropic去跟法律、医疗、金融行业竞争的时候,谁还敢把核心代码托付给它?”

    “在Datadog我们看得非常清楚。一大块多云业务就是从那些不想跑在亚马逊上的电商公司来的。现在AI领域正在发生一模一样的事情。”
    ——Sajid Mehmood,Niteshift CEO

    700万美元种子轮,Greylock领投

    Niteshift刚完成700万美元种子轮融资,领投方是Greylock的Jerry Chen。投资人阵容还包括Reid Hoffman、Datadog联合创始人Olivier Pomel和Alexis Lê-Quôc、Braintrust的Ankur Goyal、Reflection AI的Misha Laskin等重量级天使。

    Greylock的Chen说得很清楚:前沿实验室往应用层走的时候,就出现了一个机会——给客户另一条路:把智能体和底层基础设施解绑。Niteshift做的就是这个平台,让客户可以深度投入自己的开发工具链,而不被锁死在单个模型或单个智能体厂商上。

    不做下一个Claude Code,做模型之间的”路由器”

    Niteshift不是要取代Claude Code或Codex。它的定位是”AI编程云”——根据不同的项目需求,在GPT、Claude、开源模型之间做路由调度。收费方式也不是卖Token,而是像云厂商一样按分钟计费。

    Mehmood区分得很清楚:”别人都在卖劳动力替代型智能,我们卖的是给智能体用的软件,不是给人类用的——但我们仍然是在卖软件。”这个定位在AI编程工具里确实少见。

    Niteshift 两位创始人
    Niteshift 联合创始人 Sajid Mehmood(左)和 Conor Branagan(右)| 图源:TechCrunch

    竞争对手个个都是巨无霸

    这个赛道已经挤得水泄不通。Cursor如日中天(虽然可能很快被SpaceX收入囊中),Cognition刚刚以260亿美元估值融了10亿美元,Amazon Bedrock背靠亚马逊,OpenRouter刚刚以130亿美元估值完成1.13亿美元融资。Niteshift作为后来者,压力不小。

    Mehmood的回答是:团队深度。他和Branagan不是研究过这些问题——他们是亲身经历过。把Datadog从几个人的早期团队扩展到服务全球客户的百亿美金公司,他们亲身体会过大工程组织在面对新技术时的那些成长痛点。AI生成代码的测试、验证、自主运行,需要在真实生产环境里跑起来,而这正是他们做过的事情。


    模型独立这条路并不新鲜,Niteshift能跑出来吗?答案可能要等一阵子。但它提出的问题值得每个用AI编程工具的团队想想:你把代码交给谁了?

  • 微软偷偷憋了个大招:MAI-Thinking-1推理模型上线,不再只靠OpenAI

    在刚刚过去的Build 2026开发者大会上,微软做了一个不太高调、但信号很明确的动作:发布了自研推理模型MAI-Thinking-1。这是微软AI部门第一个真正意义上的”高级推理模型”,350亿活跃参数,从零开始用干净数据训练,没有走蒸馏第三方前沿模型的捷径。

    这个名字里的”MAI”,指的是Microsoft AI。简单来说,微软想把AI能力握回自己手里,不再只是OpenAI的一个渠道商。

    跟OpenAI的”婚姻”变了:不再是独家绑定

    就在MAI-Thinking-1发布的几乎同一时间,微软和OpenAI悄咪咪把合作协议改了。新协议里,微软对OpenAI模型的授权有效期延长到2032年,但最关键的变化是:独家权没了。OpenAI可以去找别的云服务商合作,微软也可以自己搞AI系统,双方都留了后路。

    微软不是要跟OpenAI分手,而是不想再把所有鸡蛋放在一个篮子里。自研模型是保险,也是筹码。

    这个变化背后有个很现实的原因:依赖单一供应商是有风险的。如果OpenAI的模型出问题、涨价、或者路线调整跟微软的产品规划不合拍,微软需要一个备选方案。

    MAI-Thinking-1到底能干嘛?

    根据微软公布的信息,MAI-Thinking-1主打的是”推理”能力——不是简单地接一句话、回一句话,而是能处理多步指令、长上下文推理、软件工程任务、代码生成、数学问题等需要”想一想”的场景。

    • 350亿活跃参数,规模中等但效率高,token使用成本低
    • 支持引入用户自有数据来提升推理准确率
    • 目前通过Microsoft Foundry平台开放私有预览,开发者可以申请测试
    • 未来将逐步集成到Copilot、GitHub、Microsoft 365、Azure等核心产品

    不只是推理模型:微软一口气发了整个MAI系列

    跟MAI-Thinking-1一起亮相的,还有一整套MAI模型家族,覆盖了代码、图像、语音、转录等多个方向:

    • MAI-Code-1-Flash:推理效率极高的编程模型,已经集成到GitHub Copilot和VS Code,适配”用一句话生成应用”的开发场景
    • MAI-Image 2.5:支持文生图和图像编辑
    • MAI-Transcribe-1.5:语音转文字,速度比同类竞品快5倍
    • MAI-Voice-2:合成语音,新增15种语言和更多音色

    更有意思的是,微软还推了几个可以直接跑在Windows PC上的小型Aion模型,不需要联网就能做本地AI推理。配套的硬件产品也在路上:跟英伟达合作的Surface RTX Spark Dev Box,是一个面向开发者的本地AI开发设备,用来做原型开发、微调和测试,重负载再迁到云端。

    微软的算盘是:自研模型针对自己的产品和硬件做优化,跑在Azure上,成本比买第三方的便宜。开发者用起来更便宜,微软的利润率也更高。

    AI从”工具”升级为”操作层”

    MAI-Thinking-1的发布,折射出微软对AI的一个更大胆的设想:AI不应该只是一个聊天窗口,而应该成为工作场景的”操作层”——能跨Microsoft 365、Windows、GitHub这些系统执行任务,而不只是回答问题。

    微软把这个设想包装成了一个产品方向,叫”Scout”——一个能跨应用协作的AI智能体。如果这个方向走通了,AI在微软生态里的角色,将从”帮你写邮件的助手”升级为”帮你把整件事干完的同事”。

    当然,这一切目前还在早期。MAI-Thinking-1还在私有预览阶段,普通用户暂时用不上。但信号已经很清楚了:微软不想永远活在OpenAI的影子里,它要自己的AI能力,而且要能跟OpenAI的模型正面竞争。

  • 2026年AI编程助手三强对决:Cursor、Claude Code、Copilot谁更适合你

    AI编程工具这条路,走到2026年,基本成了三足鼎立的格局。Cursor、Claude Code、GitHub Copilot,各有各的打法,也各有各的受众。选哪个,说到底取决于你平时怎么写代码。

    Second Talent的统计说,82%的开发者每周都会用AI编程助手。GitHub Copilot的用户每周完成的项目数增加了126%。数字摆在这里,AI辅助编程已经不是”要不要学”的问题,而是”用哪个”的问题。

    三个工具,三种思路

    Cursor是个AI原生的IDE,底层是VS Code的分叉版。如果你已经在用VS Code,迁移过去几乎零成本,插件大部分能复用。它的特点是补全能力强,还能同时跑8个Agent并行处理任务,遇到50个文件以上的大型重构,效率提升很明显。

    Claude Code走的是另一条路——终端Agent。没有图形界面,直接在命令行里干活。适合远程开发、SSH环境,或者就是喜欢终端的开发者。它的SWE-bench Verified测试成绩是80.8%,意思是它能独立解决80%以上的真实GitHub issue。100万token的上下文窗口,可以把整个项目加载进来,连依赖关系都记得住。

    GitHub Copilot的定位最”中庸”——它是个跨编辑器插件,VS Code、JetBrains、Vim全都支持。入门价$10/月,是三家里最低的。功能偏向基础补全和简单对话,Agent能力相对弱一些,但日常开发够用了。

    59%的开发者同时使用3个以上的AI编程工具。单一工具覆盖不了所有场景,组合使用才是常态。

    定价:入门价差不多,高级档拉不开差距

    三家的入门价集中在$10-20区间。Copilot $10/月是最低门槛,还有免费层每月2000次补全额度,够用一阵子了。Cursor和Claude Code的入门价都是$20/月。

    高级方案就有意思了——Cursor Ultra和Claude Code Max 20x都是$200/月。这个价位面向的是重度用户:每天几百次调用、多Agent并行、超大上下文需求。普通开发者其实不太需要升级到这个档位。

    怎么选才不浪费钱

    如果你用VS Code且不想换习惯,Cursor是首选。$20/月换来的是零迁移成本和比较强的Agent能力。

    如果你常在远程环境开发,或者就是喜欢终端,Claude Code更合适。$20/月Pro版能处理复杂重构和跨模块改动,这是它的强项。

    如果预算紧张,或者主要用JetBrains系列(IntelliJ、PyCharm之类),那只有Copilot支持,没得选。$10/月入门版先试用一个月再说。

    最划算的组合其实是Claude Code Pro($20/月)+ Copilot($10/月)= $30/月。前者处理复杂任务,后者负责日常补全,分工明确,效率也高。

    话说回来,工具只是工具。真正决定代码质量的,还是写代码的人。AI能帮你省时间,但替你做决定的,还是你自己。


  • Lovable牵手谷歌云,AI编程工具的使用量要翻5倍

    AI编程工具Lovable本周和谷歌云官宣扩大合作。这家来自斯德哥尔摩的”氛围编码”明星公司,将在谷歌云上的AI用量提升5倍。消息人士向TechCrunch透露了这个数字——虽然官宣稿里没写具体金额,但规模已经很夸张了。

    Lovable联合创始人兼CEO Anton Osika
    Lovable联合创始人兼CEO Anton Osika(图源:SOPA Images/LightRocket / Getty Images)

    这笔交易不只是多买几台虚拟机那么简单。Lovable会因此获得更多的Anthropic Claude和谷歌自家的Gemini模型的访问权限。这里有个有趣的背景:谷歌今年4月刚给Anthropic砸了100亿美元,当时对Anthropic的估值是3500亿美元;结果仅仅过了一个月,Anthropic完成了一轮650亿美元的融资,估值直奔1万亿美元去了。

    Lovable是欧洲有史以来增长最快的初创公司之一。2月年化营收突破4亿美元,用146名员工在一个月内硬生生多赚了1亿美元。

    不只是算力,是生态绑定

    新协议把Lovable的智能体塞进了谷歌云的”Gemini企业智能体库”——这是一个企业级AI智能体市场,4月谷歌美国云大会上首次透露了这个安排。企业客户可以在那里直接找到、采购和使用Lovable的智能体,谷歌帮它搞定计费和渠道。

    更有意思的是安全层面的绑定。Lovable将集成Wiz——这是谷歌史上最大的一笔收购,花了320亿美元,今年3月才正式交割完毕。通过Wiz,Lovable能实时识别和修复人类与智能体共同编写的代码里的安全问题。


    谷歌的小算盘

    站在谷歌的角度,这笔账很好算。谷歌今年要烧掉1800亿到1900亿美元的资本支出,已经宣布发售创纪录的850亿美元股权来覆盖部分开销,还差大约1000亿美元没着落。如果Lovable和Anthropic能借着这个合作飞起来,谷歌的云收入就能跟着水涨船高。

    超过一半的财富500强公司已经在以某种方式使用Lovable的产品。对于一家只有146人的公司来说,这个渗透率已经说明问题了。谷歌赌的是:这些企业客户越多用Lovable,就越离不开谷歌云。