标签: Gemini

  • Google的AI大牛们正在集体出走,Anthropic和OpenAI疯狂捡人

    Google的AI研究部门正在经历一轮令人不安的人才流失。根据彭博社的报道,顶级AI研究人员Jonas Adler和Alexander Pritzel已经决定离开Google,加盟Anthropic。这两个名字你可能不太熟悉,但他们都是Google Gemini模型开发过程中的核心人物。

    一周之内,连续出走

    这已经不是偶然事件了。就在上周,传奇AI研究员Noam Shazeer刚刚宣布离开Google、加入OpenAI。Shazeer在Google的资历极深——2000年就加入了,中间出去创立了Character.AI(那个做AI聊天伴侣的创业公司),后来Google花了27亿美元把Character.AI的人才和技术基本整个买了回来,目的就是把Shazeer弄回来主导Gemini项目。

    AI研究人员从Google流向Anthropic和OpenAI
    顶级AI研究人员正从Google流向Anthropic和OpenAI | 来源:TechCrunch

    结果人刚回来没多久,又要走。而且这次不是一个人——就在Shazeer官宣之后几天,DeepMind的总监John Jumper也宣布离职去Anthropic。Jumper可不是普通研究员,他和DeepMind CEO Demis Hassabis一起拿了2024年的诺贝尔化学奖,获奖理由是用AlphaFold预测蛋白质三维结构,这项技术对整个生物界都有颠覆性意义。

    一个诺贝尔化学奖得主、一个Gemini核心架构师、一个Character.AI创始人——这些人短时间内接连离开,对任何一家公司来说都是值得警惕的信号。

    为什么是现在

    时机很微妙。OpenAI和Anthropic都在准备IPO,这对于顶尖AI人才来说是一个极具吸引力的时刻——用股权来抢人,这种手段在硅谷从来都好使。相比之下,Google的薪资福利虽然依然顶级,但股票增值的想象空间跟一家即将上市的公司能给出的期权比起来,确实没那么性感了。

    还有一个更深层的问题:Google内部对AI研究方向的控制和优先级排序,可能让一些研究员感到受限。Anthropic主打AI安全研究,OpenAI虽然争议不断但至少在推进AGI路线上目标明确。如果研究员觉得自己在Google做不了最想做的东西,出走只是时间问题。

    这对Google意味着什么

    短期来看,Gemini项目不会因为几个人离开就垮掉——Google的资源和人才储备依然深厚。但长期来看,如果这种顶级人才持续外流的趋势不能遏止,Google在大模型竞赛中的技术领先地位就会被一点点蚕食。

    更关键的是,Anthropic和OpenAI正在形成某种人才”黑洞效应”——越多顶级研究员过去,对那些还在犹豫的人吸引力就越强。Google现在需要认真想想,除了钱之外,还能给这些最顶尖的脑子提供什么他们真正想要的东西。


  • Google终于认真做智能音箱了,这次靠Gemini能不能翻身

    Google终于认真做智能音箱了,这次靠Gemini能不能翻身

    智能音箱这个品类,已经沉寂太久了。自从2020年Google发布Nest Audio之后,这个品类就进入了某种休眠状态——功能年年小修小补,但没人真正重新想一想:有了大模型之后,音箱到底应该是什么样子。

    Google本周给出了它的答案:一台叫做Google Home Speaker的新设备,售价99.99美元。这是Google六年来第一款真正意义上的新音箱,也是第一款”为Gemini而生”的音频设备。

    Google Home Speaker智能音箱
    Google Home Speaker,底部有一圈环形灯 | 图片来源:Google

    自然语言,终于能用了

    老一代智能音箱最大的问题,是你得”学它的语言”。想关灯,得说”关掉客厅的灯”;说错了用词,它就听不懂。Gemini进来之后,这个逻辑被打破了。

    新音箱支持完全自然的多步骤指令。你可以说:”把厨房灯调暗,放点轻松的音乐,再设个20分钟的定时器。”一句话,三个动作,不需要分三次说,也不需要记住特定的唤醒词格式。

    更实用的一点是:它支持中途纠正。说到一半改主意了?直接改就行。”把咖啡机关掉……哦不对,是打开。”Gemini能理解这种日常对话里的反复,而不是让你重新来过。

    10种新声音,能聊也能问

    除了控制智能家居,这台音箱还被设计为可以和你对聊。它内置10种新声音,支持”持续对话”模式——不用说”OK Google”就能接着问。你可以拿它学东西、查资料、聊想法,基本就是把Gemini的对话能力,从手机屏幕搬到了客厅里。

    音箱的麦克风会在”持续对话”模式下短暂保持开启,让你能自然追问,而不必每次都重新唤醒。

    外观上,新音箱延续了Google一贯的织物包裹设计,圆形身材,3.4 x 4.2英寸大小。美国市场有Jade和Berry两种颜色,全球版本则提供Hazel和Porcelain。底部新增一圈环形灯,用不同光效表示”在听”、”在想”和”在回答”三种状态。

    订阅制来了:高级功能月费10美元

    不是所有新功能都免费。Google推出了Google Home Premium订阅计划,月费10美元(或年费100美元),解锁更强大的AI能力:

    • Gemini Live自由对话(更高级的多轮语音聊天)
    • Nest摄像头活动解读——你不在家时,AI帮你总结发生了什么
    • 更深度的智能家居场景联动

    好消息是,Google会在前六个月免费提供这些高级功能,让你先试试再看值不值得续费。这套路和手机厂商差不多——先让你用上,再决定要不要交钱。

    问题是,消费者愿意为智能音箱的AI能力每月交10美元吗?Google在这个时间点推订阅制,勇气可嘉,但市场买不买账,还得看实际体验。


    这台设备目前已经开放预购,本月晚些时候发货。Google显然希望Gemini能成为下一个时代的”音箱灵魂”,就像Siri定义了上一代设备一样。只是,六年过去了,人们的注意力早就从音箱转移到了手机、耳机、甚至眼镜上。Google这次能不能翻盘,答案可能要等到年底假期销售季才能揭晓。

  • 把手机举到耳边就能实时翻译:Google把70种语言塞进了你的电话

    把手机举到耳边就能实时翻译:Google把70种语言塞进了你的电话

    Google Translate刚上线的时候,你把一句话敲进去,等两秒,它给你吐出来一段有时候对有时候不对的文字翻译。二十年过去,Google的翻译引擎已经每个月为几十亿用户处理超过一万亿个单词。现在他们想把「实时语音翻译」也做成每个人随手就能用的东西。

    不等你说完就开始翻

    Gemini 3.5 Live Translate是Google最新的语音翻译模型,支持70多种语言。最关键的部分是:它不像老一代翻译App那样等你把一句话说完才开工。它是连续生成的,边听边翻,延迟只有几秒钟,语气和节奏都尽量贴合说话的人。

    Google Gemini 3.5 Live Translate实时翻译概念图
    把手机举到耳边,就像接电话一样听翻译 (图片:AI生成)

    最有趣的功能是Android上的「聆听模式」:你把手机举到耳边,就像接电话一样,翻译好的语音就从听筒里直接出来。不用戴耳机,也不用举着手机让别人看到屏幕。Google说这个功能在你想快速听翻译、又不想让别人听见的时候特别有用——比如在国外旅游听到导游讲解,或者在异国他乡的商店里和店主砍价。

    「只需把手机举到耳边,就像一通普通电话,翻译好的语音就直接流进你的耳朵。」

    从5种语言到70种

    Google Meet也在用这个模型。以前Meet的翻译功能只支持5种语言,而且只能译成英文或者从英文译出。现在换成3.5 Live Translate之后,一口气的70多种语言、2000多种语言组合都能在会议里实时互译。这个功能这个月开始向部分企业Google Workspace客户开放私测。

    Grab也在测试这个模型。他们平台上每个月有超过1000万通语音通话,主要是司机和乘客之间的。两边经常说不同的语言,实时翻译能直接帮上忙。

    所有生成的语音都打了SynthID水印——这是Google开发的一种几乎听不出来的音频水印,用来标记这段内容是AI生成的,防止被人拿来造谣。

    在哪里能用?

    • Google Translate App(Android和iOS)——已全球推送
    • Gemini Live API —— 开发者公测版
    • Google Meet —— 部分企业客户私测中
    • Android「聆听模式」—— 正在逐步推送

    这篇文章其实没什么深奥的道理可讲。就是Google把一样东西做得更好、更顺手了。你要真想知道它翻译得准不准,最好的办法是找个说外语的朋友,面对面试试。


  • 苹果WWDC26:库克谢幕演出,Siri终于用上了Gemini

    2026年6月9日凌晨,苹果全球开发者大会在Apple Park正式开幕。这是蒂姆·库克作为CEO主持的最后一届WWDC——他自己大概也没想到,告别演出会赶上苹果软件史上最大的一次AI转型。

    整场发布会没有发布任何硬件,但软件层面的变化堪称近年来最具野心的一次。iOS 27、iPadOS 27、macOS 27、watchOS 27、visionOS 27全部亮相,AI渗透进了系统的每一个角落。苹果用一整场发布会宣告:AI时代,它不会再缺席。

    苹果WWDC26发布会
    苹果WWDC26:AI全面渗透苹果生态(图片来源:中关村在线)

    Siri终于像个现代AI了

    Siri从2011年推出到现在,用户体验一直停留在”能听懂话但不够聪明”的阶段。这次,苹果把它彻底重做了。

    新Siri不再是一个弹窗助手,而是以独立App的形式亮相,交互方式全面向ChatGPT这样的聊天机器人靠拢。背后用的是苹果与谷歌合作定制的Gemini模型(国行用户暂时还用不了)。

    三大核心能力值得一提:跨应用操作、屏幕感知、个人情境理解。唤醒Siri后,灵动岛会自动扩展显示”Search or Ask”提示,从屏幕顶部下滑就能触发全局搜索。你还可以把ChatGPT、Claude等第三方AI设为默认引擎——苹果管这个叫”模型自由”。

    照片编辑被AI彻底改造

    相机App里新增了一个”Siri模式”,跟拍照、视频等模式并列,用来快速调用Apple Visual Intelligence视觉智能功能,比如识别植物、翻译文字、读取营养标签、从名片上抓取联系信息。

    相册应用新增了三个AI工具:Extend可以智能扩图,自动把照片边界向外推,用AI生成的内容填充新区域;Reframe让你按住拖动主体就能改变照片的透视和构图;CleanUp消除功能也大幅重建,之前用户抱怨的物体去除不干净的问题,这次基本解决了。

    你甚至可以用语音或文字指令修改图片局部,比如”给蛋糕加几根蜡烛”——Siri听得懂,也改得出来。

    Apple Intelligence的写入,让照片编辑从”手动工具操作”变成了”用自然语言对话”。

    性能提升是实打实的

    苹果宣称iOS 27精简了冗余代码,内存占用减少20%,日常续航延长1至2小时。应用启动速度提升30%,照片在图库中的显示速度提升70%,隔空投送速度提升80%。

    macOS 27代号”GoldenGate”,一个标志性的变化是停止对Intel架构Mac的支持——Intel Mac正式走入历史。视觉上延续了液态玻璃设计语言,但新增了系统级透明度调节滑块,用户可以在完全不透明和半透明磨砂效果之间自由调节。

    手表和头显也没落下

    watchOS 27最大的看点是AI与健康监测的深度融合。高血压风险预警功能已经进入FDA审批流程,Siri在手表端的上下文理解能力也明显增强。苹果还计划推出”Health+”付费健康订阅服务,用AI深度分析Apple Watch和iPhone的健康数据。

    visionOS 27相对保守,以稳定性和性能优化为主。最大的变化是Siri在visionOS中以球体形态呈现,用户看向它就可以提问。


    大会主题叫”先来曝点光”。从Siri的彻底重生到相机的全面AI化,从照片编辑的智能化到系统性能的全面提速——苹果用这场发布会证明,它正在把AI推到每一个用户触手可及的地方。

    库克时代的最后一次WWDC,苹果选择用AI照亮下一个十年。

  • NotebookLM悄悄升级Gemini 3.5,你的AI笔记本现在能跑代码了

    NotebookLM Gemini 3.5 upgrade
    NotebookLM升级Gemini 3.5,每一个笔记本现在都连着一台云电脑 | 图源:The Verge

    你的AI笔记本,现在能自己跑代码了

    谷歌这两天悄悄给 NotebookLM 推了个大版本更新,可能很多人还没注意到。简单说就是:NotebookLM 现在用上了 Gemini 3.5,而且每一个笔记本背后都连着一台”云电脑”。

    这个变化比听起来要大。以前 NotebookLM 主要做的是帮你整理笔记、回答你导入材料里的问题,本质上是个”阅读理解”工具。现在不一样了——它能写代码、跑代码、生成图表、输出各种格式的文件,已经有点像个住在你笔记本里的研究员了。

    谷歌在官方博客里说,升级后的NotebookLM”更准确、更可靠”。但真正有意思的不是这个说法,而是它现在能做的事。


    云电脑是什么意思

    这次更新最核心的变化,是 NotebookLM 现在跑在谷歌的代理编码平台 Antigravity 上。每一个你创建的笔记本,背后都挂着一台安全的云计算机。

    这意味着什么?意味着 NotebookLM 不再只是”回答问题”——它可以主动写代码来做分析,然后把代码扔到那台云电脑上跑,再把结果返回给你。你要它帮你分析一组数据,它可以直接写Python代码、跑统计、画图表,然后把图表给你。

    以前要做到这个程度,你得自己会写代码,或者至少会用 Colab、Jupyter 这类工具。现在你在 NotebookLM 里用自然语言描述你想做什么,它自己就把代码写了、跑了、结果也给你了。

    输出的格式也多了很多。除了以前的文字回复,现在还能直接给你出 PDF、Excel、PowerPoint、CSV 表格,甚至是数据可视化图片(PNG、SVG)和用 Nano Banana 生成的图像。


    不用导入资料也能用了

    另外一个挺实用的更新:你现在不需要先导入笔记或YouTube视频,直接问 NotebookLM 一个问题,它就会自己去调用谷歌搜索帮你找来源。

    这其实是对之前”发现”功能的升级。以前那个功能主要是帮你找资料来源,现在直接整合进了主流程——你问问题,它找资料,然后基于找到的资料回答你,同时把来源列出来,你可以选择把哪些来源导入到笔记本里。

    这个改动看起来小,实际上降低了使用门槛。以前你得先有组织笔记的习惯,才会想到用 NotebookLM。现在哪怕你只是想快速了解一个话题,也可以直接把它当搜索工具来用,而且比普通搜索靠谱——因为它会给出来源,你可以追溯。


    目前只有高价用户能用

    当然,谷歌一贯的作风——好功能先给有钱的用户用。这次更新目前只推送给 Google AI Ultra 订阅用户和 Workspace 用户。普通用户什么时候能用上,谷歌没说。

    AI Ultra 每月要付的钱不少,Workspace 也是企业级收费。所以某种程度上,这也是谷歌在给自己的高价订阅套餐增加卖点。但你不得不承认,如果这些功能最终下放到免费版或低价版,竞争力会相当强。

    想想看:一个能自己跑代码来做分析的 AI 笔记工具,还自带搜索和来源追溯,而且所有计算都在云端完成,不占用你本地资源。对于做研究、写报告、分析数据的人来说,这基本上就是把以前需要好几个工具配合才能做的事,塞进了一个界面里。

    • 研究人员可以用它快速做文献综述和数据分析
    • 学生可以用它整理学习笔记、生成复习材料
    • 职场人可以用它处理报告、做数据可视化
    • 内容创作者可以用它整理素材、生成多格式内容

    AI笔记工具的角逐开始了

    NotebookLM 这个产品方向,其实挺能代表谷歌在 AI 消费级产品上的思路:不追求最炫的演示,而是把 AI 能力悄无声息地嵌进你已经在用的工具里。

    对比一下,苹果的 WWDC 刚说要让 Siri 能帮你做更多事,微软在推 Copilot,Notion 也有 AI 功能。但 NotebookLM 的打法不太一样——它从一个明确的场景(笔记+研究)切入,然后把 AI 能力一层层加上去,每一步都让你觉得”嗯,这个确实有用”,而不是”哇好厉害但我要它干嘛”。

    这次加上云电脑和代码执行能力,算是往前迈了一大步。接下来就看其他家怎么跟了。可以预期的是,类似的”AI+代码执行+多格式输出”的能力,很快就会出现在其他笔记和生产力工具里。

    如果你有 Google AI Ultra 或 Workspace 账号,现在就可以去试试新版本的 NotebookLM。没有的话,可能还得等一段时间。但不管怎样,这个方向值得关注——它很可能改变很多人做研究和整理信息的方式。

  • 谷歌这个功能太小看,把手机贴耳边就能实时翻译,出国不用愁了

    谷歌这个功能太小看,把手机贴耳边就能实时翻译,出国不用愁了
    谷歌Gemini Live Translate新增聆听模式(图源:生成的AI配图)

    用翻译软件最尴尬的时刻是什么?大概就是你对着手机说话,周围人都在看你,而你还要戴个耳机才能听到翻译结果。谷歌最近给Gemini 3.5 Live Translate加了一个新功能,直接把这种尴尬消除了——你只需要像接普通电话一样,把手机贴在耳边,就能听到实时翻译的音频,不用戴耳机。

    以前要戴耳机,现在不用了

    Live Translate这个功能之前就有,但一直有个不太方便的地方:如果你想听翻译结果,要么开外放(在公共场合很尴尬),要么戴耳机(多了一个设备)。谷歌这次推出的”聆听模式”,就是为了解决这个问题。你把手机贴在耳边,翻译音频直接从听筒出来,只有你能听到,和接电话一模一样。

    这个设计看起来简单,但实际使用场景很多。比如你在国外旅游,在餐厅点菜,或者在街上问路,你只需要打开Gemini Live Translate,把手机贴耳边,对方说的话就会被实时翻译并传到你耳朵里。不需要盯着屏幕,不需要戴耳机,体验自然了很多。

    谷歌官方说,这个功能目前先给安卓用户用,支持超过70种语言。覆盖的语言数量足够多,基本上你去大部分国家都不会遇到语言障碍。

    实时翻译这件事,谷歌做了很多年

    谷歌在翻译这块积累很深。从最早的文本翻译,到后来的拍照翻译(Google Lens),再到现在的实时语音翻译,每一步都在降低跨语言沟通的门槛。Live Translate是去年跟着Gemini 2.0一起推出的,当时的卖点是可以边走边聊,不用停下来打字。现在加了”聆听模式”,又往前走了一步。

    和同类产品比,谷歌的优势在于语言覆盖量和翻译质量。支持70多种语言实时翻译的产品不多,能做到翻译质量接近人工的更少。当然,实时翻译还是有延迟和准确率的问題,特别是遇到口音重或者专业术语的时候,但日常使用已经足够。

    AI让翻译变得更自然

    这件事的背后其实是AI能力的提升。以前的机器翻译是逐句翻译,翻出来生硬且不连贯。现在的AI翻译能理解上下文,甚至能处理习语和文化差异。Gemini 3.5的Live Translate之所以能做到”贴耳边就能用”,是因为AI能够在极短时间内完成语音识别、翻译和语音合成,延迟低到用户几乎感觉不到。

    对于经常出国或者需要和外语人士交流的人来说,这个功能确实实用。虽然还没有正式推送给所有用户,但已经有人在测试了。如果你用的是安卓手机,可以关注一下Gemini应用的更新,这个功能应该会很快覆盖到更多人。


  • WWDC 2026:苹果准备再次介绍Siri,这次真的要用上Gemini了

    过去几年,苹果在AI这条路上一直在追赶。但换个角度看,落后未必是坏事。

    周一的WWDC 2026上,苹果准备再次向用户介绍新版Siri。说”再次”,是因为我们早在2024年苹果高调”推出”Apple Intelligence时就见过新Siri了——当时换上了发光边框,提供了不同的语音选项,还具备了把问题转交给ChatGPT的能力。苹果当时承诺Siri的”智能”功能很快上线,结果并没有。

    事实上,苹果围绕Apple Intelligence的宣传如此具有误导性,以至于公司正在和解一起集体诉讼,需要为从未兑现的功能向iPhone用户进行赔偿。

    2024年WWDC上苹果首次曝光AI版Siri
    2024年WWDC上,苹果首次曝光AI版Siri,口号是”AI for the rest of us”。两年过去了,这次得动真格了。

    AI助手竞赛,苹果已经输了

    如果把这事儿当成一场竞赛,苹果已经输得很彻底了。Gemini已经能实现叫Uber、点照烧外卖、查看你的日历并计算你该什么时候出发去机场这类功能。Gemini赢得这场竞赛,实至名归。

    但与此同时,人们对AI的不信任感正在上升,尤其是年轻人。Gemini越强大,给人的感觉就越诡异。要交付真正有用的助手,AI必须做到能预判你的需求,但”希望AI助手预判你的下一步需求”和”亲眼看到它真的这么做了”完全是两回事。

    我自愿授予了Gemini访问我的Google相册和Gmail的权限,但每次听到Gemini大声说出我儿子的名字,我还是会觉得毛骨悚然。

    苹果的新玩法:借力Gemini

    新版Siri将以某种形式基于Gemini构建。苹果无疑会为这项特权支付高昂的费用,但这种”隔了一层”的合作模式也有潜在的好处。

    你知道哪家公司没有和大型不受欢迎的数据中心项目绑定吗?是苹果。谷歌为了在全国各地的社区大规模开工建设数据中心,并没有赢得多少好感。苹果就算付费给谷歌,也不用背负这个负面名声,哪怕它付给谷歌的钱大概率会被投入到庞大的数据中心建设中。

    还有Copilot相关的争议:也就是”到处都是AI按钮”的问题。Siri尝试总结消息的功能既好笑又烦人,但至少Siri不会钻进你每一份工作文档里,非要帮你做总结。

    隐私牌,苹果的老本事

    可以预料,苹果会在WWDC上大谈隐私。私有云计算(Private Cloud Compute)会被再次搬出来,据说这项技术可以让你的数据就像从未离开过你的设备一样安全。新版Siri可能还会提供自动删除聊天记录的选项,而不是默认保留所有数据。

    承诺更私密、更安全的AI体验,可能会吸引那些不愿意向谷歌交出更多个人信息的人。但对于那些已经受够了软件里到处都是AI的人来说,这并没有什么帮助。


    苹果完全可以把AI进展缓慢包装成更负责任的做法。把之前的延迟说成是”花时间把事情做对”,并不是个坏策略。但虚假启动的阶段已经结束了。这次Siri必须要真的兑现承诺;这种第二次机会不会一直有,错过了就不会再来。

  • Gemini CLI:105k Stars!Google官方终端AI Agent,让命令行拥有Gemini的超能力

    Gemini CLI Screenshot

    项目简介

    Gemini CLI 是 Google 官方开源的终端 AI Agent 工具,将 Gemini 的强大能力直接集成到你的命令行终端中。它是目前从提示词到模型调用最直接的路径,为开发者提供了轻量级的 Gemini 访问入口。

    ⭐ GitHub Stars: 105k+
    🔗 项目地址: github.com/google-gemini/gemini-cli
    📄 开源协议: Apache 2.0
    🌐 官方网站: geminicli.com

    安装要求和过程

    环境要求

    • Node.js >= 18 (推荐 20+)
    • npmHomebrew (macOS)
    • Google 账号 (免费使用 Gemini API)

    快速安装步骤

    方式一:npx 即时运行(推荐试用)

    npx @google/gemini-cli

    方式二:npm 全局安装

    npm install -g @google/gemini-cli
    gemini --version

    方式三:Homebrew 安装(macOS/Linux)

    brew install gemini-cli
    gemini

    首次启动认证:

    # 启动后会自动打开浏览器进行 Google 账号 OAuth 认证
    gemini

    核心功能

    功能 说明
    🧠 代码理解与生成 支持查询、编辑大型代码库;可基于 PDF、图片、草图等多模态内容生成新应用;支持自然语言调试问题、排查故障
    🤖 自动化与集成 支持自动化操作任务,比如查询拉取请求、处理复杂变基;可通过 MCP 服务器扩展能力,包括对接 Imagen、Veo、Lyria 等媒体生成工具
    🔍 高级能力 内置 Google Search 搜索能力,支持实时信息检索;支持对话检查点,可保存、恢复复杂会话;支持自定义上下文文件 GEMINI.md
    🚀 免费额度友好 个人 Google 账号即可享受免费 tier,支持 60 次请求/分钟、1000 次请求/天
    🔧 内置工具丰富 自带 Google Search 搜索、文件操作、Shell 命令执行、网页抓取等能力;支持 MCP(模型上下文协议),可自定义集成第三方能力

    典型使用场景

    场景一:快速启动新项目

    进入项目目录启动 gemini 后,直接用自然语言描述需求即可生成对应代码:

    # 启动 Gemini CLI
    cd my-new-project
    gemini
    
    # 在交互界面中输入:
    > Write me a Discord bot that answers questions using a FAQ.md file I will provide

    场景二:分析现有代码变更

    克隆代码库后启动 gemini,可以快速获取代码变更总结:

    # 克隆代码库
    git clone https://github.com/some/repo.git
    cd repo
    gemini
    
    # 在交互界面中输入:
    > Give me a summary of all of the changes that went in yesterday

    场景三:非交互式脚本自动化

    使用 -p 参数可以在脚本中调用 Gemini CLI,实现工作流自动化:

    # 获取简单文本响应
    gemini -p "Explain the architecture of this codebase"
    
    # 获取结构化 JSON 输出
    gemini -p "Explain the architecture of this codebase" --output-format json
    
    # 实时流式输出
    gemini -p "Run tests and deploy" --output-format stream-json

    推荐理由

    作为一款终端原生的 AI Agent 工具,Gemini CLI 给我留下了深刻印象:

    • 官方背书,值得信赖:Google 官方开源项目,持续维护,质量有保障
    • 免费额度慷慨:个人开发者使用免费 Google 账号即可享受 60 次/分钟、1000 次/天的 API 调用额度,足够个人使用和小型项目开发
    • 100 万 token 上下文窗口:支持 Gemini 2.5 Pro/Flash 等顶级模型,能够理解超大型代码库,一次性分析整个项目
    • 终端原生体验:专为习惯命令行的开发者打造,操作流畅,无需离开终端即可完成代码理解、生成、调试全流程
    • MCP 扩展性强:支持模型上下文协议(MCP),可以对接 Imagen、Veo、Lyria 等媒体生成工具,未来潜力巨大

    如果你是一名开发者,正在寻找一款轻量级、功能强大、免费额度慷慨的终端 AI 助手,Gemini CLI 绝对值得一试!

    下载地址

  • WWDC 2026前瞻:Siri要变独立App了,苹果押注AI重构全系统

    苹果刚刚正式宣布,2026年全球开发者大会(WWDC 2026)定在6月9日凌晨1点开幕。和往年不一样,这次苹果在发布会前就主动预告会带来”AI新进展”——外界普遍认为,这会是苹果近年来战略意义最重的一次开发者大会。

    Apple WWDC 2026前瞻
    苹果WWDC 2026将于6月9日开幕,Siri将迎来15年来最大变革

    Siri变独立App,这是15年来头一回

    最值得关注的变化是:Siri要被彻底重建,而且会以独立App的形式重新出现在iOS 27里。这是自2010年苹果收购Siri、把它塞进系统底层以来,时隔15年第一次恢复独立App形态。

    苹果这个举动背后的信号很直接:过去那套语音助手的逻辑已经走不通了。新版的Siri交互界面全部重做,采用类似iMessage的对话列表设计,支持多轮连续对话,历史记录可以搜索和回溯。用户还能通过全局手势从屏幕顶部中央下滑一键唤起——灵动岛在唤醒时会展开,配上发光光标效果,存在感比现在强得多。

    据彭博社马克·古尔曼等多方信源披露,新版Siri支持跨应用深度联动,可通过App Intents框架读取邮件、日历和屏幕内容并执行操作,算是真正意义上实现了多任务自动化。

    苹果找谷歌当”外援”

    在底层模型的选择上,苹果做了一件挺有意思的事:跟谷歌达成深度合作,引入Gemini大模型为新版Siri提供核心能力支撑。据悉苹果每年为此向谷歌支付约10亿美元。

    但苹果还是守住了隐私边界:用户数据在苹果自有的私有云服务器上运行,谷歌无权将对话内容用于模型训练,而且聊天记录支持用户自主设置保留30天、一年或者永久。

    不过苹果自己似乎对这套新版Siri的成熟度也没那么有信心。iOS 27测试版里,新版Siri已经被标注了”测试版”字样,系统里还内置了退出测试体验的开关——这意味着即便今年秋季正式发布,这个”测试版”标识很可能还会保留一段时间。

    AI功能全面铺开,但大多是”跟跑”

    除了Siri本身,iOS 27在AI能力上还有几项值得说的更新。写作辅助方面,苹果计划推出一套对标Grammarly的AI语法检查工具,以半透明菜单的形式从屏幕底部滑出,并排展示原文和AI修改建议,用户可以逐条采纳或者一键全部批准。

    快捷指令也迎来了自然语言化升级——以前用户得手动拼装自动化流程,现在只要在文本框里用自然语言描述需求,系统就能自动生成并安装对应的快捷指令。门槛低了很多。

    更有意思的是,iOS 27将引入名为”Extensions”的第三方AI模型接入系统,允许用户安装Claude、Gemini等主流AI应用作为扩展,并在搜索栏里自由切换不同的AI引擎。这意味着ChatGPT从苹果的”特权合作伙伴”变成了众多选项之一——苹果的AI平台化战略,这次算是正式浮出水面了。


    折叠屏iPhone也在路上

    今年9月,苹果预计将发布第一代折叠屏iPhone。这是苹果十几年来最大的产品形态革新,对系统软件和AI能力的适配提出了全新要求:多任务调度、大屏界面优化、AI交互入口的重新设计,都需要硬件、软件和AI能力三方协同。

    从这个角度看,iOS 27这次AI重构做得好不好,会直接决定折叠屏iPhone的产品说服力。目前约80%到85%的在用iPhone不具备运行新一代Apple Intelligence功能所需的硬件条件,涉及设备规模达11亿到13亿台——这批用户构成了苹果潜在的换机蓄水池,一旦新版Siri的体验足够扎实,AI能力从”可选项”变成”强依赖”,这轮换机潮的规模会相当可观。

  • 我把谷歌的Gemini Spark塞进日常生活一周,有些话想说

    谷歌在今年的I/O大会上发布了Gemini Spark——一个跑在云端虚拟机上的7×24小时AI智能体。CEO皮查伊当时开了个玩笑:”你可以合上笔记本电脑了。”这话明显是在暗戳戳地怼OpenClaw那种需要保持设备唤醒才能工作的方案。

    听起来很美好。但真正用了一圈之后,我发现Spark的定位其实挺尴尬的——它既不是给发烧友用的极客工具,也没有真正想清楚普通用户到底需要它干什么。

    它能做什么?实际测了四个场景

    我拿到了提前体验资格,给Spark安排了四个不同类型的任务,想看看这个”永远在线”的AI助手到底能帮上什么忙。

    Gemini Spark概念图
    Gemini Spark作为谷歌I/O 2026重点发布的AI智能体功能,定位”永远在线”(图源:Bloomberg / Getty Images)

    场景一:比价购物。我让Spark帮我在本地药店找优惠,哪些产品有折扣、哪些可以叠加优惠券。这块它做得不错——准确找到了参与促销的商品,还提醒我可以组合线上促销码。唯一翻车的是它推荐了一个已经失效的促销码,看来实时数据验证还是AI的弱项。

    场景二:一日游打包清单。让Spark查目的地天气、读取活动性质,然后给我出一份携带建议清单,还要导入Google Keep。结果你猜怎么着?Spark根本不支持Google Keep。作为谷歌自家的产品,这个遗漏实在说不过去。最后它给我塞了一份Google Docs文档,然后说”你可以去看那个文档当做清单”——行吧。

    Spark给我出的打包建议其实挺到位的:草坪椅、水、防晒霜、墨镜、太阳落山后穿的薄外套、可重复使用的购物袋,还提醒了我活动不允许带狗。问题不出在AI的理解能力,出在它和谷歌自家生态的打通程度上。

    场景三:本地周末活动推荐。我住的小城市不算热闹,但要靠自己翻遍所有本地简报、Facebook群组、线上报纸来找周末去处,实在太花时间了。Spark这次表现不错——它设置了一个网页搜索,结合我的Gmail里订阅的本地简报,整理出了一份近期活动清单。我甚至发现了有个年度”海狸女王”选美大赛在为湿地保护筹款——这种冷门活动我平时根本不可能主动搜到。

    场景四:价格监控。让Spark帮我盯着一款贵妇眼霜的降价情况,到了目标价就提醒我。这块Spark理解了意图,但把监控频率设成了”每两周检查一次”——如果你等的是一个转瞬即逝的闪购促销,两周一次的频率基本等于没监控。


    最大的问题:它为什么是个”独立品牌”?

    这是我用了之后最想吐槽的一点。Spark本质上就是Gemini的一个运行模式,但它被谷歌做成了一个有独立名字、独立切换开关的”产品”。用户要在Gemini的界面里手动切换”切换到Spark”——我作为一个正常人,为什么要思考”我这个需求是普通对话还是后台任务”?我只想输入请求然后完事。

    更要命的是,iPhone用户目前没法通过硬件按键或者手势直接唤起Spark。你得先打开Gemini App,再从里面手动切换模式。隔壁苹果的Siri shortcuts都能做到按一下侧键就触发自定义流程了,谷歌这个体验说实话有点掉队。

    Gemini Spark界面截图
    Gemini Spark的操作界面,用户需要手动切换模式(图源:TechCrunch screenshot)

    值不值得用?

    如果你已经是Google生态的深度用户(Gmail、Google日历、Google Docs全套在用),Spark确实能帮你省一些平时要手动整理的时间。但如果你期待它是一个能替你完成”跨应用复杂操作”的真·智能体,目前还差得远。

    谷歌说Spark未来会通过MCP协议接入更多第三方服务,到时候也许真的能做到”帮我在Resy上订餐厅”或者”监控机票价格自动下单”。但在那之前,Spark更像是一个”能记住你偏好的后台Gmail摘要生成器”——有用,但还没到非用不可的程度。

    • ✅ 优势:与Google生产力套件集成较深,云端常驻不依赖本地设备
    • ✅ 优势:摘要类任务表现稳定,节省日常信息整理时间
    • ❌ 劣势:缺少Google Keep集成,笔记场景体验割裂
    • ❌ 劣势:独立品牌增加认知负担,用户不清楚何时该用Spark
    • ⚠️ 待观察:MCP扩展落地后能力边界才能真正确定