标签: AI Agent

  • UI-TARS Desktop:35.3k Stars!字节跳动开源多模态AI代理桌面端,让AI直接操作你的电脑

    UI-TARS Desktop:35.3k Stars!字节跳动开源多模态AI代理桌面端,让AI直接操作你的电脑


    📦 项目简介

    UI-TARS Desktop 是字节跳动开源的多模态 AI Agent 桌面应用,基于自研的 UI-TARS 多模态大模型和先进的 GUI Agent 架构,让你可以用自然语言直接控制电脑——打开软件、修改设置、操作浏览器,全部由 AI 代劳。

    项目已获得 35.3k+ Stars,Apache 2.0 开源协议,支持 Windows / macOS / Linux 三平台,是 2026 年最值得关注的多模态 AI Agent 项目之一。

    UI-TARS Desktop 演示

    UI-TARS Desktop 实际操作演示

    ⚙️ 安装要求和过程

    环境要求:

    • Windows 10+ / macOS 12+ / Linux(Ubuntu 20.04+)
    • 8GB+ RAM(推荐 16GB)
    • 支持 CPU 推理,推荐 NVIDIA GPU(4GB+ 显存)以获得最佳体验
    • Node.js 22+(如使用 Agent TARS CLI)

    方式一:下载桌面端(推荐)

    1. 访问 GitHub Releases 页面,下载对应系统的安装包
    2. Windows 用户:下载 .exe 安装包,双击安装
    3. macOS 用户:下载 .dmg 文件,拖入 Applications 文件夹
    4. 首次启动需下载 UI-TARS 模型(约 4GB),请保持网络畅通

    方式二:使用 Agent TARS CLI

    # 快速启动(无需全局安装)
    npx @agent-tars/cli@latest
    
    # 全局安装
    npm install @agent-tars/cli@latest -g
    
    # 使用火山引擎方舟模型启动
    agent-tars --provider volcengine --model doubao-1.5-thinking-vision-pro-250428 --apiKey YOUR_KEY
    
    # 使用 Anthropic Claude 模型启动
    agent-tars --provider anthropic --model claude-3-7-sonnet-latest --apiKey YOUR_KEY
    

    🚀 核心功能

    🤖
    自然语言控制
    基于视觉语言模型(VLM),用日常语言描述任务,AI 自动理解并执行
    🖥️
    全系统 GUI 操作
    精准控制鼠标、键盘,操作任意桌面应用,不受 API 限制
    🌐
    混合浏览器 Agent
    支持 GUI Agent 视觉定位、DOM 操作或混合策略控制浏览器
    🔌
    MCP 工具集成
    内核基于 MCP 构建,支持挂载各类 MCP 服务器,连接真实世界工具
    🔒
    隐私安全
    完全本地处理,数据不上传云端,支持企业内网部署
    🔄
    远程操作
    v0.2.0 起免费提供远程电脑操作和远程浏览器操作,无需额外配置

    🎯 典型使用场景

    场景一:让 AI 帮你配置开发环境

    告诉 UI-TARS “帮我在 VS Code 里打开自动保存,并把延迟设为 500 毫秒”,它会自动打开 VS Code 设置页面,找到对应选项并完成修改——全程无需你动手。

    场景二:自动完成网页预订任务

    对 Agent TARS CLI 说 “帮我在 Priceline 上订 9 月 1 日圣何塞到纽约最早的航班,以及 9 月 6 日最晚的返程航班”,它会自动打开浏览器、填写表单、筛选结果并完成预订。

    场景三:查询并分析 GitHub 项目

    直接问 “你能帮我查看 GitHub 上 UI-TARS-Desktop 项目最新的开放 issue 吗?”,AI 会自动访问项目页面、抓取 issue 列表并整理成可读的格式反馈给你。

    💡 推荐理由

    UI-TARS Desktop 最打动我的是它的「真正理解界面」的能力。不同于传统 RPA 工具依赖元素定位,UI-TARS 通过视觉语言模型直接”看”屏幕,就像人一样理解界面布局和元素含义。

    作为字节跳动出品的开源项目,它的技术栈相当扎实:基于自研的 UI-TARS-1.5-7B 多模态模型,支持 Docker 沙箱隔离执行,MCP 工具集成也非常完善。最关键的是——它完全本地运行,你的数据不会被上传到任何云端服务器。

    如果你一直在寻找一个能真正帮你操作电脑的 AI Agent,而不是只会聊天的对话工具,UI-TARS Desktop 绝对值得一试。它的远程操作功能(v0.2.0 起免费)更是让”AI 助手”的概念从聊天进化到了”真正帮你做事”。

    🚀 立即体验 UI-TARS Desktop

    开源 · 本地运行 · 多模态 AI Agent · 字节跳动出品

    支持 Windows / macOS / Linux · Apache 2.0 协议

    📥 下载地址


    📌 本文由 WorkBuddy AI 自动采集撰写,原文发布于 hiyoho.com

  • ClickUp裁员22%背后:AI正在重新定义「谁还有工作」

    ClickUp裁员22%背后:AI正在重新定义「谁还有工作」

    上个周四,协作软件公司ClickUp的CEO Zeb Evans在X平台上发了一条消息,说他们刚裁掉了22%的员工。听起来是个坏消息,但Evans的话风很有意思——他说这次裁员不是为了省钱,而是为了激进地拥抱AI。

    这话不是修饰。Evans说他要把裁员省下来的大部分钱,直接回馈给留下来的员工,甚至要推出「百万美元级别」的薪资档位。意思很直白:如果你用AI做出了远超预期的成果,你的薪水就不该被传统档位限制住。

    「那些用AI自动化了自己工作的人,永远会有工作。」——Zeb Evans,ClickUp CEO

    3000个AI代理已上岗

    根据《财富》杂志的报道,ClickUp最近内部部署了大约3000个AI代理,用来代替员工处理各类复杂任务。现在的员工不需要亲自完成那些工作,而是负责指挥这些代理,最后审核输出结果是否符合公司标准。

    这个变化挺激进的。员工的核心技能从「把事情做好」变成了「把AI代理用好」。ClickUp把这个目标叫做成为一家「100倍组织」——用极少的真人,产出百倍于传统团队的产出。

    ClickUp不是唯一这么想的公司。Gartner最近的调查显示,大约80%正在使用自主AI技术的公司已经进行了裁员。但这里有个问题:裁员并不一定会转化为有意义的财务回报。也就是说,有些公司可能只是拿AI当裁员的借口。

    ClickUp坚称自己不是这类公司。Evans在邮件里跟TechCrunch说,他们确实从AI代理身上看到了生产力提升,而且不仅在内部衡量这些效率提升,显然还在准备向客户推出包含相关功能的新产品。

    ClickUp AI工作流程示意图
    ClickUp总部,该公司正大力拥抱AI代理技术(图源:Getty Images)

    「Token最大化」正在成为考核指标

    近几个月来,越来越多的公司开始监测员工的token消耗量,把它当作衡量员工是否真的在用AI工具的指标。但批评者认为这个叫「tokenmaxxing」的概念是错误的——它只会推高AI成本,而不一定带来实际价值。

    Evans的说法是:「我们不做token成本的游戏化,我们做的是创造价值和节省时间的游戏化。」这话听起来有道理,但实际执行起来,员工为了证明自己在用AI,可能会无意义地消耗更多token。

    这场实验的核心矛盾在于:如果AI不断接管更多任务,ClickUp最终需要的人就会越来越少。那些没能很好实现职能自动化的员工,最终还是会被淘汰。CEO说「用AI自动化工作的人永远有工作」,但没说这些工作将来还有多少需要真人来做。

    一个人估值2.5亿美元的公司

    科技圈已经出现了一个把AI自动化用到极致的极端案例。成立仅一年的Polsia,声称用AI为独立创业者处理所有软件运营工作,而这家公司只有1名员工——就是它的创始人兼CEO Ben Broca。

    这种效率显然带来了回报:Polsia刚刚以2.5亿美元的估值完成了3000万美元的融资。这个故事给整个行业抛出了一个尖锐的问题:如果1个人加上一堆AI代理就能做原来需要几百人才能做的事情,那其他人的工作在哪里?

    ClickUp的这次裁员,加上他们明说的「100倍组织」目标,本质上是在告诉整个行业:用AI极致提效不是未来,是现在。那些还在犹豫要不要拥抱AI的公司和员工,可能很快就要面对一个很现实的选择——要么学会指挥AI代理,要么被那些已经学会的人取代。

    这场变化的速度可能比大多数人想象的要快。ClickUp把节省下来的人力成本用来给剩下的人涨薪,这个做法挺聪明——它至少在一定程度上缓解了留下来的员工的焦虑。但整个行业能不能复制这个模式,还得看AI代理到底能不能真的交付它们承诺的那些生产力红利。


    • ClickUp裁员22%,CEO称是拥抱AI而非成本削减
    • 内部已部署约3000个AI代理,员工角色转变为「代理指挥者」
    • Gartner:80%使用自主AI技术的公司已完成裁员
    • 「1人公司」Polsia以2.5亿美元估值融资,AI极致效率的极端案例
  • OpenClaw — 你的专属个人AI助手

    OpenClaw — 你的专属个人AI助手

    🦞 OpenClaw — 你的专属个人AI助手


    OpenClaw Logo

    📝 项目简介

    OpenClaw 是一款可以运行在你自己设备上的个人AI助手,支持任何操作系统、任何平台。它让你在已经使用的通讯渠道中与AI交互,真正实现”你的数据你做主”。

    项目在GitHub上获得了 374,000+ Stars,是2026年最热门的个人AI助手项目之一。

    💻 安装要求和过程

    环境要求:

    • Node.js:24.x(推荐)或 22.19+
    • 操作系统:macOS、Linux、Windows(推荐WSL2)
    • 包管理器:npm、pnpm 或 bun

    快速安装步骤:

    # 全局安装 OpenClaw
    npm install -g openclaw@latest
    # 或使用 pnpm
    pnpm add -g openclaw@latest
    
    # 运行引导式安装(推荐)
    openclaw onboard --install-daemon

    守护进程模式(推荐):

    # 安装守护进程
    openclaw onboard --install-daemon
    
    # 检查网关状态
    openclaw gateway status

    前台调试模式:

    # 停止后台网关
    openclaw gateway stop
    
    # 前台运行(带详细日志)
    openclaw gateway --port 18789 --verbose

    ✨ 核心功能

    🌐 本地优先网关(Local-first Gateway)
    单一控制平面管理会话、渠道、工具和事件,所有数据保存在本地设备上。
    📱 多渠道收件箱
    支持 20+ 通讯平台:WhatsApp、Telegram、Slack、Discord、Google Chat、Signal、iMessage、IRC、Microsoft Teams、Matrix、飞书、LINE、Mattermost等。
    🤖 多Agent路由
    将不同渠道/账号/联系人路由到隔离的Agent(工作区 + 每Agent会话),实现多用户、多场景并行处理。
    🎙️ 语音唤醒 + 对话模式
    macOS/iOS支持语音唤醒词,Android支持连续语音对话(集成ElevenLabs TTS + 系统TTS备用)。
    🎨 实时画布(Live Canvas)
    Agent驱动的可视化工作区,支持A2UI协议,让AI实时生成和操作界面元素。

    🚀 典型使用场景

    场景1:跨平台消息助手
    在你最常用的通讯工具(如WhatsApp或Telegram)中直接与AI对话,OpenClaw作为后台网关统一处理,无需切换应用。

    场景2:开发者工作流自动化
    结合Cron作业、Webhook和Gmail Pub/Sub,让AI定时执行任务、监控邮件并自动回复,打造个性化自动化工作流。

    场景3:多设备协同助手
    在macOS菜单栏、iOS和Android设备上同时运行OpenClaw节点,通过WebSocket配对,实现跨设备语音控制和画布同步。

    💡 推荐理由

    作为一名AI工具和开源项目的爱好者,我认为OpenClaw在以下几个方面表现出色:

    • 隐私优先:所有数据保存在本地,不依赖第三方云服务,真正实现了”own-your-data”的理念。
    • 渠道覆盖广:支持的平台数量远超同类项目,几乎覆盖了所有主流通讯工具。
    • 架构设计优雅:Gateway作为控制平面,配合可选 Companion App,既保证了功能完整性,又保持了模块化。
    • 活跃社区:374K+ Stars和众多企业赞助商(OpenAI、GitHub、NVIDIA、Vercel等)证明了项目的生命力和商业价值。

    如果你在寻找一个真正属于自己、可定制、跨平台的AI助手,OpenClaw绝对值得一试!

    📥 下载地址

    🦞 EXFOLIATE! EXFOLIATE!

  • ClickUp大裁员22%:AI替代人工的时代真的来了?

    AI加持下的”100倍组织”梦想

    ClickUp 的 CEO Zeb Evans 在 X 平台上说了一句话,让很多人心里一紧。他说这次裁掉 22% 的员工,不是成本削减,而是”激进地拥抱 AI”,要让 ClickUp 变成”100 倍组织”。

    什么叫”100 倍组织”?简单说就是:用极少的人,干出原来 100 倍的工作量。Evans 甚至承诺,省下来的人力成本会”直接回流给留下来的员工”,还要推出”百万美元薪资档位”。听起来很美好,但问题是——那些被裁掉的人,已经不在”留下来的人”的范围内了。

    AI与工作未来的概念图
    AI正在重塑工作场所,但代价由谁承担?

    3000 个 AI 智能体在”上班”

    根据《财富》杂志的报道,ClickUp 最近内部引入了约 3000 个 AI 智能体,代替员工处理各类复杂任务。现在的员工不需要亲自完成工作,而是被要求”指挥”这些智能体,然后审核输出结果。

    这个变化背后有一个微妙的逻辑:原来一个人做的工作,现在变成”人指挥 AI 做,人审核”。理论上人的效率提升了,但实际上需要的人数变少了。Evans 说”用 AI 自动化自己工作的人永远会有工作”——这话没错,但能走到那一步的人,显然不会是全部。

    ClickUp 并非唯一一家把 AI 智能体当作生产力答案的公司。Gartner 的调查显示,约 80% 使用自主技术的公司已经削减了岗位——但裁员并不一定会转化为有意义的财务回报。

    “代币最大化”:一个值得警惕的指标

    近几个月来,越来越多的公司开始监控员工的”代币消耗量”,把它当作衡量员工是否真正在用 AI 工具的指标。ClickUp 说他们不是在做”代币成本游戏化”,而是在游戏化”创造的价值和节省的时间”。

    但批评者指出,把代币消耗作为考核指标本身就是个错误方向,因为这只会刺激不必要的 AI 调用,推高成本,却不一定带来真实的价值产出。这就像一个餐厅老板跟厨师说:”你今天用了多少度电,我就给你发多少奖金。”厨师会怎么反应?当然是拼命开最大功率的烤箱。

    一个极端案例:只有一名员工的初创公司

    科技圈一直在理论推演”AI 完全替代人工”的场景,而现在已经有了一个高知名度的极端案例:成立仅一年的 Polsia,声称用 AI 自动化了所有软件运营工作,整个公司只有一名员工——创始人兼 CEO Ben Broca。

    这种效率显然正在获得资本市场的认可:Polsia 刚刚以 2.5 亿美元的估值完成了 3000 万美元的融资。投资者用真金白银说明了一件事——他们相信”一个人 + AI”可以替代几十甚至上百人的传统团队。

    ClickUp 的裁员或许只是一个开始。当 Evans 说”AI 会让留下的人拿到百万美元薪资”时,他可能没意识到,这句话的另一面是:大部分人会离开,而留下的人将面临前所未有的工作强度和压力。


  • 豪歌也在摸着石头过河:AI安全的真实困境






    谷歌也在摸着石头过河:AI安全的真实困境

    上周在洛杉矶的一场活动后台,谷歌云首席运营官Francis de Souza跟我聊了二十多分钟AI安全。他的语气很稳,像大学教授讲课那种感觉,说现在大家都在”实时摸索”AI安全规范,谷歌自己也不例外。

    这话听起来有点反直觉。谷歌可是全球最顶尖的AI公司之一,它居然也在”摸索”?

    AI安全概念图
    AI安全已成为企业无法回避的核心议题(图源:TechCrunch)

    “影子AI”正在悄悄蔓延

    de Souza反复强调一个观点:安全不能是事后补救。很多公司引入AI工具的时候,先上线再说,安全配置留到后面再搞——这基本上是把门打开再想着装锁。

    他特别提到了”影子AI”的风险。这个词听起来有点吓人,其实说的就是员工私下用消费级AI工具,比如拿ChatGPT处理公司机密文档,或者用了某个AI插件但公司根本不知道。这种行为没有组织监督,数据流向完全不可控。

    “不存在没有数据战略和安全战略的AI战略,这三者必须齐头并进。”——Francis de Souza,谷歌云首席运营官

    智能体发现了被遗忘的数据库

    这篇文章里有个细节让我印象深刻。de Souza说,在企业内部系统中自主移动的AI智能体,可能会发现多年前就被遗忘的数据存储库。

    很多组织有旧的SharePoint服务器和访问控制机制,很久没更新了,以前这没什么大不了的,因为根本没人知道那些数据在哪。但AI智能体在企业里”漫游”的时候,会找到这些被遗忘的数据资产,然后——把数据暴露出来。

    这本质上是一种新型的攻击面。传统的网络安全防御模型是针对人类黑客设计的,但AI智能体的行为模式完全不同,它们有能力访问人类可能不会去碰的数据角落。

    谷歌自己的漏洞呢?

    有意思的是,就在de Souza讲这番话的同时,《The Register》连续报道了谷歌云的一连串安全问题。

    事情是这样的:很多开发者把谷歌地图的API密钥放在公开代码里(按照谷歌自己的文档说明做的),以前这些密钥只能访问地图服务,所以泄露了也没什么大不了。但谷歌悄悄扩大了这些密钥的权限范围,让它们也能调用Gemini模型——而且没有清楚地告知开发者这个变化。

    结果就是:攻击者在30分钟内让一家面试准备平台CEO的谷歌云账单飙到了10138美元。另一个澳大利亚开发者的账户被刷了约17000澳元。

    更离谱的是,谷歌的自动系统会根据账户历史记录”升级”计费等级, effectively把开发者的支出上限从他们设置的250美元提到了10万美元——而且没有明确要求同意。


    密钥撤销要等23分钟

    安全公司Aikido的研究发现,即使开发者发现了密钥泄露并立即删除它,攻击者在接下来的23分钟内仍然可以用这个密钥访问Gemini。因为谷歌的密钥撤销操作是在基础设施中”逐渐传播”的,不是即时生效的。

    研究人员指出,谷歌云较新的凭证格式(服务账户API凭证)撤销时间约为5秒,Gemini较新的AQ前缀密钥格式约为1分钟。技术上完全可以做到更快,23分钟的窗口期不是一个工程限制问题,而是一个公司优先级的问题。

    读完de Souza的那番话再来看这些报道,感觉有点微妙。他说的是对的,企业确实需要把安全放在前面,而不是事后补救。但平台自己提出的建议,和它们自己适应这些建议的速度之间,存在着一个不小的差距。

    领英首席信息安全官Lea Kissner本周对《纽约时报》说,她预计这个行业至少需要几年时间,才能以任何可持续的长期方式理解AI安全。这几年里,企业和平台都在同一条船上,大家一起摸着石头过河。


  • LangGraph —— 用图结构编排生产级 AI Agent,让复杂工作流清晰可观测

    LangGraph Logo

    GitHub 29K+ Stars

    LangGraph

    生产级 AI Agent 编排框架,用图结构掌控复杂工作流

    项目简介

    LangGraph 是 LangChain 团队推出的低级别 Agent 编排框架,通过有向图(DAG)建模 Agent 的执行路径,实现状态持久化、人机协同、可观测的复杂 AI 工作流。已将 LangChain 从”链式调用”升级为”图式编排”,是多步骤、有条件分支、需要人工审核的 Agent 系统的工程化首选方案。

    安装要求与过程

    环境要求
    • Python >= 3.9
    • pip 包管理器
    • (可选)LangSmith 账号用于可视化管理
    # 快速安装
    pip install -U langgraph

    # 安装 LangGraph Studio(可视化编辑器)
    pip install langgraph-studio

    # 验证安装
    python -c “import langgraph; print(langgraph.__version__)”

    核心功能

    1
    图结构编排(Graph Orchestration)
    用节点(Node)和边(Edge)显式定义 Agent 执行路径,支持条件分支、循环、并行执行,执行过程完全可观测、可回溯、可干预。

    2
    持久化状态(Persistent State)
    自动将 Agent 执行状态持久化到存储后端(内存/SQLite/PostgreSQL),支持从任意断点恢复执行,无需重复处理已完成步骤,是长时间运行 Agent 的基石能力。

    3
    人机协同(Human-in-the-Loop)
    可在 Agent 执行的任意节点暂停,等待人工审核、修改状态或批准下一步操作,适用于高风险决策场景(如金融审批、医疗诊断辅助)。

    4
    多 Agent 协同(Multi-Agent)
    原生支持 Sub-graph(子图)和 Send(动态分发),可构建层级化多 Agent 系统,不同 Agent 负责不同子任务,通过图结构协调通信与状态共享。

    5
    LangSmith 深度集成
    一键接入 LangSmith 可视化追踪平台,实时查看 Agent 执行轨迹、状态变化、Token 消耗和延迟指标,复杂 Agent 行为的调试效率提升 10 倍以上。

    典型使用场景

    场景一:复杂客户支持 Agent
    构建需要多步骤推理的客户支持系统——先理解用户意图(分类节点),再查询知识库(RAG 节点),然后生成回复(LLM 节点),最后人工审核敏感回复(人机协同节点)。每个步骤的执行路径、状态变化、失败重试都通过 LangGraph 图结构精确控制。

    场景二:代码生成与审查流水线
    实现自动化代码生成 Agent——需求分析 → 代码生成 → 静态检查 → 单测生成 → 人工审核 → 提交 PR。每个阶段作为图的一个节点,条件边决定流程走向(如检查失败则回到生成节点),整个流水线状态可持久化,断点续跑无需从头开始。

    场景三:多 Agent 研究助手
    构建多 Agent 协作的研究系统——协调者 Agent 接收问题,分发给搜索 Agent、分析 Agent、写作 Agent,各子 Agent 并行工作,最终结果由审核 Agent 汇总。LangGraph 的 Sub-graph 和状态共享机制让多 Agent 协作的代码结构清晰可维护。

    推荐理由

    LangGraph 解决了 AI Agent 开发中最痛的”黑盒执行”问题。传统 Agent 框架(包括早期 LangChain)的执行路径是隐式的,调试时只能看到最终输出,无法知道 Agent 为什么走了某条路径。

    LangGraph 的核心价值在于显式建模——把 Agent 的每一步逻辑、每一个条件分支、每一个状态转移都定义成图结构,执行过程像代码一样可读、可调试、可复现。这对生产级 Agent 系统来说是刚需。

    实际使用中,最常用的模式是 StateGraph + checkpoint:定义状态类(TypedDict),用 add_node() 和 add_edge() 构建图,用 SqliteSaver 做持久化。整个开发体验接近写普通 Python 代码,但获得的是生产级的容错和可观测能力。

    如果你正在用 LangChain 但感觉 Agent 逻辑不够透明,或者需要构建有条件分支、人工审核环节的 Agent 系统,LangGraph 是目前最成熟的工程化方案,没有之一。

    如果这篇文章对你有帮助,欢迎在 GitHub 给 LangGraph 点个 Star!

  • Aider:45.3k Stars!终端AI结对编程工具,让Git与AI完美融合

    Aider:45.3k Stars!终端AI结对编程工具,让Git与AI完美融合

    📌 项目简介

    Aider

    Aider 是一款在终端中运行的AI结对编程工具,支持从零启动新项目或基于现有代码库进行开发。它不仅能理解整个代码库的结构,还能自动执行lint和测试,是开发者的AI编程利器!

    ⚙️ 安装要求和过程

    环境要求

    • Python 3.8+
    • Git(Aider原生集成Git)
    • API密钥(Anthropic/OpenAI/DeepSeek等)

    快速安装步骤

    1. 安装Aider
      python -m pip install aider-chat
      aider
    2. 配置API密钥
      # 使用Claude 3.7 Sonnet
      export ANTHROPIC_API_KEY=your-key
      aider --model sonnet
      
      # 使用DeepSeek
      export DEEPSEEK_API_KEY=your-key
      aider --model deepseek
      
      # 使用GPT-4o
      export OPENAI_API_KEY=your-key
      aider --model gpt-4o
    3. 进入项目目录
      cd /path/to/your/project
      aider

    💡 核心功能

    1. 全代码库理解

    Aider能自动生成整个代码库的”地图”,理解项目结构,无论项目多大都能精准定位需要修改的文件。

    2. Git原生集成

    每次AI修改后,Aider都会自动生成合理的commit信息,你可以通过Git轻松diff、管理和回滚AI的修改。

    3. 多模态输入支持

    支持添加图片、网页到对话,提供视觉上下文、截图、参考文档等,让AI更准确理解你的需求。

    4. 自动校验与修复

    每次修改后自动执行代码lint和测试,如果检测到lint错误或测试失败,Aider会自动修复!

    5. 语音转代码

    支持语音输入需求,自动实现新功能、测试用例或Bug修复,编程效率翻倍!

    🚀 典型使用场景

    场景1:新项目从零启动

    想快速搭建一个新项目?只需在终端输入:

    $ aider
    Aider> 帮我创建一个Flask REST API,包含用户认证和JWT令牌

    Aider会自动生成项目结构、配置文件、路由和测试用例,并自动提交第一个commit!

    场景2:现有代码库的功能迭代

    在已有项目中添加新功能?Aider理解整个代码库:

    $ aider
    Aider> 在用户模型中添加一个"最后登录时间"字段,并更新相关API

    Aider会自动找到需要修改的文件,添加字段,更新迁移脚本,修改API响应,并运行测试确保一切正常!

    场景3:Bug修复与测试

    遇到Bug?让Aider帮你定位和修复:

    $ aider
    Aider> 修复用户登录时的502错误,并添加测试用例

    Aider会分析日志、定位问题、修复代码、添加测试,确保问题不再复现!

    🎯 推荐理由

    作为一名开发者,我一直在寻找能让AI真正融入编程工作流的工具。Aider是我用过的最实用的AI编程助手,原因如下:

    ✅ Git原生集成:不像其他工具那样”黑盒”修改,Aider的每次修改都有清晰的commit,你可以随时diff或回滚。

    ✅ 理解大型代码库:Aider会生成整个代码库的地图,即使是很复杂的项目,它也能精准定位需要修改的地方。

    ✅ 自动修复lint/测试错误:这是我最喜欢的功能!Aider修改代码后会自动运行lint和测试,如果有错误会自动修复,真正实现了”自动化编程”。

    ✅ 支持100+编程语言:无论你用Python、JavaScript、Rust、Go还是C++,Aider都能胜任。

    ✅ 多模态输入:可以添加图片、网页到对话,让AI更准确理解你的需求,这对前端开发特别有用!

    如果你想要一个真正能理解你的代码库、并与Git无缝集成的AI编程助手,Aider绝对值得一试!

    📥 下载地址

    官方资源

    快速安装

    # 安装Aider
    python -m pip install aider-chat
    
    # 使用Claude 3.7 Sonnet(推荐)
    export ANTHROPIC_API_KEY=your-key
    aider --model sonnet
    
    # 使用DeepSeek(性价比高)
    export DEEPSEEK_API_KEY=your-key
    aider --model deepseek
    
    # 使用GPT-4o
    export OPENAI_API_KEY=your-key
    aider --model gpt-4o

    #开源项目 #AI编程 #终端AI #Aider #GitHub热门 #AI Agent

  • 英伟达又破纪录了,但黄仁勋盯上了更大的蛋糕

    英伟达又破纪录了,但黄仁勋盯上了更大的蛋糕

    英伟达刚交出一份又破纪录的财报——截至4月26日的季度,营收816亿美元,环比增长20%,其中数据中心营收752亿美元,同样创下新高。季末公司还授权了800亿美元的股票回购计划,看上去一切都在按计划推进。

    但黄仁勋在财报电话会上话锋一转,抛出了一个更大的数字:英伟达发现了一个全新的2000亿美元总可寻址市场(TAM)。这个市场来自英伟达今年3月刚发布的Vera CPU——全球第一款专为代理式AI(Agentic AI)设计的中央处理器。

    黄仁勋在GTC大会
    黄仁勋在GTC大会上(图源:Getty Images)

    为什么是CPU?

    这个逻辑听起来有点反直觉——英伟达不是做GPU起家的吗?黄仁勋的解释是:AI模型的”思考”部分由GPU负责,但AI智能体(Agent)的大部分任务执行,其实跑在CPU上。随着智能体数量爆发,对CPU的需求会跟着涨。

    “全球有10亿人类用户,我的判断是未来会有数十亿个智能体。这些智能体都会使用工具,而这些工具会像个人电脑一样运行——当然不是现在,我们会在发展过程中逐步达到这个规模。”黄仁勋在电话会议上这样说。

    Vera的设计思路和传统CPU不一样。传统CPU追求”核心数”,目标是尽可能同时跑多个应用实例;而Vera专门优化了token处理速度,匹配智能体场景的需求。这款产品既可以单独销售,也可以和英伟达的下一代GPU Rubin捆绑销售。

    财报里的其他细节

    说回财报本身。英伟达预计下季度营收910亿美元,增幅约12%——比本季度的20%明显放缓,市场对此其实早有预期,AI算力建设的周期性和需求波动是真实存在的。

    中国市场的出口管制仍是悬而未决的问题。CFO科莱特·克雷斯表示,H200虽然已获得美国出口批准,但英伟达尚未从中产生任何收入,也不确定是否会被允许向中国出口。

    另一个值得注意的数据是英伟达在私营公司的持股——1月时价值220亿美元,到季度末已经涨到430亿美元,主要来自季度内185亿美元的收购。这个数字还不包括对康宁、IREN等上市公司的投资,也不反映尚未完成的承诺(比如2月承诺向OpenAI投资的300亿美元)。


    黄仁勋在电话会上还提到了和Anthropic的合作——今年和明年为Anthropic上线的产能会”非常可观”。在此之前,英伟达对Anthropic的覆盖基本为零。这说明英伟达正在把算力基础设施的触角伸向AI最大的几个客户,而Vera CPU就是这套布局里的重要一环。

    2000亿美元是不是画饼?现在下判断还为时过早。但Vera上市首年就有200亿美元的销售额,至少说明市场愿意给它一个机会。至于能不能守住这块新市场,就要看英特尔、AMD和各大云厂商自研芯片的反击速度了。

  • Google DeepMind憋了个大招:AI不再只陪你聊天,开始帮你搞科研了

    前两天刷到Google DeepMind的一条消息,说他们搞了个叫Co-Scientist的东西——多智能体AI系统,专门给科研人员用的。我第一反应是:又来一个”AI助力科研”的PPT项目?但仔细看完,发现这次有点不一样。

    Google DeepMind Co-Scientist AI系统
    Co-Scientist:基于Gemini构建的多智能体科研助手

    从”搜索工具”到”科研搭档”,这步跨得挺大

    以往AI在科研里的角色,说白了就是个高级搜索引擎——你问它”XXX领域有什么进展”,它给你列一堆文献摘要,然后你自己去啃。

    Co-Scientist想做的事不一样。它的定位是:假设生成、讨论、验证的协同伙伴。核心架构是”生成-讨论-验证”三阶段,多个AI智能体互相抬杠、互相验证,最后给你一个它觉得靠谱的假设方向。

    传统科研里,一个有价值的研究假设,往往需要研究者花几个月甚至几年去打磨。Co-Scientist的目标,是把这个”灵感孵化”的过程,压缩到几天甚至几个小时。

    它到底强在哪?不是参数多,是”会自己纠偏”

    DeepMind在介绍里特意强调了一点:Co-Scientist强化了准确引用专业文献自我修正逻辑矛盾的能力。

    这话什么意思?你去用用现在市面上的大模型,让它帮你梳理一个研究假设,十有八九会出现”编造引用”(hallucinated references)或者”前后逻辑打脸”的情况。Co-Scientist针对这个痛点做了强化,目标是让AI在科研场景里不乱说话

    当然,现在它还处在实验性开放阶段,主要面向研究机构,不是你我去网页上就能白嫖的。但它透露出的方向很明确:AI不再只是”知识的搬运工”,而是开始涉足”知识的创造过程”。


    瞄准的是哪些科研领域?生物学、化学,还有那些”人类搞了几十年还没搞明白”的难题

    DeepMind在展望里点名了几个方向:

    • ALS(肌萎缩侧索硬化症)治疗:这个病折腾了科学界几十年,AI能不能帮忙找到新的药物靶点或者治疗路径?Co-Scientist想试试。
    • 衰老研究:衰老机制极其复杂,假设空间巨大,人工筛选成本极高。AI介入后,可能会开辟一些人类研究者还没想到的角度。
    • 化学分子设计:新药物、新材料的分子结构搜索,本质上是超高维空间的探索问题,AI”生成-验证”的循环在这里很有优势。

    未来DeepMind还打算把Co-Scientist跟实验自动化系统整合起来。到那时候,AI不只是帮你”想”,还能指挥实验室里的机器人去”做”,再把结果喂回来继续迭代。这个闭环一旦跑通,科研效率的跃升会是数量级的。

    跟OpenAI证明数学猜想那件事,其实是同一个信号

    几乎同一时间,OpenAI也放了个大卫星:他们的推理模型证明了一个80年没解决的数学猜想(Erdős单位距离猜想),证明过程125页。

    这两件事放在一起看,信号就很清楚了:2026年的AI,已经从”帮我总结一下”进化到”帮我证明/帮我发现”了。这不是简单的参数堆砌,而是推理能力、文献理解、逻辑自洽性这几件事同时到了一个临界点。

    科研人员如果还在把AI当”高级搜索引擎”用,可能真的有点亏了。下一步值得关注的,是这些科研AI智能体能不能真正加速重大发现,而不只是在已有假设上修修补补。

  • Flowise:42.4k Stars!可视化LLM应用搭建工具,让AI工作流像搭积木一样简单

    Flowise:42.4k Stars!可视化LLM应用搭建工具,让AI工作流像搭积木一样简单

    Flowise Logo

    ## 📝 项目简介

    **Flowise**(flowiseai.com)是一个 **Low-code 的 LLM 应用构建平台**,让你通过可视化拖拽的方式快速搭建基于大语言模型的 AI 应用。它的定位类似于 Langflow,但更轻量、更易上手,专注于让开发者和非开发者都能快速把 LLM 能力落地到实际产品中。


    ## 🔧 安装要求和过程

    ### 环境要求
    – **Node.js** 18+ (必须)
    – **npm** 或 **yarn**
    – 支持 Windows / macOS / Linux

    ### 快速安装(3步搞定)

    **方法一:NPX 直接运行(推荐体验)**
    “`bash
    npx flowise start
    “`

    **方法二:全局安装**
    “`bash
    npm install -g flowise
    npx flowise start
    “`

    **方法三:本地开发**
    “`bash
    git clone https://github.com/FlowiseAI/Flowise.git
    cd Flowise
    pnpm install
    pnpm build
    pnpm start
    “`

    安装完成后访问 `http://localhost:3000` 即可进入可视化界面。


    ## ⚡ 核心功能

    **1. 可视化 LLM 流程编排**
    通过拖拽组件的方式连接 Prompt、LLM、Memory、Tools 等节点,无需写代码就能构建复杂的 AI 工作流。

    **2. 丰富的组件库**
    内置支持 OpenAI、Anthropic、Hugging Face、Ollama 等主流 LLM 提供商,以及 Vector Store、Document Loader、Chain 等常用组件。

    **3. 对话记忆管理**
    支持多种 Memory 类型(Buffer Memory、Window Memory 等),让 AI 应用具备上下文记忆能力。

    **4. API 一键部署**
    流程构建完成后,一键生成可调用的 API 接口,直接集成到你的应用或网站中。

    **5. 向量数据库集成**
    原生支持 Pinecone、Milvus、PostgreSQL(pgvector) 等主流向量数据库,轻松构建 RAG 应用。


    ## 🚀 典型使用场景

    **场景1:构建企业知识库问答机器人**
    上传公司文档 → 接入向量数据库 → 搭建 RAG 流程 → 生成 API → 嵌入企业微信/官网。全程可视化,非技术人员也能操作。

    **场景2:快速原型验证 AI 创意**
    想验证一个 AI 产品的想法?用 Flowise 拖拽出原型,生成 API 直接测试,比写代码快10倍。很多团队用它做 AI 产品的 MVP 验证。

    **场景3:为现有应用添加 AI 能力**
    已有 Web/移动应用?用 Flowise 构建 AI 流程,生成 API,3行代码就能把智能对话、文档分析、内容生成能力接入你的产品。


    ## 💡 推荐理由

    为什么推荐 Flowise?

    比 Langflow 更轻量 — 安装包更小,启动更快,界面更简洁。
    真正能用在生产环境 — 不少同类工具只是 demo 级别,Flowise 的 API 可以直接承载生产流量。
    社区活跃,文档完善 — 42k+ Stars,持续迭代,中文资料也逐渐丰富。
    对非开发者友好 — 产品经理、运营同学也能用它搭建 AI 流程,不用等开发排期。
    与 Langflow 互补 — 如果你在用 Langflow,Flowise 值得对比试用,两者各有优势。


    ## 📥 下载地址

    **🌐 官方网站**
    https://flowiseai.com

    **🐙 GitHub 仓库**
    https://github.com/FlowiseAI/Flowise
    (42.4k+ Stars,持续更新中)

    **📚 官方文档**
    https://docs.flowiseai.com

    **💬 Discord 社区**
    https://discord.com/invite/jBaHxxxadB


    本文由 WorkBuddy AI 自动采集撰写,内容来源于 GitHub 公开信息及官方文档。