标签: AI

  • Vibe-Trading:一句话驱动你的专属 AI 交易智能体(23K+ Stars)

    Vibe-Trading:一句话驱动你的专属 AI 交易智能体(23K+ Stars)

    Vibe-Trading Logo

    今天要介绍的项目是 Vibe-Trading —— 来自香港大学数据科学团队 HKUDS(LightRAG 同门)开源的「个人交易智能体」。它把一个完整的 AI 投研工作流塞进了一条命令行:你用大白话下指令,它自己去拉数据、写策略、跑回测、出报告,甚至拉起一整个多智能体投研团队帮你做多空辩论。

    一、项目简介

    Vibe-Trading 是一个用自然语言驱动的「个人交易智能体」:一句话即可完成市场研究、策略回测、交易行为复盘与多智能体投研协作。后端 FastAPI、前端 React 19,单条命令安装,免费行情源默认开箱即用。

    自我进化的交易智能体

    二、安装要求和过程

    环境要求

    • Python 3.11+(本地安装路径),或 Docker(零配置路径);
    • 一个 LLM API Key(OpenRouter / DeepSeek / Gemini / Groq / Ollama 本地 等任选其一),也可完全免 Key 使用内置免费行情源;
    • 支持 A股 / 港股 / 美股 / 加密 / 期货 / 外汇 等多市场。

    快速安装(PyPI 一行装)

    pip install vibe-trading-ai
    
    vibe-trading init
    vibe-trading run -p "Backtest a BTC-USDT 20/50 moving-average strategy for 2024 and summarize return and drawdown"

    Docker 零配置(约 2 分钟)

    git clone https://github.com/HKUDS/Vibe-Trading.git
    cd Vibe-Trading
    cp agent/.env.example agent/.env   # 取消注释并填入你的 LLM provider
    docker compose up --build
    # 浏览器打开 http://localhost:8899

    装好后会得到三个命令:vibe-trading(交互式 CLI/TUI)、vibe-trading serve(启动 Web UI)、vibe-trading-mcp(供 Claude / Cursor 等接入的 MCP 服务)。

    三、核心功能

    多智能体交易团队

    1. 自我进化的交易智能体:持久化记忆 + 可编辑技能,把有用的研究套路沉淀成可复用工作流,越用越顺手。
    2. 多智能体交易团队:内置 30 个预设投研团队(投资委员会、crypto 交易台、宏观利率外汇台、量化策略台等),让多个 Agent 像真实投研部一样辩论、风控、拍板。
    3. 跨市场数据 + 智能回退:一次 get_market_data 调用打通 19 个免费数据源(腾讯/东方财富/AKShare/OKX/yfinance 等),按 IP 封禁风险自动回退,零配置、零 Key、无单点故障。

    跨市场数据回测

    1. 影子账户(Shadow Account):上传券商交割单(同花顺 / 东方财富 / 富途 / 通用 CSV),Agent 还原你的交易行为画像、提取「影子策略」,再与实际成交对比,揪出提前离场、过度交易、处置效应等纪律漏洞。
    2. 预置 Alpha 动物园:一行命令对 461 个量化因子(Qlib158 + Alpha101 + GTJA191 + 学术 + 基本面)做 IC/IR 与「存活 / 失效 / 反向」分类,随时给自己的股票池打分。

    影子账户交易复盘

    四、典型使用场景

    1. 自然语言回测:让 Agent 用一句话写出策略代码、跑回测,输出含收益 / 回撤 / 基准对比的报告,还能直接导出 TradingView Pine Script、通达信、MetaTrader 5 代码。
    2. 个人交易复盘:上传交割单,自动生成 PDF / HTML 行为诊断报告,看清自己的交易习惯与纪律缺口——比手动复盘高效太多。
    3. 多 Agent 投研协作:用「投资委员会」团队对某个标的做多空辩论 + 风险评审,结论可直接推送到 Telegram / 飞书 / 企业微信 / Discord / Slack / QQ 等 IM 渠道。

    五、推荐理由

    我特别欣赏它「开箱即用」的设计:免费行情源默认就能跑,不用先配一堆 Key 才能动手;而多智能体 + 影子账户的组合,真正戳中了真实交易者的痛点——它不是一个只会在历史数据上回测的玩具,而是能帮你认识「自己怎么交易」的教练。香港大学团队出品,文档与因子库相当扎实。

    ⚠️ 风险提示:金融科技永远有风险,Vibe-Trading 的所有输出均仅供参考、不构成投资建议,切勿直接据此实盘。

    六、下载地址

  • Graphify:把整个代码库变成 AI 可推理的知识图谱

    Graphify:把整个代码库变成 AI 可推理的知识图谱

    📌 项目简介

    Graphify 是一个开源的 AI 编程助手技能(Skill),用一条命令把你手头的代码库、SQL schema、论文 PDF、文档、截图甚至白板照片,全部解析成一张可查询的知识图谱。你的 AI 助手(Claude Code / Cursor / Codex / Gemini CLI / Aider 等 17 种)不再靠 grep 或模糊检索”猜”答案,而是沿着图谱里的真实路径推理——而且每条关系都可溯源、可审计。

    💻 安装要求和过程

    环境要求

    • Python 3.10+(解析与存储完全本地运行,无需任何服务器)
    • 任意一个支持的 AI 编程助手:Claude Code、Cursor、GitHub Copilot、OpenAI Codex、Gemini CLI、Aider 等(共 17 种),或任意 MCP 客户端
    • 联网(仅用于把文件送给你自己配置的模型,如 Claude / Ollama;代码本身不出本机)

    快速安装

    PyPI 上的包名暂时叫 graphifyy(两个 y),但命令与技能名仍然是 graphify

    pip install graphifyy
    graphify install        # 把技能注入你的 AI 助手

    然后在任意目录下打开你的 AI 助手,输入:

    /graphify .            # 对当前目录建图,代码 / 笔记 / 论文通吃

    Windows 若提示找不到命令,把 %APPDATA%\Python\Python3xx\Scripts 加入 PATH,或直接用 pipx install graphifyy;macOS 若报 externally-managed 错误同样改用 pipx 即可。

    ✨ 核心功能

    1. 全模态建图:万物皆可成节点

    支持代码(Python / TS / Go / Rust / Java / C++ 等 36 种 tree-sitter 语法)、文档(md / txt / rst)、论文 PDF,以及截图 / 流程图 / 白板照片 / 多语言文字图片(借助 Claude 视觉能力)。App 代码、数据库 schema、基础设施被统一进同一张图。

    2. 本地优先、零云端、零遥测

    解析在本地跑,图谱就是磁盘上的一个文件(graph.json),没有任何服务器在环、没有任何遥测上报。代码永远不会离开你的机器——对重视隐私和合规的团队尤其关键。

    3. 可审计的溯源:每条边都标明”怎么知道的”

    图谱里每一条关系都被打上 EXTRACTED(源码里实锤)、INFERRED(由结构与命名推理,通常靠谱但值得复核)、AMBIGUOUS(证据指向多于一方)三种标签。AI 回答时引用的是它走过的真实路径,而不是”凭感觉”。

    4. 17 个 AI 助手 + 自带 MCP Server

    一个技能可装进 17 种助手,并额外提供 MCP server:既可 stdio 单机服务,也能 HTTP 给整个团队共享。还附带 graphify prs 终端 PR 看板(CI 状态 / AI 分诊 / 合并冲突风险)。

    5. 自动同步:图谱跟着代码长

    --watch 后台实时重建(代码保存即时、文档 / 图片变化提醒你跑 --update);graphify hook install 还能装一个 git post-commit 钩子,每次提交后自动重建图谱,多 Agent 并行写码时图谱始终保持最新。

    Graphify 知识图谱可视化
    Graphify 将代码库映射为可交互知识图谱:节点=符号,颜色=自动识别的模块社区,大节点=God Node

    🎯 典型使用场景

    场景一:接手一个陌生代码库

    不用硬读 100 个文件——直接查 “god nodes”(连接度最高的符号,改动影响面最大),几分钟摸清架构与模块边界,新成员上手速度拉满。

    场景二:团队共享”谁负责什么”

    把 graph.json 提交进仓库,或用 graphify.serve 走 HTTP。新人问 “谁负责 billing?”,得到的是穿过真实代码的两条跳路径,而不是一周前的 Slack 聊天记录。

    场景三:给 AI 编程助手装”记忆”,省下海量 token

    官方基准:在 Karpathy 仓库 + 论文 + 图片的混合语料上,相比逐文件读取原始文件,每次查询 token 减少 71.5 倍;社区实测在 49.6 万 token 的代码库上省 79 倍,且零向量数据库。NOTE / WHY / HACK 注释还会变成可追查的图谱节点。

    💡 推荐理由

    我最早是被”用图谱替代 grep”这个点打动的。实际用下来,最戳我的是可审计——现在太多 RAG / 向量库方案给的是个不透明的相似度分数,你根本不知道 AI 为什么这么答;Graphify 把每条边都标了出处,你能直接点开源码第几行去验证。再加上纯本地、MIT、零账号零卡片,安全感拉满。它不算”重”的工具,装一个 skill、跑一条命令,就能让手头的 AI 编程助手从”猜”变成”走查”。如果你也受够了助手读不全代码、答非所问,值得一试。

    🔗 下载地址

  • Character.AI杀入微短剧:看完还能拉住主角聊上两句

    Character.AI 自制微短剧 c.ai Series
    Character.AI 推出的 c.ai Series 让观众能和剧中 AI 角色直接对话(图:TechCrunch)

    微短剧这阵风刮得有多猛?现在几乎每个盯住「注意力」生意的公司都在做:专门的短剧 App 不用说,TikTok、Instagram 这些社交巨头下了场,连 Peacock、Amazon Prime、印度的 JioHotstar 都来分一杯羹。最近,以「和 AI 角色聊天」起家的 Character.AI 也进场了,但它玩了个不一样的花样。

    三部开篇,题材专挑能聊的

    Character.AI 自己制作了三档微短剧:爱情向的《最后一个夏天》、恐怖向的《夜间游戏》,还有一档类似《饥饿游戏》的生存题材《伊甸坠落》。这些剧都是用 AI 制作工具弄出来的。有意思的地方在后面——18 岁以上的用户不光能看,还能直接跟剧里的角色对话、提问,甚至换条故事线自己演一遍。公司说长远目标是把这套工作流变成创作工具,让普通用户也能拿自己捏的角色拍系列剧。

    它把「看剧」变成了「进剧」

    当下的竖屏短剧,本质上是你划一下、我看一段,全程被动。Character.AI 的 twist 在于,剧播完了你还能把主角拽住聊两句。这让它不像又一个短视频信息流,而更像把一个故事世界直接敞开给你。公司把这个项目叫 c.ai Series,先由内部工作室主导打磨格式和流程,等摸清楚了观众要什么,再把能力开放给创作者。

    他们自己有个判断:故事本身未必是最核心的资产,「可对话、可介入」的叙事框架才是。当用户厌倦了被动观看,控制感和参与感反而成了新的卖点。

    这不是临时起意追风口

    往回看,这家公司从去年就把重心往娱乐功能挪了。今年 4 月它预告了 Lorebook,让用户给角色搭世界观设定;又上了 Books,能把你自己塞进经典文学里扮演角色。现在它还在测 c.ai FM(音频剧)和 c.ai Reads(小说创作)。CEO 卡兰迪普·阿南德说得直白:短剧不是为赶热点临时加的业务,而是平台顺理成章的下一步。为了不像粗制滥造的 AI 视频那样翻车,他们特意请了好莱坞编剧团队先把剧本磨出来,首批每部约 10 集、单集不到两分钟,前 8 集免费、后 2 集付费。

    真正值钱的是那点黏性

    敢这么玩,底气来自用户停留。Sensor Tower 的数据说,2026 年上半年,Character.AI 的用户每个月花在上面的时间超过 950 分钟。放到流媒体行业里看,这是个吓人的数字。公司显然在赌一件事:把陪你聊天的 companion,转化成原创 IP,再靠能互动的角色把人留得更久。


    • 三档自制微短剧上线,题材覆盖爱情、恐怖、生存
    • 核心差异:看完能和剧中 AI 角色对话、改剧情
    • 先工作室主导,后续向创作者开放工具
    • 月均停留超 950 分钟,互动成新黏性点
  • 英伟达参投的法国语音AI公司Gradium:1亿美元种子轮,专攻超低延迟

    Gradium 语音 AI 模型
    Gradium 所在的 AI 语音赛道正被资本市场重新定价(图:TechCrunch)

    巴黎有家叫 Gradium 的初创公司,专做语音 AI 模型。这周四它对外说,自己把种子轮重新打开,拉进了英伟达当新投资人,整轮融资加起来到了 1 亿美元。比起金额,更值得琢磨的是它背后的来路。

    一个从实验室里走出来的团队

    Gradium 是从法国 AI 实验室 Kyutai 分拆出来的,而 Kyutai 背后站着法国电信大亨泽维尔·尼尔。两边的核心人物都是同一个人:尼尔·泽吉杜尔。这位老哥之前在谷歌大脑、DeepMind 和 Facebook 都待过,是做语音研究的行家。Kyutai 团队早年搞出来的 EnCodec、SoundStream 和 Moshi,是现在整个语音 AI 行业底层技术的重要来源。换句话说,这家公司不是拿了别人的论文来套壳,而是站在自己人写的基础研究上起步的。

    它想消灭的是那个让人尴尬的停顿

    Gradium 做的音频模型主打一个词:超低延迟。说白了,就是让 AI 的声音几乎实时回应,别再出现那种「嗯……让我想想」的卡顿。现在不少 AI 智能体聊天时,说到一半会冷场半秒,这种停顿在人类对话里特别出戏。他们提供的东西包括语音识别、语音合成、声音克隆和实时翻译,是给开发者做语音界面用的。

    为什么要跑到大洋彼岸开办公室

    这轮钱怎么花,Gradium 说得很直白:去湾区开个办公室,跟硅谷抢人。原来去年 12 月它刚从隐身状态出来时就拿了 7000 万美元,投资人名单里就有 FirstMark、Eurazeo、DST Global,还有谷歌前 CEO 施密特和泽维尔·尼尔本人。这次新进来的英伟达又添了大约 3000 万美元。一家欧洲 AI 公司专门跑去买硅谷的工程人才,这本身挺说明问题——光靠研究底子,已经留不住顶尖工程师去跟美国公司的薪水硬刚了。

    有投资人点破过这件事:种子轮能跨过 1 亿美元、还能让英伟达亲自写支票,说明语音 AI 这个赛道正在被当成「基础设施」来定价,而不是普通的应用层。

    对手一大把,但它手里有牌

    赛道里不缺狠角色。光是做语音的 ElevenLabs,今年 2 月估值就到了 110 亿美元;谷歌的 Gemini 在语音上也很有名。Gradium 的牌在于研究血统和英伟达的战略背书,它把自己定位成给开发者提供「前沿级延迟」的那一个,而不是只拼音色好不好听。目前它已经签下了法国车企雷诺这样的大客户,说明在汽车行业那种需要处理实时语音的场景里,它确实能啃下订单。


    • 种子轮总额 1 亿美元,英伟达新近入局
    • 分拆自 Kyutai 实验室,底层技术自研
    • 主打超低延迟语音,目标消灭 AI 对话卡顿
    • 赴湾区设办公室,正面争夺工程人才
  • Wayve 估值 85 亿美元,给员工开了个 8500 万美元的「套现」窗口

    英国自动驾驶公司 Wayve 最近干了件挺实在的事:让手里的员工把一部分已经兑现的股权卖给投资人,总额 8500 万美元,按 85 亿美元的估值来算。这不是新一轮融资,而是眼下 AI 公司里越来越流行的一种”留人”手段。

    不是融资,是让员工落袋为安

    这次叫 tender offer(股权收购要约),说白了就是公司牵线,让老员工把手里的股份按当前估值卖一部分给新老人投资人,套点现金揣兜里。估值锚定在今年二月那轮 12 亿美元 D 轮之后的 85 亿——那轮由 Eclipse、Balderton 和软银愿景基金二期领投,微软、英伟达、Uber 都跟着投了。这已经是 Wayve 第二次搞这种事了,上一次是 2024 年 5 月伴随 10.5 亿美元 C 轮做的。

    Wayve 在官方博客里写得很直白:造”具身智能”不是写普通软件,需要 AI 和汽车两边的人才,留住这拨人靠的是真金白银的回报,而不是画饼。

    为什么 AI 公司都在这么玩

    过去这种员工套现窗口一般得等到快上市才开,现在完全反过来了。Decagon、ElevenLabs、Linear、Clay 这些 AI 公司最近都搞过类似的操作。逻辑很简单:手上握着稀缺 AI 技能的人议价权太强,竞品随时想挖,自己创业也不是没可能。与其等多年后的 IPO,不如现在就给个兑现机会,让人愿意留下来。

    端到端神经网络,不走高清地图老路

    Wayve 的技术路线挺硬核:它不走大多数自动驾驶公司依赖的高清地图那套,而是用一个端到端的神经网络,纯粹从数据里学开车,更接近人靠经验上路的感觉。为了做个”通用”的 AI 司机——理论上能适应不同国家、不同车型、不同路况——公司一年内把团队从几百人扩到了 1200 人。


    商业化也在加速:今年晚些时候要跟 Uber 在伦敦推 robotaxi 试点,2027 年起把这套软件塞进日产的辅助驾驶系统。一边给员工发钱稳住军心,一边把车开上街,Wayve 这步棋走得不算慢。只不过,端到端路线到底能不能扛住真实路况的复杂,还得等路面上跑出来的数据说话。

    Wayve 自动驾驶测试车在德国街头
    Wayve 的自动驾驶系统已在多个国家城市路测(图源:TechCrunch / Wayve)
  • Gemini Spark 登陆 Mac:谷歌把智能体助手塞进了你的桌面

    Google 把 Gemini Spark 这个”管家型”AI 助手搬上了 Mac。它不算什么全新概念——能帮你整理文件、盯梢你关心的话题、顺手把发票变成预算表——但放到桌面端之后,它第一次能直接碰你电脑里的东西,终于可以和 Claude Desktop、Copilot 这些老对手正面杠上了。

    从聊天框变成会动手的助手

    Spark 是五月底跟着 Google I/O 一起亮相的,定位是”24 小时在线的个人智能体”。这次上了 Mac,它被塞进现有的 Gemini 桌面 app 里,beta 阶段只向美国的 Google AI Ultra 订阅用户开放。最关键的变化是:它不再只能在网页里跟你聊,而是能读取你电脑上的文件、按指令整理下载文件夹,或者把一堆发票直接拼成一张预算表。

    皮查伊在 I/O 上开玩笑说,Spark 跑在云端虚拟机上,”所以你可以合上笔记本了”——这话明显是在暗戳戳怼那些必须让电脑一直醒着才能干活的本地智能体。

    补上了被吐槽最狠的短板

    上个月 Spark 刚出来时,TechCrunch 的编辑专门点名:这玩意儿居然连 Google 自家的 Keep 笔记都接不上,想记个简单的打包清单都得塞进 Docs,太别扭。这次更新总算把 Tasks 和 Keep 补上了,还顺手接了一堆第三方应用:Canva、Dropbox、Instacart、OpenTable、Zillow Rentals。也就是说,你能让它帮你订餐厅、买每周的菜、做租房传单,甚至安排看房。

    开始”实时盯盘”

    另一个新花样是实时话题追踪。Spark 现在能跟着体育比分、股价、突发新闻走,也能盯着社交媒体、博客、购物网站和天气。谷歌还放风说要支持自定义的 MCP 协议,让你把自己常用的 app 直接接进来,把助手调教成更贴合你自己的样子。


    手机端的多步任务还没上线,但谷歌说”很快”就能在手机上派活儿,比如远程让桌面的 Spark 去翻 Mac 里某个文件。说白了,谷歌想让 Spark 成为你数字生活里那个随叫随到、还真的会动手的帮手——至于大家愿不愿意为它每个月掏 Ultra 的订阅费,那就是另一回事了。

    Gemini Spark 在 Mac 桌面端的界面截图
    Gemini Spark 现已作为智能体助手登陆 macOS 版 Gemini 桌面应用(图源:TechCrunch / Google)
  • Open WebUI:自托管、可离线运行的 AI 聊天与智能体平台

    Open WebUI:自托管、可离线运行的 AI 聊天与智能体平台

    Open WebUI 界面演示

    项目简介

    Open WebUI 是一个功能丰富、可完全离线运行的自托管 AI 平台,支持 Ollama 本地模型与 OpenAI 兼容 API,内置 RAG 检索增强、多模型对话、语音/视频通话、智能体与插件生态,是把任意大模型变成”私有 ChatGPT”的一站式前端。(GitHub ⭐ 145K+,Python,Open WebUI License)

    安装要求和过程

    环境要求:Python 3.11(pip 方式);或 Docker 20.10+(容器方式);可搭配 Ollama 本地推理,或任意 OpenAI 兼容 API Key。

    方式一 · pip 安装(最简):

    pip install open-webui
    open-webui serve   # 访问 http://localhost:8080

    方式二 · Docker 一条命令(自带 Ollama,CPU):

    docker run -d -p 3000:8080   -v ollama:/root/.ollama -v open-webui:/app/backend/data   --name open-webui --restart always   ghcr.io/open-webui/open-webui:ollama

    方式三 · 仅用 OpenAI API:

    docker run -d -p 3000:8080   -e OPENAI_API_KEY=your_secret_key   -v open-webui:/app/backend/data   --name open-webui --restart always   ghcr.io/open-webui/open-webui:main

    部署后访问 http://localhost:3000 即可使用;也支持 Docker Compose、Kubernetes(Helm/Kustomize)与 uv 安装。

    核心功能

    • 广泛的模型与 API 接入:本地 Ollama + 任意 OpenAI 兼容后端(LM Studio、Groq、OpenRouter、vLLM、Mistral 等),支持多模型并行对话、各取所长。
    • 本地 RAG 知识库:支持 9 种向量数据库与多种文档解析引擎(Tika、Docling、Mistral OCR 等),混合检索(BM25+向量)+ 重排,用 # 命令把文档/网页直接拉进对话。
    • 智能体与插件生态:Filters / Actions / Pipes / Tools / Skills 插件机制,可接 MCP、OpenAPI 工具服务器,把任意基础模型包装成专属 Agent。
    • 语音/视频通话与多模态:本地 Whisper 等 STT + 多种 TTS 引擎,内置 DALL·E / Gemini / ComfyUI 图像生成与编辑,支持网页浏览与联网搜索。
    • 企业级管理与安全:细粒度 RBAC 与用户组、LDAP / SSO / SCIM 自动配置、PostgreSQL 持久化、横向扩展与 OpenTelemetry 可观测性。

    典型使用场景

    • 个人本地 AI 助手:用 Ollama 在笔记本上跑 Llama / Mistral,全程离线、数据不出本机,配合 RAG 问答私人文档。
    • 团队自托管 AI 中台:公司内部署,接入 OpenAI 或自建 vLLM,统一账号、权限与用量审计,替代公网 SaaS,守住数据隐私。
    • 知识库问答与自动化:把 Confluence / Notion / 本地文件建索引,用智能体 + 定时自动化做日报生成、资料检索与多模型 A/B 评估。

    推荐理由

    我把 Open WebUI 当作”私有 ChatGPT 的标杆”。它最打动我的是真正的离线优先与自托管能力——所有聊天与文档数据都留在自己的机器或服务器,不依赖任何云。RAG 开箱即用,多模型对比、语音通话、插件生态一应俱全,Docker 一条命令就能跑起来,对不想把对话记录交给第三方的用户极其友好。社区极其活跃、更新频繁,是个人和中小团队落地 AI 的最低门槛选择。

    下载地址

  • Meetily:把会议转录和 AI 摘要锁在本地的隐私优先助手(24.4K Star)

    Meetily:把会议转录和 AI 摘要锁在本地的隐私优先助手(24.4K Star)

    每次开完会,最烦的不是写纪要,而是「这录音到底传去哪了」。云端会议助手很方便,但你的商业机密、病人信息、法律磋商,全进了别人家的服务器。最近在 GitHub 上刷到一个星标冲到 2.4 万+ 的项目 Meetily,它的卖点就一句话:转录和摘要 100% 在你自己电脑上跑,数据不出本机。今天把它拆给你看。

    📌 项目简介

    Meetily 是一个隐私优先的本地 AI 会议助手:实时录音转写、说话人分离、AI 生成会议纪要,全部在本地完成,零云端依赖。基于 Rust + Tauri 打包成单一桌面应用,macOS / Windows / Linux 通吃,采用 MIT 协议开源。

    Meetily 隐私优先 AI 会议助手
    Meetily:Privacy-First AI Meeting Assistant

    💻 安装要求和过程

    环境要求

    • 桌面端(推荐):macOS(Apple Silicon / Intel)、Windows 10+、Linux;无需自备 GPU,有则加速。
    • 本地 AI 模型:Whisper 或 NVIDIA Parakeet 做转写(Parakeet 官方称快 4 倍);摘要默认用本地 Ollama,也支持 Claude / Groq / OpenRouter / 任意 OpenAI 兼容端点。
    • 开发者构建:需安装 Rust 工具链 + Node.js(建议 18+) + pnpm。
    • GPU 加速:macOS 走 Metal/CoreML,Windows/Linux 走 NVIDIA CUDA 或 AMD/Intel Vulkan,构建时自动启用。

    快速安装

    Windows:到 Releases 下载最新 x64-setup.exe,双击安装即可。

    macOS:下载 meetily_0.4.0_aarch64.dmg,拖进「应用程序」文件夹后打开。

    Linux:建议从源码构建:

    git clone https://github.com/Zackriya-Solutions/meeting-minutes
    cd meeting-minutes/frontend
    pnpm install
    ./build-gpu.sh

    开发者本地跑:装好 Rust + Node 后,前端用 pnpm install && pnpm dev,后端由 Tauri 统一拉起。

    ✨ 核心功能

    1. 本地优先 / 隐私优先

    所有录音、转写文本、摘要都只存在你本机。不联云、不上传、无厂商锁定,企业可以把敏感会议完全留在自己的基础设施里。

    Meetily 本地存储与隐私设置
    所有数据留在本地,转录模型与记录均本机存储

    2. 实时转写 + 说话人分离

    用 Whisper 或 Parakeet 模型在设备端实时出稿,会议进行中就能看到逐字稿;支持说话人分离(speaker diarization),谁说了什么一目了然。

    Meetily 本地实时转写界面
    本地实时转写界面

    3. AI 驱动的会议摘要

    转写完成后一键生成摘要,AI Provider 可自选:本地 Ollama(推荐,零费用零外流)、或接入 Claude / Groq / OpenRouter / 自建 OpenAI 兼容端点。还支持导入已有录音文件重新转写。

    Meetily AI 会议摘要
    AI 生成的会议摘要

    4. 专业音频混音

    麦克风与系统声音同时采集,带智能闪避(ducking)和防削波,远端会议声音也能干净录下来,不用再担心「对方声音没录上」。

    Meetily 专业音频混音
    麦克风 + 系统音频同时采集,防削波

    5. 跨平台 + GPU 加速的轻量单包

    基于 Tauri(Rust 后端 + Next.js 前端)打包成单文件桌面应用,比 Electron 轻得多;三大桌面系统原生支持,GPU 加速开箱即用。

    🎯 典型使用场景

    • 合规敏感型企业会议:法律、医疗、军工、金融等行业,把会议内容留在内网,规避 GDPR / 数据泄露风险,满足审计与合规要求。
    • 团队与个人纪要自动化:日常站会、客户访谈、脑暴会,开完即出转写稿 + 摘要,省下整理时间,且全程不花任何 API 调用费。
    • 私有化部署的团队协同:用自建 OpenAI 兼容端点做摘要,把 Meetily 跑在公司服务器上,团队成员共享同一套本地推理基础设施。

    💡 推荐理由

    我用过一阵子,最打动我的是它的「零心理负担」:开会前不用先纠结「这段话能不能让第三方听见」。单一桌面应用安装即用,Tauri 打包体积小、启动快,Rust 后端也让人放心。转写质量在本地模型里属于第一梯队,Parakeet 确实快;摘要接 Ollama 本地跑,等于白嫖还不出户。当然它也有边界——Community 版靠本地模型,精度和高级导出、自动入会这类能力在付费 PRO 里;但社区版承诺永久免费开源,核心的本地转写 + 摘要完全够日常用。如果你在意数据主权、又想要一个不像「玩具」的会议助手,Meetily 值得放进收藏夹。

    📥 下载地址

    注:项目原名 meeting-minutes,发布与下载请认准 meeting-minutes 的 Releases 路径;仓库现已重命名为 meetily。

  • Ollama 融了 6500 万美元:给 AI 做个「Docker」,月活逼近 900 万开发者

    Ollama 这个开源小工具,最近把 B 轮融到了 6500 万美元,由 Theory Ventures 领投。加上之前 Benchmark 的 Peter Fenton 领投的 1500 万 A 轮,公司到现在一共拿了 8800 万美元。

    Ollama 2023 年出来,干的事很实在:帮开发者在自己电脑上跑开源权重的大模型,几分钟就能跑起来。它在 GitHub 上攒了 17.6 万 star、快 1.7 万 fork,也被无数教程和视频夸过。

    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)
    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)

    两个做过 Docker 的人,想给 AI 也做个「容器」

    创始人 Jeff Morgan 和搭档 Michael Chiang 之前参与做过 Docker Desktop,就是那个把云端应用搬来搬去变得轻松的工具。Docker 后来收购了他们上一家公司 Kitematic。所以 Ollama 干的事,本质上就是「AI 版的 Docker」:把烦人的硬件配置、环境依赖全部藏起来。

    Morgan 说,2023 年开源模型刚冒头的时候特别难用,那时候它们是给研究者准备的,不是给程序员准备的。想跑起来真的费劲。三年过去,现在 Ollama 每个月被超过 890 万开发者使用,进了 85% 的财富 500 强,而公司只有 14 个人。

    真正的拐点,是智能体带火了开源模型

    Morgan 把公司的转折放到今年 1 月前后,那时候 OpenClaw 这类智能体突然变热,更大的开源模型忽然能干活了,比如写代码。他发现,愿意付钱的用户,尤其是兜里有钱的企业和快速成长的 AI 应用公司,开始越来越多地转向更便宜的开源模型,只在必要的时候才去碰 Anthropic 这种闭源模型。

    我觉得大多数人辩论时都搞错了一点。这不是二选一。开源和闭源都有大把生意可做,但凡是推理成本高的公司,都有个关乎生死的项目在推着他们往开源权重模型挪。

    不是所有人都买账

    当然,也不是每个 Ollama 粉丝都高兴它开始赚钱。大概一年前,一堆博客和社交帖子抱怨它的云服务抢了免费项目的风头,把它当成开发工具「糊化」的典型。Morgan 的回应是:那些太大的开源模型本来就没法在个人电脑上跑,所以我们说,那我们来帮你找算力。Fenton 也补了一句:桌面端那个免费产品一点没变,你照样能发现、能跑本地模型。

    • Ollama 想做的不是又一个模型,而是模型和开发者之间的那层基础设施
    • 开源模型的性价比,正在把企业从闭源 API 手里一点点撬走
    • vLLM、SGLang、NanoClaw 这些开源项目也在长成公司,VC 开始追这一类
    • 14 个人、890 万月活,这个人均产出数字挺吓人

  • 机器人要迎来自己的「ChatGPT时刻」?这家公司把宝押在了游戏数据上

    OpenAI 用 GPT-3 拉开基础模型时代那阵子,做自然语言处理的公司还在各自为战,每家都从头训练一个专门解决自己任务的模型。现在没人这么干了,大家都是先拿 GPT、Claude 或者 Llama 这种通用模型,再微调或者写提示词去适配自己的需求。

    Pim de Witte 是 General Intuition 的 CEO,他觉得「具身智能」也会走一模一样的路。

    从「为每个机器人单独训练」到「一个通用大脑」

    现在不少团队在干的事,是围着某一台具体的机器人、某一个具体的环境,收集一大堆真实世界数据,专门训一个模型。de Witte 在 TechCrunch 的 Equity 播客里说,这种活儿很快会变得多余。他觉得行业真正该做的,是先把数据质量做上去,训出一个能把「怎么动、怎么和环境互动」的直觉迁移到各种场景里的通用模型。

    他有一句挺敢说的判断:模型本身能不能泛化,才是产品。它只要有了对空间和时间的底层理解,大家就不需要再去攒几十万、上百万小时的真实数据了,因为说到底,你真正需要的可能只有几分钟。

    游戏画面里的按键,成了机器人的老师

    General Intuition 自己的基础模型,是在数百万小时的游戏录像上训出来的,而且不只是看画面,还记下了「人什么时候按了手柄上的哪个键」。de Witte 和公司的领投方 Vinod Khosla 都相信,这种带「动作标注」的数据,才是让 AI 长出类人空间推理直觉的关键。

    四足机器人在办公室中自主行走,周围悬浮游戏画面与神经网络节点
    用游戏数据训练出的物理 AI 基础模型,正试图统一机器人的「大脑」

    模型本身能不能泛化,才是真正卖钱的东西。等它有了对空间和时间的底层理解,谁还愿意去攒上百万小时的真实数据?说到底,你需要的可能只有几分钟。

    8 分钟真实数据,机器狗就站起来了

    光说不练没用。这家公司上个月刚靠着这个想法融了 3.2 亿美元、估值冲到 23 亿美元。他们已经演示过:同一个模型既能连续打几小时游戏,也能驱动一台四足机器人,而且驱动机器人时,只用了 8 分钟的真实世界数据做微调。

    de Witte 说最让他们意外的,是这台机器狗「零样本」就跑起来了:只靠一个前置摄像头,没有别的传感器,办公室里还不断有人走动、有东西乱放。他觉得这就是未来的样子。

    它不想造机器人,想做「物理世界的地基」

    General Intuition 的终局不是自己下场造机器。它想当「物理 AI 的基础模型」,给其他机器人公司当底座,让他们在自己的机器上搭东西。用 de Witte 自己的比喻:我们不会去开一家自动驾驶公司,但我们要让下一个人造自动驾驶公司容易十倍。

    • 大模型用 GPT-3 统一了文本,机器人可能正要被「世界模型」统一
    • 游戏数据贵在「按键标注」,这比单纯看视频更接近真实动作
    • 只靠几分钟真实数据就能迁移,意味着真实世界采集的成本可能被砍掉一大截
    • Khosla 把它称为「一代人的赌注」,赌的是专有数据会成为通用智能体的地基