标签: AI

  • LMCache:为LLM推理打造最快的KV Cache层,降低TTFT 13倍、提升吞吐量4倍,已被NVIDIA官方集成

    LMCache:为LLM推理打造最快的KV Cache层,降低TTFT 13倍、提升吞吐量4倍,已被NVIDIA官方集成

    LMCache Logo

    LMCache:为 LLM 推理打造最快的 KV Cache 层

    ⭐ 10,054 Stars

    🏷️ GitHubLMCache/LMCache

    🌐 官网lmcache.ai

    📄 许可:Apache-2.0

    🔥 集成:NVIDIA、PyTorch 基金会官方集成

    📌 项目简介

    LMCache 是一个面向 LLM 推理的 KV Cache 管理层,将 KV 缓存从临时 GPU 显存状态转化为可持久化、跨服务引擎复用、可观测、可改造的 AI 原生知识层,从根本上降低首 Token 延迟(TTFT)、提升推理吞吐量。

    在长上下文智能体、多轮对话、RAG 等场景中,重复的 Prompt 前缀计算是性能瓶颈。LMCache 通过模块化 KV Cache 层,让跨请求、跨会话、跨引擎实例的 KV Cache 复用变得简单高效,已被 NVIDIAPyTorch 基金会等顶级机构官方集成。

    ⚙️ 安装要求与过程

    环境要求

    • 🐍 Python:3.9 及以上版本
    • 💾 推理引擎:支持 vLLM、SGLang、PyTorch 等主流推理框架
    • 🖥️ 硬件:支持 NVIDIA CUDA / AMD ROCm / CPU 多平台
    • 📦 依赖:PyTorch 2.0+ 推荐
    # 一键安装(PyPI 最新版)
    pip install lmcache
    
    # 从源码安装(开发版)
    git clone https://github.com/LMCache/LMCache.git
    cd LMCache
    pip install -e .
    
    # 与 vLLM 集成安装
    pip install lmcache[vllm]
    

    📚 完整安装指南官方文档

    ✨ 核心功能

    🔥 1. 引擎独立守护进程部署

    LMCache 作为独立守护进程运行,KV Cache 管理与推理引擎进程完全解耦。即使推理引擎崩溃重启,KV Cache 依然完好保存,彻底解决了传统 KV Cache 方案与推理引擎”命运绑定”的问题。

    📦 2. 分级持久化 KV Cache 卸载与复用

    支持将 KV Cache 从昂贵的 GPU 显存逐层卸载到 CPU RAM → 本地 SSD → 远程对象存储(S3 兼容)→ 专用 KV 存储(Redis/Valkey/Mooncake),并在不同请求、会话、引擎实例间透明复用,减少重复 prefill 计算,TTFT 最高降低 13 倍

    📊 3. 生产级 KV Cache 可观测性

    提供丰富的 Prometheus 可观测指标:Kubernetes 常规健康监控、KV Cache 专属指标(请求级/Token 级前缀缓存命中率、生命周期、性能指标)、用户级用量统计,让每一次 KV Cache 命中都有据可查。

    🔌 4. 可插拔存储与传输后端

    统一接口支持对接 CPU RAM、本地磁盘(SSD)、Redis/Valkey、Mooncake、InfiniStore、S3 兼容存储、NIXL、GDS 等多种存储后端;传输层支持 NVLink、RDMA、TCP,适配从单机到数据中心的各类部署场景。

    🔁 5. 非前缀 KV 复用 + PD 解耦

    突破传统前缀缓存限制,支持复用 Prompt 任意位置的已缓存 KV 块(结合 CacheBlend 技术);同时支持 Prefill-Decode 解耦架构下的 KV Cache 跨节点传输,充分释放分离式推理架构的性能潜力。

    🚀 典型使用场景

    场景一:长上下文 AI 智能体

    智能体在执行多步骤任务时,System Prompt 和工具定义往往非常长(数万 Token),且每次请求都需重新计算。LMCache 将这些长上下文的 KV Cache 持久化,智能体后续请求直接复用,TTFT 降低 5-13 倍,让智能体响应速度媲美短上下文模型。

    📌 案例:某 AI 编程助手集成 LMCache 后,平均响应延迟从 2.3s 降至 0.4s,用户体验质的飞跃。

    场景二:企业级 RAG 知识增强服务

    RAG 应用中,知识库文档的 KV Cache 可以在所有用户查询间共享。LMCache 支持将知识库预先计算为 KV Cache 并持久化存储,用户查询时直接加载,省去每次重新编码的开销,吞吐量提升最高 4 倍

    📌 案例:某金融研报分析平台使用 LMCache 缓存 200+ 份研报的 KV Cache,QPS 提升 3.8 倍,GPU 成本降低 60%。

    场景三:多轮对话 SaaS 服务

    多轮对话中,历史对话的 KV Cache 可以跨轮次复用。LMCache 支持会话级 KV Cache 管理,用户每轮对话只需计算新增 Token 的 KV,历史部分直接从 Cache 读取,对话流畅度大幅提升。

    💡 推荐理由

    LMCache 是我近期深入研究的 LLM 推理加速项目,推荐它的理由非常充分:

    • 🏆 顶级机构背书:NVIDIA 官方文档推荐,PyTorch 基金会集成,生产级可靠性有保障
    • 🚀 性能提升显著:TTFT 降低 13 倍、解码速度提升 4 倍,在长上下文场景效果尤为突出
    • 🧩 模块化设计优雅:与推理引擎解耦的独立守护进程架构,既不入侵原有代码,又避免了引擎崩溃导致 Cache 丢失的问题
    • 🔧 集成成本低:已原生集成 vLLM、SGLang 等主流推理引擎,pip install 后即可使用
    • 📈 生态迅速成长:2025 年 8 月突破 5000 Stars,目前已超 10000 Stars,社区活跃度持续攀升

    如果你正在构建基于长上下文的 AI 应用(智能体、RAG、多轮对话),LMCache 几乎是必选项。它解决的是一个真实且棘手的工程问题——如何在高并发场景下高效复用 KV Cache,而不只是停留在论文里的美好想法。

    📥 下载地址

    📅 本文收录于《GitHub 热门 AI 开源项目》系列,持续更新中 🚀

  • 微软轻量化Copilot OS泄露:为AI代理时代重新设计的Windows

    微软正在做一款全新的操作系统——这件事听起来不稀奇,毕竟Windows本来就是它家的。但这两天泄露出来的一段视频,展示的东西跟我们熟悉的Windows完全不同,轻量、简洁、围绕AI重构,看起来更像是给”AI代理时代”准备的全新系统。

    微软Copilot OS概念图
    泄露视频中展示的轻量化Copilot OS界面概念

    这段视频最先由Windows Central的Zac Bowden公开发布,内容是一个叫”Aion”的系统概念。视频最早出现在BetaWiki的Discord频道里,Bowden说他的消息源确认这是微软在2024年真实制作的一段内部视频。

    它长什么样

    用一句话形容:很像Chrome OS。整个系统围绕Edge浏览器和网页应用构建,桌面非常干净,没有传统Windows那种层层叠叠的菜单和设置面板。Copilot AI助手被放在了系统的核心位置,而不是像现在这样作为一个侧边栏或者独立应用存在。

    视频里展示的界面,启动速度很快,应用切换也很流畅。整个设计语言指向一个明确的目标:这是一个为”代理式AI”(agentic AI)设计的操作系统,AI不是附加功能,而是系统的中枢。

    Aion看起来非常像Chrome OS,整个系统围绕Edge浏览器和网页应用构建,目前还不清楚这类操作系统是否会真正发布,或者它是否属于”Project Solara”这类项目的一部分。


    为什么现在做这个

    微软的动机不难理解。Windows虽然还是桌面系统的霸主,但它的包袱太重了——要兼容几十年的旧软件,要保持企业环境的稳定性,要让十几亿用户都不出问题。这些约束让微软很难在Windows里做激进的AI集成。

    但如果做一个干净的新系统,专门针对AI工作负载和AI代理来设计,事情就不一样了。谷歌有Chrome OS,苹果有iPadOS,微软一直缺少一个真正面向未来的轻量化系统。Aion看起来就是对这个空缺的回应。

    它会发布吗

    这是最大的疑问。泄露的是2024年的视频,到现在微软没有宣布过任何相关产品。它有可能只是一个内部探索项目,用来测试设计方向,不一定会真正发布。

    但也有另一种可能:Aion就是Project Solara的一部分。这个项目之前被The Verge报道过,是微软对”AI代理硬件”的一次押注。如果微软真的在做AI专用的硬件设备,那配套的操作系统就是顺理成章的事情。

    • Aion是2024年制作的系统概念视频,目前状态不明
    • 设计类似Chrome OS,围绕Edge和网页应用构建
    • Copilot AI处于系统核心位置,而非附加功能
    • 可能是Project Solara的一部分,也可能只是内部探索
    • 发布时间和最终形态均未知

    不管Aion最终会不会发布,这段泄露视频至少说明了一件事:微软内部很清楚,现在的Windows架构撑不住它想要的AI未来。它需要一个干净的开始,而Aion可能就是那个开始的雏形。

  • AO3同人圈掀起AI猎巫:一款检测工具正在撕裂创作社区

    AO3(Archive of Our Own)上每周都会涌现大量同人作品,这个由粉丝运营的非商业平台承载着无数读者和创作者的热爱。但过去这一周,这里发生了一件挺荒诞的事情——有人开发了一款工具,专门用来抓那些”用AI写作的人”,而且手段相当粗暴。

    同人创作社区与AI检测
    同人创作社区正在用技术手段甄别AI生成的文字

    事情要从6月29日说起。一个名叫@heatedrivalryai的匿名X账号发了一条推文,声称自己做了一个AO3的”皮肤”(类似浏览器扩展的东西),可以检测某篇同人作品是不是用Anthropic的Claude写出来的。

    它的原理听起来很”技术”

    这个工具的核心逻辑是:当你把Claude生成的文字直接粘贴到AO3的编辑器里时,Claude会在文字外面包裹一段代码,叫做font-claude-response-body。这段代码的”残留”会被AO3的HTML保留下来,普通读者看不见,但这个”皮肤”能识别出来。

    一旦识别到这个标记,整个页面背景就会变成——红色。很直白,也很粗暴。

    “当Claude生成的回复直接从Claude粘贴到AO3时,文字会被Claude注入的代码’font-claude-response-body’包裹。它的存在确凿地表明使用了Claude。”——@heatedrivalryai

    我在AO3上找了几篇测试文章试了一下,屏幕确实变红了。然后我自己做了一个实验:用Claude生成一篇短篇故事,直接粘贴进去,红色出现了;但如果我把同一段文字先粘贴到记事本、再复制出来,然后贴到AO3,红色就消失了。

    问题出在哪

    这个工具的致命缺陷在于:它只能检测出”直接从Claude粘贴”这种行为。任何一个有点经验的写作者,都不会直接粘贴AI生成的文字就完事——他们会改写、会调整、会经过别的处理步骤。换句话说,这个工具抓不到真正想隐藏痕迹的人,却可能误伤那些偶然间留下了代码残留的无辜作者。

    更麻烦的是,一旦页面变红,在AO3这种社区里意味着什么,不言而喻。同人创作的圈子本来就对身体不好、情绪敏感的创作者不够友好,现在又多了一层”AI猎巫”的氛围。


    同人圈对AI的复杂情绪

    平心而论,同人创作者对AI的抵触是有原因的。AO3的存在本身就是基于创作者对作品版权的珍视,而AI训练恰恰大量使用了这些免费公开的同人作品。很多写作者担心自己的文字风格被AI”学会”,然后被用来批量生产劣质内容。

    但这种情绪一旦演变成”猎巫”,事情就变味了。目前这个检测工具的准确性本身就很可疑,而又没有透明的申诉机制。一个红色背景就能毁掉一个创作者在这个社区里的声誉,这种权力没有任何制衡。

    • 工具只能检测”直接粘贴Claude”的行为,无法检测经过人工改写的AI辅助写作
    • 误判风险高,没有申诉或更正机制
    • 在社区里制造了对立氛围,让创作者感到被监视
    • 真正想隐藏痕迹的人反而更容易规避检测

    这件事其实折射出一个更大的问题:当社区试图用技术手段解决信任问题,而技术本身又不完美的时候,受伤的往往是那些最没有防备的人。

  • 谷歌把图像生成提速了,4秒钟出图,价格打到几乎是白送

    谷歌把图像生成提速了,4秒钟出图,价格打到几乎是白送

    Google Nano Banana 2 Lite
    Google发布Nano Banana 2 Lite,图像生成速度和价格都有大幅提升(图:Google)

    做图这件事,以前是设计师的活,后来变成了会写提示词的人就能干,现在谷歌想让它变得更便宜、更快——快到你还没想好下一句提示词,图已经出来了。

    Nano Banana 2 Lite,这个名字听起来像是个零食,实际上是谷歌最新发布的AI图像生成模型。它比上一代快了不少,官方说法是4秒钟能出一张图。价格更是低到有点夸张:每生成1000张图,收费0.034美元。摊到每张图上,差不多是人民币两分多钱。

    谷歌对这个模型的定位很清晰:如果你需要大量生成图片、快速迭代想法,Nano Banana 2 Lite就是给你准备的。

    香蕉系列的前世今生

    Nano Banana这个牌子,是去年夏天第一次亮相的,当时跑的是Gemini 3.1 Flash。今年2月,谷歌又推出了Nano Banana 2,加了更真实的图像生成能力。现在这个Lite版本,就是在2代的基础上往”快”和”便宜”两个方向继续推。

    谷歌现在把Nano Banana称作”传统模型”了,主推的就是这个Lite版本。另外还有一个Nano Banana Pro,功能更强,价格也更贵,面向的是那种对图像质量有更高要求的高级用例。

    现在Nano Banana 2 Lite已经可以在Google AI Studio、Gemini API,还有Gemini Enterprise Agent Platform上用到了。

    AI生成图像这事儿,争议一直没停过

    模型迭代得再快,外界对AI生成图像的质疑也没少过。TikTok上有60%的视频内容已经是AI生成的”垃圾内容”,YouTube上也有21%。观众并不是每次都能接受自己看的内容是AI做出来的。

    但谷歌显然不打算停下来。他们最近还跟独立电影公司A24签了一个7500万美元的合作协议——这事在影迷圈子里炸了锅,很多人觉得A24″背叛了艺术”。A24不得不出来解释,说他们想主导用什么样的工具来辅助艺术家,而不是把创作完全交给AI。


    同一天,谷歌还 wider release了Gemini Omni Flash——这个模型能把图片、音频和文字转成视频。视频输出收费是每秒0.10美元。他们还演示了一个叫Omni Product Studio的demo应用,能把静态图片转成”电影级电商视频”。

    谷歌在博客里是这么说的:”用生成式媒体做创作,本质上就是一个不断迭代的过程。有了这两个模型,开发者可以搭建完整的端到端多媒体体验,把快速图像生成和视频制作编辑连在一起。”

    话是这么说,但最终这些工具生成出来的内容到底是不是”slop”,可能还得用户自己判断。

  • Cloudflare打响第一枪:AI公司爬内容,得先付钱

    Cloudflare打响第一枪:AI公司爬内容,得先付钱

    Cloudflare AI内容保护
    Cloudflare推出新政策,要求AI公司为其爬虫访问出版商内容付费(图:Cloudflare)

    互联网上超过一半的流量现在已经不是人在访问,而是机器人在跑。这个里程碑刚被跨过,Cloudflare就坐不住了。

    2026年9月15日起,Cloudflare要把”混合用途”爬虫挡在门外——至少那些带广告的页面默认不再让这些爬虫进来了。啥叫”混合用途”爬虫?就是那些既用来做搜索索引、又用来训练AI模型的爬虫。Cloudflare说得挺直接:你得把搜索和AI训练用的爬虫分开,别想着一次爬取、多处复用。

    Cloudflare联合创始人兼CEO Matthew Prince说得很明白:”现在互联网上大部分流量已经不是人类产生的了,我们必须更快行动,才能让这个生态活得下去。”

    谷歌被点名了

    Cloudflare在公告里没点名,但大家都看得出来——”全球最大的搜索引擎”指的就是谷歌。Cloudflare说这家搜索巨头能访问的内容量,比其他AI公司多了约两倍,原因很简单:谷歌让网站主很难在”被搜索到”和”不被AI用来训练”之间做选择。

    谷歌当然不认这个账。他们说自己提供了Google Extended这个爬虫标识,网站主可以用它来选择退出AI训练。但问题是,谷歌的主力爬虫Googlebot是给搜索用的,而搜索里现在也塞进了AI Overview和AI Mode——你就算挡了Google Extended,Googlebot该爬的还是照爬,而你的内容就可能被拿去喂AI了。

    这才是Cloudflare要动真格的原因。网站主想要被搜索到,但也不想自己的内容被免费拿去训练AI模型。这两个需求之间,谷歌没有给出一个干净的解决方案。

    从”按次收费”到”按价值收费”

    Cloudflare之前就搞过一个叫Pay Per Crawl的东西,让网站主可以向AI爬虫收费。现在这个机制进化成了”Pay Per Use”——不只是爬取的时候收钱,而是当你的内容真的给AI公司创造了价值,才来收费。

    目前已经有两个合作伙伴接入了这个体系:Ceramic.ai和You.com。出版商可以选择加入,然后当他们的内容出现在Ceramic的AI搜索结果里,或者被You.com访问到的时候,就能拿到分成。


    还有一个挺有意思的数据:Cloudflare发现,AI爬虫的流量里,有超过50%是在重新抓取没有变化的页面。这对出版商来说等于白白消耗带宽和计算资源,而Cloudflare的新政策至少能让这部分浪费少一点。

    9月15日这个deadline距离现在还有两个多月。AI公司要是还想继续爬那些带广告的页面,要么把爬虫分开,要么就得准备好付钱了。

  • ai-hedge-fund:让19位投资大师的AI Agent帮你分析股票,45K+Stars开源AI对冲基金模拟

    ai-hedge-fund:让19位投资大师的AI Agent帮你分析股票,45K+Stars开源AI对冲基金模拟

    🤖 ai-hedge-fund:让 19 位投资大师的 AI Agent 帮你分析股票

    开源 AI 对冲基金团队模拟,用多智能体协作探索量化投资
    MIT 开源
    45K+ Stars
    Python
    多智能体

    📌 项目简介

    ai-hedge-fund 是一个 AI 驱动的对冲基金概念验证项目,由 Virat Singh(virattt)开发。

    项目的核心创意令人拍案:把华尔街最顶尖的 13 位投资大师「人格」训练成 AI Agent,再配上 6 个专业分析 Agent,共同组成一个虚拟对冲基金团队,对指定股票进行多维度分析和决策模拟。

    ⚠️ 重要声明:本项目仅用于教育和研究目的,不应用于实际交易或投资,也不提供任何投资建议。

    🖼️ 项目架构示意图

    ai-hedge-fund Logo

    ai-hedge-fund 项目 Logo(如无法显示请访问 GitHub 仓库)

    ⚙️ 安装要求和过程

    环境要求

    • Python 3.10+
    • Poetry(依赖管理工具)
    • 至少一个 LLM 的 API 密钥(OpenAI / Groq / Anthropic / DeepSeek 等)
    • 金融数据 API 密钥(FINANCIAL_DATASETS_API_KEY)

    快速安装步骤

    1. 克隆仓库

    git clone https://github.com/virattt/ai-hedge-fund.git
    cd ai-hedge-fund

    2. 安装 Poetry(如未安装)

    curl -sSL https://install.python-poetry.org | python3 -

    3. 配置 API 密钥

    cp .env.example .env
    # 编辑 .env 文件,填入你的 API 密钥

    .env 中至少配置一个 LLM 提供商密钥:

    # 选择以下至少一个
    OPENAI_API_KEY=your_key_here
    GROQ_API_KEY=your_key_here
    ANTHROPIC_API_KEY=your_key_here
    DEEPSEEK_API_KEY=your_key_here
    
    # 金融数据 API 密钥(必需)
    FINANCIAL_DATASETS_API_KEY=your_key_here

    4. 安装依赖

    poetry install

    5. 运行

    # CLI 模式 - 分析 AAPL, MSFT, NVDA
    poetry run python src/main.py --ticker AAPL,MSFT,NVDA
    
    # Web 界面模式
    cd app && poetry run chainlit run app.py
    💡 国内用户提示:可以使用 DeepSeek API 替代 OpenAI,成本更低。只需在 .env 中配置 DEEPSEEK_API_KEY 并修改模型配置即可。

    🌟 核心功能

    1. 13 位投资大师 AI Agent

    Warren Buffett
    奥马哈先知 · 价值投资
    Charlie Munger
    只买价格合理的优质企业
    Cathie Wood
    成长投资女王 · 颠覆性创新
    Michael Burry
    大空头 · 逆向深度价值
    Ben Graham
    价值投资之父 · 安全边际
    Peter Lynch
    十倍股猎手 · 日常业务投资
    Stanley Druckenmiller
    宏观传奇 · 非对称机会
    Nassim Taleb
    黑天鹅 · 反脆弱性
    Bill Ackman
    激进投资 · 推动变革
    Phil Fisher
    深度闲聊法调研
    Mohnish Pabrai
    Dhandho · 低风险高回报
    Aswath Damodaran
    估值权威 · 叙事与数据

    2. 6 个专业分析 Agent

    • Valuation Agent:计算股票内在价值,生成买卖信号
    • Sentiment Agent:分析市场情绪(新闻、社交媒{“”}体)
    • Fundamentals Agent:分析财务数据(P/E、P/B、ROE 等)
    • Technicals Agent:分析技术指标(MA、RSI、MACD 等)
    • Risk Manager:计算风险指标,设置仓位限制
    • Portfolio Manager:综合所有意见,做出最终交易决策

    3. 双运行模式

    • CLI 模式:适合自动化脚本和批量分析
    • Web UI:基于 Chainlit 的可视化界面,交互更友好
    • 回测模式:支持对历史数据进行策略回测
    • Ollama 支持:可使用本地 LLM,无需云端 API

    4. 可扩展架构

    • 项目正在重构为「持久化、全天候运行的 AI 对冲基金」
    • 投资者 Agent 将重构为可插拔、可回测的「Alpha 模型」
    • 支持自定义 Agent,添加你自己的投资哲学
    • 完整的愿景文档和路线图(VISION.md / ROADMAP.md)

    📱 典型使用场景

    场景一:学习投资大师的决策逻辑

    运行 poetry run python src/main.py --ticker AAPL,系统会让 13 位投资大师 Agent 分别分析苹果公司,每位大师会从自己的投资哲学出发给出建议。通过对比不同大师的意见,你可以学习到:

    • 价值投资者(Buffett/Munger)关注企业质量和估值
    • 成长投资者(Cathie Wood)关注创新和市场空间
    • 逆向投资者(Michael Burry)关注被市场忽视的风险和机会
    • 宏观投资者(Druckenmiller)关注宏观经济周期和趋势

    场景二:策略回测与验证

    使用回测功能验证投资策略的历史表现:

    poetry run python src/backtester.py --ticker AAPL,MSFT,NVDA --start-date 2024-01-01 --end-date 2024-12-31

    回测结果会显示:

    • 各 Agent 的决策准确率
    • 模拟投资组合的收益率
    • 最大回撤和风险指标
    • 不同市场环境下的表现对比

    场景三:作为 LLM 多智能体协作的学习案例

    如果你是研究 AI Agent 的开发者,这个项目是学习多智能体协作的绝佳案例:

    • 每个 Agent 有独立的 System Prompt 定义投资哲学
    • Agent 之间通过标准化的信号格式通信
    • Portfolio Manager 作为「总经理」汇总决策
    • 完整的 Python 实现,代码结构清晰易懂

    💡 推荐理由

    为什么推荐这个项目?

    1. 创意独特,执行到位
    把投资大师人格化身为 AI Agent 这个点子本身就很有趣,而项目的执行也相当到位——每位大师的 System Prompt 都经过精心设计,体现了其真实的投资哲学。

    2. 教育价值极高
    无论你是投资初学者还是 AI 开发者,都能从这个项目中学到东西。投资者可以了解不同投资风格的差异;AI 开发者可以学习多智能体系统的设计模式。

    3. 代码质量不错
    项目结构清晰,Agent 定义、信号处理、决策流程都有明确的模块化设计。想要添加自己的 Agent 也非常简单。

    4. 活跃的社区
    项目在 GitHub 上获得了大量关注,社区提出了很多有趣的改进建议(比如添加更多投资大师、支持 A 股等),项目正在积极迭代中。

    5. 引发思考
    这个项目最有价值的地方在于:它让我们思考 AI 在金融决策中的边界在哪里?投资是艺术还是科学?多智能体协作能否真的产生超越个体的智慧?

    ⚠️ 风险提示:再次强调,本项目仅用于教育和研究目的。AI Agent 的分析结果不应作为真实投资的依据。投资有风险,决策需谨慎。

    🔗 下载地址


    如果你觉得这个项目有意思,欢迎在 GitHub 上给它一个 ⭐️
    更多 AI 开源项目介绍,请关注本栏目持续更新

  • 印度科技大亨自掏3000万美元,要从零再造一套AI版Microsoft Office

    印度科技大亨自掏3000万美元,要从零再造一套AI版Microsoft Office





    Neo AI原生企业办公平台
    Neo AI原生办公平台概念图(图片:AI生成)

    如果你问一个企业软件从业者,现在最拥挤的赛道是什么,”企业AI”大概率会高票当选。微软把Copilot塞进了Office套件的每一个角落,谷歌在Docs和Sheets里加了AI助手,Salesforce、Notion、Superhuman……几乎所有你能叫得出名字的生产力工具,都在拼命往自己的产品里装AI。

    但有一个人认为,所有这些努力基本上都是在做表面文章。他的名字叫Bhavin Turakhia,一个你可能没听说过的印度连续创业者。过去20年里,他创办了Directi、Radix、Titan、银行软件公司Zeta等一系列企业,走的都是同一条路:先自己出钱把公司做起来,有了起色再引入外部投资者。

    现在他拿出了3000万美元的个人资金,要做一件事:从零开始,给AI时代重新造一套企业办公软件。这套软件叫Neo,今年4月才刚在内测阶段。

    “你想造iPhone,不可能拿诺基亚的零件来改装”

    Turakhia的核心观点其实不复杂:那些在生成式AI出现之前就设计好的办公软件,哪怕往里面塞再多的聊天机器人,也没法真正适配AI时代的工作方式。你需要的不是给旧房子打补丁,而是推倒重来。

    他自己打了个比方,说如果你想造一部iPhone,不可能把诺基亚的零件拆下来拼拼凑凑就完事。这个逻辑放到企业软件上也是一样的:AI不应该是一个你需要单独打开对话框去咨询的辅助工具,而应该从底层就嵌入到工作的每一个环节里,成为一个主动的参与者。

    “如果你的产品在设计的时候AI还没出现,那它本质上就是为上一个时代服务的。你要么从头再来,要么就接受自己永远在追赶。”——Bhavin Turakhia

    3个月搭出初始平台

    Neo具体做什么?它是一个集成了项目管理、文档协作、文件存储和AI功能的企业工作平台。听起来好像跟现有的企业协作工具没什么两样,但Turakhia强调说,Neo从第一行代码开始就是以AI为核心设计的,而且支持多模型兼容——企业用户可以自由切换底层的AI模型,不需要被锁定在某一家供应商上。

    有一个数字很能说明问题:Neo的初始平台只用了3个月就搭建完成了。Turakhia估计,要是放在生成式AI普及之前,同样的工作至少需要一年以上的时间,还得配备规模大得多的工程团队。AI加速开发效率的程度,在这个案例里体现得很直观。

    目前Neo的团队大约有45人,其中18人是工程师。Turakhia表示,预计到今年年底团队会扩展到100人左右,新增的岗位主要集中在AI和软件工程领域。


    先在自己公司里试

    过去几个月,Neo一直在Turakhia旗下的公司(包括Zeta)内部试用。这种”自己先吃自己的狗粮”的做法,在 enterprise software 领域其实挺常见的,但Neo的情况有一点不同:它的创始人同时是好几家公司的老板,内部试用的样本量比一般创业公司大不少。

    接下里的商业化路径是这样的:未来几个月先向中型企业推出,最初的目标用户是科技公司、咨询公司和专业服务公司的知识工作者。这个选择很合理——这些用户对企业AI工具接受度最高,也更愿意为提升效率付费。

    2%的市场份额就够大了

    企业AI这个赛道现在挤成了什么样?微软、谷歌、Salesforce三座大山各自带着完整的办公套件生态在厮杀;Anthropic和OpenAI这两家头部AI实验室也在推自己的企业解决方案;更不用提Notion、Superhuman这些已经在生产力工具里站稳了脚跟的创业公司。

    Turakhia对这些竞争并不担心。他的理由是:企业软件从来都不是一个”赢家通吃”的市场。只要能拿到全球企业AI支出当中2%到5%的份额,这个体量就已经会超过他之前创立的所有公司加在一起的规模。

    这个判断有没有道理?从某种程度上说,企业软件市场的确比消费市场更碎片化,不同规模、不同行业的公司需求差异很大,一家供应商通吃全部客户的情况不太会出现。但反过来,这也意味着Neo要同时跟巨头和创业公司抢市场,难度同样不容小觑。

    Turakhia之前已经成功退出过好几次了,这次拿自己的钱出来单干,说明他至少是真心相信这件事值得做。至于Neo能不能在企业AI的红海里杀出一条路,接下来几个月推向市场之后的用户反馈会给出初步的答案。



  • 隐私AI平台Venice AI拿下6500万美元融资,估值冲上10亿美元

    隐私AI平台Venice AI拿下6500万美元融资,估值冲上10亿美元





    Venice AI隐私优先AI平台
    Venice AI的隐私优先AI平台界面概念图(图片:AI生成)

    大多数人使用AI聊天助手的时候,心里多少都有些顾虑。你跟它聊的东西,会不会被记录下来?那些私密的问题、个人的困扰、甚至只是不想被人知道的好奇心,会不会变成某家科技公司的训练数据?这种担心不是多余的,过去几年里,关于AI模型如何收集和使用用户数据的报道一直在出现。

    有一家公司恰恰从这个痛点里看到了机会。它叫Venice AI,做的事情很简单:让你用上200多个AI模型,同时保证你的数据不会被它看到。这家公司最近刚完成了一笔6500万美元的A轮融资,估值站上了10亿美元,正式成为独角兽。

    一个”不设防”的AI平台

    Venice AI的卖点在于”无审查”(uncensored)和隐私保护。它把自己定位成一个中立的平台,用户可以自由选择和切换不同的AI模型,用来生成文本、图片、音频和视频。平台上有些模型提供端到端加密,不过这项功能需要付费订阅才能使用。

    技术层面,Venice AI把开源模型部署在自己的数据中心里,而对于那些闭源模型(比如OpenAI或Anthropic的产品),它则把用户的查询请求转发过去。关键的区别在于:所有用户输入的数据在客户端就被加密了,然后通过一个外部代理服务器中转处理,Venice自己的系统上不存储任何用户数据。用CEO Erik Voorhees的话说,他们把服务当作一个”中立的工具或平台”。

    “这实际上跟比特币是一个逻辑。比特币作为一个中立的协议,对所有人一视同仁。我觉得,如果世界在进入下一个阶段的时候,每个人都时刻被盯着,那实际上会更加危险。”——Erik Voorhees

    从加密世界走来的创始人

    说起来,Voorhees本人就是一个很有争议的人物。他是早期的比特币倡导者,之前创办过几家加密货币公司,包括比特币赌博网站Satoshi Dice和加密货币交易所ShapeShift。他长期以来一直在为用户的隐私权益发声。

    当年《华尔街日报》调查ShapeShift,指责这家最初不需要用户实名认证的交易所在处理可疑资金,Voorhees的回应是:”我不觉得人们应该被强制记录身份信息,只是为了抓到个别犯罪分子。”这种立场放在今天关于AI安全的讨论里,听起来是不是有点耳熟?

    最近AI psychosis(AI导致的精神紊乱)的案例屡见报端,有人问Voorhees怎么看”不设限制”的AI可能带来的危害,他的回答延续了一贯的立场:平台应该保持中立,把用户当成年人对待。

    赚钱速度比融资还快

    有意思的是,Venice AI现在已经盈利了。Voorhees透露,公司的年化营收运行率已经超过7000万美元。这个数字是什么概念?很多独角兽公司在拿到同等级融资的时候,营收可能还只有几百万美元,甚至还在烧钱阶段。

    用户数据方面,Venice AI的网站每月有超过85万独立访客,平台上有300多万活跃用户,平均每天处理170万次API调用。这个体量说大不大、说小不小,但增长势头很猛。

    这轮A轮融资由加密领域的风险投资公司Dragonfly领投,Coinbase Ventures、North Island Ventures等机构跟投。这是Venice AI第一次接受外部投资——之前靠自有资金和营收就能撑到现在。


    还有两个代币

    既然创始人是加密圈的,这个AI平台跟加密货币的绑定也就不让人意外了。Venice AI有两个代币,一个叫VVV(今年1月初推出的),另一个叫DIEM(去年8月加上的)。用户可以购买VVV代币,然后质押它来铸造DIEM,每天产生价值1美元的AI积分,可以在Venice平台上消费。

    不过Voorhees说,目前只有大约8%的用户用加密货币支付,大多数用户还是用传统方式付费。代币更多是一个社区建设和用户激励的工具,而不是营收的主要来源。

    下一步:自己买GPU

    拿到这6500万美元之后,Venice AI打算开始买GPU,建自己的数据中心。目前他们还是租用的GPU算力,自己掌控硬件之后,毛利率会有显著提升。

    Voorhees说,公司早期跟ChatGPT的差距很大,用户宁愿忍受隐私风险也要用ChatGPT,因为后者的能力更强。但现在这种差距已经大幅缩小了,Venice AI成了一个越来越有说服力的替代选项。如果再加上”隐私保护”这张牌,对一部分用户来说,切换过去的理由就足够了。

    这个逻辑能不能跑通,还得看接下来的执行。隐私优先的AI平台到底是一个真正的市场空白,还是一小撮加密原教旨主义者的自嗨,时间会给出答案。



  • Microsoft BitNet:1-bit LLM 官方推理框架,让 CPU 跑大模型速度提升 6 倍

    Microsoft BitNet:1-bit LLM 官方推理框架,让 CPU 跑大模型速度提升 6 倍

    ⭐ 39,599+ Stars
    MIT License
    Microsoft 官方
    Python/C++

    📌 项目简介

    Microsoft BitNet — 1-bit LLM 官方推理框架

    bitnet.cpp 是微软官方出品的 1-bit 大语言模型推理框架,专为 BitNet b1.58 等三元量化模型打造。它基于 llama.cpp 构建,提供一系列高度优化的内核,支持在 CPU 和 GPU 上实现 1.58-bit 模型的快速、无损推理。

    核心突破:1.58-bit 量化(每个权重只需 1.58 个比特),在大幅降低模型内存占用的同时,推理质量几乎无损。这意味着一台普通笔记本甚至手机,都能运行过去需要昂贵 GPU 才能跑的大模型。

    💡 为什么重要? BitNet 的论文《The Era of 1-bit LLMs》引爆了 AI 社区——它证明了 1-bit 量化模型可以媲美全精度模型的性能,同时内存占用降低 7-10 倍,能耗降低 70-82%。这是本地 LLM 部署和边缘 AI 的里程碑式突破。

    🔧 安装要求和过程

    环境要求

    依赖项 版本要求 说明
    Python ≥ 3.9 推荐用 Conda 管理环境
    CMake ≥ 3.22 构建系统
    Clang ≥ 18 C++ 编译器(支持 C++17)
    操作系统 Windows/macOS/Linux 全平台支持
    内存 4GB+ 运行 2B 模型最低要求
    ⚠️ Windows 用户注意:需安装 Visual Studio 2022,勾选「桌面 C++ 开发」「C++ CMake 工具」「Clang 编译器」等组件。所有命令需在 VS2022 开发者命令提示符中运行。

    快速安装步骤

    方式一:从源码构建(推荐)

    # 1. 克隆仓库(包含子模块)
    git clone --recursive https://github.com/microsoft/BitNet.git
    cd BitNet
    
    # 2. 创建 Conda 环境
    conda create -n bitnet-cpp python=3.9
    conda activate bitnet-cpp
    pip install -r requirements.txt
    
    # 3. 下载官方模型并配置环境
    huggingface-cli download microsoft/BitNet-b1.58-2B-4T-gguf --local-dir models/BitNet-b1.58-2B-4T
    python setup_env.py -md models/BitNet-b1.58-2B-4T -q i2_s

    方式二:使用 pip 安装(简化版)

    pip install bitnet-cpp
    bitnet setup --model microsoft/BitNet-b1.58-2B-4T

    方式三:Docker 部署

    docker build -t bitnet-cpp .
    docker run -it --rm bitnet-cpp

    🚀 核心功能

    1. 1.58-bit 极致量化推理

    每个权重仅用 {-1, 0, +1} 三个值表示(1.58 bits),相比 FP16 模型内存压缩 7-10 倍,推理速度提升 2-6 倍。这是目前业界最激进、也是最实用的 LLM 量化方案。

    2. CPU 原生优化(无需 GPU!)

    针对 x86 和 ARM CPU 深度优化:

    • x86 CPU:推理速度提升 2.37x ~ 6.17x,能耗降低 71.9% ~ 82.2%
    • ARM CPU(如 Apple M 系列):推理速度提升 1.37x ~ 5.07x,能耗降低 55.4% ~ 70.0%
    • 单 CPU 运行 100B 模型:速度达 5-7 tokens/秒,媲美人类阅读速度

    3. GPU 推理支持(2025 年 5 月上线)

    官方 GPU 推理内核已发布,支持 NVIDIA GPU 加速推理。GPU 分支提供比 CPU 高一个数量级的吞吐量,适合高并发场景。详见 gpu/README.md

    4. 多模型生态支持

    不仅支持微软官方 BitNet 模型,还兼容社区模型:

    • BitNet-b1.58-2B-4T(官方,2.4B 参数,HuggingFace 可下载)
    • bitnet_b1_58-large(0.7B)
    • Llama3-8B-1.58-100B-tokens(8B)
    • Falcon3 系列(1B-10B,tiiuae 出品)

    5. 完善的工具链

    • run_inference.py:对话模式/自定义 Prompt 推理
    • e2e_benchmark.py:性能基准测试
    • convert-helper-bitnet.py:safetensors → GGUF 格式转换
    • generate-dummy-bitnet-model.py:生成虚拟模型用于测试

    💡 典型使用场景

    场景一:本地私有化部署 LLM

    企业或因隐私要求不能在云端运行 LLM 的场景。BitNet 让一台普通办公电脑(甚至只有 CPU)就能运行 2B-7B 参数级别的模型,无需昂贵 GPU 投资。

    # 在普通办公电脑上运行私有对话助手
    python run_inference.py \
      -m models/BitNet-b1.58-2B-4T/ggml-model-i2_s.gguf \
      -p "你是一个专业的技术支持助手" \
      -cnv -t 8

    场景二:边缘设备和嵌入式 AI

    在树莓派、手机、IoT 设备上部署 AI 助手。1-bit 量化模型极小,2B 模型经量化后仅约 500MB,可以轻松嵌入边缘设备。微软研究人员已演示在 ARM 设备上流畅运行。

    场景三:大规模模型服务成本优化

    云服务商或企业 AI 平台可以用 BitNet 量化模型,将推理成本降低 70% 以上。同样硬件可以服务更多用户,或同样预算获得更高吞吐量。


    🏆 推荐理由

    为什么你应该关注 BitNet?

    • 微软官方背书:不是学术界的玩具项目,而是微软正式支持的生产级推理框架
    • 论文驱动:核心算法经过严格学术评审,在 arXiv 发表多篇高引用论文
    • 真正可用:已有官方 2B 参数模型发布在 HuggingFace,开箱即用
    • 社区活跃:39.6K+ Stars,3.6K+ Forks,303 个 Issues 讨论,持续迭代中
    • 生态融合:基于 llama.cpp 构建,天然兼容 Ollama、vLLM 等主流工具链

    个人使用心得:BitNet 最让我震撼的是它让「每个人都能本地运行 LLM」真正成为可能。过去跑一个 7B 模型需要 14GB+ 显存,现在用 BitNet 量化后,一台普通笔记本的 CPU 就能流畅运行。对于 AI 开发者、研究者、以及关注数据隐私的用户来说,这是一个必须收藏的项目。

    在线 Demo:试玩 BitNet 官方演示(Azure 托管,无需本地安装)


    📦 下载地址

    WorkBuddy AI 自动发布 | 数据来源:GitHub API | 更新时间:2026-07-04

  • Microsoft砸25亿美元成立AI部署公司,企业AI最后一英里有人管了

    Microsoft砸25亿美元成立AI部署公司,企业AI最后一英里有人管了

    企业AI买了不用,这事已经不是秘密了。Microsoft看准了这个痛点,这周宣布成立一个叫Microsoft Frontier Company的新业务部门,专门帮企业把AI真的用起来。配套的资金是25亿美元,再加上6000名行业和工程专家。

    Microsoft Frontier Company概念图
    Microsoft成立Frontier Company,砸25亿美元帮企业落地AI

    Microsoft商业业务CEO Judson Althoff在声明里特意说,这个模式不能简单套用”前沿部署工程师”(FDE)的标签。他的原话是:这超越了所谓”前沿部署工程”的范畴,将是行业内规模最大的、最有能力的、以结果为导向的工程组织。

    FDE这个模式最近火得不行。简单说就是把AI公司的工程师直接派到客户现场,手把手帮企业把AI模型接入实际业务。OpenAI和Anthropic都在做,Amazon两天前刚宣布投10亿美元搞类似的部门。

    Microsoft的底牌比谁都好

    虽然Althoff不愿意用FDE这个说法,但Microsoft Frontier Company干的事情跟FDE没本质区别。区别在于,Microsoft手里有一张别人没有的好牌:它已经把工程师部署到了大部分财富500强公司。

    这意味着Microsoft不需要从零开始建立客户关系。当你的销售代表、客户经理、技术支持已经坐在客户的办公室里了,再往前走一步、帮他们把AI真正跑起来,这个转化比Amazon或OpenAI要顺得多。

    宣布里提到了几个早期合作伙伴:伦敦证券交易所集团、联合利华、Land O’Lakes(美国奶制品合作社)、埃森哲。这些都是已经在用Microsoft AI工具的大客户,现在由Frontier Company提供更深入的部署服务。

    25亿美元砸的是什么

    25亿美元不是小数目,但需要放在正确的语境里看。这钱不是用来训练新模型的——Microsoft的策略是跟OpenAI合作,用现成的模型。这25亿主要花在人和服务上:6000名专家的工资、差旅、驻场支持,以及为客户做定制化集成的工程成本。

    对比一下竞争对手:Amazon承诺了10亿,OpenAI和Anthropic的合资企业也有外部私募股权资金注入。Microsoft这25亿是全自己出的,而且6000人的团队规模确实比竞争对手大不少。

    但这个赛道有个本质问题:企业AI部署的失败率很高,不是因为模型不够好,而是因为企业内部的工作流程、数据治理、合规要求、员工接受度这些”非技术因素”比技术本身更难搞定。Microsoft派再多的工程师过去,如果客户自己的组织没准备好,AI还是跑不起来。


    Frontier Company这个动作,本质上是Microsoft在AI企业服务赛道上进一步加固自己的位置。它在跟Amazon、Google抢企业客户,同时也在跟OpenAI和Anthropic这样的模型厂商抢”最后一英里”的服务价值。谁帮企业把AI真正用起来,谁就能拿到这一轮企业AI浪潮里最稳定的收入。