博客

  • Supervision:Roboflow 开源计算机视觉工具库,46.3K+ Stars 让 CV 开发不再重复造轮子

    Supervision:Roboflow 开源计算机视觉工具库,46.3K+ Stars 让 CV 开发不再重复造轮子

    🔍 Supervision

    Roboflow 开源计算机视觉工具库

    ⭐ 46.3K+ Stars
    🍴 4.1K+ Forks
    🐍 Python
    📜 MIT 许可

    📌 项目简介

    Supervision 是 Roboflow 团队开发的开源 Python 计算机视觉工具库,提供模型无关的检测、跟踪、标注和数据集处理能力。它让你专注于业务场景,而不是重复编写基础 CV 工具函数。

    ✨ 核心特色

    🔗 模型无关设计

    内置 Ultralytics (YOLO)、Transformers、MMDetection、RF-DETR 等主流库的连接器,统一输出 sv.Detections 格式,换模型不改代码。

    🎨 丰富可视化标注

    提供 BoxAnnotator、MaskAnnotator、EllipseAnnotator、LabelAnnotator 等多种标注器,高度可定制,一行代码完成结果可视化。

    📦 数据集处理

    支持 COCO、YOLO、Pascal VOC、YOLOv8 Oriented Bounding Box 等格式的加载、拆分、合并、格式转换,一站式数据集管理。

    📹 视频分析工具

    内置目标跟踪(ByteTrack/Norfair)、区域计数、速度估计、驻留时间分析等常见 CV 任务的配套工具,开箱即用。

    ⚙️ 安装要求和过程

    环境要求

    • Python ≥ 3.10
    • 操作系统:Windows / macOS / Linux 全平台支持
    • 可选依赖:根据使用的模型后端选择安装(ultralytics / transformers / mmdet 等)

    快速安装

    # 使用 pip 安装(推荐)
    pip install supervision
    
    # 使用 conda 安装
    conda install -c conda-forge supervision
    
    # 从源码安装最新版
    pip install git+https://github.com/roboflow/supervision.git

    💡 安装后可在 Google Colab 中在线体验,或访问 HuggingFace Spaces 体验标注器效果。

    🚀 典型使用场景

    场景一:目标检测 + 可视化标注

    使用 YOLO 或 RF-DETR 模型进行目标检测,并用 Supervision 的标注器一键可视化结果:

    import cv2
    import supervision as sv
    from rfdetr import RFDETRSmall
    
    # 加载模型
    model = RFDETRSmall()
    image = cv2.imread("image.jpg")
    
    # 推理
    detections = model.predict(image, threshold=0.5)
    
    # 可视化
    box_annotator = sv.BoxAnnotator()
    label_annotator = sv.LabelAnnotator()
    
    annotated = box_annotator.annotate(
        scene=image.copy(), detections=detections
    )
    annotated = label_annotator.annotate(
        scene=annotated, detections=detections
    )
    
    cv2.imwrite("result.jpg", annotated)

    场景二:视频目标跟踪与区域计数

    对视频中的目标进行跨帧跟踪,并统计穿越特定区域的目标数量:

    import supervision as sv
    
    # 定义感兴趣区域(多边形)
    ZONE = sv.PolygonZone(
        polygon=sv.Polygon.from_file("zone.json")
    )
    
    tracker = sv.ByteTrack()
    
    for frame in sv.get_video_frames_generator("video.mp4"):
        detections = model.predict(frame)
        detections = tracker.update(detections)
        
        # 统计区域内的目标
        zone_count = ZONE.trigger(detections)
        print(f"区域内目标数: {zone_count}")

    场景三:数据集格式转换

    在不同标注格式之间自由转换,方便切换训练框架:

    import supervision as sv
    
    # 从 COCO 格式加载
    dataset = sv.DetectionDataset.from_coco(
        images_directory_path="data/train/images",
        annotations_path="data/train/_annotations.coco.json",
    )
    
    # 拆分为训练集和验证集
    train_ds, val_ds = dataset.split(split_ratio=0.8)
    
    # 保存为 YOLO 格式
    train_ds.as_yolo(
        images_directory_path="data/yolo/images/train",
        annotations_directory_path="data/yolo/labels/train",
    )

    💡 推荐理由

    计算机视觉开发者最头疼的事情之一,就是每次用新的检测模型都要重新写一遍数据预处理、结果解析、可视化标注、数据集转换的代码。Supervision 把这个痛点彻底解决了。

    它的 模型无关设计 是一大亮点——不管你用 YOLOv8、YOLO11、RT-DETR、SAM 还是 Grounding DINO,Supervision 都能以统一的 sv.Detections 格式输出结果,让你的下游代码完全不用改。

    另一个让人惊喜的地方是数据集处理工具。以前 COCO 转 YOLO 要写几十行脚本,现在几行代码就搞定。格式拆分、合并、统计类别分布,全都内置了。

    Roboflow 作为计算机视觉领域的头部公司,维护质量和文档完善度都非常高。PyPI 月下载量超百万,社区活跃,Discord 里提问基本当天就有回复。不管是做学术研究还是工业落地,这都是必备工具库。

    📊 项目信息

    GitHub Stars ⭐ 46,329+
    Forks 🍴 4,106+
    语言 🐍 Python
    许可 📜 MIT License
    最新版本 v0.29.0(要求 Python ≥ 3.10)
    创建时间 2022-11-28
    维护方 Roboflow 团队

    🤖 本文由 AI 自动生成 · 数据来源:GitHub – roboflow/supervision

  • 微软轻量版’Copilot OS’泄露,AI操作系统争夺战悄然打响

    一段泄露视频最近在网上流传,展示了一个叫”Aion”的系统——这是一个为AI代理专门设计的轻量级Windows概念版本。视频最早由Windows Central的Zac Bowden发布,他的消息源确认这段视频确实是微软在2024年制作的,不是外部爱好者的概念作品。

    像Chrome OS,但为AI而生

    从视频来看,Aion的界面非常简洁,整体围绕Edge浏览器和网页应用构建,风格很像Google的Chrome OS。但它和Chrome OS最大的不同是——AI代理才是这个系统的核心,而不是用户手动打开一个个应用。

    微软Copilot OS概念图
    微软正在探索为AI代理设计的轻量级操作系统

    这个概念其实和微软之前公布的Project Solara有相似之处。Project Solara是微软正在研发的AI代理操作系统项目,目标是让AI深度嵌入系统层,而不是像现在这样作为一个应用存在。目前还不清楚Aion是否就是Project Solara的一部分,或者只是一个探索性的内部原型。

    为什么需要AI专属操作系统

    现在的AI助手——不管是Copilot还是ChatGPT——本质上都是在现有操作系统上运行的应用。它们的能力受限于操作系统能给的权限。如果AI要真正”代理”你的电脑操作,它需要更深层的系统权限:直接读写文件、调用系统API、跨应用协作,甚至管理其他进程。

    现有的操作系统架构是为人类用户设计的——键盘、鼠标、图形界面。当主要用户变成AI代理,操作系统的底层逻辑可能也需要重新思考。

    微软显然不想把这块阵地让给别人。如果未来AI代理成为人机交互的主流方式,掌握操作系统入口的公司就掌握了下一时代的主动权。苹果在做自己的AI眼镜操作系统,Google在推Gemini for Home,微软的选择是把Windows改造成AI的原生平台。

    离真正发布还有多远

    目前没有任何迹象表明Aion会以现在这个形态正式发布。它更像是一个方向性的探索——微软在试探”如果Windows完全围绕AI重建,会是什么样子”。

    但泄露本身就有价值。它至少证实了微软已经在认真思考这个问题,而且思考的时间比外界想象的要早。2024年就有了成型的视频演示,说明这不是临时起意,而是一条已经在内部走了相当远的研发路线。


  • OpenAI要给美国政府5%股权,AI红利谁说了算?

    OpenAI估值8520亿美元,CEO Sam Altman最近向特朗普政府抛出一个提案——让美国政府持有OpenAI 5%的股权。按照最新融资轮估值计算,这笔股份价值大约426亿美元。这个想法其实不新,据金融时报报道,Altman早在去年初就向特朗普提过类似建议。

    为什么要给政府股份

    Altman的逻辑是:让公众从AI的发展中获得实际的经济利益,最好的方式就是直接持股。这个提案出现的背景是OpenAI与特朗普政府之间的关系相当微妙。相比之下,OpenAI的主要竞争对手Anthropic近几个月接连遭到打压——先是被五角大楼认定为”供应链风险”,紧接着最新模型又被出口管制,被迫从市场下架。

    OpenAI与政府持股概念图
    OpenAI提议向美国政府开放5%股权

    OpenAI显然不想成为下一个被针对的目标。如果政府直接持有股份,监管层面的压力可能会小很多——毕竟,你不太会对自己有股份的公司下重手。

    华盛顿已经在这么做了

    这个提案听起来夸张,但美国政府最近确实在这么做。特朗普政府已经持有了Intel 10%的股权,还要求和Nvidia、AMD从中国销售AI芯片的收入中分出15%给联邦政府。OpenAI的提案如果落地,相当于把这个模式扩展到了AI领域最值钱的那几家公司。

    Altman据说亲自提出了5%这个数字。如果其他美国AI公司也参与类似安排,这将是AI行业与华盛顿关系的一个历史性转折点。

    讨论还在非常早期的阶段,其他AI公司会不会同意类似的安排也完全不清楚。不过方向已经看得见了:AI公司越来越意识到,与其被动挨打,不如主动把一部分利益分给权力部门。

    主权财富基金的影子

    参议员Bernie Sanders的态度更激进。他认为AI本质上是公共资源,应该被征收一次性50%的股票税,用来建立美国主权财富基金。OpenAI的5%提案相比之下简直算是温和的了。

    不管这个提案最终能不能落地,它至少说明了一件事:AI公司已经不再只是埋头做技术了,它们开始在华盛顿玩一场更复杂的游戏。这场游戏的规则很简单——谁分到的利益够多,谁就能活得更安稳。


  • Cloudflare出手了:AI公司想抓内容训练,得先付钱

    Cloudflare出手了:AI公司想抓内容训练,得先付钱

    Cloudflare这几天扔了一颗炸弹——从今年9月15日起,它的默认设置会直接屏蔽那些”混合用途”的网络爬虫。啥叫混合用途?就是那些一边帮你做搜索索引、一边偷偷抓数据去训练AI的爬虫。

    这个时间点卡得很准。Cloudflare的CEO Matthew Prince说得直接:”现在互联网上大部分流量已经不是人产生的了,我们得动作快点,不然可持续的生态系统建不起来。”他指的是前不久的一个里程碑——机器人流量历史上第一次超过了人类流量,而且这事儿本来预计明年才发生。

    Cloudflare AI爬虫政策概念图
    Cloudflare要求AI公司为内容付费 | 来源:AI生成

    被点名的最大的那家搜索引擎(你懂的,Google)一下子有点尴尬。Cloudflare说它手里的信息量比别的AI公司多出约两倍,就是因为搜索巨头让客户很难只保留搜索可见性而拒绝AI使用。

    Google当然不服气,说自己有个叫”Google Extended”的机器人,网站主可以自主选择不让内容被用于训练Gemini这类AI产品,而且不影响搜索收录。但问题是,Googlebot这个主力爬虫是给搜索用的,可搜索里现在也塞进了AI Overview和AI Mode——这界线本身就模糊。

    Cloudflare这一招的影响不容小觑。它手里管着大量网站的流量入口,这一改默认设置,AI公司想抓广告支持类网站的内容训练模型,门儿都没有——除非网站主自己手动改设置。

    更有意思的是,Cloudflare把原来的”按抓取付费”(Pay Per Crawl)升级成了”按使用付费”(Pay Per Use)。意思是,AI公司不光是抓内容的时候要付钱,真用这些内容产生了价值,还得再付。

    目前已经有两个合作伙伴在用这个模式:Ceramic.ai和You.com。发布商加入之后,只要自家内容出现在Ceramic的AI搜索结果里,或者You.com调取了付费内容,就能拿到分成。

    Cloudflare给出的数据挺扎心:AI爬虫的抓取流量里,超过50%是在重复抓取没变化的页面。这不光是版权问题,还是算力浪费问题。

    这件事的大背景是,网站主们其实并不反对自己的内容被搜到,甚至也不反对被AI服务引用,但白给别人拿去训练商用模型,这账怎么算都不划算。Cloudflare这回相当于给了他们一个杠杆,把”要不要用”的选择权拿了回来。


  • 25亿美元砸下去,微软要帮企业把AI真正用起来

    25亿美元砸下去,微软要帮企业把AI真正用起来

    昨天(7月2日)微软突然宣布成立一个新部门,叫Microsoft Frontier Company,专门帮企业把AI落地。不是那种喊口号的”AI转型”,是实打实派工程师进驻企业、手把手帮部署的那种。

    这笔投入不小——25亿美元,外加6000名行业专家和工程师。微软商业业务CEO Judson Althoff在声明里特意强调,这不单单是啥”前置部署工程”(FDE)那么简单,而是要做成”行业里最大、最有能力、最结果导向的工程组织”。

    微软AI部署公司概念图
    微软斥资25亿美元成立AI部署公司 | 来源:AI生成

    但说实话,这事儿看着眼熟。最近几个月,亚马逊、OpenAI、Anthropic都在搞类似的联合 venture。就在两天前,AWS刚宣布掏10亿美元做自己的AI部署业务,明摆着走FDE路线。OpenAI和Anthropic那边也拉了私募股权基金进来。

    微软的优势在于客户基础。财富500强里一大半早就是它的客户了,工程师早就驻场了。这次官宣的初期合作伙伴里,有伦敦证券交易所集团、联合利华、Land O’Lakes,还有埃森哲。

    这个赛道突然这么热闹,背后逻辑其实挺清晰。AI模型和工具现在一大堆,但企业真要用起来,中间的”最后一英里”问题没人管。模型再强,部署不了、用不起来,都是白搭。微软这回等于把原来散在各部门的AI咨询服务整合成一个独立的利润中心,专门吃这块蛋糕。

    25亿美元不是小数目,但比起微软的体量,这更像一个信号——它要认真做企业AI部署这门生意了,而且要把亚马逊、OpenAI它们都卷进来。


  • CodeGeeX4:清华大学出品的9B全能代码模型,性能超越70B级大模型

    CodeGeeX4:清华大学出品的9B全能代码模型,性能超越70B级大模型

    CodeGeeX4
    清华大学 KEG 实验室 × 智谱 AI 联合出品
    ALL-9B 全能模型 · 代码生成 · Function Call · 仓库级理解
    ⭐ 最新一代
    🚀 9B 超越 70B
    🏆 BigCodeBench SOTA

    📝 项目简介

    CodeGeeX4 是清华大学 KEG 实验室与智谱 AI 联合推出的第四代多语言代码生成模型,基于 GLM-4-9B 持续训练,在代码生成、代码解释、Web 搜索、Function Call、仓库级 Q&A 等全场景软件开发生命周期中均提供卓越表现。仅 9B 参数即超越 Llama3-70B、DeepSeekCoder-33B 等超大模型,是当前 10B 以下参数规模中综合性能最强的代码模型。

    9B
    模型参数

    82.3%
    HumanEval Pass@1

    128K
    上下文长度

    ⭐ 30K+
    GitHub Stars

    ⚙️ 安装要求和过程

    💻 环境要求

    • Python 3.10+(推荐 3.11)
    • CUDA 12.1+(GPU 推理)
    • PyTorch 2.0+ 或 vLLM 0.5.1+
    • 内存:FP16 推理约 18GB,INT4 量化约 6GB
    • 操作系统:Windows / macOS / Linux 全平台支持

    🚀 快速安装(Ollama — 最简单)

    # 安装 Ollama(需 0.2+ 版本)
    # macOS/Linux:
    curl -fsSL https://ollama.com/install.sh | sh
    
    # Windows: 从 https://ollama.com/download 下载安装
    
    # 一键运行 CodeGeeX4
    ollama run codegeex4

    🐍 使用 transformers 推理

    pip install transformers==4.40.0 torch
    
    from transformers import AutoTokenizer, AutoModelForCausalLM
    import torch
    
    model = AutoModelForCausalLM.from_pretrained(
        "THUDM/codegeex4-all-9b",
        torch_dtype=torch.bfloat16,
        trust_remote_code=True
    ).cuda().eval()
    tokenizer = AutoTokenizer.from_pretrained(
        "THUDM/codegeex4-all-9b",
        trust_remote_code=True
    )
    
    # 对话格式
    prompt = [{"role":"user","content":"写一个快速排序"}]
    inputs = tokenizer.apply_chat_template(prompt, add_generation_prompt=True, return_tensors="pt").cuda()
    outputs = model.generate(inputs, max_new_tokens=256)
    print(tokenizer.decode(outputs[0], skip_special_tokens=True))

    ⚡ vLLM 高性能部署

    pip install vllm==0.5.1
    
    # 启动 OpenAI 兼容 API 服务
    python -m vllm.entrypoints.openai.api_server     --model THUDM/codegeex4-all-9b     --trust-remote-code     --tensor-parallel-size 1
    
    # 然后即可用 OpenAI SDK 调用
    # pip install openai
    # client = OpenAI(base_url="http://localhost:8000/v1", api_key="dummy")

    ✨ 核心功能

    💬 全场景代码助手
    支持代码补全、代码生成、代码解释、代码翻译、文档生成、Bug 修复等全场景,基于 ChatGLM2/GLM-4 架构,中英文理解能力优异。

    🔧 Function Call 原生支持
    唯一原生支持 Function Call 的代码模型,Function Call 执行成功率甚至超越 GPT-4。可无缝接入 AI Agent 工具调用链路。

    📦 仓库级代码理解
    支持 128K 超长上下文,可理解整个代码仓库。支持仓库级 Q&A、跨文件代码补全、自动 commit 等高级功能。

    🌐 多平台部署
    支持 Ollama / vLLM / transformers / Rust-candle 多种推理后端;支持 VS Code、JetBrains 全系列 IDE 插件;支持本地 / 云端双模式。

    🏆 性能全面领先(10B 以下模型)
    HumanEval 82.3% · MBPP 75.7% · NaturalCodeBench 40.4% · BigCodeBench 48.9%(complete)/ 40.4%(instruct)· CRUXEval-O 47.1%。在代码推理、代码理解、代码执行等全方位评测中均取得 10B 以下模型最佳成绩。

    🎯 典型使用场景

    场景一:IDE 智能编程助手(最适合日常使用)

    在 VS Code 或 JetBrains IDE 中安装 CodeGeeX 插件,即可体验:

    • 代码补全:根据上下文自动补全下一行 / 下一个函数
    • 上下文补全:基于仓库内其他文件提供跨文件补全建议
    • Ask CodeGeeX:中英文对话解决编程问题,支持代码解释、翻译、纠错
    • 本地模式:连接本地 Ollama 运行的 CodeGeeX4,数据完全不出本地

    💡 支持超过 100 种编程语言!

    场景二:AI Agent Function Call 工具

    CodeGeeX4 原生支持 Function Call,可以:

    • 作为 AI Agent 的代码生成工具,解析自然语言需求生成代码
    • 接入 OpenAI 兼容 API,与 LangChain / AutoGen 等 Agent 框架无缝集成
    • 支持仓库级代码操作(增删改文件),实现 AI 自动 commit
    • 结合 vLLM 部署,支持多并发、高吞吐的生产环境调用

    场景三:本地私有化部署(数据安全敏感场景)

    对于数据隐私有严格要求的企业 / 个人,CodeGeeX4 提供完善的本地部署方案:

    • 通过 Ollama 一行命令启动,INT4 量化仅需 6GB 显存
    • 支持连接 VS Code / JetBrains 插件,体验与云端一致
    • 支持昇腾 / NVIDIA 全系列硬件,包括国产 AI 芯片
    • 代码和数据完全不离开本地,满足企业合规要求

    💡 推荐理由

    作为 AI 编程工具的深度用户,我试用过 GitHub Copilot、Claude Code、Cursor 等各类产品,CodeGeeX4 给我留下了极其深刻的印象:

    ① 性价比无敌:9B 参数的小模型,性能直接干翻 70B 的 Llama3 和 33B 的 DeepSeekCoder。这意味着你用消费级显卡(甚至 6GB 显存的 RTX 3060)就能跑一个世界级代码模型。

    ② Function Call 是杀手锏:在 AI Agent 时代,代码模型不能只做补全,还要能调用工具。CodeGeeX4 是唯一原生支持 Function Call 的开源代码模型,而且执行成功率比 GPT-4 还高。这对构建 AI 编程 Agent 来说是个游戏规则改变者。

    ③ 清华大学 + 智谱 AI 双背书:KEG 实验室(唐杰教授团队)在 NLP 和代码生成领域深耕多年,CodeGeeX 系列从 2022 年做到 2026 年,四代演进,成熟度远超同类竞品。智谱 AI 的 GLM 架构也在持续迭代优化。

    ④ 真正可用的 IDE 插件:很多开源模型只提供权重,没有好的用户体验。CodeGeeX 的 VS Code / JetBrains 插件做得相当完善,上下文补全、跨文件理解、Ask CodeGeeX 对话,体验不输商业产品。

    如果你在找一个能本地部署、性能好、中文友好的 AI 编程助手,CodeGeeX4 是目前唯一的最优解

    📊 性能对比(10B 以下模型)

    模型 参数 HumanEval MBPP NCB Function Call
    CodeGeeX4-ALL-9B 9B 82.3% 75.7% 40.4% ✅ 超越GPT-4
    Llama3-70B-Instruct 70B 77.4% 82.3% 37.0%
    DeepSeekCoder-33B 33B 81.1% 80.4% 39.3%
    Codestral-22B 22B 81.1% 78.2% 46.0%

    数据来源:CodeGeeX4 官方 README,NCB = NaturalCodeBench

    📚 CodeGeeX 系列演进

    CodeGeeX(第一代,2022)
    13B 参数,基于华为昇腾芯片训练,在 20+ 编程语言上预训练。配套开源 HumanEval-X 多语言评测基准。Apache-2.0 开源。

    CodeGeeX2(第二代,2023)
    基于 ChatGLM2-6B,6B 参数即超越 15B 的 StarCoder。支持 8192 序列长度,量化后仅需 6GB 显存。HumanEval-X 全面提升(+57%~+321%)。

    CodeGeeX4(第四代,2024)
    基于 GLM-4-9B,9B 参数全能模型。支持 Function Call、仓库级 Q&A、128K 上下文。BigCodeBench / NaturalCodeBench / CRUXEval 全基准 SOTA。Apache-2.0 开源。

    由自动化任务发布 · GitHub 热门 AI 开源项目系列 · 清华大学 KEG 实验室 × 智谱 AI
  • 微软砸25亿美元搞了个AI部署公司,这仗越打越猛了

    周四,微软悄悄亮了一张新牌——一家叫Microsoft Frontier Company的运营新公司,专门帮企业把AI真正用起来。听起来像个咨询服务部门?不完全是。微软这次拿出了25亿美元的承诺投资,还拉了6000名行业和工程专家进来。

    微软商业业务CEO Judson Althoff在宣布这件事的时候,特意强调了一件事:这不只是你们说的”前置部署工程师”(FDE)那套东西。”这超越了所谓前置部署工程的标签,”他写道,”这会是行业里最大、最能打、最结果导向的工程组织。”

    微软AI部署公司Frontier
    微软Frontier Company聚焦企业AI落地,25亿美元投入(配图由AI生成)

    FDE到底是什么,为什么大家都在做

    FDE全称Forward Deployed Engineer,直译过来是”前置部署工程师”——说人话就是,把工程师直接派到客户那边,现场帮企业把AI模型接进业务流程里。这套打法最早是Palantir带起来的,现在变成了AI公司的标配。

    有意思的是,就在微软宣布这件事的两天前,AWS刚说自己要拿10亿美元搞一个类似的AI部署项目,而且明说就是FDE模式。OpenAI和Anthropic也没落下,两家都在这几个月里宣布了和私募股权公司合作的联合 venture,方向也是企业AI服务。

    所以现在局面是这样的:亚马逊扔了10亿,微软扔了25亿,OpenAI和Anthropic各自拉了外部资本进场。企业AI落地这件事,已经从”顺手做一做”变成了各家都要单独成立公司来做的核心业务。

    微软的真正优势在哪

    论掏钱,微软这次确实出手最重。但钱不是唯一的筹码,微软手里有一样别人没有的东西——客户。

    公告里点了几家早期合作伙伴:伦敦证券交易所集团、联合利华、Land O’Lakes(美国乳制品合作社)、埃森哲。这些名字背后代表的,是微软在企业市场深耕几十年的积累。财富500强里大部分公司,本来就是微软的客户。

    这意味着微软不需要从头去敲门。工程师已经驻场了,关系已经建立了,现在只是把”帮企业部署AI”这件事,从顺手做的事变成了一门正经生意。相比之下,OpenAI和Anthropic虽然技术强,但企业客户基础远不如微软深厚,它们选择和私募股权合作,某种程度上也是在补这个短板。

    企业AI落地的窗口期

    这件事的背后,其实是一个更大的趋势:AI公司都在从”卖模型”往”卖结果”转型。企业不缺模型,缺的是把模型变成业务流程里真正能用、愿意用的东西。这块活儿脏、累、慢,但利润厚、黏性强。

    微软这次把25亿美元砸进去,摆明了是要把这块市场吃下来。它有的是销售团队、有的是企业关系、有的是Azure云基础设施。Frontier Company如果能把这些牌都打出来,对其他玩家来说会是个不小的压力。


    当然,话说回来,宣布和做成是两回事。企业AI落地的坑,这几年大家都看了不少——模型效果不稳定、数据安全顾虑、员工不会用、业务流程改不动。微软有钱有关系,但这些实际问题,不是砸钱就能解决的。

    接下来值得看的是,Frontier Company第一个公开案例什么时候出来,以及效果到底怎么样。 announcement是廉价的,客户买单才是真的。

  • Anthropic正与三星商讨定制AI芯片,不想只靠英伟达了

    四月那会儿,路透社曾经报过一条消息,说Anthropic在认真考虑自研AI芯片,原因很简单——芯片不够用。当时听起来更像是行业内幕人士的放风,没多少人当真。但这几天,这件事看起来是真的了。

    周四,The Information 报道称Anthropic正在和三星接触,商讨围绕一款待定芯片展开合作。不过按照报道的说法,Anthropic自己也没完全想清楚这块芯片到底用来干什么、怎么塞进服务器、性能要做到什么程度。说白了,双方还在谈,没到拍板的阶段。

    Anthropic与三星商讨定制AI芯片
    AI公司纷纷开始布局自研芯片,Anthropic和三星的合作正在洽谈中(配图由AI生成)

    TechCrunch去求证的时候,Anthropic的回复很标准——包含谷歌、亚马逊和英伟达芯片的多元化硬件堆栈,仍将是其计算战略的核心。至于和三星有没有可能合作,官方说法是没有更多信息可以披露。

    这话翻成人话就是:我们确实在聊,但别问太多,说出来就不好谈了。

    OpenAI上周刚亮底牌

    Anthropic这个动作,怎么看都像是对上周OpenAI那步棋的回应。就在6月24日,OpenAI联手博通(Broadcom)发布了它们的首款自研推理处理器,代号”Jalapeño”。OpenAI的说法是,这块芯片效率更高,性能功耗比优于竞品。

    除了OpenAI和Anthropic,亚马逊和谷歌也早就在做自己的定制芯片了——亚马逊有Trainium,谷歌有TPU,都是云服务里的标配。所以归根到底,这场”造芯”运动的核心逻辑只有一个:英伟达太强势了,强势到所有人都想绕开它。

    英伟达在AI芯片领域的地位不用多说,训练、推理两头吃,市面上基本没有能打的对手。但这种一家独大的局面,让所有AI公司都睡不踏实——供货要看脸色,价格也没多少议价空间。自己掌握芯片,意味着至少不用把命门捏在别人手里。

    三星为什么是那个合适的人选

    三星在AI产业链里的位置很特殊。它既是英伟达的合作伙伴,帮英伟达生产训练AI模型所需的芯片,同时又用英伟达的软件来制造自己的芯片。两边下注,和谁都熟。

    更有意思的是,三星和英伟达正在韩国合建一座AI芯片工厂。也就是说,如果Anthropic最终选择和三星合作,这条供应链上会出现一个微妙的三角关系:英伟达帮三星建厂,三星帮Anthropic做芯片,而Anthropic本来就是英伟达的大客户。大家都在同一张牌桌上,只是出的牌不一样。

    三星也不是第一次和AI公司谈芯片合作了。此前有报道说,三星还在和谷歌讨论下一代AI芯片的制造。看起来,三星想在AI芯片代工这块吃到更多份额,和台积电掰一掰手腕。


    这块芯片最终能不能做出来,现在下结论还太早。Anthropic连”用来干什么”都没想清楚,说明项目还在非常早期的阶段。但方向已经明确了:AI公司不想永远当英伟达的客户,它们想自己掌握硬件的主动权。

    接下来值得看的是,OpenAI的Jalapeño芯片什么时候能量产落地,以及Anthropic和三星的谈判会不会在年内有实质性突破。芯片这件事,宣布容易,做出来难,业内翻车的例子也不是没有。

  • Strix:开源AI渗透测试工具,让AI智能体像真实黑客一样发现漏洞(31.6K Stars)

    Strix:开源AI渗透测试工具,让AI智能体像真实黑客一样发现漏洞(31.6K Stars)

    🛡️ Strix:开源AI渗透测试工具,让AI智能体像真实黑客一样发现漏洞

    Strix
    Autonomous AI Penetration Testing
    ⭐ 31.6K Stars
    🐍 Python
    📄 Apache-2.0
    🏢 useStrix

    📌 项目简介

    Strix 是一款开源的 AI 驱动的渗透测试工具,由 useStrix 团队维护(YC W25 孵化项目)。它用自主AI智能体模拟真实黑客的攻击行为——动态执行代码、发现漏洞、验证PoC(概念验证),覆盖从侦察、利用到验证的完整渗透测试流程。与传统静态分析工具的高误报率不同,Strix 通过实际利用来验证漏洞,输出可工作的PoC,让开发者和安全团队在几小时内完成传统需要数周的渗透测试。

    ⚙️ 安装要求与过程

    环境要求

    • Docker 必须已启动(用于沙箱隔离执行)
    • ✅ 任意支持的 LLM 提供商 API 密钥(OpenAI / Anthropic / Google / 本地模型等)
    • ✅ Python 3.10+(仅使用 PyPI 包时)

    快速安装(3步搞定)

    # 1. 一键安装 Strix
    curl -sSL https://strix.ai/install | bash
    
    # 2. 配置 AI 提供商(支持 OpenAI / Claude / Gemini 等)
    export STRIX_LLM="openai/gpt-5.4"
    export LLM_API_KEY="your-api-key"
    
    # 3. 运行首次安全评估
    strix --target ./app-directory

    📦 首次运行会自动拉取沙箱 Docker 镜像,结果保存到 strix_runs/<run-name> 目录。

    ✨ 核心功能

    🤖
    多智能体渗透测试
    多个AI渗透测试智能体协作——分工负责侦察、利用、后渗透阶段,像红队一样动态协调、共享发现、链式利用漏洞,并行执行提升覆盖效率。

    🔍
    真实漏洞验证(非误报)
    与传统静态分析工具的高误报率不同,Strix 通过实际执行利用代码来验证漏洞,输出可工作的PoC(概念验证),确保每一个报告的问题都是真实可利用的。

    🧰
    完整渗透测试工具链
    内置 HTTP 拦截代理(Caido)、浏览器漏洞利用(Playwright)、命令执行环境、自定义漏洞运行时(Python 沙箱)、侦察与OSINT、动静态代码分析(SAST+DAST)、结构化漏洞知识库(CVSS + OWASP 分类)。

    🔧
    自动修复与合规报告
    不仅发现问题,还能生成安全补丁(AI 自动修复)和符合 SOC 2 / ISO 27001 / PCI DSS 标准的渗透测试报告,一键即可生成可直接提交的漏洞报告。

    🚀
    CI/CD 原生集成
    无交互模式(-n/--non-interactive)完美适配自动化场景,GitHub Actions 工作流仅需 10 行配置,即可在每次 Pull Request 时自动扫描漏洞,在代码合并前阻断安全风险。

    🚀 典型使用场景

    场景一:PR 合并前的自动安全门禁
    在 GitHub Actions 中配置 Strix,每次 PR 提交时自动触发安全扫描。Strix 会自动将扫描范围限定在变更文件(diff-scope),快速完成审查。发现漏洞时以非0退出码阻断合并,并自动生成包含PoC和修复建议的安全报告。传统渗透测试需要数周,Strix 在 CI 流水线中仅需分钟级完成。
    场景二:Bug Bounty 自动化辅助
    安全研究员使用 Strix 对目标应用进行自动化漏洞挖掘。Strix 的智能体协作机制可同时覆盖 OWASP Top 10 的八大类漏洞(访问控制、注入攻击、服务端漏洞、客户端攻击、业务逻辑缺陷、认证与会话、基础设施与云安全、API 安全),并自动生成可用于漏洞报告提交的 PoC 脚本,大幅提升 Bug Bounty 研究的效率与覆盖深度。
    场景三:本地代码仓库的白盒安全审计
    开发者运行 strix --target ./app-directory,Strix 在 Docker 沙箱内动态执行应用代码,结合 SAST(静态应用安全测试)和 DAST(动态应用安全测试)双重分析,精准发现硬编码密钥、SQL 注入、SSRF 等传统工具难以触达的深层漏洞。支持通过 --instruction 参数指定重点关注的业务逻辑缺陷类型。

    💡 推荐理由

    在 AI 辅助开发日益普及的今天,安全责任正在向左迁移——开发者需要在代码提交前就能发现安全问题。传统 SAST 工具(如 Bandit、Semgrep)误报率高,而专业渗透测试周期长、成本高。Strix 用 AI 智能体填补了这个空白:

    • 🎯 真实可利用性验证:不只报告潜在问题,而是实际执行利用代码,输出可工作的 PoC,将误报率降至最低。
    • 🤝 多智能体协作:像真实红队一样分工协作,侦察智能体发现攻击面 → 利用智能体验证漏洞 → 后渗透智能体评估影响范围,链式利用让漏洞发现更系统。
    • 🔗 DevSecOps 无缝集成:GitHub Actions / GitLab CI 仅需 10 行配置,PR 差异范围自动扫描,安全门禁无感嵌入开发流程。
    • 🌐 支持广泛 LLM 提供商:通过 LiteLLM 支持 OpenAI / Anthropic / Google / Azure / AWS Bedrock / 本地模型(Ollama),可灵活选择兼顾成本与效果的最佳模型。

    作为 YC W25 孵化的开源项目,Strix 在短短数月内获得 3.1 万+ stars,已成为 AI 安全测试领域最受关注的开源工具之一。无论你是开发者、安全工程师还是 DevSecOps 团队,Strix 都值得加入你的安全工具链。

    📥 下载地址

    📌 本文由 AI 助手自动生成,数据来源:GitHub + 项目官方 README。Strix 采用 Apache-2.0 开源许可,由 useStrix 团队维护(YC W25)。
  • 纽约高空屋顶跑酷电影感动作大片

    纽约高空屋顶跑酷电影感动作大片

    纽约高空屋顶跑酷电影感动作大片



    🤖 ChatGPT

    🇺🇸 English Prompt

    Ultra-realistic IMAX-level Netflix-style cinematic rooftop parkour action portrait, 9:16 vertical composition, use the uploaded image as the primary visual reference for the dynamic airborne pose, freestyle parkour body angle, sunglasses styling and fearless urban energy, while redesigning the subject as a beautiful young adult woman, create a dramatic full-body action scene set at the top of one of the tallest buildings in New York City during a breathtaking cinematic sunset-blue-hour transition, show the girl in a powerful mid-air jump as she launches from one skyscraper rooftop and leaps toward another nearby rooftop, captured in a bold side-front action angle with strong depth and height, her body suspended in motion with one hand pushing off from the ledge, one leg bent and the other extended as she flies across the gap, her posture athletic, agile and perfectly balanced, her face showing fierce concentration, adrenaline, fearless confidence and sharp determination, with focused eyes, slightly tense brows and softly parted lips, her skin luminous fair porcelain milky-white with an ultra-smooth clean texture and perfect even face-to-body skin tone consistency, her hair styled in a short edgy windswept pixie or layered short haircut with natural flying strands reacting to the jump, outfit designed in a premium urban parkour streetwear style including black sunglasses, a loose grey half-sleeve graphic t-shirt, a dark sleeveless utility vest flowing with motion, black cargo jogger pants with strap details, a black smartwatch, minimal wrist accessories and stylish high-performance white sneakers, background featuring the spectacular New York skyline with towering skyscrapers, rooftop ledges, distant high-rises, atmospheric haze, glowing windows and an epic sense of dangerous height, the jump gap between the two buildings clearly visible to enhance the thrill, lighting intensely cinematic with dramatic orange-gold sunset glow mixed with cool blue city shadows, rim light outlining her body, soft light reflections on the rooftops, subtle motion blur on the background edges and rich action contrast, ultra-rich color grading with warm amber highlights, deep charcoal shadows, metallic city tones and premium blockbuster-style depth, captured with a cinematic action lens, HDR lighting, global illumination, photorealistic rendering, masterpiece quality, ultra-detailed textures, 8K production detail. Negative Prompt: bad anatomy, extra limbs, distorted pose, weak jump action, blurry face, flat lighting, dull colors, cartoon, anime, CGI look, text, watermark, logo, low quality.

    🇨🇳 中文提示词

    超现实IMAX级网飞风格电影化屋顶跑酷动作肖像,9:16垂直构图,使用上传的图像作为动态空中姿势、自由式跑酷身体角度、太阳镜造型和无畏城市能量的主要视觉参考,同时将主体重新设计为一名美丽的成年女性,在令人叹为观止的电影感日落与蓝色时刻交替期间,创建场景设置在纽约市最高建筑之一顶部的戏剧性全身动作场景,展示女孩在强有力的半空中跳跃,她从一座摩天大楼的屋顶起跳,跃向附近的另一座屋顶,以具有强烈深度和高度感的动感侧前方角度捕捉,她的身体悬浮在运动中,一只手从边缘推开,一条腿弯曲,另一条腿在飞越间隙时伸展,她的姿势充满运动感、敏捷且完美平衡,她的脸部展现出强烈的专注、肾上腺素、无畏的自信和锐利的决心,眼神聚焦,眉毛微皱,双唇微张,她的皮肤明亮、白皙、瓷白色、乳白色,具有超光滑干净的质地和完美的脸部到身体肤色一致性,她的发型设计为干练的随风飘动的精灵短发或层次感短发,发丝在跳跃中自然飞扬,服装设计为高级城市跑酷街头风格,包括黑色太阳镜、一件宽松的灰色半袖图案T恤、一件随动作飘动的深色无袖工装马甲、带有织带细节的黑色工装慢跑裤、一款黑色智能手表、极简腕饰和时尚的高性能白色运动鞋,背景以壮观的纽约天际线为特色,包含高耸的摩天大楼、屋顶边缘、遥远的高楼大厦、大气雾霾、发光的窗户和史诗般的危险高度感,两座建筑之间的跳跃间隙清晰可见,以增强刺激感,灯光具有强烈的电影感,富有戏剧性的橙金色落日余晖与冷蓝色的城市阴影交织,轮廓光勾勒出她的身体,屋顶上有柔和的光线反射,背景边缘有细微的运动模糊,以及丰富的动作对比度,超丰富的调色,带有温暖的琥珀色高光、深炭灰色的阴影、金属感的城市色调和高级大片风格的深度感,使用电影动作镜头拍摄,HDR光照,全局照明,照片级渲染,杰作质量,超详细纹理,8K制作细节。负面提示词:解剖结构不良、多余肢体、姿势扭曲、跳跃动作无力、面部模糊、平淡的光照、暗淡的色彩、卡通、动漫、CGI外观、文字、水印、标志、低质量。