标签: 大模型

  • aisuite:吴恩达开源的统一大模型调用库,一行代码切换 10+ 厂商

    aisuite:吴恩达开源的统一大模型调用库,一行代码切换 10+ 厂商

    aisuite 项目封面

    做 AI 应用的同学大概率都踩过同一个坑:今天想用 GPT-4o,明天想换 Claude,后天又想试试 Gemini,每换一家就得重写一整套 SDK 调用、参数映射、错误处理。吴恩达(Andrew Ng)团队开源的 aisuite,就是把这件事彻底变简单的那把钥匙——一套统一接口,调遍十余家大模型。

    项目简介

    aisuite 是一个轻量级 Python 库,提供两层能力:底层是跨厂商统一的 Chat Completions API,上层是带工具与 MCP 的 Agents API。它同时是桌面 AI 同事 OpenWorker 的底层基座。一句话概括:用一套 OpenAI 风格的接口,调用 OpenAI、Anthropic、Google 等所有主流大模型。

    安装要求和过程

    环境要求

    • Python 3.10 及以上
    • pip 包管理器
    • 对应厂商的 API Key(或本地运行 Ollama 免 Key)

    快速安装

    基础包(不含任何厂商 SDK):

    pip install aisuite

    按需安装指定厂商 SDK,或一次性装全:

    pip install 'aisuite[anthropic]'   # 仅 Anthropic SDK
    pip install 'aisuite[all]'         # 所有厂商 SDK

    配置 API Key(以环境变量为例):

    export OPENAI_API_KEY=sk-...
    export ANTHROPIC_API_KEY=sk-...

    一行调用示例——切换模型只改字符串:

    import aisuite as ai
    client = ai.Client()
    
    models = ["openai:gpt-4o", "anthropic:claude-3-5-sonnet-20240620"]
    messages = [
        {"role": "system", "content": "用海盗英语回答。"},
        {"role": "user", "content": "讲个笑话。"},
    ]
    for model in models:
        resp = client.chat.completions.create(
            model=model, messages=messages, temperature=0.75)
        print(resp.choices[0].message.content)

    核心功能

    aisuite 核心能力

    1. 统一 Chat Completions API:provider-agnostic 的 OpenAI 风格接口,模型名采用 <provider>:<model-name> 格式,aisuite 自动路由到正确的厂商与参数,切换模型只需改一个字符串。
    2. Agents API + Toolkits:把普通 Python 函数直接当工具,自动生成 schema、执行调用并回传结果;内置 files / git / shell 沙箱工具包;提供工具策略(审批、黑白名单)与状态持久化(内存 / 文件 / Postgres)。
    3. 原生 MCP 支持pip install 'aisuite[mcp]' 后,任意 MCP Server 的工具都能直接交给模型,无需胶水代码。
    4. 流式与异步stream=True 跨厂商统一分块输出,acreate 提供异步变体,工具调用同样可流式处理。
    5. 可扩展 Provider 适配器:按命名约定实现 <provider>_provider.py + <Provider>Provider 类即可被自动发现加载,轻松接入新厂商。

    支持的模型厂商

    aisuite 支持的模型厂商

    典型使用场景

    1. 多模型横向对比 / A/B 评测:同一段业务逻辑只改 model 字符串,就能对比 GPT-4o、Claude、Gemini 的输出质量与成本,非常适合做模型选型与回归测试。
    2. 本地优先 + 多云的 Agent 应用:aisuite 是 OpenWorker 的基座,可接入 Ollama 完全本地运行(数据不出本机),也能在云端多厂商间灵活切换,兼顾合规与弹性。
    3. 快速挂载 MCP 工具做文件 / 代码操作:一行声明 filesystem MCP,即可让模型列举目录、读写文件、执行 git 命令,省去繁琐的适配代码。

    推荐理由

    我个人非常看重 aisuite 解决的一个真实痛点:厂商锁定。在真实项目里,模型能力此消彼长,今天这家强、明天那家反超,aisuite 让你把”换模型”从”改一堆 SDK 代码”降级成”改一个字符串”,产品的可移植性直接拉满。

    它不只是简单的接口封装:Agents API 把工具调用、MCP、工具策略、状态持久化收敛到一套统一范式里,意味着你写一次 Agent,就能在多家模型间稳健落地;底层还能私有化(Ollama)满足数据合规需求。MIT 协议商用友好,对创业团队和个人开发者都很友好,强烈建议作为 AI 应用的默认底座。

    下载地址

    项目数据:★16.1K · 1.7K Fork · Python · MIT · 创建于 2024-06,最近更新 2026-07。

  • DwarfStar (ds4):antirez 打造的 DeepSeek V4 原生本地推理引擎

    DwarfStar (ds4):antirez 打造的 DeepSeek V4 原生本地推理引擎

    DwarfStar ds4

    📌 项目简介

    DwarfStar(简称 ds4)是 Redis 作者 antirez(Salvatore Sanfilippo)开源的一个原生本地推理引擎,专门为 DeepSeek V4 Flash / PROGLM 5.2 这类开源权重打造。它不追求做成通用 GGUF 运行器,而是把模型加载、分词、工具调用、KV 缓存、HTTP 服务乃至内置编码智能体垂直打通、一起调优;整个引擎用纯 C 编写、单文件二进制、零外部运行时依赖,在 Metal / CUDA / ROCm 三大后端上都能跑。

    DwarfStar 项目速览

    ⚙️ 安装要求和过程

    环境要求

    • 硬件后端:Apple Silicon(Metal,96 GB 以上内存最佳,小内存可走 SSD 流式加载);NVIDIA CUDA 显卡(含 DGX Spark / GB10 多卡);AMD ROCm(Strix Halo,如 Framework Desktop)。
    • 工具链:C 编译器(clang / gcc);CUDA 需 nvcc,ROCm 需 hipcc。仅依赖系统工具链,无外部运行时依赖
    • 模型权重:需单独从 Hugging Face(antirez/deepseek-v4-gguf)下载对应的 GGUF 文件,引擎不内置权重。

    快速安装

    # 克隆仓库
    git clone https://github.com/antirez/ds4
    cd ds4
    
    # macOS(默认 Metal 后端)
    make
    
    # NVIDIA CUDA:DGX Spark / GB10
    make cuda-spark
    # 或通用本地 CUDA 构建
    make cuda CUDA_ARCH=native
    
    # AMD ROCm(Strix Halo / Framework Desktop,gfx1151)
    make rocm
    
    # CPU 参考 / 调试路径(非生产用途)
    make cpu

    下载模型权重

    # 下载一个主模型(推荐 imatrix 版)
    ./download_model.sh ds4f-q2          # 96 / 128 GB 内存机器
    ./download_model.sh ds4f-q2-q4       # 末 6 层专家用 q4
    ./download_model.sh ds4f-q4          # ≥ 256 GB 内存
    ./download_model.sh ds4f-mxfp4       # 原生 MXFP4 专家,约 156 GB
    ./download_model.sh pro-q2-imatrix   # 512 GB 内存,PRO q2 imatrix 量化

    运行

    # 单条提示
    ./ds4 -p "用一段话解释 Redis Stream。"
    
    # 进入多轮交互式对话
    ./ds4
    ds4> /help
    
    # 启动 OpenAI / Anthropic 兼容的本地服务
    ./ds4-server --ctx 100000 --kv-disk-dir /tmp/ds4-kv --kv-disk-space-mb 8192

    ✨ 核心功能

    DwarfStar 核心能力

    1. 贴近模型的「专用」引擎:不为通用 GGUF 设计,模型加载 / 分词 / 工具调用 / KV 缓存 / HTTP 服务 / 编码智能体垂直打通,针对少数量身优化的开源权重做专项调优。
    2. 三大后端原生加速:Metal(主战场,Mac 96 GB+)、NVIDIA CUDA(含多卡 / DGX Spark)、ROCm(Strix Halo);内存不足的机器还能用 SSD 流式加载权重。
    3. 分布式推理:管道并行把多台机器的内存叠加起来跑更大的模型;基于 RDMA 的张量并行甚至能让两台 128 GB MacBook 合力运行 4-bit 的 DeepSeek Flash 或 GLM 5.2。
    4. 内置原生编码智能体:推理由智能体内部直接驱动、没有 socket / API 边界,会话本身就是磁盘上的 KV 缓存;工具调用走原生 LLM 格式,延迟极低、KV 永不错位,还能用 /save /switch 续上历史会话。
    5. OpenAI / Anthropic 兼容服务ds4-server 提供 /v1/chat/completions/v1/responses 等端点,支持多会话批处理与磁盘 KV 缓存,可完全私有化部署。

    DwarfStar 性能实测

    实测参考(q2 量化,意大利语长文本输入):MacBook Pro M5 Max(128 GB,Metal)在 2K 上下文下预填约 790 t/s、生成约 39 t/s;DGX Spark GB10 预填可达 826 t/s。128 GB 内存即可流畅跑 DeepSeek V4 Flash。

    🎯 典型使用场景

    DwarfStar 适用场景

    1. 个人高端 Mac / 工作站本地跑强模型:MacBook M5 Max、Mac Studio M3 Ultra、DGX Spark、Framework Desktop 用户,无需联网、隐私不出本机即可使用 DeepSeek V4 级别的大模型。
    2. 把闲置旧 CUDA 卡变成多用户服务器:借助 CUDA 多卡与 ds4-server 的微批处理,把不再被 vLLM 支持的旧 Ada 架构显卡(如 8×L40S)改造成公司内部的多用户 LLM 服务。
    3. 企业内网私有化部署:用 OpenAI 兼容端点 + 磁盘 KV 缓存,配合工具调用承载客服、知识库问答、本地编码助手等智能体,数据全程不出内网。

    💡 推荐理由

    作为 Redis 作者的最新作品,ds4 最打动我的是它的「克制与专注」:它坦然承认自己不是万能的通用推理器,而是把一件事做到极致——让 DeepSeek V4 这类前沿开源权重在消费级 / 工作站级硬件上跑得又快又稳。对一个 C 写的单文件引擎来说,开箱即用的交互式 CLI、兼容 OpenAI 的服务端、甚至原生编码智能体全部到位,体验相当完整。

    特别加分的是项目的坦诚:antirez 在 README 里明确做了「AI 全程披露」,说明代码大量借助 GPT / Claude 完成、但由人类把握方向与测试,同时也郑重致谢 llama.cpp 与 GGML——这种开源精神值得点赞。需要提醒的是,项目目前仍处快速迭代的 beta 阶段、文档也在持续补全,适合愿意折腾、想把手里高端硬件榨干的朋友尝鲜。

    🔗 下载地址

  • AirLLM:单张 4GB 显卡跑起 70B 大模型,无需量化不损精度

    AirLLM:单张 4GB 显卡跑起 70B 大模型,无需量化不损精度

    如果你手头只有一张 4GB 显存的消费级显卡(比如 RTX 3050 / 4060),却想本地跑 70B 级别的大模型,AirLLM 是目前最省心的解法之一。它不靠量化、蒸馏或剪枝来”阉割”模型,而是用逐层加载的巧思,把推理所需的显存从”整个模型”压到”单层”,让穷人也能在本地玩转大模型。

    📌 项目简介

    AirLLM 是一个低显存大模型推理框架。它核心思路是一次只在 GPU 上保留一层权重,配合稀疏 MoE 的专家流式加载,使显存占用取决于”单层大小”而非”模型总大小”。因此在原生精度、零精度损失的前提下,单张 4GB 显卡就能跑 70B 模型,8GB 跑 405B,约 12GB 跑 DeepSeek-V3(671B)。

    🛠 安装要求和过程

    环境要求

    • Python 3.8+ 与 PyTorch(CUDA 可用 GPU,或 MacOS Apple Silicon 上的 MLX)
    • HuggingFace transformers 等依赖(仓库 requirements.txt 已列)
    • 需能联网拉取 HuggingFace 模型权重

    快速安装

    pip install airllm

    如需开启模型压缩加速(必须 airllm 2.0.0+):

    pip install -U bitsandbytes
    pip install -U airllm

    ⚡ 核心功能

    1. 极低显存推理:70B≈4GB、405B≈8GB、DeepSeek-V3 671B≈12GB、Kimi K3 2.8T 低于 4GB。
    2. 无量化/蒸馏/剪枝:原生精度运行,彻底告别量化带来的精度焦虑。
    3. 模型压缩加速:基于分块量化的 4bit/8bit 压缩,最高约 3× 推理加速,精度损失可忽略。
    4. AutoModel 统一接口:一行 from_pretrained 切换 Llama / Qwen / DeepSeek / Mistral / Phi / Gemma / ChatGLM 等。
    5. 多平台 + 预取:支持 Linux 与 MacOS(Apple silicon);加载与计算重叠预取提速;稀疏 MoE 专家流式加载。
    AirLLM 模型压缩 3x 推理加速
    AirLLM 基于分块量化的 4bit/8bit 压缩可带来最高约 3× 推理加速,精度损失可忽略

    🎯 典型使用场景

    • 个人本地推理:开发者用 4–8GB 显卡在本地跑 70B/405B 模型做聊天、RAG、Agent,无需租用云 GPU。
    • 低成本大模型服务:在显存受限的边缘/低成本服务器上部署 DeepSeek-V3(671B)这类超大模型对外提供能力。
    • 教学与演示:在普通笔记本上现场演示大模型推理流程,无需昂贵的 A100/H100,课堂与 workshop 友好。

    💡 推荐理由(个人使用心得)

    AirLLM 真正把”穷人也能玩大模型”变成了现实——4GB 显卡就能跑 70B,门槛低到惊人。相比各种量化方案,它保留全精度输出,结果更可靠、更可复现;而且 AutoModel 接口与 HuggingFace transformers 几乎一致,迁移成本几乎为零。两点提醒:一是逐层加载牺牲了速度,更偏 demo / 研究,不适合高并发生产;二是需要能拉取 HF 权重,且开启压缩加速要额外装 bitsandbytes。整体而言,是入门本地大模型的极佳首选。

    🔗 下载地址

  • colibri:用纯 C 把 744B~2.8T MoE 大模型跑到本地

    colibri:用纯 C 把 744B~2.8T MoE 大模型跑到本地

    colibri 是近期 GitHub 上热度最高的本地推理引擎之一:只用纯 C 编写、零运行时依赖,就能把 744B 到 2.8T 参数的 MoE(混合专家)大模型跑在你现有的硬件上。它不是把模型硬塞进显存,而是把 VRAM、RAM 和 NVMe 当作同一层级来管理,按需从磁盘流式加载专家权重。项目上线一个月已收获 21.9K Stars,并支持 GLM-5.2、Inkling、Kimi K3、OLMoE 四大模型家族。

    本期我们就来拆解:colibri 是怎么让“本地运行千亿 MoE”这件事从神话变成可复现实验的。

    项目简介

    colibri 是一个面向前沿 MoE 模型的本地推理引擎。它用“存储即内存层级”的思路替代传统的“模型必须全进显存”假设:密集注意力层常驻 RAM,19456 个路由专家放在磁盘,只有在路由器真正需要时才被预取到 RAM/VRAM。这样一台只有 25 GB 内存的常规电脑也能把 744B 的 GLM-5.2 跑起来,而高端工作站则可以把全部专家驻留 GPU,达到接近数据中心的吞吐。

    配图速览

    colibri 核心速览
    colibri 核心数据一览
    三层存储层级
    colibri 把专家权重分布在 VRAM / RAM / NVMe 三个层级,速度随硬件变化,语义保持不变。

    安装要求和过程

    环境要求

    • 操作系统:Linux、macOS、Windows 11
    • 内存:最低 25 GB RAM(仅 CPU 流式);推荐 128 GB 或更高,配合多 GPU 可获得更好体验
    • 磁盘:GLM-5.2 int4 容器约 372 GB;Kimi K3 原始检查点约 1.6 TB
    • 软件:Python 3(仅用于 launcher 和转换脚本);编译源码需要 gcc/clang + OpenMP
    • GPU(可选):CUDA、Metal(Apple Silicon)、Vulkan 1.2(含 AMD RADV)后端均可选

    快速安装

    1. 下载对应平台的预编译 release 并解压:
    mkdir colibri && tar xzf colibri-v1.1.0-linux-x86_64.tar.gz -C colibri && cd colibri
    python3 coli info
    1. 或从源码构建:
    git clone https://github.com/JustVugg/colibri && cd colibri/c
    ./setup.sh
    1. 下载 GLM-5.2 int4 gs64 容器(推荐带 int8 MTP 头的版本):
    # 推荐从 Hugging Face 拉取 mastouri/GLM-5.2-colibri-int4-g64-with-int8-mtp
    # 约 372 GB,放 NVMe 上最佳
    1. 运行交互式聊天、API 服务或 Web 面板:
    COLI_MODEL=/nvme/glm52_i4 ./coli chat
    COLI_MODEL=/nvme/glm52_i4 ./coli serve    # OpenAI-compatible API
    ./coli web --model /nvme/glm52_i4          # API + 可视化 dashboard

    核心功能

    1. 存储即内存层级
      把 VRAM、RAM、NVMe 统一成专家权重的放置策略。缺显存不会悄悄改模型精度或路由语义,只会影响速度。
    2. 按需流式加载专家
      MoE 每层只激活少量专家。colibri 让 19456 个专家中的绝大部分常驻磁盘,通过 per-layer LRU、学习到的热专家 pinned set 和一层提前预取(PILOT)减少磁盘等待。
    3. 纯 C 零依赖引擎
      每个模型对应一个 C 文件(如 c/glm.c),无 BLAS、无运行时 Python、无 GPU 也能跑。
    4. 多后端异构执行
      支持 CPU、CUDA、Metal、Vulkan 四种后端,可组合使用;双 SSD 镜像可把只读专家读取带宽翻倍。
    5. 学习缓存与压缩状态
      引擎记录你的工作负载路由历史(.coli_usage),越用越快;MLA KV 状态压缩到原来的 1/57,并能持久化对话上下文。

    典型使用场景

    场景一:个人开发者跑前沿模型做实验

    你只有一台 64 GB RAM + 1 TB NVMe 的台式机。传统 vLLM/llama.cpp 会把 744B 模型拒之门外;colibri 让你用 COLI_MODEL=/nvme/glm52_i4 ./coli chat 直接对话,虽然 token/s 不高,但足以做提示工程、长文本探索和小批量评估。

    场景二:工作室搭建本地私有 API

    在多卡工作站(如 6× RTX 5090)上,把专家全部驻留 GPU,colibri 可提供 5.8–6.8 tok/s 的解码速度和 1.6 s 的 TTFT。通过 coli serve 提供 OpenAI-compatible API,内部团队就能在不联网的情况下调用千亿模型。

    场景三:MoE 推理系统研究

    colibri 把放置策略、调度、I/O、CPU/GPU 重叠都做成可测量的实验参数。研究者可以替换缓存策略、测试双 SSD 镜像、评估 int4/int8/MXFP4 格式对质量的影响,并把结果以 issue 形式回馈社区。

    推荐理由

    colibri 最打动我的不是“跑 744B 模型”这个噱头,而是它把“本地推理”重新定义为系统优化问题:不盲目堆硬件,而是认真测量每一个瓶颈——磁盘带宽、专家命中率、KV 压缩、CPU/GPU 重叠、量化质量——并用可复现的 A/B 来做决策。README 里反复出现的不是营销数字,而是“这个功能在哪台机器上、用什么 commit、跑什么 prompt 测出来的”。

    对于国内用户,它还有一个隐性好处:GLM-5.2、Kimi K3、Qwen3 MoE(roadmap)等模型天然和中国模型生态更近,未来可以更低成本地跑开源中文大模型。

    当然,它现在还是研究导向的项目:没有 SLA 保证速度,配置参数很多,对磁盘和内存仍有一定要求。但如果你既想摸到前沿模型,又不想把数据送出去,colibri 是 2026 年最值得关注的本地推理引擎之一。

    下载地址

  • TensorRT LLM:NVIDIA 开源的高性能大模型推理引擎,14.2K Star

    TensorRT LLM:NVIDIA 开源的高性能大模型推理引擎,14.2K Star

    项目简介

    TensorRT LLM 是 NVIDIA 开源的高性能大语言模型(LLM)与视觉生成模型推理优化库。它在 NVIDIA GPU 上提供最先进的定制内核、运行时优化和 Python 化高层 API,能把主流开源/自研大模型的推理延迟压到更低、吞吐拉到更高——从单张 RTX 显卡到多机 NVL72 集群都能统一部署。

    TensorRT LLM

    安装要求和过程

    环境要求

    • GPU:NVIDIA GPU(推荐 Ampere / Ada / Hopper / Blackwell 架构)
    • CUDA:CUDA 13.2.1(以 README 当前 badge 为准)
    • Python:3.10 或 3.12
    • PyTorch:2.11.0
    • 系统:Linux(主要支持)、Windows、WSL2

    快速安装

    # 推荐通过 pip 安装最新 release
    pip install tensorrt_llm
    
    # 或使用预编译容器(避免环境踩坑)
    docker pull nvcr.io/nvidia/tritonserver:26.05-trtllm-python-py3
    
    # 验证安装
    trtllm-serve --help

    更复杂的源码编译或多节点部署可参考官方安装指南:Installation Guide

    核心功能

    TensorRT LLM 架构分层

    • PyTorch 原生架构:模型定义直接写 PyTorch,调试、扩展、自定义注意力/量化都更直观。
    • 高层 LLM API:一行代码从 Hugging Face 加载模型,自动编译 TensorRT engine,支持单卡、张量并行、流水线并行、专家并行。
    • State-of-the-Art 内核:针对 Attention、GEMM、MoE 等常见算子手写 CUDA kernel,充分发挥 Tensor Core 算力。
    • 丰富的高级特性:FP8/FP4/INT4 AWQ 量化、KV Cache 复用、投机解码、Prefix Caching、CUDA Graphs、Prefill-Decode 解耦等。
    • 生产级部署生态:原生兼容 NVIDIA Dynamo、Triton Inference Server,也能作为 vLLM、SGLang 等框架的后端。

    典型使用场景

    TensorRT LLM 核心优化技术

    1. 高并发在线服务

    在 H100/H200/B200 集群上部署 Llama、DeepSeek、Qwen 等模型,配合 Tensor Parallelism 和 Disaggregated Serving,把单用户延迟压到百毫秒级,同时保持数千 token/s 的聚合吞吐。

    2. 本地化推理与边缘部署

    通过 INT4/FP4 量化和 Weight-Stripped Engines,在单张 RTX 4090 或 Jetson AGX Orin 上运行 70B 级别模型,满足私有化、低功耗场景需求。

    3. Agent 与长上下文应用

    利用 Prefix Caching 和 chunked context,在多轮工具调用、RAG、代码补全等长上下文场景中显著降低首 token 时延。

    推荐理由

    TensorRT LLM 是 NVIDIA 在大模型推理领域的“官方解法”。它不是简单的封装,而是从 kernel、runtime 到 serving 的垂直优化。2025 年 3 月后项目已完全开源并迁到 GitHub 维护,社区活跃、文档详尽,对追求极致吞吐和成本控制的生产环境尤其友好。虽然硬件门槛是 NVIDIA GPU,但如果你已经在 CUDA 生态里,它基本是目前能把模型跑得最快、最省显存的工具之一。

    下载地址

  • Kronos:首个金融K线开源基础模型,45+交易所数据预训练,33.5K Stars(AAAI 2026)

    Kronos:首个金融K线开源基础模型,45+交易所数据预训练,33.5K Stars(AAAI 2026)

    Kronos 两阶段框架总览

    项目简介

    Kronos首个面向金融 K 线(蜡烛图)的开源基础模型——由清华大学团队开源,在全球 45+ 家交易所的行情数据上预训练,把 OHLCV 序列当作”金融市场的语言”来建模,一个模型通吃价格预测、波动率估计等多种量化任务。论文已被 AAAI 2026 录用,GitHub 上已收获 33,000+ Stars,是今日 GitHub Trending 上最亮眼的 AI × 金融项目。

    与通用时间序列基础模型(TSFM)不同,Kronos 专门针对金融数据高噪声、多维联动的特性设计了两阶段框架:

    1. 分层离散化 Tokenizer:把连续的多维 K 线数据(开高低收 + 量额)量化为分层离散 token;
    2. 自回归 Transformer:decoder-only 架构在海量 token 序列上预训练,像 GPT “续写文本”一样”续写行情”。

    安装要求和过程

    环境要求

    • Python 3.10+
    • PyTorch(GPU 可选,CPU 也能跑小模型推理)
    • 微调需要 NVIDIA GPU(支持 torchrun 多卡)+ 可选 Qlib 数据环境

    快速安装

    # 1. 克隆仓库
    git clone https://github.com/shiyu-coder/Kronos.git
    cd Kronos
    
    # 2. 安装依赖
    pip install -r requirements.txt

    三行代码开始预测

    from model import Kronos, KronosTokenizer, KronosPredictor
    
    # 从 Hugging Face Hub 加载预训练模型
    tokenizer = KronosTokenizer.from_pretrained("NeoQuasar/Kronos-Tokenizer-base")
    model = Kronos.from_pretrained("NeoQuasar/Kronos-small")
    predictor = KronosPredictor(model, tokenizer, max_context=512)
    
    # df 为含 open/high/low/close(/volume/amount) 的 DataFrame
    pred_df = predictor.predict(df=x_df, x_timestamp=x_timestamp,
                                y_timestamp=y_timestamp, pred_len=120,
                                T=1.0, top_p=0.9, sample_count=1)

    KronosPredictor 封装了数据预处理、归一化、预测与反归一化全流程,返回未来 OHLCV 的完整 DataFrame;还提供 predict_batch 批量并行预测多个标的。

    Kronos 预测结果与真实行情对比

    核心功能

    • 金融专用基础模型家族:开源 Kronos-mini(4.1M 参数、2048 上下文)、Kronos-small(24.7M)、Kronos-base(102.3M)三档模型,全部可在 Hugging Face(NeoQuasar)直接下载,按算力自由选择;
    • 两阶段”金融语言”建模:分层离散化 Tokenizer 把高噪声 OHLCV 压成 token,自回归 Transformer 统一建模,一个模型服务多种量化任务;
    • 概率化采样预测:支持温度 T、top-p 核采样、sample_count 多路径平均,不只给单点预测,还能刻画行情的不确定性;
    • 完整微调管线:官方提供基于 Qlib 的 A 股微调全流程脚本——数据预处理 → Tokenizer 微调 → Predictor 微调(torchrun 多卡)→ Top-K 策略回测,一条龙跑通;
    • 在线 Live Demo:官方部署了 BTC/USDT 未来 24 小时预测的可视化演示页,无需安装即可直观感受模型效果。

    A股微调后回测累计收益曲线示例

    典型使用场景

    1. 量化研究信号生成:把 Kronos 的预测价格变动作为原始 alpha 信号,接入组合优化与风险中性化流程,用于选股/择时研究——官方 A 股示例展示了从 Qlib 数据到 Top-K 策略回测的完整路径;
    2. 加密货币/外汇短线预测:对 BTC/USDT 等 7×24 交易品种做未来数小时至一天的 K 线走势与波动区间预测(官方 Live Demo 场景),辅助仓位与风控决策;
    3. 自有市场数据微调:券商、私募或个人研究者用自己的分钟线/日线数据微调 Tokenizer + Predictor,让基础模型适配特定市场微观结构,替代从零训练的高昂成本。

    推荐理由

    时间序列基础模型不少,但真正”懂金融”的开源模型 Kronos 是第一个。我实际体验下来有三点印象很深:

    一是门槛低得惊人——pip install -r requirements.txt 加几行 Python 就能跑通预测,KronosPredictor 把归一化、截断、反归一化这些脏活全包了,量化新手也能十分钟上手;二是学术与工程兼备——AAAI 2026 论文背书、45+ 交易所数据预训练,同时给足了 torchrun 多卡微调和 Qlib 回测的工程脚本,不是只发权重不管落地的”论文模型”;三是诚实——README 明确提醒示例回测只是演示,生产级策略还需要组合优化、风险因子中性化、交易成本建模,这种不吹牛的态度在 AI × 金融领域难能可贵。

    需要注意:模型输出是概率性预测而非投资建议,直接拿裸信号实盘风险很高;Kronos-large(499M)暂未开源,开源版本上下文长度上限 512(mini 为 2048)。适合量化研究者、金融工程学生和对”AI 预测行情”认真感兴趣的开发者。

    下载地址

    许可证:MIT | 语言:Python | Stars:33.5K+ | 数据截至 2026-07-25

  • Outlines:15K Star 的 LLM 结构化输出库,让大模型 100% 生成合法 JSON

    Outlines:15K Star 的 LLM 结构化输出库,让大模型 100% 生成合法 JSON

    Outlines - LLM 结构化输出库

    项目简介

    Outlines 是由 .txt(dottxt)团队开源的 LLM 结构化输出(Structured Outputs)库——它在生成阶段就保证大模型输出严格符合你指定的类型或结构(枚举、整数、Pydantic 模型、JSON Schema、正则、上下文无关文法),从根源上消灭”解析失败、JSON 残缺”问题。项目在 GitHub 上已收获 15,200+ Stars,被 NVIDIA、Cohere、HuggingFace、vLLM 等信任并采用,vLLM 的 Structured Output 后端正是基于它的 outlines-core。

    一句话:别再用正则和 try/except 去”修补”模型输出了——Outlines 让模型从一开始就只能生成合法结构:model(prompt, output_type)

    安装要求和过程

    环境要求

    • Python 3.9+(建议 3.10 以上)
    • 按需选择后端:本地推理需 transformers / llama.cpp(配相应硬件),或走 vLLM / Ollama 服务端,或直接用 OpenAI / Gemini API(无本地算力要求)
    • 操作系统不限,CPU 也能跑(配合 API 或 Ollama)

    快速安装

    pip install outlines

    # 基础安装
    pip install outlines
    
    # 按后端安装可选依赖(示例)
    pip install outlines[transformers]   # 本地 transformers 模型
    pip install outlines[vllm]           # vLLM 服务
    pip install outlines[openai]         # OpenAI API

    30 秒上手

    import outlines
    from typing import Literal
    from transformers import AutoTokenizer, AutoModelForCausalLM
    
    MODEL = "microsoft/Phi-3-mini-4k-instruct"
    model = outlines.from_transformers(
        AutoModelForCausalLM.from_pretrained(MODEL, device_map="auto"),
        AutoTokenizer.from_pretrained(MODEL),
    )
    
    # 情感分类:输出只可能是这三个值之一
    sentiment = model(
        "Analyze: 'This product completely changed my life!'",
        Literal["Positive", "Negative", "Neutral"],
    )
    print(sentiment)  # "Positive"
    
    # 提取数值:保证返回合法 int
    temperature = model("What's the boiling point of water in Celsius?", int)
    print(temperature)  # 100

    核心功能

    Outlines 使用哲学:指定类型即可

    1. 类型即约束,贴合 Python 类型系统Literal 做多选一、int/float 做数值、Pydantic 模型/JSON Schema 做复杂对象、正则约束字符串格式、CFG 文法约束复杂语法——一行 model(prompt, type) 全部搞定。
    2. 生成期保证合法,而非事后修补:基于约束解码(constrained decoding),在每个 token 采样时就屏蔽非法选项,输出 100% 可被 model_validate_json 解析,不存在破损 JSON。
    3. 一套代码横跨所有模型:统一接口支持 transformers、llama.cpp(本地),vLLM、Ollama(服务端),OpenAI、Gemini(API),换模型/换供应商不改业务代码。
    4. 函数签名即 Schema 的 Function Calling:把 Python 函数直接当输出类型传入,Outlines 自动从签名推断结构,返回可直接 **kwargs 调用的参数字典。
    5. Jinja 提示词模板与可复用应用outlines.Template 把复杂 Prompt 从代码中分离,支持 few-shot 模板文件复用,方便工程化管理。

    典型使用场景

    1. 客服工单自动分诊

    把自由格式的用户来信一步解析为结构化工单(优先级枚举 / 类别 / 是否需主管介入 / 行动项列表),直接驱动自动路由与升级告警——priority 字段只可能是 low/medium/high/urgent 四个合法值,下游逻辑零防御代码。

    2. 电商商品自动归类与信息抽取

    批量把商品描述转成 主类目/子类目/属性列表/品牌 结构化数据,喂给库存和搜索系统;同理可做文档分类(财报/合同/技术文档)、事件信息抽取,甚至用 Union 类型优雅处理”信息不足则返回 I don’t know”的兜底。

    3. 生产级 Agent / RAG 管道的可靠胶水层

    Agent 的工具调用参数、RAG 的引用格式、多步工作流的中间态,全部用 Pydantic 模型锁死结构。vLLM 等推理引擎已内置其核心库,本地部署大模型时开启结构化输出几乎零成本。

    推荐理由

    使用 Outlines 的公司

    • 解决的是 LLM 工程化第一痛点:任何把 LLM 输出接入程序的人都被破损 JSON 折磨过。Outlines 的思路是”让非法输出根本不可能被生成”,比重试+修复的方案优雅一个量级。
    • 学习成本极低:会写 Python 类型注解就会用,10 分钟能跑通第一个例子;README 附 6 个可直接抄的生产级示例。
    • 学术与工业双背书:源自论文《Efficient Guided Generation for Large Language Models》,NVIDIA、HuggingFace、vLLM、Cohere 都在用,不是玩具项目。
    • Apache-2.0 宽松许可:商用无忧;核心 outlines-core 用 Rust 重写,约束编译速度快,生产可用。
    • 实测感受:约束解码对本地小模型提升尤其明显——Phi-3 这类 3B 级模型配合 Outlines 做分类/抽取,可靠性直逼裸用大一个数量级的模型,非常适合降本场景。

    下载地址


    项目信息(截至 2026-07-23):15,256 Stars · 809 Forks · Python · Apache-2.0 许可 · 由 .txt(dottxt-ai)团队维护

  • llmfit:一条命令,算出哪些大模型能在你的电脑上跑起来

    llmfit:一条命令,算出哪些大模型能在你的电脑上跑起来

    llmfit TUI 演示

    想在本地跑大模型,却总被「这张显卡能不能带得动?」「选哪个量化档位?」劝退?llmfit 把这道难题变成了一条命令:它自动检测你的内存、CPU、GPU,再为目录里数百个模型和提供商打分,直接告诉你哪些模型能在你的机器上流畅跑起来。下方动图就是它的交互式 TUI——硬件规格在顶部,下面是所有模型按「适配度」实时排名。

    📌 项目简介

    llmfit 是一款用 Rust 编写的终端工具,能根据系统的 RAM、CPU 与 GPU 自动「量体裁衣」地为 LLM 模型选型;它会检测硬件、对每一个模型从内存适配、速度估算、模型质量、上下文长度四个维度打分,并输出真正能在你机器上跑得动的推荐清单。默认提供交互式 TUI,也支持经典 CLI 模式,兼容多 GPU、MoE 架构、动态量化,以及 Ollama / llama.cpp / MLX / Docker Model Runner / LM Studio 等本地运行时。

    🛠 安装要求和过程

    环境要求:

    • 预编译二进制,无需安装 Node.js / Python 运行时,开箱即用;
    • 支持 Windows / macOS / Linux,跨平台一致;
    • 可选:本地运行时(Ollama、llama.cpp、MLX、Docker Model Runner、LM Studio)用于实测与部署;
    • 从源码构建需要 Rust 工具链(cargo)。

    快速安装(任选其一):

    # macOS / Linux(Homebrew 预编译二进制,推荐)
    brew install AlexsJones/llmfit/llmfit
    
    # Windows(Scoop)
    scoop install llmfit
    
    # 一行脚本安装(无 sudo 时落到 ~/.local/bin)
    curl -fsSL https://llmfit.axjns.dev/install.sh | sh
    
    # Python 生态(uv / pip)
    uv tool install -U llmfit      # 或 pip install llmfit
    
    # Docker / Podman(直接出 JSON 推荐)
    docker run ghcr.io/alexsjones/llmfit
    
    # 从源码构建
    git clone https://github.com/AlexsJones/llmfit.git && cd llmfit && cargo build --release
    

    跑起来:

    llmfit            # 进入交互式 TUI,看硬件 + 全模型排名
    llmfit fit        # 命令行表格:所有模型按适配度排名
    llmfit recommend --json   # 以 JSON 输出 Top 推荐(供脚本 / Agent 消费)
    llmfit info "qwen2.5:7b"  # 单个模型的适配分析与估算依据
    llmfit bench      # 对你的运行时实测 tok/s 与首字延迟
    llmfit doctor     # 输出硬件检测报告(用于反馈问题)
    

    ✨ 核心功能

    llmfit 工作流程

    1. 硬件自动检测 + 四维评分:读取 RAM / CPU / GPU·VRAM 与本地后端,对目录里数百个模型按「内存适配、速度估算、模型质量、上下文长度」四维打分,并公开每个分数的输入依据,llmfit info 可逐项核查。
    2. TUI 交互 + CLI 脚本化:默认 TUI 实时排名、规划、模拟下载并接入社区榜单;同时提供 fit / recommend --json / info 等子命令,方便被脚本、CI 与 AI Agent 调用。
    3. 多 GPU、MoE 与动态量化:支持多卡配置与 MoE 架构(按激活参数而非总量估算显存),并会根据你的硬件动态选择最优量化档位(如 Q4 / Q8)。
    4. 本地运行时全覆盖:原生对接 Ollama、llama.cpp、MLX、Docker Model Runner、LM Studio,推荐结果可直接落地运行。
    5. 实测众包(benchmark & share):在你机器上实测 tok/s,结果先存本地、再一键以 PR 贡献回社区,让同型号硬件的人拿到「已验证 ✓」的真实数字。

    🎯 典型使用场景

    llmfit 四大评分维度

    • 本地部署前选型:拿到一台新笔记本 / 显卡,先跑 llmfit 看 7B / 14B / 32B 甚至 70B 谁能在你的显存和内存里跑、大概多快,避免「下了 3 小时发现跑不起来」的尴尬。
    • 自动化流水线 / AI Agent:在部署脚本或 Coding Agent 里调用 llmfit recommend --json --use-case coding,根据当前主机规格自动挑选可运行的编码模型,做到「按机器适配」而非写死模型名。
    • 硬件升级决策:想加内存还是换显卡?用 llmfit info 对比不同配置下目标模型的适配与速度估算,量化升级带来的收益再下单。

    💡 推荐理由

    本地跑大模型最让人头大的就是「选型玄学」——参数规模、量化、上下文、显存、内存交织在一起,靠经验猜十次翻车八次。llmfit 把这件事变成了可解释、可验证的工程问题:它不只给结论,还把每个估算的输入摊开给你看,并鼓励你用真实 benchmark 反哺社区。Rust 编写的单文件二进制启动极快、零运行时依赖,TUI 好看、CLI 好接,是个人本地 AI 实验室和企业内网「该跑哪个模型」决策的贴心小助手。30K+ Star、MIT 协议、隐私默认(不联网不上传),值得收藏。

    🔗 下载地址

  • 阿里千问甩出 Qwen-Image-3.0:这次不拼好看,拼的是“像真的”

    阿里这两天把 Qwen-Image 系列推到了第三代。前两代分别强调”精准”,以及”精准、多样、完整、美观、真实”,到了 3.0,团队把核心词压成了一个字——”实”。说白了,前两代在想办法让图”好看”,这一代想让图”有用”。

    一张图里塞下一整版报纸

    最直观的变化是”内容量”。新模型能吃进最多 4.5k token 的指令,一口气画出报纸版面、分镜脚本、试卷这类信息密度极高的图。官方演示里有个 3×3 的网格,九宫格里每一格都是独立的科普插图——隧道安全漫画、空间几何课、细胞 DNA 对比……单是描述这张图就花掉 3.7k token,而它是一口气生成的,不是把九张小图拼起来。

    Qwen-Image-3.0 渲染的人像细节
    Qwen-Image-3.0 渲染的人像细节,皮肤质感接近照片级。

    这种”横向铺开”考验的是模型在同一张画布上并列多个概念、还互不干扰的能力;而”纵向钻深”考验的是层层嵌套——比如在一张图里从外到内叠出 VSCode 界面、Qwen Chat 窗口、微信对话,再到一张手冲咖啡海报。

    10 像素的小字也读得清

    光塞得多没用,还得细。Qwen-Image-3.0 能把 10px 的小字渲染得清清楚楚,毛孔、发丝这种微观细节也到位,皮肤质感接近照片。学术排版是终极压力测试,密集的 LaTeX 公式、上下标、希腊字母、定理编号,符号一个都不能错。它甚至能模拟高中生课堂笔记的红笔批注——下划线、波浪线、圈画,笔迹自然得有点真假难辨。

    会说 12 种语言,还懂真实世界

    第三块叫”深知识”:原生支持 12 种语言的文字渲染,能模仿网页、游戏、直播间的界面,背后是世界知识的支撑。它还能联网取最新信息——你让它画一张”杭州 7 月 21 日天气预报”,它能真的去查。更脑洞的是,它可以把齐白石和梵高拽进同一个直播间,一起给 Qwen-Image-3.0 打广告。


    从”能用”到”好用”,图像生成模型这三年走了很远。阿里的算盘很清楚:当模型能稳定产出报纸 PDF、短剧分镜、复杂 UI 这类高价值内容,它就不只是玩具,而是真正能进设计、教育、电商产线的生产力工具。

  • 前Google Brain研究员用AI智能体替非英伟达芯片写底层代码

    上个月,Jeremy Nixon 悄悄把一家公司推到了台前。这家叫 Infinity 的初创公司刚宣布拿到 1500 万美元融资,估值 1 亿美元,投资方里除了 Touring Capital、Principal VC,还有来自 OpenAI 和 Anthropic 的研究员个人。Nixon 本人是个有意思的人——他曾在 Google Brain 做研究,也是黑客社区 AGI House 的创始人。真正让外界注意到他的,是他抛出的一个有点狂的念头:AI 系统本身,能不能成为一种「元技术」,自己发明新东西。

    从「自动发明算法」到「自动写芯片代码」

    早在做 Infinity 之前,Nixon 就捣鼓过一个叫 Omega 的机器学习算法。它的特别之处在于,能自己创造出新的机器学习算法,然后在一个反馈回路里自动评估好坏。那次成功让他开始琢磨:这套思路能不能挪到别的地方?他盯上了硬件——自动化系统或许也能生成那些让芯片跑得更高效的底层代码,比如内核(kernel)这一类东西。

    英伟达的护城河,一半是软件

    这里得先说清楚一件事。很多人以为英伟达厉害是因为芯片性能好,这当然没错,但另一半答案藏在 CUDA 里。CUDA 是英伟达的软件层,让原本为图形设计的 GPU 能当通用处理器用,PyTorch、TensorFlow 都建在它上面。开发者用 Python 写应用,默认就跑在英伟达的卡上。问题是,绝大多数应用层公司既没资源也没本事自己写内核、把应用移植到别的芯片上。

    Nixon 想做的,是把 CUDA 这套「让芯片好用」的活儿交给一个 AI 智能体来干,而且不挑芯片——SRAM、GPU、手机芯片、Systolic Array 统统能适配。

    一个会自己改自己代码的智能体

    Infinity 的核心产品叫 Ignition,是个 AI 研究智能体。它的任务很硬核:为那些想挑战英伟达的芯片写 AI 推理所需的底层代码。它会测试、调试,测量硬件在这套代码下跑得快不快,不行就自动重写,直到性能提上去。整个系统是自优化的,会持续学习、自我改进,而且能适应不同的芯片架构,不管对方是不是闭源的。

    不收授权费,只抽性能提升的成

    这种打法听起来很「AI 原生」。Nixon 说,客户里已经包括 AI 芯片公司 D-Matrix——一家立志挑战英伟达的玩家,同时 Infinity 还在和其他大芯片厂、云厂商谈。更妙的是它的收费模式:不收前置授权费,而是从性能提升和成本节省里抽成,衡量的指标很直接,就是每秒令牌数(tokens per second)的变化。在一个案例里,这个智能体把原本可能要花几年或几个月的过程,压缩到了几小时或几天。

    • Infinity 不是第一家想拆英伟达墙角的公司,但它走的是「逐产品蚕食」的软件路线,而不是去造另一块卡。
    • 人类并没有被踢出局,而是给智能体定大方向,繁琐的体力活交给它。
    • 公司目前只有 26 个人,分布在设计、运营和工程岗。

    把视角拉远一点,Infinity 其实是这一波「AI 基础设施去中心化」浪潮里的一朵浪花。当训练和推理不再被绑死在某一家厂商的软件栈上,更多芯片公司才有机会把货卖出去。这条路能不能走通,取决于 Ignition 真能在不同架构上稳定逼近 CUDA 的水平——这是个需要时间验证的承诺,不是今天就能盖棺的事。

    Infinity 创始人 Jeremy Nixon
    Infinity 创始人 Jeremy Nixon(图源:TechCrunch)