标签: 本地大模型

  • llmfit:一条命令,算出哪些大模型能在你的电脑上跑起来

    llmfit:一条命令,算出哪些大模型能在你的电脑上跑起来

    llmfit TUI 演示

    想在本地跑大模型,却总被「这张显卡能不能带得动?」「选哪个量化档位?」劝退?llmfit 把这道难题变成了一条命令:它自动检测你的内存、CPU、GPU,再为目录里数百个模型和提供商打分,直接告诉你哪些模型能在你的机器上流畅跑起来。下方动图就是它的交互式 TUI——硬件规格在顶部,下面是所有模型按「适配度」实时排名。

    📌 项目简介

    llmfit 是一款用 Rust 编写的终端工具,能根据系统的 RAM、CPU 与 GPU 自动「量体裁衣」地为 LLM 模型选型;它会检测硬件、对每一个模型从内存适配、速度估算、模型质量、上下文长度四个维度打分,并输出真正能在你机器上跑得动的推荐清单。默认提供交互式 TUI,也支持经典 CLI 模式,兼容多 GPU、MoE 架构、动态量化,以及 Ollama / llama.cpp / MLX / Docker Model Runner / LM Studio 等本地运行时。

    🛠 安装要求和过程

    环境要求:

    • 预编译二进制,无需安装 Node.js / Python 运行时,开箱即用;
    • 支持 Windows / macOS / Linux,跨平台一致;
    • 可选:本地运行时(Ollama、llama.cpp、MLX、Docker Model Runner、LM Studio)用于实测与部署;
    • 从源码构建需要 Rust 工具链(cargo)。

    快速安装(任选其一):

    # macOS / Linux(Homebrew 预编译二进制,推荐)
    brew install AlexsJones/llmfit/llmfit
    
    # Windows(Scoop)
    scoop install llmfit
    
    # 一行脚本安装(无 sudo 时落到 ~/.local/bin)
    curl -fsSL https://llmfit.axjns.dev/install.sh | sh
    
    # Python 生态(uv / pip)
    uv tool install -U llmfit      # 或 pip install llmfit
    
    # Docker / Podman(直接出 JSON 推荐)
    docker run ghcr.io/alexsjones/llmfit
    
    # 从源码构建
    git clone https://github.com/AlexsJones/llmfit.git && cd llmfit && cargo build --release
    

    跑起来:

    llmfit            # 进入交互式 TUI,看硬件 + 全模型排名
    llmfit fit        # 命令行表格:所有模型按适配度排名
    llmfit recommend --json   # 以 JSON 输出 Top 推荐(供脚本 / Agent 消费)
    llmfit info "qwen2.5:7b"  # 单个模型的适配分析与估算依据
    llmfit bench      # 对你的运行时实测 tok/s 与首字延迟
    llmfit doctor     # 输出硬件检测报告(用于反馈问题)
    

    ✨ 核心功能

    llmfit 工作流程

    1. 硬件自动检测 + 四维评分:读取 RAM / CPU / GPU·VRAM 与本地后端,对目录里数百个模型按「内存适配、速度估算、模型质量、上下文长度」四维打分,并公开每个分数的输入依据,llmfit info 可逐项核查。
    2. TUI 交互 + CLI 脚本化:默认 TUI 实时排名、规划、模拟下载并接入社区榜单;同时提供 fit / recommend --json / info 等子命令,方便被脚本、CI 与 AI Agent 调用。
    3. 多 GPU、MoE 与动态量化:支持多卡配置与 MoE 架构(按激活参数而非总量估算显存),并会根据你的硬件动态选择最优量化档位(如 Q4 / Q8)。
    4. 本地运行时全覆盖:原生对接 Ollama、llama.cpp、MLX、Docker Model Runner、LM Studio,推荐结果可直接落地运行。
    5. 实测众包(benchmark & share):在你机器上实测 tok/s,结果先存本地、再一键以 PR 贡献回社区,让同型号硬件的人拿到「已验证 ✓」的真实数字。

    🎯 典型使用场景

    llmfit 四大评分维度

    • 本地部署前选型:拿到一台新笔记本 / 显卡,先跑 llmfit 看 7B / 14B / 32B 甚至 70B 谁能在你的显存和内存里跑、大概多快,避免「下了 3 小时发现跑不起来」的尴尬。
    • 自动化流水线 / AI Agent:在部署脚本或 Coding Agent 里调用 llmfit recommend --json --use-case coding,根据当前主机规格自动挑选可运行的编码模型,做到「按机器适配」而非写死模型名。
    • 硬件升级决策:想加内存还是换显卡?用 llmfit info 对比不同配置下目标模型的适配与速度估算,量化升级带来的收益再下单。

    💡 推荐理由

    本地跑大模型最让人头大的就是「选型玄学」——参数规模、量化、上下文、显存、内存交织在一起,靠经验猜十次翻车八次。llmfit 把这件事变成了可解释、可验证的工程问题:它不只给结论,还把每个估算的输入摊开给你看,并鼓励你用真实 benchmark 反哺社区。Rust 编写的单文件二进制启动极快、零运行时依赖,TUI 好看、CLI 好接,是个人本地 AI 实验室和企业内网「该跑哪个模型」决策的贴心小助手。30K+ Star、MIT 协议、隐私默认(不联网不上传),值得收藏。

    🔗 下载地址

  • Ollama:170k Stars!本地LLM运行工具,让AI模型在本地飞速运行

    配图

    Ollama Logo
    Ollama – 本地LLM运行工具

    项目简介

    Ollama 是一个轻量级的本地大语言模型(LLM)运行工具,让你能够在自己的设备上轻松部署和运行各种开源大语言模型,无需将数据发送到外部服务器,完全保护隐私。

    截至2026年,Ollama 已在 GitHub 获得 17万+ Stars,成为最广泛使用的本地LLM运行时,Docker Hub下载量超过1亿次。

    安装要求和过程

    环境要求

    • 操作系统:Linux(Ubuntu 20.04+)、macOS 11+、Windows 10(需WSL2)
    • 内存:8GB以上(运行7B模型),16GB以上(运行13B模型),32GB以上(运行33B+模型)
    • 存储:至少10GB可用空间(用于存放模型文件)
    • GPU:可选,NVIDIA GPU(CUDA)、AMD GPU(ROCm)或苹果M系列芯片可加速推理

    快速安装步骤

    macOS/Linux 一键安装:

    # Linux/macOS
    curl -fsSL https://ollama.com/install.sh | sh
    
    # macOS 也可用 Homebrew
    brew install ollama

    Windows 安装:

    1. 访问 https://ollama.com/download 下载 Windows 安装包
    2. 运行 OllamaSetup.exe,按照提示完成安装
    3. 打开命令提示符或PowerShell,输入 ollama --version 验证安装

    Docker 安装(推荐服务器环境):

    docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama

    核心功能

    1. 一键运行本地模型:支持一键拉取和运行100+开源大语言模型,包括 Llama 3.3、Mistral、Qwen、Phi、DeepSeek R1 等热门模型。
    2. OpenAI API 兼容:原生提供兼容 OpenAI API 格式的 REST API(默认端口11434),可直接对接现有基于 OpenAI 生态开发的应用和工具。
    3. 智能硬件加速:自动适配 NVIDIA(CUDA)、AMD(ROCm)、苹果 M 系列芯片(Metal)的 GPU 加速,大幅提升推理速度。
    4. 模型自定义配置:支持通过 Modelfile 自定义模型参数(温度、上下文长度、系统提示词等),轻松创建专属模型。
    5. 多模态支持:最新版本支持视觉模型(如 Llama 3.2 Vision),可处理图像输入,实现图文混合推理。

    典型使用场景

    场景一:开发者本地 AI 应用开发

    作为开发者,你可以使用 Ollama 在本地运行 LLM,用于:

    • 开发和测试 AI 应用,无需支付 API 费用
    • 对接 Open-WebUI 等前端界面,搭建私有化 AI 聊天助手
    • 通过 API 集成到自己的应用中,实现本地智能推理

    示例:用 Ollama 运行 Llama 3.3 8B 模型,通过 OpenAI 兼容 API 为本地应用添加 AI 能力。

    场景二:企业私有化部署

    对于企业用户,Ollama 提供了:

    • 数据隐私保护:所有推理过程在本地完成,敏感数据无需上传云端
    • 零 API 成本:无需为每次 API 调用付费,适合高频调用场景
    • 离线可用:模型下载后,无需联网即可使用,适合内网环境

    推荐理由

    我个人从2025年开始使用 Ollama,它已经成为我本地 AI 开发的标配工具。推荐理由如下:

    1. 极简体验:一条命令就能安装,一条命令就能运行模型,对新手极其友好。
    2. 生态丰富:支持对接 Open-WebUI、Continue(VS Code 插件)、LangChain 等50+主流工具,可玩性极高。
    3. 性能优秀:支持 4-bit/8-bit 量化,即使在中端笔记本上也能流畅运行 7B 参数的模型。
    4. 活跃社区:GitHub 上40000+社区集成,几乎任何你能想到的工作流,都有人已经做好了集成方案。

    如果你想要一个简单、快速、隐私安全的本地 LLM 运行方案,Ollama 绝对是首选。

    下载地址

  • Ollama:172K Stars!本地运行大模型的最热门工具,让AI完全属于你自己

    Ollama:172K Stars!本地运行大模型的最热门工具,让AI完全属于你自己

    Ollama


    ## 📦 项目简介

    Ollama 让你在本地一键运行 Llama 3、Mistral、Gemma、DeepSeek 等大模型,无需任何云服务,数据完全留在你自己的机器上。


    ## 🛠️ 安装要求和过程

    Ollama 支持 macOS、Windows、Linux 三大平台,安装极其简单。

    🔧 环境要求

    • macOS 11+ / Windows 10+ / Linux(主流发行版)
    • 建议 8GB 以上内存(7B 模型最低要求)
    • 建议 50GB 以上磁盘空间(存放多个模型)

    ⚡ 快速安装(3步搞定)

    macOS:

    brew install ollama

    Linux / WSL2:

    curl -fsSL https://ollama.com/install.sh | sh

    Windows:

    ollama.com/download 下载安装包,双击安装即可。

    验证安装:

    ollama --version

    ## ⭐ 核心功能

    🚀

    一键运行大模型

    一行命令 ollama run llama3 即可启动对话,无需配置环境。

    🔌

    本地 REST API

    自带 HTTP API(默认 http://localhost:11434),轻松集成到任何应用。

    📦

    Modelfile 自定义

    类似 Dockerfile 的 Modelfile,可定制系统提示词、温度参数、模板等。

    🔄

    模型库丰富

    官方库支持 50+ 模型,包括 Llama、Mistral、Gemma、DeepSeek、Qwen 等。

    GPU 加速推理

    自动检测并利用 Metal(macOS)、CUDA(NVIDIA)、ROCm(AMD)进行硬件加速,推理速度飞快。


    ## 🎯 典型使用场景

    📚 场景一:本地知识问答

    你可以用 Ollama 在本地运行大模型,结合 RAGFlow 或 AnythingLLM,搭建完全本地的知识库问答系统。所有文档数据和对话历史都留在本地,特别适合处理敏感资料、法律文件、医疗记录等场景。

    # 拉取中文模型
    ollama pull qwen2:7b
    # 启动对话
    ollama run qwen2:7b

    💻 场景二:AI 编程助手(本地版 Copilot)

    将 Ollama 接入 Continue、Cursor 或 VS Code,打造完全本地的 AI 编程助手。代码不需要发送到任何云端,隐私零泄露,适合企业内网开发环境。

    # 拉取代码专用模型
    ollama pull codellama:7b
    # 通过 API 调用
    curl http://localhost:11434/v1/chat/completions   -H "Content-Type: application/json"   -d '{"model":"codellama:7b","messages":[...]}'

    📝 场景三:内容创作与文本处理

    Ollama 配合 Open WebUI,可以在本地搭建一个”私人 ChatGPT”,用于文案撰写、文本摘要、翻译、邮件回复等日常任务。响应速度快,支持多轮对话,且完全免费。


    ## 💡 推荐理由

    我用过不少本地大模型运行工具,Ollama 是目前最省心的一个。安装简单到不可思议 —— macOS 一个 brew 命令,Linux 一条 curl 管道,Windows 下载安装包双击,全程不超过 3 分钟。

    它最打动我的一点,是对 Apple Silicon 的优化极其出色。在 M 系列芯片的 Mac 上,Ollama 能充分利用 Metal GPU 加速,7B 模型推理速度可以达到 40+ tokens/s,日常对话毫无压力。

    另外,它的 REST API 设计得非常优雅,和 OpenAI 的 API 格式高度兼容,迁移成本几乎为零。如果你正在做 AI 应用开发,Ollama 绝对是本地调试和离线部署的首选方案。

    推荐指数:4.8/5.0
    易用性满分,模型丰富度高,API 兼容性好,隐私保护强。


    ## 📥 下载地址

    🌐

    官方网站

    下载安装包 / 文档

    访问官网 →

    🐙

    GitHub 仓库

    172K+ Stars · Go 语言

    查看源码 →

    📖

    官方文档

    API 参考 / Modelfile 指南

    阅读文档 →


    >

    本文由 WorkBuddy AI 自动采集撰写 · 开源项目第35期 · GitHub 172K+ Stars