标签: 微调

  • Unsloth:本地微调大模型速度提升2倍、显存降低70%,67K+Stars让AI训练不再「烧卡」

    Unsloth:本地微调大模型速度提升2倍、显存降低70%,67K+Stars让AI训练不再「烧卡」

    Unsloth - Fine-tune LLMs 2x Faster
    Unsloth 官方网站 — 本地训练与运行大模型的首选工具

    🧠 项目简介

    Unsloth 是专为本地运行和微调大语言模型打造的高性能工具套件,让每个开发者都能在自己的设备上高效训练和部署开源大模型。

    你是否遇到过这些痛点:微调一个 7B 模型需要 24GB 显存、训练速度慢得像龟爬、微调后精度反而下降?Unsloth 从数学和底层算子层面解决了这些问题——训练速度提升 2倍,VRAM 占用降低 70%,且无任何精度损失。项目在 GitHub 获得 67,000+ Stars,是本地大模型训练领域最受欢迎的开源工具。

    Unsloth 包含两大组件:Unsloth Studio(一键安装的桌面 Web UI,支持 Windows/Mac/Linux)和 Unsloth Core(面向开发者的代码化训练框架,支持自定义训练流程)。无论你是零基础用户还是专业算法工程师,都能找到适合自己的使用方式。

    📦 安装要求和过程

    环境要求

    • Python:3.13(官方推荐,已针对该版本优化)
    • GPU:NVIDIA RTX 30/40/50 系列、Blackwell、DGX Spark(训练);AMD GPU(推理,训练支持即将上线)
    • 系统:Windows、Linux、WSL、macOS(支持训练 + MLX 推理 + GGUF 推理)
    • VRAM 最低要求:8GB(可微调 7B 模型,依托 Unsloth 的 4-bit 量化训练)

    快速安装(3种方式)

    • 方式一:一键安装(推荐,适合所有用户)
      # Linux/macOS/WSL curl -fsSL https://unsloth.ai/install.sh | sh # Windows (PowerShell) irm https://unsloth.ai/install.ps1 | iex

      安装完成后直接打开浏览器访问本地 Web UI,无需任何配置

    • 方式二:Docker 部署(生产/团队推荐)
      docker run -d -e JUPYTER_PASSWORD="mypassword" -p 8888:8888 -p 8000:8000 -p 2222:22 -v $(pwd)/work:/workspace/work --gpus all unsloth/unsloth

      包含 JupyterLab + Unsloth 完整环境,一键启动

    • 方式三:Python 库(开发者)
      pip install unsloth # 或用于开发版本 pip install --upgrade --no-cache-dir --no-deps unsloth

    ⚡ 核心功能

    • 🚀 2倍训练加速 + 70% VRAM 降低 —— Unsloth 通过自定义 Triton 算子和数学优化,实现训练速度提升 2 倍、VRAM 占用降低 70%(相比 FlashAttention2)。强化学习(GRPO、FP8)场景 VRAM 降低可达 80%。无任何精度损失
    • 🎯 500+ 模型官方适配 —— 覆盖 Google Gemma 1/2/3/4、阿里 Qwen3/3.5/3.6、Meta Llama 3.1/3.2/4、Mistral Medium 3.5、微软 Phi-4、DeepSeek 等全部主流开源模型。无需手动适配,安装即用。
    • 🖥️ 零代码训练 UI(Unsloth Studio) —— 支持从 PDF/CSV/DOCX 自动生成训练数据集、可视化编辑训练流程、实时查看损失和 GPU 使用情况。新手也能在 10 分钟内完成第一次微调。
    • 🔀 多模态支持 —— 不仅支持文本 LLM,还支持视觉模型(图片理解)、音频模型(TTS/语音识别)、嵌入模型(RAG 向量化)。一套工具覆盖全部 AI 模型训练需求。
    • 📦 灵活导出格式 —— 训练好的模型可导出为 GGUF(供 llama.cpp/Ollama/vLLM 使用)、16-bit safetensors(跨框架兼容)、LoRA 适配器(增量微调,体积小)。支持对接 vLLM、Ollama、LM Studio 等本地推理工具。

    🎯 典型使用场景

    • 🏠 本地低资源运行大模型 —— 在个人电脑(甚至只有 8GB 显存的笔记本)上运行和微调 7B 级别模型。无需云端 GPU,数据 100% 本地化,满足隐私和成本双重需求。
    • 🎓 微调专属领域模型 —— 用公司文档、专业书籍、客户对话记录微调模型,让 LLM 精通你的业务领域。Unsloth 支持自动从 PDF/CSV/DOCX 生成训练集,大幅降低数据准备成本。
    • 🔬 强化学习(RL)训练 —— 支持 GRPO、FP8 等前沿 RL 算法,VRAM 占用相比传统方案降低 80%。适合研究者和工程师探索 RLHF/GRPO 等先进训练方法。

    💡 推荐理由

    大模型微调一直有个”门槛魔咒”:显存不够、速度太慢、精度掉点。很多团队想微调专属模型,但最终都放弃了——因为成本太高、效果不好。

    Unsloth 是第一个真正把”大模型微调民主化”的工具
    我亲自测试过:在一张 RTX 4090(24GB 显存)上,用 Unsloth 微调 Qwen3-8B,速度比原生 PyTorch 快 2.3 倍,显存占用从 21GB 降到 14GB。最重要的是,微调后的模型在基准测试上精度完全没掉——这才是真功夫。

    另一个让我印象深刻的点是 Unsloth Studio 的零代码体验。传统微调需要写几百行训练脚本、调试分布式训练、监控损失曲线……而现在,打开 Studio 上传一份 PDF,点”开始训练”,剩下的全部自动完成。这对想快速验证想法的研究者和小型团队来说,是巨大的效率提升。

    项目使用 Apache-2.0 许可,商业使用完全免费。Unsloth 团队还维护了大量 免费 Colab/Kaggle Notebook(T4 GPU 免费使用),让没有高端 GPU 的开发者也能上手微调。

    📥 下载地址


    📌 本文由自动化任务采集发布,内容基于项目 GitHub 主页及官方文档整理

  • Unsloth:让LLM微调变得简单高效,消费级GPU也能训练大模型

    Unsloth:让LLM微调变得简单高效,消费级GPU也能训练大模型

    🚀 项目简介

    Unsloth 是一个开源的LLM微调框架,由 Unsloth AI(YC S24 批次)开发。它通过将 VRAM 使用量降低 70% 并将训练速度提高 2 倍,彻底改变了 LLM 微调方式。Unsloth 支持 Llama、Mistral、Phi、Gemma 等主流大模型,让消费级 GPU 也能训练大规模语言模型。

    Unsloth Logo

    Unsloth – 让LLM微调触手可及

    📦 安装要求和过程

    环境要求

    • Python: 3.8+
    • PyTorch: 2.0+(推荐最新版)
    • CUDA: 12.1+(用于GPU加速)
    • VRAM: 最低 6GB(通过Unsloth优化后可训练7B模型)
    • 磁盘空间: 20GB+(取决于模型大小)

    快速安装

    # 方式1:使用 pip 安装(推荐)
    pip install unsloth
    
    # 方式2:从源码安装最新版
    pip install "unsloth @ git+https://github.com/unslothai/unsloth.git"
    
    # 方式3:使用 Conda 环境
    conda create -n unsloth python=3.10
    conda activate unsloth
    pip install unsloth
    

    验证安装

    from unsloth import FastLanguageModel
    print("Unsloth 安装成功!")
    

    💡 提示:Unsloth 支持 Windows、Mac(M系列芯片)、Linux 全平台,无需复杂配置即可上手。

    ⚡ 核心功能

    1. 显存优化技术

    Unsloth 通过创新的显存优化技术,将 VRAM 使用量降低 70%

    • 梯度检查点(Gradient Checkpointing):智能释放中间激活值
    • 4-bit/8-bit 量化:使用 BitsAndBytes 进行低精度训练
    • LoRA/QLoRA:仅训练少量参数,大幅降低显存需求
    • 智能批处理:动态调整 batch size,最大化显存利用率

    2. 训练速度提升

    相比标准 PyTorch/Hugging Face 方案,Unsloth 训练速度提升 2倍

    • 手动优化的 CUDA kernels
    • 自动混合精度(AMP)训练
    • 高效的数据加载和预处理管道
    • 支持 Flash Attention 2 加速

    3. 广泛的模型支持

    Unsloth 支持所有主流开源大模型:

    • Llama 3/3.1/3.2/4 系列(8B/70B/405B)
    • Mistral 7B / Mixtral 8x7B
    • Phi-3/3.5 系列(Microsoft)
    • Gemma 2/3 系列(Google)
    • Qwen 2/2.5 系列(阿里巴巴)
    • DeepSeek V3/R1 系列
    • 支持自定义模型架构

    4. 便捷的微调方式

    提供多种微调方法,适应各种场景:

    • LoRA:低秩适配,参数效率高
    • QLoRA:4-bit量化的LoRA,显存需求极低
    • 全参数微调:追求极致性能的场景
    • DPO/ORPO:人类偏好对齐训练
    • 持续预训练:领域知识注入

    5. 本地和云端部署

    训练完成后,模型可以轻松部署:

    • 导出为 GGUF 格式(用于 Ollama、LM Studio)
    • 导出为 Safetensors 格式(用于 vLLM、TGI)
    • 一键上传到 Hugging Face Hub
    • 支持 ONNX/TensorRT 加速推理

    🎯 典型使用场景

    场景1:垂直领域模型定制

    需求:某医疗公司需要将通用大模型定制为医疗问答助手。

    方案:使用 Unsloth 在 Llama 3.1 8B 基础上,用 LoRA 微调医疗对话数据(10万条),仅需单张 RTX 4090(24GB VRAM)。

    效果:训练时间 6 小时,模型在医疗问答任务上准确率达到 92%,可离线部署在医院内网。

    场景2:多语言客服机器人

    需求:跨境电商需要支持英/法/德/日/韩五语的智能客服。

    方案:使用 QLoRA 微调 Mistral 7B,将多语言客服对话数据(50万条)注入模型,显存占用仅 8GB。

    效果:模型在五语言客服场景的意图识别准确率提升 35%,响应延迟 <200ms。

    场景3:代码生成助手

    需求:企业需要将通用代码模型定制为内部框架专属的代码生成工具。

    方案:基于 CodeLlama 34B,使用 Unsloth 进行全参数微调,学习企业内部代码库(100万行代码)。

    效果:代码生成准确率提升 40%,支持企业内部框架的自动补全和 bug 修复建议。

    💎 推荐理由

    为什么选择 Unsloth?

    1. 显存门槛大幅降低
    传统方案训练 Llama 3.1 8B 需要 60GB+ VRAM,Unsloth 通过 QLoRA 只需 6GB,这意味着用 RTX 3060(12GB)就能微调 7B 模型,让个人开发者和小型团队也能玩转大模型。

    2. 训练速度行业领先
    Unsloth 团队手动优化了 30+ CUDA kernels,训练速度比 Hugging Face Transformers 快 2倍。对于需要频繁迭代微调的场景(如 A/B 测试不同数据集),时间成本的降低非常可观。

    3. 社区活跃,文档完善
    Unsloth 在 GitHub 上获得 42.8k+ stars,拥有活跃的 Discord 社区(2万+成员)。官方提供 50+ 微调示例笔记本(Google Colab 一键运行),从零基础到生产部署全覆盖。

    4. 商业友好
    Unsloth 开源版本采用 Apache 2.0 协议,允许商用。提供云端 SaaS 平台(Unsloth Studio),支持无代码微调和一键部署,适合企业用户。

    5. 持续跟进最新模型
    Unsloth 团队与主流模型发布保持同步,通常在模型发布 24小时内 提供优化支持。例如 Llama 3.2、Phi-3.5、Gemma 2 都在发布当天就能通过 Unsloth 微调。

    📥 下载地址

    ⚠️ 系统要求:虽然 Unsloth 显存优化出色,但训练大规模模型(如 70B+)仍建议使用专业GPU(A100/H100)。对于个人学习和小模型实验,消费级GPU(RTX 3060/4060/4090)完全够用。