标签: 检索增强生成

  • RAGFlow:83K+ Stars 的开源 RAG 引擎,为 LLM 打造卓越上下文层

    RAGFlow:83K+ Stars 的开源 RAG 引擎,为 LLM 打造卓越上下文层

    📌 项目简介

    RAGFlow 是一款领先的开源检索增强生成(RAG)引擎,由 InfiniFlow 团队(Milvus 向量数据库原班人马)开发,将前沿 RAG 技术与 Agent 能力深度融合,为大语言模型提供卓越的上下文理解层。

    RAGFlow 架构图

    RAGFlow 系统架构概览


    ⚙️ 安装要求和过程

    环境要求(自托管)

    配置项 最低要求
    CPU ≥ 4 核
    内存 ≥ 16 GB
    磁盘 ≥ 50 GB
    Docker ≥ 24.0.0
    Docker Compose ≥ v2.26.1

    🐳 Docker 快速部署(推荐)

    # 1. 调整系统内核参数(避免 Elasticsearch 启动失败)
    sudo sysctl -w vm.max_map_count=262144
    
    # 2. 克隆项目代码
    git clone https://github.com/infiniflow/ragflow.git
    cd ragflow/docker
    
    # 3. 切换到稳定版本
    git checkout v0.26.1
    
    # 4. 启动服务(仅CPU)
    docker compose -f docker-compose.yml up -d
    
    # (可选)如需GPU加速,先执行:
    # sed -i '1i DEVICE=gpu' .env
    # docker compose -f docker-compose.yml up -d
    
    # 5. 验证服务状态
    docker logs -f docker-ragflow-cpu-1

    启动成功后,浏览器访问服务器 IP 地址(默认 HTTP 端口 80)即可进入 RAGFlow 登录页面。

    💻 源码启动(开发用途)

    # 安装依赖工具
    pipx install uv pre-commit
    
    # 克隆代码
    git clone https://github.com/infiniflow/ragflow.git
    cd ragflow/
    uv sync --python 3.13
    uv run python3 download_deps.py
    
    # 启动基础依赖服务
    docker compose -f docker/docker-compose-base.yml up -d
    
    # 启动后端
    source .venv/bin/activate
    export PYTHONPATH=$(pwd)
    bash docker/launch_backend_service.sh
    
    # 启动前端(新终端)
    cd web && npm install && npm run dev

    ✨ 核心功能

    1. 深度文档理解,输入即精准

    基于先进的文档解析技术,可从格式复杂的非结构化数据(PDF、Word、PPT、Excel、扫描件、图片等)中精准提取知识,真正做到”Quality in, Quality out”。

    2. 可视化模板化分块,答案可追溯

    分块逻辑智能可解释,提供大量预置分块模板;支持文本分块可视化,允许人工干预调整;最终答案附带可追溯的引用来源,有效降低 LLM 幻觉问题。

    3. 多源数据兼容,异构数据统一管理

    支持解析 Word、PPT、Excel、TXT、图片、扫描件、结构化数据、网页等各类异构数据源,一站式完成企业知识库构建。

    4. Agentic 工作流 + MCP 协议支持

    内置丰富 Agent 能力,支持 Agentic 工作流编排、MCP 协议接入;内置 Python/JavaScript 代码执行器组件;支持 AI Agent 记忆功能。

    5. 高精度混合检索,多路召回+融合重排

    结合向量搜索、BM25 关键词搜索和自定义评分机制,配合先进重排序算法,提供无与伦比的回答准确性和上下文相关性。


    🚀 典型使用场景

    📈 股权投资研究

    自动化收集公司数据,整合财务指标与研究洞察。通过自主规划和多智能体编排,实现高级股票分析。自动从用户查询中识别股票代码,聚合外部权威来源和内部记录中的洞察,最终结合定性洞察和财务指标生成完整投资报告。

    ⚖️ 法律判例分析

    通过检查公共来源和内部数据集中的类似法律案例,提供结构化判例分析。自动提取关键属性(如司法管辖区和法律问题)以制定搜索查询并检索可比较的先例,最终整合成结构化分析报告。

    🏭 制造业维护支持

    通过从内部手册中准确获取内容,提供结构化维护指导(外部参考作为补充支持)。输入任务后,工作流首先验证输入充分性,然后从内部维护手册中提取标准协议,整合补充外部技术数据,生成清晰的执行指令。


    💡 推荐理由

    RAGFlow 是我用过的最”务实”的 RAG 产品,没有之一。

    第一,它真正解决了 RAG 的底层痛点——文档解析。很多 RAG 框架只关注向量检索和生成,却忽略了最关键的”输入质量”问题。RAGFlow 的 DeepDoc 技术能精准解析复杂格式的 PDF、扫描件,真正做到”Garbage in, garbage out”的反面——Quality in, quality out

    第二,可视化分块 + 可追溯引用,让 AI 回答有章可循。这是企业场景的刚需。你可以清楚看到每个答案是从哪个文档的哪个位置来的,大幅降低了 LLM 幻觉带来的风险。

    第三,Agentic 能力的融合非常自然。不是简单地在 RAG 上面套一个 Agent 外壳,而是将 Agent 能力(MCP 协议、代码执行、记忆管理)深度集成到 RAG 工作流中,真正实现了”RAG + Agent”的一体化编排。

    最后,InfiniFlow 团队是 Milvus 的原班人马,技术底蕴深厚。83K+ Stars 和 9600+ Forks 的社区活跃度也证明了产品的成熟度。如果你正在构建企业级知识库或 RAG 应用,RAGFlow 绝对值得一试。


    📥 下载地址

    🌐 官方网站:https://ragflow.io

    📦 GitHub 开源地址:https://github.com/infiniflow/ragflow ⭐ 83K+ Stars

    ☁️ 云服务(快速体验):https://cloud.ragflow.io

    📚 官方文档:https://ragflow.io/docs/dev/

    💡 小贴士:RAGFlow 支持飞书、Discord、Telegram、Line 等多聊天渠道接入(2026年6月更新),可快速将企业知识库接入到日常沟通工具中!

  • LightRAG – 轻量级知识图谱RAG框架,微软GraphRAG的高效替代方案

    LightRAG – 轻量级知识图谱RAG框架,微软GraphRAG的高效替代方案

    🔍

    LightRAG

    轻量级知识图谱RAG框架 – 微软GraphRAG的高效替代方案

    🏫 香港大学
    📄 EMNLP 2025
    ⭐ 2.4K+ Stars

    📋 项目简介

    LightRAG 是由香港大学数据科学实验室(HKUDS)开发的轻量级、基于知识图谱的检索增强生成(RAG)框架。作为微软GraphRAG的高效替代方案,LightRAG专为法律、医疗、金融等复杂文档分析场景设计,支持多模态文档处理。其创新的双层级检索架构同时管理知识图谱(KG)和向量嵌入,解决了传统GraphRAG大规模数据处理时的高算力开销、响应慢、增量更新成本高等瓶颈问题。

    ⚙️ 安装要求

    ⚠️ 环境要求

    • Python 3.10 及以上
    • 推荐使用 uv 包管理工具(比 pip 性能更优)
    • 前端构建依赖:bun(如需自行构建WebUI)

    快速安装(三种方式)

    方式一:从PyPI安装(推荐)

    # 安装带API服务的LightRAG
    uv tool install "lightrag-hku[api]"
    
    # 构建前端产物
    cd lightrag_webui
    bun install --frozen-lockfile
    bun run build
    cd ..
    
    # 配置环境变量后启动服务
    cp env.example .env  # 修改.env中的LLM和嵌入模型配置
    lightrag-server

    方式二:从源码安装

    git clone https://github.com/HKUDS/LightRAG.git
    cd LightRAG
    
    # 一键初始化开发环境(自动安装所有依赖+构建前端)
    make dev
    
    source .venv/bin/activate  # Windows用 .venv\Scripts\activate
    
    # 配置环境变量后启动服务
    make env-base  # 生成.env配置文件
    lightrag-server

    方式三:Docker部署

    git clone https://github.com/HKUDS/LightRAG.git
    cd LightRAG
    cp env.example .env  # 修改LLM和嵌入模型配置
    docker compose up

    ✨ 核心功能

    🔍 双层级检索架构

    同时管理知识图谱(KG)和向量嵌入,弥合传统向量RAG和图RAG的技术鸿沟。支持5种查询模式:local(局部上下文)、global(宏观主题)、hybrid(融合模式)、naive(传统向量检索)、mix(默认,最全面)

    ⚡ 增量更新能力

    支持知识库无缝增量更新,新数据通过标准图索引pipeline生成局部图后直接合并到现有图谱,无需重构全局索引。删除文档时可基于构建阶段的LLM缓存快速重建受影响的关系,更新效率极高。

    🎯 多模态文档处理

    v1.5版本起支持多模态文档分析,文档处理管道支持MinerU、Docling、Native等多解析引擎,可高效提取文档中的文本、表格、公式、图像,实现跨模态实体和关系的统一映射与索引。

    💰 成本优势

    无需生成低效的社区报告或多跳推理来处理复杂查询,大幅减少索引和查询阶段的LLM调用次数,降低响应延迟和算力成本。在农业、计算机科学、法律、混合领域四类测试集上,性能均显著优于NaiveRAG、RQ-RAG、HyDE、GraphRAG等基线方法。

    🗄️ 多存储后端支持

    支持4类存储(KV存储、向量存储、图存储、文档状态存储)的灵活配置。生产环境可选择PostgreSQL、MongoDB、OpenSearch等统一后端,也可分别搭配Milvus/Qdrant做向量存储、Neo4j/Memgraph做图存储。

    🎯 典型使用场景

    📄 场景一:垂直领域复杂文档分析

    适用场景:法律合同审查、医疗病历分析、金融研报解读等需要深度上下文理解、逻辑推理的场景。
    优势:LightRAG的图索引能力可捕捉实体间复杂语义依赖,生成质量优于传统RAG。例如在法律领域,其全面性指标达到83.6%,远超NaiveRAG的16.4%。

    🏢 场景二:大规模知识库构建

    适用场景:需要处理海量文档、且知识库需要频繁更新迭代的企业知识库、技术文档站等。
    优势:LightRAG的增量更新能力可大幅降低更新成本,支持30B参数级开源模型也可达到高精度。无需每次都重构全局索引,显著提升运维效率。

    🚀 场景三:生产级RAG系统部署

    适用场景:企业级RAG应用,对高可用、低延迟、安全性有严格要求。
    优势:可通过配置统一存储后端、本地部署嵌入/重排序模型、调整并发参数,满足企业级部署需求。支持引用溯源、文档删除、RAGAS评估集成、Langfuse链路追踪等生产特性。

    💡 推荐理由

    作为一名经常与RAG系统打交道的开发者,我必须说 LightRAG 是我近期见过的最务实的RAG框架创新。它并没有试图颠覆什么,而是精准地解决了GraphRAG在实际落地时的三大痛点:算力开销高、更新成本高、响应速度慢

    最让我印象深刻的是它的增量更新能力。在传统GraphRAG中,每次添加新文档都需要重构整个知识图谱,这在动态知识库场景下几乎是不可接受的。而LightRAG通过局部图合并策略,实现了真正的无缝增量更新,这让它在企业级应用场景中具备了极强的竞争力。

    另外,它的多模态支持也非常实用。在现代文档中,表格、公式、图片的信息同样重要,但传统RAG往往只能处理纯文本。LightRAG v1.5通过集成MinerU、Docling等解析引擎,真正实现了对复杂文档的全面理解。

    当然,它并不是完美的。相比成熟的商业化方案,LightRAG在文档量和用户友好度上还有提升空间。但考虑到它是开源且活跃维护的项目,而且已经有EMNLP 2025论文背书,我相信它会成为RAG领域的一个重要里程碑。

    适用人群:如果你正在构建需要处理复杂文档的RAG系统,或者对GraphRAG的性能和成本不满,LightRAG绝对值得一试。特别是对于法律、医疗、金融等垂直领域的应用,它的知识图谱能力会让你事半功倍。

    ─────────────────── ✨ ✨ ✨ ───────────────────

    LightRAG 为RAG系统提供了一种更高效、更经济的解决方案。无论是构建企业知识库、垂直领域问答系统,还是进行RAG相关研究,它都是一个值得深入探索的优秀工具。

    你是否也在使用RAG技术? 欢迎在评论区分享你的经验和想法!