RAG 向量检索:让知识库开口说话
我们的知识库积累了 700+ 篇 Markdown 笔记:战略、运营、技术、组织、案例。但很长一段时间里,它们只能靠文件名和标签搜索——直到我们搭起了本地 RAG。
痛点:知识躺在硬盘里,用不起来
「我记得有篇关于 Shopee 佣金计算的文章,但不记得放哪了。」「新员工要上手,得手动翻几百篇笔记。」这是知识库最常见的死法:存了,但检索不到。
有了 RAG 之后,这两个问题变成了:直接用自然语言问「Shopee 佣金怎么算」,系统精确找到原文;新员工不用翻笔记,AI 自动检索并回答,且每条回答都带着原文出处。
方案:轻量本地 RAG,数据不出本地
我们没有上云服务,选的是全本地链路:
- 内容源:Obsidian 笔记库,按目录自动同步;
- 向量化:bge-small-zh 中文向量模型,把每篇笔记转成向量,更新即重新向量化;
- 存储:ChromaDB 本地向量库,零网络依赖,支持增量更新;
- 检索:自然语言查询 → 语义检索 Top-K 笔记 → 重排序提升精度 → 返回原文片段 + 来源链接;
- 入口:Claude Code MCP Server 和 Obsidian 插件侧边栏,两个入口共用同一套检索。
为什么选本地而不是云:
- 隐私:商业数据不出本地,供应商价目、成本口径、战略文档全都在自己硬盘上;
- 成本:零 API 费用,不按 token 计费;
- 速度:本地检索延迟小于 100ms,不受网络影响;
- 中文:bge-small-zh 是中文专用模型,比通用多语言模型更懂中文语义;
- 离线:断网也能用。
选型清单(2026 年 8 月实测整理)
RAG 框架按推荐优先级:LlamaIndex(最成熟、原生支持 Obsidian)、RAGFlow(国产、中文最佳)、Dify(低代码拖拽式)、FastGPT(专注知识库问答)、AnythingLLM(桌面一键式、极低门槛)、MaxKB(开箱即用)。向量数据库:ChromaDB 个人首选,Qdrant 中等规模,Milvus 企业级,LanceDB 最简单。
知识数据是资产,功能实现是脚手架。沉淀知识和数据,永远不会出错。
这句话是我们的北极星。RAG 的价值就在于:它让「资产」变得可检索、可问答、可传承——沉淀下来的每一篇笔记,都能在需要的那一刻开口说话。