为本地大模型增加知识库(本地RAG)
上篇文章介绍了如何通过 Ollama 在本地部署 LLM,以及如何通过 Open WebUI 更友好地使用大模型。
实际使用中,我发现 DeepSeek R1 的 14B 模型在文字处理方面已经能够提供很好的体验,对系统资源占用也较小,是一个不错的平衡选择。
但有时,我希望能够指定一些特定信息,辅助模型进行更精准的回答,也希望模型能够对特定文档进行分析和整理,这时我们就需要一个知识库系统来提供支持。
Open WebUI 自带 RAG 能力,但其默认的sentence-transformers/all-MiniLM-L6-v2嵌入模型在文本处理上(特别是中文)使用体验不太好。导致 R1 模型不论是 14B 还是 32B,其处理结果总是不太令人满意。
现在主流的 AI 网站都支持知识库能力,但如果你对数据隐私比较敏感,不愿意将数据上传至第三方网站进行分析,同时又有知识库的使用需求,那么可以考虑这个替代方案:Ollama + DeepSeek R1 + Open WebUI + bge-m3。
Ollama + DeepSeek R1 + Open WebUI的搭建步骤请见[Cursor和Windsurf平替方案的部署说明(含DeepSeek R1和Janus-Pro-7B)]的方案二。
1. 下载bge-m3
我们只需用 bge-m3 替换掉sentence-transformers/all-MiniLM-L6-v2即可。命令如下:
ollama pull bge-m3
bge-m3 下载成功后,可使用下述命令查看信息。该嵌入模型不用手动启动,在 WebUI 上完成配置后即可自动调用。
ollama list
2. 在Open WebUI中进行配置
在管理员面板 - 设置 - 文档中,将“语义向量模型引擎”由默认的“sentence-transformers”改为“ollama”,“语义向量模型”一栏填入“bge-m3:latest”。

在 WebUI 中进入管理员面板 - 设置 - 模型,即可看到该嵌入模型。

3. 在工作空间-知识库中上传知识库文档。
4. 在大模型对话框中输入“#”,即可引用本地知识库。

5. 示例:对指定 Excel 文件进行分析(数据仅做参考)

完成以上步骤后,本地知识库就搭建完成了。
另外请注意,Open WebUI 默认使用的向量数据库是 sqlite,对于大数据量的支持比较有限,可以考虑用 Chroma 进行替代。
总结:
通过本文的介绍,我们为本地大模型 DeepSeek R1 搭建了一个基于 bge-m3 嵌入模型的知识库系统。这个方案不仅解决了 Open WebUI 默认嵌入模型对中文处理不佳的问题,还保护了用户的数据隐私,避免将敏感数据上传到第三方平台。
本地知识库的搭建,为我们更有效地利用大模型提供了强大的支持。无论是精准问答、文档分析还是信息整理,本地知识库都能发挥重要作用。
此外,我们还提到了使用 Chroma 向量数据库替代 sqlite 的方法,以应对大数据量的场景。
希望本文能帮助你搭建自己的本地知识库,更好地利用大模型的能力。如果你在搭建过程中遇到任何问题,欢迎在评论区留言,我们一起交流学习。

如何学习AI大模型?
我在一线互联网企业工作十余年里,指导过不少同行后辈。帮助很多人得到了学习和成长。
我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑,所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限,很多互联网行业朋友无法获得正确的资料得到学习提升,故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

第一阶段: 从大模型系统设计入手,讲解大模型的主要方法;
第二阶段: 在通过大模型提示词工程从Prompts角度入手更好发挥模型的作用;
第三阶段: 大模型平台应用开发借助阿里云PAI平台构建电商领域虚拟试衣系统;
第四阶段: 大模型知识库应用开发以LangChain框架为例,构建物流行业咨询智能问答系统;
第五阶段: 大模型微调开发借助以大健康、新零售、新媒体领域构建适合当前领域大模型;
第六阶段: 以SD多模态大模型为主,搭建了文生图小程序案例;
第七阶段: 以大模型平台应用与开发为主,通过星火大模型,文心大模型等成熟大模型构建大模型行业应用。

👉学会后的收获:👈
• 基于大模型全栈工程实现(前端、后端、产品经理、设计、数据分析等),通过这门课可获得不同能力;
• 能够利用大模型解决相关实际项目需求: 大数据时代,越来越多的企业和机构需要处理海量数据,利用大模型技术可以更好地处理这些数据,提高数据分析和决策的准确性。因此,掌握大模型应用开发技能,可以让程序员更好地应对实际项目需求;
• 基于大模型和企业数据AI应用开发,实现大模型理论、掌握GPU算力、硬件、LangChain开发框架和项目实战技能, 学会Fine-tuning垂直训练大模型(数据准备、数据蒸馏、大模型部署)一站式掌握;
• 能够完成时下热门大模型垂直领域模型训练能力,提高程序员的编码能力: 大模型应用开发需要掌握机器学习算法、深度学习框架等技术,这些技术的掌握可以提高程序员的编码能力和分析能力,让程序员更加熟练地编写高质量的代码。

1.AI大模型学习路线图
2.100套AI大模型商业化落地方案
3.100集大模型视频教程
4.200本大模型PDF书籍
5.LLM面试题合集
6.AI产品经理资源合集
👉获取方式:
😝有需要的小伙伴,可以保存图片到wx扫描二v码免费领取【保证100%免费】🆓

魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。
更多推荐


所有评论(0)