← 返回目录
d4.2实操⏱ 约 10 分钟

建个人知识库:极简 RAG

它懂天下事,却不懂你的事——今天教它读你的书

🔎 最后验证 2026-07📚 来源:🧰 Cherry Studio、Ollama(可选,本地嵌入)
为什么学这个

问 DeepSeek「秦始皇为什么修长城」,它对答如流;问它「我们公司的报销流程是什么」,它一个字都不知道——你的合同模板、产品手册、读书笔记,都不在它的记忆里。

笨办法你已经用过:每次把资料粘贴进对话(d2 章的老套路)。但资料一多就顶不住了——总不能每次问个报销,先粘 50 页员工手册吧?

这一节装一个「知识库」:资料一次入库,随问随查。这套技术有个学名叫 RAG,是眼下 AI 落地最值钱的玩法之一——而你今天一行代码都不用写。

RAG 是什么?开卷考试

💡 打个比方

让 AI 掌握你的资料有两条路。一条是「背下来」(重新训练模型)——贵得离谱,还容易背串。

另一条就是 RAG:开卷考试。书不用背,考试时带进考场;遇到题目,先翻到相关的那几页(检索),再照着页面上的内容作答(生成)。

入库时有个幕后角色叫嵌入模型,它的工作是给书里每一段贴上「内容标签」,这样考试时才能一翻一个准。记住这个分工:嵌入模型管翻书,DeepSeek 管答题。

实操:用现成装备搭一个

好消息:你在 d3.3 装的 Cherry Studio 自带知识库功能,d4.1 装的 Ollama 正好能白嫖嵌入模型。四步搭完:

第一步:请一位「贴标签专员」(嵌入模型)。DeepSeek 官方 API 只管答题、不提供嵌入模型,所以这个角色要另请。最省钱的路:用 Ollama 拉一个免费的嵌入模型(比如 bge-m3,让 DeepSeek 给你具体命令),全程本地、不花钱。

第二步:建库。Cherry Studio 里打开「知识库」,新建一个,起个名,选中刚才的嵌入模型。

第三步:放资料。把文件拖进去——pdf、docx、md、txt 都吃。然后等它「向量化」(就是逐段贴标签),出现完成标记即可。第一次先放三五份就好。

第四步:开卷问答。回到聊天,把这个知识库挂到会话上(界面细节以版本为准),用 DeepSeek 提问试试:「根据我的资料,……」。它会先翻库、再作答,还能给出引用了哪些原文片段。

那一刻的感觉,值得你亲手试一次:它终于在聊「你的事」了。

好库是喂出来的

  • 一库一主题:报销制度和读书笔记别塞同一个库——大杂烩会让「翻书」翻错页;
  • 资料更新要重新入库:库里存的是入库那一刻的快照;
  • 提问时点名:「根据知识库里的员工手册」比干问命中率高。
⚠️ 避坑
  1. RAG 是开卷考试,不是记忆移植。它每次只翻「相关的几页」,所以「第三章第二条怎么说」答得很准,「整本书的中心思想是什么」这种要通读全书的题反而容易答瘸——宏观总结类任务,还是回 d2.3 的套路把全文直接给它;
  2. 开着卷也可能编。答案里的关键结论,点开它引用的原文片段核对一眼——d1.4 的纪律带进考场;
  3. 隐私账要算清:如果嵌入模型走的是云端服务商,你的资料入库时同样「出了门」。真正敏感的材料,嵌入用 Ollama 本地方案,答题模型也换成 d4.1 的本地徒弟——全链路不出电脑。

这扇门后面:从「会查」到「会干」

今天你的 AI 学会了「查着资料回答」。自然会冒出下一个念头:能不能让它拿着这些知识主动干活?——收到邮件自动按手册回复、每周自己整理笔记、多步骤完成一整件事。

那就不是知识库了,那叫智能体(Agent)——AI 从「问答机」进化成「办事员」。我们有一整门课专讲这件事:《从零构建 AI 智能体》,40 节,亲手养成一个能做事、能上线的 AI 助理。学完这门 DeepSeek 课再去,正好无缝衔接。

❓ 测验
按「开卷考试」的类比,知识库问答时,嵌入模型和 DeepSeek 分别扮演什么角色?
✅ 小结
  • RAG=开卷考试:先检索(翻书)再生成(答题),不必重新训练
  • 零代码路线:Ollama 拉免费嵌入模型 → Cherry Studio 建库放资料 → 挂库提问
  • 好库三原则:一库一主题、更新重入库、提问点名资料
  • 边界:宏观通读题不擅长、引用要核对、敏感资料走全本地链路
下一节 → 家底盘点完毕。倒数第二节,把这门课零散提过的钱和额度一次算清——省钱心法三招打包。
智图软件的赞赏码
都看到这了,打个赏呗!
接下来 · d4.3
成本与限流:把账算明白
继续读下一节 →