建个人知识库:极简 RAG
它懂天下事,却不懂你的事——今天教它读你的书
问 DeepSeek「秦始皇为什么修长城」,它对答如流;问它「我们公司的报销流程是什么」,它一个字都不知道——你的合同模板、产品手册、读书笔记,都不在它的记忆里。
笨办法你已经用过:每次把资料粘贴进对话(d2 章的老套路)。但资料一多就顶不住了——总不能每次问个报销,先粘 50 页员工手册吧?
这一节装一个「知识库」:资料一次入库,随问随查。这套技术有个学名叫 RAG,是眼下 AI 落地最值钱的玩法之一——而你今天一行代码都不用写。
RAG 是什么?开卷考试
让 AI 掌握你的资料有两条路。一条是「背下来」(重新训练模型)——贵得离谱,还容易背串。
另一条就是 RAG:开卷考试。书不用背,考试时带进考场;遇到题目,先翻到相关的那几页(检索),再照着页面上的内容作答(生成)。
入库时有个幕后角色叫嵌入模型,它的工作是给书里每一段贴上「内容标签」,这样考试时才能一翻一个准。记住这个分工:嵌入模型管翻书,DeepSeek 管答题。
实操:用现成装备搭一个
好消息:你在 d3.3 装的 Cherry Studio 自带知识库功能,d4.1 装的 Ollama 正好能白嫖嵌入模型。四步搭完:
第一步:请一位「贴标签专员」(嵌入模型)。DeepSeek 官方 API 只管答题、不提供嵌入模型,所以这个角色要另请。最省钱的路:用 Ollama 拉一个免费的嵌入模型(比如 bge-m3,让 DeepSeek 给你具体命令),全程本地、不花钱。
第二步:建库。Cherry Studio 里打开「知识库」,新建一个,起个名,选中刚才的嵌入模型。
第三步:放资料。把文件拖进去——pdf、docx、md、txt 都吃。然后等它「向量化」(就是逐段贴标签),出现完成标记即可。第一次先放三五份就好。
第四步:开卷问答。回到聊天,把这个知识库挂到会话上(界面细节以版本为准),用 DeepSeek 提问试试:「根据我的资料,……」。它会先翻库、再作答,还能给出引用了哪些原文片段。
那一刻的感觉,值得你亲手试一次:它终于在聊「你的事」了。
好库是喂出来的
- 一库一主题:报销制度和读书笔记别塞同一个库——大杂烩会让「翻书」翻错页;
- 资料更新要重新入库:库里存的是入库那一刻的快照;
- 提问时点名:「根据知识库里的员工手册」比干问命中率高。
- RAG 是开卷考试,不是记忆移植。它每次只翻「相关的几页」,所以「第三章第二条怎么说」答得很准,「整本书的中心思想是什么」这种要通读全书的题反而容易答瘸——宏观总结类任务,还是回 d2.3 的套路把全文直接给它;
- 开着卷也可能编。答案里的关键结论,点开它引用的原文片段核对一眼——d1.4 的纪律带进考场;
- 隐私账要算清:如果嵌入模型走的是云端服务商,你的资料入库时同样「出了门」。真正敏感的材料,嵌入用 Ollama 本地方案,答题模型也换成 d4.1 的本地徒弟——全链路不出电脑。
这扇门后面:从「会查」到「会干」
今天你的 AI 学会了「查着资料回答」。自然会冒出下一个念头:能不能让它拿着这些知识主动干活?——收到邮件自动按手册回复、每周自己整理笔记、多步骤完成一整件事。
那就不是知识库了,那叫智能体(Agent)——AI 从「问答机」进化成「办事员」。我们有一整门课专讲这件事:《从零构建 AI 智能体》,40 节,亲手养成一个能做事、能上线的 AI 助理。学完这门 DeepSeek 课再去,正好无缝衔接。
- RAG=开卷考试:先检索(翻书)再生成(答题),不必重新训练
- 零代码路线:Ollama 拉免费嵌入模型 → Cherry Studio 建库放资料 → 挂库提问
- 好库三原则:一库一主题、更新重入库、提问点名资料
- 边界:宏观通读题不擅长、引用要核对、敏感资料走全本地链路
