企业知识库怎么做,才不会变成资料坟场

大部分企业知识库最后都变成了同一个东西:一个没人打开的文件夹

接上 AI 之后,这个问题不但没解决,还多了一层——现在它变成了一个会一本正经胡说的文件夹

这篇讲清楚三件事:为什么会这样、怎么判断你的知识库是不是在往这个方向走、以及正确的做法是什么。

---

资料坟场是怎么形成的

不是因为资料太少,恰恰是因为太多、太杂、没人负责

典型的路径是这样:

1. 项目启动,各部门被要求"把资料交上来"

2. 交上来的是几百个文件:Word、PDF、扫描件、Excel、还有几个 PPT

3. 里面混着 2021 年的旧流程、废弃的价目表、三个版本的同一份制度

4. 全部导入系统,宣布"知识库建成"

5. 员工问了几次,答案要么过时要么互相矛盾

6. 三周后没人再用了

关键的失败点在第 4 步:把"导入完成"当成了"知识库建成"。

导入是搬运,不是建设。中间隔着四道工序:内容治理、切分、检索策略、质量验证。这四道每一道都能让最终效果崩掉。

我们自己踩过同一个坑

这不是在说别人。2026 年 8 月,我们把自己官网的内容盘了一遍,结果是:

  • 全站 142 个页面
  • 其中 51 页(36%)只有摘要和提纲,没有实质内容
  • 41 页正文不足 1200 字
  • 洞察类页面正文的中位数是 893 字,而这 893 字里还有大半是"这篇讨论什么""阅读提纲""相关检索词"这类框架

从"有多少篇"看,内容很丰富;从"每篇真讲了什么"看,接近于空。

这正是资料坟场的标准形态——数量掩盖了密度。企业知识库出问题时,第一反应往往是"资料还不够多,再导一批",而真正该问的是"已经导进去的这些,有多少是真能回答问题的"。

我们的处理办法是逐篇重写,而不是再导一批。这篇文章本身就是那次重写的产物之一。

---

第一道:内容治理(最枯燥,也最决定成败)

要做的事

  • 去重:同一份制度的三个版本,只留一份有效的,其余归档
  • 去过期:明确标注失效日期,或者直接移出检索范围
  • 补上下文:很多文档只有正文没有背景,比如一份价目表没写适用时间和适用客户类型,AI 检索到之后会当成通用规则
  • 拆开混合文档:一份 80 页的手册里可能包含十个不相关的主题,整份塞进去检索效果会很差

判断做没做到位的一个方法:随机抽 20 份资料,问业务方"这份现在还有效吗、适用于什么情况"。如果超过三分之一答不上来,说明治理没做够。

这一步没有捷径。没有任何技术能自动判断哪份价目表是现行的——那需要业务知识。

---

第二道:切分(技术上最容易被忽略)

文档要切成小块才能被检索。切法直接决定检索质量:

  • 切太大:一个块里混了多个主题,检索时相关度被稀释
  • 切太小:语义不完整,检索到一个片段但缺少必要上下文
  • 按固定字数硬切:会把一句话、一张表、一个条款从中间切断

比较稳的做法是按文档结构切(按章节、按条款、按问答对),并让相邻块有一定重叠,避免边界信息丢失。表格和列表通常需要单独处理——它们被硬切之后基本就废了。

一组可以直接拿去用的起步参数(不是最优解,是"先跑起来不至于太差"的默认值):

参数起步值什么时候该调
块大小300–800 字文档段落普遍很长时往上调
相邻块重叠块大小的 10–15%答案经常缺前半句时往上调
每次检索返回块数3–8 块上下文精确率低时往下调
表格 / 代码整块不切——

为什么给区间不给定值:最优参数取决于你的文档形态,只能实测。但从这组值起步,比拍脑袋定一个数少走很多弯路——关键是每调一次都要用同一批问题重新量四个指标,否则就是在盲调。

---

第三道:检索策略

只用向量检索是不够的。向量擅长"意思相近",但对精确匹配很弱:员工问"3.2 条怎么规定的",纯向量检索经常找不到那一条。

实践中比较稳的组合是关键词检索 + 向量检索并行,然后重排序。前者管精确匹配(编号、专有名词、型号),后者管语义相似,重排序决定最终给模型看哪几段。

另一个必须处理的:权限。检索必须在权限范围内进行,不能先检索出来再过滤——那样会从回答的措辞里泄露出不该看到的信息存在。

---

第四道:质量验证

这一步最常被跳过,因为"看起来能答"就以为好了。

必须分开量四个指标(下面的定义直接沿用开源评测框架 RAGAS 的口径,docs.ragas.io,不用自己发明):

指标量什么低了说明什么
上下文召回率该被找到的资料,找到了几成切分或检索策略有问题
上下文精确率找出来的资料里,真正相关的占几成检索噪声大,会干扰模型
答案忠实度回答里每句话能不能在检索到的资料里找到依据模型在编
答案相关性回答有没有真的在回答问题答非所问

为什么必须分开:答错了到底是"没找到资料"还是"找到了但模型答歪了",这两种病的处方完全不同。混在一起看,永远定位不了。

关于幻觉,有一个公开的持续评测可以参考(Vectara 的 HHEM 榜,github.com/vectara/hallucination-leaderboard)——它测的是有文档做依据时主流模型的幻觉率,也就是最有利的条件。企业场景通常更难,所以工程上必须有兜底:给出处、答不上时明确拒答、关键结论要求人工确认。

---

六个信号,说明你的知识库正在变成坟场

不用等三个月,这些信号随时可以自查:

1. 说不清谁负责更新。问一圈没人认领,或者答案是"IT 部门"——IT 不懂业务,判断不了哪份文档过期了。

2. 导入之后再没变过。业务在变,资料不变,两周就开始失真。

3. 没有人在看使用数据。每天多少人问、问了什么、答得满不满意——这些不看,就不知道它在退化。

4. 答案里没有出处。用户没法判断该不该信,只能自己再查一遍,那系统就没省事。

5. 没有拒答。任何问题都给个答案的系统,一定在编。

6. 回归测试集不存在。改一次就可能把原来对的改错,没有对照就发现不了。

中三条以上,基本可以确定它已经在往坟场走了。

---

正确的做法:从一个小场景开始

不要一次性把所有资料都导进去。

正确的顺序是:

1. 选一个高频、边界清楚的问题域——比如"报销制度问答",而不是"公司所有知识"

2. 只治理这个域的资料——几十份,能真正做干净

3. 让真实用户用两周,量上面那四个指标

4. 达标之后再扩下一个域

为什么这么做:一次性全导进去,一旦效果不好,你连"是哪一部分资料的问题"都定位不了。分域推进,每一域都可验证、可回滚。

---

一条容易被忽略的运营机制

知识库不是项目,是运营。上线那天不是终点。

至少要定下来这四件事:

  • 谁负责更新:必须是懂业务的人,而且要有明确的时间承诺
  • 多久更新一次:跟着业务节奏,不是固定周期
  • 更新后谁验证:改完要重跑回归测试集,确认没把原来对的改错
  • 用户反馈答错了流向谁:有人接、有时限、修完要通知反馈的人

最后一条决定了用户会不会继续反馈。如果反馈了没下文,第二次就没人反馈了,你也就失去了唯一的质量信号。

---

相关阅读

  • 企业 AI 项目怎么验收:七层验收标准与证据要求
  • 企业第一次做 AI,应该先建知识库还是先做智能体
  • 企业 AI 项目 ROI 怎么算:从人工基线、业务结果到风险成本怎样量

---

*本文说明的是方法与判断标准,不代表任何未公开项目的实施细节。文中引用的开源评测框架与公开榜单,出处已在正文标明,读者可自行核验。*