企业知识库怎么做,才不会变成资料坟场
大部分企业知识库最后都变成了同一个东西:一个没人打开的文件夹。
接上 AI 之后,这个问题不但没解决,还多了一层——现在它变成了一个会一本正经胡说的文件夹。
这篇讲清楚三件事:为什么会这样、怎么判断你的知识库是不是在往这个方向走、以及正确的做法是什么。
---
资料坟场是怎么形成的
不是因为资料太少,恰恰是因为太多、太杂、没人负责。
典型的路径是这样:
1. 项目启动,各部门被要求"把资料交上来"
2. 交上来的是几百个文件:Word、PDF、扫描件、Excel、还有几个 PPT
3. 里面混着 2021 年的旧流程、废弃的价目表、三个版本的同一份制度
4. 全部导入系统,宣布"知识库建成"
5. 员工问了几次,答案要么过时要么互相矛盾
6. 三周后没人再用了
关键的失败点在第 4 步:把"导入完成"当成了"知识库建成"。
导入是搬运,不是建设。中间隔着四道工序:内容治理、切分、检索策略、质量验证。这四道每一道都能让最终效果崩掉。
我们自己踩过同一个坑
这不是在说别人。2026 年 8 月,我们把自己官网的内容盘了一遍,结果是:
- 全站 142 个页面
- 其中 51 页(36%)只有摘要和提纲,没有实质内容
- 41 页正文不足 1200 字
- 洞察类页面正文的中位数是 893 字,而这 893 字里还有大半是"这篇讨论什么""阅读提纲""相关检索词"这类框架
从"有多少篇"看,内容很丰富;从"每篇真讲了什么"看,接近于空。
这正是资料坟场的标准形态——数量掩盖了密度。企业知识库出问题时,第一反应往往是"资料还不够多,再导一批",而真正该问的是"已经导进去的这些,有多少是真能回答问题的"。
我们的处理办法是逐篇重写,而不是再导一批。这篇文章本身就是那次重写的产物之一。
---
第一道:内容治理(最枯燥,也最决定成败)
要做的事:
- 去重:同一份制度的三个版本,只留一份有效的,其余归档
- 去过期:明确标注失效日期,或者直接移出检索范围
- 补上下文:很多文档只有正文没有背景,比如一份价目表没写适用时间和适用客户类型,AI 检索到之后会当成通用规则
- 拆开混合文档:一份 80 页的手册里可能包含十个不相关的主题,整份塞进去检索效果会很差
判断做没做到位的一个方法:随机抽 20 份资料,问业务方"这份现在还有效吗、适用于什么情况"。如果超过三分之一答不上来,说明治理没做够。
这一步没有捷径。没有任何技术能自动判断哪份价目表是现行的——那需要业务知识。
---
第二道:切分(技术上最容易被忽略)
文档要切成小块才能被检索。切法直接决定检索质量:
- 切太大:一个块里混了多个主题,检索时相关度被稀释
- 切太小:语义不完整,检索到一个片段但缺少必要上下文
- 按固定字数硬切:会把一句话、一张表、一个条款从中间切断
比较稳的做法是按文档结构切(按章节、按条款、按问答对),并让相邻块有一定重叠,避免边界信息丢失。表格和列表通常需要单独处理——它们被硬切之后基本就废了。
一组可以直接拿去用的起步参数(不是最优解,是"先跑起来不至于太差"的默认值):
| 参数 | 起步值 | 什么时候该调 |
|---|---|---|
| 块大小 | 300–800 字 | 文档段落普遍很长时往上调 |
| 相邻块重叠 | 块大小的 10–15% | 答案经常缺前半句时往上调 |
| 每次检索返回块数 | 3–8 块 | 上下文精确率低时往下调 |
| 表格 / 代码 | 整块不切 | —— |
为什么给区间不给定值:最优参数取决于你的文档形态,只能实测。但从这组值起步,比拍脑袋定一个数少走很多弯路——关键是每调一次都要用同一批问题重新量四个指标,否则就是在盲调。
---
第三道:检索策略
只用向量检索是不够的。向量擅长"意思相近",但对精确匹配很弱:员工问"3.2 条怎么规定的",纯向量检索经常找不到那一条。
实践中比较稳的组合是关键词检索 + 向量检索并行,然后重排序。前者管精确匹配(编号、专有名词、型号),后者管语义相似,重排序决定最终给模型看哪几段。
另一个必须处理的:权限。检索必须在权限范围内进行,不能先检索出来再过滤——那样会从回答的措辞里泄露出不该看到的信息存在。
---
第四道:质量验证
这一步最常被跳过,因为"看起来能答"就以为好了。
必须分开量四个指标(下面的定义直接沿用开源评测框架 RAGAS 的口径,docs.ragas.io,不用自己发明):
| 指标 | 量什么 | 低了说明什么 |
|---|---|---|
| 上下文召回率 | 该被找到的资料,找到了几成 | 切分或检索策略有问题 |
| 上下文精确率 | 找出来的资料里,真正相关的占几成 | 检索噪声大,会干扰模型 |
| 答案忠实度 | 回答里每句话能不能在检索到的资料里找到依据 | 模型在编 |
| 答案相关性 | 回答有没有真的在回答问题 | 答非所问 |
为什么必须分开:答错了到底是"没找到资料"还是"找到了但模型答歪了",这两种病的处方完全不同。混在一起看,永远定位不了。
关于幻觉,有一个公开的持续评测可以参考(Vectara 的 HHEM 榜,github.com/vectara/hallucination-leaderboard)——它测的是有文档做依据时主流模型的幻觉率,也就是最有利的条件。企业场景通常更难,所以工程上必须有兜底:给出处、答不上时明确拒答、关键结论要求人工确认。
---
六个信号,说明你的知识库正在变成坟场
不用等三个月,这些信号随时可以自查:
1. 说不清谁负责更新。问一圈没人认领,或者答案是"IT 部门"——IT 不懂业务,判断不了哪份文档过期了。
2. 导入之后再没变过。业务在变,资料不变,两周就开始失真。
3. 没有人在看使用数据。每天多少人问、问了什么、答得满不满意——这些不看,就不知道它在退化。
4. 答案里没有出处。用户没法判断该不该信,只能自己再查一遍,那系统就没省事。
5. 没有拒答。任何问题都给个答案的系统,一定在编。
6. 回归测试集不存在。改一次就可能把原来对的改错,没有对照就发现不了。
中三条以上,基本可以确定它已经在往坟场走了。
---
正确的做法:从一个小场景开始
不要一次性把所有资料都导进去。
正确的顺序是:
1. 选一个高频、边界清楚的问题域——比如"报销制度问答",而不是"公司所有知识"
2. 只治理这个域的资料——几十份,能真正做干净
3. 让真实用户用两周,量上面那四个指标
4. 达标之后再扩下一个域
为什么这么做:一次性全导进去,一旦效果不好,你连"是哪一部分资料的问题"都定位不了。分域推进,每一域都可验证、可回滚。
---
一条容易被忽略的运营机制
知识库不是项目,是运营。上线那天不是终点。
至少要定下来这四件事:
- 谁负责更新:必须是懂业务的人,而且要有明确的时间承诺
- 多久更新一次:跟着业务节奏,不是固定周期
- 更新后谁验证:改完要重跑回归测试集,确认没把原来对的改错
- 用户反馈答错了流向谁:有人接、有时限、修完要通知反馈的人
最后一条决定了用户会不会继续反馈。如果反馈了没下文,第二次就没人反馈了,你也就失去了唯一的质量信号。
---
相关阅读
- 企业 AI 项目怎么验收:七层验收标准与证据要求
- 企业第一次做 AI,应该先建知识库还是先做智能体
- 企业 AI 项目 ROI 怎么算:从人工基线、业务结果到风险成本怎样量
---
*本文说明的是方法与判断标准,不代表任何未公开项目的实施细节。文中引用的开源评测框架与公开榜单,出处已在正文标明,读者可自行核验。*