企业 AI 项目:什么才算证明它真的有用

项目做完,最终要回答一个问题:

它到底有没有用?

大部分项目答不上来。不是因为没效果,是因为从一开始就没准备能回答这个问题的材料

到了要交代的时候,能拿出来的通常是一次演示、几句好评、还有一个"大家反馈都挺好"。这些都不是证据。

---

五级证据分级

不是所有材料的证明力都一样。按这五级看,就知道手里的东西值多少:

级别是什么证明力常见程度
E1 演示现场跑一遍给人看接近 0最常见
E2 好评使用者说好用很低常见
E3 使用数据多少人在用、用了多少次较少
E4 对照结果同一批样本上,新旧做法的对比罕见
E5 业务结果实际业务指标变化高,但归因难罕见

E1 和 E2 是大部分项目的全部家当,而它们几乎不证明任何事。

为什么演示不算证据:演示用的样例是挑过的。任何系统都能在挑过的样例上表现良好——这不是造假,是选择偏差,而且往往是无意的。

为什么好评的证明力很低:新东西天然会得到正面反馈(新鲜感、给面子、不想显得跟不上)。上线第一个月的好评,几乎不预测第六个月的使用率。

---

E4 是关键:对照结果

唯一有说服力的,是同一批样本上的前后对比。

三个必要条件:

一、样本必须固定,且在项目开始前就冻结。

  • 50–100 个真实案例
  • 包含典型和边界情况
  • 必须包含"现在这套做法也做不好"的案例
  • 冻结之后不许改——中途换样本,前后就没法比

二、基线必须在项目开始前量。

在这批样本上,先量现在的做法:耗时、正确率、人工介入比例。

项目开始后再补的基线一定失真——因为那时候你已经知道要往哪个方向证明了。这不是诚信问题,是认知偏差,谁都免不了。

三、对比要在同一批样本上做。

不能拿"上线后的新案例"和"上线前的老案例"比——那两批的难度分布可能完全不同

---

E5 的陷阱:归因

业务指标变好了,能不能算 AI 的功劳?

通常不能直接算。因为同期还发生了很多别的事:市场变化、人员调整、流程改造、季节因素。

务实的处理方式有三种

方式做法适用
分组对比一部分人用、一部分不用,同期比较最可靠,但不是所有场景能做
分阶段上线按部门/区域先后上线,比较上线前后较常用
只报关联不报因果明确说"同期该指标变化为 X",不声称是 AI 造成的最诚实,也最安全

第三种被严重低估。说"这段时间该指标改善了 X,同期我们上线了这个系统",比硬说"AI 带来了 X% 的提升"更站得住——而且后者一旦被追问归因,会很难看

---

证据要在什么时候准备

答案是:项目开始之前。

这是整件事最反直觉的地方——准备证明材料不是验收阶段的工作,是启动阶段的工作。

具体时间线:

`

立项时 → 冻结固定样本,量基线,写下验收标准

开发中 → 每轮迭代都在同一批样本上跑,留下每轮结果

上线时 → 完整跑一次,作为交付证据

上线后每月 → 重跑,观察是否退化

`

"每轮迭代都在同一批样本上跑"这一条最容易被跳过,但它的价值很大:它让你知道每一次改动到底有没有用。没有它,团队会陷入"改了很多、不知道哪个起作用"的状态。

---

一份证据清单

项目结束时,下面这些应该都在:

  • [ ] 固定样本集(含冻结时间和样本选取说明)
  • [ ] 基线测量结果(含测量时间和方法)
  • [ ] 每轮迭代在固定样本上的结果(有版本、有日期)
  • [ ] 上线时的完整评测结果
  • [ ] 四项指标分开的数据(不是一个总分)
  • [ ] 使用数据(多少人、多少次、什么问题问得最多)
  • [ ] 未命中问题清单(系统答不上来的那些)
  • [ ] 用户反馈记录及处理情况
  • [ ] 上线后每月的重跑结果

指标口径沿用开源评测框架 RAGAS(docs.ragas.io:上下文召回率、上下文精确率、答案忠实度、答案相关性。

"四项分开"这一条特别重要。一个总分说明不了任何问题——指标要能指向"该修哪里",否则它只是一个用来汇报的数字。

---

为什么这件事值得认真做

MIT 的 NANDA 项目 2025 年发布的《The GenAI Divide》给出过一个被反复引用的数字:约 95% 的企业级生成式 AI 试点没有产生可测量的损益影响(nanda.media.mit.edu)。

这个 95% 有争议,但"可测量"这三个字值得琢磨

有相当一部分项目并不是真的没效果,而是从来没有准备过能测量它的材料。到了要说明的时候,只能拿出演示和好评——于是在统计上,它和一个真的没效果的项目长得一模一样。

提前准备好这些材料的价值,是让真的有效果的项目能被证明有效果。

---

一条给内部推动者的话

如果你是企业内部推动这件事的人,这些材料最大的价值不是对外交代,是保护你自己

一个有完整证据链的项目:

  • 效果好,你能说清好在哪,下一步扩范围有依据
  • 效果不好,你能说清为什么不好、卡在哪一环——这也是有价值的结论
  • 中途要停,是按事先约定的停止条件执行,不是谁的判断失误

没有证据链的项目,无论结果好坏,最后都会变成一场关于感受的争论。而在那种争论里,推动者是最吃亏的一方

---

相关阅读

  • 企业第一次做 AI,怎样选对项目并设计可退出的试点
  • 企业 AI 项目怎么验收:七层验收标准与证据要求
  • 企业 AI 上线之后:系统是怎么安静地退化的
  • 企业 AI 项目多少钱:把预算拆成四段再谈价

---

*本文说明的是方法与判断标准,不代表任何未公开项目的实施细节。文中引用的开源评测框架与公开研究,出处已在正文标明,读者可自行核验。*