企业 AI 项目:什么才算证明它真的有用
项目做完,最终要回答一个问题:
它到底有没有用?
大部分项目答不上来。不是因为没效果,是因为从一开始就没准备能回答这个问题的材料。
到了要交代的时候,能拿出来的通常是一次演示、几句好评、还有一个"大家反馈都挺好"。这些都不是证据。
---
五级证据分级
不是所有材料的证明力都一样。按这五级看,就知道手里的东西值多少:
| 级别 | 是什么 | 证明力 | 常见程度 |
|---|---|---|---|
| E1 演示 | 现场跑一遍给人看 | 接近 0 | 最常见 |
| E2 好评 | 使用者说好用 | 很低 | 常见 |
| E3 使用数据 | 多少人在用、用了多少次 | 中 | 较少 |
| E4 对照结果 | 同一批样本上,新旧做法的对比 | 高 | 罕见 |
| E5 业务结果 | 实际业务指标变化 | 高,但归因难 | 罕见 |
E1 和 E2 是大部分项目的全部家当,而它们几乎不证明任何事。
为什么演示不算证据:演示用的样例是挑过的。任何系统都能在挑过的样例上表现良好——这不是造假,是选择偏差,而且往往是无意的。
为什么好评的证明力很低:新东西天然会得到正面反馈(新鲜感、给面子、不想显得跟不上)。上线第一个月的好评,几乎不预测第六个月的使用率。
---
E4 是关键:对照结果
唯一有说服力的,是同一批样本上的前后对比。
三个必要条件:
一、样本必须固定,且在项目开始前就冻结。
- 50–100 个真实案例
- 包含典型和边界情况
- 必须包含"现在这套做法也做不好"的案例
- 冻结之后不许改——中途换样本,前后就没法比
二、基线必须在项目开始前量。
在这批样本上,先量现在的做法:耗时、正确率、人工介入比例。
项目开始后再补的基线一定失真——因为那时候你已经知道要往哪个方向证明了。这不是诚信问题,是认知偏差,谁都免不了。
三、对比要在同一批样本上做。
不能拿"上线后的新案例"和"上线前的老案例"比——那两批的难度分布可能完全不同。
---
E5 的陷阱:归因
业务指标变好了,能不能算 AI 的功劳?
通常不能直接算。因为同期还发生了很多别的事:市场变化、人员调整、流程改造、季节因素。
务实的处理方式有三种:
| 方式 | 做法 | 适用 |
|---|---|---|
| 分组对比 | 一部分人用、一部分不用,同期比较 | 最可靠,但不是所有场景能做 |
| 分阶段上线 | 按部门/区域先后上线,比较上线前后 | 较常用 |
| 只报关联不报因果 | 明确说"同期该指标变化为 X",不声称是 AI 造成的 | 最诚实,也最安全 |
第三种被严重低估。说"这段时间该指标改善了 X,同期我们上线了这个系统",比硬说"AI 带来了 X% 的提升"更站得住——而且后者一旦被追问归因,会很难看。
---
证据要在什么时候准备
答案是:项目开始之前。
这是整件事最反直觉的地方——准备证明材料不是验收阶段的工作,是启动阶段的工作。
具体时间线:
`
立项时 → 冻结固定样本,量基线,写下验收标准
开发中 → 每轮迭代都在同一批样本上跑,留下每轮结果
上线时 → 完整跑一次,作为交付证据
上线后每月 → 重跑,观察是否退化
`
"每轮迭代都在同一批样本上跑"这一条最容易被跳过,但它的价值很大:它让你知道每一次改动到底有没有用。没有它,团队会陷入"改了很多、不知道哪个起作用"的状态。
---
一份证据清单
项目结束时,下面这些应该都在:
- [ ] 固定样本集(含冻结时间和样本选取说明)
- [ ] 基线测量结果(含测量时间和方法)
- [ ] 每轮迭代在固定样本上的结果(有版本、有日期)
- [ ] 上线时的完整评测结果
- [ ] 四项指标分开的数据(不是一个总分)
- [ ] 使用数据(多少人、多少次、什么问题问得最多)
- [ ] 未命中问题清单(系统答不上来的那些)
- [ ] 用户反馈记录及处理情况
- [ ] 上线后每月的重跑结果
指标口径沿用开源评测框架 RAGAS(docs.ragas.io):上下文召回率、上下文精确率、答案忠实度、答案相关性。
"四项分开"这一条特别重要。一个总分说明不了任何问题——指标要能指向"该修哪里",否则它只是一个用来汇报的数字。
---
为什么这件事值得认真做
MIT 的 NANDA 项目 2025 年发布的《The GenAI Divide》给出过一个被反复引用的数字:约 95% 的企业级生成式 AI 试点没有产生可测量的损益影响(nanda.media.mit.edu)。
这个 95% 有争议,但"可测量"这三个字值得琢磨。
有相当一部分项目并不是真的没效果,而是从来没有准备过能测量它的材料。到了要说明的时候,只能拿出演示和好评——于是在统计上,它和一个真的没效果的项目长得一模一样。
提前准备好这些材料的价值,是让真的有效果的项目能被证明有效果。
---
一条给内部推动者的话
如果你是企业内部推动这件事的人,这些材料最大的价值不是对外交代,是保护你自己。
一个有完整证据链的项目:
- 效果好,你能说清好在哪,下一步扩范围有依据
- 效果不好,你能说清为什么不好、卡在哪一环——这也是有价值的结论
- 中途要停,是按事先约定的停止条件执行,不是谁的判断失误
没有证据链的项目,无论结果好坏,最后都会变成一场关于感受的争论。而在那种争论里,推动者是最吃亏的一方。
---
相关阅读
- 企业第一次做 AI,怎样选对项目并设计可退出的试点
- 企业 AI 项目怎么验收:七层验收标准与证据要求
- 企业 AI 上线之后:系统是怎么安静地退化的
- 企业 AI 项目多少钱:把预算拆成四段再谈价
---
*本文说明的是方法与判断标准,不代表任何未公开项目的实施细节。文中引用的开源评测框架与公开研究,出处已在正文标明,读者可自行核验。*