企业第一次做 AI,怎样选对项目并设计可退出的试点

第一次 AI 试点最怕两个极端:只做一个好看的演示,或者一开始就改造全公司。

前者花小钱办不成事——演示过后没有下文,因为它从来没在真实数据上跑过。后者花大钱办砸事——摊子铺太大,出了问题连"是哪一部分的问题"都定位不了。

中间那条路是:选一个真实、高频、可量化、风险可控的任务,用固定样本证明价值,同时提前写清什么情况下停止。

---

先把经营问题翻译成工作任务

老板提的通常是经营问题:"客服成本太高""销售转化上不去""质量老出问题"。

这些不能直接做。必须先翻译成一个具体的工作任务,翻译的标准是能填满下面这句话:

什么时候什么事,一次花 多长时间,做错了会 怎样

举例,"客服成本太高"可以翻译成很多个不同的任务:

  • 客服每天要回答大量重复问题 → 重复问答的自助化
  • 客服要在五个系统间来回查 → 信息聚合
  • 新客服上手要三个月 → 知识辅助
  • 投诉处理流程长 → 工单流转优化

这四个是完全不同的项目,成本、难度、见效速度都不一样。不做这一步翻译,需求会一直在天上飘。

---

选任务的五条标准

候选任务列出来之后,逐条打分:

标准为什么重要不达标的样子
真实是现在每天在发生的事"以后可能会用到"
高频频次够高才能快速积累证据一个月发生两次
可量化有基线数字可对比只能说"感觉好点了"
风险可控答错了有人兜底、后果不严重直接对外发布、涉及资金
边界清楚能说清什么问题属于范围内"公司所有知识"

五条里最容易被牺牲的是"风险可控"——大家总想拿最重要的场景开刀,觉得那样才显得有价值。但第一个项目的真正目标不是创造价值,是建立信心和积累方法。选一个错了也不要紧的场景,团队才敢真上,才有机会暴露真问题。

五条里最不能牺牲的是"可量化"。没有基线的试点,最后一定变成一场关于"到底有没有用"的争论。

一组可以直接用的起步参数:候选任务列 5–8 个,五条标准每条按 1–3 分打分,取总分前 2 名进入详细评估。低于 10 分(满分 15)的任务不建议作为第一个项目——分数低通常不是任务不重要,而是现在还看不清

---

试点必须有的三样东西

一、固定样本

在开工之前,选出 50–100 个真实案例,冻结起来。

  • 包含典型情况,也要包含边界情况
  • 必须包含"现在这套做法也做不好"的案例——那才是真问题
  • 冻结之后不许改。中途换样本,前后就没法比了

这批样本后来就是验收测试集。它是整个项目里最有价值的资产之一,比任何技术选型都重要。

二、基线数字

在同一批样本上,先量一遍现在的做法

  • 平均耗时
  • 正确率或返工率
  • 需要人工介入的比例

这些数字要在项目开始前拿到。项目开始后再补的基线,一定是失真的——因为你已经知道要往哪个方向证明了。

三、停止条件

这是最容易被跳过、也最关键的一样。

要在开工前写清楚:什么情况下这个项目应该中止。例如:

  • 在固定样本上跑 3 轮,关键指标仍达不到基线水平(例如正确率始终低于人工基线的 90%)
  • 需要的资料治理工作量超过预估的两倍
  • 必须的系统接口在约定时间内拿不到

为什么必须写:没有停止条件的项目不会失败,只会一直花钱——因为每一次都可以说"再改一版就好了"。写清楚了,中止就是按约定执行,不是谁的责任问题。

MIT 的 NANDA 项目 2025 年发布的《The GenAI Divide》给出过一个被反复引用的数字:约 95% 的企业生成式 AI 试点没有产生可测量的损益影响(nanda.media.mit.edu)。这个 95% 有争议,但它反映的模式值得警惕——试点做了很多,能说清结果的很少。而说不清结果,往往正是因为一开始就没定基线和停止条件。

---

政策环境给企业补了什么

2025 年 8 月,国务院发布《关于深入实施"人工智能+"行动的意见》(www.gov.cn),从数据、算力、开源生态、人才、标准和安全等方面部署了推进方向。

对企业做试点来说,这份文件的实际意义在于:它把"要不要做"这个问题的环境不确定性降低了,配套的数据、算力、标准建设都在推进。

但要说清楚的是:政策解决的是环境问题,不解决方法问题。具体到一个企业该先做哪件事、怎么验收、什么时候停,仍然要靠上面那套自己的判断。不要因为"政策鼓励"就跳过基线和停止条件——那是两回事。

---

一个可以直接照抄的试点设计模板

`

任务:______ 在 ______ 时候做 ______

现状基线(固定样本 n=___):

· 平均耗时 ___ 分钟

· 正确率 ___%

· 人工介入比例 ___%

目标(同一批样本上):

· 耗时降到 ___ 分钟以内

· 正确率不低于 ___%

· 人工介入比例降到 ___% 以内

周期:___ 周

停止条件:

· 第 ___ 轮后指标仍低于 ______ → 中止

· 资料治理工作量超过 ___ 人天 → 重新评估范围

· ______ 接口在第 ___ 周仍拿不到 → 换任务

上线后谁负责:______(姓名,不是部门)

`

最后一行不能写"IT 部门"。必须是一个具体的人,而且这个人要懂业务——技术人员判断不了哪份文档已经过期。

---

试点结束后的三种正确结局

试点做完,只有三种合理结局。"继续再看看"不是其中之一。

1. 达标 → 扩范围。明确下一个域是什么,用同样的方法再来一遍。

2. 没达标但知道差在哪 → 改一个变量再试一轮。一轮只改一件事,否则不知道是哪个改动起了作用。

3. 没达标且原因是任务本身不适合 → 换任务。这不是失败,这是诊断的产物——你现在知道了一件重要的事。

第三种结局最有价值,也最需要事先约定好。如果没有停止条件,第三种结局永远不会发生,项目会变成第四种:无限期延续。

---

相关阅读

  • 企业做 AI 项目前需要准备哪些资料
  • 企业 AI 项目怎么验收:七层验收标准与证据要求
  • 企业 AI 项目多少钱:把预算拆成四段再谈价
  • 企业知识库怎么做,才不会变成资料坟场

---

*本文说明的是方法与判断标准,不代表任何未公开项目的实施细节。文中引用的公开政策文件与研究报告,出处已在正文标明,读者可自行核验。*