企业第一次做 AI,怎样选对项目并设计可退出的试点
第一次 AI 试点最怕两个极端:只做一个好看的演示,或者一开始就改造全公司。
前者花小钱办不成事——演示过后没有下文,因为它从来没在真实数据上跑过。后者花大钱办砸事——摊子铺太大,出了问题连"是哪一部分的问题"都定位不了。
中间那条路是:选一个真实、高频、可量化、风险可控的任务,用固定样本证明价值,同时提前写清什么情况下停止。
---
先把经营问题翻译成工作任务
老板提的通常是经营问题:"客服成本太高""销售转化上不去""质量老出问题"。
这些不能直接做。必须先翻译成一个具体的工作任务,翻译的标准是能填满下面这句话:
谁 在 什么时候 做 什么事,一次花 多长时间,做错了会 怎样。
举例,"客服成本太高"可以翻译成很多个不同的任务:
- 客服每天要回答大量重复问题 → 重复问答的自助化
- 客服要在五个系统间来回查 → 信息聚合
- 新客服上手要三个月 → 知识辅助
- 投诉处理流程长 → 工单流转优化
这四个是完全不同的项目,成本、难度、见效速度都不一样。不做这一步翻译,需求会一直在天上飘。
---
选任务的五条标准
候选任务列出来之后,逐条打分:
| 标准 | 为什么重要 | 不达标的样子 |
|---|---|---|
| 真实 | 是现在每天在发生的事 | "以后可能会用到" |
| 高频 | 频次够高才能快速积累证据 | 一个月发生两次 |
| 可量化 | 有基线数字可对比 | 只能说"感觉好点了" |
| 风险可控 | 答错了有人兜底、后果不严重 | 直接对外发布、涉及资金 |
| 边界清楚 | 能说清什么问题属于范围内 | "公司所有知识" |
五条里最容易被牺牲的是"风险可控"——大家总想拿最重要的场景开刀,觉得那样才显得有价值。但第一个项目的真正目标不是创造价值,是建立信心和积累方法。选一个错了也不要紧的场景,团队才敢真上,才有机会暴露真问题。
五条里最不能牺牲的是"可量化"。没有基线的试点,最后一定变成一场关于"到底有没有用"的争论。
一组可以直接用的起步参数:候选任务列 5–8 个,五条标准每条按 1–3 分打分,取总分前 2 名进入详细评估。低于 10 分(满分 15)的任务不建议作为第一个项目——分数低通常不是任务不重要,而是现在还看不清。
---
试点必须有的三样东西
一、固定样本
在开工之前,选出 50–100 个真实案例,冻结起来。
- 包含典型情况,也要包含边界情况
- 必须包含"现在这套做法也做不好"的案例——那才是真问题
- 冻结之后不许改。中途换样本,前后就没法比了
这批样本后来就是验收测试集。它是整个项目里最有价值的资产之一,比任何技术选型都重要。
二、基线数字
在同一批样本上,先量一遍现在的做法:
- 平均耗时
- 正确率或返工率
- 需要人工介入的比例
这些数字要在项目开始前拿到。项目开始后再补的基线,一定是失真的——因为你已经知道要往哪个方向证明了。
三、停止条件
这是最容易被跳过、也最关键的一样。
要在开工前写清楚:什么情况下这个项目应该中止。例如:
- 在固定样本上跑 3 轮,关键指标仍达不到基线水平(例如正确率始终低于人工基线的 90%)
- 需要的资料治理工作量超过预估的两倍
- 必须的系统接口在约定时间内拿不到
为什么必须写:没有停止条件的项目不会失败,只会一直花钱——因为每一次都可以说"再改一版就好了"。写清楚了,中止就是按约定执行,不是谁的责任问题。
MIT 的 NANDA 项目 2025 年发布的《The GenAI Divide》给出过一个被反复引用的数字:约 95% 的企业生成式 AI 试点没有产生可测量的损益影响(nanda.media.mit.edu)。这个 95% 有争议,但它反映的模式值得警惕——试点做了很多,能说清结果的很少。而说不清结果,往往正是因为一开始就没定基线和停止条件。
---
政策环境给企业补了什么
2025 年 8 月,国务院发布《关于深入实施"人工智能+"行动的意见》(www.gov.cn),从数据、算力、开源生态、人才、标准和安全等方面部署了推进方向。
对企业做试点来说,这份文件的实际意义在于:它把"要不要做"这个问题的环境不确定性降低了,配套的数据、算力、标准建设都在推进。
但要说清楚的是:政策解决的是环境问题,不解决方法问题。具体到一个企业该先做哪件事、怎么验收、什么时候停,仍然要靠上面那套自己的判断。不要因为"政策鼓励"就跳过基线和停止条件——那是两回事。
---
一个可以直接照抄的试点设计模板
`
任务:______ 在 ______ 时候做 ______
现状基线(固定样本 n=___):
· 平均耗时 ___ 分钟
· 正确率 ___%
· 人工介入比例 ___%
目标(同一批样本上):
· 耗时降到 ___ 分钟以内
· 正确率不低于 ___%
· 人工介入比例降到 ___% 以内
周期:___ 周
停止条件:
· 第 ___ 轮后指标仍低于 ______ → 中止
· 资料治理工作量超过 ___ 人天 → 重新评估范围
· ______ 接口在第 ___ 周仍拿不到 → 换任务
上线后谁负责:______(姓名,不是部门)
`
最后一行不能写"IT 部门"。必须是一个具体的人,而且这个人要懂业务——技术人员判断不了哪份文档已经过期。
---
试点结束后的三种正确结局
试点做完,只有三种合理结局。"继续再看看"不是其中之一。
1. 达标 → 扩范围。明确下一个域是什么,用同样的方法再来一遍。
2. 没达标但知道差在哪 → 改一个变量再试一轮。一轮只改一件事,否则不知道是哪个改动起了作用。
3. 没达标且原因是任务本身不适合 → 换任务。这不是失败,这是诊断的产物——你现在知道了一件重要的事。
第三种结局最有价值,也最需要事先约定好。如果没有停止条件,第三种结局永远不会发生,项目会变成第四种:无限期延续。
---
相关阅读
- 企业做 AI 项目前需要准备哪些资料
- 企业 AI 项目怎么验收:七层验收标准与证据要求
- 企业 AI 项目多少钱:把预算拆成四段再谈价
- 企业知识库怎么做,才不会变成资料坟场
---
*本文说明的是方法与判断标准,不代表任何未公开项目的实施细节。文中引用的公开政策文件与研究报告,出处已在正文标明,读者可自行核验。*