关于这个问题,市面上的回答基本分两类:一类说不做就会被淘汰,一类说都是泡沫别跟风。两类都不能拿来做决定,因为它们讨论的是行业,而你要决定的是你自己这家公司的下一笔预算。

这篇给一个可以自己走一遍的判断方法。它的结论可能是"现在不该做"——这也是一个合格的结论。


先看一个容易被误读的数字

MIT 的 NANDA 项目在 2025 年发布过一份《The GenAI Divide》,里面有个被反复引用的数字:约 95% 的企业生成式 AI 试点没有产生可测量的损益影响。

这个数字经常被两边各取所需地引用。更值得注意的是"可测量"这三个字。

相当一部分项目并不是真的没效果,而是从一开始就没准备过能测量它的材料。到了要交代的时候,能拿出来的只有一次演示、几句好评——于是在统计上,它和一个真的没效果的项目长得一模一样。

这件事对"该不该做"的启示是:如果你现在没有能力判断做完之后是好是坏,那么先解决这个,比先上项目更重要。


4 种情况,现在不该做

第 1 种:说不出具体是哪个岗位的哪件事。

如果目前的描述停留在"提升效率""降本增效""推动转型"这一类,那么现在开始会得到一个演示很好看、上线没人用的东西。

可用的描述长这样:售后顾问每天要回答约 40 次关于保养项目的问题,每次要翻手册确认,平均 3–5 分钟。这样的描述才能往下走。

第 2 种:这件事的正确答案本身不稳定。

有些业务的判断标准每周都在变(临时政策、活动规则、审核口径)。这类场景不是不能做,但要先让规则稳定下来,否则系统一直在追一个移动的目标。

第 3 种:没有人能持续负责。

这一条比技术条件更致命。企业 AI 不是一次性交付,上线之后需要有人做资料更新、异常处理、效果监测。如果找不到这个人(不是挂名,是真的有时间和权限),项目会在三到六个月内安静地失效——不报错、不宕机,只是答得越来越不对。

第 4 种:只是因为同行做了。

这不构成理由。同行的业务结构、数据条件、人员配置和你不一样,他做成的场景换到你这里可能完全不适用;他做砸的场景也一样。


3 个信号,说明现在可以做

反过来,出现下面这些情况通常意味着时机到了:

信号一:有一件事在重复发生,且每次处理方式差不多。

重复是关键。一件每月只发生 2 次的事,做自动化的投入产出比很难成立;一件每天发生 30 次、每次流程相似的事,才有空间。

信号二:这件事的正确答案有据可查。

答案能在某份文档、某个系统、某套规则里找到——哪怕现在散落在几个地方。这类问题适合先做,因为对错可以验证。

反过来,答案主要依赖个人经验和临场判断的事情,属于难度更高的一档,不适合作为第一个场景。

信号三:有人愿意为这件事的结果负责。

有一个具体的人说"这件事归我管,做成什么样算好由我来定"。有这句话,项目才有主人。


一个 30 分钟能做完的自查

不需要请人,自己就能走一遍:

  1. 列出 3 件公司里最花人力的重复性工作。 只列具体的事,不列部门。
  1. 对每一件问 4 个问题:

- 一天发生多少次?

- 每次花多长时间?

- 处理它需要的信息,现在存在哪儿?

- 做错了会怎么样?

  1. 看第 3 问的答案。 如果是"在某个系统/某份文档里",这件事可以往下想;如果是"在老王脑子里",先想办法把它写下来——这一步本身就有价值,且不需要任何 AI。
  1. 看第 4 问的答案。 错了代价很高的(涉及资金、合规、人身安全),第一个场景不要选它。先在错了能被发现、能被纠正的地方验证。
  1. 最后问自己一句: 如果三个月后要向老板证明这件事做成了,你会拿什么出来?

第 5 问答不上来,就先别启动。这不是拖延,是省钱——因为答不上来的项目,最后大概率会变成那 95% 里的一个。


如果决定要做,第一件事不是选产品

按经验,启动阶段最值得花时间的是这 3 件:

一、把"做成什么样算好"写成可验证的句子。 不是"回答准确率高",而是具体到:在 100 条真实历史问题上,答对多少条、多少条允许说"不知道"、多少条绝对不能答错。

二、建一个测试集。 从真实业务里挑出来的问题,带标准答案。规模不用大,100–150 条起步就有意义。它的作用是让"变好了还是变差了"这件事可以被测量,而不是靠感觉。

检索类系统怎么量,有公开的口径可以直接抄。以开源评测框架 RAGAS(docs.ragas.io)为例,它把质量拆成上下文召回率、上下文精确率、答案忠实度、答案相关性 4 项——这 4 项要分开看,因为"没找到资料"和"找到了但答歪了"的处方完全不同。

三、明确哪些环节必须人工确认。 在开始之前就划清楚,比出了问题再补要容易得多。

这 3 件事加起来通常需要 1–2 周,而且不依赖任何供应商。做完之后,无论选标准产品还是定制开发,你都处在一个能判断好坏的位置上。


写在最后

"该不该做 AI"这个问题,最实用的答案往往不是是或否,而是:先做上面那个 30 分钟的自查,看它把你导向哪里。

如果自查之后发现连一件"重复、有据可查、有人负责"的事都找不出来,那么结论就是现在不该做。这个结论一点也不丢人,它比匆忙启动一个说不清目标的项目要值钱得多。