企业 AI 项目 ROI 怎么算?从人工基线、业务结果到风险成本怎样量

大部分企业 AI 项目算不出 ROI,不是因为收益不存在,是因为上线之前没人量过"原来是什么样"

改造之后再想证明改善,已经没有对照组了。所以这篇的第一句话就是结论:

ROI 的第一步不在上线后,在上线前——把基线量下来。

---

先说为什么"感觉变好了"不能当结果

MIT 的 NANDA 项目 2025 年那份研究(nanda.media.mit.edu)里有个被反复引用的数字:企业级生成式 AI 试点中,约 95% 没有产生可测量的损益影响。

值得注意的是"可测量"这三个字。这 95% 里有相当一部分并不是完全没效果,而是没有任何人能拿出数据证明有效果——用的人说"挺好用",但问到"省了多少时间""错误少了多少",没人答得上来。

在财务口径里,证明不了的收益等于不存在

---

基线要量哪五样

在动任何代码之前,把这五个数记下来。每一个都要有具体数值和采集时间:

量什么怎么量常见疏漏
单次耗时一个人完成一次这个任务平均多久只记"处理时间",漏掉等待、找资料、来回确认
频次每天/每周发生多少次只统计高峰期或只统计低谷
参与人数这件事涉及几个岗位、几个人漏掉上下游的协作者
错误率与返工多少比例要返工、返工要多久完全没统计过,靠印象
等待时间从提出到完成,中间空等多久这一项往往比处理时间大得多

最后一项是最容易被低估的收益来源。很多流程真正的问题不是"处理得慢",而是"排队排得久"——一份材料在某人的待办里躺了两天,实际处理只用了十分钟。

---

一张可以照着填的计算表

下面用示例数字演示算法。这些数字是编来说明算法的,不是任何真实项目的数据——你要做的是把它们换成自己的。

收益侧

① 人力时间节省

`

年节省工时 = 单次节省时间 × 年频次 × 涉及人数

年节省金额 = 年节省工时 × 该岗位综合时薪

`

示例:一次节省 20 分钟,每天 30 次,1 个岗位,年工作日 250 天:

20分 ÷ 60 × 30 × 250 = 2500 工时

按综合时薪 60 元算 → 约 15 万元/年

⚠️ 综合时薪不等于工资除以工时。要含社保、公积金、工位、管理成本,通常是税前月薪折算时薪的 1.3–1.6 倍。用错这个数,整张表都偏。

② 错误与返工减少

`

年减少返工成本 = 年发生次数 × 错误率下降幅度 × 单次返工成本

`

单次返工成本不只是重做的工时,还要算上:下游等待的损失、对外沟通的代价、以及如果错误流到客户那里的挽回成本。

③ 周期缩短带来的业务收益

这一项最难算,也最容易被夸大。只有当周期缩短能直接对应到收入或成本时才计入——比如报价响应从 2 天缩到 2 小时、赢单率因此提升,那么要有赢单率的前后对比数据才能算。

没有对比数据就别算这一项,宁可让 ROI 保守一点。

④ 容量释放

原来因为人手不够做不了的事,现在能做了。这一项要谨慎:只有当释放出来的产能真的被用起来时才算收益,否则只是"闲下来了"。

成本侧

① 一次性投入:诊断费 + 试点费 + 系统建设费 +(如需)硬件

② 持续支出(这一块最常被漏算):

`

年模型调用成本 = 单次任务 token 消耗 × 年调用次数 × 单价

`

主流平台按每百万 token 计价,输入和输出分别定价、输出通常贵 3–5 倍,具体见各家官方定价页(help.aliyun.comdocs.volcengine.comapi-docs.deepseek.com)。

同样的调用量,选不同的模型成本能差近十倍。所以试点期就要把"单次任务的真实 token 消耗"量出来,乘以规模才是可信的预算。

③ 运维与运营:资料更新、质量监测、异常处理的人力

④ 隐性成本(最容易漏,也最真实):

  • 学习成本:员工适应新流程的时间
  • 重试成本:答得不满意要重问几次
  • 人工复核成本:如果每次输出都要人再核一遍,那节省的时间要打折

第四项决定了一个项目是真省钱还是假省钱。如果员工用完还得从头核一遍,名义上省的时间全部作废。

---

把它们放到一起

`

年净收益 = (①+②+③+④ 收益) − (② 持续支出 + ③ 运维 + ④ 隐性)

投资回收期 = 一次性投入 ÷ 年净收益

`

判断标准建议

  • 回收期在 12 个月以内——通常值得做
  • 12–24 个月——要看战略价值,比如是否为后续场景打基础
  • 超过 24 个月——除非有明确的战略理由,否则应该重新选场景

---

三个让 ROI 算错的常见做法

一、拿演示效果当生产效果。演示时一次答对,不代表生产里稳定答对。ROI 要用试点期的真实数据算,不能用演示数据。

二、只算节省不算隐性成本。尤其是人工复核——很多项目上线后员工的实际工作量没变,只是把"自己做"换成了"检查 AI 做的"。

三、把不该归因的收益算进来。同期换了流程、加了人、赶上旺季,这些带来的改善不能全记在 AI 头上。做法是保留一个对照组:同类业务里留一部分不上系统,两边对比。这一条大部分企业不愿意做,但它是唯一能证明因果的方法。

---

风险成本也要算

ROI 不只有正向,还有可能的损失:

  • 答错的代价:如果输出会影响对外承诺、报价、合规判断,错一次的代价可能远超全年节省
  • 数据泄露的代价:权限没管好,成本不是钱能衡量的
  • 依赖风险:如果整条流程只有 AI 能跑、人已经不会做了,供应商涨价或服务中断时的处境

这三项通常不用精确量化,但必须在决策时写进去,并对应到具体的控制措施(人工确认、权限分层、降级方案)。

---

一个最小可行做法

如果嫌上面太复杂,至少做这三件事:

1. 上线前一周,让业务方记录一周的真实耗时和返工次数——只要一周的数据,胜过事后所有推算

2. 试点期,量出单次任务的真实 token 消耗和人工复核比例

3. 上线后一个季度,用同样的方法再量一次,两组数据直接对比

这三步花不了多少时间,但它是"我们做了 AI"和"我们证明了 AI 有用"之间的全部差距。

---

相关阅读

  • 企业 AI 项目怎么验收:七层验收标准与证据要求
  • 企业 AI 项目多久能见效:从诊断、试点到生产上线怎样判断
  • 企业 AI 咨询多少钱:诊断、试点、系统建设与持续顾问怎样报价

---

*本文提供的是计算方法与口径,文中数字为示例,不代表任何具体项目的实际收益。模型 API 单价以各平台官方定价页为准,且变动频繁。*