企业 AI 项目 ROI 怎么算?从人工基线、业务结果到风险成本怎样量
大部分企业 AI 项目算不出 ROI,不是因为收益不存在,是因为上线之前没人量过"原来是什么样"。
改造之后再想证明改善,已经没有对照组了。所以这篇的第一句话就是结论:
ROI 的第一步不在上线后,在上线前——把基线量下来。
---
先说为什么"感觉变好了"不能当结果
MIT 的 NANDA 项目 2025 年那份研究(nanda.media.mit.edu)里有个被反复引用的数字:企业级生成式 AI 试点中,约 95% 没有产生可测量的损益影响。
值得注意的是"可测量"这三个字。这 95% 里有相当一部分并不是完全没效果,而是没有任何人能拿出数据证明有效果——用的人说"挺好用",但问到"省了多少时间""错误少了多少",没人答得上来。
在财务口径里,证明不了的收益等于不存在。
---
基线要量哪五样
在动任何代码之前,把这五个数记下来。每一个都要有具体数值和采集时间:
| 量什么 | 怎么量 | 常见疏漏 |
|---|---|---|
| 单次耗时 | 一个人完成一次这个任务平均多久 | 只记"处理时间",漏掉等待、找资料、来回确认 |
| 频次 | 每天/每周发生多少次 | 只统计高峰期或只统计低谷 |
| 参与人数 | 这件事涉及几个岗位、几个人 | 漏掉上下游的协作者 |
| 错误率与返工 | 多少比例要返工、返工要多久 | 完全没统计过,靠印象 |
| 等待时间 | 从提出到完成,中间空等多久 | 这一项往往比处理时间大得多 |
最后一项是最容易被低估的收益来源。很多流程真正的问题不是"处理得慢",而是"排队排得久"——一份材料在某人的待办里躺了两天,实际处理只用了十分钟。
---
一张可以照着填的计算表
下面用示例数字演示算法。这些数字是编来说明算法的,不是任何真实项目的数据——你要做的是把它们换成自己的。
收益侧
① 人力时间节省
`
年节省工时 = 单次节省时间 × 年频次 × 涉及人数
年节省金额 = 年节省工时 × 该岗位综合时薪
`
示例:一次节省 20 分钟,每天 30 次,1 个岗位,年工作日 250 天:
20分 ÷ 60 × 30 × 250 = 2500 工时
按综合时薪 60 元算 → 约 15 万元/年
⚠️ 综合时薪不等于工资除以工时。要含社保、公积金、工位、管理成本,通常是税前月薪折算时薪的 1.3–1.6 倍。用错这个数,整张表都偏。
② 错误与返工减少
`
年减少返工成本 = 年发生次数 × 错误率下降幅度 × 单次返工成本
`
单次返工成本不只是重做的工时,还要算上:下游等待的损失、对外沟通的代价、以及如果错误流到客户那里的挽回成本。
③ 周期缩短带来的业务收益
这一项最难算,也最容易被夸大。只有当周期缩短能直接对应到收入或成本时才计入——比如报价响应从 2 天缩到 2 小时、赢单率因此提升,那么要有赢单率的前后对比数据才能算。
没有对比数据就别算这一项,宁可让 ROI 保守一点。
④ 容量释放
原来因为人手不够做不了的事,现在能做了。这一项要谨慎:只有当释放出来的产能真的被用起来时才算收益,否则只是"闲下来了"。
成本侧
① 一次性投入:诊断费 + 试点费 + 系统建设费 +(如需)硬件
② 持续支出(这一块最常被漏算):
`
年模型调用成本 = 单次任务 token 消耗 × 年调用次数 × 单价
`
主流平台按每百万 token 计价,输入和输出分别定价、输出通常贵 3–5 倍,具体见各家官方定价页(help.aliyun.com、docs.volcengine.com、api-docs.deepseek.com)。
同样的调用量,选不同的模型成本能差近十倍。所以试点期就要把"单次任务的真实 token 消耗"量出来,乘以规模才是可信的预算。
③ 运维与运营:资料更新、质量监测、异常处理的人力
④ 隐性成本(最容易漏,也最真实):
- 学习成本:员工适应新流程的时间
- 重试成本:答得不满意要重问几次
- 人工复核成本:如果每次输出都要人再核一遍,那节省的时间要打折
第四项决定了一个项目是真省钱还是假省钱。如果员工用完还得从头核一遍,名义上省的时间全部作废。
---
把它们放到一起
`
年净收益 = (①+②+③+④ 收益) − (② 持续支出 + ③ 运维 + ④ 隐性)
投资回收期 = 一次性投入 ÷ 年净收益
`
判断标准建议:
- 回收期在 12 个月以内——通常值得做
- 12–24 个月——要看战略价值,比如是否为后续场景打基础
- 超过 24 个月——除非有明确的战略理由,否则应该重新选场景
---
三个让 ROI 算错的常见做法
一、拿演示效果当生产效果。演示时一次答对,不代表生产里稳定答对。ROI 要用试点期的真实数据算,不能用演示数据。
二、只算节省不算隐性成本。尤其是人工复核——很多项目上线后员工的实际工作量没变,只是把"自己做"换成了"检查 AI 做的"。
三、把不该归因的收益算进来。同期换了流程、加了人、赶上旺季,这些带来的改善不能全记在 AI 头上。做法是保留一个对照组:同类业务里留一部分不上系统,两边对比。这一条大部分企业不愿意做,但它是唯一能证明因果的方法。
---
风险成本也要算
ROI 不只有正向,还有可能的损失:
- 答错的代价:如果输出会影响对外承诺、报价、合规判断,错一次的代价可能远超全年节省
- 数据泄露的代价:权限没管好,成本不是钱能衡量的
- 依赖风险:如果整条流程只有 AI 能跑、人已经不会做了,供应商涨价或服务中断时的处境
这三项通常不用精确量化,但必须在决策时写进去,并对应到具体的控制措施(人工确认、权限分层、降级方案)。
---
一个最小可行做法
如果嫌上面太复杂,至少做这三件事:
1. 上线前一周,让业务方记录一周的真实耗时和返工次数——只要一周的数据,胜过事后所有推算
2. 试点期,量出单次任务的真实 token 消耗和人工复核比例
3. 上线后一个季度,用同样的方法再量一次,两组数据直接对比
这三步花不了多少时间,但它是"我们做了 AI"和"我们证明了 AI 有用"之间的全部差距。
---
相关阅读
- 企业 AI 项目怎么验收:七层验收标准与证据要求
- 企业 AI 项目多久能见效:从诊断、试点到生产上线怎样判断
- 企业 AI 咨询多少钱:诊断、试点、系统建设与持续顾问怎样报价
---
*本文提供的是计算方法与口径,文中数字为示例,不代表任何具体项目的实际收益。模型 API 单价以各平台官方定价页为准,且变动频繁。*