企业 AI 咨询多少钱?诊断、试点、系统建设与持续顾问怎样报价
先给一句实话:任何在没听完你的业务之前就报出确切总价的人,报的都不是你这个项目的价。
但"要谈完才知道"也不是答案——采购方需要在立项之前就有个数,好去申请预算。所以这篇讲清楚三件事:钱花在哪几段、每段的行业常见区间是多少、以及哪些因素会让价格翻倍。
---
企业 AI 项目的钱,花在四段上
不要把"做个 AI"当成一笔钱。它至少是四笔,性质完全不同:
| 阶段 | 买的是什么 | 常见计价方式 | 典型周期 |
|---|---|---|---|
| ① 诊断 | 判断"值不值得做、先做哪个" | 按人天或固定包 | 1–3 周 |
| ② 试点 | 用真实数据验证一个场景能不能跑通 | 固定包 | 3–8 周 |
| ③ 系统建设 | 把跑通的场景做成能日常用的系统 | 按模块或整体包 | 1–4 个月 |
| ④ 持续运营 | 让它三个月后还好用 | 按月/按季顾问费 | 长期 |
最容易出问题的是跳过①直接买③。没有诊断就上系统建设,等于在不知道病因的情况下直接开药——最后钱花了,做出来的东西业务部门不用。
---
第一段:诊断阶段
买的是判断,不是交付物。
诊断要产出的东西很具体:哪几个业务场景值得做、按什么顺序做、每个场景需要什么资料和权限、做成之后怎么验收、以及哪些场景现在不该做。最后一条往往最值钱——帮企业省下的钱经常超过诊断费本身。
行业常见区间:按顾问人天计,国内市场从每人天数千元到上万元不等,视顾问资历和行业经验而定。一次完整的入企诊断通常需要 5–15 个人天。
采购方要问的:
- 诊断报告里会不会包含"不建议做"的结论?(只会说"都能做"的顾问,诊断没有价值)
- 诊断团队会不会真的进现场、和一线员工聊?还是只开高层会
- 诊断结论和后续实施是不是同一方?如果是,怎么避免"诊断出来的问题正好是我能卖的方案"
一个判断标准:好的诊断报告应该让你即使换一家实施方也能用。如果它离开了这家公司就没意义,那它是销售材料不是诊断报告。
---
第二段:试点阶段
买的是一次真实验证。
试点不是做 Demo。Demo 用的是挑好的数据、跑的是顺利路径;试点必须用真实或脱敏的生产数据,让真实的员工在真实的工作里用。
行业常见区间:单场景试点在国内市场通常落在数万元到十几万元区间,取决于场景复杂度、数据治理工作量和是否需要对接现有系统。
试点必须有明确的退出条件。这是采购方最该坚持的一条:约定清楚"什么情况下我们判定这个场景不值得继续",并且约定试点失败时的处理方式。没有退出条件的试点会变成无限期的追加。
采购方要问的:
- 试点用谁的数据?多少条?谁来准备?
- 试点期间业务方要投入多少人、多少时间?(这部分是隐性成本,经常被漏算)
- 试点结束时交付什么?只有一个能演示的东西,还是包括"为什么行/为什么不行"的分析
---
第三段:系统建设
这一段的价格差异最大,因为"系统"这个词覆盖的范围可以差十倍。
影响价格的六个因素,按影响程度排:
1. 要不要对接现有系统。 接 ERP、MES、CRM 是价格的头号变量。接口有没有文档、对方厂商配不配合、要不要改对方的系统,这三件事能让工作量翻几倍。
2. 数据治理的工作量。 企业资料通常散在各处、格式不一、有大量过期内容。"把资料整理成 AI 能用的样子"这件事,经常比开发本身更费时间。
3. 私有化程度。 用公有云 API 最便宜;混合部署(敏感数据本地、模型调用走云)中等;完全本地部署需要买 GPU 服务器,前期投入是另一个量级。
4. 权限体系的复杂度。 全员一个权限,和按部门/岗位/项目三层控权,工作量差很多。
5. 并发规模。 十个人用和一千个人用,架构不是一回事。
6. 要不要做回归测试体系。 这一项经常被砍掉,但砍掉之后系统改一次坏一次(详见我们关于验收标准的那篇)。
行业常见区间:从十几万元的单场景系统,到上百万元的多场景平台,跨度很大。报价单如果没有拆到上面这六个因素,那个总价是没法验证的。
---
第四段:持续运营
这是最容易被砍、也最容易出事的一段。
AI 系统会退化,原因有三个:企业的资料变了、模型供应商升级了、用户的问法变了。没有人管的系统,通常在三到六个月内从"挺好用"滑到"不太准",再到"没人用了"。
持续运营买的是:资料更新、质量监测、异常处理、以及模型或平台变更时的适配。
行业常见区间:通常按系统建设费的一定比例按年计,或按月付顾问费。
采购方要问的:
- 上线之后出问题找谁?响应时限是多久?
- 模型供应商涨价或下线某个模型,谁负责迁移、算不算额外收费?
- 资料更新是我们自己做还是你们做?如果自己做,有没有工具和培训?
---
一笔经常被漏算的钱:模型调用成本
这笔钱不在实施方的报价单里,但它是持续支出,而且会随使用量线性增长。
主流大模型 API 按 token 计费,输入和输出分别计价,输出通常是输入的 3 到 5 倍。下面是几家主流平台公开定价页上的价格(单位:元/百万 token),供估算量级用:
| 平台 / 型号 | 输入 | 输出 | 官方定价页 |
|---|---|---|---|
| 阿里云百炼 qwen-max | 2.4 | 9.6 | help.aliyun.com/zh/model-studio/model-pricing |
| 阿里云百炼 qwen-plus(128K 基础档) | 0.8 | 2.0 | 同上 |
| 火山方舟 doubao-pro 系列 | 6 | 30 | docs.volcengine.com/docs/82379/1544106 |
| DeepSeek deepseek-v4-flash(高峰/缓存未命中) | 3.0 | 9.0 | api-docs.deepseek.com/zh-cn/quick_start/pricing |
| 智谱 GLM-5.3 | 8 | 28 | bigmodel.cn/pricing |
⚠️ 这些数字必须自己去官方页核一遍再用。国内平台调价频繁,而且计价结构越来越复杂:DeepSeek 已经按高峰/空闲时段差异化定价,同一个模型空闲时段只要高峰的一半;多家平台还引入了上下文缓存命中价,命中时输入价能低到未命中的十分之一。拿一个单一数字做长期预算,一定会算错。
算一笔具体的账
假设一个内部知识问答场景:每次问答输入约 3000 token(含检索到的资料)、输出约 500 token,每天 200 次。
用 qwen-plus 基础档估算:
- 输入:3000 × 200 × 30 天 = 1800 万 token → 约 14.4 元/月
- 输出:500 × 200 × 30 天 = 300 万 token → 约 6 元/月
- 合计约 20 元/月
看起来微不足道。但把同样的量换成 doubao-pro:输入 108 元 + 输出 90 元 ≈ 198 元/月,差了近十倍。再把日均 200 次换成 5000 次,就是每月数千元的持续支出。
所以模型选型不只是效果问题,也是成本结构问题。试点期就该把"单次任务的真实 token 消耗"量出来——这个数乘以规模,才是可信的预算。
还有一笔更隐蔽的:重试和人工返工。如果员工每次都要重问两三遍、还要自己再核一遍,真实成本是账面的好几倍。这个数同样在试点期就能量出来,别等推广后才发现。
---
三种报价方式的适用场景
| 方式 | 适合什么情况 | 风险在哪 |
|---|---|---|
| 按人天 | 需求还不清晰的诊断阶段 | 采购方承担范围风险,容易超支 |
| 固定包 | 范围能写清楚的试点和单场景建设 | 交付方承担风险,所以会把不确定性算进价格 |
| 按效果分成 | 有明确可量化业务指标的场景 | 指标定义和归因极难谈清楚,实际用得很少 |
多数企业 AI 项目的合理组合是:诊断按人天 + 试点固定包 + 建设分模块固定包 + 运营按年。一上来就要求整体固定总价的,交付方要么把风险溢价加得很高,要么后面靠变更单找补。
---
采购方在比价时最该问的五个问题
1. 这个报价包含哪几段?诊断、试点、建设、运营,缺哪段。
2. 不包含什么?尤其是:模型调用费、服务器费用、第三方接口费、我方要投入的人力。
3. 验收标准写在哪?报价和验收标准必须配套,只有价没有验收标准的报价单没法签。
4. 超范围怎么算?变更单的计价规则,事先写清楚。
5. 如果试点判定不继续,已付款怎么处理?这条不问,试点就变成了必然通向大单的漏斗。
---
为什么我们不在这个页面上写死具体报价
因为写死了对你没好处。
同样是"做一个客服智能体",资料齐全、无需对接、五十人用,和资料散乱、要接三个系统、五百人用——工作量差五倍以上。页面上给一个数字,要么虚高(把最坏情况算进去),要么虚低(等谈的时候再加)。两种都不是诚实的做法。
我们的做法是:先做诊断,诊断结束时给出分段报价,每一段都对应明确的交付物和验收标准。诊断本身的费用是明确的、有上限的,且诊断报告即使不继续合作也能用。
---
相关阅读
- 企业 AI 项目怎么验收:七层验收标准与证据要求
- 企业 AI 项目多久能见效:从诊断、试点到生产上线怎样判断
- AI 智能体开发公司怎么选:采购前必须验证的能力清单
---
*本文所述价格区间为国内市场的常见范围,供预算规划参考,不构成报价。模型 API 单价以各平台官方定价页为准,且变动频繁。具体项目报价需在完成业务诊断后确定。*