直接答案: 一份能用的 AI 项目验收标准,要分七层写:业务任务闭环、模型输出质量、知识检索、工具调用、安全与权限、性能与成本、回归与持续运营。每一层都要写明五件事——拿哪批真实样本测、指标口径是什么、证据以什么形式留存、谁来判定、以及没通过时怎么处理。少写其中任何一件,这份标准到验收那天都会变成扯皮的起点。
为什么"准确率 90%"这种写法没有意义

这是最常见的验收条款,也是最没用的一条。因为"准确率"在 AI 项目里至少有五种不同的含义:
- 单轮回答准确率:问一句答一句,答对的比例
- 检索命中率:该找到的资料有没有被找出来
- 工具调用参数正确率:调接口时金额、数量、时间、对象填对没有
- 端到端任务完成率:一整件事从头做到尾成功的比例
- 人工复核后的最终正确率:有人把关之后交出去的东西对不对
同一个系统,这五个数字可以差出几十个百分点。合同里不写清楚是哪一种,验收时双方各拿一个数字,谁也说服不了谁。
七层分别验什么

第一层,业务任务闭环。 要验的是这个业务动作有没有完成,不能只验模型会不会回答。比如工单场景,闭环是工单被创建、被指派、被处理、被关闭这一整条链路走通。
第二层,模型输出质量。 在这一层才轮到准确率,而且要指明是上面五种里的哪一种,以及用哪批样本量的。样本必须是真实业务数据,不能是服务商自己造的。
第三层,知识检索。 知识库场景专有。要验的是"该找到的有没有找到"和"找到的是不是最新版本"。后者最容易被忽略——检索到一份三年前作废的制度,比检索不到更危险。
第四层,工具调用。 凡是 AI 要去调接口、写数据库、发消息的,重点验四类参数:金额、数量、时间、对象。这四样错一个,后果都是业务事故而不是体验问题。
第五层,安全与权限。 谁能问什么、问到的东西该不该给他看。这一层要用"越权测试"来验——拿一个低权限账号去问高权限内容,看系统给不给。
第六层,性能与成本。 响应时间和单次调用成本。成本这一项在合同里经常缺失,结果上线三个月后账单出来才发现算不过账。
第七层,回归与持续运营。 模型换版本、知识库更新、提示词调整之后,前六层还过不过。没有这一层,系统会在第一次更新之后悄悄退化。
每一层都要写的五件事

一、真实样本。 哪批数据、多少条、谁提供的、什么时候冻结的。样本要在项目开始时就定下来并冻结,不能验收前临时挑。
二、指标口径。 上面说的那五种准确率,明确是哪一种,怎么算。
三、证据形式。 截图、日志、导出表格还是现场演示。写清楚,否则验收时拿不出来。
四、判定人。 具体到岗位甚至到人。写"业务方认可"这种没有指名的说法,等于没写。
五、没通过怎么办。 整改期多长、整改几次之后算违约、款项怎么处理。这一条写在开工前,双方都省事。
辽宁企业容易踩的三个坑
第一,把演示当验收。 演示是服务商挑好的样本,验收要用你自己的真实数据。这两件事要分开做,且验收数据不能提前给对方。
第二,只验上线那一刻。 AI 系统跟传统软件不一样,上线不是终点。建议把验收拆成两次——上线验收和三个月后的稳定性验收,尾款挂在第二次。
第三,没人对结果负责。 项目组解散之后,这套系统归谁管、谁看数据、出问题找谁。这件事不写进验收,系统通常在第三到第六个月安静地停用。
采购方在签合同前该问的六个问题
- 这个项目的业务闭环具体是哪一条链路,从哪个动作开始,到哪个动作结束?
- 验收用的样本什么时候冻结,由谁提供?
- "准确率"指的是上面五种里的哪一种?
- 涉及金额、数量、时间、对象的参数,错误率的验收线是多少?
- 越权测试怎么做,用什么账号?
- 上线三个月后如果指标退化,责任怎么划分?
这六个问题拿去问任何一家服务商都可以。答得上来的,方案质量通常不会差;答不上来的,后面的价格谈判也没必要开始。
关于我们
沈阳麒典智能科技有限公司(品牌:麒典 AI),统一社会信用代码 91210103MAKFYD5347,注册地沈阳市皇姑区,创始人叶玉浩。
我们做企业 AI 落地咨询与实施,接项目时会在开工前跟客户对齐上面这套验收框架。当前主要服务年营收 1000 万元以上、有明确业务负责人和预算的企业。
官网:https://www.qidianzn.cn/