AI 智能体开发公司怎么选?企业采购前必须验证的 9 项能力

这个问题现在很难搜到有用的答案。

搜索结果里大部分是"十大服务商排名"之类的文章,而这类文章往往由某一家自己或其代理发布——你会发现不同的榜单里第一名各不相同。所以这篇不做排名,只给一套你可以自己拿去核的清单:九个问题,每个问题配上"什么样的回答算过关"和"什么样的回答要警惕"。

先看一组我们自己跑出来的数据

2026 年 8 月,我们用未登录的匿名浏览器,把三个词分别喂进 11 个平台(百度网页、百度AI搜索、必应、360、搜狗、夸克、微信搜一搜、知乎、小红书、B站、抖音),一共 33 次搜索,记录每个平台返回什么。

结果里有两个数字值得采购方注意:

  • 14 次是彻底零结果——搜服务品类词时,多个主流平台一条相关结果都给不出来
  • 搜"某地区 + 企业AI落地咨询"这类品类词时,首屏第一名往往是一篇推广软文,而不是真正做这件事的公司

这说明一件事:你在搜索引擎和 AI 问答里看到的"推荐",和谁真的做得好,关联度很低。排在前面的通常是最会做内容分发的,不一定是最会做交付的。

所以选型不能靠搜——得靠一套自己拿在手里的核对方法。下面就是。

---

先明确一件事:你买的到底是什么

"做一个 AI 智能体"这句话,在不同公司嘴里是三件完全不同的事:

卖的是什么典型形态适合什么情况
一个工具账号在某个平台上帮你配好一个机器人需求简单、预算很小、能接受随时改
一套定制系统接你的数据和系统,按你的流程建有明确业务目标和验收条件
一段咨询过程先诊断该不该做、做哪个,再谈建设需求还没想清楚,怕做错方向

很多采购纠纷的起点,是买方以为自己在买第二种,卖方在交付第一种。所以第一个动作不是比价,是把"我要买什么"写清楚

---

九项核对清单

1. 他能不能说清楚"什么情况下不该做"

过关:对方能举出具体场景说"这个现在不建议做",并说明理由——数据不够、流程没定、责任边界不清、投入产出不划算。

警惕:什么都能做、什么都合适、你说什么他都点头。

为什么这条排第一:AI 落地失败最常见的原因不是技术不行,是选错了场景。一个不会说"不"的服务商,帮不了你避开这个坑。

---

2. 他的方法论能不能离开他自己用

过关:他给的诊断结论、场景排序、验收标准,你换一家实施方也照样能用。

警惕:所有结论都指向"所以要用我们的平台/我们的方案"。

怎么验:直接问——"如果我们最后没选你们,这份诊断报告对我们还有价值吗?"看他怎么答。

---

3. 他怎么处理"模型会说错话"这件事

这是技术能力的分水岭。

过关:对方会主动讲幻觉问题,并给出具体的工程手段——检索时给出处、答不上时明确拒答、关键操作前要人工确认、留完整日志可追溯。

警惕:说"我们用的模型很准,不会出错",或者含糊过去。

背景:大模型的幻觉率不是零,也不可能是零。有公开的持续评测可以参考(Vectara 维护的 HHEM 榜,github.com/vectara/hallucination-leaderboard),它测的是有文档做依据时的幻觉率,也就是最有利的条件。企业实际场景通常更难。

所以正确的问题不是"你们准不准",而是"错了之后会怎样"。

---

4. 他有没有可运行的验收标准

过关:能拿出一份分层的验收方法——业务任务、模型输出、知识检索、工具调用、权限、性能、持续运营,每层有什么样的证据算通过。

警惕:只说"我们会做测试",或者把"准确率 90%"直接写进合同却不定义分子分母。

怎么验:问"准确率的分子和分母分别是什么,谁来判,判多少条,有争议怎么裁决"。答不上这四个的,那个数字是没意义的。

---

5. 他怎么对接你现有的系统

过关:会先问你有什么系统、接口文档在不在、原厂商配不配合,然后说明哪些能接、哪些要改、哪些接不了。

警惕:说"都能接"。

为什么重要:接 ERP、MES、CRM 是项目成本的头号变量。接口没文档、原厂商不配合、要改对方系统——这三件事任何一件都能让工作量翻几倍。这个风险必须在报价前暴露,不能等做到一半才说。

---

6. 数据和权限怎么管

过关:能说清楚数据存在哪、谁能访问、不同角色看到的内容有什么不同、日志留多久、离场时数据怎么处理。

警惕:只说"我们很安全""数据加密"。

必须问的一个具体问题:不同权限的员工问同一个问题,会不会看到不同的答案?如果答案是"都一样",那就意味着只要能提问,就能问出任何内容

---

7. 上线之后谁负责、负责多久

过关:明确的运营期责任、响应时限、以及模型或平台变更时谁负责适配。

警惕:合同只写到"交付上线"。

为什么重要:AI 系统会退化——资料变了、模型被供应商升级了、用户问法变了。没人管的系统通常在三到六个月内从"挺好用"滑到"没人用"。上线不是终点,是运营的起点。

---

8. 他给的案例能不能核

过关:能给出可验证的信息——哪个行业、什么场景、解决了什么问题、用了多久。即使因为保密不能说客户名,也能讲清楚问题和方法。

警惕

  • 案例只有 Logo 墙,没有任何可核的细节
  • 现场照片、合影、会议视频当成交付证明
  • 说不清"这个项目现在还在跑吗"

一条判据现场照片和视频只能证明去过、聊过,不能证明系统上线了、验收了。这两件事之间差着整个交付过程。

---

9. 他敢不敢做小规模验证

过关:愿意先做一个有明确退出条件的试点,试点失败也认。

警惕:一上来就要签整体大单,或者说"试点没意义,要做就做完整的"。

这条是前面八条的兜底:即使你判断不准,一个约定了退出条件的小试点,最多损失试点那笔钱,不会把整个预算搭进去。

---

三类必须直接排除的情况

有些信号不需要再往下谈:

一、承诺"保收录""保排名""保上首页"。各大搜索引擎官方都明确声明不保证收录任何页面。任何做出这类承诺的,要么不懂,要么打算用见不得光的手段。

顺带一提,2026 年 5 月 Google 更新的搜索垃圾内容政策已经把"操纵生成式 AI 回答"明确纳入处罚范围(developers.google.com/search/docs/essentials/spam-policies)。用批量生成、关键词堆砌之类手段"做 AI 可见度"的,风险是降权甚至除名,不是没效果那么简单。

二、拿不出任何可核验证据,只有话术。你问细节他就换话题、绕回价值和愿景。

三、报价单没有拆解。一个总价、没有分段、没有说明包含什么不包含什么。这种报价单没法验证,也没法比较。

---

一个成本参考:验证这件事本身要花多少

采购方常有的顾虑是"我怎么知道他行不行,总不能先付一大笔"。

正确做法是把"验证"本身变成一个小额、有明确交付物的独立环节

  • 业务诊断:按顾问人天计,一次完整的入企诊断通常需要 5–15 个人天,产出应该是一份换个实施方也能用的报告
  • 单场景试点:固定包,用真实或脱敏数据,约定明确的退出条件

这两笔加起来,通常远低于一个失败项目的代价。而且诊断报告本身是资产——即使不继续合作,你也拿到了"该做什么、按什么顺序做、怎么验收"的答案。

---

把这九条变成一张表

建议在见服务商之前,把这九个问题打印出来,边聊边打勾。九项里:

  • 第 1、3、4 项答不上的,直接排除——这三项分别对应"会不会选错场景""错了怎么办""怎么算做成",是项目成败的三个关键点
  • 第 5、6 项答得含糊的,要求书面补充
  • 第 9 项不愿意的,谈判空间已经不大了

---

相关阅读

  • 企业 AI 项目怎么验收:智能体、RAG 与生成式 AI 的七层验收标准
  • 企业 AI 咨询多少钱:诊断、试点、系统建设与持续顾问怎样报价
  • 企业 AI 项目多久能见效:从诊断、试点到生产上线怎样判断

---

*本文提供的是采购方自查方法,不构成对任何具体服务商的评价。文中引用的官方政策与公开评测基准,出处已在正文标明,读者可自行核验。*