这个问题几乎每家企业在立项前都会争一轮,而且经常争不出结果——因为双方讨论的其实不是同一件事。
主张自建的人想的是"能力要沉淀在自己手里",主张外包的人想的是"这一版要按时上线"。两句话都对,只是说的不是同一个时间尺度。
先给结论:这不是一个二选一的问题,而是一个分阶段的问题。绝大多数真正跑起来的企业 AI 项目,最后都不是纯自建也不是纯外包。
先分清 3 类工作,别混在一起谈
企业 AI 里有 3 类工作,成本结构和能力要求完全不同,混在一起谈就永远得不出结论。
第一类:一次性的搭建工作。 把知识整理成机器能用的结构、把系统接口打通、把权限和审批配好、把评测集建起来。这类工作有明确的开始和结束,做完就不需要重复做。
第二类:持续的运营工作。 资料更新、异常处理、效果监测、用户反馈闭环。这类工作没有终点,只要系统还在用就一直有。
第三类:判断工作。 先做哪个场景、哪些事不让 AI 自动做、效果不达标是继续调还是停掉。这类工作量不大,但错了代价最高。
看清这 3 类之后,那个"自建还是外包"的问题就变成了 3 个更好回答的问题:哪一类适合谁做。
3 种模式的真实成本
| 模式 | 一次性搭建 | 持续运营 | 判断 | 常见问题 |
|---|---|---|---|---|
| 纯自建 | 自己做 | 自己做 | 自己做 | 起步慢,前几个月在交学费 |
| 纯外包 | 服务商 | 服务商 | 服务商 | 能力不落地,续费即绑架 |
| 混合 | 服务商为主 | 逐步转自己 | 始终自己 | 交接节点要写进合同 |
第三行是大多数项目最后的实际形态。值得单独说明的是最后一列:判断这一类,任何情况下都不该外包。
理由不是能力问题,是责任问题。"这个场景要不要上线""这类回答能不能自动发出去"——这些决定的后果由企业自己承担,服务商既不承担也承担不了。一个愿意替你做这类决定的服务商,恰恰是需要警惕的。
3 种情况,明确建议不要外包
作为提供这类服务的一方,把这 3 条写出来对我们没有好处,但不写这篇文章就没有价值。
第 1 种:你要解决的问题本身还没想清楚。
如果现在说不出"哪个岗位、哪件事、现在花多长时间、做成什么样算好",那么找任何服务商都会得到一个看起来很完整、但用不起来的东西。
MIT 的 NANDA 项目在 2025 年那份《The GenAI Divide》里给过一个被反复引用的数字:约 95% 的企业生成式 AI 试点没有产生可测量的损益影响。这个比例一直有争议,但值得注意的是"可测量"三个字——相当一部分项目不是没效果,是从一开始就没准备过能测量它的材料。
这个阶段该做的是把问题拆清楚,不是找人开发。
第 2 种:核心数据不允许出公司,而且没有条件做本地部署。
这不是外包与否的问题,是可行性问题。数据边界决定了部署形态,部署形态决定了成本量级。边界没确定就往下走,做到一半推翻重来的概率很高。
第 3 种:你要的其实是一个能长期改的东西,而不是一次交付。
如果这套东西的规则每周都在变(比如价格策略、活动规则、审核口径),那么每次改都要走一遍外部流程,响应速度会成为最大的成本。这种情况下,哪怕起步慢,也应该让改动能力留在内部。
什么情况下外部力量确实划算
反过来,下面几种情况自建的代价通常被低估:
赶第一个可用版本的时候。 从零建团队到产出第一个能用的版本,中间要经历选型、踩坑、返工。这段时间的成本不是薪资,是业务窗口。
需要跨系统打通的时候。 接 ERP、接 OA、接业务库,难点通常不在 AI,在于各系统的历史遗留和权限设计。这类经验在企业内部很难自然长出来,因为它来自见过很多套不同的系统。
需要一套评测方法的时候。 检索类系统的质量不是"感觉准不准",而是几个必须分开量的指标。以开源评测框架 RAGAS(docs.ragas.io)的口径为例,至少要分开看:
- 上下文召回率——该找到的资料,找到了几成
- 上下文精确率——找出来的资料里真正相关的占几成
- 答案忠实度——每句话能不能在资料里找到依据
- 答案相关性——有没有真的在回答问题
这 4 个必须分开看。答错了到底是"没找到资料"还是"找到了但答歪了",处方完全不同;混在一起只知道变差了,不知道该往哪修。
另外,幻觉率这类指标有公开的横向评测可以参考(如 Vectara 的 HHEM 榜单),但公开榜单测的是通用场景,企业自己的业务问题还是要用自己的测试集重新量一遍。
建立这套方法本身是一次性工作,学会之后可以一直用——这正是适合外部带进来、然后留在企业内部的东西。
混合模式怎么设计交接
选混合模式的话,有 3 件事必须在合同阶段就写清楚,否则最后仍然是纯外包:
一、交接物是什么。 不是"提供文档"这种表述,而是具体到:评测集和它的构造方法、知识整理的规则、异常处理的清单、每个自动化环节的责任人配置。
二、交接的判据是什么。 建议用一条可验证的:企业自己的人,在没有服务商参与的情况下,独立完成一次完整的资料更新和一次回归评测。做得到才算交接完成。
三、交接之后服务商还做什么。 通常是按次的复核和重大变更时的支持,而不是继续把日常运营握在手里。这一条决定了这段关系是合作还是依赖。
一个可以直接用的判断顺序
- 那三类工作里,判断类留给自己——这条没有例外。
- 一次性搭建:问自己"这件事我们三年内还会做几次"。答案是"就这一次",交给外部通常更划算;答案是"以后经常做",那么第一次就该有人跟着学。
- 持续运营:先看谁离业务更近。资料更新、异常判断这类工作,做的人必须知道业务实际怎么运转,这一点上企业内部有天然优势。
- 无论选哪种,评测方法必须留在企业内部。这是唯一能让你在下一次采购中不被话术左右的东西。
写在最后
关于这个问题,有一句话值得先说清楚:决定"自建还是外包"的通常不是技术判断,是组织判断。
有没有人能持续负责这件事、这个人有没有权限调动业务部门配合、他做出的判断能不能被执行——这 3 件事比选哪家服务商更能决定结果。
如果这 3 件事还没有答案,那么无论自建还是外包,都会在同一个地方卡住。