金融场景里的 AI:人必须管到哪一层

金融行业问 AI 的第一个问题从来不是"能不能做",而是"出了事谁负责"

这个问题问得对。它决定了在金融场景里,AI 的正确用法不是"替代判断",而是在明确的边界内提高效率,把判断留给人

难的是把这条边界写清楚——写到能进内控文件、能被审计追溯的程度。

---

先把场景按风险分四级

不要笼统地讨论"AI 在金融能做什么"。同一个技术,用在不同环节,风险差几个量级。

级别特征AI 的角色人的角色
L1 信息查询只读、结果给内部人看检索 + 归纳用户自己判断是否采信
L2 材料生成生成初稿,人再改起草逐句复核后签字
L3 判断辅助给出倾向性意见提供依据和建议必须独立形成结论
L4 直接决策结果直接生效——本文不建议

第一个项目应该落在 L1,最多 L2。

L3 需要成熟的复核机制和足够长的观察期数据支撑。L4 在现阶段的金融场景里,不建议作为目标——不是技术问题,是责任无法归属的问题。

---

L1:可以放心做的四类

这四类的共同点是只读、不产生对外效力、错了立刻能被发现

一、内部制度与产品条款查询

员工问"这个产品的赎回规则是什么""这类客户的准入条件",系统从制度文件里检索作答并给出处。

门槛:制度版本管理。如果人工都分不清哪版有效,AI 只会把混乱放大。

二、历史案例检索

"类似情况以前是怎么处理的"——从历史工单、审批记录里找相似案例。

门槛:历史记录的结构化程度。

三、公开信息归纳

从公开披露的财报、公告、监管文件里提取要点。

门槛:注意区分"公开信息"和"内部数据",两者的数据边界完全不同。

四、内部培训与知识辅助

新员工上手期的知识问答。

门槛:低。这通常是最适合当第一个项目的场景——频次高、风险低、痛点真实。

---

L2:可以做,但必须配三道机制

生成初稿类场景(报告初稿、材料模板、会议纪要整理)价值很大,但必须配套:

一、逐句可溯源

每一个数字、每一条结论,都要能点回原始出处。做不到这一点的生成,就不该进入 L2 流程。

二、明确的签字责任

初稿是 AI 生成的,但签字的是人。签字人对内容负全责——这一条要写进制度,不能默认。

三、留痕与审计

谁在什么时候用了什么输入、得到了什么输出、改了哪些地方。审计要求能追溯到具体人和具体版本。

---

L3:判断辅助的两条硬要求

如果确实要做到 L3(比如风险初筛、异常提示),有两条不能让步:

一、系统只提供依据和建议,不给结论性表述。

措辞上的差别是实质性的:

不该这么说应该这么说
"该客户风险较高,建议拒绝""该客户在以下 3 项指标上偏离同类均值:……"
"此笔交易异常""此笔交易与该账户过去 90 天模式的差异点:……"

为什么:前者是替人做了判断,后者是给人提供了判断材料。责任归属完全不同。

二、必须有独立复核,且复核人不能只看结论。

如果复核人只看到"高风险"三个字就签字,那这道复核是形式上的。复核必须基于原始依据,而不是基于 AI 的结论。

---

幻觉在金融场景里意味着什么

Vectara 维护着一个公开的持续评测(HHEM 榜,github.com/vectara/hallucination-leaderboard),测的是有文档做依据时主流模型的幻觉率——也就是最有利的条件下的表现。

企业场景通常比评测条件更难。这意味着在金融场景里,工程上必须有三道兜底:

1. 强制出处:每个事实性陈述都带可点击的原文引用

2. 明确拒答:找不到依据时说"没有找到相关规定",而不是推理一个答案

3. 数值二次校验:涉及金额、比例、期限的数字,与原文做程序化比对,不一致就拦下

第三条最容易被跳过,也最关键。模型把"不超过 30%"复述成"不超过 35%"这类错误,语义上完全通顺,只有程序化比对能抓住。

---

合规这一项必须前置

在境内提供生成式人工智能服务,适用《生成式人工智能服务管理暂行办法》。金融行业还有本行业的专门监管要求。

关键区分:面向公众提供服务,与仅供机构内部使用,要求完全不同。这个区分会直接决定技术方案,所以必须在选型之前确认,不能上线前才补。

具体适用情况必须由机构自身的合规部门确认——本文只提示这些规范的存在,不构成合规意见,也不能替代机构的合规审查。

---

数据边界:一条不能试探的线

金融场景里,有一类数据的处理方式没有商量余地:

  • 客户身份信息
  • 账户与交易明细
  • 未公开的经营数据

这类数据不能发送给不受控的外部服务。这不是成本考量,是合规底线。

实践中的处理方式通常是:

  • 脱敏后再处理:把身份标识替换掉,只保留分析需要的特征
  • 本地或专有环境部署:数据不出机构网络边界
  • 分层架构:敏感环节本地处理,非敏感环节可用外部能力

选哪种取决于合规部门的判断,不取决于技术偏好。

---

一份可以直接用的边界自检表

在金融场景启动 AI 项目前,对着这七条过一遍:

  • [ ] 这个场景属于 L1 / L2 / L3 中的哪一级,写下来了
  • [ ] 涉及的数据类型列清楚了,且合规部门确认过处理方式
  • [ ] 每个事实性输出都能溯源到原始文件
  • [ ] 有明确的签字责任人(是人名,不是部门)
  • [ ] 有完整的输入输出留痕,满足审计要求
  • [ ] 数值类内容有程序化的二次校验
  • [ ] 写清了什么情况下系统应该拒答

七条全部满足才动手。任何一条含糊,先把它变清楚——在金融场景里,边界不清就是最大的风险,比技术不成熟严重得多

---

相关阅读

  • 企业第一次做 AI,怎样选对项目并设计可退出的试点
  • 企业 AI 的数据治理:治什么、治到什么程度、谁来治
  • 企业 AI 项目怎么验收:七层验收标准与证据要求
  • 企业知识库怎么做,才不会变成资料坟场

---

*本文说明的是方法与判断标准,不代表任何未公开项目的实施细节。文中引用的公开规范与评测榜单,出处已在正文标明,读者可自行核验。合规适用情况请由机构合规部门确认,本文不构成合规意见。*