把 AI 接进办公平台:四个特有的边界问题

企业想把 AI 接进飞书或企业微信,理由很正当:那是员工已经打开的地方,不用再培养一个新习惯。

但这个接入有四个特有的问题,它们在独立的网页版应用里根本不存在。没提前处理好,出问题的方式会很难看。

---

接入方式先分三种

方式形态适合主要风险
机器人(单聊)员工私聊问答知识查询、个人助手权限继承
机器人(群聊)在群里被 @ 或自动响应团队协作消息边界
应用/工作台独立入口复杂交互、表单类相对可控

建议的起步顺序:单聊 → 应用 → 群聊。

群聊放最后,因为它的风险最特殊,下面会讲。

---

问题一:权限继承

核心问题:员工在办公平台里的身份,和他在业务系统里的权限,不是一回事

一个常见的错误假设是"他能登录飞书,所以他是员工,所以他能查"。这个推理少了一层:他是员工,但他是哪个部门、哪个层级、能看哪些数据?

必须做到的两件事

一、身份要打通到业务系统的权限体系。

不是"是不是本公司员工",而是"这个人在业务系统里对应哪个账号、什么权限"。

二、检索必须在权限范围内进行。

不能先全量检索再过滤——那会从回答的措辞里泄露"存在你看不到的内容"这个信息本身

验证方法:用不同层级的账号问同一个问题,检查两件事:

1. 内容没返回

2. 拒答措辞与"内容不存在"时完全一致

第二条最容易漏。

---

问题二:群聊的消息边界(最特殊的一个)

这是办公平台接入独有的问题,也是最容易出事的

场景:一个机器人被拉进了群,群里有 20 个人,权限各不相同。它该按谁的权限回答?

三种错误做法:

错误做法后果
按提问者的权限答群里其他人看到了不该看的内容
按群里最低权限答基本没什么能答的,功能形同虚设
按机器人自己的权限答最危险——等于给全群开了后门

可行的处理方式有三种,各有取舍

一、群里只答公开内容。

涉及权限的问题一律引导到私聊。最安全,也最容易实现

二、群按权限分级建。

一个群里的人权限一致,机器人按这个级别回答。管理成本高,但能用。

三、群里只给"有这条信息"的提示,内容私发给有权限的人。

实现复杂,但体验好。

判据:如果说不清"这个群里的回答该按谁的权限",那就先别把机器人拉进群。

---

问题三:外部联系人

企业微信可以加客户,飞书可以有外部协作方。这意味着机器人可能在跟公司外的人对话。

必须处理的三件事

一、要能识别对方是不是外部人员。

这是最基本的前提,不能靠"应该不会有外人"的假设。

二、外部对话走完全不同的知识范围。

不是"少答一点",是另一套受控的内容。内部知识库和对外话术库应该是分开的两个库。

三、对外的表述要受控。

涉及价格、承诺、交期、政策的内容,走受控话术表,不自由生成——理由和零售、教育、汽车场景完全一致:说出去的话有效力

判据如果这个机器人有任何可能接触到外部人员,那它的对外能力必须单独设计,不能是内部能力的子集。

---

问题四:留痕与隐私的平衡

办公平台的对话既是工作记录,也可能包含员工的个人表达。

要明确的三件事

一、记什么。

建议记:谁在什么时候问了什么类别的问题、系统返回了什么、用的哪一版资料。这些是排错和审计需要的。

二、告知。

员工应该知道这个机器人的对话会被记录。这不只是合规问题,也是信任问题——事后才发现被记录,比一开始就说清楚破坏性大得多。

三、保存期限。

定一个明确的期限,到期清理。无限期保存不是更安全,是更大的负担。

具体的处理要求请由企业的法务或合规部门确认,本文只提示这三点的存在。

---

一个常被忽略的技术边界

办公平台的机器人有一个网页应用没有的约束:消息是异步的,而且用户会连续发多条。

这带来两个实际问题:

一、上下文怎么算。

用户连发三条消息,是一个问题还是三个?处理不好会答得驴唇不对马嘴。

务实的做法:设一个短暂的等待窗口(比如 2–3 秒),把连续消息合并处理,而不是每条都立刻响应。

二、长回答的呈现。

聊天窗口里塞一屏文字,可读性很差。

务实的做法:先给结论和出处,长内容做成可展开或链接。这一条对使用率的影响比模型质量还大。

---

怎么验收

答案质量口径沿用开源评测框架 RAGAS(docs.ragas.io),另加接入场景特有的:

指标建议门槛
权限隔离正确率(越权测试用例)100%
拒答措辞一致性(不泄露信息存在)100%
外部身份识别准确率(如涉及外部联系人)100%
答案忠实度不低于 95%
首次响应时长建议 3 秒以内

前三项都是 100% 门槛,因为它们靠的是身份和路由逻辑,不靠模型准确率——做不到就是配置错了,不是"模型不够准"

测试集建议:至少覆盖 3 个权限层级 × 每级 10–20 条,外部身份场景另加 20–30 条。如果要上群聊,还要单独测群场景——群里的权限判断逻辑和单聊完全不同,不能靠单聊的测试结果推断。

---

一个务实的推进顺序

1. 单聊 + 公开内容——两三周上线,验证使用习惯

2. 单聊 + 权限内容——打通身份,做好越权测试

3. 工作台应用——处理复杂交互

4. 群聊放最后,且必须先想清楚"按谁的权限答"

5. 外部联系人单独设计,不复用内部能力

很多企业反着来,因为群聊看起来"覆盖人多、效果明显"。那是把最特殊的风险放在了团队最没经验的时候。

---

相关阅读

  • 企业 AI 系统的安全治理:四类特有风险
  • 企业知识库怎么做,才不会变成资料坟场
  • 企业第一次做 AI,怎样选对项目并设计可退出的试点
  • 企业 AI 项目怎么验收:七层验收标准与证据要求

---

*本文说明的是方法与判断标准,不代表任何未公开项目的实施细节。文中引用的开源评测框架,出处已在正文标明,读者可自行核验。数据处理与留痕的具体要求请由企业法务或合规部门确认,本文不构成合规意见。*