物流场景的 AI:先解决异常件闭环,不是路径优化

物流加 AI 的公开讨论,大半在讲路径优化和无人配送。

但对绝大多数物流企业和有物流环节的企业来说,每天真正在烧人力、且完全没被解决的,是异常件——破损、错分、滞留、地址问题、拒收、丢件。

这一类的特点是:量不大(占总单量的个位数百分比),但每一件都要人跟,跟一件耗时长,且经常跟丢。

它比路径优化更适合做第一个 AI 项目,理由有三个:数据现成、见效快、错了有人兜底。

---

异常件为什么难:不是判断难,是闭环难

处理一件异常,通常要走这几步:

1. 发现(系统报警,或客户投诉)

2. 定性(是哪一类异常)

3. 定责(哪个环节、哪个网点)

4. 联系相关方(网点、司机、客户、发件人)

5. 给方案(补发、退回、赔付、重新派送)

6. 跟进到结束

7. 归档

真正难的是第 4 到第 6 步。不是判断难——老手一眼就知道该怎么办;难的是这几步要跨系统、跨部门、跨时区地追着人问,一件事要来回七八次,而同时手上还压着几十件。

跟丢的通常不是难件,是简单件——因为它不紧急,就一直往后排。

---

AI 在这里该做什么

不是替人做决定,是把"追人"这件事自动化。

具体到四件事:

一、自动定性

从系统状态、扫描记录、客服会话里判断这是哪一类异常。

为什么可行:异常类型是有限的(通常十几到二十几类),且有明确的判据。

输出形态:给出分类 + 判断依据(哪条扫描记录、哪句客服描述)。不给结论性表述,让人确认。

二、自动补齐信息

一件异常要处理,需要哪些信息?运单信息、扫描轨迹、历史沟通、相似案例的处理方式。

现在这些散在四五个系统里,人要一个个点开。把它们聚合到一屏,是最直接的省时间。

这一件不需要任何"智能",就是数据聚合。但它通常能省掉处理时长的很大一部分。

三、自动跟进

这是价值最大的一件。

  • 到时间了没回复 → 自动催办
  • 责任方一直不响应 → 自动升级
  • 客户在等 → 自动同步进度

为什么这件事必须自动化:人做跟进最容易疲劳、最容易漏,而且漏掉的成本是滞后爆发的——一件跟丢的异常,两周后变成一条投诉。

四、给处理建议

基于历史相似案例,给出"这类情况以前通常怎么处理"。

注意措辞:给的是"历史上类似情况的处理方式",不是"你应该这么处理"。判断权留给人。

---

一张异常分类表

分类是整个系统的基础。分类错了,后面全错。

大类典型情况数据来源能不能自动定性
物理异常破损、少件、包装破裂扫描记录 + 现场照片部分能(照片需人工确认)
路由异常错分、错发、滞留扫描轨迹能,判据明确
地址异常地址不详、联系不上、拒收派送记录 + 客服会话
时效异常超期未妥投时间戳对比能,纯规则
信息异常面单信息错、重量体积不符系统字段比对
丢失轨迹中断且查无轨迹缺口能识别,定责需人工

前五类里有四类是纯规则或轻判断,根本不需要大模型。这一点很重要——用规则能解决的,不要用模型,规则更快、更准、更好解释。

模型的价值主要在两处:从非结构化的客服会话里提取信息,以及在历史案例里找相似的

---

闭环的判据

这个系统做没做成,只看一件事:

异常件的平均闭环时长,以及超期未闭环的件数。

不是"处理了多少件",不是"自动分类准确率"——那些是过程指标。

建议的量法

指标定义
平均闭环时长从异常产生到最终归档
超期未闭环件数超过约定时限还没结束的
跟丢率超过 N 天无任何动作的件数占比
重复投诉率已归档但客户又找回来的

"跟丢率"是最能反映真实状况的一个,也是最容易被系统性掩盖的——因为跟丢的件在报表上通常显示为"处理中",看起来一切正常。

先量出跟丢率,再谈优化。很多企业量出来之后的第一反应是"不可能这么高"——那正说明这个指标之前根本没人看。

---

数据准备:三件必须先做的事

一、异常类型要有统一口径。

如果不同网点对"滞留"的定义不一样,那统计出来的数字没有意义。这一步是纯管理工作,跟 AI 无关,但必须先做。

二、扫描记录要完整。

轨迹有缺口,自动定性就无从谈起。先查一批真实数据,看缺口率有多高——这个数字会决定项目可行性。

三、历史处理记录要能用。

"以前是怎么处理的"要能查到,才能给建议。如果历史记录只有"已处理"三个字,那这一块暂时做不了。

建议的启动门槛:取最近 3 个月的异常件,抽 100–200 件,检查上面三项。轨迹缺口率高于 10%,或历史记录里超过一半没写处理方式,先补这两项再上系统。

---

怎么验收

指标建议门槛
自动定性准确率(对照人工标注)不低于 90%,且错的要能说清为什么错
信息聚合完整性100%(该聚的字段一个不能少)
自动跟进触达率100%(该催的一个不能漏)
建议采纳率作为参考,不作为考核

"建议采纳率"不能当考核指标——把它当 KPI,会导致系统倾向于给"人容易同意"的建议,而不是"对的"建议。这是指标设计上的一个常见陷阱。

答案质量的口径可沿用开源评测框架 RAGAS(docs.ragas.io),重点看答案忠实度:给出的处理建议,能不能对应到具体的历史案例或制度条款。

---

一个务实的推进顺序

1. 先做信息聚合——纯数据整合,两三周能见效,风险为零

2. 加自动定性,但只对那四类判据明确的做,且人工确认

3. 加自动跟进——这一步价值最大,也最需要跨部门配合

4. 最后做处理建议,此时已经有足够的历史标注数据

第 3 步是真正的分水岭。它需要的不是技术,是跨部门的流程约定——谁该在多久内响应、不响应升级给谁。这件事谈不下来,系统做得再好也没用。

---

相关阅读

  • 企业第一次做 AI,怎样选对项目并设计可退出的试点
  • 企业做 AI 项目前需要准备哪些资料
  • 企业 AI 项目怎么验收:七层验收标准与证据要求
  • 企业 AI 的数据治理:治什么、治到什么程度、谁来治

---

*本文说明的是方法与判断标准,不代表任何未公开项目的实施细节。文中引用的开源评测框架,出处已在正文标明,读者可自行核验。*