物流场景的 AI:先解决异常件闭环,不是路径优化
物流加 AI 的公开讨论,大半在讲路径优化和无人配送。
但对绝大多数物流企业和有物流环节的企业来说,每天真正在烧人力、且完全没被解决的,是异常件——破损、错分、滞留、地址问题、拒收、丢件。
这一类的特点是:量不大(占总单量的个位数百分比),但每一件都要人跟,跟一件耗时长,且经常跟丢。
它比路径优化更适合做第一个 AI 项目,理由有三个:数据现成、见效快、错了有人兜底。
---
异常件为什么难:不是判断难,是闭环难
处理一件异常,通常要走这几步:
1. 发现(系统报警,或客户投诉)
2. 定性(是哪一类异常)
3. 定责(哪个环节、哪个网点)
4. 联系相关方(网点、司机、客户、发件人)
5. 给方案(补发、退回、赔付、重新派送)
6. 跟进到结束
7. 归档
真正难的是第 4 到第 6 步。不是判断难——老手一眼就知道该怎么办;难的是这几步要跨系统、跨部门、跨时区地追着人问,一件事要来回七八次,而同时手上还压着几十件。
跟丢的通常不是难件,是简单件——因为它不紧急,就一直往后排。
---
AI 在这里该做什么
不是替人做决定,是把"追人"这件事自动化。
具体到四件事:
一、自动定性
从系统状态、扫描记录、客服会话里判断这是哪一类异常。
为什么可行:异常类型是有限的(通常十几到二十几类),且有明确的判据。
输出形态:给出分类 + 判断依据(哪条扫描记录、哪句客服描述)。不给结论性表述,让人确认。
二、自动补齐信息
一件异常要处理,需要哪些信息?运单信息、扫描轨迹、历史沟通、相似案例的处理方式。
现在这些散在四五个系统里,人要一个个点开。把它们聚合到一屏,是最直接的省时间。
这一件不需要任何"智能",就是数据聚合。但它通常能省掉处理时长的很大一部分。
三、自动跟进
这是价值最大的一件。
- 到时间了没回复 → 自动催办
- 责任方一直不响应 → 自动升级
- 客户在等 → 自动同步进度
为什么这件事必须自动化:人做跟进最容易疲劳、最容易漏,而且漏掉的成本是滞后爆发的——一件跟丢的异常,两周后变成一条投诉。
四、给处理建议
基于历史相似案例,给出"这类情况以前通常怎么处理"。
注意措辞:给的是"历史上类似情况的处理方式",不是"你应该这么处理"。判断权留给人。
---
一张异常分类表
分类是整个系统的基础。分类错了,后面全错。
| 大类 | 典型情况 | 数据来源 | 能不能自动定性 |
|---|---|---|---|
| 物理异常 | 破损、少件、包装破裂 | 扫描记录 + 现场照片 | 部分能(照片需人工确认) |
| 路由异常 | 错分、错发、滞留 | 扫描轨迹 | 能,判据明确 |
| 地址异常 | 地址不详、联系不上、拒收 | 派送记录 + 客服会话 | 能 |
| 时效异常 | 超期未妥投 | 时间戳对比 | 能,纯规则 |
| 信息异常 | 面单信息错、重量体积不符 | 系统字段比对 | 能 |
| 丢失 | 轨迹中断且查无 | 轨迹缺口 | 能识别,定责需人工 |
前五类里有四类是纯规则或轻判断,根本不需要大模型。这一点很重要——用规则能解决的,不要用模型,规则更快、更准、更好解释。
模型的价值主要在两处:从非结构化的客服会话里提取信息,以及在历史案例里找相似的。
---
闭环的判据
这个系统做没做成,只看一件事:
异常件的平均闭环时长,以及超期未闭环的件数。
不是"处理了多少件",不是"自动分类准确率"——那些是过程指标。
建议的量法:
| 指标 | 定义 |
|---|---|
| 平均闭环时长 | 从异常产生到最终归档 |
| 超期未闭环件数 | 超过约定时限还没结束的 |
| 跟丢率 | 超过 N 天无任何动作的件数占比 |
| 重复投诉率 | 已归档但客户又找回来的 |
"跟丢率"是最能反映真实状况的一个,也是最容易被系统性掩盖的——因为跟丢的件在报表上通常显示为"处理中",看起来一切正常。
先量出跟丢率,再谈优化。很多企业量出来之后的第一反应是"不可能这么高"——那正说明这个指标之前根本没人看。
---
数据准备:三件必须先做的事
一、异常类型要有统一口径。
如果不同网点对"滞留"的定义不一样,那统计出来的数字没有意义。这一步是纯管理工作,跟 AI 无关,但必须先做。
二、扫描记录要完整。
轨迹有缺口,自动定性就无从谈起。先查一批真实数据,看缺口率有多高——这个数字会决定项目可行性。
三、历史处理记录要能用。
"以前是怎么处理的"要能查到,才能给建议。如果历史记录只有"已处理"三个字,那这一块暂时做不了。
建议的启动门槛:取最近 3 个月的异常件,抽 100–200 件,检查上面三项。轨迹缺口率高于 10%,或历史记录里超过一半没写处理方式,先补这两项再上系统。
---
怎么验收
| 指标 | 建议门槛 |
|---|---|
| 自动定性准确率(对照人工标注) | 不低于 90%,且错的要能说清为什么错 |
| 信息聚合完整性 | 100%(该聚的字段一个不能少) |
| 自动跟进触达率 | 100%(该催的一个不能漏) |
| 建议采纳率 | 作为参考,不作为考核 |
"建议采纳率"不能当考核指标——把它当 KPI,会导致系统倾向于给"人容易同意"的建议,而不是"对的"建议。这是指标设计上的一个常见陷阱。
答案质量的口径可沿用开源评测框架 RAGAS(docs.ragas.io),重点看答案忠实度:给出的处理建议,能不能对应到具体的历史案例或制度条款。
---
一个务实的推进顺序
1. 先做信息聚合——纯数据整合,两三周能见效,风险为零
2. 加自动定性,但只对那四类判据明确的做,且人工确认
3. 加自动跟进——这一步价值最大,也最需要跨部门配合
4. 最后做处理建议,此时已经有足够的历史标注数据
第 3 步是真正的分水岭。它需要的不是技术,是跨部门的流程约定——谁该在多久内响应、不响应升级给谁。这件事谈不下来,系统做得再好也没用。
---
相关阅读
- 企业第一次做 AI,怎样选对项目并设计可退出的试点
- 企业做 AI 项目前需要准备哪些资料
- 企业 AI 项目怎么验收:七层验收标准与证据要求
- 企业 AI 的数据治理:治什么、治到什么程度、谁来治
---
*本文说明的是方法与判断标准,不代表任何未公开项目的实施细节。文中引用的开源评测框架,出处已在正文标明,读者可自行核验。*