买家不会给系统打速度分,只判断对方是否听懂了自己的问题。客服自动化上线后的典型情形是响应指标漂亮、满意度不动、退款率反而上升,问题出在评估口径里没有语言质量这一层。

先按后果给错误分级

把会话按“答对、答错、错得危险”分类,比统计命中率有用。答案正确但表达生硬,影响体验;答案错误但买家能自行纠正,产生重复沟通;答案读起来通顺却给出错误的尺码建议或售后口径,直接带来退款与纠纷。第三类要在评估里单列,因为自动评分很容易把它判为合格。

抽样要分层,总量随机说明不了问题

按语种、问题类型和业务阶段分层取样:小语种样本少但错误后果重,退款与纠纷类会话占比低但关系资损,售前咨询量大但容错高。只看总量随机,会让低风险会话淹没高风险场景,结论看起来稳定却没有指向。

语言质量的四个检查面

四个面分开看,是因为修复方式不同:术语问题回到词表,槽位问题回到字段抽取,语气问题回到风格指南,保留规则问题回到配置项。混在一起打一个总分,团队并不知道该改哪一处。

  • 术语一致:同一部件、面料、规格在全文与商品页面用同一说法,避免买家理解成不同物件。
  • 槽位准确:能正确引用订单号、尺寸与颜色,不张冠李戴。
  • 语气与文化适配:道歉、催促、拒绝的表达在当地习惯里是否得体。
  • 禁译与保留规则:地址、品牌名、法规术语的原文保留要求。

评估节奏与门槛设置

评估周期要贴业务节奏:大促前完整跑一轮,上新品类或换供应商时补一轮,日常只做小样本跟踪。门槛不宜设成统一平均分,涉及退款、清关与产品安全的场景要单独设线,因为这些错误的代价和其他会话不在同一个量级。

另外要留一组固定样本作为回归集,知识库或模型调整后重跑同一批,观察结论变化来自哪条规则。没有回归集时,改进与退化会同时发生却难以分辨,团队往往在几周后才从差评里发现。

评估结果怎么回到系统

双评加仲裁是必要的:两名母语评审分歧时由第三人裁定,分歧本身要留档,因为它往往说明业务口径含糊,而不是模型问题。评审之外,维护一份不能自动应答的清单同样关键,涉及责任划分、赔付承诺、清关资料、安全与使用说明的话题一律转人工。评估产出不该只是一份分数,而是术语表、清单和知识库条目的修订记录。

九顺控股旗下的精盈电商板块在处理多语种客服时,把语言质量与业务后果挂钩来看:某类错误一旦关联到退款,就先关闭该场景的自动应答再谈优化。正在上线或复盘客服自动化的团队,可致电 0755-8359 0008 交流分层抽样的做法。