企业把生成式AI用起来,通常从文档开始:合同初审、投标技术响应、说明书翻译、会议纪要整理。理由很实际,字数大、重复度高、见效快。也恰恰是文档,写错一个条款、漏一项参数,责任要有人承担,所以边界必须提前划定。
按责任后果给文档分级
分级的依据不是任务难不难,而是出了错谁承担后果。内部周报、竞品资料摘要、培训讲稿属于低风险,偏差由内部消化,模型可以承担较多起草工作。对外报价说明、投标响应、产品说明书属于较高风险,涉及承诺与合规表述,生成内容只能作为底稿,逐条对照原始资料后签发。合同文本、劳动用工告知、财务与税务口径说明属于高风险,模型可做条款比对与风险提示,最终判断必须由有授权的人作出并留名。
分级的价值在于同一套工具在不同场景匹配不同审核强度,而不是一刀切禁用或者一刀切上线。前者浪费效率,后者埋下事故。
能交给模型的环节与必须留人的环节
- 适合模型:资料检索、格式改写、要点抽取、版本差异对照、多语言初译。
- 必须留人:事实核验、数字与承诺的确认、条款取舍、责任表述、终稿签发。
- 必须留痕:谁提交、提交了什么、系统返回什么、谁改了哪几处。
中间地带最容易出问题的是看似抽取、实为判断的任务,例如从一堆条款里总结违约责任。模型抽取的是文本表层,判断需要结合合同整体与交易背景,这类环节应设计成机器给线索、人给结论。
数据边界先于功能上线
语料与检索库涉及客户名单、报价、工艺参数与人员信息,权限要按角色和项目隔离。同一家机构同时服务多家客户时,不能把一家的价格资料作为另一家的生成参考,这是最容易忽视也最难解释的泄漏路径。对外发出去的文档、涉及个人隐私的材料,进入模型前要做脱敏,是否允许使用第三方接口要有明确清单,不能由员工个人自行决定。
评估口径看修改幅度,不看整体准确率
上线前用历史文档做小样本对照更有指向性。看三件事:漏项率,关键条款或参数是否缺失;错项率,是否出现原文没有的内容;人工修改幅度,编辑距离比正确率更诚实。若人工需要重写大段内容,模型只是把工作量换了个形式,效率收益并不成立。运行一段时间后,再按文档类别统计返工情况,把边界往回收或往前推。
深圳市九顺控股有限公司在内部推进这类工具时采用的顺序是先分类、再试点、后放权:低风险场景先跑,高风险场景只做比对提示。关于业务文档场景的工具落地路径,可拨打 0755-8359 0008 与团队交流。