假设一家小公司准备把售后接给 AI。顾客问:“这台机器刚买三天就坏了,能不能直接退款?”

系统很快查到订单,检索到退换政策,起草了一段语气也不错的回复:可以申请退款,已为您处理。演示时很顺。可这句话一旦发出去,接下来的问题就会冒出来:谁确认了商品状态?库存和款项有没有真的变化?这笔订单是不是正在被别的客服处理?顾客看到“已处理”以后,团队拿什么解释?

很多企业 Agent 在这里被误判了。屏幕上出现了一段像真人写的文字,团队就以为业务流程已经跑通。可文字只是一个候选动作。订单、工单、库存、退款和权限,才是业务真正的状态。模型可以参与判断,不能靠一句“我已经办好了”替系统改账。

OpenAI 的 Agent 建设指南把工具、清晰指令、护栏和人工介入放在同一套设计里;它还特别提醒,高风险或不可逆的动作需要人来把关。OpenAI 的指南说的是通用原则。落到国内团队常见的售后、运营和销售支持里,我觉得可以把它翻成一条更朴素的交付规则:别先问 Agent 会不会聊天,先问它能拿出什么证据,证明自己走到了哪一步。

第一张:它到底能动什么

一个客服 Agent 能读订单,不等于它能改订单;能生成退款建议,也不等于它能发起退款。权限要按动作拆开。

最开始可以让它只做三件事:读取经过授权的订单信息、引用已批准的规则、起草给客服看的回复。它没有直接改价、退款、补发的权限。等团队积累了足够的真实案例,再把低风险动作一点点放开。

这听起来保守,实际上是在给团队留手牌。你不必第一天就押注“全自动售后能不能成”,先验证一张更小的牌:它能不能把资料找对、把风险挑出来、把人工的准备时间省掉。这个结果看得见,也容易纠错。

第二张:它的依据能不能翻出来

模型写得笃定,常常会掩盖一个很尴尬的问题:这句话依据哪条规则?

售后政策、报价口径、客户合同、内部 FAQ 都会变。Agent 如果只给结论,不给来源,客服很难核对;如果它引用了过期文档,事情会更麻烦。一个可交付的流程至少要让人看见它使用了什么资料、资料的版本和适用范围。没有可靠依据时,系统该说“需要补充信息”或“转人工”,不要把猜测包装成答复。

这也是为什么检索不是把一堆文件塞进去就结束了。资料里有旧价格、例外条款、内部备注和客户信息时,团队还要决定哪些内容能给模型看,哪些只能留在系统里。把全部上下文倒给模型,省的是眼前几分钟,赔的可能是数据边界和解释成本。

第三张:这次动作有没有真的落到系统里

AI 生成“已提交退款申请”,和退款申请在业务系统里出现,是两件事。中间至少隔着一次受控调用、一次返回结果,以及必要时的失败处理。

拿本土电商售后举例。顾客在微信里催进度,客服把聊天交给 Agent。它可以把订单号、故障描述和政策整理好,提示“符合人工复核条件”。真正提交时,系统要返回一个工单号或状态变化;接口失败,页面就应明确显示失败,而不是让 Agent继续沿用那句“已经办理”。

这条区分会直接改变产品界面。别只在聊天框里做一个漂亮回答。把当前状态、下一步负责人、失败原因和可恢复入口摆出来。人看到的不是一段流畅文案,而是一件还能接着办下去的事。

第四张:谁在什么情况下接手

“必要时转人工”这句话太轻了。真正的转人工要写清楚触发原因、交给谁、此前做了哪些动作、对方接手后能否拒绝或补资料,以及顾客端该收到什么说明。

例如退款金额超过团队设定的范围、商品涉及安全投诉、资料互相矛盾、模型连续几次拿不到可信依据,都该进入人工队列。这个队列不是 Agent 甩锅的垃圾桶,而是让有权限的人接过完整上下文,做一次能被追溯的判断。

人工确认也不是给流程加一道仪式。它负责处理当前语境:今天这位客户是不是特殊情况,哪条旧规则不该生搬硬套,风险该不该由公司承担。AI 可以把桌面收拾好,人仍然要决定这张牌现在能不能打。

第五张:下次改了,旧问题会不会又回来

团队把提示词改得更聪明,常常只盯着眼前那一个案例。可新版本修好了退款话术,可能又把补发场景弄乱;更新了知识库,又可能让旧合同被错误引用。

所以第一批上线前,不妨留下几十个真实但已经脱敏的样本:常规咨询、资料缺失、规则冲突、需要转人工、接口失败。每次改模型、提示词、知识来源或业务规则,都让它们重跑一遍。结果不用追求一张华丽分数,先把哪些通过、哪些失败、为什么失败记下来。

这一步会把“感觉这版好像更聪明”变成能讨论的东西。产品、客服和开发不必各说各话,大家看同一批任务:哪一个环节出了问题,修复是不是伤到了别的流程,下一次该把哪条规则写得更清楚。

团队暂时做不到完整回归,也别空着。先给每个上线场景留一张小记录:输入是什么,允许的动作是什么,人工最后怎么判,异常出现时系统停在哪。它不精致,却能让下一次讨论回到事实,而不是回到谁的印象更深。

先交小作业,再谈大自动化

企业做 Agent,最容易被聊天框带偏。它太像结果了:回答快、语气顺、演示也好看。可业务里真正昂贵的部分,是错一次以后谁去查、谁去赔、谁向客户解释。

先把范围缩到一件具体的事。让 Agent 读什么、建议什么、绝对不能动什么;每一步凭什么继续;失败后谁接;改完怎样重跑旧样本。把这五张证据交出来,团队再去讨论要不要接更多工具、上更复杂的编排、放更大的权限。

这样做不酷,却能把“AI 能做什么”换成一个更值得回答的问题:这套流程今天能负责到哪里。答案越清楚,后面自动化的路才越走得远。