上周和一位做社区团购的朋友聊天。他给售后同事做了一个 AI 回复助手:把用户的问题贴进去,再让它根据店里的规则写一段能直接发出去的话。
一开始看起来很省事。直到有人问:“今晚下单的冷链商品缺货,能换货还是退款?”助手把两条旧规则拼在一起,给出一段很像那么回事、实际却不能发的答复。朋友的第一反应是:这个 AI 不好用。第二反应是,再改一版提示词。
问题在于,三天以后,换了一个相近的问法,它又错在同一个地方。大家记得自己“刚刚改过”,却说不清改了什么,也没法知道这次到底有没有修好。
这类返工常被归到模型能力、提示词手感,或者“资料还不够”。它们都可能是真的,但还有一个更近的原因:失败没有被留下来。没有样本,改动只能靠印象验收;印象好的那一刻,往往正好是最容易高估自己的时候。
我从 Dianne Penn 一场公开访谈里谈到的评测实践中,捡到一个很朴素的做法:别急着把 AI 当成一个需要被表扬或责备的同事,先把它做错的题收起来。下面不谈复杂平台,只谈一个小团队今天就能开始的版本。
抱怨不是样本,样本能回归
“它又答错了”不是可用的记录。过两天再看,你无法复现当时给了它什么资料,也不知道什么才算正确。
一次失败至少要有五格:
- 任务:希望它完成什么动作,例如“根据已给规则起草一条售后回复”。
- 输入:当时的用户问题、允许使用的资料,以及明确限制。
- 实际输出:原样保存,不要事后替它润色。
- 期望结果:不是长篇标准答案,而是必须包含、绝不能出现什么。
- 判定规则:谁来判,怎么判。例如“不得承诺未确认的补偿;缺货处理必须转人工确认”。
这五格凑齐,失败才从情绪变成一张能重跑的题。以后换模型、补资料、调整流程,拿同一批题再跑一遍,就能看到:这次少错的是哪一类,新增的错又是什么。
这里有个容易混淆的地方。样本不是为了证明 AI 有多差,而是为了把责任分清。它引用错资料,可能是资料没给全;它语气不合适,可能是输出约束没写明;它替人做了不能替的决定,问题可能根本不该交给它。把这三种错混在一起,改十轮提示词也只是在原地打转。
先攒 10 个,不要先追求一套大系统
十不是神奇数字。它只是比“记住刚才那两个例子”可靠,又不会把一个人困在表格里一整天的起步量。
可以给每条失败再贴一个小标签:资料、格式、判断边界、语气、步骤遗漏。连续收十条后,通常会露出一个很具体的洞:比如 AI 总把不同日期的活动规则混用,或者总把“建议联系人工”说成“已经可以办理”。这时再改,手上有的是证据,不是灵感。
以那家团购小店为例,先把真实政策替换成演练规则:冷链缺货只能说明“正在核实”,退款和换货都不能承诺。收集十个不同问法后,他们可能发现六个错误都发生在“资料里有相近旧规则”时。于是这次不必重写整段提示词,只要把可用规则限定为当期版本,并要求答复先引用规则编号给人工看。改完,把那十题重新跑一遍。
这不是自动化售后的正式方案。价格、库存、发货、退款这类会改变用户权益的事,仍应由熟悉规则的人确认。AI 在这里更适合做起草和提醒,不适合越过最后那道门。
改一次,只动一个变量
最可惜的情况是:觉得效果不好,于是同时换模型、加资料、改提示词、换输出格式。结果变好了,也不知道是哪个动作起效;下次坏了,更不知道该退回哪里。
我更愿意按这个顺序做:
- 用一周把每天出现的失败记下来,宁可短,不要靠回忆补写。
- 从中挑返工成本最高的三条,而不是挑最容易让人不舒服的三条。
- 给每条写一条人能读懂的判定规则:什么算过,什么必须转人工。
- 每次只改一个地方:资料范围、任务说明、输出格式或人工交接条件,四选一。
- 改完重跑旧样本,并给这次改动留一个版本号和日期。
第五步经常被省掉,却最值钱。它让“这版感觉更顺”变成“原来十题里有七题通过,现在九题通过,但有一题开始漏掉日期”。你不需要假装自己在做一间大公司的评测平台;只要能看见得失,就已经比凭感觉迭代稳得多。
把主线任务留给人
AI 的输出会变,业务规则会变,用户的问法也会变。稳定的不是某一版提示词,而是你有没有一套办法,把变化拿回来对照。
所以,下次再遇到“它怎么又不好用”,先别急着换工具。把这一题记下来,写清它拿到了什么、错在哪里、谁有资格说它过关。攒够十题,再动手改。
你真正保住的,不是一段漂亮提示词,而是团队判断问题的手牌:哪些可以交给机器,哪些必须留在人手里。主线任务始终是后者。