“今年必须把 AI 用起来。”

这句话在会议室里已经很常见了。真正难的是下一句:那我们怎么知道谁真的会用?

很多公司的第一反应,是办一场提示词考试。让候选人写一段复杂指令,十分钟做出一页漂亮的 PPT,再看谁讲得最顺。这个办法能筛出会演示的人,却很难判断他能不能接住一项真实工作。

生产现场没有干净的题目。资料会缺页,口径会打架,客户会临时改要求,最后还要有人签字。会把模型叫出一个答案,和能对结果负责,是两种能力。

所以我更愿意把筛选做成一段四周的真实任务试工。它不是统一的人事标准,也不是用来自动淘汰谁的算法,而是一套可以在企业内部调整的管理试点:把候选人放进一条有输入、有验收、有例外的工作流里,观察他留下了什么证据。

先看他能不能把一件旧工作说清楚

拿电商团队的商品上新举例。运营每天要把供应商表格、产品图、规格说明和客服常见问题整理成商品页。看上去是填标题、卖点和参数,真正容易出错的地方却在细节:某个尺寸到底按厘米还是英寸,库存表的更新时间是什么,图片里的颜色和文字描述冲不冲突,哪些承诺必须让负责人确认。

第一周,先关掉 AI,让候选人照原流程完成一次。他要画出材料从哪里来、每一步产出什么、谁验收、哪些情况必须人工判断。这个阶段不追求快,追求把隐含的判断摊到桌面上。

如果他一上来只说“把资料丢给模型,让模型生成商品页”,说明他还没有看见任务的骨架。模型能处理文字,不会替团队决定哪个字段算最终口径。

第二周,再让他用 AI 跑同一类任务。要求保留原始材料、使用过的任务说明、模型输出的版本、人工修改和最后的验收记录。这样才能分清:效率来自流程变好了,还是只是把检查工作藏到了最后。

四周真实任务从流程梳理、AI 辅助、同事接手到异常沙盒测试逐步推进

四周的重点不是做出一次漂亮演示,而是让一条工作流经得起换人和出错。

第三周,把任务交给另一个同事。原作者不能坐在旁边口头救场,只能提供他留下的说明、样例和检查表。别人能不能按说明跑出相近结果,暴露的是流程有没有被真正交出来。

第四周,准备一个隔离的测试副本,故意放进缺失字段、互相矛盾的数据、格式混乱的附件和临时改动的要求。这里不考谁能把错误“修得像没发生过”,而是看他会不会停下来、标记问题、升级给谁、留下什么记录,以及能不能回滚到上一版。

留证据,比交一个漂亮结果重要

筛选 AI 人才时,最容易被忽略的是过程证据。一个结果看起来正确,可能是候选人凭经验手工修好的,也可能是模型碰巧猜对的。没有原始输入和修改记录,管理者无法判断这条流程下一次是否还可靠。

我会要求候选人至少留下五样东西:原始材料的范围和版本、任务拆解、每次输出、人工改动的理由、最终验收人和验收标准。材料涉及客户或内部数据时,测试应使用脱敏资料或副本,不能把真实敏感信息直接塞进公共工具。

这也解释了为什么“提示词写得长”不是好指标。长提示词可能只是把所有愿望堆在一起,真正重要的却是:输入变了,哪一段需要重新确认;输出不完整,谁来补;模型给出看似合理的数字,依据在哪里。

证据卡片、检查清单、风险标记和交接文件组成一张可复核的工作台

把原始材料、版本和验收放在同一张桌上,结果才有机会被复核。

分数只划候选池,分项决定岗位

为了让讨论不只停留在“我觉得他不错”,可以做一个 100 分的内部试点评分表:业务判断 25 分,验收与纠错 25 分,任务拆解与上下文 20 分,风险边界 15 分,复用和教会别人 15 分。

这个权重是管理试点建议,不是行业验证过的标准。企业可以按自己的风险调整。比如财务、法务和医疗相关任务,风险边界和验收权重就应该高一些;低风险的内容整理,可以把复用和速度放得更前。

分数的作用也不是给人贴标签。我会把 60 分当作“可以继续观察”的候选线,把 75 分当作“进入高潜池”的讨论线,但最终仍要看哪几项得分。一个人总分不错,却完全不会做验收,就不该单独负责高风险流程。

岗位路由大致有三条:能理解业务、拆任务、使用工具的一线 AI 使用者;能把任务做成可维护流程的工作流负责人;能定义标准、抽查结果、拥有暂停权的风险与验收角色。有人工具用得很熟,但不懂业务,他可以做实现和支持,却不应独自定义“什么算完成”。

业务老手、流程建设者和验收者在三个相连工作台上配对,经验、实现和暂停权各有位置

把业务判断、流程实现和验收权拆开,团队才不会把“会用工具”误当成“能对生产负责”。

老员工不是要不要保,而是经验怎么换位置

真正熟悉业务的人,往往知道哪些情况表面正常、实际上马上要出问题。他们的经验不一定写在 SOP 里,而是藏在一句“这个供应商月底最容易失约”、一个客户的特殊习惯,或者一张旧表格的颜色标记里。

如果公司只要求他们把经验全部上传,然后让另一个人接管,他们当然会警惕。更可行的安排,是让业务老手负责整理例外库、验收规则和不能自动化的边界,再和熟悉 AI 工具的人组成小组。前者决定什么不能错,后者把这些判断变成可运行、可检查的步骤。

配对能不能成立,还要看管理者有没有把几件事说清楚:培训时间算不算工作,流程上线后的功劳怎么记录,谁有签字权,谁可以按下暂停键,出了问题往哪条线升级。没有这些安排,四周测试很容易变成一场新的隐性加班。

给管理者的一张最小检查卡

如果你准备在团队里试一次,可以先做下面七步:

  1. 选一项高频、重复、已有验收人的真实任务,不要从空泛的“做个 AI 助手”开始。
  2. 第一周关掉 AI,要求候选人画出输入、输出、人工判断和异常分支。
  3. 第二周开放 AI,但保存材料、任务说明、版本、修改和验收证据。
  4. 第三周换一个同事执行,原作者只提供文档,不在旁边口头补洞。
  5. 第四周在脱敏副本里放入缺字段、冲突数据和临时要求,观察停、问、记、退四个动作。
  6. 用分项评分讨论他适合做使用者、流程负责人还是验收角色,不只看总分。
  7. 事先写好暂停线、升级人和回滚办法;红线的含义是暂停生产资格,不是自动解雇。

这套方法的价值,不在于四周后得到一个看起来精确的分数,而在于把“他到底会不会”换成一串可以检查的问题:任务交给别人还能不能跑,资料变了会不会重验,结果不对时能不能说清楚,出了边界有没有人能按下暂停。

真正会用 AI 的人,不是把模型哄出一段漂亮答案的人,而是知道什么时候不能继续,能让别人复现,能把证据交回来,也能承认这一步需要业务负责人签字。

至于 100 分怎么分、60 和 75 放在哪里,只能由每家公司的任务风险、数据边界和管理规则决定。先拿一条真实流程试四周,通常比再办一场提示词比赛更接近答案。