昨天还在说,智能体一旦进到真实系统,权限和审核得跟上。今天的三条消息把这件事往前推了一步:欧盟开始要求 AI 内容和交互说清身份;Cloudflare 在给智能体准备受控的“电脑”;OpenRouter 则提醒大家,选模型得拿自己的任务去测。
这不是三家公司的各自更新。它们都在补同一个缺口:AI 能力接进流程以后,谁来标、谁来管、谁来验收?
欧盟透明度规则生效:别把“用户应该懂”当作免责
欧盟《人工智能法案》中的透明度义务已在 8 月 2 日生效。公开报道显示,公司需要让用户知道何时在与 AI 互动,并为合成音频、视频和文本提供机器可读标记;违规最高可罚 1500 万欧元。
8 月 2 日那期日报已经谈过 AI 内容会碰上平台规则。今天新增的变化是,规则不再只是“平台要不要管”的讨论,而是产品要把披露做进界面和流程。一个客服机器人、一个生成视频的工具,不能只在角落塞一句说明就算完事。用户在哪一步看到提示,合成内容被转发后标记还在不在,出现争议后能不能追溯,都是要交付的细节。
对做产品的人来说,这不是合规同学最后补的一页文档。先把“AI 在哪里出现、用户会看到什么、记录留在哪里”画出来,后面改起来会少很多返工。
Cloudflare 给智能体补“电脑”:会调工具还不够
Cloudflare 发布了 @cloudflare/computer 的早期预览版。它提供虚拟文件系统,并支持让智能体在 isolate、容器沙箱或浏览器中执行代码。
这和昨天的 Agent Cloud 是同一条线,但今天多了更具体的部件:智能体到底在哪里保存文件、运行代码、接触浏览器。很多智能体演示看起来很顺,是因为它只完成了一小段调用;一旦要连续读文件、改文件、跑脚本,权限串了、状态丢了、错误扩散了,才是真正麻烦的地方。
别把“给智能体一台电脑”理解成权限开得越大越好。更实用的理解是:给它一块隔离的工位,能做什么、留下什么、出错后怎么收回,都得先定好。你让它接手的不是一句问答,而是一段有后果的工作。
Ori Eval:模型选型别靠排行榜猜
OpenRouter 推出 Ori Eval,主张用 API 对代码库里的具体任务跑评估,再比较不同模型的结果。
这件事说起来不新鲜,真正落地却常被省掉。大家看榜单、看别人截图,最后还是凭印象挑一个模型。可你自己的任务可能是整理会议纪要、改一段旧代码、抽取表格字段,评判标准也不一样:有的要少出错,有的要快,有的必须控制成本。
最小的做法不复杂。挑 5 到 10 个你已经知道标准答案的真实任务,给几个候选模型跑一遍,记录成功率、耗时和花费。别只问“谁最强”,先问它在你手里的这副牌里能不能稳定交付。
今天可以直接带走
准备把 AI 接进工作流时,先补三道题:用户是否知道它是 AI;它能动到什么边界;结果拿什么真实任务验收。
这三题答不上来,模型再强,也只是演示好看。答清了,才有资格往正式流程里放。