今天最值得看的,不是一张新的模型排行榜,而是三条新闻把同一个问题摆到了台面上:模型开始接到更长、更具体的任务后,能力只是第一步,后面还得有任务拆解、测试方法和人工验收。
Claude Opus 5:模型更强,工作流不该更糊
Anthropic 发布了 Claude Opus 5。公开说明把重点放在复杂任务、工具使用和长时间运行的工作上。对普通使用者来说,这类更新最容易被理解成“以后它能替我多做一点”。
我更在意另一面。任务拉长以后,问题不会自动消失,只是更晚才出现:目标有没有说清,过程中拿到的资料对不对,最后交付能不能用。模型越能连续干活,越不能只在开头丢一句需求,结尾看一眼就点确认。
如果你在用 AI 写代码、整理资料或跑重复任务,可以先把一件小事写成明确的验收标准。比如要生成什么、哪些结果不能接受、哪里必须人工看。这样模型升级时,你才能分辨它是真的替你省了返工,还是只让它更快地输出一堆待检查内容。
Drone-Bench:把 AI 拉到真实空间里,短板会更清楚
Anthropic 与 Andon Labs 推出了 Drone-Bench,用来测试 AI 在室内无人机任务中的地图重建、定位、导航、目标检测和跟随能力。它把原本一句“让 AI 控制无人机”的大话,拆成了一组可以分别检查的任务。
这比又多一个演示视频更有价值。聊天框里答对一道题,和在真实空间里持续完成任务,中间隔着感知、路径、时序和出错后的处理。每一环都可能把看上去很聪明的模型卡住。
对不做无人机的人,这个思路同样有用。别只问一个 AI 工具“能不能完成”,而要把自己的工作拆成几步:它能读懂输入吗,能做出正确动作吗,遇到例外会不会停下来求助。拆开之后,哪些地方值得自动化,哪些地方还得留给人,才会变得具体。
FLUX 3:一体化生成越方便,后期越不能省
Black Forest Labs 推出了 FLUX 3,主打把图像、视频和音频放进同一套多模态能力里,单次可生成最长 20 秒的视频并带原生音频。对做内容的人,这种变化很直接:原来要在几个工具之间来回切的环节,可能被收进一次生成里。
但一次出片不等于一次交付。镜头是否连贯、声音是否合适、素材能否商用、细节有没有穿帮,仍然得回到成品检查。工具把前半段提速了,后半段的判断反而更重要。
可以直接带走
今天可以做一个小练习:挑你最常让 AI 做的一件事,把它写成三行。
- 输入是什么。
- 结果长什么样。
- 哪个环节必须自己确认。
这张小卡不酷,但能让你在下一次模型更新时,知道它到底替你省掉了什么,又把什么责任留在了你手上。