今天留两条消息。它们都不在比谁的模型参数更大,而是在处理同一个麻烦:AI 真开始干活以后,人得看得见它在做什么,也得管得住资源怎么分。
把智能体从聊天记录里拿出来
GitHub 介绍了在智能体工作流中使用 canvas 的做法。聊天适合说清意图,可一旦任务要分步骤执行、调用工具、消耗额度,过程很快就被对话记录淹没。canvas 把计划、执行状态和成本放到同一个可见界面里,方便人在中途修改方向或叫停。
这件事很朴素。让 AI 干一件小活,聊天框够用;让它接一条长流程,光看最终回答不够。你要知道它准备做什么、已经碰过哪些文件、还要花多少成本,以及哪一步该由人验收。否则出了错,只能对着一长串记录倒查,和让实习生关门写半天活差不多。
GPU 也不是越多越好用
Hugging Face 发布的 Dharma AI 案例把注意力放在 GPU 分配上。团队没有增加硬件,而是根据不同任务的约束和时效性调度资源;在文中列出的七个基准场景里,相比 FIFO 调度,同一集群的 GPU 利用率最高提高了 33 个百分点。
数字来自该团队的基准测试,不能直接当成所有公司的结果。但它提醒了一件常被忽略的事:模型能力上去了,服务能不能跑稳还取决于排队、优先级和监控。把最急的请求和最吃资源的任务混在一条队里,再多 GPU 也会被浪费掉。
今天可以带走什么
如果你已经在工作里让 AI 跑多步骤任务,先补两样东西:一张能看到任务状态和人工确认点的清单,一条区分紧急任务与后台任务的规则。
模型负责处理不确定的部分,流程负责把它放在该放的位置。能看见、能暂停、能复核,AI 才算真正进了工作流。