今天留两条和“少搬一点数据,多解决一个问题”有关的更新。

Google DeepMind 给 Gemini 加了 agentic video:模型会围绕问题自己搜索视频、回看关键片段,再决定下一步该看哪里。Hugging Face 则发布了 @huggingface/kernels,把 200 多个 WebGPU 内核做成可在浏览器里调用的库。一个在减少长视频理解里的无效读取,一个在把部分推理能力往用户设备推。

长视频不用再从头硬塞给模型

Google DeepMind 介绍的这套能力,面向的是“视频里到底有没有某个动作、某段信息出现在哪里”这类问题。模型可以先粗看,再把注意力放到值得复查的片段;官方在其测试中给出的结果是,token 用量最多可降 88%,成本最多可降 66%,准确率最多提高 7%。这些是公司测试口径,实际效果还要看视频类型和提问方式。

对做内容、课程或素材整理的人,这个方向比“模型能看视频”更有用。真正费时间的地方往往不是把文件传进去,而是从两小时素材里找出那几分钟。下次试视频 AI,别只问它能不能总结,拿一个能核对的问题去测:它能否给出时间点、说明依据,并让你回到原片复查。找得到、说得清、能复看,才值得接进工作流。

浏览器本地推理,多了一层可用的底子

Hugging Face 发布的 @huggingface/kernels 收录 200 多个 WebGPU 内核,目标是让开发者在浏览器里调用常见的 AI 计算操作。它不是一个直接替人完成任务的产品,更像是给网页端本地推理铺的一层基础设施。

这件事的价值在于选择多了一种。某些轻量任务可以少走一次云端 API,延迟、隐私和离线可用性都有机会重新取舍;但设备性能、浏览器兼容性和模型体积仍是成本,不能把“能在浏览器跑”直接等同于“适合生产”。

今天可以带走什么

给手上的 AI 工具做一次小测试:挑一个结果能回查的真实任务,记录它读取了什么、给了什么结果、你花多少时间复核。模型更会找、更靠近设备,最后还是要落到这张账上:它到底替你省了哪一步,又把哪一步的责任留给了你。