8 月 1 日,DeepSeek Harness 团队成员崔天一在 X 上发了一条招募:做过开源 Agent Harness 项目的开发者,可以带着 GitHub ID 和代表作申请内测。

这不是一场面向普通用户的产品发布。没有价格页,没有公开仓库,没有许可证,也没有“现在就能下载”的链接。

但这个动作值得看。

因为 DeepSeek 这次找的,不是来体验聊天效果的人,而是最早一批会接工具、管状态、做权限、处理失败恢复的开发者。模型公司开始把他们拉进来,说明它要碰的已经不只是模型本身,而是模型外面那层真正让 Agent 干活的东西。

先把最容易被标题带歪的地方说清楚:DeepSeek 有两个连续动作,但不是同一件事。

7 月 31 日,DeepSeek 把 V4-Flash API 正式版放进公测,并说明它原生支持 Responses API、专门适配 Codex;官方同时强调,本次只升级 Flash API,V4-Pro API 和 App/Web 模型没有变化。两天后,Harness 团队成员开始为一个仍未公开的产品招募定向内测开发者。前者是模型 API 更新,后者是 Agent 执行层的产品信号。把它们合成“DeepSeek V4-Pro 全量发布”或者“DeepSeek Harness 已全面开源”,都超出了证据。 DeepSeek Change Log

真正有意思的,是这两件事摆在一起以后,DeepSeek 的牌开始变了。

V4-Flash 更新的重点,不只是一组跑分

DeepSeek 在 7 月 31 日的更新里,重点写了 Agent 能力和多项基准结果。官方也给了测试条件:部分 Code Agent 任务使用其最小模式的 Harness、最高 effort 等设置;其中两项全栈和高难编码集还是内部测试集。它们可以说明 DeepSeek 想展示什么方向,不能直接翻译成“任何 Codex 工作流都一定比过去强多少”。 DeepSeek Change Log

更值得普通开发者注意的是两个很具体的变化。

第一,deepseek-v4-flash 支持 Responses API,而当前 deepseek-v4-pro 还不支持。第二,DeepSeek 已经把 Codex 的配置、备份和切换方式写进自己的集成文档里。官方文档说得很直白:目前只有 V4-Flash 能接进 Codex,Pro 的支持仍预计在 8 月初到来。 DeepSeek 的 Codex 集成文档

这意味着什么?

以前模型公司更像是在卖一台发动机。你发一段文字,它给一段文字,最多再多一点工具调用。现在它开始主动把发动机装进现成的驾驶舱:有文件、有命令行、有项目状态、有工具权限,也有失败之后怎么恢复。

模型能力当然重要,但用户真正能不能感到差距,往往取决于这辆车能不能上路。任务能不能接着跑?文件改错能不能回退?发邮件和发布内容前会不会停下来让人确认?换模型以后,原来的资料和流程会不会一起丢掉?

这些问题,模型排行榜回答不了。

Harness 到底是什么?

这个词听上去很工程,先说人话。

把模型想成发动机。Harness 就是把发动机接上方向盘、刹车、仪表盘、维修记录和拖车绳的那一层。

它负责的通常不是“再想出一个更聪明的答案”,而是让模型能在真实环境里连续做事:

  • 调用哪些工具,谁有权限;
  • 任务做到哪一步,状态怎么保存;
  • 遇到报错后重试、换路还是交给人;
  • 多次操作留下哪些日志,哪里可以回滚;
  • 一段时间以后,哪些资料和规则还能继续用。

这也是为什么 Claude Code、Codex 这类工具给人的感受,早就不只是“代码写得怎么样”。真正拉开差距的,是它们能不能把模型塞进一套可控的工作环境里。

DeepSeek 如果真的做自己的 Harness,争的就不只是一笔 API 调用量。它也在争用户默认从哪里开始任务,开发者优先兼容谁的工具格式,以及一套工作流里的状态、权限和记忆最终留在哪儿。

说得更直白一点:以前它更像卖发动机,现在开始碰驾驶舱了。

为什么第一批要找开源开发者?

招募帖要求申请人带 GitHub ID 和开源代表作,这个选择很有针对性。做过 Harness 的人通常已经在真实项目里踩过坑:工具怎么接、长任务怎么续、权限如何收口、模型犯错时怎么留刹车。

这类人进内测,不只是为了给一个 Demo 点赞。他们会立刻问更麻烦的问题:我能不能接自己的模型?状态格式能不能迁移?工具协议是否稳定?出了事故到底谁能看日志、谁能撤回?

产品团队如果真想做生态入口,就需要这批人帮忙把缺口翻出来。

招募帖评论区的热闹也印证了这一点。一份第三方整理声称,回复中出现了 257 个自荐项目,其中不少项目仍在活跃开发,也有一部分已支持 DeepSeek。这个数字很容易被拿去做“生态爆发”的标题,但先别急。

整理者自己也写了限制:只覆盖了约一半回复,主要根据项目 README 由单一模型提取,样本还是愿意在招募帖下自荐的人。它不是 DeepSeek 的官方名单,更不是完整市场普查。把它当成一支温度计可以,拿它当行业人口普查就过头了。 第三方项目整理

不过,有一件事不需要等统计学完美才成立:产品还没公开,已经有人提前把自己的项目和手里的牌摆出来,争第一批兼容、第一批测试,也争第一批被看见的机会。

对 DeepSeek 来说,这会是一张活的生态地图。哪些项目已经做了记忆、沙箱、编排和技能;哪些地方只能自己补;哪些地方只要兼容现有接口,就能把一批开发者和工具接过来。257 以后会不会变,不是重点。重点是,这场抢入口的比赛已经开始有人站位了。

开不开源?现在还没有答案

招募帖下面最尖锐的问题是:“为什么不直接放 GitHub?是不是准备闭源?”

现在谁都不该替 DeepSeek 把这句话答完。

截至本文写作时,能确认的是 Harness 相关开发者的定向内测招募。没有看到 DeepSeek 发布公开仓库、许可证、部署方式或开放范围的正式说明。没有公开仓库,不等于产品一定会封闭;没有宣布开源,也不能反过来写成“已经全面开源”。 内测招募帖

这里最容易被带偏的是,把“开不开源”当成唯一问题。

一个项目就算开了代码,如果任务状态锁在平台、工具接口不稳定、权限和日志不能接到自己的系统里,用户仍然很难真正掌握它。反过来,一个暂时没开源的产品也可能提供清晰的接口、可迁移的数据和足够的部署选择。

真正要看的,是控制权开放到哪一层。

等产品出来,先查这三件事

到正式产品出现时,别急着盯演示视频,也别先问它是不是“中国版 Claude Code”。先查三件更硬的事。

1. 仓库和许可证

代码在哪?许可证允许你看、改、分发到什么程度?有没有清楚的版本和贡献规则?

这决定它是不是一个能被外部开发者长期接住的项目,而不只是一个把代码放出来的展示页。

2. 部署和模型控制权

能不能自己部署?能不能换模型?数据、任务状态和配置能不能带走?

DeepSeek 当前的定价页显示,V4-Flash 的缓存命中输入、缓存未命中输入和输出按不同档位计费,且未来还会引入高峰时段政策。价格当然重要,但更重要的是:当价格、能力或服务条款变化时,你有没有换路的权利。 DeepSeek Models & Pricing

3. 工具、记忆和权限接口

Agent 一旦开始读文件、改代码、发消息、调用外部服务,真正危险的地方就不再只是“答错一句话”。工具怎么授权?发布前有没有人工确认?失败以后能不能回滚?日志能不能查?长期记忆能不能清掉或迁走?

这些接口如果不清楚,Demo 做得再顺,也只能算一次演示。真正进生产,靠的是你能不能管得住它。

DeepSeek 这张新牌,值得看,但还不能替它下结论

从 V4-Flash 的 Codex 适配,到 Harness 内测开发者招募,DeepSeek 正在把触角伸到模型外面的执行层。

这不是它已经做成了一个新平台,更不是开源路线已经确定。它只是一个足够清楚的动作:模型公司开始意识到,未来的竞争不只在模型榜单,还在谁能把模型接进用户每天真正工作的那套工具、状态和规则里。

普通人不需要为了这个去背 Harness 的定义。

你只需要记住:当 AI 开始替你操作文件、查询资料、发送消息,别只看它聪不聪明。看它有没有刹车,东西能不能带走,出了问题谁能把车开回来。