一条两分半钟的科普视频,第一次自动检查时没有报错。

分辨率、音轨、字幕、场景数量都对,程序还抽出了 47 张复核帧。按很多 AI 产品演示的写法,故事到这里就该结束了:流程跑通,效率提升,点击发布。

我把关键帧一张张看完,却在 18 秒和 124 秒附近发现了两处很短的亮闪。它们只占一瞬,脚本不知道这叫“难看”,常规文件检查也不会把它判成损坏。最后只能退回组装环节,重新渲染、重新抽帧,再做一次人工复核。

这次首跑的音频是 152.085 秒,字幕 61 条。上面的数字只是我这一个项目留下的一手记录,不代表所有人运行都会得到同样结果。它真正让我确认的是另一件事:AI 已经很会生成文件了,但“生成了什么、现在做到哪一步、凭什么算完成、出错该退回哪里”,仍然经常散落在聊天记录里。

如果那天我只看自动报告,两处亮闪就会跟着成片走到发布包。多花的不是一次点击,而是看完 47 张帧、找到问题、退回正确环节再验一次的时间。这个成本省不掉,只能提前安排,或者在发布后付出更贵的返工。

所以我把自己的视频生产流程整理成了开源项目 CreatorFlow。它不是又一个替你写脚本或剪视频的按钮,而是一套给 Agent 使用的生产规则。

表面缺的是工具,实际缺的是交接

今天做一条视频并不缺单点能力。大模型能出选题和脚本,TTS 能配音,生成模型能做画面,剪辑工具能渲染,检查脚本能看编码和字幕。

问题发生在这些工具之间。

脚本改了,旧配音还能不能用?素材换过,原来的画面复核是否有效?项目隔三天再打开,新会话拿到的是最终成片,还是一个名字里带“最终版”的旧文件?如果这些答案只存在于上一次对话里,Agent 越能干,接手时反而越容易把旧状态当新状态。

这和公司里交接一个项目很像。销售说合同谈好了,法务说条款看过了,财务说金额没问题。可如果三个人各自在微信里留了一句“OK”,没有合同版本、审批记录和当前负责人,第四个人接手时仍然不敢发。不是大家没做事,是结果没有变成可交接的证据。

CreatorFlow 把生产拆成六段:Topic、Script TTS、Material、Assembly、QA、Publish Wrap Up。选题阶段留下为什么做和哪里可能说错;脚本配音阶段留下锁定文本、实际音频和字幕;素材阶段记录来源和逐句视觉任务;组装阶段交付可检查工程与候选成片;QA 同时保留自动报告和人工关键帧复核;最后才整理封面、文案和发布包。

公开仓库目前支持 Codex、TRAE Work、Claude Code、OpenClaw 和 Hermes,V1 面向 Windows,采用 MIT License。PowerShell、Python、FFmpeg 和 ffprobe 组成 Core,其他配音、素材发现、渲染或上传工具按需要接入。这些是仓库当前能公开核对的能力,不是我对未来版本的承诺。

文件出现了,不等于这一关过了

做长链路最容易犯的错,是把“产物存在”当成“阶段完成”。

目录里有一份 script.md,只能证明有人写过脚本;文本锁定、音频生成、字幕对齐并完成试听以后,脚本配音阶段才算结束。同样,渲染器吐出 MP4,只能说明机器完成了一次导出,不能证明画面承接了内容,也不能证明这就是刚才被检查的那一版。

CreatorFlow 为此把状态写回项目。Agent 先读当前阶段、阶段状态、下一步动作和阻塞项,再决定要做什么。换会话、换执行者,不必靠人重新复述整个历史。

更重要的是,验收要绑定对象。我的首跑视频修掉亮闪后重新渲染,旧的人工 PASS 立即失效;新复核记录只对当前成片的 SHA256 负责。这个规则看起来较真,却挡住了内容生产里很常见的一类事故:检查的是 A,最后交出去的是 B。

这也解释了为什么工作流需要返工路线。素材授权有问题,就退回 Material;字幕或声音出问题,就退回 Script TTS;画面组装有问题,就回到 Assembly。谁拥有问题,谁承担返工。否则所有错误都堆到发布前,团队会一遍遍重跑整条链,自动化省下的时间又被返工吃掉。

六个阶段,其实在管四笔成本

第一笔是记忆成本。状态落在文件里,下一次不必从聊天记录考古。

第二笔是判断成本。机器先检查尺寸、时长、编码、字幕和必需产物,人只看审美、语境、隐私和发布后果这些机器暂时承担不了的部分。

第三笔是返工成本。问题回到对应阶段,不牵连已经锁定的工作。

第四笔是权限成本。缺少依赖时,流程先说明用途、来源、拟执行命令、风险和替代路线;下载、安装、登录、写入凭据都需要单独授权。默认只生成发布包,不自动上传平台。

这最后一点和我之前写过的“为什么不让 AI 顺手发布”有关,但不是本文的主线。发布门只负责最后一次外部动作;CreatorFlow 更想解决的是,在走到那扇门以前,前面几十步有没有留下能被下一位执行者信任的状态和证据。

第一次别跑满整条链

如果你也想把零散 AI 工具接成生产线,先别急着把所有模型、插件和账号一次装齐。拿一个真实但影响不大的选题,只跑到 Topic,检查四件事:为什么入选、哪些候选被淘汰、事实从哪里来、下一阶段要遵守什么边界。

这一关能留下清楚记录,再进入脚本配音。每推进一段,都问五个问题:完成条件是什么;证据在哪里;换会话后能否接着做;产物改变会不会让旧验收失效;失败时应该退回哪一段。

跑完一个小项目,再决定哪里值得加自动化。总在素材搜集上卡住,就补素材发现能力;每次人工复核都在同一类画面出错,就把失败样本写进 QA;发布时仍要判断当天语境,就保留人工确认。你的手牌不是工具装得多,而是哪些环节已经用真实交付证明能稳定接住。

CreatorFlow 目前只是 V1,也不承诺流量。它做的事情很朴素:让 Agent 做完一段以后,把现场收拾清楚,让下一段知道自己接到了什么。

一条生产线真正跑起来,不是因为所有按钮都会自动按下,而是中途停下来以后,仍然有人知道该从哪里继续。