No. 32: AI 视频不是一句 Prompt,我把它做成了一条有审批门的生产线

从脚本、角色、场景到镜头、音轨和最终渲染,AI 视频真正缺少的不是更多生成按钮,而是一条能锁版本、做审批并留下证据的生产流程。

2026.08.16

目录7 节

做 AI 视频最吸引人的时刻,通常是输入一段 Prompt,然后等模型吐出一个看起来不错的片段。这个过程很像魔法,也很适合演示。

但我真正想做的是一条可以反复运行的视频生产流程。到了这个目标下,一段好看的生成结果远远不够:角色换了衣服,场景空间对不上,台词和镜头错位,已经确认的脚本又被后续步骤悄悄改掉,都可能让整条片子返工。

于是我把注意力从「怎么生成」移到了「怎么生产」。我做了一套 AI Video Production Skill,用文件、状态和人工审批把每个阶段连接起来,再由确定性渲染器组装最终结果。

它现在还不是一个能替我自动完成所有创作的机器。生成供应商、真实素材质量和实际成本仍然需要逐项验证。但这套系统已经回答了另一个更基础的问题:怎样让一次充满随机性的生成过程,变成可以检查、回退和继续协作的项目。

先锁故事,再谈镜头

很多视频工作流从分镜或提示词开始,我却把故事确认放在最前面。因为脚本还在变化时,角色设定、场景概念、配音、分镜和镜头都没有稳定输入。

这套流程先经过 discovery、brief、research 和 story。世界观或视觉方向还没有定下来时,可以额外插入 creative preview,先用少量候选图确认风格。故事通过人工审批后,才进入角色与场景设计。

这里的审批不是在聊天里说一句「可以」。每个阶段都有明确产物、验证结果和批准状态。后续阶段只能读取已经批准的上游版本。脚本改动以后,依赖它的产物会失效,需要重新确认,而不是继续沿用旧版本凑出一个结果。

这一步看起来拖慢了生成,实际上是在用早期的小成本确认,替代后期的大范围返工。

候选素材和正式素材必须分开

角色和场景设计默认各生成三张候选卡。候选只用于比较,选中的一张经过确认后才进入 approved 区域。没有获批的素材不能进入后续时间线和最终渲染。

我给角色、场景、镜头和素材分配稳定 ID,例如 CHAR_001SCENE_001SHOT_001ASSET_001。文件名可以调整,显示名称可以变化,但引用关系不应该跟着漂移。

这解决了生成式生产里一个常见问题:聊天里出现过很多相似图片,过几轮以后,没人知道现在讨论的是哪一张,渲染脚本又用了哪一张。把候选与正式素材分开,再用稳定 ID 连接,选择才会变成可追踪的项目状态。

浏览器里的审阅页面也只负责做决定。选择、批注和批准先保存为草稿,导出并由工作流处理后,才成为新的事实。界面不能绕过验证器直接改写项目状态。

连续性需要显式记录,不能交给模型记忆

同一个角色跨镜头保持一致,是 AI 视频里最容易低估的难题。仅仅保存一张角色参考图,并不能保证服装、道具、动作、视线和出入画关系连续。

因此每个镜头都要记录角色、场景、说话人、服装与道具、动作状态、入画与出画,以及与前后镜头的状态交接。多场景、多角色项目还要先建立 Entity Registry,再检查每个 Shot 引用了哪些实体。

这些约束不是为了让表格更完整,而是为了把「看起来不对」拆成可验证的问题。角色身份错了,属于实体绑定问题;动作接不上,属于状态交接问题;两个人视线相反,属于 eyeline 问题。只有问题被命名并落到字段里,后续生成和人工审阅才有共同语言。

模型仍然可以提出镜头方案,但它不能凭上下文印象替代连续性记录。每一次通过审批的状态,才是下一阶段可以依赖的输入。

音频时间线应该成为镜头节奏的事实源

如果先生成画面,再把配音硬塞进去,镜头长度和台词节奏很容易互相冲突。我把顺序反了过来:故事通过后先完成配音与音频 cue,最终音频时间线确定后,再由它驱动分镜和镜头时长。

每段台词都有说话人、开始时间和结束时间。分镜需要覆盖音频区间,字幕从同一份台词数据生成,渲染器也使用同一条时间线。这样可以避免配音、字幕和画面分别维护一套时间,最后再靠人工猜测对齐。

时间线一旦变化,受影响的镜头与字幕必须重新验证。系统不应该偷偷拉伸素材,掩盖上游节奏已经变化的事实。

随机生成和确定性渲染要分成两层

生成模型适合创造角色图、场景图和视频片段,但最终组装需要另一套逻辑。我的渲染流水线只读取已批准素材,按照确定的时间线拼接画面、音频与字幕,并记录渲染输入和结果摘要。

流程支持 preview、standard 和 final 三种层级。预览可以更快地暴露节奏与连续性问题,最终渲染则需要完整验证。只有 final 产物生成、检查全部通过,系统才会把 releaseReady 设为 true

即使如此,releaseReady 也只代表机器能够验证的条件已经满足。故事、角色身份、对白语义、字幕观感、混音质量和素材权利仍然要由人做最终审阅。机器状态不能冒充创作判断。

渲染器还会拒绝越界路径、符号链接逃逸、缺少权利信息、重复正式素材、输入输出指向同一文件以及未经允许的覆盖。它们都不直接提升画面质量,却能减少项目文件被误用和发布证据被污染。

人工审批不是流程里的摩擦

这套 Skill 有 14 个固定阶段,从 discovery 一直走到 retro;需要视觉方向探索时,再加入可选的 creative preview。除 post 外,每个阶段都要求明确的人工 gate。

这并不意味着人要逐项点几十次确认。真正重要的是把决定放在成本还可控的位置:故事没定,不批量生成角色;角色没定,不铺开关键帧;关键帧没通过,不生成全部片段;预览没通过,不进入最终渲染。

审批的价值,是阻止未经确认的内容继续放大成本。自动化则负责准备候选、检查格式、传递已批准状态和生成审阅页面。两者不是互相替代,而是在不同位置承担责任。

同样,这套流程不会自动发布,也不会在没有明确授权时触发付费生成。生产系统可以减少重复劳动,但预算和对外发布仍然属于人的决定。

我现在更关心一次失败能留下什么

一次 Prompt 生成失败,通常只会留下一个不满意的结果。生产流程失败时,应该还能知道是哪一阶段、哪份输入、哪条约束和哪次审批出了问题,并从正确位置继续。

这也是我做这套系统最大的收获。AI 视频的护城河未必是掌握一条神奇提示词,而是把创意判断、随机生成和确定性交付组织成一条可以复用的协作链。

目前这条链路已经具备文件契约、状态验证、人工审批和确定性渲染,但真实模型生成、供应商稳定性、成本与浏览器视觉验收仍需在具体项目中继续验证。我宁愿把这些边界写清楚,也不愿把一个可运行的框架描述成已经全自动交付的生产能力。

生成模型负责产出素材,生产系统负责守住版本、批准状态、连续性和发布证据。

← Writing