面向 5–10 分钟写实真人短片的完整工作流 · 2026 年 8 月版
一个人如何兼任导演、编剧与摄像 —— 国内工具为主,文生视频 / 图生视频
核心理念
2025–2026 年,AI 剧情片的制作方式已经从"抽卡式单镜头碰运气"进化为结构化电影管线:模型负责生成,但一致性、连贯性和可看性全部来自前期设计与后期剪辑。你一个人身兼导演、编剧、摄像,本质上是在管理一条小型制片管线。行业里流传的一句话值得贴在桌面上:
"前期定天花板,生成定地板,剪辑救命。"—— 对 2025–2026 年数十部 AI 短片幕后复盘的共识总结
阅读须知 本指南基于 2026 年 8 月的公开资料调研整理。AI 视频工具迭代极快(本文提到的 Seedance 2.5、可灵 3.0、海螺 H3 均为 2026 年上半年发布),开工前请先用 1 分钟样片验证你选择的工具的当前版本表现,并到官网核对最新价格与功能。
全景工作流

时间分配参考
一部 5–10 分钟的写实 AI 剧情短片,规范流程分为八个阶段。注意它不是一条直线:任何一环失败都要回退重做,迭代贯穿全程。
综合《归墟》访谈、百花奖 AIGC 推优短片、Runway AI 电影节获奖作品等多份公开复盘整理(为多案例综合推断,供排期参考):

最反直觉的结论 生成环节花的时间其实不是最多的,"筛选 + 重试 + 改指令"才是。多位创作者强调:AI 并没有让工期除以十,合理预期是"传统工期 × 0.7"。把时间主要预算给筛选和后期,而不是指望一键出片。
八阶段详解
阶段一:故事与剧本 —— 编剧的你
目标:写一个"AI 拍得出来"且好看的故事
产出:一页梗概(logline + 三幕结构)→ 含场景、对白、情绪标注的完整对白剧本
为 AI 选题材:主角 1–2 人(角色越多一致性越难)、场景集中(3–5 个主场景)、冲突明确。写实片尤其要避开人群戏、复杂打斗、大幅肢体交互——这些是当前模型的集体短板。
写完整对白剧本,不要只写意象大纲。《归墟》创作者的教训:剧本不清导致后期成倍烧钱,"很多成本来自创作者不知道自己具体要什么"。
每场戏写明时间 / 天气 / 光线(如"黄昏、雨后、侧逆光"),这是给后面场景一致性埋的锚点。
可以用 LLM(Kimi / 豆包 / ChatGPT 等)辅助扩写与打磨,但核心冲突和取舍必须自己定——AI 给的是平均值,可看性来自你的判断。
复杂情绪不要指望一个镜头演出来:拆成身体反应和局部特写(攥紧的手、颤抖的指尖、躲闪的眼神),既好生成又有电影感。
—— 《归墟》创作者泫九的处理方式
阶段二:分镜脚本与镜头表 —— 导演 + 摄像的你
目标:把剧本翻译成一条条可以直接投喂模型的镜头单元
产出:镜头表(Shot List):镜号 / 场景 / 景别 / 运镜 / 画面内容 / 角色动作 / 对白音效 / 时长 / 参考资产 / 转场备注
按约 15 秒为一个镜头单元拆剧本(百花奖最佳短片《断鞘》的实战粒度),再按需切成 5–10 秒的生成段。
景别要有节奏:远 / 全 / 中 / 近 / 特交替使用,避免同景别同角度镜头堆叠(看起来像跳帧),也避免跨度太大的跳切。
模型不懂 180 度轴线规则——这是写实对话戏最容易翻车的地方。必须由你(导演)在分镜里保证:提示词中明确写出人物相对位置("A 在画面左侧,B 在画面右侧")和视线方向;反打镜头时手动交换方位描述。
复杂调度可以写"分镜式提示词":可灵 3.0 的智能分镜支持一次生成最多 6 个镜头切换,即梦 Seedance 2.5 支持时间戳指令(精度 1 秒内)控制段落节奏。

分镜脚本示例:手绘风格六格分镜,标注景别递进(全景 → 中景 → 特写)与运镜箭头。实际项目中可以用 AI 绘图生成九宫格分镜图,编号管理场景与关键时刻。
阶段三:角色资产:定妆照 —— 全片一致性的根基
目标:为每个主角建立"角色锚点":一组全片通用的基准形象图
产出:定妆照(正脸特写)+ 三视图(正 / 侧 / 背)+ 服装道具参考图 + 角色提示词词库

角色定妆三视图示例:同一角色的正面 / 侧面 / 背面全身参考图,服装与面部特征保持一致。全片所有镜头都以这组图作为参考输入。
这一步不能省、不能急。《归墟》一个主要角色生成了上百张图才定稿 1 张基准形象;国内首部 AI 长片《奇谭》完成了 200 余个角色与视觉资产、十余轮形象探索。
定妆照要求:正脸清晰、光线均匀、五官无遮挡、服装完整。侧脸、遮挡、强风格滤镜都会污染后续参考。
同时建立角色提示词词库:性别年龄 + 五官 + 发型发色 + 体型 + 服装 + 随身物品,写成固定模板,全片逐镜头复用,只改动作与情绪。
工具选择:即梦 AI 绘图(与即梦视频同平台,参考链路最短)、Nano Banana 2(多图一致性编辑业界顶级,需代理)、Midjourney(电影质感强)、SD/ComfyUI + LoRA(免费、可控性最高、门槛也最高)。详见「工具选型」。
阶段四:场景资产:环境基准图
目标:让同一个场景在不同镜头里"长得一样"
产出:每个场景 1–2 张环境基准图 + 场景描述模板 + 光线/时间/天气设定表

场景概念图示例:黄昏雨巷的面馆街景。这类"定场镜头"基准图锁定空间布局、主色调与光线基调,该场景的所有镜头都以其为参考或首帧。
每个场景先生成一张环境基准图(无人或人物很小),该场景所有镜头以它为参考/首帧,避免背景漂移。
锁光线:场景描述模板中固定时间段、光源方向、色温、天气("黄昏、侧逆光、暖色温、雨后湿地反光"),只改人物动作部分。光影跳变时,优先检查场景描述是否被改动。
列一张场景变化清单:同一场景若有时间推移(白天 → 黄昏),明确标注哪几个镜头开始切换,避免无意间混用。
阶段五:关键帧图生成 —— "首帧即王"
目标:每个重要镜头先出静态图,确认无误再转视频
产出:按镜头表编号的关键帧图(可含首帧 + 尾帧双图)
图生视频的质量上限由首帧决定。业内经验:"人物变脸,先回去提升首帧参考图的质量",而不是反复重抽视频。
关键帧要确认四件事:构图、光线、人物形象、情绪状态。静态图都不对,动起来只会更不对。
需要镜头内大幅变化(如人物从坐着到站起)时,直接生成首帧 + 尾帧两张图,交给模型推理中间过程(可灵 2.1 起的首尾帧功能、即梦"使用尾帧"、Vidu Keyframe-to-Video)。
关键帧命名按镜头表编号管理:S01_镜03_首帧_v2.png,资产多了以后你会感谢这个习惯。
阶段六:视频生成 —— 图生视频为主,文生视频为辅
目标:把关键帧批量变成合格的动态镜头
产出:按镜头编号归档的视频素材(含废片,留作备份)
为什么图生视频优先:文生视频随机性大、角色无法锚定;图生视频有首帧图像做参照,构图与人物都被锁住。文生视频更适合空镜、氛围镜头和灵感探索。
提示词公式:主体(@参考图)+ 具体动作与表情 + 场景与光线 + 运镜 + 风格画质。写"她攥紧伞柄,指节发白,回头瞥了一眼",不要写"她很紧张"——具体动作有效,抽象情绪无效(《纸手机》团队经验)。
一个镜头只给一种运镜(推 / 拉 / 摇 / 移 / 环绕选一),运动强度不宜过高;短镜头控制在 5–10 秒,新模型虽支持 15–30 秒原生直出,但越长越容易变形漂移。
抽卡心态:单镜头重生成 3–5 次是正常水平,头部团队废片率高达 300:1。生成前先明确"这条镜头的通过标准是什么",避免无目的反复抽卡烧钱。
需要长镜头时用视频延长:即梦可续写最多 2 次至约 36 秒,可灵可把 10 秒延到约 20 秒,延长时用时间戳锚点稳住关键动作。时长不够优先拆分镜,而不是硬拉。
镜头衔接用首尾帧:导出上一段最后一帧 →(需换机位时先用图生图出变体)→ 作为下一段首帧。详见「镜头连贯性」一节。
多模型混用是行业共识
"让每个 AI 只干它最擅长的事":写实特写给可灵、多角色叙事长镜头给即梦 Seedance、快速量产给 Vidu、便宜空镜给通义万相。没有一个模型能包打天下。
阶段七:对白、口型与声音设计
目标:让角色开口说话,让世界有声音
产出:配音音轨、对口型后的对白镜头、配乐与环境音效
当前有两条技术路线并存:
① 先 TTS 后对口型(2025 年主流,现在仍是精修首选):先用 TTS/声音克隆生成干净人声(单段 ≤15 秒、背景干净),再用即梦/可灵的对口型功能匹配画面;
② 音画原生共生成(2026 年新趋势):Seedance 2.5、海螺 H3(原生立体声)、可灵 3.0 支持口型、声线、环境声与画面一次生成。粗剪省事,精修仍常回路线①。
即梦对口型实操要点:适合单人清晰正脸(多人需分段再做画中画合成);"生动模式"运动幅度设 2–3;工序必须是先对口型 → 再补帧 → 再 HD 增强,顺序颠倒会出问题;侧脸和遮挡镜头容易口型错位。
角色声线要锁:豆包 TTS 支持声音复刻(约 150 元/音色/年),为每个主角建一个固定音色;ElevenLabs 情感表现力最强($5/月起)。
音效是遮丑神器:脚步声、雨声、环境底噪能极大转移观众对画面瑕疵的注意力。配乐可用 Suno($10/月可商用)、海绵音乐(免费、中文强)、ElevenLabs SFX。
阶段八:剪辑、调色与成片 —— 救命环节
目标:把一堆不完全一致的镜头,剪成一部看起来连贯的片子
产出:成片(16:9,1080p/4K)+ 字幕 + AI 标识
剪辑是第二次导演。Runway AI 电影节获奖作品《River of Inheritance》从 217 段素材删到 28 段——宁删勿留,采用率从严。
动作镜头在动作中间剪,前后速度一致,观众的眼睛会被动作带走,注意不到细节差异;相似构图不要相接。
转场从简:优先硬切或闪白;接不上的地方用反打镜头、台词或音效垫过去。不要用花哨转场欲盖弥彰。
统一调色是掩盖镜头差异的最后一道保险:对齐色相 / 对比 / 饱和度,加一层胶片颗粒,既统一质感又去"塑料感"。达芬奇免费版即可胜任,是调色天花板。
分辨率不足时后期超分:Topaz Video AI(约 $299,行业标准)或剪映内置超分/补帧,把 720p 素材升到 4K 交付。
导出前过一遍合规清单:AI 声明、角标、元数据标识。
三大一致性难题
3.1 角色一致性:五种方案对比
业界通行的组合拳
新手 = 定妆照 + 参考图;多机位复杂镜头 = 参考图 + 提示词模板 + 换脸兜底;长期系列 IP = LoRA。写实真人剧情片的标准打法是:定妆照 → 图生视频 → 个别镜头局部重抽 / 换脸补救。
3.2 场景一致性:四件套
环境基准图复用:每个场景一张基准图,所有该场景镜头以它为参考/首帧。
锁光线三要素:时间、光源方向、色温写进固定模板,逐镜头复用。
场景描述模板化:空间布局、主色调、陈设做成模板只改动作;背景变了先查模板是否被改。
后期统一调色:LUT + 色彩校正对齐全片,掩盖残余差异。
3.3 镜头连贯性:接戏的艺术

可灵 2.1 首尾帧:同时给首帧 + 尾帧 + 提示词,模型推理中间过渡并动态校正人物/色彩/节奏(官方称转场效果较 1.6 版提升 235%);即梦开"使用尾帧",首尾差异大时选较长时长、适中速度并写明过渡方式。
剪辑点规则:动作中间剪、前后速度一致;远/全/中/近/特切换,避免相似构图相接。
轴线自己保:模型不理解 180 度规则。对话戏在提示词里写死左右方位与视线方向,反打镜头手动交换。这是写实对话戏不"跳轴"的唯一办法。
两条路线按叙事选:追求无缝用首尾帧接力;追求节奏用硬切 + 统一调色遮盖。硬切并不丢人,观众脑补能力很强。
工具选型指南
4.1 国内视频生成主工具对比
4.2 海外标杆(简要对比)
4.3 配套工具链
4.4 三套推荐组合
入门低成本:通义万相(空镜/预演)+ Vidu(主力剧情)+ 剪映(剪辑/超分)——月均百元级
混合推荐:可灵 3.0(写实特写)+ 即梦 Seedance 2.5(多角色长镜头)+ 剪映/达芬奇(后期)——月均数百元
高质量冲奖:即梦 Seedance 2.5 + 可灵 3.0 + Sora 2(hero 镜头)+ Topaz 超分 + 达芬奇调色——单片千元以上
案例与他人经验
以下案例均来自公开报道与创作者专访,是这份指南里"别人真金白银换来的经验":
常见坑与规避指南
成本与工期估算
7.1 单条镜头参考价(5 秒 · 1080p · 2026 年中)
测算前提:成片 60–80 个镜头 × 每镜头重生成 3–5 次 ≈ 总生成量 180–400 条。以下仅视频生成费,另有会员/软件固定开销。
7.2 一部 8 分钟短片的总预算
7.3 工期锚点
三条省钱铁律 ① 先用便宜模型(万相 720p / Luma)跑完整动态分镜,定稿镜头才上高质量模型,能省一半以上;② 所有模型失败重试都扣费,真实成本按名义价 ×2–3 估,预算留 30% 余量(即梦 2026 年已三次涨价,行业算力紧张期还可能调);③ 把需求写死再抽卡——最贵的镜头永远是"不知道自己要什么"的镜头。
合规与发布
8.1 《人工智能生成合成内容标识办法》(2025 年 9 月 1 日施行)
两类标识:显式标识(观众可见的文字、角标、语音提示)+ 隐式标识(写入文件元数据的服务提供者编码、内容编号)。
对创作者最关键的一条:拿到无显式标识的 AI 内容后公开传播,必须主动声明并添加显式标识;不得恶意删除、篡改、伪造、隐匿标识,也不得提供工具帮别人删标。
平台会通过元数据识别 AI 内容并向公众提示。即使你不说,平台也可能帮你标——但主动声明更安全。
8.2 主要平台落地规则
长片 / 剧集额外注意 《奇谭》以"网络故事片"身份取得《网络剧片发行许可证》——AI 长片、剧集在国内发行同样需要走网络剧片许可与备案流程。如果你的目标是 20 分钟以上或系列化,立项时就要把审查规划进去。另外,避免生成可识别的名人肖像与 IP 形象,商用前核查配乐与参考图版权。
附录:模板与清单
9.1 视频生成提示词通用模板
角色描述模板(全片固定复用):性别年龄 + 五官特征 + 发型发色 + 体型 + 服装 + 随身物品。只改动作与情绪,其余一字不动。
场景描述模板(全场景固定复用):空间布局 + 主色调 + 陈设 + 时间段 + 光源方向 + 天气。
9.2 运镜提示词速查
9.3 镜头表模板
建议用表格软件管理,一行一镜;"参考资产"列直接写文件名,生成时按图索骥。
9.4 生成前检查清单
角色定妆照已确认并加入参考图
场景基准图已生成并锁定光线参数
提示词使用具体动作描述而非抽象情绪
景别与运镜在相邻镜头间有变化
轴线方位已在提示词中写死(对话戏)
该镜头的通过标准已明确(避免无目的抽卡)
9.5 发布前检查清单
已勾选平台 AI 生成声明
画面中已添加 AI 生成角标
文件元数据中的 AI 标识未被清除
配乐与参考图版权已核查
无可识别的名人肖像或 IP 形象
9.6 主要调研来源
本指南信息来自 2025–2026 年公开报道、官方发布与创作者专访,主要包括:人民网(可灵 2.1 首尾帧发布)、新华网(《奇谭》持证首播 / 《千秋诗颂》)、腾讯新闻(《归墟》创作者泫九专访)、光明网与 36 氪(可灵 AI 导演共创计划)、新浪财经(百花奖 AIGC 推优六部短片)、凤凰网(《纸手机》)、豆瓣(《牌子》导演专访)、Adobe 官方博客(MAX 2025 生成式 AI 电影节幕后)、网信办系统(《人工智能生成合成内容标识办法》答记者问)、阿里云开发者社区(万相 2.6 发布)、少数派(MiniMax H3 解读)及各工具官网与第三方横评(价格信息)。工具价格与功能随版本变动,开工前请以官网为准。
工具迭代飞快:本文所有模型版本、功能与价格信息截至 2026 年 8 月,仅供决策参考。祝开机顺利,一次过稿。
评论