面向 5–10 分钟写实真人短片的完整工作流 · 2026 年 8 月版

一个人如何兼任导演、编剧与摄像 —— 国内工具为主,文生视频 / 图生视频

核心理念

2025–2026 年,AI 剧情片的制作方式已经从"抽卡式单镜头碰运气"进化为结构化电影管线:模型负责生成,但一致性、连贯性和可看性全部来自前期设计与后期剪辑。你一个人身兼导演、编剧、摄像,本质上是在管理一条小型制片管线。行业里流传的一句话值得贴在桌面上:

"前期定天花板,生成定地板,剪辑救命。"—— 对 2025–2026 年数十部 AI 短片幕后复盘的共识总结

阅读须知 本指南基于 2026 年 8 月的公开资料调研整理。AI 视频工具迭代极快(本文提到的 Seedance 2.5、可灵 3.0、海螺 H3 均为 2026 年上半年发布),开工前请先用 1 分钟样片验证你选择的工具的当前版本表现,并到官网核对最新价格与功能。

全景工作流

全景工作流.png

时间分配参考

一部 5–10 分钟的写实 AI 剧情短片,规范流程分为八个阶段。注意它不是一条直线:任何一环失败都要回退重做,迭代贯穿全程。

综合《归墟》访谈、百花奖 AIGC 推优短片、Runway AI 电影节获奖作品等多份公开复盘整理(为多案例综合推断,供排期参考):

排期.png

最反直觉的结论 生成环节花的时间其实不是最多的,"筛选 + 重试 + 改指令"才是。多位创作者强调:AI 并没有让工期除以十,合理预期是"传统工期 × 0.7"。把时间主要预算给筛选和后期,而不是指望一键出片。

八阶段详解

阶段一:故事与剧本 —— 编剧的你

目标:写一个"AI 拍得出来"且好看的故事

产出:一页梗概(logline + 三幕结构)→ 含场景、对白、情绪标注的完整对白剧本

  • 为 AI 选题材:主角 1–2 人(角色越多一致性越难)、场景集中(3–5 个主场景)、冲突明确。写实片尤其要避开人群戏、复杂打斗、大幅肢体交互——这些是当前模型的集体短板。

  • 写完整对白剧本,不要只写意象大纲。《归墟》创作者的教训:剧本不清导致后期成倍烧钱,"很多成本来自创作者不知道自己具体要什么"。

  • 每场戏写明时间 / 天气 / 光线(如"黄昏、雨后、侧逆光"),这是给后面场景一致性埋的锚点。

  • 可以用 LLM(Kimi / 豆包 / ChatGPT 等)辅助扩写与打磨,但核心冲突和取舍必须自己定——AI 给的是平均值,可看性来自你的判断。

复杂情绪不要指望一个镜头演出来:拆成身体反应和局部特写(攥紧的手、颤抖的指尖、躲闪的眼神),既好生成又有电影感。

—— 《归墟》创作者泫九的处理方式

阶段二:分镜脚本与镜头表 —— 导演 + 摄像的你

目标:把剧本翻译成一条条可以直接投喂模型的镜头单元

产出:镜头表(Shot List):镜号 / 场景 / 景别 / 运镜 / 画面内容 / 角色动作 / 对白音效 / 时长 / 参考资产 / 转场备注

  • 按约 15 秒为一个镜头单元拆剧本(百花奖最佳短片《断鞘》的实战粒度),再按需切成 5–10 秒的生成段。

  • 景别要有节奏:远 / 全 / 中 / 近 / 特交替使用,避免同景别同角度镜头堆叠(看起来像跳帧),也避免跨度太大的跳切。

  • 模型不懂 180 度轴线规则——这是写实对话戏最容易翻车的地方。必须由你(导演)在分镜里保证:提示词中明确写出人物相对位置("A 在画面左侧,B 在画面右侧")和视线方向;反打镜头时手动交换方位描述。

  • 复杂调度可以写"分镜式提示词":可灵 3.0 的智能分镜支持一次生成最多 6 个镜头切换,即梦 Seedance 2.5 支持时间戳指令(精度 1 秒内)控制段落节奏。

img_02.jpeg

分镜脚本示例:手绘风格六格分镜,标注景别递进(全景 → 中景 → 特写)与运镜箭头。实际项目中可以用 AI 绘图生成九宫格分镜图,编号管理场景与关键时刻。

阶段三:角色资产:定妆照 —— 全片一致性的根基

目标:为每个主角建立"角色锚点":一组全片通用的基准形象图

产出:定妆照(正脸特写)+ 三视图(正 / 侧 / 背)+ 服装道具参考图 + 角色提示词词库

img_03.jpeg

角色定妆三视图示例:同一角色的正面 / 侧面 / 背面全身参考图,服装与面部特征保持一致。全片所有镜头都以这组图作为参考输入。

  • 这一步不能省、不能急。《归墟》一个主要角色生成了上百张图才定稿 1 张基准形象;国内首部 AI 长片《奇谭》完成了 200 余个角色与视觉资产、十余轮形象探索。

  • 定妆照要求:正脸清晰、光线均匀、五官无遮挡、服装完整。侧脸、遮挡、强风格滤镜都会污染后续参考。

  • 同时建立角色提示词词库:性别年龄 + 五官 + 发型发色 + 体型 + 服装 + 随身物品,写成固定模板,全片逐镜头复用,只改动作与情绪。

  • 工具选择:即梦 AI 绘图(与即梦视频同平台,参考链路最短)、Nano Banana 2(多图一致性编辑业界顶级,需代理)、Midjourney(电影质感强)、SD/ComfyUI + LoRA(免费、可控性最高、门槛也最高)。详见「工具选型」。

阶段四:场景资产:环境基准图

目标:让同一个场景在不同镜头里"长得一样"

产出:每个场景 1–2 张环境基准图 + 场景描述模板 + 光线/时间/天气设定表

img_04.jpeg

场景概念图示例:黄昏雨巷的面馆街景。这类"定场镜头"基准图锁定空间布局、主色调与光线基调,该场景的所有镜头都以其为参考或首帧。

  • 每个场景先生成一张环境基准图(无人或人物很小),该场景所有镜头以它为参考/首帧,避免背景漂移。

  • 锁光线:场景描述模板中固定时间段、光源方向、色温、天气("黄昏、侧逆光、暖色温、雨后湿地反光"),只改人物动作部分。光影跳变时,优先检查场景描述是否被改动。

  • 列一张场景变化清单:同一场景若有时间推移(白天 → 黄昏),明确标注哪几个镜头开始切换,避免无意间混用。

阶段五:关键帧图生成 —— "首帧即王"

目标:每个重要镜头先出静态图,确认无误再转视频

产出:按镜头表编号的关键帧图(可含首帧 + 尾帧双图)

  • 图生视频的质量上限由首帧决定。业内经验:"人物变脸,先回去提升首帧参考图的质量",而不是反复重抽视频。

  • 关键帧要确认四件事:构图、光线、人物形象、情绪状态。静态图都不对,动起来只会更不对。

  • 需要镜头内大幅变化(如人物从坐着到站起)时,直接生成首帧 + 尾帧两张图,交给模型推理中间过程(可灵 2.1 起的首尾帧功能、即梦"使用尾帧"、Vidu Keyframe-to-Video)。

  • 关键帧命名按镜头表编号管理:S01_镜03_首帧_v2.png,资产多了以后你会感谢这个习惯。

阶段六:视频生成 —— 图生视频为主,文生视频为辅

目标:把关键帧批量变成合格的动态镜头

产出:按镜头编号归档的视频素材(含废片,留作备份)

  • 为什么图生视频优先:文生视频随机性大、角色无法锚定;图生视频有首帧图像做参照,构图与人物都被锁住。文生视频更适合空镜、氛围镜头和灵感探索。

  • 提示词公式:主体(@参考图)+ 具体动作与表情 + 场景与光线 + 运镜 + 风格画质。写"她攥紧伞柄,指节发白,回头瞥了一眼",不要写"她很紧张"——具体动作有效,抽象情绪无效(《纸手机》团队经验)。

  • 一个镜头只给一种运镜(推 / 拉 / 摇 / 移 / 环绕选一),运动强度不宜过高;短镜头控制在 5–10 秒,新模型虽支持 15–30 秒原生直出,但越长越容易变形漂移。

  • 抽卡心态:单镜头重生成 3–5 次是正常水平,头部团队废片率高达 300:1。生成前先明确"这条镜头的通过标准是什么",避免无目的反复抽卡烧钱。

  • 需要长镜头时用视频延长:即梦可续写最多 2 次至约 36 秒,可灵可把 10 秒延到约 20 秒,延长时用时间戳锚点稳住关键动作。时长不够优先拆分镜,而不是硬拉。

  • 镜头衔接用首尾帧:导出上一段最后一帧 →(需换机位时先用图生图出变体)→ 作为下一段首帧。详见「镜头连贯性」一节。

多模型混用是行业共识

"让每个 AI 只干它最擅长的事":写实特写给可灵、多角色叙事长镜头给即梦 Seedance、快速量产给 Vidu、便宜空镜给通义万相。没有一个模型能包打天下。

阶段七:对白、口型与声音设计

目标:让角色开口说话,让世界有声音

产出:配音音轨、对口型后的对白镜头、配乐与环境音效

  • 当前有两条技术路线并存:

    • ① 先 TTS 后对口型(2025 年主流,现在仍是精修首选):先用 TTS/声音克隆生成干净人声(单段 ≤15 秒、背景干净),再用即梦/可灵的对口型功能匹配画面;

    • ② 音画原生共生成(2026 年新趋势):Seedance 2.5、海螺 H3(原生立体声)、可灵 3.0 支持口型、声线、环境声与画面一次生成。粗剪省事,精修仍常回路线①。

  • 即梦对口型实操要点:适合单人清晰正脸(多人需分段再做画中画合成);"生动模式"运动幅度设 2–3;工序必须是先对口型 → 再补帧 → 再 HD 增强,顺序颠倒会出问题;侧脸和遮挡镜头容易口型错位。

  • 角色声线要锁:豆包 TTS 支持声音复刻(约 150 元/音色/年),为每个主角建一个固定音色;ElevenLabs 情感表现力最强($5/月起)。

  • 音效是遮丑神器:脚步声、雨声、环境底噪能极大转移观众对画面瑕疵的注意力。配乐可用 Suno($10/月可商用)、海绵音乐(免费、中文强)、ElevenLabs SFX。

阶段八:剪辑、调色与成片 —— 救命环节

目标:把一堆不完全一致的镜头,剪成一部看起来连贯的片子

产出:成片(16:9,1080p/4K)+ 字幕 + AI 标识

  • 剪辑是第二次导演。Runway AI 电影节获奖作品《River of Inheritance》从 217 段素材删到 28 段——宁删勿留,采用率从严。

  • 动作镜头在动作中间剪,前后速度一致,观众的眼睛会被动作带走,注意不到细节差异;相似构图不要相接。

  • 转场从简:优先硬切或闪白;接不上的地方用反打镜头、台词或音效垫过去。不要用花哨转场欲盖弥彰。

  • 统一调色是掩盖镜头差异的最后一道保险:对齐色相 / 对比 / 饱和度,加一层胶片颗粒,既统一质感又去"塑料感"。达芬奇免费版即可胜任,是调色天花板。

  • 分辨率不足时后期超分:Topaz Video AI(约 $299,行业标准)或剪映内置超分/补帧,把 720p 素材升到 4K 交付。

  • 导出前过一遍合规清单:AI 声明、角标、元数据标识。

三大一致性难题

3.1 角色一致性:五种方案对比

方案

原理

优点

局限

适用场景

代表工具

参考图 / 多图参考(当前主流·首选

上传定妆照等参考图,生成时按 @调用 并绑定权重

上手快、无需训练、效果好

多人同框易互相干扰;大幅动作/换装仍可能漂移

绝大多数剧情镜头

可灵多图参考/局部参考、即梦全能参考(最多 50 路素材)、Vidu 主体参考、海螺 Omni-Reference

LoRA 训练

用 15–30 张多角度人像训练专属小模型,相似度约 90–95%

一致性最高、长期零边际成本

需 12GB+ 显存与训练门槛;云端商用平台(可灵/即梦)不支持用户上传

长期复用的主角 IP、系列剧

SD / ComfyUI / Wan 开源系

换脸后处理

先自由生成画面,后期统一换成同一张脸

前期限制少,面部统一度高,可兜底

逐帧处理成本高;侧脸/遮挡易露馅;注意肖像权合规

台词多、必须统一面孔又抽不出一致画面时的兜底

FaceFusion 等开源工具

提示词锁特征

全片复用同一套人物特征 + 服装文本模板

灵活、零成本

细节不稳定,单独使用效果弱

与参考图联用,作为双保险

所有文生/图生工具

首帧锁定 + 固定种子

同角色镜头都用同一张定妆照做首帧;API 固定 seed

简单直接

动作/角度变化大时仍不稳,只适合温和变化

同机位小幅变化的镜头组

可灵 API(seed 参数)等

业界通行的组合拳

新手 = 定妆照 + 参考图;多机位复杂镜头 = 参考图 + 提示词模板 + 换脸兜底;长期系列 IP = LoRA。写实真人剧情片的标准打法是:定妆照 → 图生视频 → 个别镜头局部重抽 / 换脸补救。

3.2 场景一致性:四件套

  • 环境基准图复用:每个场景一张基准图,所有该场景镜头以它为参考/首帧。

  • 锁光线三要素:时间、光源方向、色温写进固定模板,逐镜头复用。

  • 场景描述模板化:空间布局、主色调、陈设做成模板只改动作;背景变了先查模板是否被改。

  • 后期统一调色:LUT + 色彩校正对齐全片,掩盖残余差异。

3.3 镜头连贯性:接戏的艺术

接戏流程图.png
  • 可灵 2.1 首尾帧:同时给首帧 + 尾帧 + 提示词,模型推理中间过渡并动态校正人物/色彩/节奏(官方称转场效果较 1.6 版提升 235%);即梦开"使用尾帧",首尾差异大时选较长时长、适中速度并写明过渡方式。

  • 剪辑点规则:动作中间剪、前后速度一致;远/全/中/近/特切换,避免相似构图相接。

  • 轴线自己保:模型不理解 180 度规则。对话戏在提示词里写死左右方位与视线方向,反打镜头手动交换。这是写实对话戏不"跳轴"的唯一办法。

  • 两条路线按叙事选:追求无缝用首尾帧接力;追求节奏用硬切 + 统一调色遮盖。硬切并不丢人,观众脑补能力很强。

工具选型指南

4.1 国内视频生成主工具对比

工具 / 模型

发布

单次时长

分辨率

角色一致性能力

音频 / 口型

参考价格

写实评级

最适合

可灵 3.0

快手

2026-02

15 秒

原生 4K/60fps

元素参考、3–8 秒参考视频锁角色、局部参考、智能分镜(一次 6 镜)

音画同出,中英日韩西语口型

会员 66/266/666 元/月;折合约 0.43 元/秒,4K 约 3 元/秒

★★★★★

写实主力、4K 特写、运镜控制

即梦 Seedance 2.5

字节

2026-08

30 秒

1080p

最多 50 路多模态参考(30 图+10 视频+10 音频)、时间戳指令、局部编辑

声画同出 + 二次对口型编辑

年费 659/1899/5199 元;2.5 一条 30 秒理想约 63 元,含重试更高

★★★★★

多角色长镜头叙事、精确时间轴控制

Vidu Q2

生数科技

2025 下半年

15 秒档

1080p

多图 @参考(人物/物品/场景),一次最多 3 主体,首尾帧

支持口型

折算约 0.42 元/秒,低档月费数十元起

★★★★

角色 @一致性快速量产、抢工期

海螺 H3

MiniMax

2026-07

15 秒(延展约 30 秒)

原生 2K/24fps

Omni-Reference:9 图 + 3 视频 + 3 音频参考

原生立体声(对白/音效/环境同步)

约 139 元/月;API 约 $0.13/秒

★★★★☆

写实表演镜头、需要原生声场

通义万相 2.6

阿里

2025-12

15 秒

1080p

国内首个"角色扮演"(参考视频形象+音色出演)、多图融合、智能分镜

音画同步、音色参考

1080p 1 元/秒、720p 0.6 元/秒;App 会员 47–72 元/月;新用户送 50 秒

★★★☆

低成本批量、空镜过场、动态分镜预演

混元 HunyuanVideo 1.5

腾讯

2025-11

5–10 秒

高清

基础;开源可自训

I2V 版支持对口型/动作驱动

元宝免费体验 + 开源本地部署

★★★

免费尝鲜、本地部署研究

4.2 海外标杆(简要对比)

工具

亮点

时长 / 分辨率

参考价格

对国内创作者

OpenAI Sora 2

物理真实感与写实的公认标杆,原生同步音频

最长 20 秒(Pro)/ 1080p

Plus $20/月,Pro $200/月;API $0.10–0.50/秒

需解决网络与账号;适合月抛拍最难镜头

Google Veo 3.1

4K + 全档原生音频,Scene Extension 可连续延长

4–8 秒 / 至 4K

订阅含额度;API 约 $0.05–0.40/秒

需代理;hero 镜头点睛可选

Runway Gen-4.5

影视感镜头与运动细控强,References 多图参考

5–10 秒 / 1080p 级

$15–95/月;无原生音频

贵且无声,优先级低于国产第一梯队

Luma Ray2

便宜、快

最长 10 秒

约 $10/月起

适合做便宜草稿与动态分镜预演

Pika 2.2

创意特效向

最长 10 秒

$8–76/月

写实能力弱,不适合真人剧情

4.3 配套工具链

环节

工具

要点与价格(2026-08)

图像生成(关键帧/定妆照)

即梦 AI 绘图 / Nano Banana 2 / Midjourney / Flux / SD+ComfyUI / 通义万相 t2i

即梦与视频同平台链路最短;Nano Banana 2 多图一致性顶级(约 0.5 元/张,需代理);MJ 电影感强($10 起);SD 可 LoRA 锁脸且免费;万相 0.2 元/张最便宜

对口型

各视频模型原生口型(优先)/ Sync Labs / Hedra

剧情对白优先用可灵/即梦/Vidu/海螺的原生口型;批量补救用 Sync Labs(约 $0.18/分钟)

TTS 配音

豆包 TTS / MiniMax 语音 / ElevenLabs / 剪映内置

豆包超自然音色约 4.9–6.5 元/万字符,声音复刻约 150 元/音色/年(锁角色声线首选);ElevenLabs 情感最强($5/月起)

音乐音效

Suno / 海绵音乐 / 天工音乐 / ElevenLabs SFX

Suno Pro $10/月可商用;海绵音乐免费且接剪映生态;音效用于掩盖画面瑕疵

剪辑 / 超分

剪映专业版 / DaVinci Resolve / Topaz Video AI

剪映内置超分补帧字幕对口型,AI 功能最全;达芬奇免费版调色天花板;Topaz 约 $299 一次性买断,720p→4K 行业标准

4.4 三套推荐组合

  • 入门低成本:通义万相(空镜/预演)+ Vidu(主力剧情)+ 剪映(剪辑/超分)——月均百元级

  • 混合推荐:可灵 3.0(写实特写)+ 即梦 Seedance 2.5(多角色长镜头)+ 剪映/达芬奇(后期)——月均数百元

  • 高质量冲奖:即梦 Seedance 2.5 + 可灵 3.0 + Sora 2(hero 镜头)+ Topaz 超分 + 达芬奇调色——单片千元以上

案例与他人经验

以下案例均来自公开报道与创作者专访,是这份指南里"别人真金白银换来的经验":

案例

体量

耗时

关键经验

海南岛电影节 72 小时 AI 黑客松一等奖

微电影

72 小时(极限赛制)

赛制逼迫下验证了"分镜先行"的可行性

《纸手机》

5 分钟

约 3 天

轻量、单人双人档;提示词写具体动作而非抽象情绪

《失控》(百花奖推优)

短片

6 天(团队冲刺)

证明了小团队集中火力出短片的可行性

《牌子》

7 分 45 秒

约 23 天

标准参赛片节奏;导演专访强调"宁删勿留"

《归墟》第一季

12 集 × 8 分钟

约 5 个月(单人)

单角色上百张定妆照才定稿;单镜头最高花费 2 万元;播放破亿仍未回本

《奇谭》

国内首部 AI 长片

200 余个角色与视觉资产、十余轮形象探索;以"网络故事片"身份取得发行许可证

常见坑与规避指南

序号

典型表现

规避办法

1

角色漂移

换个镜头就换张脸;《奇谭》需十余轮形象探索才定稿

建角色资产库:主角生成上百张图定 1 张基准;全程固定参考图/多参考绑定

2

动作复杂度超限

攀爬、翻跟头、打斗空间关系崩坏(《归墟》打斗戏没有一段能直接用)

复杂动作拆成局部特写 + 反应镜头;放弃长动作镜头,靠剪辑拼接;打斗预留 3–4 天/分钟

3

手部 / 微动作崩坏

手指失真、"手上蝴蝶起飞"这类微动作生成失败

不让手部动作成为叙事焦点;用手势简单的构图或道具遮挡

4

光线 / 透视不连贯

前后光影跳变、空间透视出错

分镜阶段锁光源方向与机位;同场景同一参考图约束;提示词固定光线模板

5

塑料感 / 恐怖谷

仿真人长镜头不自然、皮肤质感假

加胶片颗粒 + 统一调色;控制单镜头时长、快切掩盖;必要时保留"不完美"的真实道具质感

6

提示词含糊 / 过长

只写情绪词无效;提示词越长越失控

写具体动作 + 表情 + 镜头语言;按 15 秒单元拆分;一镜一运镜

7

成本失控(无目的抽卡)

《归墟》单镜头 2 万元生成 20 次不满意;废片率最高 300:1

先写死通过标准再抽卡;先图像定关键帧再做视频;预算按名义价 ×2–3 估(失败也扣费)

8

素材过载、剪辑失焦

生成数千镜头不知取舍(《牌子》)

生成前定时间线与情绪曲线;边生成边筛、设硬性采用率;宁删勿留

9

工期幻觉

以为 AI 能让工期除以十,实际反复生成筛选改指令

按"传统工期 × 0.7"排期;把时间预算给筛选和后期

10

AI 标识缺失

未声明 AI 被识别 → 限流甚至下架

发布勾选 AI 声明 + 保留画面角标 + 不清除元数据隐式标识(详见合规章节)

11

版权风险

模型会拦截版权角色 / 特定导演风格;真人肖像、配乐侵权

避免可识别 IP 与名人形象;商用前核查配乐与参考图版权

12

变现预期过高

《归墟》播放破亿仍未回本

立项即想好变现路径(平台分成/广告/IP 运营),别以播放量为唯一目标

成本与工期估算

7.1 单条镜头参考价(5 秒 · 1080p · 2026 年中)

测算前提:成片 60–80 个镜头 × 每镜头重生成 3–5 次 ≈ 总生成量 180–400 条。以下仅视频生成费,另有会员/软件固定开销。

模型

单条约

口径说明

Vidu Q2 / 可灵 3.0(会员折算)

2.1–2.2 元

约 0.42–0.43 元/秒

通义万相 2.6

5 元

官方 1 元/秒,明码标价

海螺 H3

约 4.7 元

$0.13/秒

即梦 Seedance 2.0

约 6.9 元

实测 1.38 元/秒

即梦 Seedance 2.5

30 秒一条理想约 63 元

含重试实际 200–300 元/条长镜头

Sora 2 API(720p)

约 3.6 元

$0.10/秒起

7.2 一部 8 分钟短片的总预算

方案

乐观(180 条)

保守(400 条)

含固定开销总预算

低成本组合

约 400–600 元

约 800–1400 元

约 600–1700 元

混合组合(推荐)

约 900–2000 元

约 2500–5000 元

约 1500–6000 元

高质量组合

约 900–1400 元起

约 2000–3200 元(重度重试可到 5000–8000)

约 3500–10000 元

7.3 工期锚点

案例

体量

耗时

海南岛电影节 72 小时 AI 黑客松一等奖

微电影

72 小时(极限赛制)

《纸手机》

5 分钟

约 3 天(轻量、单人双人档)

《失控》(百花奖推优)

短片

6 天(团队冲刺)

《牌子》

7 分 45 秒

约 23 天(标准参赛片)

《归墟》第一季

12 集 × 8 分钟

约 5 个月(单人)

单人 · 写实真人感 · 5–10 分钟(对你的推断)

3–6 周,取决于废片率控制水平

三条省钱铁律 ① 先用便宜模型(万相 720p / Luma)跑完整动态分镜,定稿镜头才上高质量模型,能省一半以上;② 所有模型失败重试都扣费,真实成本按名义价 ×2–3 估,预算留 30% 余量(即梦 2026 年已三次涨价,行业算力紧张期还可能调);③ 把需求写死再抽卡——最贵的镜头永远是"不知道自己要什么"的镜头。

合规与发布

8.1 《人工智能生成合成内容标识办法》(2025 年 9 月 1 日施行)

  • 两类标识:显式标识(观众可见的文字、角标、语音提示)+ 隐式标识(写入文件元数据的服务提供者编码、内容编号)。

  • 对创作者最关键的一条:拿到无显式标识的 AI 内容后公开传播,必须主动声明并添加显式标识;不得恶意删除、篡改、伪造、隐匿标识,也不得提供工具帮别人删标。

  • 平台会通过元数据识别 AI 内容并向公众提示。即使你不说,平台也可能帮你标——但主动声明更安全。

8.2 主要平台落地规则

平台

规则要点

抖音

投稿时标注 + 元数据读写;未标注时平台辅助补标;疑似 AI 内容显示"疑似使用了 AI 生成技术"提示。实操层面有报道称未标识内容会被限流

B 站

投稿页"创作声明"勾选"该视频使用人工智能合成技术";未声明者平台依规补加标识

快手

AI 内容展示"AI 生成"并嵌入元数据;恶意改动或隐藏标识会按规则处置

视频号等腾讯系

加显式 + 隐式标识;用户不得删除/篡改/伪造/隐匿,违规处罚

长片 / 剧集额外注意 《奇谭》以"网络故事片"身份取得《网络剧片发行许可证》——AI 长片、剧集在国内发行同样需要走网络剧片许可与备案流程。如果你的目标是 20 分钟以上或系列化,立项时就要把审查规划进去。另外,避免生成可识别的名人肖像与 IP 形象,商用前核查配乐与参考图版权。


附录:模板与清单

9.1 视频生成提示词通用模板

  • 角色描述模板(全片固定复用):性别年龄 + 五官特征 + 发型发色 + 体型 + 服装 + 随身物品。只改动作与情绪,其余一字不动。

  • 场景描述模板(全场景固定复用):空间布局 + 主色调 + 陈设 + 时间段 + 光源方向 + 天气。

9.2 运镜提示词速查

中文

英文(部分模型英文提示更稳)

效果

推镜头

push in / dolly in / zoom in

聚焦主体、制造压迫感

拉镜头

pull out / dolly out / zoom out

揭示环境、释放情绪

摇镜头

pan left/right(水平)、tilt up/down(俯仰)

扫视空间、跟随视线

移镜头 / 跟拍

tracking shot / follow shot

伴随运动、代入感

环绕

orbit / arc shot

仪式感、强调时刻

升降

crane up / crane down

开场定场、情绪升华

手持晃动

handheld camera

纪实感、紧张感

慢动作

slow motion

放大情绪瞬间(还能掩盖瑕疵)

过肩 / 反打

over-the-shoulder / reverse shot

对话戏标配(注意手动交换左右方位)

9.3 镜头表模板

镜号

场景

景别

运镜

画面内容

角色动作

对白 / 音效

时长

参考资产

转场备注

S01-03

雨巷

中景

缓推

巷口霓虹下

回头张望、攥伞

雨声 / 无对白

5s

角色A定妆照 + 雨巷基准图

硬切至 S01-04

建议用表格软件管理,一行一镜;"参考资产"列直接写文件名,生成时按图索骥。

9.4 生成前检查清单

  • 角色定妆照已确认并加入参考图

  • 场景基准图已生成并锁定光线参数

  • 提示词使用具体动作描述而非抽象情绪

  • 景别与运镜在相邻镜头间有变化

  • 轴线方位已在提示词中写死(对话戏)

  • 该镜头的通过标准已明确(避免无目的抽卡)

9.5 发布前检查清单

  • 已勾选平台 AI 生成声明

  • 画面中已添加 AI 生成角标

  • 文件元数据中的 AI 标识未被清除

  • 配乐与参考图版权已核查

  • 无可识别的名人肖像或 IP 形象

9.6 主要调研来源

本指南信息来自 2025–2026 年公开报道、官方发布与创作者专访,主要包括:人民网(可灵 2.1 首尾帧发布)、新华网(《奇谭》持证首播 / 《千秋诗颂》)、腾讯新闻(《归墟》创作者泫九专访)、光明网与 36 氪(可灵 AI 导演共创计划)、新浪财经(百花奖 AIGC 推优六部短片)、凤凰网(《纸手机》)、豆瓣(《牌子》导演专访)、Adobe 官方博客(MAX 2025 生成式 AI 电影节幕后)、网信办系统(《人工智能生成合成内容标识办法》答记者问)、阿里云开发者社区(万相 2.6 发布)、少数派(MiniMax H3 解读)及各工具官网与第三方横评(价格信息)。工具价格与功能随版本变动,开工前请以官网为准。


工具迭代飞快:本文所有模型版本、功能与价格信息截至 2026 年 8 月,仅供决策参考。祝开机顺利,一次过稿。