本教程基于用户@MrLarus 的实战案例整理。他用 AI 工具链完成了一个 45 秒、9 个场景的"秦统一中国"历史科普短视频,风格为 Vox 式剪贴簿拼贴加停格动画——像一本会动的历史百科页面。全流程中,只有背景音乐选择和最终时序调整是手动完成的,其余环节全部由 AI 生成。
以下是完整的四步工作流,所有提示词均可直接复制使用。
工具清单
完成这条视频需要四类工具。ChatGPT(或任何强 LLM)负责规划视频结构和场景拆分。ChatGPT 内置的 GPT-Image2 图像生成功能用于生成每个场景的拼贴关键帧。Seedance 将静态关键帧转为 5 秒停格动画。最后用视频编辑软件(CapCut、DaVinci Resolve 等)完成配音、字幕和拼接,配音可用 ElevenLabs 或 CapCut 自带的 AI 语音。
第一步:用 ChatGPT 拆分视频结构
这一步决定整条视频的信息密度和节奏。目标是把主题拆成短小精悍的"视觉节拍"(visual beats),每个节拍对应一个 5 秒场景,拥有独立的视觉主题和动画动作。
向 ChatGPT 发送以下提示词:
@MrLarus最终使用的 9 个场景是:战国七雄时期、诸侯割据各自为政、秦国开始征服六国、秦始皇统一六国、统一文字、统一货币(半两钱)、统一度量衡、统一车轨与道路(驰道网络)、中央集权帝国制度及其对后世 2000 多年的影响。每个场景 5 秒,9 个拼在一起正好 45 秒。
拆场景时最重要的原则是每个节拍必须有一个明确的视觉锚点——一枚硬币、一张地图、一组文字——而不是抽象概念。"统一货币"比"经济改革"更适合做拼贴动画,因为前者有具体的物件可以画出来、动起来。
第二步:用 GPT-Image2 生成拼贴关键帧
为每个场景生成一张 9:16 竖版关键帧。这一步的核心是让画面看起来像一页信息密集的百科拼贴画,而不是干净的海报。每个视觉元素(人物、硬币、文字标签、箭头、地图碎片)都必须有清晰的剪纸边缘,互相分离,这样下一步做动画时每个元素才能独立运动。
以下是通用提示词框架,只需替换方括号中的场景主题即可直接在 ChatGPT 中使用:
每个场景生成一张即可,但建议多生成几次,从中挑选构图最丰富、元素分离最清晰的那一张。判断标准很简单:如果你能用手指指出画面中至少 5 个可以"单独动起来"的物件,这张图就合格了。如果整张图是一个融为一体的插画,动画效果会大打折扣。
第三步:用 Seedance 把关键帧做成动画
把上一步选好的关键帧上传到 Seedance 作为参考图,用以下提示词生成 5 秒动画:
这段提示词中有几个关键控制点。"Animate the separated cutout elements, not the whole image"阻止 Seedance 对整张图做全局变形,只让独立的剪纸元素运动。"Each scene should have a small event"要求每个场景有一个微叙事——箭头飞向地图上的某个点、硬币旋转落下、文字标签弹入画面——而不是所有元素都在轻轻飘浮。"Do not make it look like PPT blocks sliding around"防止生成那种元素呆板平移的效果。
动画强度是最需要反复调试的变量。停格动画的精髓是"抖而不晃":元素有纸张的轻微抖动和弹跳感,但主体构图和重要文字保持稳定。如果生成结果太剧烈,尝试在提示词中强调"subtle""gentle jitter";如果太平淡,加入更具体的动作描述,比如"a coin drops from above and lands with a paper bounce"。
第四步:后期合成
将 9 段 5 秒动画导入视频编辑软件,按场景顺序排列。这一步需要完成三件事。
用 ElevenLabs、CapCut AI 语音或其他配音工具生成中文解说旁白。语速要适中,带讲解感,每个场景的旁白控制在对应的 5 秒以内。旁白内容可以直接让 ChatGPT 根据第一步的 9 个场景分别写出。
为每个场景添加字幕,一行一个重点。字幕风格保持简洁,与拼贴画面的视觉调性一致。
最后微调每个片段的入出点,添加轻度转场(纸张翻页效果或淡入淡出),选择一段适合历史题材的背景音乐。@MrLarus 在原帖中提到,只有背景音乐的选择和最终时序微调是手动完成的,其余环节全部由 AI 生成。
让效果更好的几个关键原则
整个工作流的核心理念是把每一帧当成"会动的百科页面"来设计,而不是普通的视频画面。这意味着画面应该信息密集、元素丰富,像一页你会在维基百科或国家地理杂志上看到的信息图。
元素分离是动画成功与否的前提。如果关键帧中的物件边缘模糊、互相粘连,Seedance 无法将它们作为独立对象来驱动。在 GPT-Image2 生成阶段就要确保每个物件有清晰的白色剪纸边缘。
风格一致性贯穿始终。9 个场景全程保持"旧纸张 + 拼贴 + 停格"的视觉语言,不要中途切换到写实渲染或 3D 风格。使用同一套提示词框架(只替换场景主题)是保持风格统一最简单的方法。
单个场景 5 秒是经验上最舒适的时长。更短会感觉信息没读完,更长会让停格动画的重复感暴露出来。9 个场景 × 5 秒 = 45 秒,正好是短视频平台上信息密度和注意力保持的平衡点。