论文标题Automated Movie Generation via Multi-Agent CoT Planning机构Show Lab, National University of Singapore发表arXiv 2503.07314, 2025年3月链接arXiv一、Motivation现有的长视频生成框架存在一个核心痛点缺乏自动化的规划能力。无论是故事线拆分、场景设计、镜头语言还是角色交互都高度依赖人工输入成本高、效率低。具体来说当前的研究现状存在以下不足短视频生成为主流Sora、HunyuanVideo 等模型虽然生成质量很高但主要聚焦在 10 秒以内的短视频缺乏结构化叙事能力。长视频生成方法不成熟DreamFactory、StoryAgent 等方法虽然引入了多智能体但仅停留在基础的视频拼接层面缺乏高层次的叙事规划无法处理多角色交互、音频同步等问题。真实电影制作是层级化协作过程导演、编剧、分镜师、摄影师各司其职这种层级化推理很难用单一模型替代。因此作者提出了一个核心问题能否模拟真实电影制作的层级化协作流程实现从剧本到成片的全自动化生成二、Related Work论文从三个方向回顾了相关工作2.1 视频生成Video Generation扩散模型路线VDM → SVD → Lavie → SORA / HunyuanVideo质量逐步提升但仍聚焦短视频。Transformer路线VideoPoetVQ-VAE 自回归、CogVideo层级注意力提升了长程依赖建模能力。共同局限依赖人工进行叙事规划和镜头设计无法实现全自动化。2.2 故事可视化Story Visualization从 StoryGANGAN时代到 StoryDiffusion、Magic-Me扩散时代时序一致性和角色一致性有所改善。Adapter 方法IP-Adapter、ROICtrl、In-context LoRA提升了角色定制化能力。核心不足缺乏自动化的高层规划场景结构化和镜头设计仍需人工干预。2.3 LLM 辅助视频生成VideoDirectorGPT、VideoStudio 探索了 LLM 驱动的场景构图。DreamFactory、StoryAgent 引入了基于 LLM 的自适应镜头规划。VideoGen-of-Thought 利用 CoT 推理改善多镜头一致性。不足仍需人工介入且缺乏角色和音频的定制化。三、Method3.1 任务定义给定剧本摘要S SS和角色库C { [ char k , I k , A k ] } k 1 L C \{[\text{char}_k, I_k, A_k]\}_{k1}^{L}C{[chark,Ik,Ak]}k1L包含角色名、肖像图、音频样本目标是生成长视频V ^ \hat{V}V^包含多场景、多镜头同时保证叙事连贯、角色一致和音画同步。形式化为映射函数F : ( S , C ) → V ^ F: (S, C) \rightarrow \hat{V}F:(S,C)→V^3.2 整体框架三个核心智能体MovieAgent 采用层级化的多智能体 CoT 推理框架模拟真实电影制作分工1Director Agent导演智能体职责高层叙事结构化。将剧本摘要S SS分解为若干子剧本S { S 1 , S 2 , . . . , S K } \mathcal{S} \{S_1, S_2, ..., S_K\}S{S1,S2,...,SK}。推理步骤识别核心叙事结构主要幕次、关键情节点、转折点定义剧本分段确保逻辑故事推进与角色一致性为每个子剧本提供分段理由2Scene Plan Agent场景规划智能体职责将子剧本细化为场景列表P { P 1 , P 2 , . . . , P N } \mathcal{P} \{P_1, P_2, ..., P_N\}P{P1,P2,...,PN}每个场景包含角色、情节、情感基调、视觉风格、摄影笔记等。推理步骤分析叙事结构识别转折和过渡提取关键场景元素角色、事件、情感意义定义场景边界位置切换、时间跳跃、情感高潮保留推理过程以确保可追溯性3Shot Plan Agent镜头规划智能体职责将每个场景进一步分解为具体镜头V i { V 1 i , V 2 i , . . . , V M i } \mathcal{V}^i \{V_1^i, V_2^i, ..., V_M^i\}Vi{V1i,V2i,...,VMi}包含角色感知情节、镜头参数和视觉动态。推理步骤确定镜头构图和取景远景/中景/特写、机位角度指定摄影技术静态/摇/倾/推拉/跟踪协调视觉连续性与场景叙事对齐3.3 内部链式思维Internal CoT所有智能体共享的结构化推理框架分五个阶段阶段内容1. 叙事结构分析主要情节点、情感节拍、关键角色交互2. 关键元素提取核心角色、关键事件、情感意义3. 边界与结构单元定义叙事分割、场景过渡、自包含单元4. 电影感与情感增强视觉风格、灯光、道具、音效5. 技术电影规划镜头运动、构图、角色位置与对白3.3.1 各环节具体模型选型MovieAgent 并不是一个单一模型而是一个多模型协作的 pipeline各环节由不同模型承担环节角色使用的模型说明剧本拆解 规划Director Agent / Scene Plan Agent / Shot Plan AgentGPT-4o默认最佳三个智能体共享同一 LLM backbone通过不同的 system prompt 扮演不同角色论文还测试了 Deepseek-R1、Deepseek-V3、Llama3.3-70b角色一致性图像生成定制化图像生成ROICtrl消融实验默认/ AutoStory / StoryDiffusion根据镜头脚本 角色库生成保持角色一致性的关键帧图像图像转视频视频生成CogVideoX消融实验默认/ SVD将关键帧图像扩展为视频片段端到端视频生成一阶段视频生成Magic-Me/ DreamVideo跳过关键帧阶段直接从脚本生成角色定制化视频字幕转语音音频生成VALL-E X根据角色音频样本 字幕文本生成角色对白音频说话人视频合成Talking Head 生成Hallo2将关键帧图像 角色音频合成为嘴型同步的说话人视频默认最佳配置根据论文实验结果GPT-4o (LLM, 三个 Agent 共用) ↓ 剧本 → 子剧本 → 场景 → 镜头脚本 ROICtrl (角色一致性图像生成) ↓ 镜头脚本 角色库 → 关键帧 CogVideoX (图像转视频) ↓ 关键帧 → 视频片段 VALL-E X (字幕 → 角色语音) Hallo2 (图像语音 → 说话人视频) ↓ 最终合成带音频的视频需要注意的是三个 Agent 本质上是同一个 LLM 的不同 prompt 实例化而非三个独立模型。论文通过精心设计的 system prompt 让 LLM 分别扮演导演、场景规划师和镜头规划师的角色每个角色内部都嵌入了 Internal CoT 的五阶段推理流程。这种设计的好处是灵活且低成本但也意味着 Agent 之间的协作其实是串行的信息传递前一个 Agent 的输出作为后一个 Agent 的输入而非真正的多模型并行讨论。3.4 定制化视频与音频生成根据是否需要音频生成分为两种模式纯视频生成使用两阶段StoryDiffusion CogVideoX或端到端Magic-Me模型。视频音频联合生成两阶段策略——先用 StoryDiffusion 生成关键帧图像用 VALL-E X 从字幕生成角色音频再用 Hallo2 合成会说话的人像视频。四、Experiments4.1 实验设置评测数据集 MoviePrompts10 个剧本提示8 个来自知名电影如哪吒2、冰雪奇缘2、头脑特工队22 个为原创。评测指标自动指标CLIP、Inception Score、VBench 人工评分5分制5个维度。硬件2 × A6000 GPU。4.2 主要结果自动指标Table 2指标MovieAgent最佳BaselineCLIP22.2521.83Inception9.399.01Motion Smoothness97.8496.60Dynamic Degree76.2774.48Aesthetic58.6356.69MovieAgent 在几乎所有 VBench 指标上全面领先。人工评分Figure 7MovieAgent 在五个维度均大幅超越基线方法尤其在 Character Consistency4.04和 Visual Appeal4.01上表现突出最佳基线仅约 2.5 分左右。4.3 消融实验Table 3消融项关键发现Internal CoT加入 CoT 后平均分从 3.55 → 3.61Narrative Coherence 提升最显著3.09 → 3.29LLM 选择GPT-4o 多智能体效果最佳3.82但 Deepseek-R1 在叙事连贯性上更优3.79 vs 3.55因其内置推理优化Multi-Agent多智能体协作显著提升性能3.72 vs 3.55Script Faithfulness 提升 0.33Narrative Coherence 提升 0.224.4 失败案例分析论文诚实地列出了五类典型失败Figure 11视觉失真、角色混淆、提示词跟随困难、叙事不连贯过渡、不合物理规律的人体比例并针对每类提出了改进方向。五、ConclusionMovieAgent 首次定义并探索了自动化电影/长视频生成的范式核心贡献包括范式定义明确了给定剧本角色库 → 多场景多镜头长视频的任务形式。层级化多智能体 CoT 框架模拟导演、编剧、分镜师的协作流程自动完成从剧本拆解到镜头设计的全链路。接近零成本相比传统电影1.5亿美元 / 6-7年MovieAgent 可在 2-10 分钟内免费生成。SOTA 结果在自动指标和人工评估中均取得最佳表现。六、个人思考亮点任务定义清晰且有价值论文首次正式定义了自动化电影生成的任务范式将一个模糊的愿景变成了可量化的研究问题这对后续研究有很强的引导作用。层级化设计合理Director → Scene → Shot 的三级分解很好地映射了真实电影制作流程比端到端生成更可控、可解释。每一级的 CoT 推理保留了决策理由方便调试和追溯。系统性思维不是简单堆砌模型而是从真实世界的电影制作是怎样的出发反向设计了 AI 系统的架构这种方法论值得借鉴。局限与疑问视频生成质量仍受限于底层模型从失败案例来看视觉失真、角色混淆等问题根源在于 StoryDiffusion、CogVideoX 等模型本身的能力瓶颈MovieAgent 的规划再好也无法弥补。随着底层模型进步如更强的角色一致性模型框架的价值会更明显。评估的可信度存疑仅 2 名评估者、10 个测试样本、主观 5 分制打分——这样的人工评估规模偏小结论的稳健性有待加强。自动指标方面VBench 等指标并非为长视频叙事设计的适用性值得商榷。音视频联合生成的处理偏工程化当前的两阶段音视频生成方案图像→音频→说话人合成是一种妥协策略未来随着端到端多模态生成模型的发展这部分可能被大幅简化。以上为个人阅读理解如有不当之处欢迎交流讨论。