资讯中心

视频编辑这件事,正在从“剪辑室“搬到“直播间“

📅 2026/8/20 23:39:36
视频编辑这件事,正在从“剪辑室“搬到“直播间“
你有没有想过这样一个场景你正在开着一场直播画面里是你自己在沙漠里踢球突然你想让整个场景变成雨中的体育场下一秒想给自己套上钢铁侠的战甲再过一会儿又想把整个画风换成卡通风格。这一切的转变不是拍完之后回去后期做的而是画面正在直播的同时实时发生的。这不是科幻电影的桥段。这是京东的Joy未来学院团队在2026年8月发布的一篇论文里真真切切实现的东西叫做JoyAI-Video-Edit。它能在一块英伟达B200显卡上以720p分辨率、每秒30帧的速度一边接收视频流一边完成编辑而且不知道视频到底有多长,可能是10秒的短片也可能是一小时的直播。这事听起来简单做起来却是个大麻烦。我们先花点时间搞清楚这个麻烦到底难在哪里。视频编辑的两个世界一直互相看不上在这篇论文出现之前视频编辑领域基本活在两个割裂的世界里。第一个世界是离线编辑。像VACE、OpenVE-Edit这些高质量的视频编辑模型工作方式是这样的你把整段视频喂给它它把整个视频通读一遍专业说法叫双向注意力也就是模型可以同时看到过去和未来的所有帧然后经过反复的去噪迭代最后一次性吐出编辑好的结果。这种方式效果很好因为模型能看到全局信息前后连贯性有保证。但问题也很明显它必须等你把整段视频都拍完、传完才能开始工作。直播场景下这条路直接走不通,你总不能让观众在弹幕里刷加载中刷上一分钟。第二个世界是流式streaming编辑也就是所谓的实时编辑。这几年出现了StreamDiffusionV2、SANA-Streaming、LiveEdit这些方案试图解决实时性的问题。但论文里给出的评测数据很扎心这些流式方法在权威评测集OpenVE-Bench上的综合得分普遍在1.2到2.6分满分5分而离线的强模型能做到3.6分甚至更高。换句话说为了追求实时这一个指标这些方法把编辑质量做出了明显的妥协,画面容易模糊、色彩会漂移、编辑指令执行得也不够准。这就是这篇论文要解决的核心矛盾**能不能既做到像离线模型一样的编辑质量又做到像直播一样的实时响应**要回答这个问题得先搞清楚为什么直接把离线模型改造成实时模型这条路走不通。把双向模型硬掰成单向模型会遇到什么坑最直观的思路是既然离线模型效果好那就想办法让它别看未来的帧只看过去的帧,这样不就能实时输出了吗这个思路在工程上是可行的业内管这个过程叫做因果化causalization。但论文作者发现单纯做这个改造会撞上一个叫做训练-推理不匹配train-inference mismatch的问题。这里需要展开说一下。模型在训练的时候通常会用教师强制teacher forcing的方式:也就是说当模型在预测第10秒的画面时研究者会把真实、干净的第1到9秒画面喂给它作为历史参考。这样训练出来的模型见到的历史永远是完美无瑕的。但真到了实际部署推理的时候事情就不一样了。模型在生成第10秒画面时能参考的第1到9秒画面不是真实数据而是模型自己之前生成出来的、可能带着瑕疵的画面。如果第3秒的画面颜色稍微偏了一点这个偏差就会被当作历史事实传递给第4秒、第5秒……一路累积下去。这就好比你在玩一个传话游戏。第一个人说的话是准确的原文但从第二个人开始每个人听到的都是上一个人转述之后的版本。如果每次转述都有百分之一的误差传到第100个人的时候原意可能已经面目全非了。如果不做任何针对性处理直接把离线模型改造成流式模型进行长时间生成画面会逐渐出现颜色漂移、人物身份漂移、背景细节丢失,这就是论文里反复强调的长期漂移long-term drift问题。而且视频编辑这件事比单纯的视频生成还要难一层。它不仅要保证前后帧连贯还必须时刻和当前这一帧的原始源视频对齐,你要保证没被编辑到的部分比如人物的动作、背景里没提到要改的东西原封不动地保留下来同时又要把编辑指令比如把主角换成钢铁侠稳定地执行下去。这是一个动态的平衡过度依赖生成的历史会导致错误累积过度依赖原始源视频又会导致编辑指令执行得不彻底、风格显得畏首畏尾。搞清楚了这些坑我们再来看JoyAI-Video-Edit是怎么一步步填的。第一步把整个画面切成块让模型学会分段看JoyAI-Video-Edit的整体架构由三个部分组成。 多模态大语言模型MLLM负责理解文字指令和视频画面把把猫身上加一件毛衣这种自然语言指令和视频的第一帧画面结合起来转换成模型能理解的条件信息。 因果视频VAEVariational Autoencoder变分自编码器负责把视频压缩成更小的潜在表示这样模型不用直接处理海量像素处理效率大大提升。这个VAE的压缩比是8×24×24意思是每8帧原始视频压缩成1个潜在帧空间上长宽各压缩24倍。 多模态扩散TransformerMM-DiT真正干活的主体把条件信息和视频潜在表示放在一起处理逐步生成编辑后的画面。架构定下来之后第一个关键改造是把处理方式从整段视频一起看变成分块处理chunk-wise。具体做法是把视频沿着时间轴切成一个个小块论文里每块对应一个潜在帧相当于8个原始视频帧在每个小块内部模型仍然可以双向地看信息块内双向注意力但跨块之间模型只能看之前的块不能看未来的块跨块因果注意力。这个设计有个很聪明的地方为了让计算量不随着视频变长而无限增长模型只保留一个滑动窗口内的最近几个历史块再加上第一个块作为全局锚点global sink,不管视频直播了多久模型每次要处理的历史信息量始终是固定的。这一点非常关键我们打个比方。你负责给一场持续几个小时的马拉松直播做同声传译如果要求你记住从开场到现在说过的每一句话随着比赛进行你的大脑负担会越来越重到后期根本忙不过来。但如果你只需要记住最近几分钟发生的事加上开场时主持人定下的基调比如这是一场公益赛事那么不管比赛进行多久你脑子里要处理的信息量始终差不多。这个开场基调就相当于论文里的全局锚点它锁定了最初的画面风格和内容基准避免了长时间编辑之后模型忘了自己在编辑什么。如果没有这个滑动窗口设计模型要么会随着视频变长而越跑越慢因为历史信息一直在累积要么不得不砍掉历史信息导致长期一致性完全丧失。分块处理确定之后还有个训练细节的调整。团队一开始用前面提到的教师强制方式训练用干净的真实历史喂给模型但很快切换到了一种叫做重采样强制Resampling Forcing的方法。做法是把每个历史块先用模型自己跑一遍单步去噪生成一个模型自产的历史版本并且这个版本不参与梯度回传也就是detached再拿这个带瑕疵的历史去训练模型。这样一来模型在训练阶段就已经习惯了跟自己生成的、不那么完美的历史打交道而不是在部署上线之后才第一次遇到这种情况,提前适应减少现实落差。第二步怎么在两步之内做完扩散生成还不丢画质光解决了因果化的问题还不够。扩散模型diffusion model的核心工作原理是通过很多步的迭代去噪一步一步把随机噪声变成清晰画面。步骤越多画质通常越好但计算量也越大实时性就无从谈起。 扩散模型一种生成模型工作原理是先把清晰的图像逐渐加噪声直到变成完全的随机噪声然后训练一个模型学会反向这个过程,从纯噪声出发一步步去掉噪声最终还原/生成出清晰的画面。生成质量通常和去噪步数正相关步数越多质量越高但速度越慢。要做到实时就得把原本可能需要几十步的去噪过程压缩到极少的步数。这篇论文用到的技术叫分布匹配蒸馏Distribution Matching Distillation简称DMD这是一种师生蒸馏方法训练一个更小、更快的学生模型生成器去学习一个效果很好但速度很慢的教师模型真实分数模型的行为让学生模型能用远少于教师的步数达到接近的效果。但直接套用标准DMD在视频编辑上会出问题。原因还是前面提到的那个历史累积误差,在长时间的自回归推理也就是模型不断依赖自己之前生成的内容继续往下生成过程中生成器会越来越依赖自己不完美的历史导致编辑内容逐渐偏离原始视频甚至出现幻觉凭空生成一些不该出现的内容。于是团队提出了一个改进版叫做源锚定分布匹配蒸馏Source-Anchored Distribution Matching Distillation简称SA-DMD。核心思路是在蒸馏训练阶段让教师模型真实分数模型额外参考和当前编辑块在时间上严格对齐的原始源视频画面通过一种叫做无分类器引导Classifier-Free Guidance, CFG的技术把文本指令的引导强度和源视频保真度的引导强度拆成两个独立的调节旋钮分别控制。这样一来教师模型给学生的标准答案会天然带着别忘了源视频长什么样这层约束学生模型在学习过程中就把这种保真意识吸收进了自己的参数里。这里有意思的地方在于这个源锚定的操作只作用于训练阶段的教师目标上实际部署上线之后模型走的是单一的推理分支不需要额外去参考源视频进行第二次计算,相当于把保真度约束这门功课提前在考前补习班里学扎实了考试的时候也就是真实部署时不需要再翻书对照直接凭记忆答题就够了。打个比方这就像临摹一幅画。如果你只盯着自己刚画完的上一笔往下画也就是只依赖生成历史画着画着很容易越画越歪,第一笔偏了一毫米第二笔基于第一笔又偏了一毫米十笔下来整幅画可能已经和原图差之千里。但如果你时不时抬头看一眼原画源视频把自己刚画的和原画做个对照校准就能把偏差及时纠正回来。SA-DMD做的就是这件事让训练过程中的老师时刻拿着原画去纠偏教出来的学生也就是最终部署的模型自然而然地就带上了这种不容易跑偏的习惯而且不需要在实际画画的时候真的再拿一张原画出来对照,因为这个习惯已经刻进肌肉记忆里了。经过SA-DMD压缩之后论文里提到扩散去噪的步骤最终被压缩到只有两步。两步这个数字乍一听有点冒险但从后面的实验数据看这个压缩并没有让编辑质量掉太多。第三步怎么应对越编越长之后的崩坏前两步解决了因果生成和加速推理的问题但还剩最后一道坎长视频。如果训练时用的都是很短的视频片段比如几秒钟模型确实能学会怎么处理短期的因果生成但它没见过编辑到第50秒之后会是什么状态。而现实中视频流可能持续几十分钟甚至几个小时短期训练很难覆盖长期运行才会暴露出来的深层错误累积。这就好比一个新手司机驾校训练的时候只在小区里绕了几圈从没跑过长途。等真让他上高速开五六个小时方向盘握久了手会不自觉地跑偏注意力也会因为长时间重复动作而松懈,这些问题只有真的开长途才会暴露绕小区是绕不出来的。于是团队引入了长时程自回归蒸馏Long-Horizon Autoregressive Distillation简称LHAD。具体做法是把一个很长的视频片段论文里叫m-chunk rollout也就是m个块组成的滚动序列拆成若干个更短的连续小段对每一小段单独计算SA-DMD的反向传播梯度算完立刻清空计算图避免显存爆掉也就是常说的OOMOut of Memory然后把所有小段的梯度累积起来做一次统一的参数更新。这样既能让模型见识到长视频运行后期才会出现的深层错误状态又不会因为要保留整段视频的完整计算图而导致显存不够用。还有一个很实际的小设计如果训练时想要模拟的目标长度超过了手头现有源视频的长度怎么办团队用了一种叫动态镜像循环dynamic mirror looping的策略简单说就是把视频正着放一遍再倒着放一遍交替循环,这样可以在不用真的复制粘贴视频内容占用额外存储的情况下延伸出足够长的虚拟源视频而且避免了简单粗暴的循环重复带来的画面突兀跳变。部署上线如何真的做到每秒30帧方法讲完了接下来看这套系统在真实硬件上跑起来到底是什么速度。论文给出了详细的耗时拆解在一块英伟达B200 GPU上处理每个8帧的视频块,VAE编码耗时22毫秒DiT去噪耗时185毫秒VAE解码耗时19毫秒从请求发出到响应返回总共226毫秒的延迟。再加上干净KV缓存构建31毫秒和伪编码9毫秒完整一轮循环是266毫秒换算成帧率正好对应30.1 FPS。 KV缓存Key-Value CacheTransformer类模型在自回归生成时的一种加速技巧把之前计算过的键值对信息存起来后面生成新内容时可以直接复用不用每次都从头重新计算整段历史,这也是为什么分块滑动窗口的设计能让计算量保持恒定的原因之一。 FP8量化把模型内部原本用更高精度比如32位或16位浮点数存储和计算的数值压缩成8位浮点数表示,精度会略微下降但计算和存储开销大幅降低是实现实时推理的重要工程手段之一。为了达到这个速度团队做了一系列的部署优化FP8量化降低了计算和存储成本编译过的VAE计算路径配合自动调优autotuning加速了编码解码过程流水线式的执行让主机端的处理和显卡端的计算可以并行重叠启动预热、持久化的编译产物和保留的内存池则避免了重复编译和内存分配带来的额外开销。这些优化叠加起来的效果在实测对比中体现得很明显。论文给出了在81帧输入、批大小为1的条件下几个流式编辑方案的延迟和吞吐量对比| 方法 | 分辨率 | 完整流程延迟(秒) | 完整流程FPS | VAE延迟(秒) | VAE FPS ||---|---|---|---|---|---|| StreamDiffusionV2 | 480×832 | 4.48 | 18.07 | 2.19 | 37.06 || LiveEdit | 480×832 | 5.24 | 15.45 | 2.17 | 37.26 || SANA-Streaming | 704×1280 | 5.58 | 14.51 | 2.99 | 27.12 || **JoyAI-Video-Edit** | **720×1280** | **2.68** | **30.19** | **0.405** | **200.00** |值得留意的是JoyAI-Video-Edit在分辨率更高720×1280的情况下反而做到了最低的完整流程延迟和最高的吞吐量尤其是VAE处理速度达到了200 FPS比其他几家快出一大截。这说明它的优势不只是靠单点的算法先进而是整个系统链路VAE、DiT、缓存机制、量化方案协同优化之后的结果。实验结果短视频打得过长视频打得赢光讲原理不够我们来看看这套系统到底做得怎么样是不是真的比其他流式方案强又是不是真的能追上离线模型的水准。论文用了两个测试场景。第一个是短视频编辑用的是公开评测集OpenVE-Bench覆盖全局风格转换、局部改动、背景替换、局部删除、局部添加五大类任务由一个多模态大模型Gemini当裁判打分满分5分。| 方法 | 参数量 | 分辨率 | 综合得分 | 全局风格 | 局部改动 | 背景替换 | 局部删除 | 局部添加 ||---|---|---|---|---|---|---|---|---|| StreamDiffusionV2 | 1.3B | 480×832 | 1.23 | 1.48 | 1.35 | 1.01 | 1.27 | 1.05 || SANA-Streaming | 2B | 704×1280 | 2.62 | 3.48 | 2.29 | 3.20 | 2.27 | 1.88 || LiveEdit | 1.3B | 480×832 | 2.00 | 2.18 | 2.73 | 2.05 | 1.55 | 1.51 || Xmax-X2.0 | — | 832×1440 | 1.87 | 2.47 | 2.09 | 1.63 | 1.73 | 1.41 || Bernini-R离线 | 27B | 480×848 | 3.72 | 4.16 | **4.47** | 3.25 | 3.88 | 2.89 || **JoyAI-Video-Edit** | **16B** | **720×1280** | **3.60** | 3.62 | **4.47** | 2.90 | **4.06** | 2.97 |从数据能看出几个层次。首先和其他流式方案相比JoyAI-Video-Edit的综合得分3.60比第二名SANA-Streaming的2.62高出接近一整分,而且这个差距不是靠某一项冲高拉出来的是在五个类别里的四个都拿到了流式方案第一。其次也是更让人意外的一点它的表现已经追平甚至超过了一部分参数量更大的离线模型。像27B参数的Bernini-R作为离线系统综合得分3.72只比JoyAI-Video-Edit高0.12分,而且在局部改动这一项两者都是并列最高的4.47分。要知道离线模型可以看到整段视频的过去和未来JoyAI-Video-Edit只能看到过去还得在极短时间内实时吐出结果能做到这个水准并不容易。第二个测试场景更值得说道因为它触及了一个此前行业里几乎没人系统测过的盲区:长视频编辑。论文里提到现有的视频编辑评测集大多是不到10秒的短片段根本没法用来考察一个模型在长时间运行之后会不会出现质量下滑、误差累积这些问题。于是团队自己搭建了一个新的评测基准叫LongV2VBench包含229个任务覆盖背景替换、全局风格编辑、局部添加、局部修改、局部删除五大类视频长度统一为一分钟。 LongV2VBench论文作者自建的长视频编辑评测基准专门用来测试模型在处理约一分钟长度视频时是否还能保持编辑质量的稳定而不是像很多短视频评测那样只看几秒钟的表现。在这个更严苛的长时间考验下结果差距进一步拉开| 方法 | 分辨率 | 吞吐量(FPS) | 综合得分 | 背景替换 | 全局风格 | 局部添加 | 局部改动 | 局部删除 ||---|---|---|---|---|---|---|---|---|| StreamDiffusionV2 | 480×832 | 18.07 | 1.21 | 1.08 | 1.71 | 1.18 | 1.11 | 1.03 || SANA-Streaming | 704×1280 | 14.51 | 1.64 | 1.19 | 2.02 | 1.50 | 1.72 | 1.85 || LiveEdit | 480×832 | 15.45 | 1.23 | 1.10 | 1.34 | 1.33 | 1.34 | 1.04 || XMax-X2.0 | 832×1440 | 20.90 | 1.71 | 1.36 | 2.07 | 1.64 | 2.08 | 1.40 || **JoyAI-Video-Edit** | **720×1280** | **30.19** | **3.30** | **2.49** | **3.85** | **3.10** | **4.09** | **2.99** |这组数字才是真正说明问题的地方。**JoyAI-Video-Edit在长视频场景下拿下了3.30的综合分比第二名XMax-X2.0的1.71分几乎翻了一倍**。这说明什么说明其他几家流式方案虽然在几秒钟的短片段上还能凑合但一旦拉长到一分钟编辑质量出现了明显的下滑,这正好印证了前面反复提到的长期漂移问题没有专门针对长时程做优化的模型跑得越久画面越容易走样。而JoyAI-Video-Edit靠着SA-DMD和长时程蒸馏这两把刷子把这个问题压住了。同时它的吞吐量还是最高的达到30.19 FPS比分辨率更高的XMax-X2.0还快44.4%,速度和质量没有互相拖后腿。消融实验两个关键设计到底谁的功劳更大光看最终结果还不够过瘾论文里还专门做了一个拆解实验把SA-DMD和LHAD长时程自回归蒸馏分别单独拿掉看看各自到底贡献了多少。| SA-DMD | LHAD | 综合得分 | 背景替换 | 全局风格 | 局部添加 | 局部改动 | 局部删除 ||---|---|---|---|---|---|---|---|| — | — | 2.81 | 2.45 | 3.61 | 1.97 | 3.43 | 2.58 || ? | — | 3.23 | 2.49 | **4.24** | 2.74 | 4.00 | 2.67 || — | ? | 3.06 | **2.60** | 3.56 | 2.49 | 3.94 | 2.70 || **?** | **?** | **3.30** | 2.49 | 3.85 | **3.10** | **4.09** | **2.99** |从这张表能看得很清楚SA-DMD单独启用之后全局风格这一项从3.61直接跳到4.24局部改动从3.43跳到4.00,说明锚定源视频这个操作确实狠狠遏制住了因为长时间自回归导致的画面走样。而LHAD单独启用主要提升的是背景替换从2.45到2.60和局部删除从2.58到2.70这两项恰好都是需要长时间保持稳定才能做好的任务类型,说明LHAD瞄准的正是长视频运行后期状态不稳这个具体问题。两者一起用最终拿到3.30的综合最高分而且在局部添加、局部改动、局部删除这三项局部编辑任务上都是全表最优,证明这两个设计不是简单的叠加而是真的互相补位各自解决了对方解决不了的问题。人类评审真人打分下的胜负手自动打分固然客观但视频质量这种事终究还是要看人怎么看。论文里还做了一轮人类主观评审用的是两两对比的方式:把匿名的编辑结果放在一起让评审员在两个方案之间选一个更好的或者选平局。结果显示JoyAI-Video-Edit对阵LiveEdit时拿下90%的偏好票对阵SANA-Streaming是87%对阵XMax-X2.0是81%对阵StreamDiffusionV2是87%。这几组数据基本上是碾压级别的胜出。而对阵离线的Bernini-R模型时双方各拿48%和44%剩下是平局,可以说打了个平手。对阵Kling-3.0 Omni和Seedance 2.0这两个商业闭源模型时各自拿到56%的偏好票也算是稍占上风。这组人类主观评审的结果和前面自动评测的结论基本吻合**在流式实时编辑这个赛道里JoyAI-Video-Edit是明显的第一名而放到整个视频编辑领域包括离线模型来看它也已经达到了和顶尖离线系统掰手腕的水准**。数据从哪儿来训练背后的功夫方法和结果讲完了最后补一笔常常容易被忽略但其实很关键的部分:训练数据是怎么攒出来的。高质量的视频编辑配对数据也就是一段原始视频加上一段编辑后的目标视频两两配对在业内一直是稀缺资源很难大规模收集。论文里提到团队想了两条路来解决这个问题。第一条路是关键帧引导的编辑传播先从源视频里挑一帧有代表性的画面出来用图像编辑模型把这一帧改好然后把改好的这一帧和原始视频一起喂给一个图像加视频到视频的模型让它把这个编辑效果传播扩散到整段视频的其他帧上同时保持原有的运动轨迹和没被编辑到的内容不变。第二条路是潜在共享的图生视频生成从一张原始图片和它编辑后的对应图片出发用两个分支的图生视频I2V模型分别生成视频这两个分支在早期的去噪阶段共享同一批潜在变量这样能保证运动和构图一致到了后期去噪阶段才分别用不同的图片作为条件从而引入想要的编辑效果。生成出来的配对数据还要经过一轮筛选按照画面质量、编辑是否正确、内容是否被过度改动、时间连贯性等标准过滤一遍之后再用一个多模态大模型去核对源视频和编辑后视频之间的差异反过来修正和精炼编辑指令的文字描述,相当于给每一条训练数据都做了质检加复核。打个比方这有点像做菜谱教学视频。如果你只是随便拍一段做菜过程就拿去当教材可能里面有失败的步骤、错误的调料比例学的人反而学歪了。但如果你先请专业厨师把每个关键步骤关键帧单独做示范再把整个过程录下来对照检查最后请美食评论家多模态大模型核实一遍菜谱描述和实际做法是否一致,这样产出的教学素材质量才靠得住。如果不做这层筛选和核对直接拿粗糙数据训练模型模型学到的编辑能力大概率也是歪的。写在后面读完这篇论文最触动我的一点其实是长视频漂移这个问题被真正当回事对待的方式。很多论文提到长期一致性问题时往往一笔带过用未来工作打发过去。但这篇论文专门搭了一个新的评测基准LongV2VBench去量化这个问题然后用数据证明了不做专门优化的话一分钟的视频编辑质量能比十秒钟的差出一倍不止对比表里其他方法综合分普遍在1.2到1.7分远低于短视频测试时的2到3分区间。这个反差本身就是一个很有价值的发现,它说明行业里此前的实时编辑方案可能大多是在短平快的场景下堆出来的成绩一旦拉到真实的长直播场景很可能立刻现出原形。另一个让我觉得有意思的细节是SA-DMD里只在训练阶段做源锚定部署阶段单分支推理这个设计。这种考前抱佛脚考试凭记忆的思路本质上是把一个推理时的计算负担提前转移到了训练阶段去消化。这个思路在其他需要平衡实时性和质量的场景里比如实时语音翻译、实时人脸重建应该都有借鉴价值,只是具体怎么把额外约束从推理时挪到训练时每个场景恐怕都得重新设计一遍。这篇论文没有解决的一个问题是它依赖16B参数量和B200这样的顶级硬件才跑出30 FPS。等哪天这套方法能塞进一台普通游戏本甚至手机里视频编辑会不会真的变成人人张口就来的一件事值得继续追问。QAQ1JoyAI-Video-Edit是什么AJoyAI-Video-Edit是京东Joy未来学院提出的一款160亿参数的自回归扩散视频编辑模型能够在不知道视频总时长的情况下实时对视频流进行指令引导的编辑在单块英伟达B200 GPU上可以做到720p分辨率、每秒约30帧的编辑速度。Q2JoyAI-Video-Edit和其他实时视频编辑工具比优势在哪A在短视频编辑评测OpenVE-Bench上综合得分3.60大幅超过SANA-Streaming、LiveEdit、XMax-X2.0等流式方案接近甚至持平部分离线大模型在专门测试长视频的LongV2VBench上综合得分3.30比第二名高出近一倍同时吞吐量也是所有对比方案里最高的达到30.19 FPS。Q3JoyAI-Video-Edit是怎么解决长视频编辑质量下降的问题的A主要靠两个关键技术源锚定分布匹配蒸馏SA-DMD让模型在训练时始终参考对齐的原始源视频抑制自回归生成过程中的漂移长时程自回归蒸馏LHAD通过分段优化让模型在训练阶段就见识到长视频运行后期才会出现的误差累积状态从而提前学会应对。