资讯中心

Cross-Platform Low Operation Point In-Loop Filter for VVC Using Integer Operations:论文深度解读

📅 2026/8/4 23:10:29
Cross-Platform Low Operation Point In-Loop Filter for VVC Using Integer Operations:论文深度解读
本文深入解读发表于 IEEE Xplore 的论文“Cross-Platform Low Operation Point In-Loop Filter for VVC Using Integer Operations”IEEE 文献号 11562829作者来自西安电子科技大学电子工程学院。该论文针对 VVC/H.266 神经网络视频编码NNVC中的低操作点LOP环路滤波器提出了一种基于整数运算的跨平台改进方案在降低网络复杂度的同时提升了压缩效率。一、研究背景从传统环路滤波到神经网络滤波1.1 VVC 的环路滤波体系H.266/VVCVersatile Video Coding是 ITU-T 和 ISO/IEC 于 2020 年联合发布的最新一代视频编码标准相比 H.265/HEVC 可在同等质量下节省约 50% 的比特率。VVC 的压缩性能提升很大程度上依赖于其环路滤波In-Loop Filtering体系的增强。VVC 的环路滤波处理链如下滤波工具全称功能定位执行顺序LMCSLuma Mapping with Chroma Scaling亮度映射与色度缩放优化码值范围利用1编码前预处理DBFDe-Blocking Filter去块效应滤波平滑块边界不连续性2SAOSample Adaptive Offset样点自适应补偿消除振铃效应3ALFAdaptive Loop Filter自适应环路滤波基于维纳滤波减少解码误差4其中 ALF 是 VVC 相对 HEVC 新增的重要工具——它使用菱形中心对称的滤波器模板亮度 7×7色度 5×5按 4×4 块的梯度方向对像素进行分类每类使用不同的滤波器系数。尽管 ALF 在 HEVC 标准化期间就已提出但受限于当时硬件算力而未能进入标准。VVC 时代硬件能力的提升使其终于成为标配。1.2 神经网络视频编码NNVC的兴起传统编码框架经过 H.264 → HEVC → VVC 的演进基于手工设计工具的压缩效率提升越来越困难。与此同时深度学习在图像/视频处理领域展现出强大能力。为此JVET联合视频专家组于 2020 年成立了 AHG11 专项小组专门研究基于神经网络的视频编码Neural Network-based Video CodingNNVC。NNVC 基于 VTM-11.0VVC 参考软件开发集成了三类神经网络编码工具环路滤波NN-based In-Loop Filter替代或增强传统 ALF/SAO帧内预测NN-Based Intra Prediction使用全连接网络进行帧内模式预测超分辨率NN-based Super-Resolution解码端对低分辨率重建帧进行超分其中神经网络环路滤波是当前最活跃、最接近实际部署的方向。1.3 LOP 滤波器性能与复杂度的平衡点NNVC 中的神经网络滤波支持三个操作点Operating Point操作点全称复杂度定位VLOPVery Low-complexity Operating Point最低超低功耗场景LOPLow-complexity Operating Point中等性能-复杂度均衡HOPHigh-complexity Operating Point最高追求极致压缩效率LOPLow Operation Point滤波器因其良好的性能-复杂度权衡而受到最多关注。经过持续迭代发展最新版本 LOP6 在 NNVC-14.0 参考软件中Y 分量的平均 BD-rate 增益分别为全帧内AI配置8.59%随机访问RA配置8.01%这是一个非常可观的增益——意味着在同等质量下可以节省约 8% 的比特率这在编码效率已经接近极限的 VVC 框架中尤为珍贵。二、问题分析LOP6 的瓶颈与挑战尽管 LOP6 取得了显著的压缩增益但仍面临以下核心挑战2.1 感受野受限LOP6 原始结构中的骨干块Backbone BlockBBB使用较小尺寸的卷积核这限制了网络的空间感受野Receptive Field。感受野决定了网络能够看到的像素邻域范围——感受野不足会导致网络无法有效捕获大尺度的空间相关性从而影响滤波质量。2.2 网络复杂度偏高LOP6 的网络复杂度为16.60 kMAC/pixel千次乘加运算/像素。对于视频编码这类需要实时处理的应用场景每一 kMAC 的降低都意味着更低的功耗和更广的部署范围。2.3 跨平台部署的精度问题神经网络模型通常以浮点精度FP32训练和推理但视频编解码器需要在各种硬件平台上部署——从高性能 GPU 到嵌入式 DSP、FPGA。浮点运算在不同平台上的行为可能不一致特别是舍入模式差异导致相同模型、不同平台、不同输出的问题。使用整数运算Integer Operations可以彻底解决跨平台一致性问题整数运算是确定性的在任何支持整数算术的硬件上都能产生完全一致的结果。2.4 色度分支信息不足在 YUV 4:2:0 格式下色度分量的分辨率仅为亮度分量的一半。LOP6 的色度分支在处理色度信息时可用的上下文信息相对有限影响了色度通道的滤波效果。三、核心方法四大技术创新针对上述挑战本文提出了一种跨平台 LOP 环路滤波器核心创新包括四个方面。3.1 TwinBlock 替代亮度分支结构原始 LOP6 结构的亮度分支使用一系列标准卷积块进行特征提取和重建。本文方法将 LOP6 亮度分支的原始结构替换为五个 TwinBlock(x)模块。TwinBlock 的设计灵感来自 RepVGG 的结构重参数化思想——它是一种双胞胎式模块结构核心思路是训练阶段使用多分支拓扑multi-branch topology每个分支提取不同尺度的特征推理阶段通过重参数化技术将多分支等效融合为单路结构具体来说TwinBlock 在训练时将可分离卷积separable convolution展开为多分支结构增强多尺度特征提取能力推理时则将多分支合并为等效的单一卷积消除推理时的分支开销。3.2 1×5 / 5×1 深度可分离卷积扩大感受野本文在色度分支的骨干块 BBB(x) 中引入了1×5 和 5×1 的深度可分离卷积depthwise convolution替代原有的较小卷积核。为什么选择 1×5 和 5×1这是一个精心设计的权衡设计维度1×5/5×1 方案原 3×3 方案感受野水平/垂直各 5 像素水平/垂直各 3 像素参数量5CC 为通道数9C计算量5×H×W×C9×H×W×C方向性可分离水平/垂直特征各向同性1×5 和 5×1 卷积将水平方向和垂直方向的特征提取解耦在扩大感受野的同时减少了参数量和计算量。此外更大的感受野意味着 BBB(1)第一层骨干块的使用次数减少从而进一步降低了网络整体复杂度。3.3 过参数化训练Over-Parameterized Training这是本文最具深度创新的技术。受 RepVGG 结构重参数化思想的启发本文将训练阶段和推理阶段的网络架构进行解耦训练阶段——将 1×5、5×1、1×3、3×1 的深度可分离卷积分别展开为多分支结构训练时 Input ──┬── 1×5 depthwise conv ──┐ ├── 1×3 depthwise conv ──┤── concat/add ── Output ├── 3×1 depthwise conv ──┤ └── 5×1 depthwise conv ──┘每个分支负责提取不同尺度的空间特征多分支并行可以捕获更丰富的多尺度信息相当于一个过参数化的模型集成。推理阶段——通过结构重参数化Structural Re-parameterization将多分支等效转换为单路结构推理时 Input ── 合并后的单路 depthwise conv ── Output重参数化的数学本质是对于线性卷积不含非线性激活的分支多个卷积分支的叠加可以精确地等效为单个卷积。具体而言对于 1×k 和 k×1 这类可分离卷积可以将多个分支的权重在训练完成后线性融合融合后的单路卷积在数学上与多分支完全等价但推理时只需一次卷积运算这种训练时复杂、推理时简单的设计哲学使得模型在训练时享受多分支带来的丰富特征表达在推理时又拥有单路结构的高效性。3.4 可变通道配置Variable Channel Configurations针对色度分支信息不足的问题本文采用了可变通道配置策略在色度分支的不同 BBB 层中使用不同的通道数配置较浅层使用更多通道以丰富输入信息较深层适当减少通道以控制计算复杂度整体效果在不增加甚至减少总计算量的前提下为色度滤波提供了更丰富的特征表示这种设计类似于 MobileNet 中的宽→窄通道变化策略但在 NNVC 环路滤波的场景下做了专门适配。四、网络架构总览综合以上创新本文提出的 LOP 滤波器整体架构如下亮度分支Luma Branch输入重建亮度像素 预测像素等编码信息结构5 × TwinBlock(x) 模块每个 TwinBlock 内部使用过参数化训练的多分支深度可分离卷积推理时通过重参数化合并为单路结构色度分支Chroma Branch输入重建色度像素U/V 分量结构5 × BBB(x) 骨干块每个 BBB 使用 1×5、5×1 深度可分离卷积扩大感受野采用可变通道配置丰富色度输入信息整数运算保证所有卷积权重和激活值均使用整数表示训练时采用量化感知训练Quantization-Aware Training, QAT推理时全程使用整数乘加运算保证跨平台一致性复杂度对比方案复杂度kMAC/pixel变化原始 LOP616.60基准本文方法16.56-0.04降低前序工作IEEE 1152020416.810.21增高值得注意的是相比前序工作复杂度从 16.83 降至 16.81 kMAC/pixel本文进一步将复杂度降至 16.56 kMAC/pixel同时性能更优。五、实验结果分析5.1 实验设置基准锚点AnchorNNVC-14.0最新版 NNVC 参考软件测试配置AIAll Intra全帧内编码10-bitRARandom Access随机访问10-bit评价指标BD-rateBjøntegaard Delta rateBD-rate 为负值表示码率节省即性能提升分别报告 Y、U、V 三个分量5.2 主要结果全帧内AI配置分量BD-rate解读Y亮度-0.05%轻微提升U色度Cb-0.55%显著提升V色度Cr-0.07%轻微提升随机访问RA配置分量BD-rate解读Y亮度-0.13%明显提升U色度Cb-0.70%显著提升V色度Cr0.23%轻微下降5.3 结果解读色度提升最为显著AI 配置下 U 分量 -0.55%、RA 配置下 U 分量 -0.70% 的提升验证了可变通道配置和 1×5/5×1 深度卷积对色度分支信息增强的有效性。色度分量在视频编码中通常被忽视因为人眼对色度细节不敏感但色度质量的提升对于整体视觉体验仍然重要。亮度提升稳定但幅度较小Y 分量在 AI 和 RA 下分别有 -0.05% 和 -0.13% 的提升。这些数字看似不大但需注意这是在 LOP6 已经取得 8% 增益的基础上的增量提升且同时降低了复杂度——这意味着性能-复杂度帕累托前沿的整体推进。V 分量在 RA 下轻微回退0.23% 的 BD-rate 意味着 V 分量在 RA 配置下有微小的码率增加。这可能是 U/V 分量间资源分配不平衡导致的是该方法的一个小局限。5.4 复杂度-性能权衡分析本文最值得关注的不是绝对性能数字而是在降低复杂度的同时提升性能这一事实。在视频编码研究中性能和复杂度通常是正相关的——想要更好的压缩效果就需要更复杂的模型。本文通过精巧的网络设计打破了这一常规权衡过参数化训练使训练时拥有更强的特征提取能力重参数化使推理时保持简单高效1×5/5×1 卷积以更少参数获得更大感受野可变通道配置在不增加计算量的前提下丰富信息这种既要又要的设计哲学体现了作者对网络结构和训练策略的深入理解。六、技术深挖关键概念详解6.1 BD-rate 是什么BD-rateBjøntegaard Delta rate是视频编码领域最核心的性能评价标准由 Gisle Bjøntegaard 在 VCEG-M33 中提出。它衡量的是在相同 PSNR质量下两种编码方案的码率差异。BD-rate 为负 → 码率节省 → 性能更好BD-rate 为正 → 码率增加 → 性能更差例如BD-rate -0.13% 意味着在相同质量下本文方法比基准节省了 0.13% 的比特率。虽然绝对值不大但考虑到这是在已经高度优化的 NNVC-14.0 基础上的增量且同时降低了复杂度其工程价值不容忽视。6.2 深度可分离卷积Depthwise Separable Convolution标准卷积中每个输出通道与所有输入通道进行卷积计算量为C_out × C_in × K × K。深度可分离卷积将其分解为两步Depthwise深度卷积每个输入通道独立使用一个卷积核计算量为C_in × K × KPointwise逐点卷积使用 1×1 卷积进行通道间信息融合计算量为C_in × C_out这种分解将计算量从C_out × C_in × K × K降低到C_in × K × K C_in × C_out在通道数较大时可以显著减少计算量。本文中使用的 1×5 和 5×1 卷积属于 depthwise 部分它们分别沿水平和垂直方向提取特征等效于将 2D 卷积分解为两个 1D 卷积。这种分离设计不仅减少了计算量还增强了方向性特征提取能力。6.3 结构重参数化Structural Re-parameterization这是本文过参数化训练的理论基础源自 RepVGGCVPR 2021的核心思想。其数学原理如下考虑一个训练时的多分支模块包含三个并行分支3×3 卷积分支1×1 卷积分支恒等映射分支Identity训练完成后三个分支可以合并为一个等效的 3×3 卷积1×1 → 3×3将 1×1 卷积核零填充为 3×3Identity → 3×3构造一个中心为 1、其余为 0 的 3×3 卷积核BN 融合将每个分支的 BatchNorm 参数融入卷积权重分支相加将三个 3×3 卷积核逐元素相加最终得到一个单一的 3×3 卷积其输出与原始多分支完全等价但推理时只需一次卷积运算。本文将这一思想扩展到了 1×5、5×1、1×3、3×1 深度可分离卷积场景在训练时使用多分支增强特征提取推理时合并为单路降低计算开销。6.4 整数运算与跨平台一致性使用整数运算的核心价值在于确定性和可移植性浮点运算的问题IEEE 754 浮点标准允许实现层面的差异如舍入模式、中间精度不同硬件平台x86 CPU、ARM、GPU、DSP上的浮点运算结果可能存在微小差异。对于视频编解码这类需要严格比特级一致性的应用这种差异是不可接受的。整数运算的优势整数加法和乘法在所有支持的标准整数宽度的平台上都是完全确定的。相同的整数输入和运算序列无论在什么硬件上执行都会产生完全相同的结果。NNVC 中使用 SADLSoftware Automatic Differentiation Library进行模型推理集成。本文通过将网络转化为整数运算版本确保在 SADL 框架下的推理结果在不同平台上完全一致。七、与前序工作的关系本文是同一研究团队的系列工作。前序论文“Low Operation Point In-Loop Filter for VVC Based on Over-Parameterized Training and Variable Channel Configurations”IEEE 11520204已经提出了过参数化训练和可变通道配置的基本思路。本文在前序工作基础上的关键推进包括维度前序工作11520204本文11562829亮度分支使用过参数化 BBB使用 TwinBlock 替代色度分支使用可变通道 BBB使用 1×5/5×1 深度卷积 可变通道基准锚点VTM-11.0_NNVC-11.0NNVC-14.0复杂度16.81 kMAC/pixel16.56 kMAC/pixel整数运算未明确强调明确以整数运算为核心目标跨平台未突出跨平台一致性是核心贡献从 NNVC-11.0 到 NNVC-14.0 的升级意味着基准本身已经更强在此基础上的增量提升更具挑战性。同时复杂度从 16.81 进一步降至 16.56 kMAC/pixel展示了更优的效率。八、讨论与批判性分析8.1 优势总结降低复杂度的同时提升性能打破了性能-复杂度的常规正相关关系通过精巧的网络设计实现了帕累托前沿的整体推进。整数运算保证跨平台一致性这是走向实际部署的关键一步。视频编码标准要求编解码器在不同实现间保持比特级兼容整数运算是实现这一目标的必要条件。色度增益显著U 分量在两种配置下均有 0.5% 的提升对整体视觉体验有可感知的改善。与前序工作的连续性不是推翻重来而是在已有框架上的渐进式改进有利于技术积累和实际集成。8.2 局限与改进空间亮度增益有限Y 分量仅 -0.05%AI和 -0.13%RA相比 LOP6 本身 8% 的增益增量较为微小。这说明在亮度分支上的改进已接近瓶颈。V 分量在 RA 下回退0.23% 的回退表明 U/V 分量的资源分配可能不够均衡。未来可考虑自适应的 U/V 通道配置策略。实验配置有限仅报告了 AI 和 RA 两种配置缺少 Low-DelayLD配置的结果。LD 配置对实时通信场景非常重要其表现有待验证。缺乏主观质量评估BD-rate 是客观指标但视频编码的最终评价标准是主观视觉质量。论文未提供主观质量对比如 MOS 评分无法判断这些 BD-rate 增益在主观感知上的显著性。复杂度降低幅度有限从 16.60 到 16.56 kMAC/pixel仅降低了 0.04 kMAC/pixel约 0.24%。虽然方向正确但绝对降幅较小对实际部署的功耗影响可能有限。8.3 未来方向基于本文的技术路线和局限可以预见以下发展方向跨分量信息利用CCLOPIEEE 10992339已经探索了将亮度深度特征用于色度滤波的方案本文的 TwinBlock 结构可以与跨分量增强结合进一步提升色度性能。Transformer 引入ConvTransNetIEEE 10623475展示了将 CNN 和 Transformer 结合可以在环路滤波中同时捕获局部和全局特征。但 Transformer 的复杂度约 1000 kMAC/pixel远超 LOP 的约 16 kMAC/pixel。如何在 LOP 的复杂度约束下引入轻量级注意力机制是一个有价值的研究方向。自适应模型选择根据视频内容复杂度动态选择不同复杂度的滤波模型在简单场景使用更轻量网络在复杂场景使用更强网络。NN-Inter 协同已有研究表明 LOP 与 NN-Inter基于神经网络的帧间预测存在性能重叠。如何设计互补的滤波和预测方案避免冗余增强是一个系统级优化问题。更大规模的复杂度降低当前 0.04 kMAC/pixel 的降低幅度有限。如果能在 VLOP 方向上进一步简化可能为超低功耗场景打开新的可能。九、总结本文提出了一种跨平台 LOP 环路滤波器通过四大技术创新——TwinBlock 亮度分支、1×5/5×1 深度卷积扩大感受野、过参数化训练解耦训练推理架构、可变通道配置丰富色度信息——在降低网络复杂度的同时提升了 VVC 的压缩效率。从更大的视角看这项工作是 NNVC 走向实际部署道路上的重要一步。神经网络视频编码要从实验室走向产品必须解决三个关键问题跨平台一致性、计算效率、编码增益。本文通过整数运算解决了第一个问题通过过参数化和重参数化在第二个和第三个问题之间取得了更优的平衡。当然0.05%~0.70% 的 BD-rate 增益在绝对值上并不惊艳但视频编码领域的技术进步本就是一个积跬步以至千里的过程——每一个百分点的提升都凝聚着对网络结构和训练策略的深入理解。随着 NNVC 标准化的推进这类将深度学习理论过参数化、重参数化与视频编码工程实践紧密结合的工作将继续推动神经网络视频编码从研究走向应用。参考文献与延伸阅读原始论文IEEE Xplore Document 11562829前序工作IEEE Xplore Document 11520204CCLOP跨分量增强IEEE Xplore Document 10992339ConvTransNetCNNTransformer 滤波IEEE Xplore Document 10623475RepVGG结构重参数化原始论文IEEE Xplore Document 9577516 / CVPR 2021NNVC 介绍JVET AHG11 相关提案VVC 环路滤波综述各技术博客与 CSDN 系列