首页 / 资讯中心 / 文章详情

神经编码不是“AI 调参数”:看懂下一代视频编码的本质变化

神经编码不是“AI 调参数”:看懂下一代视频编码的本质变化 ★ FEATURED ARTICLE
过去三十多年视频编码技术一直沿着一条非常清晰的路线发展从 MPEG-2、H.264到 H.265/HEVC再到更新一代的视频编码技术核心目标始终没有改变——用尽可能少的数据描述尽可能接近原始画面的视觉信息。今天AI 开始进入视频编码领域“神经编码”“学习式编码”“Neural Codec”等概念越来越多。但很多人第一次接触这些技术时会自然地认为所谓神经编码是不是就是让 AI 帮 H.265 调调参数、优化一下码率其实并不是。真正意义上的神经编码改变的不是某一个编码参数而是在重新思考一个更底层的问题视频应该怎样被表示、预测和压缩这套规则一定要完全由人来设计吗传统编码的基本方法是由视频编码专家设计预测、变换、量化、熵编码等算法再让编码器在这些既定工具中寻找最优组合神经编码则尝试把其中越来越多的过程交给神经网络学习让模型从大量数据中自己寻找更有效的视频表示方式。这才是两者真正的分水岭。一、传统视频编码到底在压缩什么理解神经编码之前首先要理解传统视频编码为什么能够把庞大的原始视频压缩几十倍甚至上百倍。一帧未经压缩的高清视频本质上是一大片像素数据。如果把 1920×1080、30fps 的原始 YUV 视频直接通过网络传输带宽消耗会非常巨大。但真实世界的视频有一个非常重要的特点大量信息其实是重复的。例如一个固定摄像头拍摄会议室墙壁几十秒可能都没有变化人物虽然在运动但身体的大部分区域只是从一个位置移动到了另一个位置同一帧中相邻像素往往也非常接近。于是编码器没有必要每一帧都重新告诉解码器“这里是什么颜色”。传统视频编码实际上一直在做三件事情预测、计算差异、只编码那些无法预测的信息。帧内预测利用当前画面内部像素之间的相关性帧间预测则利用前后视频帧之间的时间相关性。编码器找到一个比较接近当前图像的预测结果然后只记录预测结果和真实图像之间的差异也就是残差。残差再经过变换、量化和熵编码最终形成我们看到的 H.264、H.265 等码流。所以从工程角度看H.264、H.265 并不是简单地“把图片压缩小一点”而是在不断回答一个问题哪些信息可以预测哪些信息必须真正发送几十年来视频编码技术的大部分进步都来自预测越来越准确、表示残差越来越高效、熵编码越来越接近信息理论极限。二、神经编码真正改变的是“谁来设计压缩方法”如果只看最终目的传统编码和神经编码其实没有区别都希望在更低码率下获得更好的画质。真正不同的是实现方法。传统视频编码更像是一套由专家设计的大型工具箱。编码标准会规定可以怎样划分图像块可以有哪些预测模式可以怎样进行运动补偿可以采用哪些变换方式如何量化如何组织码流。编码器所做的事情是在这些已经定义好的工具里面寻找一个尽可能优秀的组合。神经编码进一步改变了这个过程。它开始尝试让神经网络自己学习一幅图像或者一段视频中到底哪些信息最重要哪些信息可以被预测哪些特征应该保留下来以及这些信息怎样组织才能用更少的 bit 表达。典型的端到端学习式图像或视频编码可以理解成这样一条链路原始图像或视频 → 神经编码网络 → 潜在特征表示 → 量化与熵编码 → 码流。解码端则完成相反过程码流 → 特征恢复 → 神经解码网络 → 重建图像或视频。这里最重要的概念叫做Latent Representation也就是潜在特征表示。传统 Codec 中我们习惯看到运动矢量、预测模式、变换系数、残差等非常明确的编码元素而在神经编码中网络可以通过训练形成自己的一套内部特征表示。工程师不再需要完全人工规定“视频必须按照什么数学方式描述”模型开始参与决定“什么样的信息表达方式更高效”。因此神经编码最本质的变化并不是“编码器用了 AI”而是视频表示方法本身开始从人工设计走向数据驱动学习。三、传统编码与神经编码差别究竟在哪里如果把两种路线放在一起比较会更加直观。对比维度传统视频编码神经/学习式编码核心设计方式专家设计编码工具模型从数据中学习视频表示预测、运动矢量、残差、变换系数Learned Latent Features图像变换人工设计数学变换神经网络学习非线性变换时间预测运动估计、运动补偿可学习时间特征和上下文概率建模人工设计概率模型Learned Entropy Model优化方式搜索已有编码模式训练网络参数可解释性较强相对较弱硬件生态CPU/GPU/DSP/ASIC 非常成熟GPU/NPU 等 AI 算力更加重要部署成熟度已形成完整产业链仍处于快速工程化阶段这里最关键的区别仍然不是压缩率而是“设计空间发生了变化”。传统编码是人类首先设计好道路编码器负责寻找走哪条路最快神经编码则开始尝试让模型自己参与修路甚至决定哪些路根本没有必要存在。但两者背后的理论并没有完全割裂。不管采用哪一种方式编码系统最终都必须在两个目标之间权衡一边是“码率要尽量低”另一边是“画质损失不能太大”。传统编码一直称之为率失真优化神经编码同样需要解决这个问题只是优化对象从传统编码参数进一步扩展到了整个网络模型。所以神经编码并不是推翻几十年的视频编码理论而是换了一种寻找最优解的方法。四、今天所谓的“AI 编码”其实至少有三条路线目前市场上很多产品都会提到“AI 编码”但这些技术之间差别非常大。如果不加区分很容易把完全不同的东西混为一谈。第一类是AI 辅助传统编码。底层码流依然是 H.264、H.265 等传统标准AI 主要负责场景识别、内容复杂度分析、码率控制、ROI 判断、QP 决策、降噪、超分辨率或者画质增强。它的最大优势是不会破坏现有产业生态播放器、硬件解码器、CDN 和现有音视频系统基本都可以继续使用因此也是目前最容易实现大规模商业落地的一条路线。第二类是传统 Codec 与 Neural Network 的混合架构。传统编码框架仍然存在但把某些模块逐渐换成学习式算法例如使用神经网络进行预测、滤波、概率估计或者部分运动建模。这条路线非常值得关注因为它能够利用传统 Codec 成熟的工程体系同时逐渐吸收 AI 算法的优势。第三类才是真正意义上的端到端 Learned Codec。从输入图像或视频到生成压缩表示再到恢复图像主要过程都由训练得到的网络完成。近几年学习式图像压缩已经率先走向标准化而学习式视频编码也在持续向实时化、硬件化和标准化方向演进。因此未来的视频编码很可能不是“传统 Codec 和 Neural Codec 二选一”而会形成相当长时间的混合演进过程。五、为什么神经编码有可能突破传统编码的效率传统视频编码已经高度成熟但它始终面临一个限制算法必须能够被工程师理解、标准化并最终做成芯片。很多编码模块因此必须具有相对明确的数学结构。而神经网络可以拟合非常复杂的非线性关系能够在大量视频数据中自动寻找人类很难显式设计出来的统计规律。例如对于传统编码器而言它看到的是像素、块、运动矢量和残差而一个训练充分的神经网络有可能进一步学习到纹理、轮廓、对象结构以及更加复杂的时间相关性。神经编码的第二个优势来自概率建模。所有压缩算法本质上都在利用“某些信息出现概率高某些信息出现概率低”这个原则。如果能够更加准确地预测某个符号或者潜在特征出现的概率就有机会用更少的 bit 表达它。神经网络非常擅长复杂概率分布建模因此 Learned Entropy Model 已经成为学习式压缩中的核心技术之一。第三个优势来自时域信息建模。传统视频编码非常依赖运动估计和运动补偿而学习式视频编码可以把历史帧、隐空间特征和上下文共同纳入模型让网络自己学习哪些时间信息真正值得保留。但这并不意味着神经编码已经全面优于传统编码。对于实时音视频系统来说压缩率从来不是唯一指标。真正能够进入产业还需要同时考虑编码速度、解码速度、功耗、显存占用、NPU/GPU 性能、端到端延迟以及不同硬件平台的一致性。Codec 从来不是“谁压得最小谁就赢”而是压缩率、复杂度、延迟、功耗和生态共同决定最终结果。六、神经编码真正难的地方可能并不是算法如果只看论文很容易产生一种感觉只要 BD-Rate 再下降一些神经 Codec 很快就可以取代 H.265。实际工程远没有这么简单。传统视频编码经过几十年发展已经拥有非常成熟的硬件生态。手机 SoC、摄像机芯片、GPU、DSP、电视芯片中都存在成熟的视频硬件编解码单元。一个 H.265 解码器可以用极低功耗持续解码高清视频这是纯软件神经网络很难轻易替代的。神经 Codec 则会引入更多新的工程变量例如模型大小、模型版本、算子兼容、NPU 精度、量化方式以及不同 AI 芯片上的推理差异。过去 Codec 关注的是“Bitstream 是否符合标准”未来可能还需要关注“这个设备有没有对应模型”“这个 NPU 能否运行这些算子”“模型版本是否兼容”。这实际上会把 Codec Compatibility 从传统意义上的支持 H.264 / H.265 哪些 Profile。进一步扩展成Codec Model Hardware Capability。另外还有一个非常重要的问题生成式能力不一定适合所有视频。对于娱乐视频只要重建后的草地“看起来像草地”用户可能就可以接受但在安防监控、工业检测、执法记录或者机器视觉中我们关心的是原始画面中到底有没有某个细节。如果神经网络为了主观视觉效果生成了原视频不存在的纹理那么即使看起来更漂亮也可能破坏信息真实性。因此未来视频质量评价很可能越来越明显地分成两个方向给人看的画质关注主观感受给机器看的画质关注特征和任务准确率。这也是神经编码时代一个非常重要的变化。七、最值得关注的趋势视频正在从“给人看”变成“给人和机器一起看”传统视频产业默认了一条非常经典的数据链路摄像头 → 视频编码 → 网络传输 → 视频解码 → 人观看。但在今天的无人机、机器人、工业视觉、智能摄像机和具身智能系统中很多视频数据最终首先面对的并不是人而是 AI。传统的处理过程通常是Camera → H.264/H.265 → 网络 → 解码成 YUV/RGB → AI 再提取特征。这里存在一个非常值得思考的问题既然最终消费者本来就是 AI那么我们是否一定需要先把所有视觉信息恢复成完整视频再让神经网络重新提取一次特征未来完全可能出现另外一种链路Camera → Neural Feature → Feature Compression → Network → Cloud AI。甚至同时存在两条数据一条给人观看另一条直接给机器理解。这也是 Video Coding for Machines、Feature Coding for Machines 等方向越来越受关注的原因。一旦走到这一步视频编码讨论的就不再只是“H.265 后面是什么 Codec”而是在重新思考我们究竟应该传输像素还是应该传输视觉信息本身对于机器人、无人机、具身智能和工业视觉而言这个问题的重要性甚至可能超过单纯提升 10% 或 20% 的压缩效率。八、从 SmartMediaKit 看神经编码真正的优势是媒体架构足够开放从大牛直播 SDKSmartMediaKit的角度看面对神经编码最重要的并不是现在立即宣布支持某一种实验性的 Neural Codec而是现有音视频架构能不能容纳未来的新 Codec。SmartMediaKit 长期围绕实时音视频构建的并不仅仅是一套 H.264/H.265 解码器而是一条完整的 Media Pipeline包括采集、编码、解码、网络传输、时间戳处理、音视频同步、软硬件解码、原始视频数据回调、渲染、多实例以及不同协议的适配。这种架构对于未来 Neural Codec 有一个非常明显的先天优势Codec 并不是整个音视频系统本身。如果未来增加一种新的 Neural Codec理想情况下变化的应该主要集中在 Codec Layer而不是重新设计网络 IO、线程模型、时间戳体系、音视频同步、渲染、连接管理和业务层 API。例如未来完全可能出现下面这样的结构Camera / External Video Input↓Pixel Format LayerYUV / NV12 / RGB↓Codec Abstraction Layer↓Traditional Codec Backend / Neural Codec Backend↓Encoded Media↓Transport / Recording / Playback / ProcessingSmartMediaKit 现有的原始视频输入、解码后 YUV/RGB 数据回调、软硬件解码路径以及外部媒体数据接口本质上已经具备了一定程度的 Codec-Neutral 思路。未来如果 Neural Codec 真正进入移动端和嵌入式平台更合理的方式也是将其作为新的 Codec Backend 接入而不是推翻现有媒体架构。当然这里必须明确区分两个概念“架构能够较好地兼容 Neural Codec”并不等于“SmartMediaKit 当前已经支持某个 Neural Codec”。对于一个基础音视频 SDK 来说保持这样的技术边界反而比追逐短期概念更加重要。九、神经编码真正带来的变化是从“编码像素”走向“编码信息”如果只从 Codec 产品命名来看很容易把视频编码历史理解成H.264 → H.265 → 下一代 Codec。但如果把时间尺度拉长会看到另一条更加重要的技术主线。过去的视频编码一直在解决怎样用更少的数据恢复像素。未来的视频编码可能越来越多地需要回答这些数据到底是给谁使用的如果是给人观看就优化视觉质量如果是给 AI 使用就可能更加关注目标、轮廓、深度、运动和高层语义特征如果既给人又给机器就需要建立能够同时服务两种消费者的媒体表示方式。因此神经编码最大的意义可能最终并不是把 H.265 的 2Mbps 再压到 1.5Mbps。它真正打开的是一个更大的技术空间传统视频编码关注 Pixel神经编码开始关注 Feature机器视觉编码进一步关注 Task未来媒体基础设施则可能同时处理Pixel Feature Metadata AI Result。这对于 SmartMediaKit 这样的底层音视频框架尤其重要。未来真正具有生命力的媒体 SDK不应该只押注某一种 Codec而应该把采集、Pixel Format、Codec、Transport、Processing、AI 和 Rendering 之间的边界设计清楚。今天可以连接成熟的传统硬件 Codec未来可以加入 AI 辅助编码、Hybrid Neural Codec甚至进一步处理机器视觉 Feature。技术变化越快基础设施越需要保持稳定。这也是我们看待神经编码最值得坚持的一个工程观点未来发生变化的可能是 Codec甚至可能是整个视觉表示方式但优秀的媒体基础设施应该能够容纳这种变化而不是被某一种编码技术绑死。从这个角度看神经编码真正推动的并不只是一次新的压缩率竞赛。它正在推动视频行业从“怎样编码像素”逐渐走向“怎样编码真正有价值的视觉信息”。而这很可能才是下一代视频技术真正值得关注的方向。 CSDN官方博客音视频牛哥-CSDN博客
阅读完成 · 觉得有帮助?
咨询建站