神经编码与 H.266,到底谁更先进?下一代视频 Codec 的真正竞争

0 阅读13分钟

视频编码发展到今天,一个越来越有意思的问题摆在行业面前:一边是 H.266/VVC,把传统视频编码几十年的技术积累推到了一个新的高度;另一边是快速发展的神经编码,希望利用深度学习重新定义图像和视频的压缩方式。于是很多人会自然地问:神经编码和 H.266,到底谁更先进?

如果只看某些实验室测试,这个问题似乎可以通过一张 BD-Rate 曲线回答;但真正做过播放器、推流、实时通信、监控、编码器或者媒体服务器的人会知道,Codec 的“先进”远不止压缩率一个指标。一个真正能够进入产业的视频编码体系,还要同时回答压缩效率、编码复杂度、解码算力、实时延迟、功耗、硬件支持、跨平台互操作、Bitstream 稳定性以及长期生态等问题。

所以讨论 H.266 和神经编码,真正有价值的不是简单判断“谁赢了”,而是理解:它们分别代表了哪一种视频编码能力,又将把下一代音视频系统带向哪里。


一、H.266 的真正意义,不只是“比 H.265 再省一点码率”

H.266,又称 VVC(Versatile Video Coding),是 ITU-T 和 ISO/IEC 联合标准化的视频编码技术。它的目标并不仅仅是进一步降低码率,还要覆盖 4K/8K、HDR/WCG、沉浸式视频等更加复杂的视频应用。从技术体系上看,H.266 仍然延续经典 Hybrid Video Coding 思想,即预测、残差、变换、量化和熵编码,只是把每一个环节都做得更加精细。

H.266 的块划分更加灵活,帧内预测模式更加丰富,帧间预测拥有更复杂的运动模型,同时引入更精细的变换、滤波和重建优化手段。可以把它理解成一个规模巨大的“视频编码工具箱”:面对同一块画面,编码器拥有大量候选处理方法,需要不断判断块怎样划分、使用什么预测、参考哪一帧、采用什么运动模型,以及怎样在码率和画质之间取得更好的平衡。

因此 H.266 的技术路线其实非常清晰:让人工设计的编码工具越来越丰富,让编码器拥有更大的优化空间。 这也是传统视频编码过去几十年持续成功的基本方法。H.266 的先进,本质上是一种高度工程化、精细化的视频编码能力,而不仅仅是某个“比 H.265 节省多少码率”的数字。


二、神经编码真正挑战的,是整个“工具箱思维”

神经编码最容易被误解的地方,是把它简单理解成类似“H.267”的下一代 Codec。实际上,它挑战的是一个更加底层的问题:视频应该怎样被表示,这套方法是不是一定要主要由人设计?

H.266 再复杂,其编码空间仍然主要由视频编码专家提前定义。标准规定允许哪些预测方式、变换方式、运动模型和语法结构,Encoder 再在这个空间中寻找较优方案。而典型的神经编码系统则采用另外一种思路:原始视频经过 Neural Encoder,被转换成更加紧凑的 Latent Representation,再经过量化和熵编码形成码流;Decoder 则根据这些潜在变量重建视频。

区别就在这里。传统 Codec 更像是“专家先设计工具,编码器负责选工具”;神经 Codec 则试图让模型通过数据训练,自行学习什么样的内部表示更加适合压缩。换句话说,传统编码是在人工设计好的编码空间里寻找最优解,神经编码则进一步让编码空间本身参与学习。

所以神经编码真正具有突破性的地方,不是简单增加一个 AI 模块,而是试图改变过去几十年视频编码最核心的设计方式:从“人工设计表示方法”,逐渐向“数据驱动学习表示方法”迁移。


三、只比较压缩率,很容易误判谁“更先进”

视频编码论文通常喜欢比较 BD-Rate,这当然有价值,因为 Codec 最基本的目标就是在相同质量下使用更少的 bit。但真正进入产品后,评价函数会迅速变复杂:压缩率、编码速度、解码速度、功耗、内存带宽、延迟、硬件支持、互操作性和稳定性必须一起考虑。

假设某种 Neural Codec 在实验条件下能比 H.266 再节省一部分码率,但必须依赖高性能 GPU 才能实时解码,那么对于手机、摄像机或者嵌入式设备来说,它未必更先进。反过来,H.266 标准虽然提供了很大的压缩潜力,但商业 Encoder 为了保证 30fps 或 60fps 实时编码,也不可能穷举所有候选模式,通常需要大量快速搜索和提前终止策略。

两类技术的复杂度来源实际上并不相同。H.266 主要面临的是 Mode Decision Complexity,也就是大量编码模式和参数之间的搜索;神经编码更多面对 Neural Inference Complexity,也就是模型推理、Tensor 计算以及内存访问所带来的开销。

路线不同,最终却都会撞到实时音视频熟悉的几个硬约束:CPU、GPU、NPU、内存带宽、功耗和端到端延迟。Codec 最终不是“谁压得最小谁赢”,而是谁能在现实工程约束下提供更好的整体系统效率。


四、H.266 真正强大的地方,是标准化、确定性和完整的产业方法论

一个成熟 Codec 最重要的价值之一,其实是互操作性。今天一个厂商生成 H.264 码流,另外一家厂商开发的硬件 Decoder 通常也能够正确播放,这背后依靠的是一整套严格的标准体系,而不仅仅是一套压缩算法。

H.266 同样如此。标准会明确 Bitstream 如何组织、参数集如何表达、随机访问怎样实现、参考图像如何管理,以及 Profile、Tier、Level 应该怎样约束。对于 Decoder 来说,同一个合法 Bitstream 应当拥有明确且可重复的解释方式,这就是视频标准非常重要的 Deterministic Decoding 能力。

Neural Codec 如果进入大规模产业化,则会多出传统 Codec 很少面对的一个变量:Model 本身可能成为 Codec 的一部分。 这会引出模型版本、模型分发、算子支持、NPU 差异、推理精度、量化格式以及旧设备兼容等一系列问题。

真正困难的甚至不是“神经网络能不能重建视频”,而是“十亿台不同硬件的设备能不能按照一致规则重建视频”。从这个角度看,H.266 的成熟并不只体现在压缩效率,而是体现在一套工业 Codec 所需要的完整规则体系、实现边界和互操作能力。


五、神经编码打开了一个 H.266 很难触及的新空间:编码对象可以改变

传统视频编码长期面对的核心对象仍然是 Pixel。无论 H.264、H.265 还是 H.266,本质目标都是高效描述图像,并在 Decoder 中恢复视频。但随着机器人、无人机、机器视觉、自动驾驶和具身智能的发展,越来越多视频并不是首先给人看的,而是先交给 AI 理解。

传统的数据链路通常是:Camera → Video Encoder → Network → Video Decoder → YUV/RGB → AI。编码器先把视频压缩成码流,解码器再恢复成像素,AI 最后又从像素中重新提取 Feature。既然最终消费者就是机器,那么未来就可能出现另外一种路径:Camera → Feature Extraction → Feature Compression → Network → AI。

更进一步,同一个摄像头的数据甚至可以形成两条路径:一条 Video Representation 给人观看,另一条 Feature Representation 给 AI 使用。此时编码目标就不再只有 Human Visual Quality,还可能加入 Machine Task Accuracy。

这意味着未来的媒体表示有可能从单纯的 Pixel,逐渐扩展为 Pixel + Feature + Metadata + Semantic Information。所以 Neural Media Coding 真正具有长期价值的地方,不只是“比 H.266 再降低多少码率”,而是它有机会扩大 Codec 所处理的信息类型。H.266 更擅长回答“怎样更高效地编码视频”,而下一代 Neural Media 技术甚至开始追问:究竟什么信息才应该被编码和传输?


六、真正的下一代 Codec,很可能不是 H.266 与神经编码二选一

如果把未来想象成 H.266 和 Neural Codec 两个阵营竞争,可能已经过于简单。下一代视频编码更可能采用混合路线:成熟且高效的传统模块继续保留,而神经网络被用于传统算法明显受限、又特别适合学习的问题。

例如未来 Codec 完全可能同时包含传统 Block-based Coding、Neural Prediction、Learned Filter、Learned Entropy Model、标准化 Bitstream 设计以及 AI Hardware Acceleration。一部分能力继续依赖传统信号处理,因为几十年的工程优化已经让它们拥有非常高的执行效率;另一部分则通过 Neural Network 学习更加复杂的非线性关系。

这种 Hybrid Codec 不是折中,反而非常符合成熟工程体系的演化规律。真正进入产业的技术往往并不会突然把过去几十年的基础全部推翻,而是在已有架构中不断吸收更有效的新技术,直到两者的边界越来越模糊。

所以未来真正值得关注的问题,不是“传统 Codec 还是 Neural Codec”,而是:下一代视频编码器中,到底哪些部分还应该由人设计,哪些部分更适合交给模型学习。


七、对实时音视频而言,接入新 Codec 远远不只是“加一个解码器”

从 Codec 研究转向实时音视频工程,会看到完全不同的问题。假设明天出现一种非常优秀的新 Codec,在播放器中增加一个 Decode(frame) 只是整个接入工作的很小一部分。

首先要处理 Codec Configuration,包括 Profile、Level、Resolution、Pixel Format、Bit Depth 以及 Decoder 初始化数据;然后要明确 Access Unit、关键帧和随机访问语义,确定什么时候可以开始播放、什么时候需要 Flush Decoder、参数变化后是否需要重新初始化。

接下来是时间戳和同步。存在 B Frame 或 Reorder 时,PTS、DTS 怎样处理?视频和音频怎样保持统一时间轴?网络传输时还要定义 Codec 怎样放入 RTP 或其他实时传输协议,大帧怎样切片,丢包后哪些数据必须重新获取或等待下一关键帧。

再往后还包括录像封装、截图、GPU Render、硬件 Decoder、颜色空间、HDR、异常恢复以及不同平台的能力协商。如果是 Neural Codec,还会额外增加 Model Capability、NPU Capability、模型加载、模型版本、Inference Backend、Warm-up 和 Fallback 等问题。

所以一个新 Codec 真正进入实时系统,需要经过的不是一层,而是一整条链路:

Bitstream → Parser / Framing → Codec Configuration → Decoder Backend → Pixel Format → AV Sync → Rendering / Processing

编码端则对应:

Raw Video → Pixel Format → Encoder Backend → Encoded Frame → Packetization → Transport

用户真正需要的从来不只是一个 decoder.dll,而是一整套能够稳定运行的 Media Pipeline。


八、SmartMediaKit 的优势,是已经建立了适合新 Codec 接入的媒体边界

从大牛直播 SDK(SmartMediaKit)的技术体系看,面对 H.266、Neural Codec 以及未来 Beyond-VVC 类编码技术,真正重要的不是提前押注某一种 Codec,而是确保整个音视频框架拥有足够清晰的模块边界。

一个健康的实时媒体架构,不应该把 Protocol、Codec、Decoder 和 Renderer 全部绑定在一起,而应该形成类似这样的链路:

Source → Demux / Depacketizer → Media Frame → Codec → Raw Frame → Processing → Renderer

推送端则对应:

Capture / External Frame → Raw Video → Codec → Encoded Frame → Packetizer → Transport

SmartMediaKit 长期积累的一项重要基础,就是 Raw Media 和 Encoded Media 都能够作为媒体管线中的重要数据形态。解码后的 YUV/RGB 数据可以回调给上层,外部视频数据可以进入媒体处理链路,不同平台可以根据实际能力选择软解或硬解,渲染、网络传输和 Codec 也并不是完全耦合在一个模块中。

这种架构在 H.264/H.265 时代更多体现为 SDK 的灵活性,但到了新一代 Codec 时代,它会变成非常重要的兼容基础。例如未来完全可以形成:

Camera → NV12 → New Codec Encoder Backend → New Bitstream

或者:

Network → New Bitstream → New Codec Decoder Backend → NV12 / RGB → SmartMediaKit Render

真正需要替换的是 Codec Backend,而采集、时间戳、音视频同步、网络状态管理、缓冲、渲染、数据回调和生命周期等核心能力都可以继续复用。

所以 SmartMediaKit 面对新 Codec 更值得加强的并不是简单增加一个新的 Codec 枚举,而是进一步完善 Codec Abstraction、Media Capability 和 Platform Acceleration。未来 Decoder Capability 可能需要同时描述 Codec、Profile、Bit Depth、Pixel Format、最大分辨率、Software/Hardware Backend、GPU/NPU Capability、Latency Mode,甚至 Model ID 和 Model Version。

这才是 SmartMediaKit 面向下一代编解码体系真正有价值的技术优势:不是提前宣布支持某一种未来 Codec,而是让新 Codec 能够进入已有媒体管线,而不需要重构整个实时音视频系统。


九、神经编码与 H.266,到底谁更先进?

回到最初的问题,如果“先进”指的是成熟国际标准、确定性 Bitstream、跨厂商互操作、明确的软硬件实现路径和可持续的工业生态,那么现阶段 H.266 显然更加完整;如果“先进”指的是能否突破大量人工编码工具的限制,让视频表示方式本身通过数据学习,那么神经编码代表的是更加激进的技术路线。

因此这两者其实代表了不同层面的先进性。H.266 更接近 Codec Engineering 的高度成熟,神经编码则更接近 Representation Learning 对编码方法的重新设计。视频又比单幅图像复杂得多,它不仅包含空间信息,还必须处理时间预测、随机访问、帧重排、状态传播、错误恢复和持续实时处理,所以神经视频编码真正需要跨越的门槛,不只是从算法上获得更好的 Rate-Distortion,而是从 Model 真正成长为 Codec。

未来真正有竞争力的视频编码体系,很可能同时拥有传统 Codec 的确定性、神经网络的表示学习能力、专用硬件的能效、实时媒体系统的低延迟,以及机器视觉需要的 Feature 表达。到了那个阶段,讨论的已经不再是“H.266 与 Neural Codec 谁赢”,而是:下一代视频编码体系,应该怎样重新分配人工设计与机器学习之间的边界。

对于 SmartMediaKit 这样的实时音视频基础设施来说,也不需要押注这个问题的某一个答案。真正重要的是让采集、Raw Media、Codec、Transport、Processing、AI 和 Rendering 之间保持清晰边界,使新的编码体系能够像新的 Backend 一样被接入,而不是每出现一代 Codec,就重新设计一次播放器、推流器和整个媒体系统。

Codec 会持续变化,但一个好的媒体架构,应当比 Codec 活得更久。