当 Codec 开始“学习”:神经视频编码背后的技术逻辑与工程边界

25 阅读21分钟

过去三十年,视频编码技术的发展基本遵循一条非常清晰的路线:寻找空间冗余、时间冗余和统计冗余,然后用越来越复杂的预测、变换、量化与熵编码工具,把这些冗余一点点“挤掉”。

从 H.264/AVC 到 H.265/HEVC,再到 AV1、H.266/VVC,这条路线已经走得非常深。块划分越来越灵活,帧内预测模式越来越丰富,运动估计越来越精细,环路滤波越来越复杂,编码器为了节省几个百分点的码率,需要付出的计算量也越来越高。

神经网络的出现,则提供了另一条思路:能否不再完全依赖人工设计的预测模式和变换工具,而让神经网络自己学习“什么信息值得保留、什么信息可以舍弃、什么样的表示最容易被压缩”?

这就是神经编码、学习式视频压缩以及更广义的 Neural Codec 背后的核心思想。

值得注意的是,截至 2026 年,这已经不只是实验室概念。JPEG AI 已经成为第一个基于端到端学习方法的国际图像编码标准;与此同时,MPEG 仍在持续进行 Neural Network-based Video Compression(NNVC)的探索,覆盖传统混合编码结构增强以及端到端神经视频编码两条路线。

但如果因此得出“H.264、H.265 很快就会被 AI Codec 替代”的结论,又过于简单。

真正值得音视频行业关注的,并不是谁替代谁,而是:

未来的视频系统正在从“单一 Codec 竞争”,进入“传统编码、神经编码、AI增强、机器视觉表示与实时传输协同工作”的阶段。

而这恰恰也是 SmartMediaKit 这类底层实时音视频 SDK 更值得关注的方向。


一、传统视频编码,本质上是在用工程规则逼近视频信号的统计规律

无论 H.264、H.265 还是 H.266,其基本思想并没有发生根本变化。

一帧图像内部,大面积区域往往具有较强的空间相关性;连续视频帧之间,大多数像素的位置和内容变化有限。因此没有必要把每一个像素都重新传输,只需要描述“预测结果”和“真实结果之间的差异”。

典型视频编码过程可以抽象为:

原始图像 → 帧内/帧间预测 → 残差 → 变换 → 量化 → 熵编码 → Bitstream

解码端则执行相反过程:

Bitstream → 熵解码 → 反量化 → 反变换 → 预测重建 → 环路滤波 → 图像输出

H.265、VVC 等现代 Codec 的真正复杂之处,并不是这个框架,而是在这个框架中不断增加更加精细的决策。

比如一个 64×64 或更大的图像区域到底应该怎样划分,一个运动区域应该使用平移运动模型还是更复杂的运动模型,一块纹理应该采用哪个预测方向,变换块应该多大,量化参数应该是多少,都需要编码器通过大量搜索寻找更优解。

VVC 继续沿着这条路线把传统混合编码推到了很高的复杂度,例如更加灵活的块划分、更复杂的帧内预测、仿射运动、DMVR、BDOF、ALF 等工具。ITU-T 在 2026 年发布的 H.266 第四版仍在继续扩展 VVC 能力。

所以传统 Codec 的特点可以概括为:

算法规则是人设计的,编码参数由编码器搜索,最终 Bitstream 的语法和解码行为由标准严格定义。

这也是它最大的工程优势。

只要 Bitstream 符合标准,无论编码器来自手机、摄像机、FFmpeg、海康、大华还是其他设备,一个符合标准的 H.264/H.265 解码器原则上都能够进行解码。

这种高度确定性的互操作能力,是几十年产业化积累形成的巨大资产。


二、神经编码真正改变的,不是“有没有压缩”,而是谁来设计压缩空间

神经编码并不是简单地在 H.265 前面加一个 AI 模型。

端到端学习式编码更重要的变化,在于它不再要求视频必须按照人类预先设计好的 DCT、固定预测模式、运动矢量和残差表示方式存在,而是允许神经网络自己学习一个适合压缩的潜在空间,即 Latent Representation。

一个典型的学习式图像编码结构可以抽象为:

原始图像 X → Analysis Network → Latent Y → Quantization → Entropy Coding

解码端:

Bitstream → Entropy Decoding → Latent Ŷ → Synthesis Network → 重建图像 X̂

真正负责“变换”的,不再一定是传统 DCT/DST,而可能是一组卷积网络、Transformer、Attention 或其他神经网络结构。

训练过程中通常优化类似下面的目标:

L = R + λD

其中 R 表示码率,D 表示失真,λ 控制码率和质量之间的权衡。

这与传统编码器中的 Rate-Distortion Optimization 思想并不陌生,但二者最大的区别是:传统 Codec 在一个固定语法和固定工具集合中寻找最优参数,而神经 Codec 可以直接学习“表示空间本身”。

进一步还可以加入感知损失:

L = R + λD + αP

甚至加入机器视觉任务损失:

L = R + λD + αP + βT

这样,编码目标就不再局限于 PSNR、SSIM 或肉眼观看,还可以针对目标检测、分割、跟踪等任务进行优化。

因此,从更深层次理解:

传统编码主要是在压缩像素之间的冗余,而神经编码正在尝试学习视觉信息本身的低维表示。

这是两条技术路线最根本的区别。


三、视频比图像困难得多:神经视频编码真正的战场在“时间”

如果只是单帧图像,神经编码已经相对容易理解。但视频最大的压缩收益恰恰来自时间相关性。

传统视频编码通过参考帧和运动补偿解决这个问题。例如当前帧中的汽车向右移动了 10 个像素,就没有必要重新编码整辆汽车,只需要发送运动矢量和少量预测残差。

神经视频编码同样必须解决这个问题,只是实现方式更加自由。

一种路线仍然非常类似传统 Codec:

Previous Frame → Motion Estimation → Motion Compression → Motion Compensation → Residual Compression

只不过运动估计、运动补偿、残差表示和熵模型都由神经网络实现。

另一种路线则不再执着于“像素运动矢量”,而是在 Feature Space 或 Latent Space 中进行预测:

Frame → Feature → Temporal Context → Latent Prediction → Entropy Coding

这意味着系统压缩的可能已经不是“这个像素向右移动多少”,而是“当前视觉特征可以从之前的哪些特征预测出来”。

进一步结合 Transformer、Attention、Context Model 和 Recurrent State 后,编码器可以利用更长时间范围的上下文建立概率模型。

理论上,这给神经编码提供了很大的优化空间。

但它同样引出了神经视频 Codec 最难的工程问题之一:

状态。

如果解码器严重依赖前面多帧建立起来的神经状态,那么网络丢包、随机访问、Seek、切流、码率切换或者参考状态错误,都可能影响后续解码。

传统视频编码经过几十年的工程演化,已经形成 IDR、CRA、GOP、参考帧管理等成熟恢复机制。神经 Codec 如果真正进入实时通信,同样必须建立自己的 Random Access、Refresh、Error Recovery 和 State Reset 体系。

所以实验室里“平均码率下降多少”和真正用于实时直播,是两件完全不同的事情。


四、神经 Codec 的优势很明显,但不能只看压缩率

神经编码最大的吸引力当然是压缩效率。

传统 Codec 的大量模块本质上也是对视频统计规律的建模,只不过这些模型主要由专家设计。深度学习提供了从海量视频中自动学习复杂概率分布的能力,因此在一些数据集和工作点上,学习式压缩已经表现出非常有竞争力的 Rate-Distortion 性能。近年来的 Learned Video Compression 研究也已经从单纯模型设计,逐渐进入系统实现、硬件加速和标准化阶段。

但更重要的优势其实有三个。

第一是目标函数可编程。

传统 Codec 最终主要还是围绕视频重建质量设计,而神经网络可以根据不同业务目标重新训练。视频会议可能优先优化人脸和文字,机器人可能关注障碍物和目标轮廓,工业视觉可能更关注缺陷区域,遥感系统可能更加重视特定频段或目标。

第二是感知质量与像素误差开始分离。

传统 PSNR 指标衡量的是像素误差,但人眼并不是逐像素比较图像。神经网络可以更直接地优化 Perceptual Quality,在很低码率下生成视觉上更加自然的结果。

第三是编码和机器视觉开始融合。

视频未来并不一定都是给人看的。

摄像机采集出来的视频,越来越多会首先进入目标检测、跟踪、SLAM、VLM、机器人感知系统,而不是直接显示在屏幕上。

MPEG 目前正在推进 Video Coding for Machines,以及 Feature Coding for Machines。后者甚至直接研究神经网络中间 Feature Tensor 的压缩,使云边协同场景不必一定传输完整视频。

这实际上正在改变“视频编码”的定义:

过去是:

Camera → Video → Codec → Network → Video → Human

未来可能变成:

Camera → Neural Representation → Network → AI

或者:

Camera → Video + Feature → Network → Human + AI

甚至:

Camera → Edge AI → Feature/Metadata + Optional Video → Cloud

这对于具身智能、机器人、无人机、机器视觉、智慧交通和智能安防,意义可能比单纯节省 20% 或 30% 码率更大。


五、神经编码最大的短板,是算力,而真正的问题其实是“单位比特的能源成本”

很多神经 Codec 的论文会强调压缩率,但在工程产品中,我们还必须问另一个问题:

为了省下这些网络带宽,需要消耗多少计算资源?

H.264/H.265 今天最大的优势并不仅仅是成熟,而是拥有极其成熟的硬件生态。

手机 SoC、GPU、摄像机芯片、IPC、NVR、电视芯片中大量存在固定功能的视频编解码单元。硬件 H.265 解码可能只需要非常有限的功耗,就可以持续处理 1080P、4K 视频。

神经 Codec 即使理论计算量并非无法接受,只要大量算子仍然需要 GPU、NPU 或通用计算单元执行,其功耗、内存带宽、模型加载、Tensor 调度以及设备兼容性就会成为系统成本的一部分。

这也是为什么 AI Codec 的评估不能只有:

Mbps ↓

还应该同时观察:

FPS、Latency、TOPS、Memory、Memory Bandwidth、Power、Model Size。

最终真正有意义的指标甚至应该接近:

单位视频质量 / 单位比特 / 单位能耗。

JPEG AI 的标准化过程已经开始非常重视这一问题。2026 年 JPEG 委员会公布的工作中,也在持续比较 CPU、GPU、FPGA 等平台上的能耗、延迟和实现特性。

这说明整个行业已经开始从“模型能不能压得更小”,转向“这种 Codec 能不能真正部署”。


六、实时直播还有一个神经 Codec 很难绕开的指标:延迟

对于影视存储、离线转码而言,编码一次花 500ms 还是 5 秒可能并不是根本问题。

但对于 SmartMediaKit 面向的大量实时场景而言,延迟可能直接决定方案是否可用。

例如远程控制、机器人视觉、无人机图传、工业视觉、移动执法、远程协作,对编码链路的要求往往不是:

“压缩率最高。”

而是:

“在有限 CPU/GPU/NPU 资源下稳定编码,同时保持低延迟,并且网络抖动后能够快速恢复。”

这时候必须重新计算系统账。

假设传统 Codec:

8 Mbps + 10 ms 编码

而神经 Codec:

5 Mbps + 80 ms 编码

如果业务是一段影视视频,这可能是非常划算的交换。

但如果业务是机器人远程控制,70ms 新增延迟可能远比节省 3Mbps 更昂贵。

同时神经网络如果为了提高编码效率使用多帧上下文、双向预测、大模型 Context、复杂熵模型,就可能继续增加 Lookahead 和计算延迟。

所以对于实时 Codec 而言,未来真正竞争的不会只是 Rate-Distortion,而很可能是一个多目标问题:

Rate + Distortion + Latency + Complexity + Power + Recovery

这也是为什么传统 H.264/H.265 在实时音视频领域仍然具有非常强的生命力。

它们或许不是理论上最先进的压缩方式,却是当前“压缩率、延迟、稳定性、功耗、硬件覆盖、协议生态”综合平衡非常优秀的工程解。


七、生成式视频压缩很诱人,但“看起来一样”和“数据一样”是两回事

神经编解码还有一个传统 Codec 很少面对的问题:

重建内容到底应该多真实?

极低码率情况下,可以只传输人脸特征、姿态、关键结构甚至语义信息,然后由生成模型在接收端重新生成视频。

例如传统编码可能需要传:

大量人脸像素。

生成式方案可能只需要:

Identity + Pose + Expression + Motion + Residual。

码率理论上可以大幅下降。

H.266 2026 年版本中甚至已经出现与 generative face video、generative enhancement face video 相关的 SEI,以及神经网络后处理相关的信息机制。它并不意味着 VVC 已经变成生成式 Codec,却很好地说明了传统视频标准和神经技术的边界正在开始融合。

但是这一方向必须非常谨慎地区分场景。

视频会议里,一个被神经网络恢复出来的皮肤纹理和原始像素略有差异,通常没有严重问题。

娱乐直播可能也可以接受。

但如果视频用于安防取证、医疗、工业检测、科研测量、质量检测或者机器视觉训练,“看起来合理”远远不够。

因为生成网络有可能恢复出合理但不存在的细节。

传统有损 Codec 的失真主要是量化、模糊、块效应、振铃等;生成式 Codec 的风险则可能进一步变成:

Semantic Distortion——语义级失真。

这意味着未来 Codec 体系必须明确区分:

Fidelity Coding、Perceptual Coding、Generative Coding、Machine Coding。

不是码率越低越先进,而是应该根据业务允许的信息损失边界选择正确的编码模式。


八、未来真正可能成为主流的,并不是“纯神经替代”,而是 Hybrid Neural Codec

如果观察过去几十年的视频技术演进,会发现成熟工业体系极少一次性推翻旧世界。

更多时候,新技术先进入最值得优化的局部。

神经网络同样如此。

一种现实路线是:

传统 Codec + Neural Enhancement。

例如:

  • Neural In-loop Filter;
  • Neural Post Filter;
  • AI Super Resolution;
  • AI Denoise;
  • Neural Artifact Removal;
  • AI Frame Prediction;
  • Neural Rate Control;
  • Content-aware Encoding。

传统 H.264/H.265/VVC 仍然负责 Bitstream、GOP、参考帧、Random Access 和硬件解码,神经网络只优化传统算法最不擅长的环节。

第二种路线是:

Hybrid Neural Video Coding。

整体仍然保留 Predictive Coding 框架,但将运动估计、运动补偿、残差建模、熵模型或滤波模块逐渐替换成 Neural Network。

第三种才是:

Fully Learned End-to-End Codec。

从原始像素到 Latent,再从 Latent 直接恢复视频。

MPEG 当前 NNVC 探索本身就同时包含 Hybrid 和 End-to-End 两个方向,而不是单纯押注某一种路线。

从产业角度看,这其实很合理。

整个音视频行业拥有几十亿部带 H.264/H.265 硬件 Codec 的终端,没有任何技术会因为论文上的 BD-Rate 更漂亮,就让这些基础设施一夜之间消失。

更可能出现的情况是:

传统 Codec 提供基础兼容层,神经网络不断向 Codec 内部和上下游渗透。

最终我们甚至不会再特别强调这是“传统编码”还是“AI 编码”,就像今天已经很少有人在意摄像头 ISP 内部有多少模块开始使用神经网络。


九、从 SmartMediaKit 的角度看,真正应该掌握的不是某个 Codec,而是“Codec 之上的系统能力”

这也是我们看待神经视频编码时非常重要的一点。

一个视频系统从来不等于一个视频编码器。

真正完整的实时音视频链路至少包括:

Capture → Preprocess → Encode → Packetize/Mux → Protocol → Network → Demux → Decode → Render

并进一步涉及:

时钟、同步、抖动缓冲、弱网恢复、关键帧请求、码率控制、网络重连、硬件加速、零拷贝、图像回调、协议转换、录像以及 AI 处理。

因此对于大牛直播SDK(SmartMediaKit)而言,长期价值不应该建立在“押中哪一种 Codec”上,而应该建立在媒体框架能够容纳不同 Codec上。

SmartMediaKit 已经形成了围绕实时采集、推送、播放、转发、录像、RTSP/RTMP/HTTP-FLV、GB28181,以及 WHIP/WHEP 等方向持续扩展的媒体能力,同时在播放链路中具备软硬解码、YUV/RGB 等原始图像接口以及 GPU 渲染等基础能力。

这样的架构实际上非常适合继续向神经 Codec 延伸。

未来可以把编码层进一步抽象成:

VideoFrame → Codec Adapter → Encoded Access Unit

其中 Codec Adapter 后面可以分别对应:

H.264 / H.265 / VVC / AV1 / Neural Codec / Hybrid Neural Codec。

接收端同样变成:

Encoded Access Unit → Decoder Adapter → VideoFrame / Feature Tensor。

这样网络层看到的不是“AI”,网络层只看到需要可靠传输的一组媒体数据;渲染层看到的也不是“神经网络”,而是最终输出的 NV12、I420、RGB、Texture 或 Surface。

这实际上是一个非常重要的软件架构思想:

协议层不应该绑死 Codec,Codec 不应该绑死渲染,AI 也不应该侵入整个媒体链路。

当这些边界足够清晰以后,传统编解码和神经编解码就不是非此即彼,而可以成为并列、组合甚至动态切换的媒体能力。


十、SmartMediaKit 更值得布局的是“视频 + AI Representation”的统一媒体管线

如果把视野再向前推进一步,未来 SmartMediaKit 所面对的可能已经不仅仅是 Encoded Video。

特别是在机器人、无人机、智能穿戴、工业视觉、具身智能等领域,业务真正需要传输的可能同时存在三类数据。

第一类仍然是:

Human Video。

给操作人员观看。

第二类是:

Machine Feature。

给目标检测、跟踪、VLM、SLAM 或控制算法处理。

第三类是:

Metadata / Semantic Information。

例如目标框、轨迹、深度、姿态、事件、时间戳和传感器信息。

传统架构往往是:

Camera → H.264 → Decode → YUV → AI

也就是说,视频先编码一次,到 AI 端再完整解码,然后重新提取 Feature。

未来完全可能变成:

Camera
↓
Shared Visual Backbone
↓ ↓
Video Representation Feature Representation
↓ ↓
Human Decoder AI Model

甚至某些场景只需要 Feature,不需要完整视频。

这正是 MPEG Video Coding for Machines 和 Feature Coding for Machines 背后的产业逻辑。

因此,从 SmartMediaKit 的长期架构看,非常值得把“媒体数据”从单纯的 Audio/Video Frame,逐渐扩展为更加通用的:

Media Frame + Feature Tensor + Metadata + Timestamp。

一旦形成这样的统一 Pipeline,SmartMediaKit 就不再只是把摄像头视频从 A 点送到 B 点,而能够成为:

Camera → Codec → Network → AI → Display

之间的实时媒体基础层。

对于具身智能而言尤其如此。

机器人真正需要的不是一个“播放器 SDK”,而是一条能够在传感器、边缘计算、无线网络、远程控制和 AI 模型之间高效搬运视觉信息的基础设施。


十一、真正的竞争将从 Codec Competition 走向 Media Pipeline Competition

过去视频行业经常围绕一个问题争论:

H.264 还是 H.265?

后来变成:

H.265 还是 AV1?

现在又变成:

VVC 还是 AV1?

未来可能继续问:

传统 Codec 还是 Neural Codec?

但站在系统工程的高度看,这些问题其实都只回答了整个媒体链条中的一个局部。

真正决定用户体验的是:

采集延迟 + 编码延迟 + 排队延迟 + 网络延迟 + Jitter Buffer + 解码延迟 + 渲染延迟。

一个 Codec 节省了 30% 带宽,如果增加 100ms 编解码延迟,在很多实时场景中可能反而是退步。

反过来,一个 Codec 压缩率略低,但能够利用手机 SoC 固定硬件单元,以极低功耗实现稳定的 4K 实时编解码,在移动设备上可能更加优秀。

因此下一代实时音视频技术真正竞争的是:

Compression × Latency × Power × Reliability × Interoperability × Intelligence。

而不只是 Compression。

这也是 SmartMediaKit 应该坚持的平台化思路。

RTSP、RTMP、GB28181、WHIP/WHEP、SRT 等解决的是不同网络与业务环境中的实时传输问题;H.264、H.265、AV1、VVC 以及未来神经 Codec 解决的是视觉信息的表示问题;GPU、NPU、AI Framework 则解决感知和计算问题。

它们不是互斥关系。

真正成熟的实时媒体架构,应该能够让这些能力自由组合。


十二、结语:未来不会只有一种视频编码,而会有多种视觉表示共同存在

神经视频编码确实代表着视频压缩非常重要的一次范式变化。

它第一次让 Codec 可以不再完全依赖专家手工设计的预测、变换和概率模型,而能够直接从数据中学习更加适合压缩的视觉表示。

但是,从实验室中的 Rate-Distortion 曲线,到工业级实时视频系统之间,还有算力、功耗、延迟、确定性、模型版本、硬件支持、随机访问、弱网恢复、标准化以及跨平台互操作等大量问题需要解决。

截至 2026 年,MPEG 仍把 Neural Network-based Video Compression 列为持续探索方向;另一方面,JPEG AI 已经证明端到端学习式编码完全可以进入国际标准体系。同时,H.266/VVC 自身也已经出现神经网络后处理和生成式视频相关扩展信号。传统 Codec 与 Neural Codec 正在逐渐从两条平行路线走向融合。

因此,站在 SmartMediaKit 的视角,我们更愿意把神经编解码理解为实时音视频基础设施正在迎来的又一次能力扩展,而不是对现有技术体系的一次推翻。

H.264/H.265 仍然可以承担成熟、低延迟、广覆盖的视频传输;VVC、AV1 可以继续提高压缩效率;Neural Codec 可以探索更高效的视觉表示;AI Super Resolution、Neural Filter 可以增强传统 Codec;机器视觉场景则可以进一步传输 Feature Tensor 和 Semantic Metadata。

这些能力完全可以在同一个媒体架构中协同存在。

对于底层实时音视频 SDK 而言,最重要的技术能力因此不是预测“十年以后哪个 Codec 会赢”,而是让今天的架构能够容纳明天尚未出现的 Codec。

Codec 会变化,协议会变化,AI 模型也会变化。

但采集、时钟、媒体管线、内存管理、实时调度、网络传输、弱网恢复、跨平台适配以及软硬件协同这些底层能力,仍然会长期存在。

这或许才是神经编解码时代,实时音视频基础设施真正值得构建的技术护城河。