视频会议技术发展路线分析之AVC
Posted 晴天Jun
tags:
篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了视频会议技术发展路线分析之AVC相关的知识,希望对你有一定的参考价值。
一、 AVC视频算法的历史发展
视频编码的目的是在有限信息损耗的前提下,以尽量低的数据量来表征视频图像信息,并经过网络传输后解码呈现出满足质量要求的视频画面。常见的视频编码算法有H.261、H.263、H.264(H.264 HP)、H.265。
H.261标准是由国际电信联盟(ITU)于1990年发布,支持实现CIF(VCD)视频效果;H.263标准于1995年发布,支持实现4CIF(DVD)视频效果。H.264/AVC标准由国际联合视频组联合开发,2003年正式发布,能够实现720p和1080p的高清效果。H.264HP是H.264的高级版本,提升了压缩比,降低了网络传输带宽。
H.265继承了H.264/AVC编解码器并对压缩方案进行了一些改进,提升了压缩效率降低了传输带宽,支持4K超清。H.265在编码架构上与H.264基本一致,我们通常统称为AVC编码技术,也叫单层编码。
二、AVC有损架构MCU的发展
传统视频会议的核心是基于AVC算法架构的MCU,成型于上世纪90年代。MCU的主要功能是作为连接多台终端的中央处理设备,通过接受终端上传的视频码流解码、合成多画面、再编码传输给其他终端,或者传输给录播服务器录像存储。
AVC视频编码算法的发展推动了视频会议画质的不断升级,但并未改变AVC MCU技术架构。AVC MCU存在的主要短板如下:
- MCU对终端上传的码流二次解码编码,在MCU需要增加一倍的视频编码、界面时延,降低一次编解码图像代理的质量下降。
- MCU对终端上传的码流二次解码编码消耗大量计算资源,MCU一般需要内置大量的DSP芯片,MCU体现为专用硬件,成本极高;转通用服务器难以规模化承载,视频上云需求难以满足。
- 网络适应能力差,网络抖动或丢包引起的图像停顿或马赛克现象明显,互联网和移动网络应用受限。
- MCU软件业务功能与底层硬件绑定,受硬件限制无法持续升级,每隔一段时间就要重建改造。
H.264/AVC视频编解码技术详解十熵编码算法:CAVLC原理
《H.264/AVC视频编解码技术详解》视频教程已经在“CSDN学院”上线,视频中详述了H.264的背景、标准协议和实现,并通过一个实战工程的形式对H.264的标准进行解析和实现,欢迎观看!
“纸上得来终觉浅,绝知此事要躬行”,只有自己按照标准文档以代码的形式操作一遍,才能对视频压缩编码标准的思想和方法有足够深刻的理解和体会!
链接地址:H.264/AVC视频编解码技术详解
GitHub代码地址:点击这里
上下文自适应的变长编码(Context-based Adaptive Variable Length Coding, CAVLC)
1. 引言
在前述的几章节的博文/视频中,我们已经了解到熵编码是利用信息的统计冗余进行数据压缩的无损编码方法,并且已经讨论过了熵编码的基本原理、H.264中使用的语法元素解析算法“指数哥伦布编码”的算法与实践:
在我们已经实现的H.264码流结构(如NAL Unit、Slice Header等)的解析中,大多使用定长编码或者指数哥伦布编码实现。而例如预测残差等占据码流大量体积的数据则必须使用压缩率更高的算法,如CAVLC和CABAC等。前者是我们将在本文中讨论的内容,后者将在后续内容中详述。
2. CAVLC的基本原理
我们知道,CAVLC的全称叫做“上下文自适应的变长编码Context-based Adaptive Variable Length Coding”。所谓“上下文自适应”,说明了CAVLC算法不是像指数哥伦布编码那样采用固定的码流-码字映射的编码,而是一种动态编码的算法,因而压缩比远远超过固定变长编码UVLC等算法。
在H.264标准中,CAVLC主要用于预测残差的编码。在本系列第二篇博文中我们给出了H.264的编码流图,其中可知,熵编码的输入为帧内/帧间预测残差经过变换-量化后的系数矩阵。以4×4大小的系数矩阵为例,经过变换-量化后,矩阵通常呈现以下特性:
- 经过变换量化后的矩阵通常具有稀疏的特性,即矩阵中大多数的数据已0为主。CAVLC可以通过游程编码高效压缩连续的0系数串;
- 经过zig-zag扫描的系数矩阵的最高频非0系数通常是值为±1的数据串。CAVLC可以通过传递连续的+1或-1的长度来高效编码高频分量;
- 非零系数的幅值通常在靠近DC(即直流分量)部分较大,而在高频部分较小;
- 矩阵内非0系数的个数同相邻块相关;
鉴于上述的特性3和4,针对待编码的系数在系数矩阵中不同的位置,以及相邻块的有关信息,在编码时采用不同的码表进行编码。CAVLC的这种特性,体现了命名中的“上下文自适应”的方法。
3. CAVLC的编码流程
在CAVLC中,熵编码不是像哈夫曼编码等算法一样针对某一个码元进行编码,而是针对一个系数矩阵进行。假设我们希望对一个如下变换系数块进行CAVLC编码:
{
3, 2, -1, 0,
1, 0, 1, 0,
-1, 0, 0, 0,
0, 0, 0, 0,
}
对于一个4×4大小的变换系数矩阵进行CAVLC编码,首先需要对其进行扫描,将二维矩阵转化为一维数组。如前一节所讲,扫描按照zig-zag顺序进行,即按照如下顺序:
因此,扫描之后变换系数将进行重新排列,得到的结果为:
[3, 2, 1, -1, 0, -1, 0, 1, 0, 0, 0, 0, 0, 0, 0, 0]
在编码过程中需要注意以下重要的语法元素:
- 非零系数的个数(TotalCoeffs):取值范围为[0, 16],即当前系数矩阵中包括多少个非0值的元素;
- 拖尾系数的个数(TrailingOnes):取值范围为[0, 3],表示最高频的几个值为±1的系数的个数。拖尾系数最多不超过3个,若超出则只有最后3个被认为是拖尾系数,其他被作为普通的非0系数;
- 拖尾系数的符号:以1 bit表示,0表示+,1表示-;
- 当前块值(numberCurrent):用于选择编码码表,由上方和左侧的相邻块的非零系数个数计算得到。设当前块值为nC,上方相邻块非零系数个数为nA,左侧相邻块非零系数个数为nB,计算公式为nC = round((nA + nB)/2);对于色度的直流系数,nC = -1;
- 普通非0系数的幅值(level):幅值的编码分为prefix和suffix两个部分进行编码。编码过程按照反序编码,即从最高频率非零系数开始。
- 最后一个非0系数之前的0的个数(TotalZeros);
- 每个非0系数之前0的个数(RunBefore):按照反序编码,即从最高频非零系数开始;对于最后一个非零系数(即最低频的非零系数)前的0的个数,以及没有剩余的0系数需要编码时,不需要再继续进行编码。
在上述各类型数据中,编码非零系数的level相对最为复杂。其主要过程为:
- 确定suffixLength的值:
- suffixLength初始化:通常情况下初始化为0;当TotalCoeffs大于10且TrailingOnes小于3时,初始化为1;
- 若已经编码好的非零系数大于阈值,则suffixLength加1;该阈值定义为3 << ( suffixLength − 1 );编码第一个level后,suffixLength应加1;
- 将有符号的Level值转换为无符号的levelCode:
- 若level > 0,levelCode = (level << 1) - 2;
- 若level < 0,levelCode = -(level << 1) - 1;
- 编码level_prefix:level_prefix的计算方法为:level_prefix = levelCode/(1 << suffixLength);level_prefix到码流的对应关系由9-6表示;
- 确定后缀的长度:后缀的长度levelSuffixSize通常情况下等于suffixLength,例外情况有:
- level_prefix = 14时,suffixLength = 0, levelSuffixSize = 4;
- level_prefix = 15时,levelSuffixSize = 12;
- 计算level_suffix的值:level_suffix = levelCode%(1 << suffixLength);
- 按照levelSuffixSize的长度编码level_suffix;
在上述的系数矩阵中,非零系数个数TotalCoeffs=6,拖尾系数个数TrailingOnes=3,最后一个非零系数之前0的个数TotalZeros=2;假设nC=0。
- 在H.264标准协议文档的表9-5中查得,coeff_token的值为0x00000100;
- 编码拖尾系数的符号,从高频到低频,拖尾系数符号为+、-、-,因此符号的码流为011;
- 编码非零系数的幅值,三个普通非零系数分别为1、2、3;
- 编码1:suffixLength初始化为0;levelCode=0;level_prefix=0,查表得对应的码流为1;suffixLength=0,因此不对后缀编码;
- 编码2:suffixLength自增1等于1;levelCode=2;level_prefix=1,查表可知对应的码流为01;suffixLength=1,level_suffix=0,因此后缀码流为0;
- 编码3:suffixLength不满足自增条件,依然为1;levelCode=4;level_prefix=2,查表可知对应的码流为001;suffixLength=1,level_suffix=0,因此后缀码流为0;
- 综上所述,非零系数的幅值部分的码流为10100010;
- 编码最后非零系数之前0的个数TotalZeros: TotalCoeffs=6,TotalZeros=2时,在表9-7中可知码流为111;
- 编码每个非零系数前0的个数:从高频到低频,每个非零系数前0的总个数(zerosLeft)分别为2、1、0、0、0、0,每个非0系数前连续0的个数(run_before)分别为1、1、0、0、0、0。根据标准文档表9-10可得:
- run_before=1,zerosLeft=2,对应码流为01;
- run_before=1,zerosLeft=1,对应码流为0;
- 所有的0系数都已经编码完成,无需再继续进行编码;
综上所述,整个4×4系数矩阵经过CAVLC编码之后,输出码流为:0000010001110100010111010。
以上是关于视频会议技术发展路线分析之AVC的主要内容,如果未能解决你的问题,请参考以下文章
H.264/AVC视频编解码技术具体解释十熵编码算法:CAVLC原理