Prévia do material em texto
Transição para HDTV – 32 MPEG-4 parte 10, MPEG-4/AVC ou H.264 albino da silva O objetivo da parte 10 do documento 14496/H.264/AVC (Advanced Video Co- ding) da ISO/IEC, ou do Anexo G da norma H.264/AVC do ITU, foi criar uma norma de codificação avançada capaz de disponi- bilizar vídeo de boa qualidade com cadências de dados pelos menos 50% inferiores às das normas anteriores (sejam estas as MPEG-2 ou a MPEG-4-2), que fosse suficientemente flexível para ser usada em variadas redes e sistemas com cadências de dados e resoluções baixas ou ele- vadas, sem que isso prejudicasse a sua aplicabili- dade em termos técnicos e econômicos. A codificação avançada de vídeo descreve a construção de um feixe de dados que, adequan- do-se ao MPEG-4, desenvolve as suas caracte- rísticas e aumenta as suas funcionalidades. Para isso, proporciona novas possibilidades derivadas de compressões muito mais eficientes que as das normas anteriores, tal como a predição espacial de imagens derivadas de múltiplas imagens (1), ou a partir dos contornos de blocos vizinhos (2), a codificação sem perdas de macro-blocos (3), a codificação flexível do vídeo entrelaçado (4), de planos diferentes da mesma imagem em função das cores primárias (5), e da entropia da codi- ficação (6). Esse tipo de codificação avançada prevê ainda o suporte preciso das variações da dimensão das palavras (7), o desenvolvimen- to da quantificação (8), a introdução de novas características no desenvolvimento das trans- formadas (9), do desbloqueio por filtragem em anel (10), ou da comutação de fatias (11), além de incorporar técnicas de prevenção da emula- ção acidental de códigos de inicialização (12), de informação suplementar de reforço e da uti- lização do vídeo (13), de imagens auxiliares (14), da contagem ordenadas das imagens (15), do suporte de amostragens subcromáticas 4:2:0, 4:2:2 e 4:4:4 (16) e uma flexibilidade muitíssimo superior (17). ponto a ponto A predição espacial entre imagens derivadas de múltiplas imagens (1) faz-se usando imagens previamente codificadas como referência, que podem ir até às 16 ou, quando de varrimento entrelaçado, aos 32 campos, com compensações de movimento feitas com blocos de dimensão variável (VBSMC – Variable Block-Size Motion Compensation). Para a luminância, esses blocos podem ser de 16x16, 16x8, 8x16, 8x8, 8x4 ou 4x4 com os de crominância a poderem ser de menores dimensões em função da subamostra- gem utilizada – o que permite segmentar com precisão as regiões com movimento e múltiplos vetores de movimento por macro-bloco – com até 32 vetores nos macro-blocos dos quadros B construídos de 16 partições de 4x4 - podendo a sua filtragem ter seis níveis para que possa atingir precisões de meio pixel nas amostras de luminância e fazer predição ponderada. A predição espacial a partir dos bordos de blocos vizinhos (2) para codificação interna (in- tra) utiliza blocos de predição da luminância de 16x16, 8x8 ou 4x4 desde que a cada um dos blocos corresponda só uma dessas dimensões. A codificação sem perdas dos macro-blocos (3) faz-se com representação PCM (Pulse Coded Modulation) e com a data das amostras de ví- deo a ser representada diretamente, ou com um modo de representação reforçada desses mes- mos macro-blocos para se usarem ainda menos bits que nesse modo PCM. A codificação flexível do vídeo entrelaçado (4) é feita com a codificação adaptativa qua- Depois de termos descrito os diversos perfis e níveis correspondentes à norma MPEG-4, vamos continuar a descrever as suas ferramentas de codificação, focando-nos agora sobre as diferentes técnicas de codificação avançada de vídeo, tal como propõe a norma H.264/AVC. Macroblocos visíveis na compressão de um sinal de televisão emitido em HD e o mesmo sinal emitido sem artefatos as técnicas de codificação com compensações de movimento feitas com blocos de dimensão variável são usadas nos formatos de vídeo atuais, pós-MpEG-2, incluindo o MpEG-4 asp e aVC assim como o formato sMpTE VC-1 da Microsoft Produção Profissional | juLho 200956 téc nic a www.videosystems.com.br vendas@videosystems.com.br Tel: (11) 3835-9777 Fax: (11) 3832-5433 ® V3HD Super Slow Motion. Até1000 FPS. HD nativo. dro-campo dos macro-blocos (MBAFF – Macro- Block-Adaptive Frame-Field) usando estruturas de imagem, constituídas por pares de macro- blocos, que são codificadas como quadros, ou com codificação adaptativa quadro-campo (PAFF ou PicAFF – Picture-Adaptive Frame-Field) o que permite que misturas selecionadas de imagens codificadas MBAFF sejam depois codi- ficadas como campos de vídeo entrelaçado. As codificações de planos diferentes de uma mesma imagem como imagens diferentes (5) em função das suas cores primárias com a sua própria estrutura de fatias, modos dos macro- blocos, vetores de movimentação, etc., permite desenvolver codificadores com estruturas para- lelas simples para os perfis 4:4:4. O desenvolvimento da entropia da codi- ficação (6) é alcançado com codificação arit- mética binária adaptada ao contexto (CABAC – Context-Adaptive Binary Arthmetic Coding) ou com codificação com comprimento variável adaptada ao contexto (CAVLAC – Context- Adaptive Variable-Lenght Coding) ou com uma codificação simples mas altamente estrutura- da da codificação com comprimento variável (VLC – Variable Lenght Coding). O CABAC é um algoritmo que comprime sem perdas os elementos da sintaxe do feixe de vídeo a partir das probabilidades desses elementos existirem num dado contexto, sendo o CAVLAC uma al- ternativa de menor complexidade a usar com as transformadas quantificadas dos valores dos coeficientes. A codificação VLC, que também é denominada como codificação exponencial Golomb, ou Exp-Golomb, é uma técnica utili- zada com alguns elementos da sintaxe não su- jeitos à CABAC ou à CAVLAC. O suporte da precisão da variação das di- mensões das palavras com que as amostras podem ser representadas (7), pode ir de 8 a 14 bit por palavra. O desenvolvimento da quantificação com controle dos processamentos logarítmicos (8) para que os codificadores possam gerir mais fa- Tr an si çã o pa ra H D TV Detectar se um sinal de vídeo é de varrimento progressivo ou entrelaçado é um pro- cesso crítico na codificação avançada, estando dependente de algoritmos que agem ao nível da imagem ou ao nível dos blocos. Na especificação MPEG-4/AVC, existem duas formas de gerir o varrimento entrelaçado: uma ao nível da imagem, referida como PAFF (Picture Adaptive Frame Field); e outra ao nível de macroblocos ou super- macorblocos (um par de macroblocos verticais, por exemplo), referida como MBAFF (Macroblock Adaptive Frame Field). Na imagem da página 60, vemos a interpretação das duas abordagens. Na codificação de frame, os dois campos são codificados entre- laçados, enquanto na codificação de campo, estes são codificados de forma separada. No processo PAFF, a decisão é tomada ao nível da imagem: para cada imagem, escolhe- se se a imagem é codificada como dois campos separados ou um frame (quadro). Na abordagem MBAFF, a decisão é tomada para cada macrobloco. É também possível usar as duas técnicas - usar PAFF a um campo selecionado ou codificação de frame e MBAFF quando a codificação de frame é selecionada. Na base do esquema da página 58, mostramos um quadro com as eficiências conseguidas por essas abordagens, tendo como exemplo a implementação feita pela Thomson no Mustang ASIC que se encontra na origem dos seus equipamentos de codificação MPEG-4 Codificação sobre sinal progressivo ou entrelaçado juLho 2009 | Produção Profissional 57 téc nic a Tr an si çã o pa ra H D TV cilmente as cadências de dados, simplifica o es- calamento das quantificações inversas e efetua um escalamento mais elaborado das quantifica- ções das matrizes de freqüências. Nas novas características introduzidas pelo desenvolvimento das transformadas (9), in- cluem-se blocos de 4x4, para tratamento maispreciso dos sinais residuais com poucas sobre- oscilações, ou blocos de 8x8, para que a com- pressão de regiões estreitamente correlaciona- das seja mais eficiente que com os blocos de 4x4. Por outro lado, a seleção de codificação adaptativa entre blocos de 8x8 e de 4x4 para operações com transformadas integrais, ou com segundas transformadas Hadamard dos coefi- cientes DC das transformadas espaciais primá- rias, é aplicada aos coeficientes DC das cromi- nâncias (em alguns casos especiais, também aos de luminância) para se obterem maiores com- pressões das regiões muito uniformes. Os filtros de desbloqueio em anel (10) aju- dam a evitar os artefatos de bloqueio comuns a outras compressões de imagem baseadas em DCT, o que resulta em compressões mais efi- cientes e imagens com melhor percepção ob- jetiva e subjetiva. A comutação de fatias de quadros P (SP – Slice P) ou I (SI – Slice I) (11) permite que o codificador diga ao decodificador para saltar entre partes do fluxo de dados em função da cadência dos dados dessas partes, de forma a encontrar as referências corretas para a recons- trução da imagem. Para se evitar a emulação acidental de có- digos de inicialização (12), que são seqüências especiais de bits na data codificada, é utilizado um processamento simples e automático que possibilita o acesso aleatório ao feixe de da- dos de forma recuperar-se o alinhamento dos bytes nos sistemas que tendam a perder a sua sincronização. A informação suplementar de reforço (SEI – Supplemental Enhancement Information) e a forma de utilizar a informação de vídeo (VUI – Video Usability Information) (13) são infor- mações extra que podem ser inseridas no feixe para facilitar o uso do vídeo numa grande va- riedade de aplicações. Imagens auxiliares (14) podem ser usadas para, por exemplo, composição alfa (transparências). 7 As descrições PAFF e MBAFF com as linhas ímpares em amarelo e as pares em azul E�ciência relativa das técnicas de codi�cação MBAFF e PAFF no ASIC Mustang da Thomson. Os valores negativos correspondem a percentagem (%) da diminuição em cadência de dados (bit-rate). Frame FieldFrame Field MBAFFFrame Field MBAFF Frame PAFF MBAFF PAFF+MBAFF ∆ bit rate (%) 0 -10 -16 -18 As descrições PAFF e MBAFF com as linhas ímpares em amarelo e as pares em azul Eficiência relativa das técnicas de codificação MBAFF e PAFF no ASIC Mustang da Thomson. Os valores negativos correspondem a percentagem (%) da diminuição em cadência de dados (bit-rate). Produção Profissional | juLho 200958 téc nic a A contagem ordenada das imagens (15) ser- ve para manter o seu ordenamento, com os va- lores das amostras das imagens decodificadas isolados da informação de temporização para, assim, possibilitar que essa informação seja transportada, controlada, ou alterada, separa- damente pelo sistema, sem afetar o conteúdo da imagem decodificada. Na melhoria das características de recupe- ração (16), são introduzidas uma camada da abstração da rede (NAL – Network Abstraction Layer), para que a mesma sintaxe possa ser usada com várias redes e conjuntos de parâ- metros das imagens (PPS – Picture Parameter Sets), e das seqüências (SPS – Sequence Pa- rameter Sets), para melhorar a robustez e a flexibilidade de operação. Este técnica prevê ainda uma cadência flexível na gestão dos ma- cro-blocos (FMO – Flexible Macro-Blocks Orde- ring) e ordenamento arbitrário das fatias (ASO – Arbitrary Slice Ordering), que são técnicas de re-ordenamento dos macro-blocos de uma imagem, incluindo as técnicas de partição da data (DP- Data Partitioning), a redundância das fatias (RS – Redundancy of Slices) e a numera- ção dos quadros. A camada de abstração da rede (NAL) permite o uso da mesma sintaxe do vídeo em vários ambientes de rede, o que me- lhora a robustez e a flexibilidade da operação. As técnicas de gestão FMO e ASO são técnicas de reordenamento dos macro-blocos corres- pondentes a regiões fundamentais das ima- gens. A técnica de partição DP permite separar os elementos de sintaxe mais importantes dos menos importantes e a sua distribuição por di- ferentes pacotes de data de forma a permitir a aplicação de diferentes proteções contra erros (UEP – Unequal Error Protection) e/ou de outras técnicas destinadas a aumentar a robustez de funcionamento. A técnica de redundância das fatias (RS) faz com que o codificador envie re- presentações extra, mas de menor qualidade, de regiões da imagem, para que estas possam ser usadas se a representação normal se perder ou seja sujeita a perdas que prejudiquem a sua utilização. A numeração dos quadros permite a criação de seqüências e a escalabilidade tem- poral através da inclusão otimizada de imagens extra entre outras imagens, permitindo a de- tecção e anulação das perdas de imagens in- teiras devidas à perda de pacotes ou a erros no canal de transmissão. n Figura 2 Conteúdo orientado para aplicação MBaFF Conteúdo orientado para aplicação paFF ou MBaFF Ferramentas de codificação H.264, MBaFF e paFF Tr an si çã o pa ra H D TV Produção Profissional | juLho 200960 téc nic a