Qualité vidéo - Video quality

La qualité vidéo est une caractéristique d'une vidéo transmise par un système de transmission ou de traitement vidéo qui décrit la dégradation vidéo perçue (généralement, par rapport à la vidéo d'origine). Les systèmes de traitement vidéo peuvent introduire une certaine distorsion ou des artefacts dans le signal vidéo qui ont un impact négatif sur la perception d'un système par l'utilisateur. Pour de nombreux acteurs de la production et de la distribution vidéo , l'assurance de la qualité vidéo est une tâche importante.

L'évaluation de la qualité vidéo est effectuée pour décrire la qualité d'un ensemble de séquences vidéo à l'étude. La qualité vidéo peut être évaluée objectivement (par des modèles mathématiques) ou subjectivement (en demandant aux utilisateurs leur note). En outre, la qualité d'un système peut être déterminée hors ligne (c'est-à-dire en laboratoire pour développer de nouveaux codecs ou services) ou en service (pour surveiller et garantir un certain niveau de qualité).

De la vidéo analogique à la vidéo numérique

Depuis que la première séquence vidéo au monde a été enregistrée et transmise, de nombreux systèmes de traitement vidéo ont été conçus. De tels systèmes codent des flux vidéo et les transmettent sur divers types de réseaux ou de canaux. À l'époque des systèmes vidéo analogiques , il était possible d'évaluer les aspects qualitatifs d'un système de traitement vidéo en calculant la réponse en fréquence du système à l' aide de signaux de test (par exemple, une collection de barres et de cercles de couleur).

Les systèmes vidéo numériques ont presque entièrement remplacé les systèmes analogiques et les méthodes d'évaluation de la qualité ont changé. Les performances d'un système de traitement et de transmission vidéo numérique peuvent varier considérablement et dépendent de nombreux facteurs, notamment les caractéristiques du signal vidéo d'entrée (par exemple, la quantité de mouvement ou les détails spatiaux), les paramètres utilisés pour l'encodage et la transmission, et la fidélité du canal ou du réseau. performance.

Qualité vidéo objective

Les modèles objectifs de qualité vidéo sont des modèles mathématiques qui se rapprochent des résultats d' une évaluation subjective de la qualité , dans lesquels il est demandé à des observateurs humains d'évaluer la qualité d'une vidéo. Dans ce contexte, le terme modèle peut désigner un modèle statistique simple dans lequel plusieurs variables indépendantes (par exemple, le taux de perte de paquets sur un réseau et les paramètres de codage vidéo) sont comparées aux résultats obtenus dans un test d'évaluation subjective de la qualité utilisant des techniques de régression . Un modèle peut également être un algorithme plus compliqué implémenté dans un logiciel ou un matériel.

Terminologie

Les termes modèle et métrique sont souvent utilisés de manière interchangeable dans le domaine. Cependant, une métrique possède certaines propriétés mathématiques qui, par définition stricte, ne s'appliquent pas à tous les modèles de qualité vidéo.

Le terme « objectif » renvoie au fait que, en général, les modèles de qualité sont basés sur des critères qui peuvent être mesurés objectivement, c'est-à-dire sans interprétation humaine. Ils peuvent être évalués automatiquement par un programme informatique. Contrairement à un panel d'observateurs humains, un modèle objectif doit toujours produire de manière déterministe le même score de qualité pour un ensemble donné de paramètres d'entrée.

Les modèles objectifs de qualité sont parfois également appelés modèles instrumentaux (de qualité) , afin de souligner leur application en tant qu'instruments de mesure. Certains auteurs suggèrent que le terme «objectif» est trompeur, car il «implique que les mesures instrumentales portent l'objectivité, ce qu'elles ne font que dans le cas où elles peuvent être généralisées».

Classification des modèles de qualité vidéo objective

Image
Classification des modèles de qualité vidéo objective en référence complète, référence réduite et sans référence.
Image
Méthodes d'évaluation de la qualité de l'image et de la vidéo sans référence.

Les modèles objectifs peuvent être classés selon la quantité d'informations disponibles sur le signal d'origine, le signal reçu ou s'il y a un signal présent :

  • Méthodes de référence complète (FR) : les modèles FR calculent la différence de qualité en comparant le signal vidéo d'origine au signal vidéo reçu. En règle générale, chaque pixel de la source est comparé au pixel correspondant de la vidéo reçue, sans aucune connaissance du processus d'encodage ou de transmission entre les deux. Des algorithmes plus élaborés peuvent choisir de combiner l'estimation basée sur les pixels avec d'autres approches telles que décrites ci-dessous. Les modèles FR sont généralement les plus précis au détriment d'un effort de calcul plus important. Comme ils nécessitent la disponibilité de la vidéo d'origine avant la transmission ou le codage, ils ne peuvent pas être utilisés dans toutes les situations (par exemple, lorsque la qualité est mesurée à partir d'un périphérique client).
  • Méthodes de référence réduites (RR) : les modèles RR extraient certaines caractéristiques des deux vidéos et les comparent pour donner un score de qualité. Ils sont utilisés lorsque toute la vidéo originale n'est pas disponible, ou lorsqu'il serait pratiquement impossible de le faire, par exemple dans une transmission avec une bande passante limitée. Cela les rend plus efficaces que les modèles FR au détriment d'une précision moindre.
  • Méthodes sans référence (NR) : les modèles NR tentent d'évaluer la qualité d'une vidéo déformée sans aucune référence au signal d'origine. En raison de l'absence d'un signal original, elles peuvent être moins précises que les approches FR ou RR, mais sont plus efficaces à calculer.
    • Méthodes basées sur les pixels (NR-P) : les modèles basés sur les pixels utilisent une représentation décodée du signal et analysent la qualité en fonction des informations sur les pixels. Certains d'entre eux évaluent uniquement des types de dégradation spécifiques, tels que le flou ou d'autres artefacts de codage .
    • Méthodes paramétriques/de flux binaire (NR-B) : ces modèles utilisent des caractéristiques extraites du conteneur de transmission et/ou du flux binaire vidéo, par exemple les en - têtes de paquets MPEG-TS , les vecteurs de mouvement et les paramètres de quantification. Ils n'ont pas accès au signal d'origine et ne nécessitent aucun décodage de la vidéo, ce qui les rend plus efficaces. Contrairement aux modèles NR-P, ils n'ont pas accès au signal décodé final. Cependant, les prédictions de qualité d'image qu'ils fournissent ne sont pas très précises.
    • Méthodes hybrides (Hybrid NR-PB) : Les modèles hybrides combinent des paramètres extraits du flux binaire avec un signal vidéo décodé. Ils sont donc un mix entre les modèles NR-P et NR-B.

Utilisation de modèles de qualité d'image pour l'estimation de la qualité vidéo

Certains modèles utilisés pour l'évaluation de la qualité vidéo (tels que PSNR ou SSIM ) sont simplement des modèles de qualité d'image , dont la sortie est calculée pour chaque image d'une séquence vidéo. Cette mesure de qualité de chaque image peut ensuite être enregistrée et regroupée dans le temps pour évaluer la qualité d'une séquence vidéo entière. Bien que cette méthode soit facile à mettre en œuvre, elle ne tient pas compte de certains types de dégradations qui se développent au fil du temps, tels que les artefacts mobiles causés par la perte de paquets et sa dissimulation . Un modèle de qualité vidéo qui prend en compte les aspects temporels des dégradations de la qualité, comme VQM ou l' index MOVIE , peut être en mesure de produire des prédictions plus précises de la qualité perçue par l'homme.

Exemples

Métrique Usage La description
Référence complète PSNR (rapport signal/bruit de crête) Image Il est calculé entre chaque image du signal vidéo original et dégradé. Le PSNR est la métrique objective de qualité d'image la plus largement utilisée. Cependant, les valeurs PSNR ne sont pas bien corrélées avec la qualité d'image perçue en raison du comportement complexe et hautement non linéaire du système visuel humain.
SSIM (SIMilarité structurelle) Image SSIM est un modèle basé sur la perception qui considère la dégradation de l'image comme un changement perçu dans les informations structurelles, tout en incorporant également des phénomènes perceptuels importants, y compris les termes de masquage de luminance et de masquage de contraste.
Évaluation de l'intégrité vidéo basée sur MOVIE Index MOTION Vidéo L'indice MOVIE est un modèle basé sur les neurosciences pour prédire la qualité perceptive d'un film ou d'une vidéo (éventuellement compressé ou autrement déformé) par rapport à une vidéo de référence vierge.
Fusion d'évaluation multi-méthodes vidéo VMAF Vidéo VMAF utilise quatre fonctionnalités pour prédire la qualité vidéo VIF, DLM, MCPD, AN-SNR. Les fonctionnalités ci-dessus sont fusionnées à l'aide d'une régression basée sur SVM pour fournir un score de sortie unique. Ces scores sont ensuite temporairement regroupés sur l'ensemble de la séquence vidéo en utilisant la moyenne arithmétique pour fournir un score d'opinion moyen différentiel global (DMOS).
Référence réduite SRR (SSIM à référence réduite) Vidéo La valeur SRR est calculée comme le rapport entre le signal vidéo reçu (cible) SSIM et les valeurs SSIM du modèle vidéo de référence.
ST-RRED Vidéo Calculer les coefficients d'ondelettes des différences de trames entre les trames adjacentes dans une séquence vidéo (modélisée par un GSM). Il est utilisé pour évaluer les différences entropiques RR conduisant au RRED temporel. Il, en conjonction avec les indices RRED spatiaux évalués en appliquant l'indice RRED sur chaque image de la vidéo, donne le RRED spatio-temporel
Sans-Référence Évaluateur de qualité d'image NIQE Naturalness Image Ce modèle IQA est fondé sur des caractéristiques de statistiques de scène naturelle (NSS) du domaine spatial perceptuellement pertinentes extraites de patchs d'images locales qui capturent efficacement les statistiques essentielles d'ordre inférieur des images naturelles.
Évaluateur de la qualité spatiale des images aveugles/sans référence BRISQUE Image Le procédé extrait les statistiques ponctuelles des signaux de luminance normalisés locaux et mesure le naturel de l'image (ou son absence) sur la base des écarts mesurés par rapport à un modèle d'image naturel. Il modélise également la distribution de statistiques par paires de signaux de luminance normalisés adjacents qui fournissent des informations sur l'orientation de la distorsion.
Vidéo-BLINDS Vidéo Calcule des modèles statistiques sur les coefficients DCT des différences de trame et calcule la caractérisation du mouvement. Pedicts score basé sur ces fonctionnalités à l'aide de SVM

En outre

Un aperçu des modèles récents de qualité d'image sans référence a été donné dans un article de journal par Shahid et al. Comme mentionné ci-dessus, ils peuvent également être utilisés pour des applications vidéo. Le Video Quality Experts Group dispose d'un groupe de travail dédié au développement de mesures sans référence (appelées NORM ).

Métriques basées sur Bitstream

Les métriques à référence complète ou réduite nécessitent toujours l'accès au flux binaire vidéo d'origine avant la transmission ou au moins une partie de celui-ci. En pratique, un flux original peut ne pas toujours être disponible à des fins de comparaison, par exemple lors de la mesure de la qualité du côté utilisateur. Dans d'autres situations, un opérateur de réseau peut vouloir mesurer la qualité des flux vidéo transitant par son réseau, sans les décoder complètement. Pour une estimation plus efficace de la qualité vidéo dans de tels cas, des métriques paramétriques/basées sur le flux binaire ont également été standardisées :

Évaluation de la formation et de la performance

Étant donné que les modèles objectifs de qualité vidéo sont censés prédire les résultats donnés par des observateurs humains, ils sont développés à l'aide de résultats de tests subjectifs . Lors du développement d'un modèle objectif, ses paramètres doivent être entraînés de manière à obtenir la meilleure corrélation entre les valeurs prédites objectivement et les scores subjectifs, souvent disponibles sous forme de scores d'opinion moyens (MOS).

Les matériaux de test subjectifs les plus largement utilisés sont du domaine public et comprennent des images fixes, des films, des vidéos en continu, des jeux de données haute définition, 3-D (stéréoscopiques) et à usage spécial liés à la qualité d'image. Ces bases de données sont créées par divers laboratoires de recherche à travers le monde. Certains d'entre eux sont devenus des normes de facto, notamment plusieurs bases de données de qualité d'image subjective du domaine public créées et gérées par le Laboratoire d'ingénierie de l'image et de la vidéo (LIVE) ainsi que la base de données d'images de Tampere 2008 . Une collection de bases de données est disponible dans le référentiel Bases de données QUALINET . La bibliothèque de vidéos numériques grand public (CDVL) héberge des séquences de test vidéo disponibles gratuitement pour le développement de modèles.

En théorie, un modèle peut être entraîné sur un ensemble de données de manière à produire des scores parfaitement correspondants sur cet ensemble de données. Cependant, un tel modèle sera surentraîné et ne fonctionnera donc pas bien sur les nouveaux ensembles de données. Il est donc conseillé de valider les modèles par rapport à de nouvelles données et d'utiliser les performances résultantes comme un véritable indicateur de la précision de la prédiction du modèle.

Pour mesurer les performances d'un modèle, certaines métriques fréquemment utilisées sont le coefficient de corrélation linéaire , le coefficient de corrélation de rang de Spearman et l' erreur quadratique moyenne (RMSE). D'autres mesures sont le coefficient kappa et le ratio des valeurs aberrantes . UIT-T Rec. P.1401 donne un aperçu des procédures statistiques pour évaluer et comparer des modèles objectifs.

Utilisations et application des modèles objectifs

Les modèles de qualité vidéo objective peuvent être utilisés dans divers domaines d'application. Dans le développement de codecs vidéo , les performances d'un codec sont souvent évaluées en termes de PSNR ou SSIM. Pour les prestataires de services, des modèles objectifs peuvent être utilisés pour surveiller un système. Par exemple, un fournisseur IPTV peut choisir de surveiller la qualité de son service au moyen de modèles objectifs, plutôt que de demander leur avis aux utilisateurs ou d'attendre les plaintes des clients concernant une mauvaise qualité vidéo. Peu de ces normes ont trouvé des applications commerciales, notamment PEVQ et VQuad-HD . SSIM fait également partie d'un ensemble d'outils de qualité vidéo disponibles dans le commerce (SSIMWAVE). VMAF est utilisé par Netflix pour régler leurs algorithmes d'encodage et de diffusion en continu, et pour contrôler la qualité de tout le contenu diffusé en continu. Il est également utilisé par d'autres sociétés technologiques comme Bitmovin et a été intégré à des logiciels tels que FFmpeg .

Un modèle objectif ne doit être utilisé que dans le contexte pour lequel il a été développé. Par exemple, un modèle qui a été développé à l'aide d'un codec vidéo particulier n'est pas garanti d'être précis pour un autre codec vidéo. De même, un modèle entraîné sur des tests effectués sur un grand écran de télévision ne doit pas être utilisé pour évaluer la qualité d'une vidéo regardée sur un téléphone mobile.

Autres approches

Lors de l'estimation de la qualité d'un codec vidéo, toutes les méthodes objectives mentionnées peuvent nécessiter la répétition de tests de post-encodage afin de déterminer les paramètres d'encodage qui satisfont au niveau requis de qualité visuelle, ce qui les rend longues, complexes et peu pratiques pour une mise en œuvre dans de vraies applications commerciales. . Des recherches sont en cours pour développer de nouvelles méthodes d'évaluation objectives qui permettent de prédire le niveau de qualité perçu de la vidéo codée avant que le codage réel ne soit effectué.

Artefacts de qualité vidéo

Tous les artefacts visuels sont toujours précieux pour la qualité vidéo. Les attributs uniques non mentionnés incluent

Spatial

  • Flou - résultat de la perte des détails de l'image à haute fréquence spatiale, généralement sur les bords nets.
  • Blocage - est causé par plusieurs algorithmes en raison de la représentation interne d'une image avec des blocs de taille 8, 16 ou 32. Avec des paramètres spécifiques, ils peuvent faire la moyenne des pixels à l'intérieur d'un bloc rendant les blocs distincts
  • Sonnerie , écho ou image fantôme - prend la forme d'un « halo », d'une bande ou d'un « fantôme » près des bords tranchants.
  • Saignement de couleur - se produit lorsque les bords d'une couleur de l'image saignent ou se chevauchent involontairement dans une autre couleur
  • Bruit d'escalier - est un cas particulier de blocage le long d'un bord diagonal ou incurvé. Plutôt que de rendre aussi lisse, il prend l'apparence de marches d'escalier

Temporel

  • Le scintillement - correspond généralement à des changements fréquents de luminosité ou de couleur le long de la dimension temporelle. Il se présente souvent sous forme de scintillement à grain fin et de scintillement à grain grossier.
  • Bruit de moustique - une variante du scintillement, il se caractérise par un flou et/ou un miroitement autour du contenu à haute fréquence (transitions nettes entre les entités de premier plan et l'arrière-plan ou les bords nets).
  • Flottant - fait référence à un mouvement illusoire dans certaines régions tandis que les zones environnantes restent statiques. Visuellement, ces régions apparaissent comme si elles flottaient au-dessus de l'arrière-plan environnant
  • Les saccades ou saccades - sont les mouvements inégaux ou tremblants perçus en raison de l'échantillonnage d'images. Cela est souvent causé par la conversion de films 24 ips en un format vidéo 30 ou 60 ips.

La majorité d'entre eux peuvent être regroupés en artefacts de compression

Qualité vidéo subjective

L'objectif principal des métriques de qualité vidéo à objectifs multiples est d'estimer automatiquement l'opinion de l'utilisateur moyen (téléspectateur) sur la qualité d'une vidéo traitée par un système. Les procédures pour les mesures subjectives de la qualité vidéo sont décrites dans la recommandation UIT-R BT.500 et la recommandation UIT-T P.910 . Dans de tels tests, des séquences vidéo sont présentées à un groupe de téléspectateurs. L'opinion des téléspectateurs est enregistrée et moyennée dans le score d'opinion moyen pour évaluer la qualité de chaque séquence vidéo. Cependant, la procédure de test peut varier en fonction du type de système testé.

Outils d'évaluation de la qualité vidéo

Outil disponibilité Métriques incluses
FFmpeg Libérer PSNR, SSIM, VMAF
MSU VQMT Gratuit pour les métriques de base

Payé pour les métriques HDR

PSNR, SSIM, MS-SSIM, 3SSIM, VMAF , NIQE, VQM, Delta, MSAD, MSE

Métriques développées par MSU : métrique de flou, métrique de blocage, métrique de luminosité, métrique de chute de trame, métrique d'estimation du bruit

EPFL VQMT Libérer PSNR, PSNR-HVS, PSNR-HVS-M, SSIM, MS-SSIM, VIFp
OpenVQ Libérer PSNR, SSIM, OPVQ - La métrique Open Perceptual Video Quality
Elecard Version démo disponible PSNR, APSNR, MSAD, MSE, SSIM, Delta, VQM, NQI , VMAF et VMAF téléphone, VIF
AviSynth Libérer SSIM
Sonde VQ Libérer PSNR, SSIM, VMAF
  • FFmpeg - FFmpeg est le principal framework multimédia, capable de décoder, encoder, transcoder, multiplexer, démultiplexer, diffuser, filtrer et lire à peu près tout ce que les humains et les machines ont créé. Il prend en charge les formats anciens les plus obscurs jusqu'à l'avant-garde. Peu importe s'ils ont été conçus par un comité de normes, la communauté ou une entreprise. Il est également hautement portable : FFmpeg compile, exécute et réussit notre infrastructure de test FATE sur Linux, Mac OS X, Microsoft Windows, les BSD, Solaris, etc. sous une grande variété d'environnements de construction, d'architectures de machines et de configurations.
  • MSU VQMT - MSU Video Quality Measurement Tool (VQMT) est un programme d'évaluation objective de la qualité vidéo. Il fournit des fonctionnalités pour les comparaisons de référence complète (deux vidéos sont examinées) et de référence unique (une vidéo est analysée).
  • EPFL VQMT - Ce logiciel fournit des implémentations rapides des métriques objectives suivantes : PSNR, SSIM, MS-SSIM, VIFp, PSNR-HVS, PSNR-HVS-M. Dans ce logiciel, les métriques ci-dessus sont implémentées dans OpenCV (C++) sur la base des implémentations Matlab originales fournies par leurs développeurs.
  • OpenVQ - OpenVQ est une boîte à outils d'évaluation de la qualité vidéo. L'objectif de ce projet est de fournir à toute personne intéressée par l'évaluation de la qualité vidéo une boîte à outils qui a) fournit des implémentations de métriques de qualité vidéo prêtes à l'emploi, et b) facilite la mise en œuvre d'autres métriques de qualité vidéo.
  • Elecard - Outil de mesure de la qualité vidéo conçu pour comparer la qualité des flux encodés sur la base de métriques objectives, telles que PSNR, APSNR, SSIM, DELTA, MSE, MSAD, VQM, NQI , VMAF et VMAF téléphone, VIF.
  • AviSynth - AviSynth est un outil puissant pour la post-production vidéo. Il fournit des moyens d'éditer et de traiter des vidéos. AviSynth fonctionne comme un frameserver, fournissant une édition instantanée sans avoir besoin de fichiers temporaires. AviSynth lui-même ne fournit pas d'interface utilisateur graphique (GUI) mais s'appuie plutôt sur un système de script qui permet une édition non linéaire avancée.
  • VQ Probe - VQ Probe est un instrument visuel professionnel pour la comparaison objective et subjective de la qualité vidéo. L'outil permet aux utilisateurs de comparer différentes normes de codecs, de créer des courbes RD et de calculer les taux de BD.

Prédiction QoE pour la qualité vidéo

La prédiction de la QoE dans les vidéos est un grand défi en raison des multiples situations qui peuvent survenir et du caractère subjectif de la QoE. Pour cette raison, pour prédire la QoE de la manière la plus précise, nous devons utiliser un bon classificateur capable de détecter la plupart des types d'erreurs ou de situations inattendues affectant la qualité vidéo. Certaines études ont démontré qu'un classificateur de processus gaussien donne de bons résultats pour ce type de classification.

Voir également

Les références

Lectures complémentaires