Que sont les normes ? Comprendre les données normatives – Édition 2024

Principes de base

Dernière mise à jour:

Disponible en :

 EN  FR 

Pour vous aider à vous familiariser avec les données normatives, nous avons demandé à l'équipe VALD Data Science de rédiger ce guide simple et clair sur les principes fondamentaux des données normatives.

Saviez-vous que VALD Hub intègre-t-il les données Norms? Si vous êtes client VALD, vous trouverez désormais les données Norms générées à partir des données ForceDecks de vos athlètes sur leur profil.

Pour en savoir plus sur les Norms intégrées, cliquez ici: https://valdperformance.com/introducing-vald-norms/

ForceDecks Norms (normative data) integrated into VALD Hub.

ForceDecks Norms (données normatives) ont été intégrées à VALD Hub.

Les clients VALD peuvent également demander des rapports de données normatives pour toute une gamme de produits VALD, portant sur divers sports et différentes cohortes. Il suffit de contacter votre Client Success Manager pour obtenir cet accès.

Qu'est-ce qu'une norme?

Les données normatives (ou « normes ») sont des informations issues d'une population donnée qui permettent d'établir une distribution de référence des résultats pour cette population particulière.

Les normes sont généralement établies à partir d'un large échantillon représentatif de la population étudiée. La littérature médicale publie souvent des données normatives portant sur des populations comptant entre 50 et 100 participants. En revanche, les normes VALD s'appuient sur des données issues de plus d'un million de personnes. Cela signifie que nous pouvons tout de même établir des normes fiables (c'est-à-dire sur la base d'au moins 50 échantillons) pour des populations extrêmement spécifiques, telles que les adolescentes européennes pratiquant le lancer du javelot.

C'est ainsi que nous transformons les données les plus approfondies du secteur en un éventail très large d'informations normatives, couvrant des centaines de sous-populations.

Il convient toutefois de noter que plus l'échantillon est petit, plus les estimations réalisées seront entachées d'incertitude.

L'incertitude peut être calculée et exprimée à l'aide d'outils statistiques tels que les intervalles de confiance à 95 %. Là encore, bien que cela dépende de la question à laquelle vous souhaitez répondre, il est recommandé de veiller à ce que votre échantillon soit relativement homogène. Par exemple, la figure 1 ci-dessous présente les résultats de la puissance de crête concentrique issus de plus de 170 000 tests de saut en contre-mouvement (CMJ) réalisés sur plus de 6 000 athlètes de la NFL (football américain).

Cependant, nous savons que les différents postes au football américain exigent généralement des caractéristiques anthropométriques et athlétiques différentes. Par conséquent, la répartition des résultats entre, par exemple, les joueurs de la ligne défensive et ceux du poste de receveur éloigné pourrait présenter des différences significatives:

Il est évident que considérer l'ensemble des athlètes de la NFL n'est peut-être pas l'approche la plus pertinente. Cependant, il convient également de noter que le fait de segmenter les données et d'étudier chaque groupe de postes séparément réduira la taille de l'échantillon.

Même si les données présentées dans la figure 2 proviennent d’un grand nombre de sportifs de la NFL, leur volume reste relativement faible par rapport à des ensembles de données normatives idéaux ; la courbe n’est donc pas lisse (normale). Cependant, la figure 3 illustre la puissance des données lorsqu’on compare un très grand groupe – en l’occurrence, des centaines de milliers d’individus.

Éléments à prendre en compte pour l'élaboration de normes

Avant de tenter de calculer une norme, il est impératif de vérifier que les données ne contiennent pas d'erreurs. Lorsque les ensembles de données sont volumineux, cela nécessite un processus rigoureux de nettoyage des données. Le processus de nettoyage des données de VALD est résumé dans la figure 4 ci-dessous.

The data cleansing process for the VALD Data Lakehouse is a secure, private database that houses tens of millions of data points from more than one million de-identified individuals.

Figure 4. Le processus de nettoyage des données de VALD, qui permet de transformer des millions de points de données en un ensemble de données propre, précis et fiable.

Par exemple, le « rejet des résultats erronés » consiste à éliminer automatiquement les valeurs aberrantes extrêmes, en s'appuyant à la fois sur une expertise métier et sur des techniques statistiques. Ces valeurs aberrantes peuvent résulter de tests déclenchés par inadvertance, de protocoles de test incorrects ou d'autres problèmes survenus lors du processus de collecte des données ; quoi qu'il en soit, elles peuvent être automatiquement identifiées comme erronées et supprimées de l'ensemble de données.

Vérification de la répartition de vos données

Lorsque l'on travaille avec des données continues, il est important de connaître le type de distribution de son échantillon. Il existe des méthodes formelles pour évaluer les distributions, mais dans le cas présent, nous pouvons évaluer visuellement la distribution de notre échantillon à l'aide d'un histogramme.

Figure 5: Répartition des forces maximales mesurées lors de plus de 170 000 tests CMJ réalisés sur plus de 6 000 athlètes de la NFL.

Cet histogramme montre clairement que la distribution de notre échantillon est approximativement normale.

Lorsque l'on examine l'asymétrie entre les membres, on peut utiliser une valeur négative pour désigner une asymétrie en faveur du membre gauche et une valeur positive pour désigner une asymétrie en faveur du membre droit. Dans ce cas, on peut s'attendre à ce que notre échantillon d'asymétrie entre les membres soit lui aussi distribué selon une loi normale.

Figure 6: Répartition des résultats relatifs à l'asymétrie de la force maximale, issue de plus de 170 000 tests CMJ réalisés au sein de la NFL.

Toutefois, lorsqu'on examine les normes relatives à l'asymétrie entre les membres, on ne devrait généralement pas se demander si cette asymétrie concerne le membre gauche ou le membre droit ; l'accent est le plus souvent mis sur l'ampleur de l'asymétrie.

Si nous transformons tous nos résultats négatifs en résultats positifs et supprimons toute référence aux membres, nous constatons que la répartition de notre échantillon a changé.

Figure 7: Répartition des résultats relatifs à l'asymétrie de la force maximale non directionnelle illustrée dans la figure précédente, après suppression de toute référence au membre.

Nous obtenons ainsi une distribution à asymétrie positive, ce qui correspond à ce à quoi on peut s'attendre pour des données relatives à l'asymétrie entre les membres: davantage d'observations proches de 0 % et des cas d'asymétries plus importantes moins fréquents.

Quelles statistiques descriptives devriez-vous utiliser?

Une fois que nous connaissons la répartition de nos données, nous pouvons nous appuyer sur ces informations pour choisir les statistiques qui permettront de les décrire.

Même si cela dépend en fin de compte de la question à laquelle vous souhaitez répondre, on peut généralement considérer que la moyenne est appropriée pour une distribution normale (par exemple, nos données sur la force maximale du CMJ), mais qu'elle peut ne pas l'être pour une distribution asymétrique (par exemple, nos données sur l'asymétrie entre les membres).

La médiane est considérée comme une mesure de tendance centrale plus robuste, particulièrement adaptée en cas de distribution asymétrique ou de valeurs aberrantes. La figure 8 présente une comparaison entre la moyenne et la médiane d'une variable arbitraire suivant une distribution normale:

Figure 8: Comparaison entre la moyenne et la médiane pour une distribution normale et une distribution à asymétrie positive.

Dans le cas d'une distribution normale, la médiane reflète étroitement la moyenne. Dans le cas d'une distribution asymétrique, la médiane peut constituer une mesure de tendance centrale plus appropriée et est moins sensible aux valeurs aberrantes que la moyenne. C'est pourquoi il peut être judicieux d'utiliser la médiane (et l'écart interquartile) pour décrire vos données.

Que sont les courbes de densité?

Si les histogrammes permettent de visualiser la fréquence des résultats sur l'ensemble de vos données, les courbes de densité offrent quant à elles une représentation idéalisée de la distribution d'un échantillon. La figure 9 montre la comparaison entre la courbe de densité et l'histogramme pour nos données de puissance de crête CMJ:

Figure 9: Superposition d'une courbe de densité et d'un histogramme.

Lorsqu'on observe une courbe de densité, on interprète souvent à tort la hauteur de la courbe comme représentant la probabilité que ce résultat particulier se produise. En réalité, c'est l'aire sous la courbe de densité qui nous indique la probabilité qu'un résultat se situe dans un intervalle donné.

Par exemple, l'aire totale sous la courbe de densité sera toujours égale à 1, ce qui indique qu'il existe une probabilité de 100 % qu'un résultat se situe entre le minimum et le maximum observés. La zone ombrée en gris sur la figure 10 représente l'aire sous la courbe comprise entre 50 W/kg et 55 W/kg:

Figure 10: L'aire sous la courbe comprise entre 50 W/kg et 55 W/kg.

En observant la courbe de densité, on pourrait probablement deviner que la zone ombrée en orange représente moins de 10 % de l'aire totale sous la courbe. Cependant, si nous voulons estimer correctement la probabilité qu'un résultat se situe entre ces deux valeurs, nous pouvons le faire en déterminant le nombre total de résultats compris entre 50 W/kg et 55 W/kg, puis en divisant ce nombre par le nombre total d'observations de notre échantillon.

Dans ce cas, la probabilité qu'un résultat se situe entre ces deux valeurs est égale à 0,05, soit 5 %. Bien que ce niveau de spécificité puisse s'avérer utile, la hauteur de la courbe suffit souvent à elle seule à nous indiquer si un résultat donné est plus ou moins probable.

Dans ce contexte, il arrive parfois que les courbes de densité ne comportent pas d'axe des y. Il est également courant de voir des courbes de densité sur lesquelles sont indiqués le premier quartile, le deuxième quartile (également appelé « médiane ») et le troisième quartile.

Figure 11: Courbe de densité présentant le premier quartile, le deuxième quartile et le troisième quartile.

Les premier, deuxième et troisième quartiles correspondent respectivement aux 25e, 50e et 75e centiles. Ces lignes permettent de tirer rapidement et facilement des conclusions sur notre échantillon. On constate que 25 % de nos données se situent en dessous du premier quartile (à 55 W/kg), 25 % au-dessus du troisième quartile (à 76 W/kg) et 50 % entre ces deux points.

Autres méthodes de visualisation d'un échantillon

Diagramme en boîte à moustaches:

Même si vous connaissez ou non les courbes de densité, la plupart des gens ont sans doute déjà rencontré une autre méthode permettant de visualiser la distribution d'un échantillon: le diagramme en boîte à moustaches.

Figure 12: Comparaison entre une courbe de densité et un diagramme en boîte à moustaches, à partir du même ensemble de données.

La figure ci-dessus montre que la courbe de densité n'est autre qu'une extension du diagramme en boîte à moustaches. Outre le fait qu'elle indique les valeurs minimales, maximales et les quartiles clés, la hauteur de la courbe de densité nous donne également une indication de la probabilité qu'un résultat se produise.

Diagramme en violon:

Le diagramme en violon constitue une autre façon de visualiser la distribution d'un échantillon:

Figure 13: Courbe de densité comparée à un diagramme en violon, à partir du même ensemble de données.

Le diagramme en violon est simplement une courbe de densité à double face. On utilise généralement un point et des barres d'erreur pour indiquer la médiane et l'écart interquartile (IQR).

Les informations clés issues d’un échantillon peuvent également être facilement résumées dans un tableau. Les percentiles clés, tels que le 1er (proche du minimum), le 25e (premier quartile), le 50e (médiane), le 75e (troisième quartile) et le 99e (proche du maximum), peuvent nous donner une idée générale de la distribution d’un échantillon. Le tableau 1 présente les percentiles clés de notre échantillon CMJ:

Tableau 1: Principaux centiles de la puissance de crête relative au CMJ (W/kg) chez les athlètes de la NFL.

PERCENTILE1 %25 %50 %75 %99 %
Puissance de crête (W/kg)3957657398

Applications de données normatives

Les normes peuvent être appliquées de différentes manières. On peut par exemple utiliser les quantiles clés d'un ensemble de données normatives comme seuils pour identifier les individus susceptibles de nécessiter une attention particulière. La figure ci-dessous présente les résultats relatifs à la force maximale au saut CMJ de 13 athlètes:

Figure 14: Exemple d'utilisation de la médiane et de l'écart interquartile issus d'un ensemble de données normatives comme seuils.

La ligne horizontale à 2 800 N correspond à la médiane de notre échantillon, tandis que la zone ombrée en orange représente l'intervalle interquartile (IQR). Les athlètes se situant en dessous du premier quartile, soit le 25e centile, sont facilement identifiables en rouge.

Dans le cadre de l'analyse de la force maximale, un professionnel de la performance pourrait utiliser ces informations pour prescrire des exercices de musculation ciblés à nos athlètes dont les résultats se situent en dessous du seuil du deuxième quartile.

Dans un contexte clinique, un praticien peut avoir un patient qui se remet d’une opération du genou suite à une blessure subie en jouant au football. Après avoir évalué ses performances au test CMJ et examiné sa force maximale, le patient pourrait se poser la question suivante: « Mon résultat est-il bon ou mauvais? » Plutôt que de juger si un résultat est bon ou mauvais, nous pouvons fournir au patient un contexte précis et lui montrer où il se situe par rapport à un groupe de référence similaire:

Figure 15: VALD Hub displays an individual’s result relative to normative data from the relevant population.

Figure 15: VALD Hub affiche les résultats d'un individu par rapport aux données normatives de la population concernée.

Le fait d'indiquer le centile dans lequel se situe le résultat du patient peut apporter un éclairage unique et précieux sur son état physique et l'évolution de son état de santé.


Comment puis-je accéder à « Norms » depuis VALD?

Les données normatives de ForceDecks sont désormais intégrées à VALD Hub. Les utilisateurs de VALD disposant de données ForceDecks verront les Norms directement superposées aux données de leurs athlètes.

ForceDecks Norms (normative data) integrated into VALD Hub.

ForceDecks Norms (données normatives) ont été intégrées à VALD Hub.

Vous pouvez demander des données normatives concernant d'autres technologies VALD ainsi que des données normatives spécifiques à certaines populations auprès de votre Client Success Manager.

Si vous ne savez pas comment contacter votre Client Success Manager, veuillez envoyer un e-mail à clientsuccess@vald.com ou support@vald.com.

Comment puis-je consulter mes rapports de données normatives sur VALD Hub?

Une fois cette fonctionnalité activée par votre Client Success Manager, vous pouvez accéder aux rapports de données normatives sur VALD Hub, depuis le tableau de bord. Voir ici pour un guide rapide.

Figure 17. Normative data reports can be found in the Reports tab, by selecting Normative Data Reports from the dropdown menu.

Figure 17. Les rapports sur les données normatives sont accessibles dans l'onglet « Rapports », en sélectionnant « Rapports sur les données normatives » dans le menu déroulant.