Empilez les deux groupes dans une seule colonne, classez toutes les valeurs avec MOYENNE.RANG(valeur; plage; 1), additionnez les rangs du groupe 1 avec SOMME.SI, puis U1 = R1 − n1(n1+1)/2. Convertissez U en score z et obtenez la valeur p avec =2*LOI.NORMALE.STANDARD(-ABS(z)).
Les noms de fonctions et le séparateur « ; » correspondent à un classeur en français (Fichier › Paramètres › Paramètres régionaux). Dans un classeur en anglais, utilisez les noms anglais et la virgule.
Les données de l'exemple
L'équipe d'un site web a mesuré le temps (en minutes) mis par des utilisateurs pour accomplir une tâche avec l'ancienne mise en page et avec une nouvelle, dix utilisateurs différents dans chaque cas. Les temps de réalisation sont souvent asymétriques à cause de quelques utilisateurs très lents, donc un test sur les rangs est un choix raisonnable. Placez le groupe en colonne A (saisissez Ancienne ou Nouvelle) et le temps en colonne B, un utilisateur par ligne (lignes 2 à 21) :
| Ancienne mise en page | 12,4 | 15,1 | 9,8 | 22,5 | 13,7 | 18,2 | 11,0 | 30,4 | 14,6 | 16,9 |
|---|---|---|---|---|---|---|---|---|---|---|
| Nouvelle mise en page | 8,1 | 10,2 | 7,5 | 12,9 | 9,4 | 11,6 | 6,8 | 14,0 | 9,0 | 19,7 |
Étape 1 : classer toutes les valeurs ensemble
En C2, à recopier jusqu'en C21 :
=MOYENNE.RANG(B2; $B$2:$B$21; 1)
Le 1 classe de la plus petite à la plus grande valeur. MOYENNE.RANG attribue aux ex æquo la moyenne de leurs rangs, ce que le test exige. Le temps le plus court (6,8) reçoit le rang 1 et le plus long (30,4) le rang 20.
Étape 2 : sommes des rangs et U
| Cellule | Signification | Formule | Résultat |
|---|---|---|---|
| F2 | n1 (ancienne) | =NB.SI(A2:A21; "Ancienne") | 10 |
| F3 | n2 (nouvelle) | =NB.SI(A2:A21; "Nouvelle") | 10 |
| F4 | R1, somme des rangs de l'ancienne | =SOMME.SI(A2:A21; "Ancienne"; C2:C21) | 137 |
| F5 | U1 | =F4-F2*(F2+1)/2 | 82 |
| F6 | U2 | =F2*F3-F5 | 18 |
| F7 | U (le plus petit) | =MIN(F5; F6) | 18 |
U1 = 82 sur un maximum de n1 × n2 = 100 signifie que, dans 82 % des paires d'utilisateurs ancienne/nouvelle, l'utilisateur de l'ancienne mise en page a été plus lent.
Étape 3 : z et la valeur p
F8 (z) : =(F7-F2*F3/2)/RACINE(F2*F3*(F2+F3+1)/12)
F9 (p) : =2*LOI.NORMALE.STANDARD(-ABS(F8))
Résultats : z = −2,42 et p = 0,016. La différence est significative au seuil de 0,05. La valeur p exacte, que certains logiciels utilisent pour des échantillons aussi petits, est de 0,015 (0,017 avec une correction de continuité) : même conclusion.
Étape 4 : taille d'effet
Deux tailles d'effet sont courantes. r = |z| / √N = 2,42 / √20 = 0,54 (fort ; les repères sont 0,1 ; 0,3 et 0,5). La corrélation bisériale de rang = 1 − 2U / (n1n2) = 1 − 36/100 = 0,64.
Sélectionnez vos données, cliquez sur Lancer : tableau de résultats complet, vérification des conditions, interprétation en phrases simples et ligne APA, gratuitement dans Google Sheets.
Décrire les groupes avec des médianes
Comme le test travaille sur des rangs, rapportez des médianes plutôt que des moyennes : =MEDIANE(FILTER(B2:B21; A2:A21="Ancienne")) donne 14,85 minutes, et la même formule pour « Nouvelle » donne 9,80 minutes.
Points de vigilance
- Ex æquo : avec beaucoup de valeurs identiques, la formule de z ci-dessus surestime légèrement la dispersion. Les logiciels appliquent une correction pour les ex æquo.
- Petits échantillons : en dessous d'environ 10 par groupe, préférez une valeur p exacte.
- Données appariées : si les mêmes personnes sont mesurées deux fois, utilisez plutôt le test des rangs signés de Wilcoxon.
- Ce qu'il teste : à strictement parler, si les valeurs d'un groupe tendent à être plus grandes que celles de l'autre. Ce n'est un test de médianes que si les deux groupes ont la même forme.
Comment rédiger le résultat (style APA)
Les temps de réalisation étaient plus longs avec l'ancienne mise en page (Mdn = 14,85 min) qu'avec la nouvelle (Mdn = 9,80 min). Un test U de Mann-Whitney a montré que la différence était significative, U = 18, z = −2,42, p = 0,016, r = 0,54.
Questions fréquentes
Quand utiliser Mann-Whitney plutôt qu'un test t ?
Utilisez-le pour deux groupes indépendants quand les données sont ordinales (rangs, notes d'évaluation) ou clairement non normales avec de petits échantillons, ou quand des valeurs aberrantes fausseraient les moyennes.
Le test U de Mann-Whitney est-il le même que le test de la somme des rangs de Wilcoxon (Wilcoxon rank-sum) ?
Oui. Ce sont deux noms pour le même test, qui donnent la même valeur p. Le test des rangs signés de Wilcoxon est différent : il sert pour des données appariées.
Quel U faut-il rapporter ?
Beaucoup de manuels et SPSS rapportent le plus petit de U1 et U2 (18 ici), tandis que R et SciPy rapportent le U du premier groupe (82 ici). Les deux donnent la même valeur p. Précisez lequel vous rapportez, et donnez les médianes pour que le sens soit clair.
L'approximation normale est-elle précise pour de petits échantillons ?
Elle est raisonnable à partir d'environ 10 valeurs par groupe. Pour des échantillons plus petits, ou avec beaucoup d'ex æquo, une valeur p exacte est préférable ; ExplainStats calcule automatiquement la valeur p exacte pour les petits échantillons.
Sélectionnez vos données, cliquez sur Lancer : tableau de résultats complet, vérification des conditions, interprétation en phrases simples et ligne APA, gratuitement dans Google Sheets.