Annexe · Rappels mathématiques

Corrélation, régression, test de Student et intervalle de confiance

Le sens de chaque outil, sa formule, et ce qu'il ne dit pas. Les calculs complets se font au tableur — l'annexe donne la logique et les repères de lecture.

Dépendance linéaire

Coefficient de corrélation (r)

r mesure la force et le sens d'un lien linéaire entre deux variables quantitatives. Il varie de −1 à +1.
−1
lien négatif parfait
−0,5
0
aucun lien linéaire
+0,5
+1
lien positif parfait
Deux pièges majeurs. (1) r fort ≠ causalité : un facteur tiers peut piloter les deux variables. (2) r proche de 0 ne veut pas dire « aucune relation » : une relation en cloche donne r ≈ 0 alors que le lien est fort. Toujours regarder le nuage de points avant d'interpréter r.
Prédiction / tendance

Régression linéaire (droite des moindres carrés)

La régression ajuste la droite y = a·x + b qui passe « au plus près » de tous les points (elle minimise la somme des carrés des écarts verticaux). Utile pour estimer une tendance, par exemple la dynamique d'une population dans le temps.
y = a·x + b a = pente (fonction PENTE) : de combien y varie quand x augmente d'une unité. b = ordonnée à l'origine (ORDONNEE.ORIGINE) : valeur de y quand x = 0.
Coefficient de détermination R². C'est r au carré : il indique la part de la variabilité de y « expliquée » par x. R² = 0,85 → 85 % de la variation de y est associée à x ; les 15 % restants relèvent d'autres facteurs ou du hasard.
Ne jamais extrapoler. Une droite ajustée sur des x de 4 à 9 n'est pas valable en x = 12 : au-delà de la plage observée, rien ne garantit que la relation se prolonge.
Comparer deux groupes

Test de Student et logique de la p-value

Le test de Student répond à : « l'écart observé entre deux moyennes est-il trop grand pour être dû au seul hasard d'échantillonnage ? » Il compare l'écart des moyennes à la variabilité interne des groupes, en tenant compte des effectifs.
Hypothèse nulle H₀ : les deux moyennes sont égales Le test calcule la probabilité (p-value) d'observer un écart au moins aussi grand que le vôtre SI H₀ était vraie.
Lecture de la p-value (seuil usuel : 0,05) :
p < 0,05 → l'écart est peu probable sous H₀ → on rejette H₀ → différence dite significative.
p ≥ 0,05 → l'écart est compatible avec le hasard → on ne rejette pas H₀ → différence non significative.
Trois contresens à éviter. (1) « non significatif » ≠ « pas de différence » (surtout sur petit effectif : le test manque de puissance). (2) La p-value n'est pas la probabilité que H₀ soit vraie. (3) « significatif » ne veut pas dire « important » : sur de très grands échantillons, un écart minuscule et sans intérêt biologique peut ressortir significatif. La taille de l'effet compte autant que la p-value.
Précision d'une estimation

Intervalle de confiance (IC)

L'IC à 95 % est la fourchette dans laquelle se trouve « raisonnablement » la vraie valeur (moyenne d'une population, proportion…), compte tenu de l'échantillon. Plus l'échantillon est grand et peu dispersé, plus l'IC est étroit.
IC₉₅ ≈ x̄ ± t · ( s / √n ) s = écart-type, n = effectif, t = coefficient lu dans la loi de Student (petits échantillons) ou approché par 1,96 pour la loi normale (grands échantillons). Le terme s/√n est l'erreur standard.
Cas Cistude : x̄ = 121 mm, s ≈ 30 mm, n = 37.
Erreur standard : 30 / √37 = 30 / 6,08 = 4,9 mm
Demi-largeur (t ≈ 2,03 pour n=37) : 2,03 × 4,9 ≈ 10 mm
IC₉₅ ≈ 121 ± 10 → [111 ; 131] mm
Loi normale ou loi de Student ? Grand échantillon (n ≳ 30) → l'approximation normale suffit (t ≈ 1,96). Petit échantillon → loi de Student, dont le coefficient t est plus grand (IC plus large) pour refléter l'incertitude supplémentaire.
Fonctions tableur

Mémo des formules

BesoinFonction (tableur FR)
Coefficient de corrélation r=COEFFICIENT.CORRELATION(X;Y)
Pente de la droite=PENTE(Y;X)
Ordonnée à l'origine=ORDONNEE.ORIGINE(Y;X)
Coefficient R²=COEFFICIENT.DETERMINATION(Y;X)
p-value comparaison de moyennes=TEST.STUDENT(G1;G2;2;2)
Écart-type d'échantillon=ECARTYPE.STANDARD(plage)
← Retour à la leçon 3 — Mettre une hypothèse à l'épreuve