Skip to main content

Évaluations nationales des acquis scolaires, Volume 4

Page 1

Analyser les données issues d’une évaluation nationale des acquis scolaires


Évaluations nationales des acquis scolaires

VOLUME 4

Analyser les données issues d’une évaluation nationale des acquis scolaires Gerry Shiel Fernando Cartwright

Vincent Greaney et Thomas Kellaghan, éditeurs de la série


© 2015 Banque internationale pour la reconstruction et le développement/La Banque mondiale 1818 H Street NW, Washington, DC 20433 Téléphone : 202–473–1000 ; Internet : www.worldbank.org Certains droits réservés La publication originale de cet ouvrage est en anglais sous le titre, Analyzing Data from a National Assessment of Educational Achievement. Vol. 4 of National Assessments of Educational Achievement, en 2015. En cas de contradictions, la langue originelle prévaudra. Cet ouvrage a été établi par les services de la Banque mondiale avec la contribution de collaborateurs extérieurs. Les observations, interprétations et opinions qui y sont exprimées ne reflètent pas nécessairement les vues de la Banque mondiale, de son Conseil des Administrateurs ou des pays que ceux-ci représentent. La Banque mondiale ne garantit pas l’exactitude des données citées dans cet ouvrage. Les frontières, les couleurs, les dénominations et toute autre information figurant sur les cartes du présent ouvrage n’impliquent de la part de la Banque mondiale aucun jugement quant au statut juridique d’un territoire quelconque et ne signifient nullement que l’institution reconnaît ou accepte ces frontières. Rien de ce qui dans le présent ouvrage ne constitue ni ne peut être considéré comme une limitation des privilèges et immunités de la Banque mondiale, ni comme une renonciation à ces privilèges et immunités, qui sont expressément réservés. Droits et autorisations

L’utilisation de cet ouvrage est soumise aux conditions de la licence Creative Commons Attribution 3.0 IGO (CC BY 3.0 IGO) http://creativecommons.org/licenses/by/3.0/igo/ Conformément aux termes de la licence Creative Commons Attribution (paternité), il est possible de copier, distribuer, transmettre et adapter le contenu de l’ouvrage, notamment à des fins commerciales, sous réserve du respect des conditions suivantes : Mention de la source — L’ouvrage doit être cité de la manière suivante : Shiel, Gerry, et Fernando Cartwright. 2015. Évaluations nationales des acquis scolaires. Volume 4 : Analyser les données issues d’une évaluation nationale des acquis scolaires, sous la conduite de Vincent Greaney et Thomas Kellaghan. Washington, DC : La Banque mondiale. DOI : 10.1596/978-1-4648-0508-0 Licence : Creative Commons Attribution CC BY 3.0 IGO Traductions — Si une traduction de cet ouvrage est produite, veuillez ajouter à la mention de la source de l’ouvrage le déni de responsabilité suivant : Cette traduction n’a pas été réalisée par la Banque mondiale et ne doit pas être considérée comme une traduction officielle de cette dernière. La Banque mondiale ne saurait être tenue responsable du contenu de la traduction ni des erreurs qu’elle pourrait contenir. Adaptations — Si une adaptation de cet ouvrage est produite, veuillez ajouter à la mention de la source le déni de responsabilité suivant : Cet ouvrage est une adaptation d’une oeuvre originale de la Banque mondiale. Les idées et opinions exprimées dans cette adaptation n’engagent que l’auteur ou les auteurs de l’adaptation et ne sont pas validées par la Banque mondiale. Contenu tiers — La Banque mondiale n’est pas nécessairement propriétaire de chaque composante du contenu de cet ouvrage. Elle ne garantit donc pas que l’utilisation d’une composante ou d’une partie quelconque du contenu de l’ouvrage ne porte pas atteinte aux droits des tierces parties concernées. L’utilisateur du contenu assume seul le risque de réclamations ou de plaintes pour violation desdits droits. Pour réutiliser une composante de cet ouvrage, il vous appartient de juger si une autorisation est requise et de l’obtenir le cas échéant auprès du détenteur des droits d’auteur. Parmi les composantes, on citera, à titre d’exemple, les tableaux, les graphiques et les images. Pour tous renseignements sur les droits et licences doivent être adressées à World Bank Publications, The World Bank, 1818 H Street, NW Washington, DC, 20433, USA ; télécopie : 202–522–2625 ; courriel : pubrights@ worldbank.org. ISBN (imprimé) : 978-1-4648-0508-0 ISBN (digital) : 978-1-4648-0515-8 DOI : 10.1596/978-1-4648-0508-0 Conception de la page de couverture : Naylor Design, Washington DC Item and Test Analysis (IATA) © 2015 Fernando Cartwright. Utilisé avec autorisation. Une autorisation est requise pour toute réutilisation. Microsoft, Access, Excel, Office, Windows, et Word sont des marques déposées ou commerciales de Microsoft Corporation aux États-Unis/ou dans d’autres pays. SPSS est une marque déposée d’IBM. WesVar est une marque déposée de Westat.


TABLE DES MATIÈRES

PRÉFACE

xvii

À PROPOS DES AUTEURS ET ÉDITEURS

xix

REMERCIEMENTS

xxi

ABRÉVIATIONS

xxiii

INTRODUCTION

1

Note

6 Partie I Introduction à l’analyse statistique des données d’une évaluation nationale Gerry Shiel

1. LA BASE DE DONNÉES POUR LES ANALYSES

Enregistrement des fichiers du CD sur votre disque dur ou votre serveur Instruments d’enquête Poids déterminé par le plan d’échantillonnage SPSS WesVar Notes

9

11 13 14 17 20 20 v


VI

| TABLE DES MATIÈRES

2. ANALYSE DES DONNÉES D’UNE ÉVALUATION NATIONALE À L’AIDE DE SPSS

Mesures de la tendance centrale Mesure de la dispersion Mesure de la position Mesure de la forme Analyse d’un ensemble de données à l’aide de SPSS Notes 3. INTRODUCTION À WESVAR

Création d’un fichier de données dans WesVar Attribution d’intitulés aux valeurs des variables Calcul des statistiques descriptives dans WesVar Calcul d’un score moyen et de son erreur-type Calcul des scores moyens et de leurs erreurs-types pour des sous-groupes de la population Notes 4. COMPARAISON DES PERFORMANCES DE DEUX GROUPES OU PLUS

Examen de la différence entre deux scores moyens Examen des différences entre trois scores moyens ou plus

21

22 22 23 24 26 32 33

33 34 35 40 43 45

47

47 53

5. IDENTIFICATION DES ÉLÈVES TRÈS OU PEU PERFORMANTS 59

Estimation des scores correspondant aux rangs centiles clés nationaux Estimation du pourcentage d’élèves dans des sous-groupes, en utilisant les rangs centiles nationaux 6. ASSOCIATION ENTRE LES VARIABLES : CORRÉLATION ET RÉGRESSION

Correlation Régression Corrélation et causalité Notes 7. PRÉSENTATION DES DONNÉES À L’AIDE DE DIAGRAMMES ET GRAPHIQUES

Diagrammes Graphiques linéaires avec intervalles de confiance

60 65

71

71 78 94 96

99 100 106


TABLE DES MATIÈRES

Graphiques linéaires pour la présentation des données de tendance Note

| VII

109 111

I.A. ANALYSE DES DONNÉES DE L’ÉVALUATION NATIONALE DES ACQUIS SCOLAIRES : STRUCTURE DU RÉPERTOIRE DES FICHIERS

113

I.B. ANALYSE DES DONNÉES DE L’ÉVALUATION NATIONALE DES ACQUIS SCOLAIRES : SOUS-RÉPERTOIRES ET FICHIERS

115

I.C. OUVERTURE D’UN FICHIER SPSS DANS WESVAR

119

Notes

126

Partie II Analyse des Items et des Tests Fernando Cartwright 8. INTRODUCTION À IATA

Installation d’IATA Données de l’évaluation Données produites par IATA Interprétation des résultats d’IATA Données des échantillons Séquence des tâches d’analyse et interfaces d’IATA Navigation DANS les séquences de tâches d’IATA Notes 9. ANALYSE DES DONNÉES ISSUES DE L’ADMINISTRATION D’UN TEST PILOTE

Étape 1 : Chargement des données des réponses Étape 2 : Chargement des clés de codage Étape 3 : Spécification de l’analyse Étape 4 : Analyse des items Étape 5 : Dimensionnalité du test Étape 6 : Fonctionnement différentiel des items Étape 7 : Examen des échelles de scores Étape 8 : Sélection des items de test

129

129 130 142 142 144 146 149 151

153

155 157 158 161 172 178 184 188


VIII

| TABLE DES MATIÈRES

Étape 9 : Normes de performance Étape 10 : Affichage et enregistrement des résultats Notes

193 193 195

10. ANALYSE COMPLÈTE DES DONNÉES ISSUES DE L’ADMINISTRATION FINALE D’UN TEST

197

Étape 1 : Spécification de l’analyse Étape 2 : Résultats de base de l’analyse Étape 3 : Analyse du fonctionnement différentiel des items Étape 4 : Définition d’échelles Étape 5 : Sélection des items de test Étape 6 : Détermination de normes de performance Étape 7 : Enregistrement des résultats Note

198 200 200 202 207 209 218 218

11. ANALYSE DES CARNETS EN ROTATION

219

Étape 1 : Chargement des données Étape 2 : Spécifications de l’analyse Étape 3 : Résultats de l’analyse des items

219 221 222

12. ANALYSE DES ITEMS À CRÉDIT PARTIEL

Étape 1 : Chargement des données Étape 2 : Spécifications de l’analyse Étape 3 : Résultats de l’analyse des items 13. COMPARAISON DES ÉVALUATIONS

Étape 1: Spécifications de l’analyse Étape 2 : Liaison des items communs Étape 3 : Redéfinition de l’échelle des résultats liés Étape 4 : Détermination des normes de performance Notes 14. UTILISATIONS PARTICULIÈRES D’IATA

Liaison des données des items Sélection des items de test optimaux Détermination et attribution des normes de performance Analyse des données des réponses avec les paramètres des items ancrés Note

225

225 227 228 233

235 238 243 245 248 249

250 253 256 259 266


TABLE DES MATIÈRES

| IX

15. SYNTHÈSE DES EXEMPLES IATA

267

II.A. THÉORIE DE LA RÉPONSE À L’ITEM

271

Note

279

RÉFÉRENCES

281

ENCADRÉ

6.1 Variables d’une régression standard

81

EXERCICE

1.1 Exécution de statistiques descriptives dans SPSS et enregistrement des fichiers 2.1 Utilisation d’Explore dans SPSS pour une seule variable dépendante (un niveau) 2.2 Utilisation d’Explore dans SPSS pour une seule variable dépendante (plus d’un niveau) 3.1 Génération de statistiques descriptives dans WesVar 3.2 Calcul d’un score moyen et de son erreur-type dans WesVar 3.3 Calcul des scores moyens et erreurs-types dans WesVar, pour quatre régions 4.1 Évaluation de la différence entre deux scores moyens 4.2 Évaluation des différences entre trois scores moyens ou plus 5.1 Calcul des scores des centiles nationaux 5.2 Calcul des scores des centiles par région 5.3 Recodage d’une variable en catégories de centiles à l’aide de WesVar 5.4 Calcul du pourcentage des élèves ayant un score inférieur aux centiles nationaux clés de référence et de l’erreur-type associée, par région 6.1 Création d’un diagramme de dispersion dans SPSS 6.2 Calcul d’un coefficient national de corrélation 6.3 Exécution d’une régression dans WesVar, avec une variable indépendante (continue) 6.4 Exécution de la régression dans WesVar, avec une variable indépendante (catégorielle) 6.5 Estimation des coefficients de corrélation 6.6 Exécution d’une régression dans WesVar, avec plus d’une variable indépendante

18 26 31 36 41 43 49 54 60 63 65

68 73 76 82 86 88 90


X

| TABLE DES MATIÈRES

7.1 Production d’un diagramme en colonnes pour montrer la performance par niveau de compétence (données nationales) 7.2 Production d’un diagramme à barres pour montrer le pourcentage à chaque niveau de compétence par région 7.3 Traçage des intervalles de confiance de 95 % d’une série de scores moyens 7.4 Présentation des données de tendance dans un graphique linéaire

100 102 106 109

FIGURES DES EXERCICES

1.1.A 1.1.B 2.1.A 2.1.B 2.2.A 3.1.A 3.1.B 3.1.C 3.1.D 3.2.A 3.2.B 3.3.A 3.3.B 4.1.A 4.1.B 4.1.C

4.2.A 4.2.B 4.2.C

Boîte de dialogue pour l’utilisation des poids Boîte de dialogue Descriptives de SPSS Diagramme à tiges et à feuilles de l’échelle des scores en mathématiques Tracé en rectangle et moustaches de l’échelle des scores en mathématiques Tracé en rectangle et moustaches de l’échelle des scores en mathématiques Nouveau classeur WesVar Spécifications des variables pour l’analyse dans WesVar Descriptives Données de sortie de WesVar Descriptives Exportation d’un fichier WesVar Spécification du calcul d’une statistique dans un tableau WesVar Tableau des résultats dans WesVar : Calcul du score moyen Classeur WesVar avant calcul des scores moyens par région Résultats WesVar du calcul des scores moyens par région Classeur WesVar avant l’évaluation de la différence entre deux scores moyens Résultats WesVar : Scores moyens en mathématiques des élèves avec et sans électricité à la maison Résultats WesVar : Différence entre les scores moyens en mathématiques des élèves ayant ou non l’électricité à la maison Classeur WesVar montrant un ajustement du seuil alpha Fin de la définition des cellules dans WesVar Classeur WesVar : Fonctions des cellules

18 19 29 30 32 37 37 38 40 42 42 44 45 51 51

52 54 55 56


TABLE DES MATIÈRES

4.2.D 4.2.E 5.1.A 5.1.B 5.2.A 5.2.B 5.3.A 5.3.B 5.4.A 5.4.B 6.1.A 6.1.B

6.1.C 6.2.A 6.2.B

6.3.A 6.3.B 6.3.C 6.3.D

Résultats WesVar : Scores moyens en mathématiques par région Résultats WesVar : Différences entre les scores moyens en mathématiques par région Classeur WesVar : Calcul des scores des centiles Résultat WesVar : Calcul des scores des centiles Classeur WesVar avant le calcul des scores des centiles par région Résultat WesVar partiel : Calcul des scores au 10e centile, par région Classeur WesVar : Recodage de Mathss en variables discrètes Attribution d’intitulés aux catégories de centiles dans WesVar Classeur WesVar avant le calcul du pourcentage de scores inférieurs aux références nationales clés, par région Résultat partiel : Pourcentage des élèves dont les scores sont inférieurs aux références nationales clés, par région Boîte de dialogue SPSS avant la création du diagramme de dispersion Diagramme de dispersion de la relation entre la mise en œuvre de procédures et la résolution de problèmes mathématiques Diagramme de dispersion montrant la droite de meilleur ajustement Classeur WesVar avant l’exécution de l’analyse de corrélation Résultat WesVar : Corrélation entre la résolution de problèmes et la mise en œuvre de procédures mathématiques Classeur WesVar avant l’exécution de la régression à une variable indépendante Résultat de la régression dans WesVar, avec une variable indépendante : Somme des carrés et valeur de R au carré Résultat de la régression dans WesVar, avec une variable indépendante : Coefficients estimés Résultat de la régression dans WesVar, avec une variable indépendante : Test de l’ajustement du modèle

| XI

57 57 61 62 63 64 66 67 68 69 74

74 75 77

77 83 83 84 85


XII

| TABLE DES MATIÈRES

6.4.A 6.5.A 6.6.A 6.6.B 6.6.C 6.6.D 7.1.A 7.1.B 7.1.C 7.2.A 7.2.B 7.2.C 7.2.D 7.2.E 7.3.A 7.3.B 7.3.C 7.3.D 7.4.A 7.4.B

Résultat de l’analyse de régression dans WesVar : Variable catégorielle indépendante Résultat pour les corrélations entre des variables indépendantes Écran de WesVar avant l’exécution de la régression avec plus d’une variable indépendante Résultat de la régression dans WesVar, avec plus d’une variable indépendante : Somme des carrés Résultat de la régression dans WesVar, avec plus d’une variable indépendante : Coefficients estimés Résultat de la régression dans WesVar, avec plus d’une variable indépendante : Test d’ajustement du modèle Pourcentages des élèves à chaque niveau de performance Options de diagrammes dans Excel Pourcentage d’élèves à chaque niveau de compétence en mathématiques Pourcentage d’élèves à chaque niveau de compétence en mathématiques, par région Options de diagrammes 2-D à barres dans Excel Pourcentage d’élèves à chaque niveau de compétence en mathématiques, par région Permuter les lignes et les colonnes à l’aide des outils de diagramme d’Excel Pourcentage d’élèves à chaque niveau de compétence en mathématiques, par région Scores moyens en mathématiques et scores aux intervalles de confiance supérieurs et inférieurs, par région Options de format pour un axe dans Excel Options de format pour les séries de données dans Excel Graphique linéaire des scores moyens en mathématiques et intervalles de confiance de 95 %, par région Feuille de calcul Excel avec les scores moyens en mathématiques par sexe, 2004 à 2013 Scores moyens en mathématiques par sexe, 2004 à 2013

87 89 90 91 92 93 101 101 102 103 103 104 104 105 107 107 108 108 110 110

TABLEAUX DES EXERCICES

2.1.A 2.1.B 4.1.A

Résumé du traitement des cas Statistiques descriptives Comparaison des scores moyens en mathématiques des élèves ayant ou non l’électricité à la maison

27 28 52


TABLE DES MATIÈRES

4.2.A 5.1.A 5.2.A

Comparaison des scores moyens en mathématiques des élèves avec ou sans électricité à la maison, par région Scores nationaux en mathématiques (et erreurs-types) à différents centiles Scores en mathématiques (et erreurs-types) à différents centiles, par région

| XIII

58 62 64

FIGURES

2.1 Distribution normale montrant les unités d’écart-type 2.2 Exemples de distributions avec une asymétrie positive, une asymétrie négative et aucune asymétrie 3.1 Attribution d’intitulés aux valeurs des variables dans WesVar 6.1 Corrélations positives et négatives 6.2 Droite de régression et équation de régression d’un nuage de points I.C.1 Agrégation des données dans SPSS I.C.2 Ajout de variables à un fichier SPSS I.C.3 Liste des variables disponibles dans le fichier de données WesVar I.C.4 Création de poids dans WesVar I.C.5 Poids de rééchantillonnage créé par WesVar 8.1 Exemples de formatage incorrect et correct des données 8.2 Sélection initiale de la langue et inscription facultative à IATA 8.3 Menu principal d’IATA 8.4 Boîte d’instructions de l’interface des tâches et boutons de navigation d’IATA 9.1 Séquence des tâches d’analyse des données des réponses 9.2 Écran de chargement des données des réponses 9.3 Réponses aux items, données de PILOT1 9.4 Spécifications de l’analyse, données de PILOT1 9.5 Résultats de l’analyse des items, MATHC1019, données de PILOT1 9.6 Résultats de l’analyse des items, MATHC1027, données de PILOT1 9.7 Résultats de l’analyse de l’item, MATHC1075, données de PILOT1 9.8 Résultats de l’analyse des items après exclusion d’un item, MATHC1075, données de PILOT1 9.9 Dimensionnalité du test et de l’item, MATHC1019, données de PILOT1

24 25 35 72 80 121 123 124 125 126 132 147 148 150 154 156 158 159 162 168 169 170 173


XIV

|

TABLE DES MATIÈRES

9.10

Résultats de la dimensionnalité de l’item, MATHC1035, données de PILOT1 9.11 Résultats de la dimensionnalité de l’item, MATHC1002, données de PILOT1 9.12 Résultats de l’analyse du FDI par sexe, MATHC1046, données de PILOT1 9.13 Résultats de l’analyse du FDI par sexe, MATHC1035, données de PILOT1 9.14 Résultats de l’analyse du FDI par sexe, MATHC1042, données de PILOT1 9.15 Résultats de l’analyse du FDI par langue parlée à la maison par les élèves, MATHC1006, données de PILOT1 9.16 Écran d’examen et de définition d’une échelle 9.17 Résultat de la sélection des items, 50Items, données de PILOT1 9.18 Résultat de la sélection des items, 79Items, données de PILOT1 9.19 Examen des résultats de l’analyse, données de PILOT1 10.1 Spécifications de l’analyse, données de CYCLE1 10.2 Résultats de l’analyse DIF par zone, données de CYCLE1, MATHC1043 10.3 Distribution de la compétence (score TRI) et information du test, données de CYCLE1 10.4 Comparaison de l’information idéale du test et de la distribution normale 10.5 Distribution et statistiques synthétiques d’une nouvelle échelle de scores (NAMscore), données de CYCLE1 10.6 Sélection des items, données de CYCLE1 10.7 Écran des normes de performance par défaut, données de CYCLE1 10.8 Interface des normes de performance, PR = 50 %, données de CYCLE1 10.9 Données des signets, PR = 50 %, données de CYCLE1 10.10 Écran des normes de performance avec des seuils définis manuellement, données de CYCLE1 11.1 Réponses des élèves, données de PILOT2 11.2 Spécifications de l’analyse, rotation des carnets de test, données de PILOT2 11.3 Résultats de l’analyse des items, données de PILOT2, MATHC2003

174 177 179 181 182 183 185 189 192 194 199 202 204 205 207 208 211 213 214 217 220 221 222


TABLE DES MATIÈRES

Clés de codage et métadonnées des items, données de PILOT2 12.2 Spécifications de l’analyse, rotation des carnets avec des items à crédit partiel, données de PILOT2 12.3 Résultats de l’analyse des items, données de PILOT2, MATHC2003 12.4 Fonction de réponse à l’item à crédit partiel, données de CYCLE2, MATHSA001, score = 2 13.1 Séquence de tâches de l’analyse des données des réponses avec liaison 13.2 Données de référence des items dans CYCLE1 à lier aux données de CYCLE2 13.3 Résultats de l’analyse des items, données de CYCLE2, MATHSA005, score = 1 13.4 Résultats de la liaison des items communs, entre CYCLE2 et CYCLE1 13.5 Résultats de la liaison des items communs, CYCLE2 à CYCLE1, MATHC1052 13.6 Scores au test de CYCLE2 exprimés sur l’échelle de CYCLE1 (NAMscore) 13.7 Détermination des normes de performance, données de CYCLE2 14.1 Sélection des items de test optimaux, données de CYCLE1 14.2 Données des items de CYCLE3 avec des paramètres pour les items ancrés 14.3 Résultats de l’analyse des items avec les paramètres des items ancrés, données de CYCLE3, MATHC2047 II.A.1 Distributions de la compétence des élèves ayant répondu de manière correcte et erronée à un item de test donné (facilité = 0,50 ; compétence moyenne des élèves ayant bien répondu = 0) II.A.2 Distributions de la compétence des élèves ayant répondu de manière correcte et erronée à un item de test donné (facilité = 0,50 ; compétence moyenne des élèves ayant bien répondu = 0,99) II.A.3 Distributions de la compétence des élèves ayant répondu de manière correcte et erronée à un item de test donné et probabilité conditionnelle de réponse correcte (facilité = 0,60 ; compétence moyenne des élèves ayant bien répondu = 0,40)

| XV

12.1

226 227 228 229 235 237 238 239 241 244 247 256 262 263

274

275

276


XVI

|

TABLE DES MATIÈRES

TABLEAUX

1.1 Test de mathématiques : distribution des items par domaine de contenu et processus 1.2 Brève description des questionnaires 5.1 Pourcentages des élèves ayant des scores inférieurs au 75e centile national de référence, par région 5.2 Pourcentage des élèves ayant des scores supérieurs ou égaux au 75e centile national de référence, par région 8.1 Variables produites ou utilisées par IATA pour décrire la compétence des élèves et leur performance aux tests 8.2 Variables d’un fichier de données des items 8.3 Exemple extrait d’un fichier de données des items 8.4 Exemple extrait d’un fichier des items pour un item à crédit partiel 8.5 Tableaux de données produits par IATA 8.6 Symboles de signalisation routière utilisés par IATA et leur signification 8.7 Tâches IATA et séquences de tâches qui les utilisent 9.1 Analyse des distracteurs, MATHC1019, données de PILOT1

13 15 70 70 137 138 138 141 143 144 149 166


PRÉFACE

La mesure des acquis des élèves est essentielle pour le suivi d’un système éducatif et l’amélioration de la qualité de l’enseignement. L’information sur la performance des élèves peut éclairer un large éventail de politiques et de décisions relatives à l’éducation, notamment concernant la conception et la mise en œuvre de programmes visant à améliorer l’enseignement et l’apprentissage dans les classes et la mise à disposition d’un appui et d’une formation appropriés là où ils sont le plus nécessaires. La série de publications Évaluations nationales des acquis scolaires, dont cet ouvrage est le quatrième volume, porte sur les procédures de pointe qui doivent être suivies pour s’assurer que les données (telles que des scores aux tests et des informations contextuelles) produites par une évaluation nationale à grande échelle soient techniquement de qualité et répondent aux préoccupations des responsables des politiques, des décideurs et d’autres parties prenantes du système éducatif. Le volume 1 de la série présente les objectifs et les principales caractéristiques des évaluations nationales des acquis scolaires et s’adresse principalement aux responsables des politiques et aux décideurs en matière d’éducation. Le volume 2 traite de la mise au point de deux types d’instruments de collecte des données utilisés dans les évaluations nationales : les tests de performance destinés aux élèves et les questionnaires contextuels. Le volume 3 est centré sur les tâches

xvii


XVIII

| PRÉFACE

pratiques nécessaires à la mise en œuvre d’une évaluation à grande échelle et fournit, notamment, des instructions détaillées étape par étape pour la logistique, l’échantillonnage, le nettoyage et la gestion des données. Ce quatrième volume, Analyser les données issues d’une évaluation nationale des acquis scolaires, aborde la façon de générer l’information sur les items de test et les scores aux tests, et de relier ces scores à des facteurs sociaux et éducatifs. Tout comme les volumes 2 et 3, il s’adresse principalement à des équipes chargées de conduire des évaluations nationales dans des économies en développement et émergentes. Enfin, le volume 5 aborde la façon de rédiger des rapports fondés sur les constatations des évaluations nationales et la manière d’exploiter les résultats pour améliorer la qualité des politiques et la prise de décision en matière d’éducation. Cette question est particulièrement importante pour ceux qui ont la responsabilité d’élaborer les rapports d’évaluation, et de communiquer et utiliser les conclusions. Au fil des pages de ce quatrième volume, le lecteur prendra conscience des difficultés et des possibilités d’analyse des données associées à une évaluation nationale à grande échelle. Pour découvrir complètement ce que les données apprennent sur la qualité, l’équité et d’autres aspects de la performance dans un système d’éducation, l’analyste doit utiliser un éventail de techniques décrites dans la partie I de ce volume. La partie II présente une technique analytique clé, la théorie de la réponse à l’item (TRI). Le volume introduit également un logiciel TRI facile à utiliser appelé Item and Test Analysis (IATA – analyse d’items et de tests). Qu’elles apprennent ce qu’est la TRI ou en aient déjà connaissance, les équipes d’évaluation du monde entier devraient trouver l’IATA très utile et l’ajouter à leur panoplie d’instruments d’analyse des données. Marguerite Clarke Spécialiste senior de l’éducation/coordinatrice d’évaluations de l’apprentissage Août 2014


À PROPOS DES AUTEURS ET ÉDITEURS

AUTEURS Fernando Cartwright est psychométricien, chercheur en sciences sociales et architecte/développeur de logiciels. Il a travaillé sur de nombreuses évaluations nationales et internationales des savoir-faire et acquis scolaires, notamment le Programme international pour le suivi des acquis des élèves (PISA) et l’Enquête sur la littératie et les compétences des adultes (ELCA). Il est l’architecte de plusieurs projets de mesure sociale, notamment l’indice composite d’apprentissage, l’indice européen d’apprentissage tout au long de la vie et le Third Billion Index. Il a produit un logiciel lié aux mesures dans l’éducation, à savoir Item and Test Analysis (IATA), ainsi que des applications web pour la mise au point de tests, le stockage des items, l’exécution des tests ainsi que l’analyse et l’évaluation des données. Il vit à Ottawa. Gerry Shiel est chercheur à l’Educational Research Centre du St Patrick’s College de Dublin. Il a dirigé l’élaboration d’une série de tests normalisés des performances dans les domaines de la compréhension de l’écrit (en anglais et irlandais), des mathématiques et des sciences. Il a travaillé de manière approfondie sur des évaluations nationales au niveau primaire et a conduit, en Irlande, la mise en œuvre nationale de l’Enquête internationale sur les enseignants, l’enseignement et l’apprentissage (TALIS) de l’Organisation de

xix


XX

| À PROPOS DES AUTEURS ET ÉDITEURS

coopération et de développement économiques ainsi que de l’enquête PISA. Il a travaillé sur des questions d’évaluation en Afrique, Asie du Sud et de l’Est et Europe orientale.

ÉDITEURS Vincent Greaney a été spécialiste principal de l’éducation à la Banque mondiale. Ancien enseignant, chargé de recherches à l’Educational Research Centre du St Patrick’s College de Dublin, boursier Fulbright et professeur invité à l’Université de Western Michigan, il est membre du Reading Hall of Fame de l’Association internationale de lecture (International Reading Association). Il s’intéresse à l’évaluation nationale, aux examens publics, à la formation des enseignants, à la lecture et à la promotion de la cohésion sociale grâce à la réforme des manuels de lecture. Il a travaillé sur des projets éducatifs principalement en Afrique, en Asie du Sud et de l’Est, en Europe de l’Est et au Moyen-Orient. Thomas Kellaghan a été directeur de l’Educational Research Centre du St Patrick’s College de Dublin et est chercheur à l’International Academy of Education. Il a travaillé à l’Université d’Ibadan au Nigéria et à la Queen’s University de Belfast. Ses domaines de recherche comprennent l’évaluation nationale, les examens publics, le handicap éducatif, la formation des enseignants et les relations entre l’école et la famille. De 1997 à 2001, il a présidé l’International Association for Educational Assessment. Il a travaillé sur des questions d’évaluation en Afrique, en Europe de l’Est, en Asie du Sud et de l’Est, en Amérique latine et au Moyen-Orient.


REMERCIEMENTS

Le présent volume est le quatrième de la série Évaluations nationales des acquis scolaires préparée par une équipe dirigée par Vincent Greaney (consultant, Réseau pour le développement humain, Groupe pour l’éducation, Banque mondiale) et Thomas Kellaghan (consultant, Educational Research Centre, St Patrick’s College, Dublin). Ont également collaboré à cette série : Sylvia Acana (Uganda National Examinations Board), Prue Anderson (Australian Council for Educational Research), Fernando Cartwright (Polymetrika, Canada) ; Jean Dumais (Statistique Canada), Chris Freeman (Australian Council for Educational Research), J. Heward Gough (Statistique Canada), Sara J. Howie (Université de Pretoria), George Morgan (Australian Council for Educational Research), T. Scott Murray (DataAngel, Canada), Kate O’Malley (Council for Educational Research), et Gerry Shiel (Educational Research Centre, St Patrick’s College, Dublin). Le travail a été réalisé sous la direction générale de Ruth Kagia, directrice, Secteur de l’Éducation à la Banque mondiale ; de ses successeurs, Elizabeth King et Amit Dar ; et de Robin Horn et Harry Patrinos, directeurs, tous de la Banque mondiale. Robert Prouty a lancé et supervisé le projet jusqu’en août 2007. Marguerite Clarke a supervisé les étapes ultérieures de révision et de publication. Nous remercions le comité d’examen pour ses contributions : Eugenio Gonzalez (Educational Testing Service), Pei-tseng Jenny Hsieh (Université d’Oxford), et Laura Jane Lewis (Banque mondiale).

xxi


XXII

| REMERCIEMENTS

Diana Manevskaya (Banque mondiale) a facilité l’élaboration de ce volume. À l’Educational Research Centre du St Patrick’s College de Dublin, nous avons bénéficié de l’appui d’Hilary Walshe, Peter Archer, John Coyle et Mary Rohan. La relecture des épreuves a été réalisée par Laura Glassman, Mary-Ann Moalli et Linda Stringer de Publications Professionals LLC. La conception graphique, l’édition et la production ont été coordonnées par Janice Tuten et Paola Scalabrin de la Division des publications et de la connaissance de la Banque mondiale ; l’impression a été coordonnée par Andrés Meneses. L’Australian Council for Educational Research, le Programme du partenariat entre la Banque mondiale et les Pays-Bas, l’Educational Research Centre de Dublin, le Fonds fiduciaire irlandais pour l’éducation, Statistique Canada, et le fonds fiduciaire Russia Education Aid for Development (READ) ont généreusement appuyé la préparation et la publication de la série.


ABRÉVIATIONS

CCCI CCT EIQ ET FDI FRI IATA IC ID JK MLH NAEP PIRLS PISA PR SPSS TCT TIMSS

TRI UPE

Courbe caractéristique de la catégorie d’items Courbe caractéristique du test Écart interquartile Erreur-type Fonctionnement différentiel des items Fonction de réponse à l’item Item and Test Analysis Intervalle de confiance Identifiant Jackknife Modèle linéaire hiérarchique National Assessment of Educational Progress (l’évaluation nationale des progrès de l’éducation – États-Unis) Programme international de recherche en lecture scolaire Programme international pour le suivi des acquis des élèves Probabilité de réponse Statistical Package for Social Sciences (logiciel d’analyse statistique pour les sciences sociales) Théorie classique des tests Tendances de l’enquête internationale sur les mathématiques et les sciences (Trends in International Mathematics and Science Study) Théorie de la réponse à l’item Unité primaire d’échantillonnage

xxiii


INTRODUCTION

L’actuelle économie mondiale de la connaissance oblige les États, les systèmes éducatifs et les établissements à suivre de près une série de résultats éducatifs, notamment les performances des élèves. Une évaluation nationale des acquis scolaires dans les domaines clés du programme de cours contribue à cet effort en traitant des questions liées à : • La qualité – fournir de l’information sur les acquis des élèves par rapport à la mise en œuvre du programme de cours, à l’application des normes éducatives prescrites ou à la préparation à un futur apprentissage. • L’équité – déterminer si le système d’éducation dessert moins bien certains groupes particuliers d’élèves, comme peuvent le prouver des différences de performance liées au sexe, à la situation géographique, à l’ethnie ou à l’appartenance à un groupe linguistique, à la catégorie socioéconomique ou à la gestion (publique-privée) des établissements. • L’offre – identifier les facteurs liés à l’apprentissage des élèves (par exemple, les ressources des établissements ; la mise en œuvre des programmes de cours ; le niveau de formation, les qualifications et l’expérience des enseignants ; et la situation familiale des élèves).

1


2

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

• Le changement – suivre l’évolution du rendement de l’éducation au fil du temps (Greaney et Kellaghan, 2008 ; Kellaghan et Greaney, 2001 ; Kellaghan, Greaney, et Murray, 2009). Les volumes précédents de la série Évaluations nationales des acquis scolaires présentent les composantes d’une évaluation nationale basée sur un échantillon. Elles comprennent la spécification du contenu des tests et questionnaires, la définition d’une population d’intérêt, la sélection d’un échantillon représentatif de la population, l’administration des tests et autres instruments aux élèves et autres répondants, la correction des épreuves, le nettoyage et la gestion des données. L’ensemble final de données généré par ces activités, au cours desquelles les items des tests ont été créés et rassemblés dans un carnet de test et les données des réponses recueillies, constitue la source des analyses décrites dans ce volume. La Partie I du volume est conçue pour aider les équipes d’évaluation nationale à réaliser les analyses des données généralement menées lors d’une évaluation nationale. Le chapitre 1 donne un aperçu des ensembles de données utilisés dans les exemples contenus dans le CD accompagnant le présent volume. Il est suivi, dans le chapitre 2, par une analyse exploratoire des données à l’aide de SPSS. Les concepts tels que la moyenne, la médiane, le mode et l’écart-type sont définis, et un certain nombre d’analyses illustratives sont exécutées. Le chapitre 3 introduit le concept d’erreur-type d’estimation et décrit les procédures à suivre pour estimer à quel point les données d’un échantillon diffèrent de celles de la population. Il décrit également comment WesVar calcule les erreurs-types pour un échantillon complexe, une caractéristique importante d’une évaluation nationale bien conçue. Le chapitre 4 décrit les manières de traiter les questions liées à l’équité en analysant les différences entre les scores moyens de différentes catégories d’élèves, pour déterminer si elles sont statistiquement significatives. Dans le chapitre 5, l’attention se porte sur la façon de décrire la performance des élèves forts et faibles. Le chapitre 6 traite les associations entre variables (par exemple, les relations entre les ressources des établissements et l’apprentissage des élèves) mises en évidence par une corrélation, et introduit l’analyse de régression. Le chapitre 7 contient des exemples de présentation des données à l’aide de diagrammes et graphiques.


INTRODUCTION

| 3

La Partie II du volume est centrée sur la définition d’échelles permettant de décrire l’apprentissage des élèves. Deux cadres statistiques populaires (au sein desquels plusieurs modèles ont été élaborés) sont utilisés pour traiter cette question. Le premier, la théorie classique des tests (TCT) (voir Crocker et Algina, 2006 ; Haladyna, 2004 ; Lord et Novick, 1968), a été employé pendant une bonne partie du XXe siècle et est utilisé dans le volume 2 de la présente série pour décrire la mise au point des tests (Anderson et Morgan, 2008). Le deuxième cadre décrit dans la partie II est la théorie de la réponse à l’item (TRI) (voir De Ayala, 2009 ; De Mars, 2010 ; Hambleton, Swaminathan et Rogers, 1991 ; Lord et Novick, 1968). Elle est apparue au milieu du XXe siècle et est depuis largement utilisée dans des évaluations nationales et internationales de la performance des élèves. Le logiciel Item and Test Analysis (IATA) décrit dans ce volume fait appel à la TRI pour analyser les données des tests. Il est conçu comme un moyen facile de traiter deux considérations statistiques majeures des évaluations nationales : a) accroître la facilité d’utilisation et d’interprétation des scores aux tests et b) définir des échelles significatives et cohérentes pour rapporter ces scores. Cette dernière considération nécessite de réduire l’erreur de mesure et de fournir une information susceptible d’être généralisée au-delà de l’échantillon dont les données sont issues. La séquence des analyses de la partie II est conçue pour reproduire les phases de développement et de mise en œuvre d’un programme d’évaluation nationale, depuis l’essai pilote jusqu’au test à grande échelle et aux tests utilisés pour effectuer un suivi dans des cycles ultérieurs d’évaluation. Le chapitre 8 décrit le menu principal d’IATA, ses composantes interactives et les résultats produits. Le chapitre 9 décrit les étapes de l’analyse des données issues de l’administration d’un test pilote et est suivi du chapitre 10, qui présente les étapes d’une analyse des données du test final. Le chapitre 11 décrit les analyses effectuées en cas de rotation des carnets de test et le chapitre 12, les items à crédit partiel. La comparaison des évaluations à l’aide de méthodes de liaison et spécialisées d’IATA est abordée dans les chapitres 13 et 14, respectivement. Le volume s’achève avec une annexe sur la TRI. Notons qu’IATA ne fonctionne que sous Windows. Contrairement à ceux de la TCT, les grands avantages de la TRI sont que les statistiques sur les items sont indépendantes de la distribution


4

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

des aptitudes de l’ensemble des candidats et que les paramètres caractérisant les candidats ne dépendent pas de l’ensemble d’items de test à partir desquels ils sont calibrés. Ces avantages sont considérés comme particulièrement intéressants dans des situations nécessitant un étalonnage, une identification des biais liés aux items et la conception de tests adaptatifs informatisés. Un inconvénient de la TRI est qu’elle nécessite des compétences analytiques avancées et des procédures de calcul complexes, dont une équipe d’évaluation nationale peut ne pas disposer. Dans les pays en développement, de nombreuses évaluations nationales continuent de baser l’élaboration de leurs tests sur les indices de facilité des items et de discrimination des items de la TCT. Notons que ces formes de données fournissent aux concepteurs des tests une information utile, quel que soit le modèle de mesure appliqué plus tard au cours du processus de mise au point des tests. En outre, la TCT et la TRI produisent des résultats très similaires en ce qui concerne la comparabilité des items, les statistiques sur les personnes et le degré d’invariance des statistiques sur les items à travers les échantillons de candidats (Fan, 1998). Que le choix se porte sur la TCT ou la TRI dans la mise au point des tests d’évaluation des performances individuelles des élèves actuellement pratiquée dans les évaluations nationales et internationales, deux questions méritent une attention particulière : a) l’hypothèse que le trait ou l’aptitude à évaluer n’a qu’une seule dimension et b) la concentration sur une différenciation maximale des performances des candidats. Les deux ont des implications pour la validité du test. L’unidimensionnalité supposée sous-tendant l’élaboration des tests a des implications importantes dans une évaluation nationale ou internationale, non seulement pour la validité du contenu, mais aussi pour la détermination des biais dans les items et des liens du test. Cette hypothèse est toutefois contestée par le fait que le rythme auquel les élèves acquièrent des compétences varie suivant les domaines de performance (comme on peut le constater, par exemple, lorsque la performance en mathématiques est évaluée par rapport aux nombres, mesures, formes et données). La cause la plus probable de cette variation réside dans les différences existant dans les expériences éducatives et, plus largement culturelles, des élèves


INTRODUCTION

| 5

(Goldstein et Wood, 1989). Le refus d’inclure des items dans un test au motif que les données statistiques n’appuient pas l’hypothèse d’unidimensionnalité peut entraîner l’exclusion d’un contenu important et aboutir ainsi à une représentation inadéquate du construct, affectant la validité du contenu du test – un aspect généralement considéré comme plus important que les inférences fondées sur des données statistiques.1 L’hypothèse d’unidimensionnalité est particulièrement problématique dans les évaluations internationales, où l’expérience scolaire et extrascolaire des élèves est reconnue comme très variable. Le souci de maximiser les différences entre les candidats, une autre caractéristique des procédures de mise au point des tests visant à évaluer les performances individuelles des élèves, pose problème dans une évaluation nationale (ou internationale), dans la mesure où le but de l’exercice est de décrire les performances du système éducatif et non de différencier les performances de chaque élève. Cette situation implique que des facteurs autres que la discrimination et la facilité doivent être considérés au moment de décider d’inclure ou non des items dans un test. Par exemple, les items auxquels tous les élèves ont répondu correctement ou ceux auxquels aucun élève n’a pu répondre ne sont généralement pas intégrés dans un test conçu pour les élèves individuels, car ils ne contribuent pas à différencier les élèves. Par contre, dans le cas d’une évaluation nationale, il est important de savoir si tous les élèves ont maîtrisé certains domaines de performance ou si aucun n’y est parvenu. Les items représentant ces domaines sont par conséquent intégrés dans l’évaluation. Pour s’assurer que les tests utilisés dans une évaluation nationale représentent correctement le construct à évaluer et fournissent une information complète sur l’éventail des acquis des élèves d’un système éducatif, il est impératif que les concepteurs de test communiquent de manière interactive avec les spécialistes des programmes de cours et les enseignants pendant la mise au point des tests. Dans ce volume, la présentation générale des analyses statistiques précède la section sur la TRI, car elle introduit une bonne partie des procédures analytiques utilisées dans celle-ci. Toutefois, dans une évaluation nationale réelle, la définition d’échelles pour décrire les performances des élèves, présentée dans la partie II, doit être effectuée avant de mener les analyses de la partie I.


6

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

Les utilisateurs de ce volume sont supposés avoir une connaissance de base de l’utilisation des répertoires et fichiers, d’Excel, et de SPSS et être capables de naviguer sans difficulté entre les composantes de SPSS.

NOTE 1. Cronbach (1970, 457) a souligné que, même dans le cas de tests élaborés pour évaluer individuellement les élèves, « rien dans la logique de la validation du contenu n’exige que le contenu de l’univers ou du test soit homogène ».


PA RT I E

I

INTRODUCTION À L’ANALYSE STATISTIQUE DES DONNÉES D’UNE ÉVALUATION NATIONALE Gerry Shiel

7


1

CHAPITRE

LA BASE DE DONNÉES POUR LES ANALYSES

Les données d’une évaluation nationale contiennent toujours une mesure de la performance des élèves. Elle peut prendre diverses formes, telles que le nombre d’items d’un test auxquels l’élève a répondu correctement (bien que cette information ne soit pas toujours très significative) ; le pourcentage de bonnes réponses ; ou des échelles de scores où une distribution dotée d’une moyenne et d’un écart-type donnés est transformée en une distribution avec une moyenne et un écart-type différents. La plupart des évaluations nationales recueillent également des données supplémentaires. Celles-ci peuvent concerner les établissements (par exemple, le type, la taille) ; les enseignants (par exemple, les qualifications, l’expérience) ; les élèves (par exemple, l’âge, le temps consacré aux devoirs) ; et l’environnement parental et familial (par exemple, le niveau d’instruction des parents ; le nombre de livres à la maison). Les données collectées appartiennent à divers types de variables. Certaines sont catégorielles et correspondent au classement des personnes dans des catégories ou groupes clairement définis, tels que le niveau d’instruction ou le sexe. D’autres variables, appelées discrètes, comprennent des mesures numériques ou des compteurs, tels que le nombre d’enfants dans une famille. Elles ne peuvent prendre qu’un nombre défini de valeurs. En revanche, les variables continues décrivent 9


10

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

des mesures numériques qui peuvent prendre une infinité de valeurs, telle que la distance entre le domicile de l’élève et l’école. Le genre d’analyse statistique qui peut être réalisé ainsi que la manière de représenter graphiquement les données dépendent du type de données. Les analyses commencent généralement par l’exploration de données numériques simples, présentées sous forme de statistiques synthétiques, de graphiques ou diagrammes ou des deux. À ce stade, comme on le verra plus en détail dans ce chapitre, l’accent est mis sur la description, même si ce qui est appris donne lieu à des hypothèses qui devront être testées à un stade ultérieur. La phase exploratoire de l’analyse des données est l’occasion d’examiner la qualité des données, en recherchant les valeurs manquantes, les résultats aberrants, les écarts et les valeurs erronées, même si ceux-ci sont censés avoir été identifiés lors de la phase de nettoyage des données (voir Freeman et O’Malley, 2012). Elle révèle également la nature des données, en indiquant si la distribution est symétrique, asymétrique ou groupée. À ce stade précoce, une présentation graphique, telle qu’un diagramme en barres, un histogramme ou un tracé en boîte (aussi appelé tracé en rectangle et moustaches), peut être très instructive pour identifier des tendances dans les données. Lorsqu’on dispose de plus d’une observation sur les personnes, on peut étudier les relations entre les variables, telles que celle entre les acquis des élèves en littératie et numératie, ou entre les acquis en mathématiques et des facteurs liés au contexte familial. Une association entre deux variables est appelée bivariée. Étant donné que dans une évaluation nationale, de nombreuses variables sont liées entre elles, il est nécessaire de réaliser des analyses multivariées nécessitant des procédures pour déterminer la performance pour une variable (par exemple, les performances en lecture) à partir des valeurs d’un ensemble d’autres variables (par exemple, le sexe des élèves et les facteurs liés au contexte familial). Une première étape de l’analyse multivariée consiste à représenter et examiner les corrélations entre deux variables dans une matrice de corrélation. Ce volume contient une introduction à l’analyse multivariée (analyse de régression ; voir chapitre 6). Il ne traite toutefois pas des formes d’analyse plus complexes, telles que la modélisation à niveaux multiples, dans laquelle les analyses sont conçues pour refléter la structure constatée dans les


LA BASE DE DONNÉES POUR LES ANALYSES

| 11

systèmes éducatifs (élèves regroupés en classes, classes en établissements, établissements en régions). Le lecteur peut développer ses compétences analytiques en effectuant les exercices exploitant la base de données fournie sur le CD qui accompagne cet ouvrage. Cette base de données, similaire à celle utilisée dans la section sur l’échantillonnage du volume Mettre en œuvre une évaluation nationale des acquis scolaires (Dumais et Gough, 2012a), contient les données d’un test de performance et d’autres sources, élaborées à partir des données d’une évaluation réelle des acquis en mathématiques en 4e année, effectuée dans un petit pays. Dans la présente série, ces données sont présentées comme celles de l’évaluation nationale d’un pays imaginaire, le Sentz. Les chapitres suivants décrivent une série de tâches analytiques généralement réalisées avec des données tirées d’une évaluation nationale. En effectuant ces analyses, le lecteur se familiarisera avec un ensemble de techniques statistiques qu’il pourra appliquer à ses propres données. La plupart des analyses utilisent le logiciel WesVar. Contrairement à beaucoup d’autres progiciels, WesVar tient compte de la complexité de la conception de l’évaluation nationale pour effectuer des analyses statistiques, telles que l’estimation de la variance et de l’erreur d’échantillonnage. Les parties II et IV du volume 3 de cette série, Mettre en œuvre une évaluation nationale des acquis scolaires, décrivent en détail l’échantillonnage complexe (Dumais et Gough, 2012a, 2012b).

ENREGISTREMENT DES FICHIERS DU CD SUR VOTRE DISQUE DUR OU VOTRE SERVEUR Les fichiers du CD peuvent être enregistrés sur un disque dur ou un serveur. À partir du CD, copiez sur votre bureau un répertoire appelé NAEA DATA ANALYSIS. Vous devez y trouver sept sousrépertoires : SPSS DATA, EXERCISE SOLUTIONS, WESVAR UNLABELED DATA, MY WESVAR FILES, WESVAR DATA & WORKBOOKS, MY SPSS DATA, et MY SOLUTIONS. Pour copier le répertoire NAEA DATA ANALYSIS du CD sur votre bureau, localisez le répertoire sur le CD, faites un clic droit sur Copy.


12

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

Ouvrez ensuite Desktop et faites un clic droit sur Paste. Vérifiez que le répertoire NAEA DATA ANALYSIS a été copié correctement. Les sept répertoires qui s’y trouvent sont : • SPSS DATA. Contient les fichiers de données SPSS (NATASSESS. SAV et NATASSESS4.SAV) utilisés pour effectuer les exercices du chapitre 2 de ce volume, ainsi qu’un fichier des établissements (SCHOOLS.SAV). • EXERCISE SOLUTIONS. Vous trouverez ici les solutions des exercices des chapitres 2 à 7 de ce volume, principalement sous la forme de fichiers de texte. Une fois les exercices terminés, vous pourrez comparer vos solutions à celles de ce sous-répertoire. • WESVAR UNLABELED DATA. Utilisez cette source pour les exercices WesVar du chapitre 3. Ce fichier de données (NATASSESS4.VAR) doit être identique à celui que vous obtiendrez en créant votre propre fichier de données WesVar à l’aide des étapes décrites dans l’annexe I.C. Le fichier de données de ce répertoire peut servir de sauvegarde. • MY WESVAR FILES. Utilisez ce sous-répertoire pour enregistrer les fichiers de données et les classeurs WesVar que vous créerez en réalisant les exercices des chapitres 3 à 6. Lorsque vous ouvrirez ce répertoire pour la première fois, vous constaterez qu’il est vide, ce qui est normal dans la mesure où vous n’y avez encore enregistré aucun fichier. Il est vivement recommandé de créer vos propres fichiers de données et classeurs WesVar en suivant les procédures décrites plus loin et dans l’annexe I.C. Veuillez noter que tous les fichiers de données et classeurs WesVar que vous créerez doivent être enregistrés dans MY WESVAR FILES. • WESVAR DATA & WORKBOOKS. Ce sous-répertoire contient le fichier de données NATASSESS4.VAR, le fichier-journal associé NATASSESS4. LOG, et quatre classeurs terminés, CHAPTER3 WORKBOOK. WVB, CHAPTER4 WORKBOOK.WVB, CHAPTER5 WORKBOOK.WVB, et CHAPTER6 WORKBOOK. WVB. Vous pouvez les consulter pour vérifier l’exactitude de votre travail dans WesVar. • MY SPSS DATA. Utilisez ce répertoire pour enregistrer les fichiers de données SPSS, nouveaux ou modifiés, tels que ceux que vous


LA BASE DE DONNÉES POUR LES ANALYSES

| 13

créerez avant de transférer un fichier de données SPSS vers WesVar (voir l’annexe I.C). • MY SOLUTIONS. Enregistrez dans ce sous-répertoire vos solutions aux exercices des chapitres 2 à 7. Tout comme MY WESVAR FILES et MY SPSS DATA, il sera vide lorsque vous l’ouvrirez pour la première fois. L’annexe I.B donne des détails sur le contenu de chaque répertoire et fichier.

INSTRUMENTS D’ENQUÊTE Cette section décrit les principaux instruments utilisés pour recueillir les données stockées dans la base de données.

Test de la performance en mathématiques Le test se compose de 125 items fondés sur le programme national de cours de 4e année. Le tableau 1.1 montre la distribution des

TABLEAU 1.1 Test de mathématiques : distribution des items par domaine de contenu et processus Domaines de contenu

Processus cognitifs

Nombre Pourcentage d’items d’items Nombres Algèbre

46

36,8

Nombre Pourcentage d’items d’items Comprendre et se rappeler

16

12,8

Mettre en œuvre des procédures

35

28,0

26

20,8

8

6,4

6

4,8

Formes et espace

18

14,4

Raisonner

Mesures

44

35,2

Intégrer et mettre en rapport

Données et probabilités Total

11

8,8

125

100,0

Appliquer et résoudre un problème Total

40

32,0

125

100,0


14

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

items entre les principaux domaines mathématiques et les processus cognitifs (ou comportements intellectuels). La plupart des items portent sur les nombres et les mesures, reflétant ainsi les poids attribués à ces domaines dans le programme national de cours et les manuels scolaires. Plus de la moitié des items concernent deux processus cognitifs : « la mise en œuvre de procédures » (28 %) et « l’application et la résolution de problèmes » (32 %). Les items sont regroupés en cinq blocs (A, B, C, D, E), composés de 25 items chacun. Chaque carnet de test contient 75 items tirés du réservoir de 125. Chaque bloc (excepté le bloc commun B) figure une fois en première position et une fois en dernière position dans un carnet de test. Chaque item est soit à choix multiple, soit à réponse courte. Les items à choix multiple proposent quatre réponses possibles (A, B, C, D), parmi lesquelles les élèves doivent choisir la réponse qu’ils estiment correcte. Pour les items à réponse courte, les élèves doivent rédiger une réponse ou faire des dessins (par exemple, tracer les lignes de symétrie d’une forme bidimensionnelle telle qu’un rectangle). Pour chaque question à choix multiple, une bonne réponse est proposée parmi les quatre réponses possibles. Chaque item à réponse courte est comptabilisé comme correct ou incorrect en fonction du barème de correction fourni aux correcteurs.

Questionnaires contextuels L’évaluation nationale comprend des questionnaires séparés destinés aux chefs d’établissement, enseignants, élèves et parents (tableau 1.2). Les enseignants remplissent également un formulaire de notation pour chaque élève.

POIDS DÉTERMINÉ PAR LE PLAN D’ÉCHANTILLONNAGE Les poids déterminés par le plan d’échantillonnage ont été calculés et intégrés dans le fichier. Ils reflètent la probabilité de sélection de chaque élève. La manière de les calculer et de les utiliser est décrite dans le volume 3 de cette série (Dumais et Gough, 2012b).


LA BASE DE DONNÉES POUR LES ANALYSES

| 15

TABLEAU 1.2 Brève description des questionnaires Questionnaire

Rempli par

Sujets concernés

Questionnaire destiné aux établissements

Chefs d’établissement

Questionnaire destiné aux enseignants

Qualifications de l’enseignant, années d’expérience Enseignants des élèves de 4e année dans l’enseignement, distance parcourue tous les participants jours pour se rendre à l’établissement, taille de la classe, temps consacré à l’enseignement des mathématiques, fréquence d’évaluation des progrès des élèves, disponibilité et utilisation de ressources pédagogiques en classe

Questionnaire destiné aux élèves

Élèves

Taille de l’établissement, ressources scolaires, personnel enseignant, planification du développement, qualifications du chef d’établissement

Âge, fréquence avec laquelle ils font leurs devoirs, intérêt pour les mathématiques

Questionnaire Parents des élèves destiné aux parents participants

Niveau d’instruction (du chef de famille et de l’épouse/époux ou compagne/compagnon), nombre de livres à la maison, taille de la propriété (terres), disponibilité de la lumière électrique à la maison, soutien et encouragement parentaux

Formulaire de notation individuelle des élèves

Fréquentation de l’école par l’élève, niveau de compétence de l’élève dans la langue d’enseignement, évaluation de la performance de l’élève par l’enseignant, comportement, soutien parental

Enseignants des élèves de 4e année participants, pour chaque élève

Pour chaque élève, un poids déterminé par le plan d’échantillonnage a été calculé en intégrant les composantes suivantes : • Composante de sélection des établissements. Les établissements ont été sélectionnés avec une probabilité proportionnelle à leur taille. Pour un établissement i, de la strate h, cette probabilité correspond à l’inverse du produit du nombre d’établissements sélectionnés par le nombre d’élèves de l’année cible dans l’établissement i (mesure de la taille), divisé par le nombre d’élèves dans la strate de population. Par exemple, si la strate compte 5 000 élèves, et si, parmi les 10 établissements sélectionnés dans cette strate, l’établissement i a 50 élèves en 4e année, la composante de sélection de l’établissement i (Schwgt) vaut 5 000/(10*50) = 10.


16

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

• Composante d’ajustement pour la non-réponse des établissements. Les établissements sélectionnés ayant tous participé, le facteur d’ajustement pour la non-réponse des établissements est fixé à 1,0 (Schnrfac).1 • Composante de sélection des élèves. Tous les élèves de 4e année d’un établissement étant sélectionnés, la probabilité qu’un élève d’un établissement sélectionné soit évalué est égale à 1,0 et sa réciproque vaut également 1,0 (Studfac).2 • Composante d’ajustement pour la non-réponse des élèves au sein d’un établissement. Une correction est effectuée pour la non-réponse des élèves au sein des établissements. Elle correspond à l’inverse du nombre de carnets de test valides renvoyés pour l’établissement divisé par le nombre d’élèves de 4e année dans l’établissement, moins les élèves dispensés (Stunrfac). Par exemple, si 90 élèves étaient inscrits en 4e année au moment de l’étude, dont aucun dispensé, et si 80 ont participé, le facteur d’ajustement est de 90/80. Pour chaque élève, le poids déterminé par le plan d’échantillonnage (Wgtpop dans le fichier de données) est donné par le produit de ces quatre composantes (Schwgt × Schnrfac × Studfac × Stunrfac). Dans les exemples précédents, le poids pour un élève x d’un établissement i vaut donc 10 × 1 × 1 × 90/80. Lorsque les données du fichier sont pondérées à l’aide du poids déterminé par le plan d’échantillonnage (poids dans la population), la taille de la population estimée devient 51 713 (nombre prévu d’élèves de 4e année dans la population). Chaque élève de l’échantillon représente en moyenne 51 713/4 747 = 10,89 élèves. Pour réaliser des analyses sur le fichier SPSS de l’évaluation nationale qui accompagne ce volume, il est recommandé d’appliquer le poids dans la population (Wgtpop), qui assure une représentation proportionnelle de chaque strate. Le calcul des poids de l’enquête est expliqué dans le chapitre 14 du volume 3 de la série, Mettre en œuvre une évaluation nationale des acquis scolaires (Dumais et Gough, 2012b). Les étapes décrites dans ce chapitre génèrent automatiquement les poids nécessaires pour analyser les données de l’évaluation nationale. À partir du chapitre 2, Wgtpop est utilisé pour pondérer les données des analyses de ce volume.


LA BASE DE DONNÉES POUR LES ANALYSES

| 17

SPSS Certains fichiers du CD accompagnant cet ouvrage (tels que NATASSESS.SAV)3 sont en format SPSS. La version 18 de SPSS a été utilisée pour analyser les données de ce fichier, mais des versions plus récentes peuvent également être employées. Aux fins des exercices présentés dans ce volume, tous les fichiers (données de l’évaluation et données de chacun des questionnaires) ont été fusionnés en un seul fichier SPSS contenant les résultats des élèves et d’autres données pour 4 747 cas.4 Pour l’analyse, les variables liées aux établissements et aux enseignants ont été répétées au niveau de chaque élève. En d’autres termes, les données de chaque élève comprennent celles de son établissement et de son enseignant. Par exemple, le nombre de minutes consacrées chaque semaine à l’enseignement des mathématiques fait partie des variables du questionnaire destiné aux enseignants. Après jointure des fichiers, le même nombre de minutes consacrées aux mathématiques par l’enseignant se trouve répété dans les données de chacun des élèves d’une même classe. Les données de plusieurs centaines de variables ont été collectées au cours de l’évaluation nationale, mais le fichier NATASSESS.SAV utilisé pour les exercices n’en reprend qu’un sous-ensemble pour maintenir sa taille et sa structure à un niveau gérable. Ouverture d’un fichier SPSS Il y a deux manières d’ouvrir un fichier de données. L’une consiste à sélectionner (My) Computer dans le menu Windows (Start) ou sur votre bureau, et à cliquer sur le disque et le répertoire où votre fichier SPSS est enregistré : par exemple, NAEA DATA ANALYSIS – SPSS DATA – NATASSESS.SAV. L’autre manière consiste à ouvrir SPSS en cliquant sur Start, All Programs – (IBM) SPSS Statistics. Cliquez sur la version spécifique de SPSS qui apparaît sur votre écran. Une fois celle-ci lancée, localisez le fichier SPSS requis en sélectionnant File – Open – Data, puis cherchez NAEA DATA ANALYSIS – SPSS DATA – NATASSESS.SAV. Double-cliquez sur NATASSESS.SAV pour l’ouvrir.


18

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

Utilisation de la barre d’outils pour effectuer des analyses préliminaires Dans SPSS, vous pouvez réaliser des analyses de deux manières : à l’aide de fichiers de syntaxe ou de la barre d’outils. Ici, nous allons utiliser la barre d’outils. Elle figure au-dessus du fichier SPSS ouvert. Il vous suffit de cliquer sur les procédures que vous souhaitez exécuter, comme indiqué dans l’exercice 1.1.

EXERCICE 1.1 Exécution de statistiques descriptives dans SPSS et enregistrement des fichiers 1. Ouvrez le fichier SPSS NATASSESS.SAV figurant dans NAEA DATA ANALYSIS\SPSS DATA. 2. Vérifiez que les poids sont activés : Data – Weight Cases – Weight Cases by – Wgtpop (figure 1.1.A) et cliquez sur OK. Wgtpop est utilisé pour assurer que les statistiques calculées représentent la population. Le message Weight On apparaît en bas à droite de l’écran. FIGURE 1.1.A Boîte de dialogue pour l’utilisation des poids


LA BASE DE DONNÉES POUR LES ANALYSES

| 19

EXERCICE 1.1 (suite) 3. Sélectionnez Analyze – Descriptive Statistics – Descriptives.a 4. Dans la boîte de dialogue Descriptives, sélectionnez la variable requise dans le panneau de gauche (dans le cas présent, Mathss, l’échelle des scores obtenus au test de mathématiques). Cliquez sur la flèche pour la déplacer dans Variable(s) (voir la figure 1.1.B).b Cliquez sur OK. Le résultat est un tableau avec une moyenne pondérée de 249,99 (arrondie à 250) et un écart-type de 49,99780 (arrondi à 50).c 5. Utilisez File – Save As pour attribuer un nom approprié à votre fichier SPSS résultat (par exemple, EXERCISE 1.1.SPV), et enregistrez-le dans NAEA DATA ANALYSIS\MY SOLUTIONS. Ensuite, sélectionnez File – Close. FIGURE 1.1.B Boîte de dialogue Descriptives de SPSS

6. Pour enregistrer votre fichier SPSS, qui doit être en mode édition, sélectionnez File – Save As… Enregistrez-le dans NAEA DATA ANALYSIS\MY SPSS DATA sous le nom NATASSESS.SAV. Sélectionnez ensuite File – Exit. a. Si un texte apparaît à l’écran au lieu des données, quittez le mode visualisation et ouvrez le mode édition en cliquant sur Window puis sur (IBM) SPSS Statistics Data Editor. b. Lorsque vous ouvrez une boîte de dialogue, au lieu de la liste des noms des variables, il est possible que vous voyiez celle des intitulés attribués aux variables. De même, les variables peuvent être classées par ordre alphabétique et non dans l’ordre où elles apparaissent dans le fichier des données. Pour modifier ces paramètres, fermez la boîte de dialogue et cliquez sur Edit – Options – General. Sélectionnez ensuite les options souhaitées dans la boîte relative à la liste des variables. c. Pour réduire le nombre de décimales à une seule, double-cliquez et sélectionnez les chiffres dans la cellule du tableau concernée (par exemple, 249,99). Faites un clic droit et activez Cell Properties – Format Value – Number – Decimals – 1.


20

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

WesVar WesVar est un progiciel statistique souvent utilisé en combinaison avec SPSS pour analyser les données d’une évaluation nationale. Outre quelques exercices préliminaires avec SPSS, le chapitre 2 explique les raisons justifiant l’utilisation de WesVar, tandis que les chapitres 3 et 6 décrivent une série d’analyses réalisées avec WesVar. Le logiciel WesVar (qui contient un menu d’aide complet) peut être téléchargé sur le site Internet de Westat.5

NOTES 1. S’il y avait eu 20 établissements dans une strate, dont 18 participants, le facteur de correction approprié aurait été 20/18 ou 1,11. 2. S’il y avait eu cinq classes d’élèves de 4e année dans l’établissement, dont trois sélectionnées pour participer, la composante de sélection des élèves aurait été 5/3. Ou bien, s’il y avait eu 100 élèves de 4e année, dont 35 sélectionnés de manière aléatoire pour participer, la composante aurait été 100/35. 3. Le suffixe .SAV est utilisé lorsque vous enregistrez un fichier de données SPSS et .SPV est employé quand vous enregistrez un fichier de sortie SPSS (résultats). 4. Le chapitre 12 du volume 3 de cette série, Mettre en œuvre une évaluation nationale des acquis scolaires, contient des détails sur la manière de fusionner des fichiers à l’aide d’Access (Freeman et O’Malley, 2012). Les fichiers peuvent également être fusionnés dans SPSS en sélectionnant Data et Merge Files dans la barre d’outils (voir l’annexe I.C). 5. Vous pouvez télécharger gratuitement la Version 5.1 de WesVar sur http:// www.westat.com/our-work/information-systems/wesvar-support/download -wesvar.


2

CHAPITRE

ANALYSE DES DONNÉES D’UNE ÉVALUATION NATIONALE À L’AIDE DE SPSS

Le présent chapitre analyse les données d’une évaluation nationale à l’aide de SPSS. Les exercices sont conçus pour permettre à l’analyste de comprendre et calculer des données telles que le score moyen général, les scores moyens des groupes constitutifs (tels que les régions) et la variabilité des scores des groupes. Les analyses décrites dans ce chapitre sont fondées sur des données pondérées. La notion de distribution des scores est un concept central de ce chapitre. Une distribution est basée sur l’ensemble des données d’un échantillon, correspondant à une variable (par ex., les scores à un test de performance). Par exemple, si un test de mathématiques avec un score maximal de 10 points était administré à un échantillon de 20 élèves, la distribution des scores pourrait être : 0, 2, 3, 3, 3, 3, 4, 4, 4, 5, 5, 5, 5, 5, 5, 6, 6, 6, 7, 10. Dans une évaluation nationale, au cours de laquelle des centaines, voire des milliers, d’élèves peuvent passer la même épreuve, le nombre de scores sera évidemment beaucoup plus important. Ce chapitre décrit la détermination de a) la tendance centrale des scores, b) la dispersion des scores, c) la position des scores et d) la forme des distributions. Les exemples sont fondés sur une distribution pondérée des scores au test de mathématiques de 4 747 cas pour lesquels des données ont été recueilles par une évaluation nationale. 21


22

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

MESURES DE LA TENDANCE CENTRALE Les mesures les plus couramment utilisées pour exprimer la valeur centrale, ou valeur typique, d’un ensemble de données sont la moyenne, la médiane et le mode. Pour calculer la moyenne (non pondérée) d’un ensemble de données (par ex., les scores des élèves à un test de mathématiques), additionnez les valeurs, et divisez ensuite le résultat par le nombre de points de données qui ont contribué au total (le nombre d’élèves qui ont participé au test). La médiane est la valeur centrale d’un ensemble de nombres triés par ordre de grandeur. Le mode est la valeur qui apparaît le plus souvent dans un ensemble de données. Une distribution à deux modes est nommée bimodale. Prenons les scores de neuf élèves ayant passé un test d’histoire : 45, 52, 55, 55, 59, 60, 70, 71 et 73. Le score moyen est 60, le score médian 59, et le score modal 55.

MESURE DE LA DISPERSION La dispersion est un concept central en statistiques. Les mesures statistiques les plus communément utilisées pour exprimer la dispersion sont la variance, l’écart-type et l’intervalle. La variance mesure à quel point les données varient ou sont dispersées. Pour déterminer la variance d’un ensemble de valeurs, on calcule la distance (appelée écart) entre chaque valeur et la moyenne. Les écarts sont élevés au carré et additionnés, et leur somme est divisée par le nombre de cas moins un. La variance est donc la moyenne des carrés des écarts entre chaque point de la distribution et la moyenne. L’écart-type est la racine carrée de la variance. D’autres mesures de la dispersion sont moins souvent utilisées. L’intervalle d’une distribution est la différence entre la valeur la plus élevée et la plus basse. Si le score le plus bas est 30 et le plus élevé 70, l’intervalle de la distribution des scores vaut 40. L’intervalle interquartile


ANALYSE DES DONNÉES D’UNE ÉVALUATION NATIONALE À L’AIDE DE SPSS

| 23

(IIQ) est la différence entre les valeurs des 25e (quartile 1) et 75e (quartile 3) centiles d’une distribution (le centile est décrit dans la section suivante). L’IIQ est une valeur de référence utile pour identifier les observations aberrantes (telles que les valeurs situées à plus de 1,5 IIQ en dessous de la valeur du quartile 1 ou au-dessus de la valeur du quartile 3).

MESURE DE LA POSITION La position relative d’un élément spécifique d’un ensemble (par ex., le score d’un élève par rapport à ceux des autres) peut être identifiée de plusieurs manières. L’une d’elles est le rang centile d’une valeur (ou score). Il correspond au pourcentage de valeurs inférieures à une valeur donnée. Par exemple, un score ayant un rang centile de 62 dans une évaluation nationale indique que 62 % des élèves ont obtenu un score inférieur. Pour calculer un rang centile, triez les scores du plus bas au plus élevé, puis calculez le pourcentage des scores inférieurs à un score donné. Dans les rapports de certaines évaluations nationales et internationales, les scores sont accompagnés de leurs erreurs-types (voir le chapitre 3), pour des centiles spécifiques tels que le 10e, le 25e, le 50e, le 75e et le 90e. Le rang centile est facile à comprendre, mais il limite l’analyse statistique dans la mesure où la propriété de l’intervalle du système de mesure est détruite lors de la transformation des scores en centiles. La position d’une valeur (d’un score) peut être exprimée par le nombre d’écarts-types la séparant de la moyenne. Dans une distribution normale, environ 68 % des valeurs se situent à un écart-type de la moyenne, 95 % à deux écarts-types, et presque 100 % à trois écartstypes. La figure 2.1 en fournit une illustration graphique. Prenons, par exemple, une distribution normale des scores avec une moyenne de 250 et un écart-type de 50. Les scores étant normalement distribués, environ 34 % des élèves ont des scores entre 200 et 250 et un autre 34 % entre 250 et 300. Un score de 325 se place à 1,5 écart-type (75 points) au-dessus de la moyenne, et un score de 125 se situe à 2,5 écarts-types (125 points) en dessous de la moyenne.


24

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

FIGURE 2.1 Distribution normale montrant les unités d’écart-type 99,7% entre ±3 ET 95,4% entre ±2 ET 68,3% entre ±1 ET

Seuls 3 points sur 1 000 tombent en dehors de la zone de 3 écarts-types de part et d’autre de la ligne centrale.

34,1%

34,1%

13,6%

13,6%

2,1% –3 ET

–2 ET

2,1% –1 ET

Moyenne

+1 ET

+2 ET

Remarque : ET = écart-type.

MESURE DE LA FORME Lors de l’examen d’une distribution des scores, il faut considérer la forme de la courbe de distribution, à savoir le fait que les valeurs soient rassemblées d’un côté ou de l’autre, parce qu’une divergence importante par rapport à la normalité peut être en contradiction avec les hypothèses de certaines techniques statistiques. Dans une distribution positivement asymétrique, la plupart des valeurs sont rassemblées vers l’extrémité inférieure avec quelques-unes dans la partie supérieure (figure 2.2). Cette situation peut se produire lorsqu’un test est particulièrement difficile et que la majorité des élèves obtiennent de faibles scores. Certaines évaluations nationales rencontrent ce problème lorsque le test est trop difficile pour la population. Dans une distribution positivement asymétrique, la moyenne est généralement supérieure à la médiane.

+3 ET


ANALYSE DES DONNÉES D’UNE ÉVALUATION NATIONALE À L’AIDE DE SPSS

| 25

FIGURE 2.2 Exemples de distributions avec une asymétrie positive, une asymétrie négative et aucune asymétrie a. Asymétrie positive

b. Asymétrie négative

c. Distribution symétrique, sans asymétrie

Dans une distribution négativement asymétrique, la plupart des valeurs sont regroupées vers l’extrémité supérieure, avec quelquesunes vers le bas (figure 2.2). Cette situation peut intervenir lorsqu’un test est particulièrement facile et que de nombreux élèves obtiennent des scores élevés. Dans une distribution négativement asymétrique, la moyenne est inférieure à la médiane. Dans une distribution symétrique (figure 2.2), la moyenne, la médiane et le mode sont proches et voisins du centre. Le kurtosis est une mesure de l’« aplatissement » des valeurs autour de la moyenne. Elle indique si la courbe de distribution est plus pointue ou plus aplatie que la distribution normale. La cloche d’une distribution avec un kurtosis élevé (leptokurtique) est plus pointue que celle de la courbe normale, avec des queues plus importantes, tandis que celle d’une distribution avec un kurtosis bas (platykurtique) est plus plate que celle de la courbe normale, avec des queues plus courtes. Dans une distribution normale, le kurtosis a une valeur nulle ou proche de zéro.1


26

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

ANALYSE D’UN ENSEMBLE DE DONNÉES À L’AIDE DE SPSS La commande Explore de SPSS fournit un éventail de statistiques et de graphiques associés, très utiles pour l’analyse d’une distribution de scores. Outre les statistiques descriptives telles que la moyenne, la médiane, le mode et l’écart-type, Explore fournit des mesures de la symétrie et du kurtosis, des diagrammes à tiges et à feuilles, des histogrammes, des tracés en boîte (aussi appelés tracés en rectangle et moustaches) et des tracés normaux. Utilisez Explore pour analyser tous les cas d’une distribution des résultats de l’évaluation nationale ou pour vous concentrer sur des sous-groupes, tels que les élèves masculins et féminins ou les élèves fréquentant les écoles de différentes régions. Dans l’exercice qui suit, Explore utilise les mêmes données que celles manipulées dans le volume Mettre en œuvre une évaluation nationale des acquis scolaires (Greaney et Kellaghan, 2012) (NATASSESS4.SAV).2 L’accent est mis sur les données d’une variable, Mathss (échelle des scores en mathématiques). L’exercice 2.1 présente un certain nombre de méthodes alternatives pour obtenir des statistiques descriptives. Avant de commencer l’exercice, cliquez sur Edit – Options – General dans la barre d’outils de SPSS et vérifiez que Display Names a été sélectionné sous Variable Lists. Cliquez sur OK. Vous pouvez également utiliser Explore pour effectuer une première analyse afin de comparer les niveaux de variables uniques telles que Gender ou Region. L’exercice 2.2 décrit comment obtenir des statistiques synthétiques pour les quatre régions où des données ont été recueillies pendant l’évaluation nationale.

EXERCICE 2.1 Utilisation d’Explore dans SPSS pour une seule variable dépendante (un niveau) 1. Ouvrez le fichier de données NAEA DATA ANALYSIS\MY SPSS DATA\NATASSESS. SAV. (Remarque : Vous avez sauvegardé les données de l’exercice 1.1 dans ce sous-répertoire.) 2. Vérifiez que les poids ont été activés : Cliquez sur Data – Weight Cases – Weight Cases by – Wgtpop – OK.


| 27

ANALYSE DES DONNÉES D’UNE ÉVALUATION NATIONALE À L’AIDE DE SPSS

EXERCICE 2.1 (suite) 3. Dans la barre d’outils, sélectionnez Analyze – Descriptive Statistics – Explore. 4. Déplacez Mathss (échelle des scores en mathématiques) vers Dependent List. Déplacez Studid vers Label Cases by.a 5. Vérifiez que Both est coché sous Display (pour assurer l’affichage des graphiques et des statistiques dans vos résultats). Cliquez sur Statistics (coin supérieur droit). Assurez-vous qu’une marque se trouve devant Descriptives. Cliquez sur Continue – Plots. Vérifiez que Stem-and-Leaf est coché. Cliquez sur Continue – OK. 6. Cliquez sur Window dans la barre d’outils, puis sur Output1. Sauvegardez le résultat sous NAEA DATA ANALYSIS\MY SOLUTIONS\EXERCISE 2.1.SPV.b Le tableau 2.1.A résume le traitement des cas. Étant donné que les données ont été pondérées par rapport à la taille de la population, les 4 747 cas de la base de données représentent une population de 51 713. Il n’y a aucun cas manquant (Pourcentage de cas valides : 100). TABLEAU 2.1.A Résumé du traitement des cas

Cas Valides

Manquants

Total

Variable

N

Pourcentage

N

Pourcentage

N

Pourcentage

Mathss

51 713

100,0

0

0,0

51 713

100,0

Les explications suivantes décrivent comment interpréter les statistiques du tableau 2.1.Bc : • Le score moyen (250,0) est la moyenne arithmétique pondérée. L’erreur-type de la moyenne est de 0,22. (Voir le chapitre 4 pour une description des erreurs-types.) • L’intervalle de confiance de 95 % pour la moyenne est la fourchette approximative de valeurs estimée au sein de laquelle la moyenne inconnue de la population de l’évaluation nationale a une probabilité de 95 % de se situer. L’intervalle de confiance va de 249,6 (limite inférieure) à 250,4 (limite supérieure). (Cette estimation est basée sur le score moyen de ± 1,96 multiplié par l’écart-type.) • La moyenne élaguée de 5 % est la moyenne arithmétique calculée sans tenir compte de 5 % des scores (cas) les plus élevés et de 5 % des scores les plus bas. Elle fournit une meilleure mesure de la tendance centrale lorsque la distribution est asymétrique. La moyenne élaguée de 5 % vaut 251,1. • La médiane est la valeur en dessous de laquelle se situent 50 % des cas. Elle correspond au 50e centile. La médiane vaut 256,3. (suite)


28

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 2.1 (suite) TABLEAU 2.1.B Statistiques descriptives

Variable Mathss

Description

Statistique

Erreur-type

250,0

0,22

Moyenne Intervalle de confiance de 95 % pour la moyenne

Limite inférieure Limite supérieure

249,6 250,4

Moyenne élaguée de 5 %

251,1

Médiane

256,3

Variance

2 499,8

Écart-type

50,0

Minimum

88,4

Maximum

400,0

Intervalle

311,6

Intervalle interquartile

67,1

Asymétrie

− 0,380

0,011

Kurtosis

− 0,101

0,022

• L’écart-type (égal à la racine carrée de la variance) vaut 50,0. • Le minimum et le maximum sont la plus petite (88,4) et la plus grande (400,0) valeur dans la distribution. • L’intervalle des scores est la différence (311,6) entre la plus grande et la plus petite valeur des scores dans la distribution. • L’intervalle interquartile est la distance entre le troisième quartile (75e centile) et le premier quartile (25e centile). Il mesure la dispersion des données. L’IIQ des scores vaut 67,1. • L’asymétrie est une mesure de la symétrie de la courbe d’une distribution. L’asymétrie d’une distribution normale est proche de zéro et sa courbe est symétrique. Dans notre exercice, l’asymétrie est légèrement négative (− 0,38). Une valeur de l’asymétrie comprise entre − 1 et + 1 est considérée comme très bonne pour la plupart des utilisations psychométriques, mais une valeur comprise entre − 2 et + 2 est généralement acceptable. • Le kurtosis est une mesure de la dispersion des valeurs autour d’un point central (« aplatissement » de la distribution). Pour une distribution normale, le kurtosis a une valeur nulle ou proche de zéro. Un kurtosis plus positif indique que les observations (scores) sont regroupées en un pic et que les queues de la courbe sont aplaties (distribution leptokurtique), tandis qu’un kurtosis plus négatif indique que les observations sont moins regroupées et que les queues de la courbe sont plus élevées et plus courtes (distribution platykurtique) que dans la distribution normale.


| 29

ANALYSE DES DONNÉES D’UNE ÉVALUATION NATIONALE À L’AIDE DE SPSS

EXERCICE 2.1 (suite) Comme pour l’asymétrie, un kurtosis compris entre − 1 et + 1 est considéré comme très bon, mais une valeur comprise entre − 2 et + 2 est généralement acceptable. La valeur de − 0,101 que nous avons obtenue est parfaitement dans ces limites. L’analyse produit un diagramme à tiges et à feuilles (figure 2.1.A) montrant la densité relative et la forme des données. Il s’agit d’une méthode de présentation de la fréquence des scores. Chaque valeur observée (classée par ordre croissant) est divisée en deux composantes : les chiffres de tête (tige) et les chiffres de fin (feuille). La tige représente les dix chiffres (ou plus) de la fréquence d’un score et la feuille contient les derniers chiffres. La tige 15, par exemple, montre que 821 élèves (après pondération) ont obtenu des scores entre 150 et 159 (inclusivement). Les données indiquent également que les valeurs inférieures ou égales à 117 et égales ou supérieures à 386 sont jugées « extrêmes » pour des raisons expliquées plus loin. FIGURE 2.1.A Diagramme à tiges et à feuilles de l’échelle des scores en mathématiques

Fermez le fichier de données SPSS NATASSESS.SAV en sélectionnant File – Exit dans la barre d’outils. Il y a un fichier pour cet exercice dans le répertoire Exercise Solutions. La commande Explore produit également un tracé en rectangle et moustaches (figure 2.1.B). Il s’agit d’une représentation graphique de la distribution des scores qui matérialise par un rectangle la médiane (50e centile) et les 25e et 75e centiles. La distance entre le haut et le bas du rectangle (entre le 25e et le 75e centile) est l’IIQ ou distance entre le score le plus élévé et le score le plus bas des 50 % du milieu de la distribution. (suite)


30

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 2.1 (suite) Ce tracé indique également les valeurs aberrantes et extrêmes. Les moustaches (les lignes horizontales tracées en haut et en bas du rectangle) représentent respectivement la valeur la plus élevée et la valeur la plus basse ni aberrantes ni extrêmes. Les valeurs aberrantes (comprises entre 1,5 et 3 fois l’IIQ) et extrêmes (supérieures à 3 fois l’IIQ) sont représentées par de petits cercles au-delà des moustaches. Les nombres indiqués (par ex., 423410) représentent le numéro d’identification des élèves (Studid) ayant obtenu ces scores aberrants ou extrêmes. La boîte à moustaches (figure 2.1.B) fournit des renseignements utiles sous une forme visuelle. Elle permet de visualiser les caractéristiques suivantes des données : • La médiane (la ligne au centre du rectangle) est le milieu de la distribution, et tout comme le score moyen, est une mesure de la tendance centrale. FIGURE 2.1.B Tracé en rectangle et moustaches de l’échelle des scores en mathématiques

400,00

423410 407215

300,00

e

75 centile median e

25 centile

200,00

100,00

56315 403109 441114 412230 410103 419208 417218

0,00 échelle des scores en mathématiques cas pondérés par Wgtpop

• La hauteur du rectangle (IIQ) montre à quel point les valeurs des scores varient dans la distribution. • Lorsqu’elle est située dans la moitié inférieure du rectangle, la médiane suggère une asymétrie positive, et négative lorsqu’elle est située dans la moitié supérieure.


ANALYSE DES DONNÉES D’UNE ÉVALUATION NATIONALE À L’AIDE DE SPSS

| 31

EXERCICE 2.1 (suite) Dans la figure 2.1.B, la médiane se trouve à peu près au milieu du rectangle, indiquant ainsi une relativement faible asymétrie. Les scores aberrants, situés à une distance comprise entre 1,5 et 3 fois la hauteur totale des rectangles supérieur (75e centile) et inférieur (25e centile), et les scores extrêmes, situés à une distance supérieure à 3 fois cette hauteur totale, doivent être examinés pour déterminer s’ils sont erronés ou effectivement valides. a. Si vous le souhaitez, vous pouvez également générer des statistiques ou des diagrammes optionnels. Cliquez sur Statistics après l’étape 3, et vous pouvez choisir les élèves ayant des scores extrêmes en sélectionnant Outliers (qui énumère les cinq scores les plus élevés et les cinq plus faibles dans la distribution). De même, en sélectionnant Percentiles, vous pouvez obtenir les scores des 5e, 10e, 25e, 50e, 75e, 90e et 95e centiles, en plus des Descriptives par défaut. En cliquant sur Plots, vous pouvez sélectionner Histogram en plus du diagramme à tiges et à feuilles par défaut. Vous pouvez copier les deux dans un document Word. b. Notez qu’une copie du résultat de l’exercice 2.1 est également disponible dans NAEA Data Analysis\ Exercise Solutions\Exercise2.1.SPV. c. Notons qu’à part celles des deux dernières lignes, toutes les valeurs du tableau 2.1.B ont été arrondies à une décimale pour les estimations et à deux décimales pour les erreurs-types. Pour ce faire, nous avons sélectionné les valeurs (autres que l’asymétrie et le kurtosis) dans le tableau, cliqué à droite et sélectionné Cell – Properties – Format – Value – Number afin de fixer le nombre de décimales à 1 (ou 2).

EXERCICE 2.2 Utilisation d’Explore dans SPSS pour une seule variable dépendante (plus d’un niveau) 1. Ouvrez le fichier de données de SPSS NAEA DATA ANALYSIS\MY SPSS DATA\ NATASSESS.SAV. 2. Sélectionnez Analyze – Descriptive Statistics – Explore. Déplacez Mathss vers Dependent List. Déplacez Region vers Factor List. Déplacez Studid vers Label Cases by. Vérifiez que Both est bien coché sous Display (les diagrammes et les statistiques seront affichés dans vos résultats). Cliquez sur Statistics (coin supérieur droit). Assurez-vous qu’une marque apparaît devant Descriptives. Cliquez sur Continue – Plots. Vérifiez que Stem-and-Leaf est coché. Cliquez sur Continue – OK. Faites défiler votre fichier de résultat pour voir les statistiques descriptives de chacune des quatre régions. Notez, par exemple, que le score moyen pour la région Northwest est 233,3. Les données correspondantes pour les régions Metro Area, Eastern Highlands et Southwest Coast sont respectivement 265,7 ; 249,1 et 251,2.a Faites défiler jusqu’à la fin pour voir les tracés en rectangle et moustaches de chacune des quatre régions (figure 2.2.A). (suite)


32

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 2.2 (suite) FIGURE 2.2.A Tracé en rectangle et moustaches de l’échelle des scores en mathématiques

échelle des scores en mathématiques

400,00

423410

407215

422113

300,00

200,00

100,00

410103

456518 311109 456431 327103 429125 225102 225103 321109 445204 429109 412230 450230 429111 419208 456315 417218

434202 403109 415113 458208 230206

0,00 Northwest

Metro area

Eastern Highlands

Southwest Coast

region

3. Le tracé en rectangle et moustaches (figure 2.2.A) montre les scores médians des quatre régions (Northwest, Metro Area, Eastern Highlands et Southwest Coast). L’analyste remarquera le nombre relativement important de scores « extrêmes » dans la région Metro Area (une fonction du score relativement élevé au 25e centile de cette région) par rapport, notamment, au Northwest. 4. Sauvegardez le résultat dans NAEA DATA ANALYSIS\MY SOLUTIONS \EXERCISE 2.2.SPV. Enregistrez le fichier de données de SPSS et quittez SPSS : File – Save et File – Exit. a. Les erreurs-types appropriées sont calculées dans l’exercice 3.3.

NOTES 1. L’asymétrie et le kurtosis ne sont généralement pas rapportés dans les évaluations nationales. Ils peuvent néanmoins aider à déterminer les formes de distribution qui pourraient être problématiques. 2. Contrairement à NATASSESS4.SAV, NATASSESS.SAV ne contient ni les zones jackknife, ni les répliques jackknife (indicateurs). Voir l’annexe 1.C.


3

CHAPITRE

INTRODUCTION À WESVAR

Ce chapitre décrit les procédures permettant de calculer des estimations de population, telles que des scores moyens et des rangs centiles, ainsi que les erreurs-types associées, à l’aide de données d’évaluation nationale pondérées. Les analyses présentées dans ce chapitre et les suivants sont réalisées avec le logiciel statistique WesVar, qui prend en charge la complexité d’un échantillon à plusieurs degrés.

CRÉATION D’UN FICHIER DE DONNÉES DANS WesVar Assurez-vous que WesVar est installé sur votre ordinateur. Vous pouvez le télécharger à partir du site Internet de Westat.1 Vous devez modifier le fichier de données SPSS NATASSESS.SAV avant de pouvoir l’enregistrer en tant que fichier WesVar. Pour être converti en un fichier WesVar, votre fichier SPSS doit comprendre des variables telles que celles mentionnées ci-dessous (les noms réellement donnés aux variables sont arbitraires) : • Studid : numéro d’identification des élèves, un numéro unique attribué à chaque élève.

33


34

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

• Wgtpop : poids dans la population, pondère les données afin de fournir une bonne estimation d’une caractéristique de la population considérée. • Jkzone : zone jackknife ;2 chaque paire d’établissements est affectée à une zone jackknife différente. • Jkindic : indicateur jackknife ; dans chaque zone jackknife3, un établissement se voit aléatoirement attribuer la valeur 0 et l’autre la valeur 1. Le fichier SPSS, NATASSESS4.SAV figurant dans le répertoire NAEA DATA ANALYSIS\SPSS DATA, contient les données de chacune de ces variables clés. Pour transférer le fichier SPSS contenant les données des tests et questionnaires dans WesVar et créer les poids de rééchantillonnage (poids des répliques), suivez les instructions de l’annexe I.C de ce volume et enregistrez votre nouveau fichier WesVar, NATASSESS4.VAR, dans le répertoire NAEA DATA ANALYSIS\MY WESVAR FILES. Sinon, pour réaliser les exercices qui vont suivre, vous pouvez aussi utiliser le fichier WesVar prêt à l’emploi, mais sans intitulés, NATASSESS4.VAR figurant dans le sousrépertoire WESVAR UNLABELED DATA.

ATTRIBUTION D’INTITULÉS AUX VALEURS DES VARIABLES Suivez les instructions suivantes :4 1. Ouvrez le fichier NATASSESS4.VAR dans le répertoire WesVar– OpenWesVarDataFile–NAEADATAANALYSIS\WESVAR UNLABELED DATA. 2. Dans la barre d’outils, sélectionnez Format – Label. 3. Sélectionnez Region dans la fenêtre Source Variables (à gauche). 4. Dans la colonne Label, saisissez Northwest dans la cellule voisine de la valeur 1 ; Metro_Area pour la valeur 2 ; Eastern_Highlands pour la valeur 3 ; et Southwest_Coast pour la valeur 4 (figure 3.1). 5. Cliquez sur OK. Vous recevez le message This operation will create a new VAR file, vous avertissant qu’un nouveau fichier VAR va être créé. Cliquez de nouveau sur OK. Enregistrez votre fichier dans NAEA DATA ANALYSIS\MY WESVAR FILES sous


INTRODUCTION À WESVAR

| 35

FIGURE 3.1 Attribution d’intitulés aux valeurs des variables dans WesVar

le nom NATASSESS4.VAR.5 Il écrasera tout fichier existant portant le même nom. 6. Sélectionnez File – Close.

CALCUL DES STATISTIQUES DESCRIPTIVES DANS WesVar Des statistiques descriptives peuvent être générées de plusieurs manières dans WesVar. Ici, la commande de menu Descriptive Stats est utilisée pour générer certaines statistiques descriptives pour la variable Mathss, l’échelle des scores en mathématiques. Lorsque vous ouvrez WesVar, quatre options vous sont proposées : 1. New WesVar Data File : permet de créer un fichier WesVar à partir d’un fichier dans un format autre, tel que SPSS. (L’annexe I.C décrit le processus de création d’un nouveau fichier de données WesVar.) 2. Open WesVar Data File : permet d’ouvrir un fichier WesVar existant pour le modifier, par exemple, afin de donner des intitulés aux


36

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

valeurs des variables ou les recoder. Dans les exercices qui suivent, vous utiliserez le fichier WesVar NATASSESS4.VAR existant. 3. New WesVar Workbook : permet de créer un classeur WesVar. Dans ce logiciel, toutes les analyses doivent être exécutées dans un classeur lié à un fichier de données WesVar. Vous créerez un nouveau classeur pour l’exercice 3.1. 4. Open WesVar Workbook : permet d’ouvrir un classeur existant afin de réaliser de nouvelles analyses ou de modifier celles qui existent déjà. Vous pourrez ouvrir le classeur WesVar que vous créerez dans l’exercice 3.1 et l’utiliser pour effectuer des analyses supplémentaires (exercices 3.2 et 3.3). Suivez les étapes de l’exercice 3.1.

EXERCICE 3.1 Génération de statistiques descriptives dans WesVar 1. Lancez WesVar et cliquez sur New WesVar Workbook. Dans ce classeur, vous pourrez indiquer à WesVar les analyses que vous souhaitez exécuter. Si vous recevez le message : Before creating a new Workbook, you will be asked to specify a data file that will be used as the default data file for new Workbook requests, vous indiquant qu’il vous faut spécifier le fichier par défaut que vous voulez utiliser pour les requêtes, cliquez sur OK. 2. Une fenêtre intitulée Open WesVar Data File for Workbook apparaît. Trouvez le fichier NAEA DATA ANALYSIS\MY WESVAR FILES\NATASSESS4.VAR.a 3. Sélectionnez Open – NATASSESS4.VAR. Cliquez sur Descriptive Stats (en bas à droite de l’écran). Sélectionnez WorkBook Title 1 dans le panneau de gauche. Pour remplacer ce titre par un nom plus spécifique, sélectionnez le texte figurant dans le champ Title du panneau de droite, et tapez Chapter 3 Exercises. De même, modifiez le champ Request Name de Descriptive Request One en entrant comme nouveau nom Exercise 3.1 (voir la figure 3.1.A). Sauvegardez votre classeur en sélectionnant File – Save As et en choisissant le répertoire NAEA DATA ANALYSIS\ MY WESVAR FILES. Enregistrez votre fichier sous le nom CHAPTER 3 WORKBOOK 4. Sélectionnez Options – Output Control dans le panneau de gauche. Cela vous permet de contrôler le nombre de décimales des données de sortie. De nombreuses évaluations nationales utilisent une décimale pour leurs estimations (telles que les scores moyens ou les rangs centiles) et deux pour les erreurs-types. Introduisez ces chiffres dans les deux derniers champs du panneau de droite. (Vous pouvez rendre ces spécifications permanentes pour ce classeur en allant dans File – Preferences – General. Spécifiez les nombres de décimales souhaités et cliquez sur Save.)


INTRODUCTION À WESVAR

| 37

EXERCICE 3.1 (suite) FIGURE 3.1.A Nouveau classeur WesVar

5. Sélectionnez Analysis Variables dans le panneau de gauche. Déplacez Mathss de Source Variables vers Selected (figure 3.1.B). Des variables supplémentaires peuvent être transférées vers Selected si désiré. FIGURE 3.1.B Spécifications des variables pour l’analyse dans WesVar Descriptives

(suite)


38

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 3.1 (suite) 6. Pour lancer l’analyse, cliquez sur l’icône avec la flèche verte dans la barre d’outils (ou sélectionnez Requests – Run Workbook Requests dans le menu). Les calculs peuvent prendre un certain temps. Cliquez sur l’icône Open Book dans la barre d’outils. 7. Pour afficher les résultats, développez la liste en cliquant sur le signe + devant Exercise 3.1, Variables et Mathss. Sélectionnez Statistics pour voir les résultats (voir la figure 3.1.C). WesVar Descriptives génère les statistiques suivantes : • N est le nombre de cas. La colonne intitulée « Weighted » indique que, quand le poids dans la population Wgtpop est appliqué, la population est estimée à 51 713 cas. La taille non pondérée de l’échantillon est égale à 4 747. FIGURE 3.1.C Données de sortie de WesVar Descriptives

• Minimum et Maximum. Les valeurs obtenues sont respectivement 88,3 et 400,0. • Percentile ranks. Les valeurs non pondérées et pondérées sont fournies pour les 1er, 5e, 10e, 25e, 50e, 75e, 90e, 95e, et 99e quantiles (rang centiles). Les valeurs pondérées sont normalement reprises dans les rapports. Par exemple, le score pondéré au 25e centile est 217,3. C’est la valeur estimée en dessous de laquelle se situent les scores de 25 % des élèves de 4e année. L’erreur-type (2,73) correspondant figure dans la dernière colonne, « SE Weighted ». La prochaine section de ce chapitre contient des informations supplémentaires sur la signification de l’erreur-type et la façon de le calculer.


INTRODUCTION À WESVAR

| 39

EXERCICE 3.1 (suite) • Mean. La moyenne non pondérée est de 250,2. La moyenne pondérée est de 250,0 avec une erreur-type de 2,20. Cette valeur de 250 n’est pas surprenante puisqu’elle a été fixée pour la moyenne lors de la définition de l’échelle. Si vous le souhaitez, vous pouvez établir un intervalle de confiance de 95 % autour de la moyenne, avec l’erreur-type de 2,20 (voir ci-dessous). • GeoMean. La moyenne géométrique est donnée par la racine nième du produit des valeurs d’une distribution de n éléments. En général, la moyenne géométrique n’est pas reprise dans les rapports des évaluations nationales. • Sum. Somme des valeurs des éléments d’une distribution. Elle n’est pas reprise dans les rapports des évaluations nationales. • Variance. L’écart-type est la racine carrée de la variance. La variance pondérée est de 2 499,73 (presque 2 500). Sa racine carrée vaut 50, ce qui correspond à l’écart-type fixé pour Mathss lors de la définition de l’échelle. • CV. Le coefficient de variation est calculé en divisant la racine carrée de la variance par le score moyen. Les valeurs non pondérées et pondérées du CV sont les mêmes (0,20). • Skewness. Le coefficient de dissymétrie indique que la distribution de Mathss a une asymétrie légèrement négative (−0,38). Notons qu’un coefficient de dissymétrie compris entre +1 et -1 est considéré comme satisfaisant (voir le chapitre 2). • Kurtosis. La valeur pondérée du kurtosis (aplatissement) est -0,10. Encore une fois, cette valeur est comprise entre +1 et -1, indiquant ainsi qu’il n’y a pas de problème particulier avec le kurtosis. 8. Enregistrez les résultats WesVar dans un fichier texteb en cliquant sur File et Export dans la barre des menus de votre fichier de résultat. Sélectionnez Single File et One Selection et cliquez sur Export (figure 3.1.D). Enregistrez le fichier dans NAEA DATA ANALYSIS\MY SOLUTIONS en lui donnant un nom approprié (tel qu’EXERCISE 3.1.TXT).c 9. Cliquez sur l’icône Exit Door (dernière icône de la barre d’outils) pour revenir au classeur WesVar. Sauvegardez votre classeur en sélectionnant File – Save dans la barre des menus. Enregistrez-le dans NAEA DATA ANALYSIS\MY WESVAR FILES sous le nom CHAPTER 3 WORKBOOK.d Vous pourrez réutiliser ce classeur pour vérifier vos réponses ou pour réaliser d’autres analyses décrites dans ce chapitre. Cliquez sur File, puis sur Exit si vous souhaitez quitter la session WesVar. Pour rouvrir ce classeur dans une autre session WesVar, lancez WesVar et sélectionnez Open WesVar Workbook (panneau de droite). Recherchez CHAPTER 3 WORKBOOK dans MY WESVAR FILES. (suite)


40

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 3.1 (suite) FIGURE 3.1.D Exportation d’un fichier WesVar

a. Si vous n’avez pas encore enregistré NATASSESS4.VAR dans NAEA DATA ANALYSIS\MY WESVAR FILES, vous devez le copier à partir de NAEA DATA ANALYSIS\WESVAR DATA & WORKBOOKS et le coller dans NAEA DATA ANALYSIS\MY WESVAR FILES. Si vous utilisez ce Copy-Paste, vous devez en même temps copier le fichier journal associé NATASSESS4.LOG dans le même sous-répertoire. b. Les fichiers texte peuvent être copiés dans Excel afin d’y être reformatés en vue de leur intégration dans un rapport d’évaluation nationale. Les résultats peuvent également être directement copiés à partir du fichier de résultat de WesVar et collés dans un fichier Excel. c. Pour rouvrir les données de sorties enregistrées en tant que fichier texte, cliquez sur (My) Computer, localisez le fichier (par exemple, dans NAEA DATA ANALYSIS\MY SOLUTIONS) et double-cliquez. Si vous le souhaitez, vous pouvez coller le contenu des fichiers .TXT dans Excel. Sélectionnez et copiez les données souhaitées dans le fichier texte, puis utilisez Paste Special (Unicode Option) pour préserver leur format. d. Vous remarquerez dans NAEA DATA ANALYSIS\WESVAR DATA & WORKBOOKS que WesVar produit des fichiers de sortie avec des suffixes tels que .001, .002, etc. chaque fois que vous travaillez sur un classeur. Vous n’avez pas besoin de manipuler ces fichiers pour faire fonctionner WesVar ou accéder aux résultats. À l’exception des fichiers texte que vous créez, tous les fichiers WesVar ne peuvent être ouverts qu’après lancement du programme.

CALCUL D’UN SCORE MOYEN ET DE SON ERREUR-TYPE L’erreur-type d’une série statistique ou d’une variable aléatoire mesure la façon dont les valeurs de cette série ou variable se dispersent autour de la moyenne. Il est une estimation de la dispersion (ou de l’étalement) des valeurs qui seraient obtenues si l’échantillon


| 41

INTRODUCTION À WESVAR

de la population considérée était infini (par exemple, tous les élèves de 4e année). L’erreur-type d’une moyenne est une statistique importante, car elle est utilisée dans les tests de signification statistique. Elle doit toujours accompagner les résultats des évaluations nationales. Les erreurs-types peuvent également être calculées pour d’autres statistiques, comme les rangs centiles. L’exercice 3.2 décrit comment calculer un score moyen, son erreur-type et son intervalle de confiance dans WesVar. EXERCICE 3.2 Calcul d’un score moyen et de son erreur-type dans WesVar 1. Lancez WesVar et cliquez sur Open WesVar Workbook. Localisez le classeur utilisé dans l’exercice 3.1 (NAEA DATA ANALYSIS\MY WESVAR FILES\CHAPTER 3 WORKBOOK). 2. Sélectionnez Chapter 3 Exercises (panneau de gauche). Puis cliquez sur Table (panneau de droite). Sélectionnez Table Request One (panneau de gauche). Cliquez sur Add Table Set Single (panneau de droite). Cliquez sur Table Request One (panneau de gauche). Modifiez le nom de la requête en introduisant Exercise 3.2 dans Request Name (panneau de droite). 3. Sélectionnez Options – Generated Statistics (panneau de gauche) et assurez-vous qu’Estimate, Standard Error et Confidence Interval (Standard) sont cochés. Décochez les autres cases. En dessous d’Exercise 3.2 (panneau de gauche), cliquez sur Computed Statistics. Sélectionnez Mathss dans le menu Source Variables (panneau de droite) et cliquez sur Block Mean (panneau de droite également) (figure 3.2.A). Cliquez sur l’icône avec la flèche verte dans la barre d’outils (Run Workbook Request). Cliquez sur l’icône Open Book dans la barre d’outils pour voir les résultats. 4. Dans Output, sélectionnez Exercise 3.2, Table Set #1 et puis Overall. Si nécessaire, cliquez sur l’icône + (plus) pour développer la liste. Les résultats sont montrés dans la figure 3.2.B. Les résultats WesVar présentés dans la figure 3.2.B fournissent les données suivantes : • M_Mathss, le score moyen pondéré vaut 250,0. • StdError, l’erreur-type vaut 2,20. • Lower 95% et Upper 95% forment l’intervalle de confiance de 95 % entourant le score moyen de 250, soit 245,6 (limite inférieure) et 254,4 (limite supérieure). Le véritable score moyen de la population a 95 % de chance de se trouver dans cet intervalle.a Celui-ci aurait également pu être calculé avec les données de la figure 3.1.C, où la moyenne et l’erreur-type valent respectivement 250,0 et 2,20. (suite)


42

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 3.2 (suite) 5. Enregistrez votre résultat en cliquant sur File et Export. Sélectionnez les options Single File et One Selection. Exportez votre résultat sous forme d’un fichier texte dans NAEA DATA ANALYSIS\MY SOLUTIONS, en utilisant un nom de fichier approprié (tel qu’Exercise 3.2.Txt). 6. Quittez les résultats à l’aide de l’icône Exit Door de la barre d’outils et enregistrez votre classeur WesVar en sélectionnant File – Save et ensuite File – Close. Cela devrait enregistrer votre classeur dans NAEA DATA ANALYSIS\MY WESVAR FILES. FIGURE 3.2.A Spécification du calcul d’une statistique dans un tableau WesVar

FIGURE 3.2.B Tableau des résultats dans WesVar : Calcul du score moyen

a. Notons que dans le calcul des intervalles de confiance à 95 %, WesVar multiplie l’erreur-type par 2,00 plutôt que par le chiffre plus conventionnel de 1,96. Il en résulte un intervalle de confiance légèrement plus grand.


INTRODUCTION À WESVAR

| 43

CALCUL DES SCORES MOYENS ET DE LEURS ERREURS-TYPES POUR DES SOUS-GROUPES DE LA POPULATION Les responsables des politiques, chercheurs ou autres peuvent souhaiter obtenir des statistiques descriptives pour différents niveaux d’une variable. Par exemple, ils peuvent être intéressés par les scores moyens en mathématiques au niveau national, pour les filles et les garçons ou par les scores moyens des élèves de différentes régions du pays. Un simple ajout au classeur WesVar permet de calculer le score moyen et son erreur-type pour chacune des quatre régions de l’évaluation nationale du Sentz (Northwest, Metro Area, Eastern Highlands, Southwest Coast) (exercice 3.3).

EXERCICE 3.3 Calcul des scores moyens et erreurs-types dans WesVar, pour quatre régions 1. Lancez WesVar. Sélectionnez Open WesVar Workbook. Ouvrez le classeur WesVar que vous avez enregistré à la fin de l’exercice 3.2. Il devrait s’intituler NAEA DATA ANALYSIS\MY WESVAR FILES\CHAPTER 3 WORKBOOK. 2. Sélectionnez le nœud Exercise 3.2 dans le panneau de gauche de l’écran de votre classeur et faites un clic droit sur Clone. Cela crée une copie de la requête Compute Mean Score. Cliquez sur Table Request Two et donnez-lui un intitulé, tel qu’Exercise 3.3, dans le panneau de droite. Développez Exercise 3.3 dans le panneau de gauche. Dans Options – Output Control, spécifiez une décimale pour Estimate et deux pour Std. Error. Assurez-vous que Variable Label et Value Label sont cochés. Décochez les autres options. 3. Cliquez sur Table Set #1. Puis, dans le panneau de droite, déplacez Region de Source Variables vers la boîte Selected. Cliquez sur Add as New Entry. 4. Saisissez des intitulés pour les valeurs de Region si cela n’a pas déjà été fait pour le fichier de données WesVar (Natassess4.var). Dans le panneau de gauche, cliquez sur Region – Cells. Sous Cell Definition (panneau de droite), cliquez sur 1 (en dessous de Region) et saisissez Northwest dans la cellule Label. Appuyez sur la touche Return de votre clavier, ou cliquez sur Add as New Entry. Recommencez le processus pour associer l’intitulé Metro_Area à 2, Eastern_Highlands à 3 et Southwest_Coast à 4. (WesVar n’autorisant aucun espace entre les mots, vous devez utiliser des tirets de soulignement.) 5. Sélectionnez Region (panneau de gauche). Sous Sum of Weights dans la colonne de droite, cochez Percent et décochez les autres cases. L’option Percent donnera le (suite)


44

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 3.2 (suite) pourcentage des élèves dans chaque région, et les scores moyens en mathématiques seront générés séparément pour chaque région puisque Mathss a déjà été spécifié dans Computed Statistics (voir la figure 3.3.A). FIGURE 3.3.A Classeur WesVar avant calcul des scores moyens par région

6. Cliquez sur l’icône avec la flèche verte de la barre d’outils pour lancer l’analyse, puis sur l’icône Open Book pour voir les résultats. Ceux-ci sont montrés dans la figure 3.3.B. Si nécessaire, cliquez sur l’icône + (plus) pour développer Exercise 3.3, Table Set #1 afin de pouvoir cliquer sur Region pour afficher les résultats. 7. Enregistrez les résultats en cliquant sur File puis sur Export. Sélectionnez les options Single File et One Selection. Exportez les résultats sous forme d’un fichier texte dans NAEA DATA ANALYSIS\MY SOLUTIONS avec un nom de fichier approprié (tel qu’EXERCISE 3.3.TXT). 8. Quittez les résultats en cliquant sur l’icône Exit Door et enregistrez votre classeur WesVar en sélectionnant File – Save puis File – Close. Sinon, vous pouvez aussi utiliser File – Save As, et écraser le classeur NAEA DATA ANALYSIS\MY WESVAR FILES\CHAPTER 3 WORKBOOK existant. Les résultats présentés dans la figure 3.3.B donnent les scores moyens, les erreurstypes et les intervalles de confiance à 95 % pour chaque région. Par exemple, le score


INTRODUCTION À WESVAR

| 45

EXERCICE 3.2 (suite) moyen pour la région Northwest vaut 233,3 et son erreur-type est de 3,28. L’intervalle de confiance à 95 % correspondant va de 226,8 à 239,9. La figure montre également le pourcentage de la population totale des élèves de 4e année correspondant à chaque région (par exemple, 26,1 % dans la région Metro Area). FIGURE 3.3.B Résultats WesVar du calcul des scores moyens par région

NOTES 1. WesVar peut être téléchargé gratuitement à l’adresse http://www.westat .com/our-work/information-systems/wesvar-support/download-wesvar. 2. Cette variable peut également être appelée Jkpair ou « code de la paire constituée pour l’estimation de la variance ». Les zones Jackknife (JKpairs) doivent être déterminées pour pouvoir créer les poids des répliques. 3. Cette variable peut également être appelée Jkrep ou « code au sein de la paire (réplique) ». 4. Les instructions pour l’attribution d’intitulés vous demandent d’ouvrir un fichier de données dans WESVAR UNLABELED DATA. Cependant, si vous avez déjà créé un fichier en suivant les instructions de l’annexe 1.C, vous pouvez utiliser le fichier NAEA DATA ANALYSIS\MY WESVAR FILES sauvegardé au lieu de celui de WESVAR UNLABELED DATA. 5. Si vous copiez NATASSESS4.VAR dans WESVAR UNLABELED DATA et le collez dans MY WESVAR FILES à l’aide d’un Copy-Paste, le fichier ne s’exécutera pas si vous n’avez pas également copié le fichier journal associé NATASSESS4.LOG dans le même sous-répertoire.


4

CHAPITRE

COMPARAISON DES PERFORMANCES DE DEUX GROUPES OU PLUS

Les responsables des politiques peuvent se demander si les niveaux de performance de sous-groupes des élèves ayant participé à une évaluation nationale (par exemple, les garçons et les filles, les élèves fréquentant des écoles de différentes régions) sont très différents les uns des autres. Ce chapitre décrit les procédures permettant de répondre à ces questions.

EXAMEN DE LA DIFFÉRENCE ENTRE DEUX SCORES MOYENS Pour évaluer si la différence de performance entre deux groupes est statistiquement significative, il faut une variable catégorielle à au moins deux niveaux et une variable continue ou graduée. Les exemples ci-dessous concernent des questions d’intérêt impliquant des variables catégorielles et continues : • Sexe (féminin/masculin) (variable catégorielle) et performance en mathématiques (variable continue). La performance en mathématiques des élèves de sexe masculin diffère-t-elle significativement de celle des élèves de sexe féminin ? • Disponibilité de la lumière électrique pour l’étude (oui/non) (variable catégorielle) et performance en compréhension de l’écrit 47


48

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

(variable continue). La performance en compréhension de l’écrit des élèves pouvant étudier à domicile sous une lumière électrique diffère-t-elle significativement de celle des élèves sans électricité à la maison ? • Accès à une aide pour les devoirs à la maison (oui/non) (variable catégorielle) et performance en sciences (variable continue). La performance en sciences des élèves bénéficiant d’une aide à domicile pour faire leurs devoirs diffère-t-elle significativement de celle des élèves qui n’en ont pas ? • Utilisation de la langue d’enseignement à la maison (oui/non) (variable catégorielle) et connaissances civiques (variable continue). Les élèves parlant à la maison la même langue que celle dans laquelle l’enseignement est dispensé et les élèves parlant une autre langue dans leur famille ont-ils des performances très différentes au test des connaissances civiques ? • Accès à des manuels de lecture individuels à l’école (oui/non) (variable catégorielle) et performance en compréhension de l’écrit (variable continue). Les élèves ayant chacun leur propre manuel de lecture à l’école ont-ils un score moyen en compréhension de l’écrit significativement différent de celui des élèves obligés de partager les manuels ? Un test comparant les scores moyens de deux groupes répond à la question suivante : pour une variable donnée, le score moyen diffère-t-il significativement entre les populations représentées par les deux échantillons ? La réponse est donnée par le seuil de signification, connu sous le nom de valeur-p. Le terme « statistiquement significatif » indique qu’une différence observée a peu de chance d’être le fait du hasard. Si, par exemple, le seuil de signification de la différence moyenne est de 0,05 (valeur-p) pour les filles, cela signifie qu’il y a moins de 5 % de chance qu’elle soit le fruit du hasard. Une valeur-p de 0,01 signifie qu’il y a moins d’une chance sur cent que le résultat observé se produise si la variable d’intérêt ne diffère pas d’un groupe à l’autre. L’erreur-type de la différence (entre les moyennes) est un concept important pour la signification statistique des différences de scores moyens. Si la différence de scores moyens est suffisamment grande


COMPARAISON DES PERFORMANCES DE DEUX GROUPES OU PLUS

| 49

pour tomber en dehors de l’intervalle de confiance calculé à partir de son erreur-type, on peut en conclure qu’elle est statistiquement significative. Par contre, si elle tombe à l’intérieur de son intervalle de confiance, on peut en conclure qu’elle n’est pas statistiquement significative. Dans l’exemple suivant (exercice 4.1), l’objectif est de déterminer si la différence entre les performances moyennes en mathématiques des élèves qui ont la lumière électrique à la maison et de ceux qui en sont privés est statistiquement significative. Avant d’entamer l’exercice 4.1, donnez des intitulés aux valeurs de la variable Electric dans votre fichier de données. Pour ce faire, lancez WesVar et sélectionnez Open WesVar Data File. Ouvrez le fichier NAEA DATA ANALYSIS\MY WESVAR FILES\NATASSESS4.VAR. Ensuite, suivez les étapes décrites dans le chapitre 3 pour l’attribution d’intitulés, en entrant Yes pour 1 (pour indiquer la disponibilité de l’électricité à la maison) et No pour 2 (pour indiquer l’absence d’électricité). Enregistrez votre fichier de données WesVar dans NAEA DATA ANALYSIS\MY WESVAR FILES en écrasant, le cas échéant, le fichier NATASSESS4.VAR existant.

EXERCICE 4.1 Évaluation de la différence entre deux scores moyens 1. Lancez WesVar et cliquez sur New WesVar Workbook. Si vous recevez le message : Before creating a new Workbook, you will be asked to specify a data file that will be used as the default data file for new Workbook requests, vous indiquant qu’il vous faut spécifier le fichier par défaut que vous voulez utiliser pour les requêtes, cliquez sur OK. 2. La fenêtre Open WesVar Data File for Workbook s’ouvre. Sélectionnez le fichier de données NATASSESS4.VAR dans NAEA DATA ANALYSIS\MY WESVAR FILES. Cliquez sur Open. 3. Enregistrez votre nouveau classeur sous le nom NAEA DATA ANALYSIS\MY WESVAR FILES\CHAPTER 4 WORKBOOK.WVB. 4. Sélectionnez Workbook Title 1 (panneau de gauche) et saisissez Chapter 4 Exercises dans le champ Title (panneau de droite). Dans le champ New request (panneau de droite, moitié inférieure), cliquez sur Table. Sélectionnez Table Request One (panneau de gauche) et remplacez le contenu du champ Request Name (suite)


50

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 4.1 (suite) (panneau de droite) par Exercise 4.1. Cliquez sur Add Table Set Single (panneau de droite). 5. Allez à Options – Generated Statistics dans le panneau de gauche. Assurez-vous qu’Estimate, Standard Error, et Confidence Interval (Standard) sont cochés. Décochez les autres cases. 6. Allez à Options – Output Control dans le panneau de gauche. Assurez-vous qu’une décimale est spécifiée pour Estimates et deux décimales pour Std. Error. Vérifiez que la variable et les intitulés de ses valeurs sont définis. 7. Sélectionnez Computed Statistics, puis Mathss dans Source Variables (panneau de droite), et cliquez sur Block Mean. 8. Cliquez sur Table Set #1 (panneau de gauche). Déplacez Electric de Source Variables vers Selected dans le panneau de droite. Assurez-vous que Percent est coché en dessous de Sum of Weights. Décochez, si nécessaire, Value, Row Percent, et Column Percent. Cliquez sur le bouton Add as New Entry. 9. Sélectionnez Electric (panneau de gauche), et cliquez sur Cells en dessous. Cliquez sur 1 (panneau de droite), saisissez Yes dans le champ d’intitulé et appuyez sur la touche Return (ou cliquez Add as New Entry). Cliquez sur 2 et saisissez No dans le champ d’intitulé, et appuyez sur Return. 10. Sélectionnez maintenant Cell Functions (panneau de gauche). Saisissez MeanDiff = Yes − No dans le champ Function Statistic. Cliquez sur Add As New Entry. 11. En dessous de MeanDiff = Yes − No (panneau de gauche), cliquez sur For…. Assurez-vous que M_Mathss figure dans Selected (figure 4.1.A). Si nécessaire, déplacez Sum_Wts vers la boîte Source Variables. 12. Lancez l’analyse en cliquant sur l’icône avec la flèche verte dans la barre d’outils. Laissez au programme le temps d’achever ses calculs. Affichez les résultats en cliquant sur l’icône Open Book dans la barre d’outils. 13. Pour voir les scores moyens associés au fait d’avoir ou non la lumière électrique à domicile, développez Exercise 4.1 – Table Set #1 et cliquez sur Electric. Les données pour les élèves des ménages avec ou sans électricité sont visibles dans la figure 4.1.B. Notez que les élèves des ménages ayant l’électricité ont un score moyen Mathss de 254,3 et une erreur-type de 2,30. 14. Pour enregistrer le résultat, sélectionnez File – Export – Single File – One Selection, et cliquez sur Export. Enregistrez dans NAEA DATA ANALYSIS\MY SOLUTIONS en donnant un nom de fichier approprié (par exemple, EXERCISE 4.1A.TXT). 15. Pour afficher l’estimation de la différence entre les scores en mathématiques des élèves des ménages ayant ou non l’électricité (26,5), cliquez sur Functions (en dessous d’Electric) (figure 4.1.C).


| 51

COMPARAISON DES PERFORMANCES DE DEUX GROUPES OU PLUS

EXERCICE 4.1 (suite) FIGURE 4.1.A Classeur WesVar avant l’évaluation de la différence entre deux scores moyens

FIGURE 4.1.B Résultats WesVar : Scores moyens en mathématiques des élèves avec et sans électricité à la maison

La figure 4.1.B montre les scores moyens en mathématiques pour les élèves ayant l’électricité à la maison (254,3) et pour ceux sans électricité (227,8). Les erreurs-types correspondants sont 2,30 et 4,95. La figure 4.1.C donne la différence (26,5) entre les scores moyens en mathématiques des élèves ayant l’électricité à la maison et de ceux qui ne l’ont pas (Yes – No). L’erreur-type de cette différence vaut 5,64. L’intervalle de (suite)


52

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 4.1 (suite) FIGURE 4.1.C Résultats WesVar : Différence entre les scores moyens en mathématiques des élèves ayant ou non l’électricité à la maison

confiance de 95 % (autour de la différence entre les scores moyens) va de 15,2 (limite inférieure) à 37,8 (limite supérieure). L’intervalle de confiance permet de déterminer rapidement si une différence entre des moyennes est ou non significative. Si son intervalle de confiance comprend la valeur zéro (comme -4,5 à +7,9), on peut affirmer que la différence entre les moyennes n’est pas significativement différente de zéro au seuil de 0,05. Dans le cas présent, l’intervalle de confiance de 95 % (15,2 à 37,8) n’inclut pas zéro, et on peut en déduire que la différence entre les moyennes de 26,5 est significativement différente de zéro (p <0,05). La différence entre les performances moyennes en mathématiques des élèves ayant ou non l’électricité à la maison est statistiquement significative. Les informations obtenues dans cette analyse peuvent être résumées dans le tableau 4.1.A. Un tel tableau peut être intégré dans un rapport d’évaluation nationale. TABLEAU 4.1.A Comparaison des scores moyens en mathématiques des élèves ayant ou non l’électricité à la maison

Pourcentage des élèves (ET) (SE)

Score moyen (ET)

Électricité à la maison

83,9 (3,41)

254,3 (2,30)

Pas d’électricité à la maison

16,1 (3,41)

227,8 (4,95)

Situation

Comparaison Électricité – Pas d’électricité à la maison

Différence (ETD)

IC (95 %)

26,5 (5,64)

15,2 à 37,8

Remarque : IC (95 %) = intervalle de confiance de 95 % ; ET = erreur-type de l’estimation ; ETD = erreur-type de la différence. L’intervalle de confiance associé aux différences statistiquement significatives est en gras.

16. Revenez à Functions, et sauvegardez la comparaison des scores moyens sous le nom EXERCISE 4.1B.TXT dans NAEA DATA ANALYSIS\MY SOLUTIONS. 17. Retournez au classeur Chapter 4 Exercises en cliquant sur l’icône Open Door. Cliquez sur Save dans la barre d’outils pour enregistrer les modifications. Sélectionnez File – Close dans la barre des menus pour fermer le classeur ou continuer avec l’exercice 4.2.


COMPARAISON DES PERFORMANCES DE DEUX GROUPES OU PLUS

| 53

EXAMEN DES DIFFÉRENCES ENTRE TROIS SCORES MOYENS OU PLUS Dans cette section, nous examinons les différences entre trois catégories d’élèves ou plus (par exemple, les élèves fréquentant l’école dans les différentes régions d’un pays). Nous comparons les performances des élèves dans une région du Sentz (par exemple, Metro Area) avec celles des élèves de chacune des trois autres régions du pays. Dans cette analyse, Metro Area constitue le « groupe de référence » par rapport auquel la performance de chacune des autres régions est comparée. Dans les comparaisons multiples (par exemple, entre le score moyen des élèves d’une région et celui des élèves de chacune des trois autres régions), il faut ajuster le seuil de signification, souvent désigné par alpha. S’il n’est pas ajusté, une différence risque d’être considérée comme statistiquement significative alors qu’elle ne l’est pas. Si plus d’une comparaison est effectuée, la valeur standard d’alpha (0,05) utilisée dans la comparaison d’une paire de scores moyens (avec un intervalle de confiance de 95 % autour de la différence entre les scores moyens) doit être diminuée (c’est-à-dire être divisée par le nombre de comparaisons à réaliser). Par exemple, pour trois comparaisons, la valeur du seuil alpha de 0,05 doit être divisée par trois, soit une valeur ajustée de 0,0167 (0,05/3). Dans le cas de l’exercice 4.2, le score moyen des élèves de Metro Area (groupe de référence) est comparé à celui des élèves de chacune des autres régions. Ainsi, trois comparaisons sont effectuées : • Metro Area – Northwest • Metro Area – Eastern Highlands • Metro Area – Southwest Coast D’autres comparaisons pourraient intéresser les responsables des politiques (en fonction des variables existant dans la base de données) : • Groupe ethnique et performance en mathématiques : Y a-t-il des différences significatives entre les performances moyennes en mathématiques des différents groupes ethniques ? Quel groupe a-t-il le score moyen le plus élevé ?


54

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 4.2 Évaluation des différences entre trois scores moyens ou plus 1. Lancez WesVar. Sélectionnez Open WesVar Workbook. Ouvrez le classeur WesVar que vous avez enregistré à la fin de l’exercice 4.1, à savoir NAEA DATA ANALYSIS\ MY WESVAR FILES\CHAPTER 4 WORKBOOK. 2. Sélectionnez le nœud Exercise 4.1. Faites un clic droit et sélectionnez Clone pour créer une copie de l’exercice 4.1 (tableau des résultats de la requête de calcul des différences entre deux moyennes). Sélectionnez Table Request Two dans le panneau de droite et enregistrez-le sous le nom Exercise 4.2. 3. Développez Exercise 4.2 (panneau de gauche). Sélectionnez Options (panneau de gauche), et dans le panneau de droite, modifiez le seuil Alpha en 0,0167 (parce que trois comparaisons seront effectuées) (figure 4.2.A). 4. Développez Options dans le panneau de gauche. Sous Generated Statistics, assurez-vous qu’Estimate, Standard Error et Confidence Interval (Standard) sont cochés. Sous Options – Output Control, vérifiez que Variable Label et Value Label sont cochés. Décochez les autres cases. Développez Table Set #1 dans le panneau de gauche, et sélectionnez Electric ; désélectionnez-le dans le panneau de droite,

FIGURE 4.2.A Classeur WesVar montrant un ajustement du seuil alpha


COMPARAISON DES PERFORMANCES DE DEUX GROUPES OU PLUS

| 55

EXERCICE 4.2 (suite) et sélectionnez Region. Cliquez sur Replace Current Entry. Si vous recevez le message Table structure has changed… Do you want to make this change ? vous demandant de confirmer le changement de structure, cliquez sur Yes. Assurez-vous que seul Percent est coché. Développez Region (panneau de gauche). Sélectionnez Cells, et définissez les valeurs comme suit : 1 = Northwest ; 2 = Metro_Area ; 3 = Eastern_Highlands ; 4= Southwest_Coast (parce que WesVar n’admet pas d’espaces entre les mots, vous devez utiliser le tiret de soulignement). Après avoir saisi chaque intitulé, cliquez sur Add as New Entry ou appuyez sur Return sur votre clavier (figure 4.2.B). FIGURE 4.2.B Fin de la définition des cellules dans WesVar

5. Sélectionnez Cell Functions (immédiatement en dessous de Cells dans le panneau de gauche). Saisissez ce qui suit dans le champ Function Statistic, et cliquez sur Add as New Entry. • MeanDiffMetro_NW = Metro_Area − Northwest (figure 4.2.C). Cliquez sur For… en dessous de chaque fonction (panneau de gauche), et assurez-vous que Mathss apparaît à chaque fois en dessous de Selected. Il est possible que vous ayez à déplacer Sum_Wts vers Source Variables. Répétez le processus pour (suite)


56

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 4.2 (suite) FIGURE 4.2.C Classeur WesVar : Fonctions des cellules

• MeanDiffMetro_EHighlands = Metro_Area − Eastern_Highlands • MeanDiffMetro_SW = Metro_Area − Southwest_Coast 6. Cliquez sur l’icône avec la flèche verte dans la barre d’outils pour lancer la requête. 7. Affichez le résultat en cliquant sur l’icône Open Book dans la barre d’outils. Pour accéder aux scores moyens de chaque région, sélectionnez Exercise 4.2 – Table Set #1 – Region (figure 4.2.D). Pour accéder aux données sur les différences entre les scores moyens, sélectionnez Functions (le nœud juste en dessous de Region) (figure 4.2.E). 8. Utilisez File et Export (Single File, One Selection) pour enregistrer le résultat sous forme de fichiers texte. Commencez par enregistrer les scores moyens (régions), et ensuite les différences entre les scores moyens (fonctions) dans NAEA DATA ANALYSIS\MY SOLUTIONS en utilisant respectivement comme nom de fichier EXERCISE 4.2A.TXT et EXERCISE 4.2B.TXT. 9. Revenez à CHAPTER 4 WORKBOOK en cliquant sur l’icône Open Door dans la barre d’outils. Sélectionnez Save – Close dans le menu (ou sélectionnez l’icône Save dans la barre d’outils). La figure 4.2.E montre les trois comparaisons demandées. La différence entre les scores moyens de Metro Area et Northwest est de 32,4 points de score avec une erreurt-type de 5,74. L’intervalle de confiance autour de la différence va de 18,2 à 46,5. Parce que cet intervalle n’inclut pas zéro, la différence entre les scores moyens de Metro Area et


COMPARAISON DES PERFORMANCES DE DEUX GROUPES OU PLUS

| 57

EXERCICE 4.2 (suite) FIGURE 4.2.D Résultats WesVar : Scores moyens en mathématiques par région

FIGURE 4.2.E

Résultats WesVar : Différences entre les scores moyens en

mathématiques par région

Northwest est statistiquement significative. De même, la différence entre les scores moyens de Metro Area et Eastern Highlands (16,6 points) est statistiquement significative parce que l’intervalle autour de la différence (3,3 à 30,0) n’inclut pas zéro. Enfin, la différence entre Metro Area et Southwest Coast (14,5 points) n’est pas statistiquement significative, parce que l’intervalle autour de la différence (-0,0 à 29,0) comprend zéro. Le tableau 4.2.A montre le résultat de cette analyse tel qu’il pourrait être présenté dans un rapport d’évaluation nationale. Il montre le score moyen de chaque région et le score moyen national ainsi que les erreurs-types associées. La moitié inférieure du tableau indique, en caractères gras, les différences régionales statistiquement significatives. (suite)


58

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 4.2 (suite) TABLEAU 4.2.A Comparaison des scores moyens en mathématiques des élèves avec ou sans électricité à la maison, par région

Région

Score moyen (ET)

Metro Area

233,3 (3,28)

Northwest

265,7 (4,46)

Eastern Highlands

249,1 (3,59)

Southwest Coast

251,2 (3,35)

National

250,0 (2,20)

Comparaison

Différence (ETD)

ICB (95 %)

Metro Area − Northwest

32,4 (5,74)

18,2 à 46,5

Metro Area – Eastern Highlands

16,6 (5,42)

3,3 à 30,3

Metro Area − Southwest Coast

14,5 (5,90)

−0,0 à 29,0

Remarque : ICB (95 %) = intervalle de confiance à 95 % ajusté (bayésien) ; ET = erreur-type de l’estimation ; ETD = erreur-type de la différence. Les intervalles de confiance associés à des différences statistiquement significatives sont en caractères gras.

• Niveau d’instruction des parents et performance en compréhension de l’écrit : Y a-t-il des différences significatives entre les performances moyennes en compréhension de l’écrit des élèves dont les parents ont achevé des études secondaires et ceux de chacun des autres groupes (tels que les parents qui n’ont aucune instruction formelle, les parents dont le plus haut niveau d’études correspond aux années 1 à 3, 4 à 6, 7 à 9 ou 10 à 12) ? • Accès aux médias et performance linguistique : Y a-t-il des différences significatives entre les performances linguistiques moyennes des élèves vivant dans des familles ayant a) la radio et la télévision, et de ceux dont les familles n’ont b) qu’une radio, c) qu’une télévision, ou d) ni télévision, ni radio ?


5

CHAPITRE

IDENTIFICATION DES ÉLÈVES TRÈS OU PEU PERFORMANTS

En plus des différences entre les niveaux moyens de performance de sous-groupes d’élèves (chapitre 4), les responsables des politiques et autres utilisateurs des résultats d’une évaluation nationale peuvent s’intéresser aux facteurs liés à la répartition des performances. Des questions, comme celles qui suivent, peuvent se poser : • Y a-t-il une plus grande proportion d’élèves à risque (peu performants) dans une région (province) du pays que dans une autre ? • La représentation des garçons et des filles est-elle la même chez les élèves très performants en mathématiques ? • Dans quel type d’établissements (ruraux ou urbains, publics ou privés) trouve-t-on la plus grande proportion d’élèves peu performants ? La réponse à ce genre de question est fournie dans ce chapitre, en identifiant les proportions d’élèves situées au-dessus ou en dessous de points clés, ou valeurs de référence, tels que le 10e ou 90e centile.

59


60

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

ESTIMATION DES SCORES CORRESPONDANT AUX RANGS CENTILES CLÉS NATIONAUX Cette section décrit une approche d’estimation des scores des élèves aux principaux rangs centiles dans une évaluation nationale. Dans le chapitre 3, la routine Descriptive Stats de WesVar a été utilisée pour déterminer les scores non pondérés et pondérés à différents rangs centiles, ainsi que leurs erreurs-types (voir la figure 3.1.C). Dans l’exercice 5.1, une procédure alternative (WesVar Tables) est utilisée pour estimer les scores correspondants aux 10e, 25e, 50e, 75e et 90e rangs centiles ainsi que leurs erreurs-types, pour chaque région du Sentz. Elle peut également être utilisée pour déterminer les scores correspondant aux autres rangs centiles.

EXERCICE 5.1 Calcul des scores des centiles nationaux 1. Lancez WesVar et cliquez sur New WesVar Workbook. Si vous recevez le message : Before creating a new Workbook, you will be asked to specify a data file that will be used as the default data file for new Workbook requests, vous indiquant qu’il vous faut spécifier le fichier par défaut que vous voulez utiliser pour les requêtes, cliquez sur OK. 2. Une fenêtre intitulée Open WesVar Data File for Workbook apparaît. Sélectionnez le fichier NAEA DATA ANALYSIS\MY WESVAR FILES\NATASSESS4.VAR. 3. Enregistrez votre nouveau classeur dans NAEA DATA ANALYSIS\MY WESVAR FILES sous le nom CHAPTER 5 WORKBOOK.WVB. 4. Modifiez Workbook Title One (panneau de droite) en Chapter 5 Exercises. Dans New Request, sélectionnez Table. Cliquez sur Table Request One (panneau de gauche). Changez Request Name en Exercise 5.1 (panneau de droite). Cliquez sur Add Table Set Single (panneau de droite). 5. Sélectionnez Options – Generated Statistics et assurez-vous qu’Estimate, Standard Error, et Confidence Interval (Standard) sont cochés. Décochez les autres cases. Dans Output Control, fixez Estimate à une décimale et Std. Error à deux. Veillez à ce que Variable Label et Value Label soient cochés. 6. Dans le panneau de gauche, sélectionnez Computed Statistics. Dans le panneau de droite, saisissez Pcile10 = Quantile (Mathss, 0.1) et cliquez sur Add as New Entry (figure 5.1.A). Vous avez ainsi demandé à WesVar de calculer le score au 10e centile.


IDENTIFICATION DES ÉLÈVES TRÈS OU PEU PERFORMANTS

| 61

EXERCICE 5.1 (suite) FIGURE 5.1.A Classeur WesVar : Calcul des scores des centiles

7. Suivez la même procédure pour les 25e, 50e, 75e et 90e centiles en cliquant, chaque fois, d’abord sur Computed Statistics. Par exemple, la formule pour le 25e centile est PCile25 = Quantile (Mathss, 0.25). N’oubliez pas de cliquer sur Add as New Entry après la saisie de chaque formule.a 8. Lancez l’analyse en cliquant sur l’icône avec la flèche verte dans la barre d’outils. 9. Affichez le résultat (figure 5.1.B) en cliquant sur l’icône Open Book de la barre d’outils. Développez Exercise 5.1 pour pouvoir sélectionner Table Set #1 dans le panneau de gauche. Cliquez sur Overall pour voir les scores des centiles. Les résultats présentés dans la figure 5.1.B sont les scores obtenus à chaque rang centile sélectionné ainsi que les erreurs-types correspondantes. Par exemple, le score au 10e centile est 181,0, avec une erreur-type de 3,01. L’intervalle de confiance de 95 % correspondant va de 174,5 à 186,5. Il y a donc 95 % de chance que le score au 10e centile se situe entre 174,5 et 186,5. Les scores et erreurs-types peuvent être présentés dans des tableaux et publiés dans le rapport national d’évaluation (voir le tableau 5.1.A.). (suite)


62

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 5.1 (suite) FIGURE 5.1.B Résultat WesVar : Calcul des scores des centiles

TABLEAU 5.1.A Scores nationaux en mathématiques (et erreurs-types) à différents centiles

Centile

Score

Erreur-type

e

10

181,0

3,01

25e

217,3

2,73

e

50

256,3

2,39

75e

284,4

1,82

90e

308,7

1,75

10. Sélectionnez File et cliquez sur Export (Single File – One Selection) pour enregistrer vos résultats sous forme d’un fichier texte. Enregistrez-le sous NAEA DATA ANALYSIS\MY SOLUTIONS avec un nom de fichier approprié tel qu’EXERCISE 5.1.TXT. 11. Cliquez sur l’icône Open Door dans la barre d’outils pour revenir à CHAPTER 5 WORKBOOK. Cliquez sur File – Save et ensuite sur File – Close. a. Une autre façon de procéder consiste, pour chaque centile, à cliquer sur Pcile10 = Quantile (Mathss, 0.10) (panneau de gauche) et à cliquer à droite sur Clone pour modifier la condition, puis sur Replace Current Entry.

Une fois les scores aux rangs centiles obtenus au niveau national, ils peuvent être calculés pour chaque région du Sentz (exercice 5.2).


IDENTIFICATION DES ÉLÈVES TRÈS OU PEU PERFORMANTS

| 63

EXERCICE 5.2 Calcul des scores des centiles par région 1. Lancez WesVar. Sélectionnez Open WesVar Workbook. Ouvrez le classeur WesVar que vous avez enregistré à la fin de l’exercice 5.1. Il s’agit de NAEA DATA ANALYSIS\My WesVar FILES\Chapter 5 Workbook.a 2. Réduisez (si nécessaire) Exercise 5.1 (panneau de gauche), en cliquant sur le signe – (moins). 3. Faites un clic droit sur Exercise 5.1 dans le panneau de gauche et sélectionnez Clone. Renommez Table Request Two dans le panneau de droite en Exercise 5.2. La suite de l’exercice 5.2 sera réalisée dans ce nœud. 4. Développez Exercise 5.2 (si nécessaire). Sélectionnez Table Set #1. Déplacez Region de Source Variables vers Selected (panneau de droite). 5. Cliquez sur Add as New Entry (panneau de droite). 6. Sélectionnez Region dans le panneau de gauche et cochez la case Percent en dessous de Sum of Weights dans le panneau de droite. Décochez, au besoin, Value, Row Percent, et Column Percent (voir la figure 5.2.A). FIGURE 5.2.A Classeur WesVar avant le calcul des scores des centiles par région

(suite)


64

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 5.2 (suite) 7. Cliquez sur l’icône avec la flèche verte dans la barre d’outils pour lancer les analyses. 8. Cliquez sur l’icône Open Book dans la barre d’outils. Développez Exercise 5.2 (si nécessaire). Sélectionnez Table Set #1 – REGION pour voir l’estimation en centiles pour chaque région. La figure 5.2.B donne les scores au 10e centile pour chaque région, ainsi que les erreurs-types et les intervalles de confiance de 95 % associés. Les données sur les scores aux autres centiles peuvent être affichées en faisant défiler le fichier des résultats. Le tableau 5.2.A présente les données dans un format qui pourrait être utilisé dans un rapport d’évaluation nationale. FIGURE 5.2.B Résultat WesVar partiel : Calcul des scores au 10e centile, par région

TABLEAU 5.2.A Scores en mathématiques (et erreurs-types) à différents centiles, par région

Northwest

Metro Area

Eastern Highlands

Southwest Coast

National

e

10

162,2 (4,12)

205,1 (7,66)

176,7 (6,47)

183,5 (5,53)

181,0 (3,01)

25e

198,4 (3,58)

238,7 (5,95)

217,1 (5,68)

218,6 (5,08)

217,3 (2,73)

e

50

238,0 (4,62)

271,6 (5,16)

255,2 (3,41)

257,6 (4,09)

256,3 (2,39)

75e

270,2 (4,11)

296,3 (3,27)

283,9 (3,49)

283,9 (3,58)

284,4 (1,82)

e

293,8 (4,42)

313,7 (3,02)

309,1 (2,87)

310,3 (3,33)

308,7 (1,75)

Centile

90

Le tableau 5.2.A montre que les scores correspondant aux rangs centiles varient selon la région. Par exemple, au 10e centile, les scores vont de 162,2 dans la région Northwest à 205,1 à Metro Area. Une analyse des scores régionaux montre que dans le Northwest, les Eastern Highlands et la Southwest Coast, les élèves peu performants (au 10e centile) le sont encore moins que dans la Metro Area. Au 90e centile, les scores des élèves du Northwest sont inférieurs à ceux des élèves des autres régions.


IDENTIFICATION DES ÉLÈVES TRÈS OU PEU PERFORMANTS

| 65

EXERCICE 5.2 (suite) 9. Enregistrez le résultat en utilisant File – Export – Single File – One Selection. Sélectionnez Export. Enregistrez sous la forme d’un fichier texte dans NAEA DATA ANALYSIS\MY SOLUTIONS\EXERCISE 5.2. Quittez le fichier des résultats en cliquant sur l’icône Open Door dans la barre d’outils. 10. Enregistrez les modifications apportées au classeur en sélectionnant File – Save et ensuite File – Close. a. Si vous n’arrivez pas à trouver le fichier, sélectionnez NAEA DATA ANALYSIS\WESVAR DATA FILES & WORKBOOKS\CHAPTER 5 WORKBOOK. Après avoir terminé l’exercice, sauvegardez le classeur dans NAEA DATA ANALYSIS\MY WESVAR FILES\CHAPTER 5 WORKBOOK.

ESTIMATION DU POURCENTAGE D’ÉLÈVES DANS DES SOUS-GROUPES, EN UTILISANT LES RANGS CENTILES NATIONAUX L’information sur le pourcentage d’élèves dans des sous-groupes de la population (tels que la région, l’origine ethnique ou le sexe) qui ont des scores inférieurs à une valeur de référence déterminée, telle que le score national au 10e centile, peut être obtenue en identifiant d’abord les scores aux rangs centiles nationaux dans la base de données nationale de l’évaluation dans WesVar (voir le tableau 5.1.A). L’exercice 5.3 montre comment créer de nouvelles variables correspondant aux 25e, 50e et 75e rangs centiles dans le fichier de données WesVar. Créez une nouvelle variable correspondant à chaque centile de référence, et affectez « 1 » aux élèves dont les scores sont inférieurs à la valeur de référence et « 2 » à ceux dont le score est supérieur ou égal à cette valeur.

EXERCICE 5.3 Recodage d’une variable en catégories de centiles à l’aide de WesVar 1. Lancez WesVar. Sélectionnez Open WesVar Data File, puis NAEA DATA ANALYSIS\ MY WESVAR FILES\NATASSESS4.VAR. 2. Cliquez sur Format dans le menu, et sélectionnez Recode. Dans Pending Records, cliquez sur New Continuous (to Discrete). (suite)


66

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 5.3 (suite) 3. Saisissez un nouveau nom de variable dans le champ prévu à cet effet. Pour cet exercice, saisissez le nom Pcile25 pour créer la variable qui divisera les élèves en deux catégories : ceux dont le score est inférieur au 25e centile national et ceux qui ont un score supérieur ou égal à ce dernier. 4. Dans la colonne intitulée Range of Original Variables, saisissez Mathss < 217.3 (valeur du 25e centile national, voir le tableau 5.2). Sur la même ligne, dans la colonne Pcile25, saisissez 1. Dans la ligne suivante, sous Range of Original Variables, saisissez Mathss ≥ 217.3, et dans la colonne Pcile25, saisissez 2 (figure 5.3.A). Cliquez sur OK. FIGURE 5.3.A Classeur WesVar : Recodage de Mathss en variables discrètes

5. Cliquez une nouvelle fois sur New Continuous to Discrete et suivez la même procédure pour créer les variables suivantes : Pcile50 : Mathss < 256.3 → 1 Mathss ≥ 256.3 → 2 (OK) Pcile75 : Mathss < 284.4 → 1 Mathss ≥ 284.4 → 2 (OK) 6. Après avoir saisi la dernière variable (Pcile75), cliquez sur OK. Cliquez ensuite sur OK dans l’écran Pending Recodes. Le message This operation will create a new VAR file. You will be asked to specify a file name vous avertit que vous devez donner un nom au nouveau fichier VAR qui va être créé. Saisissez le nom NAEA DATA ANALYSIS\ MY WESVAR FILES\NATASSESS4.VAR, de manière à écraser la version précédemment enregistrée.


IDENTIFICATION DES ÉLÈVES TRÈS OU PEU PERFORMANTS

| 67

EXERCICE 5.3 (suite) 7. Sélectionnez Format et Label dans la barre de menu. Sous Source Variables, cliquez sur Pcile25. Pour Values, dans la colonne Label, remplacez le chiffre 1 par Bottom 25 % et remplacez 2 par Top 75 % (figure 5.3.B). Cliquez ensuite sur OK. Le même message que ci-dessus vous demande de préciser un nom de fichier. Cliquez sur OK. Enregistrez sous le nom NAEA DATA ANALYSIS\MY WESVAR FILES\NATASSESS4. VAR pour écraser la version précédemment enregistrée. FIGURE 5.3.B

Attribution d’intitulés aux catégories de centiles dans WesVar

8. Répétez le processus pour Pcile50 et Pcile75. 9. Sélectionnez File puis Exit.a a. Notons que cet exercice n’a pas de fichier de résultat à sauvegarder. Au lieu de cela, vous avez enregistré le fichier de données WesVar modifié (NATASSESS4.VAR), qui sera utilisé dans le prochain exercice.

Le pourcentage des élèves ayant un score inférieur aux centiles nationaux clés de référence peut maintenant être calculé pour chaque région (exercice 5.4). Le résultat peut être utilisé pour déterminer, dans chaque région, le pourcentage des élèves ayant des scores inférieurs au 25e centile national (figure 5.4.B). On estime que, dans la région Northwest, 36,5 % des élèves ont des scores inférieurs à ce centile de référence. L’erreur-type correspondante vaut 2,74, et l’intervalle de confiance de


68

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 5.4 Calcul du pourcentage des élèves ayant un score inférieur aux centiles nationaux clés de référence et de l’erreur-type associée, par région 1. Lancez WesVar. Sélectionnez Open WesVar Workbook. Ouvrez NAEA DATA ANALYSIS\MY WESVAR FILES\CHAPTER 5 WORKBOOK. 2. Sélectionnez Chapter 5 Exercises (panneau de gauche) puis New Request – Table (panneau de droite). Cliquez sur Table Request Three (panneau de gauche), et renommez-le Exercise 5.4. Sélectionnez Exercise 5.4 (panneau de gauche) et ensuite Add Table Set – Single (panneau de droite). 3. Sélectionnez Table Set #1 (panneau de gauche), cliquez sur Pcile25 dans la liste Source Variable (panneau de droite), et déplacez-le vers Selected. Ensuite, déplacez Region de Source Variables vers Selected. En dessous de Sum of Weights, assurez-vous que la case Column Percent (panneau de droite) est cochée et que les autres options (Value, Percent, et Row Percent) sont décochées. Cliquez sur Add as New Entry (panneau de droite). Renvoyez Pcile25 et Region vers Source Variables. 4. Répétez l’étape 3 pour Pcile50 et Region ainsi que Pcile75 et Region, en vous assurant de saisir chaque fois Pcile avant Region. Cliquez sur Add as New Entry après chaque modification (figure 5.4.A). FIGURE 5.4.A Classeur WesVar avant le calcul du pourcentage de scores inférieurs aux références nationales clés, par région


IDENTIFICATION DES ÉLÈVES TRÈS OU PEU PERFORMANTS

| 69

EXERCICE 5.4 (suite) 5. Sélectionnez Output Control dans le panneau de gauche et assurez-vous que Variable Label et Value Label sont cochés. 6. Sélectionnez Generated Statistics, et assurez-vous que seuls Estimate, Standard Error, et Confidence Interval (Standard) sont cochés. 7. Lancez l’analyse en cliquant sur l’icône avec la flèche verte dans la barre d’outils. Affichez le résultat en sélectionnant l’icône Open Book dans la barre d’outils. Dans la partie gauche, développez Exercise 5.4 pour pouvoir sélectionner le niveau Pcile25*REGION afin d’afficher le premier bloc de résultats (figure 5.4.B). FIGURE 5.4.B Résultat partiel : Pourcentage des élèves dont les scores sont inférieurs aux références nationales clés, par région

8. Sauvegardez le résultat en sélectionnant File – Export – Single File – One Selection dans la barre de menu. Cliquez sur Export. Enregistrez-le sous la forme d’un fichier texte dans NAEA DATA ANALYSIS\MY SOLUTIONS\EXERCISE 5.4 – 25th (pour le résultat lié au 25e centile), EXERCISE 5.4 – 50th (pour le résultat lié au 50e centile) et ainsi de suite. Quittez le fichier de résultat à l’aide de l’icône Open Door dans la barre d’outils. 9. Enregistrez le classeur WesVar en cliquant sur l’icône Save dans la barre d’outils (ou en sélectionnant File – Save dans la barre de menu). Cliquez sur File – Close.

95 % va de 31,0 % à 42,0 %. Le tableau 5.1 présente les données sous forme tabulaire. On peut voir que dans la région Northwest, 36,5 % des élèves ont des scores inférieurs à ce centile de référence contre 14,4 % dans la Metro Area. Dans les deux autres régions, Eastern Highlands et Southwest Coast, les pourcentages à ce niveau sont similaires au taux national (25 %).


70

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

De la même manière, vous pouvez présenter dans un tableau les pourcentages des élèves ayant un score inférieur (ou égal ou supérieur) à d’autres valeurs de référence nationales, telles que le 50e centile (Pcile50) et le 75e centile (Pcile75). Le tableau 5.2 montre le pourcentage des élèves très performants (définis comme ceux ayant un score supérieur ou égal au 75e centile national) dans chaque région. Les données de ce tableau sont basées sur les résultats de l’exercice 5.4 et montrent que 15,1 % des élèves de la région Northwest ont des scores supérieurs ou égaux au 75e centile national de référence contre 35,3 % des élèves de la Metro Area. Dans les deux autres régions, les pourcentages atteignant ou dépassant le 75e centile national de référence (24,7 % dans les deux cas) sont proches du pourcentage national (25 %).

TABLEAU 5.1 Pourcentages des élèves ayant des scores inférieurs au 75e centile national de référence, par région Élèves ayant des scores inférieurs au 75e centile national de référence, par région Région Northwest

Pourcentage

Erreur-type

36,5

2,74

Metro Area

14,4

2,83

Eastern Highlands

25,1

2,83

Southwest Coast

24,4

2,30

National

25,0

1,46

TABLEAU 5.2 Pourcentage des élèves ayant des scores supérieurs ou égaux au 75e centile national de référence, par région Élèves ayant des scores supérieurs ou égaux au 75e centile national de référence, par région Pourcentage

Erreur-type

Northwest

15,1

2,24

Metro Area

35,3

3,88

Eastern Highlands

24,7

2,53

Southwest Coast

24,7

2,48

National

25,0

1,61

Région


6

CHAPITRE

ASSOCIATION ENTRE LES VARIABLES : CORRÉLATION ET RÉGRESSION

CORRELATION Les responsables des politiques peuvent souhaiter déterminer dans quelle mesure l’apprentissage des élèves est lié à une série de facteurs. Le coefficient de corrélation (r), une mesure de l’association linéaire entre deux variables, fournit cette information. Les exemples suivants correspondent à quelques-unes des questions auxquelles les corrélations peuvent répondre : • Existe-t-il une association entre la fréquence de la fréquentation scolaire et la performance des élèves en mathématiques ? • Le niveau d’instruction des parents est-il lié à la performance en compréhension de l’écrit des élèves ? • Y a-t-il une relation entre la distance parcourue par un élève pour se rendre à l’école et sa performance en mathématiques ? • L’expérience des professeurs (nombre d’années d’exercice) est-elle liée à la performance des élèves dans les principaux domaines du programme de cours ? Le coefficient de corrélation peut nous indiquer la direction ainsi que la force ou l’ampleur de la relation entre deux variables.

71


| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

72

Direction de la relation Les coefficients de corrélation peuvent être positifs, négatifs ou nuls. Positifs, ils indiquent que les valeurs de deux variables ont, en moyenne, tendance à augmenter ou diminuer en même temps. Une corrélation positive (par exemple, 0,60) entre les performances en lecture et en écriture indique qu’en moyenne, lorsque la performance en lecture augmente, la performance en écriture augmente également, et vice versa. À l’inverse, une corrélation négative indique que lorsque la valeur d’une variable augmente, la valeur de l’autre a tendance à diminuer. Par exemple, une corrélation négative (-0,28) entre l’anxiété causée par les mathématiques et la performance à un test de mathématiques indique qu’en général, lorsque l’anxiété de l’élève augmente, sa performance diminue (et vice versa). Une corrélation égale à zéro indique que rien ne prouve l’existence d’une relation entre deux variables (par exemple, entre la taille des élèves et leur performance). La figure 6.1 illustre graphiquement les relations positives et négatives entre les variables. La relation est positive dans le premier diagramme et négative dans le second.

Force ou ampleur de la relation Les coefficients de corrélation proches de -1,0 ou +1,0 indiquent une relation forte. Les valeurs situées entre ces extrêmes indiquent des relations relativement plus faibles.

FIGURE 6.1 Corrélations positives et négatives 250 225 200 175 150 125 100 75 50 25 0

250 225 200 175 150 125 100 75 50 25 0

relation positive

0

1

2

3

4

5

6

7

8

9

10

11

relation négative

0

1

2

3

4

5

6

7

8

9

10

11


ASSOCIATION ENTRE LES VARIABLES : CORRÉLATION ET RÉGRESSION

| 73

En général, les corrélations entre les mesures du statut socioéconomique et de la performance ont tendance à se situer entre 0,20 et 0,30. Les corrélations entre les scores des élèves aux tests de compréhension de l’écrit et de sciences se situent souvent entre 0,80 et 0,90 (voir, par exemple, OCDE, 2007), suggérant que la performance à un des tests (par exemple, la compréhension de l’écrit) fait appel aux mêmes savoirfaire que la performance à l’autre (sciences). Dans les évaluations nationales ou, de manière générale, dans la recherche en éducation, on trouve rarement des corrélations parfaites ou presque parfaites.

Créer un diagramme de dispersion Avant de calculer un coefficient de corrélation et d’évaluer sa signification statistique, il peut être utile de dessiner dans un diagramme de dispersion, le nuage de points représentant la relation entre deux variables. Si la relation est linéaire, les points se situeront plutôt autour d’une ligne droite traversant les données. Plus les points sont proches d’une ligne droite, plus la relation entre les variables est forte. L’exercice 6.1 utilise SPSS pour décrire la force de la relation entre les scores de deux sous-échelles de mathématiques contenues dans la base de données NATASSESS : Impl_pc (pourcentage de scores corrects aux items portant sur la mise en œuvre de procédures mathématiques) et Solve_pc (pourcentage de scores corrects aux items portant sur l’analyse et la résolution de problèmes mathématiques).1 EXERCICE 6.1 Création d’un diagramme de dispersion dans SPSS 1. Ouvrez le fichier de données NAEA DATA ANALYSIS\SPSS DATA\NATASSESS4.SAV. 2. Sélectionnez Data – Weight Cases – Weight Cases by…, déplacez Wgtpop vers le champ Frequency Variable, et cliquez sur OK. 3. Dans la barre d’outils, sélectionnez Graphs − Legacy Dialogs − Scatter/Dot − Simple Scatter – Define. 4. Assignez Impl_pc à l’axe des Y et Solve_pc à l’axe des X (Figure 6.1.A). Cliquez sur OK. Patientez pendant que le système effectue le calcul. Le résultat est présenté dans la figure 6.1.B. (suite)


74

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 6.1 (suite) FIGURE 6.1.A Boîte de dialogue SPSS avant la création du diagramme de dispersion

FIGURE 6.1.B Diagramme de dispersion de la relation entre la mise en œuvre de procédures et la résolution de problèmes mathématiques

100,00

Pourcentage correct Mise en œuvre

élève N 80,00

60,00

40,00

20,00

0,00 0,00

20,00

40,00

60,00

80,00

Pourcentage correct Analyse/résolution de problèmes cas pondérés par Wgtpop

100,00


| 75

ASSOCIATION ENTRE LES VARIABLES : CORRÉLATION ET RÉGRESSION

EXERCICE 6.1 (suite) Nous pouvons faire passer une droite de meilleur ajustement dans le nuage de points. Il s’agit de la ligne droite qui résume le mieux les données du graphique. Pour tracer cette droite à travers un diagramme de dispersion SPSS, double-cliquez sur le nuage de points pour accéder à Chart Editor et sélectionnez Elements – Fit Line at Total – Linear – Confidence Intervals – None dans la barre de menu. Le résultat est présenté dans la figure 6.1.C. Dans un diagramme de dispersion, chaque point est placé à l’intersection des valeurs des deux variables pour un individu. Par exemple, l’élève N (figure 6.1.B) a obtenu un score de 100 % de réponses correctes pour la mise en œuvre de procédures mathématiques (axe y) et un score de 83 % de réponses correctes pour la résolution de problèmes mathématiques (axe x). Notons que les points sont groupés dans une bande allant du coin inférieur gauche au coin supérieur droit, qui indique une corrélation positive entre les deux variables. FIGURE 6.1.C Diagramme de dispersion montrant la droite de meilleur ajustement

R2 Linear = 0,639

100,00

Pourcentage correct Mise en œuvre

élève N

80,00

60,00

40,00

20,00

0,00

0,00

20,00

40,00

60,00

80,00

100,00

Pourcentage correct Analyse/résolution de problèmes cas pondérés par Wgtpop

(suite)


76

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 6.1 (suite) Le résultat pour le diagramme de dispersion (figures 6.1.B et 6.1.C) montre que la performance en résolution de problèmes mathématiques a tendance à augmenter en même temps que la performance en mise en œuvre de procédures mathématiques (et vice versa). 5. Dans le résultat SPSS, cliquez à l’extérieur du graphique. Enregistrez le résultat en sélectionnant File – Save As – NAEA DATA ANALYSIS\MY SOLUTIONS, et enregistrez le fichier sous le nom EXERCISE 6.1.SPV.

Calculer un coefficient de corrélation et évaluer sa signification statistique Cette section montre comment calculer un coefficient de corrélation à l’aide de WesVar (exercice 6.2). Le but est de déterminer l’amplitude de la relation entre les performances en mise en œuvre de procédures mathématiques (Impl_pc) et en résolution de problèmes mathématiques (Prob_pc). L’erreur doit également être déterminée pour le coefficient de corrélation afin de déterminer si celui-ci diffère sensiblement de zéro. EXERCICE 6.2 Calcul d’un coefficient national de corrélation 1. Lancez WesVar et cliquez sur New WesVar Workbook. Si vous recevez le message : Before creating a new Workbook, you will be asked to specify a data file that will be used as the default data file for new Workbook requests, vous indiquant qu’il vous faut spécifier le fichier par défaut que vous voulez utiliser pour les requêtes, cliquez sur OK. 2. La fenêtre Open WesVar Data File for Workbook s’affiche. Sélectionnez le fichier de données NAEA DATA ANALYSIS\MY WESVAR FILES\NATASSESS4.VAR. 3. Enregistrez votre nouveau classeur dans NAEA DATA ANALYSIS\MY WESVAR FILES\CHAPTER 6 WORKBOOK.WVB. Cliquez sur Workbook Title 1 (panneau de gauche) et saisissez Chapter 6 Exercises (panneau de droite). 4. Cliquez sur Descriptive Stats. Sélectionnez Descriptive Request One (panneau de gauche) et saisissez Exercise 6.2 (panneau de droite). Sélectionnez Options – Output Control dans le panneau de gauche. Vérifiez que le nombre de décimales pour Estimates et Std. Error est fixé à trois. Vérifiez également que les champs Variable Name et Variable Label sont cochés.


| 77

ASSOCIATION ENTRE LES VARIABLES : CORRÉLATION ET RÉGRESSION

EXERCICE 6.2 (suite) 5. Sélectionnez Correlations dans le panneau de gauche. Activez List 1 (panneau de droite) et déplacez Solve_pc de Source Variables vers List 1. Activez List 2 et déplacez Impl_pc de Source Variables vers List 2 (figure 6.2.A). Si vous le souhaitez, vous pouvez ajouter des variables supplémentaires dans chaque liste. Chaque variable de List 1 sera corrélée avec chacune des variables de List 2. FIGURE 6.2.A

Classeur WesVar avant l’exécution de l’analyse de corrélation

6. Lancez l’analyse en cliquant sur l’icône avec la flèche verte dans la barre d’outils. 7. Affichez le résultat en cliquant sur l’icône Open Book dans la barre d’outils. Cliquez sur le signe + (plus) pour développer Correlations. Sélectionnez Overall (figure 6.2.B). FIGURE 6.2.B Résultat WesVar : Corrélation entre la résolution de problèmes et la mise en œuvre de procédures mathématiques

(suite)


78

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 6.2 (suite) 8. Sélectionnez File – Export – Single File – One Selection – Export dans la barre des menus pour enregistrer le résultat dans NAEA DATA ANALYSIS\My Solutions sous le nom EXERCISE 6.2.TXT. 9. Quittez le résultat et enregistrez le classeur WesVar en sélectionnant File – Save (voir l’étape 3 ci-dessus). La figure 6.2.B montre les coefficients de corrélation non pondérés et pondérés entre Solve_pc et Impl_pc. Dans une évaluation nationale, c’est le résultat pondéré qui est pris en compte. Pour déterminer si la corrélation de 0,800 est statistiquement significative, il faut calculer une statistique connue sous le nom de t en divisant la corrélation par son erreur-type. Dans notre exemple, t est égal à 0,800/0,007, soit 114,3. Un tableau des valeurs de ta indique que, pour 60 degrés de liberté (nombre de répliques Jackknife dans les analyses WesVar) dans un test bilatéral de t, une valeur égale ou supérieure à 2,0 indique une signification statistique (p < 0,05). Étant donné que 114,3 est supérieur à cette valeur, on peut en conclure avec un niveau de confiance élevé que la valeur de r n’est probablement pas égale à zéro. Comme le coefficient de corrélation est positif, on peut dire que, de manière générale, la performance des élèves en mise en œuvre de procédures mathématiques augmente en même temps que leur performance en résolution de problèmes (et vice versa). a. Voir le tableau des valeurs t dans un manuel standard de statistique. Vous pouvez également vous rendre sur http://surfstat.anu.edu.au/surfstat-home/tables/t.php pour consulter les tableaux en ligne des valeurs t. Introduisez les degrés de liberté (60) et de probabilité (0,05) pour le test bilatéral de t (le graphique final). Cliquez sur la flèche renversée pour calculer la valeur t nécessaire pour déterminer la signification au niveau 0,05. Dans notre exemple, cette valeur est égale à 2.

RÉGRESSION La régression diffère de la corrélation à divers égards. Tout d’abord, le modèle de corrélation ne précise pas la nature de la relation entre les variables, contrairement à la régression qui modélise la dépendance d’une variable par rapport à une ou plusieurs autres. Sur base de la théorie ou de la recherche, une variable (variable dépendante, généralement représentée sur l’axe vertical des y d’un graphique) est considérée comme dépendante ou subordonnée par rapport à une autre variable (variable indépendante, généralement représentée sur l’axe horizontal des x). Par exemple, les scores à un test de compréhension de l’écrit ont des chances de dépendre du temps que l’élève consacre à la lecture pour son plaisir.2


ASSOCIATION ENTRE LES VARIABLES : CORRÉLATION ET RÉGRESSION

| 79

Ensuite, dans la régression, la relation fonctionnelle entre les variables dépendantes et indépendantes peut être formellement exprimée dans une équation, avec des valeurs associées décrivant le degré d’ajustement entre l’équation et les données. L’information sur la performance d’un groupe de personnes est utilisée pour définir une équation (appelée équation de régression) sur base de l’hypothèse que la relation est linéaire (ce qui signifie que tout changement dans la valeur d’une variable est similaire pour toutes les valeurs de la variable). Il est possible que les analystes soient obligés d’aller au-delà de cette forme de régression lorsqu’ils analysent les données d’une évaluation nationale. Des approches plus sophistiquées, telles que la modélisation linéaire hiérarchique (MLH), sont généralement plus appropriées pour tenir compte de la structure hiérarchique ou à plusieurs niveaux des données obtenues dans ces études (voir Raudenbush et Bryk, 2002 ; Snijders et Bosker, 1999). La modélisation linéaire hiérarchique peut distinguer les effets de variables liées aux établissements et aux élèves. Par exemple, si vous disposez de données sur le statut socioéconomique des établissements et des élèves, les unes et les autres peuvent être intégrées au modèle et leurs effets sur la performance des élèves déterminés. Un modèle à deux niveaux permet également d’identifier la part de la variance au sein des établissements et entre eux, que les variables du modèle expliquent. De même, un modèle à trois niveaux (établissements, classes, élèves) fournit une estimation de la part de la variance expliquée par les variables liées aux établissements (telles que l’emplacement et la taille), aux classes (telles que les caractéristiques des enseignants et les ressources disponibles) et aux élèves (telles que l’âge et l’anxiété par rapport aux mathématiques). Les modèles à plusieurs niveaux sont particulièrement utiles lorsque la variance entre les établissements de la variable dépendante est élevée (par exemple, lorsqu’elle est supérieure de 5 % à la variance totale). La modélisation à plusieurs niveaux sort du cadre de cette publication. Toutefois, la forme d’analyse de régression décrite ici introduit certains concepts sous-tendant la modélisation à plusieurs niveaux, qui peuvent être utilisés lorsque celle-ci ne convient pas.


80

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

L’équation de régression pour une variable dépendante y et une variable indépendante x est la suivante : yˆ = α + bX + ε, où α = point d’intersection (le point sur l’axe y lorsque x est égal à zéro) b = gradient ou pente de la droite de régression (coefficient de régression) X = valeur de la variable indépendante ε = terme d’erreur (correspondant aux résidus, ou différences entre les valeurs mesurées et prédites).3 La figure 6.2 montre l’équation de régression et la droite de régression d’un nuage de points à deux variables, x (variable indépendante) et y (variable dépendante). L’équation de régression peut être utilisée pour a) indiquer si les valeurs de y (prédites) ont tendance à augmenter ou à diminuer lorsque les valeurs de x (prédicteur) changent ; b) estimer ou prédire les valeurs de y à partir des valeurs connues de x ; et c) calculer la valeur de y lorsque la valeur de x est égale à zéro (voir l’exercice 6.3).

FIGURE 6.2 Droite de régression et équation de régression d’un nuage de points 12 11 10 9 variable y

8 7 6

Y = 6,1 + 0,73x

5 4 3 2 1 0 –6

–5

–4

–3

–2

–1

0

variable x

1

2

3

4

5

6


ASSOCIATION ENTRE LES VARIABLES : CORRÉLATION ET RÉGRESSION

| 81

ENCADRÉ 6.1

Variables d’une régression standard Variable dépendante (résultat) unique, telle que la performance en compréhension de l’écrit ou en mathématiques Une ou plusieurs variables indépendantes (explicatives), telles que la taille des classes, l’emplacement géographique, les qualifications des enseignants, le niveau d’instruction des parents, le sexe des élèves

La régression décrit, sous la forme d’une équation, la relation entre deux ou plusieurs variables. Elle permet de prédire, par exemple, le score d’un élève à un test de performance à partir de ce que l’on sait de son contexte familial ou d’autres caractéristiques. Dans une évaluation nationale typique, de nombreuses variables sont susceptibles de présenter une corrélation significative avec les scores aux tests de mathématiques, langue ou sciences. En pareil cas, on peut utiliser une régression multiple pour quantifier l’association entre plusieurs variables indépendantes et une variable dépendante. Des exemples de variables dépendantes et indépendantes fréquemment observées dans les évaluations nationales sont fournis dans l’encadré 6.1.

Utilisation d’une régression à une variable dépendante et une variable indépendante Les sections qui suivent donnent des exemples de la façon d’effectuer une analyse de régression à l’aide de WesVar et d’interpréter le résultat. WesVar est utilisé parce qu’il tient compte de la complexité de l’échantillon de l’évaluation nationale (voir le chapitre 3) lors de la détermination des niveaux de signification (par exemple, les différences issues du regroupement des élèves en établissements et en classes). Le premier exemple porte sur le type de régression le plus simple. Il considère l’association entre une variable dépendante, la performance en mathématiques (Mathss), allant de 88 à 400, et une variable indépendante, le nombre de livres à la maison (Books), allant d’aucun livre (0) à 120. Le programme de régression linéaire de


82

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

WesVar vous invite à sélectionner des variables indépendantes dans deux listes : Class Variables et Source Variables. Class Variables comprend des variables catégorielles comportant au maximum 255 catégories de réponses, en plus des valeurs manquantes (une fonctionnalité de WesVar). Les Source Variables sont des variables continues. Certaines variables apparaissent à la fois dans les deux listes. C’est le cas, par exemple, de la variable Books. Ici, nous traitons Books comme une variable Source. Voir l’exemple dans l’exercice 6.3. La régression peut être utilisée avec des variables tant catégorielles que continues. Dans l’exercice 6.4, la variable indépendante est Region. Rappelons qu’il a été établi au chapitre 4 que les élèves de la région Metro Area avaient des performances nettement supérieures à celles des élèves des trois autres régions du Sentz (exercice 4.2). Notons aussi que, lorsqu’une variable catégorielle telle que Region est sélectionnée comme variable indépendante dans une analyse de régression, une série de variables catégorielles doit être créée pour indiquer la région où l’établissement d’un élève est situé. WesVar crée

EXERCICE 6.3 Exécution d’une régression dans WesVar, avec une variable indépendante (continue) 1. Lancez WesVar et ouvrez le classeur utilisé dans l’exercice 6.2, NAEA DATA ANALYSIS\MY WESVAR FILES\CHAPTER 6 WORKBOOK. 2. Sélectionnez Chapter 6 Exercises dans le panneau de gauche et cliquez sur Regression dans le panneau de droite. Sélectionnez Regression Request One (panneau de gauche). Saisissez Exercise 6.3 (panneau de droite). 3. Sélectionnez Options dans le panneau de gauche et assurez-vous que Linear est cochée. Dans Options, sélectionnez Generated Statistics – Confidence Interval. Dans Output Control, fixez Estimates et Std. Error à trois décimales. 4. Sélectionnez Models dans le panneau de gauche. Déplacez Mathss de la liste Source Variables vers Dependent. C’est la variable dépendante de votre analyse de régression. (Si vous ne voyez qu’une ou deux variables dans la liste du panneau de droite, placez votre curseur sur le bord inférieur et faites-le glisser vers le bas pour afficher plus de variables.) 5. Déplacez Books de Source Variables vers la première ligne de la liste Independent. Vérifiez qu’Intercept a bien été coché. Cliquez sur Add as New Entry (figure 6.3.A).


ASSOCIATION ENTRE LES VARIABLES : CORRÉLATION ET RÉGRESSION

| 83

EXERCICE 6.3 (suite) FIGURE 6.3.A Classeur WesVar avant l’exécution de la régression à une variable indépendante

6. Exécutez l’analyse de régression (cliquez sur la l’icône avec la flèche verte dans la barre d’outils) et ouvrez le résultat (cliquez sur l’icône Open Book dans la barre d’outils). Développez Exercise 6.3, Models et Mathss = Books. Cliquez sur Sum of Squares (figure 6.3.B). La valeur de R carré (R_Square Value) est égale à 0,099. Elle indique que la variable Books explique près de 10 % des scores en mathématiques. La valeur de R carré est obtenue en divisant la somme des carrés du modèle (expliqué) par la somme totale des carrés. FIGURE 6.3.B

Résultat de la régression dans WesVar, avec une variable indépendante :

Somme des carrés et valeur de R au carré

(suite)


84

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 6.3 (suite) 7. Enregistrez ce fichier en tant que fichier texte dans MY SOLUTIONS en utilisant File – Export – Single File – One Selection. Utilisez le nom de fichier EXERCISE 6.3 SUM OF SQUARES. 8. Sélectionnez Estimated Coefficients dans le fichier de résultat (figure 6.3.C). Cela montre l’estimation du paramètre ou la modification du score attendu associée au nombre de livres qu’un élève a chez lui. Appliquez la formule décrite précédemment, yˆ = α + bX, pour calculer la relation ou l’association entre le nombre de livres et la performance en mathématiques. N’utilisez pas ε dans ces calculs.a Notez que X représente le nombre de livres et b la pente de la droite de régression. La valeur de l’estimation pour les livres (0,515) indique qu’une augmentation d’un livre correspond à une augmentation de 0,515 point de la performance en mathématiques. Le score attendu en mathématiques d’un élève n’ayant aucun livre est la valeur du point d’intersectionb 225,196 ou, en utilisant la formule, 225,196 + 0 * 0,515. Le score attendu pour un élève ayant 10 livres est 230,346 (225,196 + 10 * 0,515). Le fait d’avoir 10 livres à la maison est, par conséquent, associé à une augmentation de 5 points de la performance en mathématiques. La valeur moyenne de Books est 48,2.c Par conséquent, le score attendu en mathématiques pour un élève ayant un nombre moyen de livres à la maison vaut 225,196 + 0,515 * 48,2, soit 250,019, un résultat très proche du score moyen général de 250,0 enregistré en mathématiques. Les valeurs t de la figure 6.3.C sont calculées en divisant chaque estimation par son erreur-type. La valeur t est une mesure de la signification statistique et elle vérifie la probabilité que la valeur réelle du paramètre ne soit pas égale à zéro. Pour Books, la valeur t est 11,449 et la valeur de la probabilité (p) (Prob>|T|) est égale ou proche de zéro (0,000). Cela indique qu’il existe une très faible chance que la valeur réelle du paramètre Books soit égale à zéro. Les limites de l’intervalle de confiance de 95 % entourant un paramètre sont estimées de manière approximative en ajoutant deux fois son erreur-type à la valeur du paramètre et en soustrayant deux fois cette erreur-type. Ainsi, après arrondi, l’intervalle de confiance de 95 % pour Books va de 0,425 à 0,605 (0,515 ± 2 * 0,045). Il y a 95 % de certitude que l’estimation de la valeur de Books dans la population se situe entre 0,425 et 0,59. (Ces valeurs sont pratiquement identiques à celles présentées dans la figure 6.3.C) FIGURE 6.3.C Résultat de la régression dans WesVar, avec une variable indépendante : Coefficients estimés


ASSOCIATION ENTRE LES VARIABLES : CORRÉLATION ET RÉGRESSION

| 85

EXERCICE 6.3 (suite) 9. Enregistrez le résultat dans MY SOLUTIONS à l’aide de File – Export – Single File – One Selection. Utilisez le nom de fichier EXERCISE 6.3 ESTIMATES.TXT. 10. Il faut maintenant s’intéresser à la « qualité de l’ajustement » du modèle statistique estimant la valeur de Mathss à l’aide des données d’une variable indépendante, Books. Sélectionnez Tests (figure 6.3.D). Notez que l’ajustement global du modèle de régression est statistiquement significatif (première ligne) et que la probabilité d’obtenir une valeurd F de 131,080 est proche de zéro (0,000). Cela signifie que le modèle de régression contenant Books est statistiquement différent d’un modèle ne comprenant pas cette variable. La ligne suivante de la figure 6.3.D présente des données identiques. Elles confirment qu’un modèle contenant Books est statistiquement très différent d’un modèle ne comprenant pas de variables indépendantes (le modèle nul). Du point de vue des politiques, cette constatation indique que le nombre de livres à la maison est lié aux performances en mathématiques des élèves. FIGURE 6.3.D Résultat de la régression dans WesVar, avec une variable indépendante : Test de l’ajustement du modèle

11. Enregistrez le fichier de résultat dans MY SOLUTIONS à l’aide de File – Export – Single File – One Selection. Utilisez le nom de fichier EXERCISE 6.3 TESTS.TXT. 12. Retournez à votre classeur (à l’aide de l’icône Open Door de la barre d’outils). Sélectionnez File – Save et ensuite File – Close. Votre classeur sera enregistré sous NAEA DATA ANALYSIS\MY WESVAR FILES\CHAPTER 6 WORKBOOK. a. Cela est dû au fait que les erreurs positives et négatives s’annulent mutuellement. b. Le point d’intersection α donne une estimation de la valeur moyenne de y (les scores en mathématiques dans cet exemple) pour X (le nombre de livres à la maison) = 0. La valeur de α est le point où la droite de régression coupe l’axe y. c. Pour calculer cette valeur, sélectionnez Descriptives dans WesVar et déplacez Books de Source Variables vers Selected, comme décrit dans l’exercice 3.1. d. La statistique F, qui doit être utilisée lorsque plus de deux variables sont comparées, vérifie la signification des différences entre les moyennes.


86

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

une série de variables muettes correspondant chacune à une région. Un code 1 ou 0 leur est assigné suivant que l’élève appartient ou non à la région. Par exemple, lorsque WesVar crée une variable muette NorthWest, le code 1 est assigné à tous les élèves fréquentant un établissement de cette région et le code 0 à tous les élèves des trois autres régions. De même, la variable muette Metro prend la valeur 1 pour tous les élèves des établissements de la région Metro Area et la valeur 0 pour les élèves des trois autres régions. Il en va de même pour les élèves de la région Eastern Highlands. En tant que catégorie de référence, la dernière région ou catégorie ne reçoit pas un code distinct, mais est comprise dans l’analyse. Dans l’exercice 6.4, où Region est la variable catégorielle (classe), la performance des élèves de chacune des trois premières régions (Northwest, Metro Area et Eastern Highlands) est comparée à celle des élèves de la quatrième région (Southwest Coast).

EXERCICE 6.4 Exécution de la régression dans WesVar, avec une variable indépendante (catégorielle) 1. Lancez WesVar et ouvrez le classeur utilisé dans l’exercice 6.3, NAEA DATA ANALYSIS\MY WESVAR FILES\CHAPTER 6 WORKBOOK. 2. Sélectionnez Chapter 6 Exercises (panneau de gauche) et cliquez sur Regression (panneau de droite). Sélectionnez Regression Request Twoa (panneau de gauche). Saisissez Exercise 6.4 (panneau de droite). Dans Options – Generated Statistics, cochez Confidence Interval. Sous Options – Output Control, fixez le nombre de décimales à trois pour l’estimation et l’erreur-type. 3. Sélectionnez Models dans le panneau de gauche. 4. Déplacez Mathss de la liste Source Variables vers Dependent dans le panneau de droite. C’est la variable dépendante de votre analyse de régression. 5. Dans Class Variables, faites glisser Region[4] vers la ligne destinée à la première variable indépendante. Vérifiez que la case Intercept est cochée. Cliquez sur Add as New Entry. Ici, Region[4] a été choisi dans la liste Class Variables parce qu’il s’agit d’une variable catégorielle (chaque élève a été affecté à une des quatre régions).


ASSOCIATION ENTRE LES VARIABLES : CORRÉLATION ET RÉGRESSION

| 87

EXERCICE 6.4 (suite) 6. Exécutez l’analyse de régression (cliquez sur l’icône avec la flèche verte dans la barre d’outils) et ouvrez le fichier de résultat (cliquez sur l’icône Open Book dans la barre d’outils). Développez Exercise 6.4, Models et Mathss = region[4]. Sélectionnez Sum of Squares dans le panneau de gauche. La valeur R carré est égale à 0,054. Elle indique que la variable Region[4] explique ou représente près de 5 % de la variance observée dans les scores en mathématiques. 7. Cliquez sur Estimated Coefficients dans le panneau de gauche. Les estimations du paramètre sont fournies pour trois des quatre régions (voir la figure 6.4.A). L’estimation du paramètre pour la région de référence est le point d’intersection (251,248). Il correspond au score moyen pour la région Southwest Coast dans l’exercice 4.2. L’estimation du paramètre pour Region.1 (Northwest) est −17,898 (soit 17,898 points de moins que dans la catégorie de référence). Le score attendu pour un élève ayant une performance moyenne dans le Northwest est donc de 233,350 (251,248 − 17,898). Cela correspond au score moyen estimé pour la région Northwest dans l’exercice 4.2. Le score estimé d’un élève ayant une performance moyenne dans la région Metro Area (Region.2) est de 265,735 (soit 14,487 points de plus que celui d’un élève de la région de référence). Enfin, le score estimé pour un élève ayant une performance moyenne dans la région Eastern Highlands (Region.3) vaut 249,108, à savoir 2,140 points de moins que dans la région de référence. La valeur t non significative associée à l’estimation du paramètre pour la région Eastern Highlands (Prob|T| = 0,667) indique que −2,14 n’est pas significativement différent de zéro et que, par conséquent, la performance d’un élève moyen dans cette région n’est pas statistiquement très différente de celle d’un élève moyen de la région de référence (Southwest Coast). FIGURE 6.4.A Résultat de l’analyse de régression dans WesVar : Variable catégorielle indépendante

8. Enregistrez le fichier de résultat en tant que fichier texte dans MY SOLUTIONS à l’aide de File – Export – Single File – One Selection. Nommez-le EXERCISE 6.4 ESTIMATES.TXT. a. Ce nombre peut varier. Par exemple, si vous avez déjà effectué une régression et que vous l’avez supprimée, le nombre est plus élevé.


88

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

Application de la régression multiple avec une variable dépendante et deux variables indépendantes ou plus Cette section décrit l’effet de l’augmentation du nombre de variables indépendantes sur l’explication ou la prise en compte des résultats au test de mathématiques. Trois variables indépendantes sont considérées : • Books, le nombre de livres existant au domicile de l’élève, une variable discrète • Distance, la distance en kilomètres entre le foyer de l’élève et l’établissement, une variable continue • Parented [6], le plus haut niveau d’études atteint par chacun des parents, une variable catégorielle comportant six catégories : 1 = aucune éducation formelle ; 2 = années 1 à 3 ; 3 = années 4 à 6 ; 4 = années 7 à 9 ; 5 = cycle supérieur de l’enseignement secondaire ; et 6 = diplôme de l’enseignement supérieur Les intercorrélations entre les variables indépendantes doivent être examinées minutieusement avant d’exécuter une régression. Il faut accorder une attention particulière à la multicolinéarité, qui se produit lorsque deux variables indépendantes ou plus sont fortement corrélées. Lorsque tel est le cas, les erreurs-types des régressions augmentent et rendent plus difficile l’évaluation du rôle spécifique de chaque variable indépendante dans l’explication de la performance.4 L’exercice 6.5 montre comment les coefficients de corrélation peuvent être calculés dans WesVar.

EXERCICE 6.5 Estimation des coefficients de corrélation 1. Lancez WesVar et ouvrez le classeur utilisé dans l’exercice 6.4, NAEA DATA ANALYSIS\MY WESVAR FILES\CHAPTER 6 WORKBOOK. 2. Sélectionnez Chapter 6 Exercises (panneau de gauche) et cliquez sur Descriptive Stats (panneau de droite). Sélectionnez Descriptive Request Two dans le panneau de gauche et saisissez Exercise 6.5 dans le panneau de droite. 3. Sélectionnez Options – Output Control, et fixez à trois le nombre de décimales pour Estimates et Std. Error.


ASSOCIATION ENTRE LES VARIABLES : CORRÉLATION ET RÉGRESSION

| 89

EXERCICE 6.5 (suite) 4. Sélectionnez Correlations (panneau de gauche). Sélectionnez List 1 (panneau de droite). Déplacez les trois variables Books, Distance et Parented vers List 1. 5. Effectuez les corrélations (cliquez sur l’icône avec la flèche verte dans la barre d’outils). Ouvrez le fichier de résultat (cliquez sur l’icône Open Book dans la barre d’outils). Sélectionnez et développez Exercise 6.5 dans le panneau de gauche. Sélectionnez Correlations – Overall. Les données générées dans la colonne Weighted (figure 6.5.A) montrent qu’il n’existe aucune preuve de multicolinéarité, étant donné qu’aucune des corrélations n’est proche de 0,80 (voir Hutcheson et Sofroniou, 1999). La corrélation négative entre Books et Distance (−0.077) indique que, lorsque la distance entre la maison et l’école tend à augmenter, le nombre de livres disponibles au domicile de l’élève a tendance à diminuer. La corrélation entre Books et Parented (traité ici comme une variable continue) est égale à 0,331. Elle indique qu’un niveau d’études plus élevé des parents est associé à la présence d’un plus grand nombre de livres à la maison. FIGURE 6.5.A Résultat pour les corrélations entre des variables indépendantes

6. Enregistrez ce fichier comme un fichier texte dans My Solutions à l’aide de File – Export – Single File – One Selection. Donnez-lui le nom EXERCISE 6.5 CORRELATIONS. Fermez votre classeur WesVar à l’aide de File – Save et File – Close.

Les trois variables n’étant pas fortement corrélées entre elles, vous pouvez maintenant effectuer une régression avec une variable dépendante (Mathss) et trois variables indépendantes (Books, Distance, Parented [6]) (exercice 6.6). En résumé, les données montrent qu’un modèle avec trois variables indépendantes (Books, Distance, Parented [6]) explique 24 % de la


90

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 6.6 Exécution d’une régression dans WesVar, avec plus d’une variable indépendante 1. Ouvrez le classeur WesVar CHAPTER 6 WORKBOOK que vous avez enregistré dans MY WESVAR FILES (utilisé pour la dernière fois dans l’exercice 6.5). 2. Sélectionnez Chapter 6 Exercises (panneau de gauche) et cliquez sur Regression (panneau de droite). Sélectionnez Regression Request Three (panneau de gauche). Saisissez Exercise 6.6 (panneau de droite). 3. Dans Options – Output Control, spécifiez trois décimales pour Estimates et Std. Error. Cliquez sur Models (panneau de gauche). 4. Déplacez Mathss de la liste Source Variables vers le champ Dependent. 5. Allez dans Source Variables et faites glisser Books et Distance vers la liste des variables indépendantes de façon à placer une variable par ligne. Passez ensuite à Class Variables et déplacez Parented [6] vers la ligne destinée à la troisième variable indépendante.a 6. Vérifiez que la case Intercept (panneau de droite) est cochée. Cliquez sur Add as New Entry (panneau de droite) (figure 6.6.A). Exécutez l’analyse de régression (cliquez sur l’icône avec la flèche verte dans la barre d’outils).

FIGURE 6.6.A Écran de WesVar avant l’exécution de la régression avec plus d’une variable indépendante


| 91

ASSOCIATION ENTRE LES VARIABLES : CORRÉLATION ET RÉGRESSION

EXERCICE 6.6 (suite) 7. Affichez le fichier de résultat (cliquez sur l’icône Open Book dans la barre d’outils). Développez Exercise 6.6 (panneau de gauche) jusqu’à ce que vous voyiez apparaître Sum of Squares. Ce résultat montre que le nouveau modèle à trois variables représente 24 % de la variance de la performance en mathématiques (R2 = 0,242). Cela représente une amélioration par rapport au modèle précédent où, en tant qu’unique variable indépendante, la variable Books expliquait à peine 10 % de la variance de la performance en mathématiques (voir la figure 6.3.B). FIGURE 6.6.B Résultat de la régression dans WesVar, avec plus d’une variable indépendante : Somme des carrés

8. Enregistrez le fichier de résultat de la figure 6.6.B en sélectionnant File – Export – Single File One Selection – Export sous le nom My Solutions\EXERCISE 6.6 SUM OF SQUARES. 9. Sélectionnez Estimated Coefficients dans le fichier de résultat (panneau de gauche, à développer si nécessaire). Le résultat donne les estimations du paramètre pour Intercept, Books, Distance et cinq des six niveaux de Parented. Notons que tous les paramètres du modèle sont statistiquement significatifs, avec une valeur de Prob>|T| égale ou proche de zéro. Ceci indique une très faible probabilité que l’un des paramètres soit égal à zéro. 10. La valeur estimée d’Intercept est 278 909. Elle correspond au score attendu d’un élève qui n’a aucun livre (Books) à la maison, qui vit à une Distance nulle de l’école (zéro kilomètre), et dont au moins un des parents a le niveau d’études le plus élevé (Parented.6, la catégorie de référence pour Parented [6]). La valeur estimée de Books est 0,309. Elle correspond à l’augmentation de performance associée à un livre supplémentaire. Ainsi, un élève qui dispose d’un nombre moyen de livres (suite)


92

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 6.6 (suite) (Books) à la maison (48,191), qui vit à moins d’un kilomètre de l’école et dont au moins un parent possède un diplôme de l’enseignement supérieur aurait un score estimé de 278,909 + (0,309 * 48,191) + (−5,620 * 0), soit 293,800. (Notons que Parented [6] a une pondération nulle dans ce calcul étant donné qu’il s’agit de la catégorie de référence.) 11. La valeur estimée de Distance est -5,620. Le signe négatif signifie que plus la distance entre la maison et l’école augmente, plus les scores en mathématiques attendus des élèves diminuent. La distance moyenne à l’école est de 4,257 km.b Le score en mathématiques attendu d’un élève qui vit à 4,257 km de l’école, n’a aucun livre à la maison et dont au moins un des parents appartient à la catégorie de référence Parented [6] est donc de 278,909 + (−5,620 * 4,257) + (0,309 * 0), soit 254,985. 12. Les valeurs estimées sont fournies pour cinq niveaux de Parented [6]. Comme mentionné précédemment, Parented.6 (au moins un des parents est diplômé de l’enseignement supérieur), la catégorie de référence, correspond au niveau d’études des parents le plus élevé. Les estimations négatives sont associées à des niveaux inférieurs d’instruction des parents. Par exemple, la valeur estimée de Parented.2 (années 1 à 3 achevées) est −30,156 (voir la figure 6.6.C). Le score attendu d’un élève qui ne dispose d’aucun livre à la maison, qui habite à côté ou à proximité de l’école et dont au moins un des parents a terminé sa 3e année d’études (Parented.2) vaut par conséquent 278,909 − 30,156, soit 248,753.

FIGURE 6.6.C Résultat de la régression dans WesVar, avec plus d’une variable indépendante : Coefficients estimés

13. De la même façon, vous pouvez calculer les scores attendus pour les élèves ayant différents nombres de livres à la maison, vivant à différentes distances de l’école et dont les parents ont différents niveaux d’instruction. Ainsi, le score attendu pour un élève qui a 50 livres (Books = 50), qui vit à une Distance de 5 km de l’école et dont les parents ont au maximum terminé une des années 7 à 9 (Parented.4) est donc égal à 278,909 + (0,309 * 50) + (−5,620 * 5) + (−15,615), soit 250,644.


ASSOCIATION ENTRE LES VARIABLES : CORRÉLATION ET RÉGRESSION

| 93

EXERCICE 6.6 (suite) 14. Enregistrez le fichier de résultat dans MY SOLUTIONS à l’aide de File – Export – Single File – One Selection. Utilisez le nom de fichier EXERCISE 6.6 ESTIMATES. TXT. 15. Sélectionnez Tests dans le résultat. Vous pouvez voir (première ligne de la figure 6.6.D) que l’ajustement global du modèle de régression est statistiquement significatif, avec une probabilité proche de zéro (0,000) d’obtenir une valeur F de 134,636. Cela signifie qu’au moins une des variables Books, Distance ou Parented [6] est statistiquement significative. Les valeurs p de Books, Distance et Parented [6] montrent que, pour chacune de ces variables, le coefficient de régression diffère significativement de zéro, après contrôle des autres variables. Par exemple, la variable Distance est statistiquement significative même après avoir pris en compte les effets des variables Books et Parented [6]. FIGURE 6.6.D Résultat de la régression dans WesVar, avec plus d’une variable indépendante : Test d’ajustement du modèle

16. Enregistrez le résultat en tant que fichier texte dans My Solutions à l’aide de File – Export – Single File – One Selection. Utilisez le nom de fichier EXERCISE 6.6 TESTS.TXT. 17. Revenez à votre classeur (à l’aide de l’icône Open Door de la barre d’outils). Sélectionnez File – Save et ensuite File – Close. Votre classeur sera enregistré en tant que NAEA DATA ANALYSIS\MY WESVAR FILES\CHAPTER 6 WORKBOOK. a. Notons que Parented apparaît également dans la liste Source Variables. Dans cet exemple, vous devez toutefois sélectionner Parented [6] dans la liste Class Variables parce que cette variable est traitée comme une variable catégorielle dans la régression. b. Pour calculer cette valeur, sélectionnez Descriptives dans WesVar et déplacez Distance de Source Variables vers Selected, comme dans la procédure décrite dans l’exercice 3.1.


94

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

variation de la performance en mathématiques. Le modèle suggère une association positive entre le nombre de livres disponibles au domicile de l’élève et sa performance en mathématiques, même après prise en compte des deux autres variables. Il suggère également que le niveau d’études des parents est lié à la performance en mathématiques des élèves : les scores attendus des élèves dont les parents ont un niveau d’éducation plus élevé ont tendance à être supérieurs aux scores de ceux dont les parents ont un niveau d’études plus bas, après prise en compte des deux autres facteurs (nombre de livres et distance). Enfin, le modèle indique une association négative entre la distance à l’école et la performance en mathématiques, en tenant compte du nombre de livres et de l’éducation des parents. Les élèves vivant plus loin de l’école ont tendance à obtenir de moins bons résultats que les élèves vivant près de leur école.

CORRÉLATION ET CAUSALITÉ Dans la plupart des évaluations nationales, des informations sont recueillies sur une série de variables personnelles et contextuelles dans des questionnaires remplis par les élèves, les enseignants et (parfois) les parents. Les variables sont généralement sélectionnées sur la base de leur relation présumée avec la performance des élèves (qu’elle soit ou non étayée par la recherche). Les responsables des politiques peuvent également inclure des variables pour orienter leurs choix d’interventions destinées à améliorer la performance des élèves. L’association entre une variable contextuelle et la performance des élèves peut être représentée dans une corrélation. La constatation d’une corrélation (même forte) entre des variables d’une évaluation nationale ne signifie toutefois pas qu’une variable est la cause d’une autre. Un certain nombre de raisons soutiennent cette affirmation. Tout d’abord, la plupart des évaluations nationales sont transversales. Les données relatives aux facteurs contextuels et à la performance sont recueillies en même temps. La séquence temporelle des événements, où la cause précède l’effet, généralement requise pour étayer une inférence de causalité, n’est donc pas présente. Ce problème peut être contourné lorsque certaines variables contextuelles décrivent des


ASSOCIATION ENTRE LES VARIABLES : CORRÉLATION ET RÉGRESSION

| 95

événements passés (par exemple, le temps consacré à l’apprentissage d’une discipline du programme). Cette question est également abordée dans les rares cas où les données sur les élèves sont recueillies à des moments différents. La prise en compte des caractéristiques des élèves à un stade antérieur de leur trajectoire éducative (notamment leurs performances et leurs données contextuelles précédentes) permet de renforcer les inférences qui peuvent être tirées à propos de l’impact de leur expérience scolaire (Kellaghan, Greaney et Murray, 2009). Un deuxième problème lié à l’identification des relations causales dans une évaluation nationale est le fait que les facteurs qui affectent la performance des élèves sont complexes et interdépendants. De nombreux ouvrages identifient une série de facteurs associés à la performance, notamment les caractéristiques personnelles des élèves, les facteurs familiaux et communautaires, et les pratiques pédagogiques individuelles des enseignants. Les analyses statistiques où une seule variable est liée à la performance non seulement échouent à reconnaître cette complexité, mais mènent également à des conclusions erronées. Un exemple simple permet d’illustrer ce point. La constatation que les élèves des établissements privés ont des niveaux de performance supérieurs à ceux des établissements publics peut être interprétée comme l’indice d’une supériorité de l’enseignement dispensé dans le privé par rapport à celui du public. Une telle conclusion devrait toutefois être revue si d’autres facteurs, tels que le niveau de performance des élèves au moment de leur inscription à l’école ou leur situation familiale (par exemple, le niveau socioéconomique des parents), étaient intégrés dans les analyses. La complexité des facteurs influençant la performance des élèves est prise en compte dans les analyses de régression multiple, lorsque les « effets » d’une variable sont isolés par le retrait systématique ou ajustement des « effets » d’autres variables. Une inférence liée à la causalité est renforcée si des relations significatives sont trouvées après ajustement. Une série de méthodes de régression plus élaborées, où des schémas de corrélation entre les variables indépendantes et les résultats sont examinés afin d’identifier des relations causales, permet de renforcer davantage les inférences liées à la causalité. Ces méthodes


96

| ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

(dont la description sort du cadre de la présente étude) sont conçues pour identifier des variables considérées comme des modérateurs, qui affectent la direction et la force de la relation entre un critère et des variables indépendantes (par exemple, le sexe, l’âge, le statut socioéconomique) et des médiateurs, qui ont trait à la façon ou aux raisons pour lesquelles des effets se produisent (Bullock, Green et Ha, 2010). Même les méthodes d’analyse les plus sophistiquées ne parviennent toutefois pas à résoudre un autre problème qui se présente lorsqu’il s’agit d’inférer des liens de causalité sur la base des données obtenues dans une étude transversale (telle qu’une évaluation nationale). Par exemple, les données peuvent manquer pour des facteurs importants, souvent incontrôlables et peu clairs, susceptibles d’affecter la performance des élèves. Ce problème ne peut être résolu qu’avec des modèles de recherche aléatoires contrôlés, où l’influence directe d’une condition sur une autre est étudiée après élimination de toutes les autres causes possibles de variation. Malgré la difficulté de tirer des inférences causales sur la base des données d’une évaluation nationale, l’information relative aux corrélats de la performance détectés dans une évaluation conserve toutefois une valeur pragmatique. Les données recueillies dans une évaluation, par exemple, sur le sexe, la situation géographique ou l’appartenance à un groupe ethnique peuvent agir comme des signaux importants identifiant, dans le système d’éducation, des problèmes qui méritent une attention particulière dans l’élaboration des politiques, et éventuellement des interventions ou des mesures correctives. La détermination de la nature de ces interventions ou mesures correctives requiert toutefois de tenir compte des conditions et ressources locales, de l’implication des parties prenantes et des constatations des études réalisées (voir Kellaghan, Greaney et Murray, 2009).

NOTES 1. Si l’intitulé d’une variable (Implement – Percent Correct) apparaît dans la colonne de gauche de Simple Scatterplot au lieu du nom de la variable (Impl_pc), sélectionnez Cancel et ensuite Edit – Options – General – Variable Lists – Display Names – Apply – OK (dans le message) – OK.


ASSOCIATION ENTRE LES VARIABLES : CORRÉLATION ET RÉGRESSION

| 97

2. La permutation des deux donnerait deux droites de meilleur ajustement. Autrement dit, la droite prédisant le mieux y à partir de x est différente de celle prédisant le mieux x à partir de y. 3. Le terme d’erreur ou « bruit » reflète le fait qu’en plus de ceux inclus dans le modèle de régression, d’autres facteurs influencent la variable dépendante. 4. Lors de la préparation d’une régression, l’analyste doit également rechercher les valeurs aberrantes ou extrêmes d’une variable (voir le chapitre 2) parce qu’elles peuvent fausser les résultats. Il est également important de déterminer si l’une des variables de l’équation de régression est fortement asymétrique. Les valeurs aberrantes ou extrêmes peuvent contribuer à la distorsion de paramètres et d’estimations statistiques.


7

CHAPITRE

PRÉSENTATION DES DONNÉES À L’AIDE DE DIAGRAMMES ET GRAPHIQUES

« Une image vaut mille mots. » Beaucoup de lecteurs des rapports d’évaluations nationales comprennent plus aisément les données lorsqu’elles sont présentées sous la forme de diagrammes ou de graphiques que sous la forme de tableaux. Les chapitres précédents contenaient des diagrammes de dispersion, des histogrammes et des diagrammes en boîte produits par des programmes informatiques au cours des différentes analyses (par exemple, l’exercice 6.1 montre comment SPSS produit un diagramme de dispersion). Ce chapitre donne des exemples d’un certain nombre d’approches graphiques de présentation des résultats des évaluations nationales. L’accent est mis sur les diagrammes et les graphiques linéaires qui peuvent être produits dans Excel et collés dans un rapport d’évaluation national. À mesure que vous vous familiariserez avec ces techniques, vous découvrirez d’autres logiciels susceptibles d’être utilisés pour présenter des données de manière picturale. Les diagrammes et graphiques n’ont pas pour but de remplacer les tableaux. Ils affichent simplement les données d’une manière différente. Lorsqu’ils sont repris dans un rapport, les tableaux correspondants (ensembles de données sur lesquels les diagrammes et graphiques sont basés) doivent également y figurer, dans le corps du texte ou en annexe (éventuellement une annexe électronique). Cette section ne traite que des diagrammes bidimensionnels (2-D). 99


100

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

DIAGRAMMES Un diagramme en colonnes utilise des rectangles verticaux d’une hauteur généralement proportionnelle à la valeur qu’ils représentent. Par exemple, vous pouvez utiliser un diagramme en colonnes pour comparer les populations de quatre régions ou les scores moyens des élèves de différents types d’écoles, dans un domaine spécifique du programme de cours. Dans l’exercice 7.1, les données sur les niveaux de compétence en mathématiques des élèves sont présentées sous la forme d’un diagramme en colonnes, où la hauteur des rectangles indique le pourcentage d’élèves à chaque niveau. Les données sont fondées sur une évaluation nationale présentant les résultats à l’aide de cinq niveaux de compétence (niveaux 1 à 4 et inférieur au niveau 1). L’exercice 7.11 décrit également la procédure de création d’un diagramme en colonnes dans Excel. Vous pouvez également représenter le pourcentage d’élèves à chaque niveau de compétence dans chaque région d’un pays. Ici, les données régionales sur les niveaux de compétence seront représentées par un diagramme à barres (voir l’exercice 7.2) qui ressemble beaucoup à un diagramme en colonnes, à la différence que les rectangles sont horizontaux.

EXERCICE 7.1 Production d’un diagramme en colonnes pour montrer la performance par niveau de compétence (données nationales) 1. Organisez les données dans une feuille Excel (figure 7.1.A). Copiez vos données à partir d’un tableau existant ou saisissez simplement les données dans la feuille Excel. 2. Sélectionnez les données (figure 7.1.A). Dans la barre de menu, sélectionnez Insert et Column (figure 7.1.B).a 3. Sélectionnez 2-D Column et Clustered Column pour le premier diagramme en colonnes. Pour donner un intitulé à l’axe vertical (y), faites un clic droit sur le côté gauche, où figurent les valeurs (0 à 25). Dans la barre d’outils, sélectionnez Chart Tools (en haut de l’écran) – Layout – Axis Titles Primary Vertical Axis Title – Rotated Title. Sélectionnez le texte dans la boîte à côté de l’axe vertical et saisissez Percentage of students (figure 7.1.C).


PRÉSENTATION DES DONNÉES À L’AIDE DE DIAGRAMMES ET GRAPHIQUES

| 101

EXERCICE 7.1 (suite) FIGURE 7.1.A Pourcentages des élèves à chaque niveau de performance

Niveau

Pourcentage d’élèves

Inférieur au niveau 1

19,8

Niveau 1

20,4

Niveau 2

23,6

Niveau 3

19,2

Niveau 4

17,1

FIGURE 7.1.B Options de diagrammes dans Excel

4. Pour donner un intitulé à l’axe horizontal (x), faites un clic droit en bas du diagramme (les niveaux de compétence seront mis en surbrillance). Dans la barre d’outils, sélectionnez Chart Tools (en haut de l’écran) – Layout – Axis Titles – Primary Horizontal – Axis Title – Title Below Axis. Sélectionnez le texte (Axis Title) dans la boîte, et saisissez Proficiency levels (figure 7.1.C). 5. Si Excel a donné lui-même un titre au diagramme, vous pouvez le modifier en sélectionnant le texte et en saisissant un nouveau nom. Si aucun titre n’a été attribué, cliquez sur le diagramme pour le sélectionner. Dans la barre d’outils, sélectionnez Chart Tools (en haut de l’écran) – Layout – Chart Title – Above Chart. Sélectionnez le texte, et saisissez Percentage of Students at Each Mathematics Proficiency Level. Le titre a été placé en haut du diagramme dans la figure 7.1.C. 6. Vous pouvez modifier diverses caractéristiques du diagramme (telles que la taille de la police et le style) en cliquant dans la zone appropriée du graphique et en utilisant l’outil d’édition (clic droit) ou Design et Layout (sous Chart Tools). Si vous voulez montrer les valeurs (pourcentages) dans chaque colonne, faites un clic droit dans l’une des colonnes (cela les sélectionne toutes). Ensuite, sélectionnez Chart Tools – Layout – Data Labels – Outside End. Les pourcentages d’élèves seront affichés pour chaque niveau de compétence. (suite)


102

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 7.1 (suite) FIGURE 7.1.C Pourcentage d’élèves à chaque niveau de compétence en mathématiques

pourcentage d’élèves

25 20

23,6 19,8

20,4

19,2 17,1

15 10 5 0 inférieur au niveau 1

niveau 1

niveau 2

niveau 3

niveau 4

niveau de compétence

7. Sélectionnez la zone du diagramme en cliquant sur le périmètre, puis sélectionnez Copy. Collez ensuite le diagramme dans votre rapport. 8. Enregistrez votre feuille Excel dans MY SOLUTIONS, avec le nom de fichier EXERCISE 7.1.XLS. a. Les versions précédentes d’Excel peuvent vous proposer l’assistant graphique où vous pouvez également sélectionner un diagramme en colonnes.

EXERCICE 7.2 Production d’un diagramme à barres pour montrer le pourcentage à chaque niveau de compétence par région 1. Copiez les données de la figure 7.2.A dans un fichier Excel. 2. Sélectionnez les données, comme le montre la figure 7.2.A. Cliquez sur Insert (ou sélectionnez Insert – Charts) − Bar − 2-D Bar − 100 % Stacked Bar (troisième option) (figure 7.2.B). Ce diagramme vous permet de comparer, par région, les pourcentages d’élèves aux différents niveaux de compétence. Vous pouvez modifier différentes caractéristiques de ce diagramme pour le rendre plus présentable.


PRÉSENTATION DES DONNÉES À L’AIDE DE DIAGRAMMES ET GRAPHIQUES

| 103

EXERCICE 7.2 (suite) FIGURE 7.2.A Pourcentage d’élèves à chaque niveau de compétence en mathématiques, par région

Inférieur au niveau 1 27,8

Niveau 1

Niveau 2

Niveau 3

23,8

22,9

16,8

8,7

Metro area Eastern Highlands

13,5 17,3

13,9 21,6

16,9 23,1

23,8 25,9

31,9 12,1

Southwest coast

18

16,9

24,7

30,5

9,9

Northwest

Niveau 4

FIGURE 7.2.B Options de diagrammes 2-D à barres dans Excel

• Si votre résultat (figure 7.2.C) présente les régions dans un ordre incorrect (par exemple, Southwest Coast en haut au lieu de Northwest), cliquez sur le diagramme puis sur les intitulés de l’axe vertical (régions). Sélectionnez Chart Tools – Format – Current Selection – Format Selection – Axis Options. Cochez la case Categories in Reverse Order – Close. • Si les niveaux apparaissent sur l’axe des y et les régions sur l’axe des x (c’est-à-dire le contraire de ce qui est présenté dans la figure 7.2.C), retournez dans Excel. Faites un clic droit dans la zone du diagramme. Sélectionnez Data et cliquez sur Switch Row/Column (figure 7.2.D). Si vous le souhaitez, vous pouvez afficher le pourcentage d’élèves à chaque niveau de compétence de chaque région. Cliquez sur la barre représentant le niveau inférieur à 1 de la première région. Cette action met en surbrillance l’ensemble des rectangles de niveau inférieur à 1 dans toutes les régions. Faites un clic droit et sélectionnez Add Data Labels (ou sélectionnez Layout – Labels – Data Labels – Center). Répétez le processus pour les autres niveaux (figure 7.2.E). (suite)


104

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 7.2 (suite) FIGURE 7.2.C Pourcentage d’élèves à chaque niveau de compétence en mathématiques, par région

Southwest Coast

Eastern Highlands

Metro Area

Northwest

0

20

40

60

80

100

pourcent inférieur au niveau 1 niveau 1 niveau 2

niveau 3 niveau 4

FIGURE 7.2.D Permuter les lignes et les colonnes à l’aide des outils de diagramme d’Excel


PRÉSENTATION DES DONNÉES À L’AIDE DE DIAGRAMMES ET GRAPHIQUES

| 105

EXERCICE 7.2 (suite) FIGURE 7.2.E Pourcentage d’élèves à chaque niveau de compétence en mathématiques, par région

Northwest

13,5

Eastern Highlands

17,3

Southwest Coast

18

13,9

16,9

16,8

23,8

8,7

31,9

région

Metro Area

22,9

23,8

27,8

0

21,6

23,1

16,9

20

24,7

40

25,9

12,1

30,5

9,9

60

80

100

pourcentage d’élèves

inférieur au niveau 1 niveau 1 niveau 2

niveau 3 niveau 4

• Si l’axe horizontal (avec les pourcentages) s’affiche en haut du tableau plutôt qu’en bas, sélectionnez l’axe horizontal (l’axe avec les pourcentages) en faisant un clic droit sur un intitulé. Ensuite, faites un clic droit sur les intitulés supérieurs ou inférieurs de l’axe (en fonction de la position actuelle des pourcentages) et sélectionnez Format Axis – Horizontal Axis Crosses – Automatic. • Si les régions sont en ordre inverse, sélectionnez l’axe vertical en cliquant sur un intitulé. Faites ensuite un clic droit sur Format Axis et cochez Categories in Reverse Order. • Si vous souhaitez ajouter un titre aux axes x ou y, sélectionnez la zone du diagramme où apparaissent les pourcentages. Sélectionnez ensuite Insert – Layout – Axis Titles – Primary Horizontal Axis Title – Title Below Axis. Sélectionnez Axis Title et saisissez le nouveau titre (par exemple, Percentage of students) dans la barre de formule ou directement dans la zone de texte nouvellement créée.a Suivez la même procédure pour ajouter un titre à l’autre axe. Pour ajouter un titre au diagramme, suivez les instructions décrites à l’étape 5 de l’exercice 7.1. (suite)


106

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 7.2 (suite) 3. Sélectionnez la zone du diagramme dans Excel en cliquant une fois sur le périmètre ; sélectionnez Home – Copy. Puis collez votre diagramme dans votre rapport, en lui donnant un titre approprié. 4. Enregistrez votre feuille Excel (NAEA DATA ANALYSIS\MY SOLUTIONS\ EXERCICE 7.2.XLS). 5. Sélectionnez File – Save et File – Close. a. Certaines versions récentes d’Excel utilisent Chart Layout suivi d’Axis Title et Chart Title pour les intitulés.

GRAPHIQUES LINÉAIRES AVEC INTERVALLES DE CONFIANCE Un graphique montrant une série de scores moyens avec leurs intervalles de confiance de 95 %, permet au lecteur non technicien de reconnaître les régions ayant une bonne performance par rapport aux autres, et de savoir si, dans une région, un score moyen et son intervalle de confiance chevauchent ou non le score moyen et l’intervalle de confiance d’une autre région.

EXERCICE 7.3 Traçage des intervalles de confiance de 95 % d’une série de scores moyens 1. Lancez Excel. Saisissez les données manuellement dans la feuille Excel, en les organisant comme indiqué dans la figure 7.3.A.a Au lieu de cela, vous pouvez également transférer ces données dans le fichier Excel à partir de NAEA DATA ANALYSIS\MY SOLUTIONS\EXERCISE 3.3.TXT. Dans ce cas, vous devrez éliminer de la feuille Excel certaines données inutiles (telles que les erreurs-types et les lignes contenant des données en pourcentage). 2. Sélectionnez les données, comme indiqué dans la figure 7.3.A. Sélectionnez Insert – Other Charts (ou Insert Chart) – Stock – High-Low-Close (première option). 3. Sélectionnez les chiffres sur l’axe vertical. Faites un clic droit et sélectionnez Format – Axis. Ensuite, sous Axis Options, cochez Fixed pour Minimum (ou Scale) et saisissez 220. De même, fixez Maximum à 280 (figure 7.3.B). Cliquez sur Close (ou OK). Veuillez noter que ces valeurs sont juste en dessous et au-dessus des valeurs les plus élevées de la figure 7.3.A.


PRÉSENTATION DES DONNÉES À L’AIDE DE DIAGRAMMES ET GRAPHIQUES

| 107

EXERCICE 7.3 (suite) FIGURE 7.3.A

Scores moyens en mathématiques et scores aux intervalles de

confiance supérieurs et inférieurs, par région

IC 95 % supérieur 239,9

Moyenne 233,3

IC 95 % inférieur 226,8

Metro area Eastern highlands

274,7 256,3

265,7 249,1

256,8 241,9

Southwest coast

257,9

251,2

244,6

Région Northwest

Note : IC = intervalle de confiance

FIGURE 7.3.B Options de format pour un axe dans Excel

4. Dans le diagramme Excel, cliquez sur la limite inférieure de la ligne de la première région (Northwest). Cette limite est mise en évidence dans les quatre régions. Dans la barre des menus, sélectionnez Format Selection – Marker Options (ou Marker Style) – Built In – Type. Sélectionnez une option convenable (telle que « – ») dans la liste Type (figure 7.3.c) (ou la liste déroulante Style). Augmentez Size à 10 ou plus, en vous assurant que la taille est suffisamment grande pour ressortir dans le graphique. Cliquez sur Close. Répétez le processus pour les limites supérieures. 5. Sélectionnez le point central de chaque ligne (score moyen) en cliquant sur la ligne de la première région et suivez la même procédure qu’à l’étape 4 pour choisir un marqueur approprié pour le score moyen. Utilisez la taille 20 pour le distinguer des autres. Notons que la légende sur le côté gauche du diagramme est produite automatiquement, sur la base de votre feuille de calcul initiale. Vous devez intituler les axes et les boîtes des séries sur le côté droit et donner un titre au diagramme. Copiez le diagramme (figure 7.3.d) dans votre rapport, en utilisant la fonction Copy et Paste. (suite)


108

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 7.3 (suite) FIGURE 7.3.C Options de format pour les séries de données dans Excel

FIGURE 7.3.D Graphique linéaire des scores moyens en mathématiques et intervalles de confiance de 95 %, par région

score moyen en mathématiques

280 270 260 250 240 230 220 Northwest

Metro Area

Eastern Highlands

Southwest Coast

région IC à 95 % supérieur Note : IC = intervalle de confiance

moyenne

IC à 95 % inférieur


PRÉSENTATION DES DONNÉES À L’AIDE DE DIAGRAMMES ET GRAPHIQUES

| 109

EXERCICE 7.3 (suite) 6. Enregistrez la feuille Excel dans NAEA DATA ANALYSIS\MY SOLUTIONS sous un nom approprié (tel qu’EXERCISE 7.3.XLS). Le graphique de la figure 7.3.D décrit les différences de performance moyenne entre les régions. Lorsqu’il n’y a aucun chevauchement entre les intervalles de confiance, on peut en conclure que les scores moyens sont significativement différents. Ainsi, il n’y a aucun chevauchement entre l’intervalle de confiance de 95 % de la région Northwest et ceux des autres régions. Les résultats moyens en mathématiques dans les régions Eastern Highlands et Southwest Coast ne diffèrent pas significativement (parce qu’il y a un chevauchement important entre leurs lignes respectives). a. Comme mentionné dans le chapitre 3, WesVar utilise 2,0 plutôt que 1,96 pour calculer les intervalles de confiance de 95 %.

GRAPHIQUES LINÉAIRES POUR LA PRÉSENTATION DES DONNÉES DE TENDANCE L’exercice 7.4 illustre comment un graphique linéaire peut être utilisé pour présenter des données de tendance. Le graphique résume la performance des garçons et des filles pour chacune des quatre années où une évaluation nationale a été réalisée (2004, 2007, 2010, et 2013). EXERCICE 7.4 Présentation des données de tendance dans un graphique linéaire 1. Lancez Excel. Organisez les données dans une feuille de calcul (figure 7.4.A).a 2. Sélectionnez les données et les intitulés à inclure dans le graphique (figure 7.4.A). Dans la barre des outils, sélectionnez Insert – Line – Line with Markersb (première option, deuxième ligne) pour créer le graphique linéaire montré dans la figure 7.4.B. Vous pouvez modifier le style des lignes en cliquant sur l’une d’elles. Sélectionnez Format – Data Series (ou sous Current Selection – Format Selection) – Line Style. Cliquez sur la flèche de la liste Dash Type pour sélectionner le style de ligne souhaité. Cliquez sur Close.c 3. Vous pouvez ajouter des titres aux axes x et y, et au diagramme lui-même, en suivant la procédure décrite dans l’exercice 7.1. Pour ajouter un intitulé à l’axe des y, cliquez sur l’échelle adjacente (210 à 255). Sélectionnez Chart Tools – Layout (ou Chart Layout) – Axis Titles (ou Labels – Axis Titles) – Primary Vertical Axis Title – Rotated Title. Cliquez dans l’espace réservé au titre de l’axe et saisissez Mean Mathematics Score. (suite)


110

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

EXERCICE 7.4 (suite) FIGURE 7.4.A Feuille de calcul Excel avec les scores moyens en mathématiques par sexe, 2004 à 2013

FIGURE 7.4.B Scores moyens en mathématiques par sexe, 2004 à 2013

score moyen en mathématiques

255 250 245 240 235 230 225 220 215 210 2004

2007

2010

2013

année filles

garçons

4. De même, attribuez un intitulé à l’axe horizontal des x (Year). 5. Utilisez l’icône Chart Title pour créer un intitulé (tel que Mean Mathematics Scores by Gender, 2004 à 2013). 6. Copiez le diagramme (figure 7.4.B) dans votre rapport. Puis enregistrez la feuille Excel sous un nom approprié (NAEA DATA ANALYSIS\MY SOLUTIONS\ EXERCISE 7.4.XLS). 7. Dans Excel, sélectionnez File – Close. a. Notez que les données de la figure 7.4.A ne sont pas tirées du fichier de données NATASSESS4.VAR. b. Il s’agit de Marked Line dans certaines versions d’Excel. c. Certaines versions d’Excel utilisent Format – Data Series – Line – Weights & Arrows – Dashed. Cliquez sur la flèche de la liste déroulante pour choisir le style de ligne. Cliquez sur OK.


PRÉSENTATION DES DONNÉES À L’AIDE DE DIAGRAMMES ET GRAPHIQUES

| 111

NOTE 1. Les instructions peuvent quelque peu varier selon la version d’Excel utilisée. Excel pour Mac et Excel pour Windows présentent de légères différences de capacité en fonction de la plateforme et de la version utilisées.


ANNEXE

I.A

ANALYSE DES DONNÉES DE L’ÉVALUATION NATIONALE DES ACQUIS SCOLAIRES : STRUCTURE DU RÉPERTOIRE DES FICHIERS

NAEA DATA ANALYSIS

Répertoire

Sous-répertoire

Fichier

SPSS DATA

NATASSESS NATASSESS4 SCHOOLS

EXERCISE SOLUTIONS

LISTED IN ANNEX I.B

WESVAR UNLABELED DATA

DATA FILE CREATED (ANNEX I.C)

MY WESVAR FILES

EMPTY INITIALLY

WESVAR DATA & WORKBOOKS

LISTED IN ANNEX I.B

MY SPSS DATA

EMPTY INITIALLY

MY SOLUTIONS

EMPTY INITIALLY

113


ANNEXE

I.B

ANALYSE DES DONNÉES DE L’ÉVALUATION NATIONALE DES ACQUIS SCOLAIRES : SOUS-RÉPERTOIRES ET FICHIERS

Sous-répertoires SPSS DATA

EXERCISE SOLUTIONS

Fichiers

Description

NATASSESS.SAV

Ce fichier comprend l’identifiant, les variables contextuelles, les scores, le statut de participation et le poids déterminé par le plan d’échantillonnage de chaque étudiant sélectionné ainsi que l’identifiant de la classe, de l’établissement et de la région.

NATASSESS4.SAV

Ce fichier comprend l’identifiant, les variables contextuelles, les scores, le statut de participation et le poids déterminé par le plan d’échantillonnage de chaque étudiant sélectionné ainsi que l’identifiant de la classe, de l’établissement et de la région. Les couches (zones) jackknife (JK) et les répliques JK (indicateurs) sont également incluses.

SCHOOLS.SAV

Ce fichier comprend le numéro d’identification des établissements, les couches (zones) JK et les répliques (indicateurs) JK. Fusionné avec NATASSESS. SAV pour créer NATASSESS4.SAV.

EXERCISE 1.1.SPV

Statistiques descriptives (moyenne, écart-type) pour Mathss, produites dans SPSS à l’aide de Descriptives. (suite)

115


116

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

Sous-répertoires

Fichiers

Description

EXERCISE 2.1.SPV

Statistiques descriptives pour Mathss (divers) produites dans SPSS à l’aide d’Explore (national).

EXERCISE 2.2.SPV

Statistiques descriptives pour Mathss (divers) produites dans SPSS à l’aide d’Explore (par région).

EXERCISE 3.1.TXT

Statistiques descriptives WesVar pour Mathss.

EXERCISE 3.2.TXT

Score moyen, erreur-type et intervalle de confiance de Mathss (national).

EXERCISE 3.3.TXT

Scores moyens, erreurs-types et intervalles de confiance de Mathss (par région).

EXERCISE 4.1A.TXT

Scores moyens Mathss des élèves avec et sans électricité à la maison.

EXERCISE 4.1B.TXT

Scores moyens Mathss et intervalles de confiance des élèves avec et sans électricité à la maison (deux groupes témoins).

EXERCISE 4.2A.TXT

Scores moyens Mathss (par région).

EXERCISE 4.2B.TXT

Signification statistique des différences de scores moyens Mathss régionaux (plus de deux groupes témoins).

EXERCISE 5.1.TXT

Rangs centiles Mathss (national).

EXERCISE 5.2.TXT

Rangs centiles Mathss (par région).

EXERCISE 5.4-25TH. TXT

Pourcentage d’élèves Mathss en dessous du 25e centile (plus les erreurs-types [ET] et intervalles de confiance [IC]) (par région).

EXERCISE 5.4-50TH. TXT

Pourcentage d’élèves Mathss en dessous du 50e centile (plus les écarts-types et intervalles de confiance) (par région).

EXERCISE 5.4-75TH. TXT

Pourcentage d’élèves Mathss en dessous du 75e centile (plus les erreurs-types et intervalles de confiance) (par région).

EXERCISE 6.1.SPV

Diagramme de dispersion des scores en mise en œuvre de procédures mathématiques et en analyse/résolution de problèmes.

EXERCISE 6.2.TXT

Corrélation entre les scores en mise en œuvre de procédures mathématiques et en analyse/ résolution de problèmes.

EXERCISE 6.3 SUM OF SQUARES.TXT

Régression par somme des carrés et valeur de R-carré, avec une variable indépendante (Books).


ANALYSE DES DONNÉES DE L’ÉVALUATION NATIONALE DES ACQUIS SCOLAIRES

Sous-répertoires

Fichiers

| 117

Description

EXERCISE 6.3 ESTIMATES.TXT

Coefficient de régression estimé, avec une variable indépendante (Books).

EXERCISE 6.3 TESTS. TXT

Régression, tests de signification, avec une variable indépendante (Books).

EXERCISE 6.4 ESTIMATES.TXT

Coefficients de régression estimés, avec une variable indépendante (Books).

EXERCISE 6.5 CORRELATIONS.TXT

Intercorrélations entre trois variables (Books, Parented, Distance).

EXERCISE 6.6 SUM OF SQUARES.TXT

Régression par somme des carrés et valeur de R-carré (pour trois variables indépendantes).

EXERCISE 6.6 ESTIMATES.TXT

Coefficients de régression estimés (pour trois variables indépendantes).

EXERCISE 6.6 TESTS. TXT

Régression, tests de signification (pour trois variables indépendantes).

EXERCISE 7.1.XLS

Diagramme : Pourcentage d’élèves à chaque niveau de compétence en mathématiques (national).

EXERCISE 7.2.XLS

Diagramme : Pourcentage d’élèves à chaque niveau de compétence en mathématiques (par région).

EXERCISE 7.3.XLS

Graphique linéaire : Scores moyens Mathss et intervalles de confiance de 95 % (par région).

EXERCISE 7.4.XLS

Graphique linéaire : Scores moyens Mathss (par sexe).

WESVAR UNLABELED DATA

NATASSESS4.VAR (NATASSESS4.LOG)

Ce fichier comprend l’identifiant, les variables contextuelles, les scores, le statut de participation et le poids déterminé par le plan d’échantillonnage de chaque étudiant sélectionné ainsi que l’identifiant de la classe, de l’établissement et de la région, les couches (zones) jackknife (JK) et les répliques JK (indicateurs). Les noms des variables et les variables créées ne sont pas inclus.

MY WESVAR FILES

Le sous-répertoire est vide au début. L’utilisateur y enregistre les fichiers de données et les classeurs WesVar créés pendant l’exécution des exercices des chapitres 3 à 6. (suite)


118

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

Sous-répertoires

Fichiers

WESVAR DATA NATASSESS4.VAR & WORKBOOKS (NATASSESS4.LOG)

CHAPTER 3 WORKBOOK.WVB CHAPTER 4 WORKBOOK.WVB CHAPTER 5 WORKBOOK.WVB CHAPTER 6 WORKBOOK.WVB MY SPSS DATA

Le sous-répertoire est vide au début. L’utilisateur y enregistre les fichiers de données SPSS nouveaux ou modifiés.

MY SOLUTIONS

Le sous-répertoire est vide au début. L’utilisateur y enregistre toutes les solutions des exercices.

Description Ce fichier comprend l’identifiant, les variables contextuelles, les scores, le statut de participation et le poids déterminé par le plan d’échantillonnage de chaque étudiant sélectionné ainsi que l’identifiant de la classe, de l’établissement et de la région, les couches (zones) jackknife (JK) et les répliques JK (indicateurs). Certains noms de variables et variables créées sont également inclus. Les fichiers sont des classeurs remplis pour exécuter les exercices des chapitres 3 à 6.


ANNEXE

I.C

OUVERTURE D’UN FICHIER SPSS DANS WESVAR

Une fois que vous avez préparé dans SPSS l’ensemble de données d’une évaluation nationale, avec les données des items de test et des questionnaires ainsi que les poids d’enquête calculés, vous devrez modifier certaines données avant de transférer votre fichier dans WesVar. L’ensemble d’instructions qui suit vous guide dans la création des poids jackknife pour un plan d’échantillonnage à deux degrés. Vous pouvez trouver des informations plus détaillées sur le jackknifing dans le volume 3 de cette série (Dumais et Gough, 2012b, annexes IV.C et IV.D). SPSS est utilisé pour créer l’information d’échantillonnage dont WesVar a besoin pour créer les poids des répliques (poids de rééchantillonnage) pour l’analyse des données de l’évaluation nationale. Les poids des répliques étant définis par établissement, vous devez créer un enregistrement pour chaque établissement participant. Cet enregistrement doit comprendre le Schoolid de l’établissement. Si vous n’avez pas de fichier contenant un identifiant par école, vous devez utiliser la procédure suivante pour en créer un. Si vous n’avez pas encore transféré NATASSESS.SAV vers MY SPSS DATA, vous devez le copier dans MY SPSS DATA à partir de

119


120

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

SPSS DATA. (Vérifiez qu’il s’agit bien de NATASSESS.SAV et non de NATASSESS4.SAV.) 1. Accédez à NAEA DATA ANALYSIS\MY SPSS DATA et ouvrez le fichier NATASSESS.SAV. Vous pouvez le faire en double-cliquant sur le nom du fichier. Si celui-ci ne se trouve pas dans MY SPSS DATA, ouvrez-le dans NAEA DATA ANALYSIS\SPSS DATA et enregistrez-le dans NAEA DATA ANALYSIS\MY SPSS DATA en utilisant File – Save As. 2. Dans la barre d’outils SPSS, sélectionnez Data – Aggregate. Déplacez Schoolid vers Break Variable(s). Déplacez MATHRS vers Aggregated Variables (figure I.C.1). Sous Save, sélectionnez Write a new data file using only the aggregated variables. Sélectionnez File (juste en dessous). Sélectionnez le répertoire NAEA DATA ANALYSIS\MY SPSS DATA où le nouveau fichier sera enregistré, sous le nom SCHOOLS. 3. En dessous d’Options for Very Large Datasets, cochez Sort file before aggregating. Cliquez sur OK. 4. Allez vers NAEA DATA ANALYSIS\MY SPSS DATA et ouvrez Schools. Activez Variable View dans le bas de l’écran, et supprimez la ligne Mathrs_Mean en utilisant Edit – Clear. Sélectionnez Data – Sort Cases, et déplacez Schoolid vers Sort by, sélectionnez Ascending, puis cliquez sur OK. (Pour quitter l’écran SPSS des résultats, sélectionnez Window dans la barre d’outils, puis l’ensemble de données voulu.) 5. À cette étape, la valeur 1 ou 2 est attribuée à chaque établissement participant.1 Sélectionnez Transform – Compute Variable, puis saisissez Jkzone sous Target Variable. Ensuite, introduisez RND($Casenum/2) sous Numeric Expression et cliquez sur OK. Sélectionnez Transform – Compute Variable. Sélectionnez Reset. Puis saisissez Randompick sous Target Variable et RV.Uniform(0,1) sous Numeric Expression. Cliquez sur OK. À ce stade, dans Data View, vous devez voir 120 établissements classés en 60 paires numérotées de 1 à 60, chaque établissement ayant aléatoirement reçu un code 0 ou 1. Si ces codes aléatoires sont affichés sous la forme de zéro et un, augmentez le nombre de décimales à partir de l’onglet Variable View. Les conditions sont maintenant réunies pour créer des répliques JK.


OUVERTURE D’UN FICHIER SPSS DANS WESVAR

| 121

FIGURE I.C.1 Agrégation des données dans SPSS

6. Les étapes 5 et 6 attribuent une valeur 1 ou 0 à chaque établissement d’une paire (zone). Sélectionnez Data – Sort Cases, puis déplacez Jkzone et Randompick vers Sort by. Cliquez sur Ascending, puis sur OK. Maintenant, sélectionnez Data – Identify Duplicate Cases, et déplacez Jkzone vers Define matching


122

7.

8.

9.

10.

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

cases by. Dans Variables to Create, cochez Indicator of Primary Cases, puis cochez Last case in each group is primary (PrimaryLast). Cliquez sur OK. WesVar attendant une numérotation des répliques à partir de 1 et non de 0, Transform – Recode into Different Variables doit être utilisé pour modifier les codes des répliques. Déplacez PrimaryLast vers Input Variable, et saisissez Jkindic dans Output Variable Name.2 Si vous le souhaitez, introduisez un intitulé. Cliquez sur Change, puis sur Old and New Values. Sous Old Value, cliquez sur Value et saisissez 0 sous Value. Sous New Value (à droite), saisissez 1, puis cliquez sur Add. Sous Old Value, cliquez sur All other values. Ensuite, sous New Value, saisissez 2. Cliquez sur Add, Continue, puis OK. Toutes les valeurs 0 de PrimaryLast ont été transformées en 1 dans Jkindic, et toutes les valeurs 1 sont devenues 2. (Notons que l’apparition ou non sur votre écran des valeurs réelles 0 et 1 pour la variable PrimaryLast dépend des paramètres de vos données SPSS.) Choisissez Data – Sort Cases dans le menu. Sélectionnez Reset. Déplacez Schoolid vers Sort by, cliquez sur Ascending, puis sur OK. Ouvrez Variable View, et supprimez les variables RANDOM PICK et PrimaryLast. Sélectionnez File – Save pour réenregistrer le fichier de données SCHOOLS. Ne fermez pas le fichier. À ce stade, les codes de la zone JK et de l’indicateur JK (réplique) ont été attribués aux établissements participants. Cette information doit maintenant être jointe à NATASSESS.SPV, le fichier contenant les données et les poids d’enquête. Ouvrez le fichier NAEA DATA ANALYSIS\MY SPSS DATA\ NATASSESS.SAV. Sélectionnez Data, Sort Cases, et déplacez Schoolid vers Sort by. Cliquez sur Ascending, puis sur OK. Les variables Jkzone et Jkindic (actuellement dans le fichier SCHOOLS.SAV) sont maintenant jointes au fichier de données NATASSESS.SAV. Toujours dans NATASSESS.SAV, sélectionnez Data – Merge files – Add variables. Choisissez SCHOOLS.SAV dans Open Dataset, puis cliquez sur Continuer. Cochez la case à côté de Match cases on key variables in sorted files. Sélectionnez Schoolid et déplacez-le vers Key Variables (figure I.C.2). Sélectionnez Non-active dataset is keyed table. Cliquez sur OK.


OUVERTURE D’UN FICHIER SPSS DANS WESVAR

| 123

FIGURE I.C.2 Ajout de variables à un fichier SPSS

11. Le message Keyed Match will fail if data are not sorted in ascending order of Key Variables vous avertit que les données doivent être triées par ordre croissant des Key Variables. Si les deux fichiers (NATASSESS et SCHOOLS) sont bien triés par Schoolid, cliquez sur OK. Dans NATASSESS.SAV, ouvrez Variable View. Les variables Jkzone et Jkindic sont visibles vers la fin de l’ensemble de données. Sélectionnez Save As et sauvegardez NATASSESS. SAV dans NAEA DATA ANALYSIS\MY SPSS DATA. 12. Fermez les fichiers SCHOOLS.SAV et NATASSESS4.SAV ouverts. 13. NATASSESS.SAV est maintenant importé dans WesVar et transformé en un fichier de données WesVar. Lancez WesVar.


124

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

Cliquez sur New WesVar Data File. Sous Input Database, sélectionnez NAEA DATA ANALYSIS\MY SPSS DATA\ NATASSESS4.SAV. Cliquez sur Open. Vous verrez le message Create extra formatted variables (créer des variables formatées supplémentaires). Cliquez sur Done. 14. Dans Source Variables, sélectionnez la variable Wgtpop (poids lié à la représentation dans la population). Sélectionnez Full Sample. Déplacez Wgtpop vers Full Sample à l’aide de la flèche >. Sélectionnez ensuite Studid dans Source Variables. Cliquez sur ID (à droite) et déplacez Studid vers ID, de nouveau à l’aide de la flèche >. Sélectionnez maintenant les variables restantes dans Source Variables. Choisissez Variables, et cliquez sur les flèches >> pour déplacer les variables restantes vers Variables (figure I.C.3). 15. Enregistrez votre fichier de données (File – Save As) dans NAEA DATA ANALYSIS\MY WESVAR FILES sous le nom NATASSESS4.VAR. (Vous pouvez utiliser le même nom parce FIGURE I.C.3 Liste des variables disponibles dans le fichier de données WesVar


OUVERTURE D’UN FICHIER SPSS DANS WESVAR

| 125

que le format et l’extension sont uniques à WesVar et que ces fichiers ne seront donc pas confondus avec les originaux SPSS.) 16. Avant le calcul d’un tableau, WesVar doit créer les poids des répliques pour déterminer l’erreur d’échantillonnage. Toujours dans le même écran, cliquez sur le bouton d’échelle ou sélectionnez Data – Create weights. À partir de Source Variables, déplacez Jkzone vers VarStrat, et Jkindic vers VarUnit. Cochez JK2 sous Method (figure I.C.4). Cliquez sur OK. Le message This operation will create a new VAR file. You will be asked to specify a file name vous avertit qu’un nouveau fichier VAR va être créé et que vous devez lui donner un nom. Cliquez sur OK. Enregistrez le fichier dans NAEA DATA ANALYSIS\MY WESVAR FILES sous le nom NATASSESS4.VAR. Vous pouvez être invité à confirmer cet enregistrement (message Confirm Save As). Cliquez sur Yes. WesVar a ajouté les poids de rééchantillonnage pour l’erreur d’échantillonnage estimée et le fichier ressemble maintenant à la figure I.C.5. FIGURE I.C.4 Création de poids dans WesVar


126

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

FIGURE I.C.5 Poids de rééchantillonnage créé par WesVar

17. Pour fermer le fichier de données WesVar, sélectionnez File – Close. Vous êtes maintenant prêt à exécuter les analyses du chapitre 3 à l’aide du fichier de données WesVar, NATASSESS4.VAR. Notons que ce fichier est le même que celui prêt à l’emploi, NATASSESS4.VAR figurant dans NAEA DATA ANALYSIS\ WESVAR DATA & WORKBOOKS.

NOTES 1. Dans l’ensemble de données actuel, le nombre d’unités primaires d’échantillonnage (ici, les établissements) est pair. S’il avait été impair, la dernière zone jackknife (JK) aurait été composée de trois établissements (1, 2 et 3). Lorsque cela se produit, il faut sélectionner JK comme méthode d’analyse (étape 15) parce JK2 requiert un nombre pair d’unités primaires d’échantillonnage. 2. Jkindic est le nom de la variable correspondant à l’indicateur jackknife.


PA RT I E

II

ANALYSE DES ITEMS ET DES TESTS Fernando Cartwright

127


8

CHAPITRE

INTRODUCTION À IATA

Ce chapitre décrit les exigences en matière de données du logiciel IATA (Item and Test Analysis) d’analyse des items et tests, et donne un aperçu des types d’information fournis. Il comprend une introduction à l’interface IATA, notamment les écrans des tâches, le menu principal et la navigation au sein de la séquence des tâches (workflow).

INSTALLATION D’IATA L’utilisation d’IATA requiert un ordinateur avec la configuration système minimale recommandée pour Windows XP (SP3) ou un système d’exploitation Windows plus récent, tel que Windows Vista, Windows 7 ou Windows 8. Si une version antérieure d’IATA est déjà installée sur l’ordinateur, elle doit être désinstallée et le répertoire des données de l’échantillon IATA doit être supprimé du bureau avant de démarrer la nouvelle installation. Pendant celle-ci, une mise à jour du système peut être demandée à l’aide de la version la plus récente du cadre .NET de Microsoft (.NET 4 ou ultérieure). Le cadre .NET est une composante standard du système d’exploitation Windows, qui est normalement mise à jour de façon automatique par Windows. Toutefois, 129


130

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

si l’accès à Internet est peu fréquent ou si la fonction de mise à jour automatique de Windows est désactivée, le système d’exploitation peut être périmé. Lorsqu’IATA est installé à partir d’un CD ou d’une clé USB, le fichier d’installation .NetFx40_Full_x86_x64.exe s’y trouve, dans le même répertoire que le fichier IATASETUP.exe. La mise à jour peut également être téléchargée et exécutée à partir de l’URL http:// www.microsoft.com/en-us/download/details.aspx?id=17718. Pour installer IATA, vous devez être connecté en tant qu’administrateur système ou qu’utilisateur autorisé à installer le logiciel. Ouvrez le CD, puis le répertoire IATA et double-cliquez sur le fichier IATASETUP.exe. Copiez ce fichier et collez-le dans le bureau Windows, auquel vous pouvez accéder en cliquant sur l’icône du bureau placée dans le coin inférieur droit de la barre des tâches Windows, ou en ouvrant l’Explorateur et en double-cliquant sur l’icône du bureau. Un message peut vous demander d’autoriser IATASETUP à accéder à votre ordinateur ou à y apporter des modifications. Vous devez cliquer sur Allow ou sur Yes pour continuer. Ensuite, vous verrez l’écran d’accueil de l’assistant d’installation, qui confirme que vous êtes en train d’installer IATA. À tout moment de l’installation, vous pouvez cliquer sur Cancel pour arrêter l’installation, auquel cas, aucun changement ne sera apporté à votre ordinateur. Cliquez sur Next>> pour continuer. Lisez l’accord contractuel et cochez I accept the agreement pour confirmer que vous souscrivez à ses conditions. Poursuivez le processus d’installation en cliquant sur Next>>. Vous pouvez conserver les paramètres d’installation par défaut ou les modifier si vous avez des répertoires différents pour vos fichiers ou menus. Avant le lancement de l’installation, un résumé des spécifications de l’installation s’affiche. Cliquez sur Install. Une fois l’installation terminée, un écran de confirmation vous est présenté. Si vous souhaitez exécuter immédiatement IATA, cochez la case Launch IATA. Cliquez sur Finish pour quitter l’assistant d’installation.

DONNÉES DE L’ÉVALUATION L’analyse des évaluations produit et utilise deux grands types de données : les données des réponses et les données des items.


INTRODUCTION À IATA

| 131

Chaque apprenant produit des données sur les réponses quand il répond aux questions d’un test (une série spécifique de questions qui évaluent un domaine de compétence ou de connaissance). Les questions d’un test s’appellent des items. Elles peuvent être à choix multiple, à réponse courte, ouvertes ou être des tâches à exécuter. L’analyse ou l’examen des items détermine leurs propriétés statistiques ou cognitives, dont l’enregistrement produit les données des items. Chaque ligne décrit les caractéristiques d’un participant au test dans un fichier des réponses, et les caractéristiques d’un item dans un fichier des items. IATA peut lire et écrire toute une série de formats de tableaux de données communs (tels qu’Access, Excel, SPSS [Progiciel de statistiques pour les sciences sociales], des fichiers textes délimités) à condition qu’ils soient correctement structurés. Si la structure des données n’est pas la bonne, IATA n’arrivera pas à effectuer les analyses. Les formats compatibles avec les bases de données, telles qu’Access ou SPSS, s’occupent de la plupart des questions de structuration des données. Lorsque les données sont stockées dans un format moins restrictif, tel qu’Excel ou un fichier texte, les conventions suivantes doivent être respectées : • Le nom des variables doit apparaître dans la cellule surmontant chaque colonne (appelée en-tête). Chaque colonne contenant des données doit avoir un en-tête. Le nom de chaque variable doit être unique parmi les autres variables du fichier. Le nom d’une variable doit commencer par une lettre et ne peut contenir aucun espace. • La plage de données est le rectangle composé des cellules contenant les données. Elle commence par le nom de la première variable apparaissant dans le fichier de données et se termine avec la dernière cellule de la dernière ligne contenant des données. Le rectangle des cellules formant la plage de données ne peut contenir aucune ligne ou colonne vide. • La plage de données doit commencer avec la première cellule de la feuille de calcul ou du fichier. Dans Excel, cette cellule est désignée par A1. Dans les fichiers textes, il s’agit de la position du curseur à l’angle supérieur gauche du fichier texte.


132

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

Les deux exemples présentés dans la figure 8.1 montrent des formats incorrects et corrects. Dans le format incorrect (a), il y a une ligne vide au-dessus du rectangle des données et une colonne vide à sa gauche. Le rectangle contient également des lignes et colonnes vides, et une des colonnes contenant des données n’a pas d’en-tête. Dans le format correct (b), toutes les données sont regroupées dans un seul rectangle dans la partie supérieure gauche de la feuille de calcul et aucune ligne ou colonne n’est vide.

FIGURE 8.1 Exemples de formatage incorrect et correct des données a. Format incorrect : Lignes et colonnes vides à l’intérieur et autour des données A

B

C

D

E

F

G

Var_A

Var_B

Var_C

4

1

1

1

1

1

5

2

2

2

2

2

6

3

3

3

3

3

7

4

4

4

4

4

5

5

5

5

5

1 2

Var_E

3

8 9

b. Format correct : Plage de données dans le coin supérieur gauche, sans ligne ni colonne vide A

B

C

D

E

1

Var_A

Var_B

Var_C

Var_D

Var_E

2

1

1

1

1

1

3

2

2

2

2

2

4

3

3

3

3

3

5

4

4

4

4

4

6

5

5

5

5

5

7 8 9

F

G


INTRODUCTION À IATA

| 133

Données des réponses Les données des réponses comprennent les réponses données par chaque élève à chaque item de test. L’importation des résultats du test dans le fichier des réponses permet une correction automatisée. Celle-ci requiert que les réponses des élèves aux items soient codées. Par exemple, si la réponse correspond à une question à choix multiple, la donnée enregistrée est le code de l’option choisie par l’élève (par exemple, A, B, C, D). IATA transformera les réponses codées en scores en utilisant la clé de codage saisie manuellement ou fournie sous la forme d’un fichier des clés de codage. D’autres informations utiles à l’analyse des résultats du test peuvent être stockées dans le fichier des réponses. Citons, à titre d’exemple, des données démographiques telles que l’âge, l’année d’études, le sexe, l’établissement et la région. D’autres informations utiles peuvent être recueillies dans des questionnaires (destinés aux élèves et aux enseignants, par exemple) ou être obtenues à partir de dossiers administratifs. Si un échantillon stratifié d’élèves a été utilisé, le poids d’échantillonnage de chaque élève doit figurer dans le fichier. Chaque élève doit avoir un identifiant unique. Si aucun identifiant unique n’est fourni, IATA en attribue automatiquement dans l’ordre d’enregistrement. Lorsque les résultats doivent être liés à d’autres sources de données, telles que des enquêtes de suivi ou des dossiers administratifs, il est toutefois préférable d’utiliser un identifiant prédéfini, tel que le nom ou le numéro de l’élève, pour faciliter la future liaison des ensembles de données. Des codes doivent être attribués à toutes les réponses. Pour les questions à choix multiple, cette procédure est simple, parce que chaque option est déjà codée comme bonne ou mauvaise. Pour les items ouverts, un barème de correction est nécessaire pour le codage des réponses des élèves à l’aide d’un cadre commun. Les items ouverts peuvent être codés comme corrects ou incorrects, ou en attribuant un crédit partiel à différentes réponses. Un item à crédit partiel a plus d’un score supérieur à zéro. Les réponses aux questions ouvertes doivent avoir été préalablement codées lors de la préparation des données des réponses. Les volumes 2 et 3 de cette série décrivent les procédures de codage des items de test (Anderson et Morgan, 2008 ;


134

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

Greaney et Kellaghan, 2012). La plupart des analyses requièrent qu’une clé de codage soit chargée dans IATA pour la correction des items. Une clé de codage est une liste de codes indiquant la ou les bonnes réponses à chaque item de test. La clé de codage peut être importée sous la forme d’un fichier de données ou saisie manuellement. Si l’analyse utilise des paramètres d’items incorporés (par exemple, pour relier différentes versions d’un test), ces paramètres doivent être inclus dans le fichier de la clé de codage ; ils ne peuvent être saisis manuellement (voir « Données des items » ci-dessous). Traitement des données manquantes et omises Des données sont manquantes lorsque, pour un élève, il n’y a pas de réponse à un item de test. Lorsque cela se produit, au lieu de laisser le champ vide, on utilise un code indiquant la raison de l’absence de réponse. Il existe deux types de données manquantes : les réponses manquantes et les questions omises. Un code réponse manquante est attribué lorsque l’élève n’a fourni aucune réponse à une question qui lui était posée. Les réponses manquantes sont considérées comme fausses. Par contre, le code question omise est utilisé lorsqu’un item n’a pas été administré aux élèves, par exemple, quand un plan de rotation des carnets est utilisé dans une évaluation nationale. En fonction des conditions d’administration du test ou du traitement des données, il faut décider si les réponses illisibles ou inappropriées (par exemple, la sélection de deux options à choix multiple au lieu d’une seule) seront traitées comme des données manquantes ou omises. En général, lorsque l’absence de données est le résultat d’une erreur de l’élève, le code est traité comme une réponse manquante et celle-ci est jugée incorrecte. Par contre, si cette absence résulte d’un problème dans le traitement des données (par exemple, une imprécision dans la lecture optique de la fiche de correction, qui n’a pas été vérifiée), le code est traité comme une question omise. Un autre cas d’utilisation du code question omise est l’application d’un plan de rotation équilibrée des carnets de test. Ces plans prévoient la distribution aléatoire d’échantillons d’items équivalents à différents élèves, afin que tous ne répondent pas aux mêmes items (voir Anderson et Morgan, 2008). Ce type de plan permet de couvrir


INTRODUCTION À IATA

| 135

complètement la matière, tout en limitant la durée des épreuves. Dans un plan de rotation des carnets, un code question omise est attribué à tous les items de l’élève, à l’exception de ceux contenus dans le carnet qu’il a reçu. Le code question omise n’est normalement pas attribué lorsque tous les élèves doivent répondre à tous les items. Les conventions courantes utilisent des valeurs spécifiques pour les différents types de non-réponse (voir Freeman et O’Malley, 2012 pour plus d’information sur les codes réponse). Les valeurs suivantes sont couramment utilisées : • 9 pour une réponse manquante, lorsque l’élève n’a pas répondu à un item ; • 8 pour une réponse impossible à noter, qui se produit généralement lorsque l’élève donne plusieurs réponses à une question à choix multiple ou lorsque la réponse à un item ouvert est illisible ; • 7 pour les items omis ou non présentés, comme dans un plan de rotation des carnets. Quels que soient les codes spécifiques utilisés pour la non-réponse, il faut indiquer pour chacun si IATA doit le traiter comme une réponse manquante ou une question omise. Dénomination des items Il est important d’attribuer un nom unique à chaque item d’un programme d’évaluation nationale (voir Anderson et Morgan, 2008 ; Freeman et O’Malley, 2012). Toutes les analyses statistiques effectuées sur un item de test doivent être clairement liées à son nom ou à son intitulé. Si un item est répété dans plusieurs cycles d’une évaluation nationale, il doit, pour chacun, conserver le même nom dans les fichiers de données. Par exemple, un item de mathématiques utilisé pour la première fois en 2009 pourrait porter le nom M003, pour indiquer qu’il s’agit du troisième item du test de 2009. S’il est une nouvelle fois utilisé dans un test en 2010, il doit conserver le nom M003, quel que soit l’endroit où il apparaît dans le test. La dénomination des items en fonction de leur position dans un test peut entraîner de la confusion lorsque les items sont réutilisés. C’est pourquoi il vaut mieux attribuer des noms permanents aux items dès leur


136

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

conception plutôt que lorsqu’ils sont utilisés pour la première fois dans une évaluation nationale. L’utilisation de noms permanents facilite également la liaison des résultats de différents tests. Lorsqu’IATA estime les liens statistiques entre plusieurs tests, il utilise le nom des items dans la procédure de liaison. Si le nom d’un item correspond à des items différents dans les tests à relier, les résultats de la liaison ne seront pas exacts. Même s’il est possible de renommer les items pour permettre leur liaison, le maintien de noms uniques depuis le début est néanmoins plus simple et moins susceptible d’entraîner des erreurs. Variables réservées par IATA Pendant l’analyse des données des réponses, IATA calcule une série de variables de travail ou de résultat. Les noms de ces variables sont réservés et ne peuvent être utilisés comme noms d’items de test ou de variables des questionnaires. Ces variables ajoutées par IATA au fichier des données de test corrigé sont énumérées dans le tableau 8.1. En plus de ne pas utiliser ces noms spécifiques, il faut également éviter d’utiliser des noms contenant le symbole @, qui est réservé au traitement des items à crédit partiel, c’est-à-dire les items de test dont le score peut prendre plus d’une valeur supérieure à zéro.

Données des items IATA produit et utilise des fichiers de données des items ayant un format spécifique. Le fichier de données des items contient toute l’information requise pour l’analyse statistique des items et, optionnellement, les paramètres utilisés pour décrire les propriétés statistiques des items. La banque de données des items produite ou utilisée par IATA contient les variables énumérées dans le tableau 8.2. Le tableau 8.3 donne des exemples tirés d’un fichier de données des items contenant l’information relative à cinq items de sciences appelés C1Sci31, C1Sci32, C1Sci33, C1Sci34 et C1Sci35. Notons que l’item C1Sci35 ne contient aucune donnée dans les colonnes intitulées a, b, c et Level. Comme indiqué dans le tableau, Name et Key sont les seules variables obligatoires. Si les paramètres a, b ou c ne sont pas fournis, ils seront estimés pendant l’analyse. De nombreuses


TABLEAU 8.1 Variables produites ou utilisées par IATA pour décrire la compétence des élèves et leur performance aux tests Nom du score

Description

XWeight

Poids déterminé par le plan d’échantillonnage de l’élève, utilisé pendant l’analyse (s’il n’est pas fourni, sa valeur est égale à 1 pour tous les élèves).

Missing

Nombre d’items omis pour un élève.

PercentScore

Score en pourcentage correspondant au nombre d’items auxquels un élève a répondu correctement, exprimé en pourcentage du nombre total d’items administrés à l’élève (en excluant les questions omises).

PercentError

Erreur de mesure du score en pourcentage. Cette estimation est spécifique à chaque élève, sa valeur dépend du score en pourcentage et du nombre d’items auxquels un élève a répondu.

Percentile

Rang centile (un nombre compris entre 0 et 100) donnant, pour chaque élève, le pourcentage des autres élèves ayant des scores inférieurs.

RawZScore

Score en pourcentage transformé pour obtenir une moyenne de 0 et un écart-type de 1 au sein de l’échantillon.

ZScore

Score équivalent à la distribution normale du rang centile, également appelé score dans la courbe en cloche. Alors que la distribution de RawZScore dépend de la distribution des scores non omis en pourcentage, la forme de la distribution de Zscore tend, elle, à se rapprocher plus parfaitement d’une cloche.

IRTscore

Estimation de la compétence de l’élève. Ce score a généralement une moyenne égale à 0 et un écart-type de 1. Il facilite la généralisation au-delà d’un échantillon spécifique d’items, parce que son estimation tient compte des propriétés statistiques des items de test.a

IRTerror

Erreur de mesure d’IRTscore.

IRTskew

Asymétrie de l’estimation de la compétence, indiquant si le test convient mieux pour mesurer la limite inférieure ou supérieure de la compétence des élèves. (Par exemple, un test facile peut déterminer précisément si les élèves ont atteint un niveau de compétence minimum, mais ne donne pas une estimation exacte des niveaux de compétence supérieurs.)

IRTkurt

Kurtosis (aplatissement) de l’estimation de la compétence, décrivant la précision de l’estimation pour un niveau d’erreur donné. (Par exemple, pour deux scores ayant la même erreur de mesure, celui ayant le plus grand kurtosis est plus précis.)

TrueScore

Score en pourcentage estimé à partir d’IRTscore. Il est préférable au score en pourcentage brut, car il corrige les différences d’erreur de mesure entre les items. Il est donné par la probabilité moyenne d’avoir une bonne réponse à chaque item, pour un score IRT de l’élève et des paramètres des items donnés.

Level

Estimation du niveau de compétence attribué à un élève dans le cadre d’une procédure de normalisation. (Si aucune procédure de normalisation n’est exécutée, la valeur 1 est attribuée par défaut à tous les élèves.)

Remarque : IRT = théorie de la réponse à l’item (TRI). a. D’autres options TRI de définition de l’échelle existent dans les fonctions avancées d’IATA. Voir le guide d’installation figurant dans le CD d’accompagnement.

137


138

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

TABLEAU 8.2 Variables d’un fichier de données des items Variable

Description

Name

(OBLIGATOIRE) Nom unique de chaque item de test

Key

(OBLIGATOIRE) Information utilisée pour attribuer un score numérique à la réponse à chaque item. Elle est soit un code unique correspondant à la bonne réponse soit une plage limitée de valeurs contenant les réponses acceptables et leurs scores numériques.

a

(FACULTATIF) premier des trois paramètres de l’item, décrivant comment la performance à un item de test est liée à la compétence dans le domaine de performance. Appelé pente ou paramètre de discrimination

b

(FACULTATIF) deuxième paramètre de l’item, appelé position ou paramètre de difficulté

c

(FACULTATIF) troisième paramètre de l’item, appelé paramètre de pseudo-chancea

Level

(FACULTATIF) niveau de compétence précédemment attribué à un item sur la base de la spécification initiale de l’item et de la correction par des experts (les valeurs doivent être des nombres naturels, commençant par 1)

Content

(FACULTATIF) code ou texte décrivant le sous-domaine du programme de cours. Également connu comme la filière, sur laquelle chaque item est le plus fortement aligné

a. L’utilisation du paramètre c pour décrire les items peut entraîner un mauvais fonctionnement de certaines fonctions, telles que l’équivalence. Dans la plupart des cas, les items sont plus utiles si la valeur du paramètre c est égale ou fixée à zéro. Le modèle à trois paramètres ne doit être utilisé que par les utilisateurs experts qui sont conscients de ses lacunes. L’estimation et l’utilisation du paramètre c sont assurées par les fonctions avancées d’IATA. L’inscription à IATA, qui est gratuite, permet d’y accéder. Pour les instructions d’inscription, consulter le guide d’installation fourni dans le CD d’accompagnement.

TABLEAU 8.3 Exemple extrait d’un fichier de données des items Name

a

b

c

Key

Level

Content

C1Sci31

0,34

0,83

0,01

3

3

Raisonnement scientifique

C1Sci32

0,46

0,40

0,12

4

2

Physique

C1Sci33

0,32

0,31

0,06

3

2

Physique

C1Sci34

0,18

0,75

0,16

1

3

Biologie

C1Sci35

5

Environnement

situations peuvent nécessiter l’introduction dans IATA d’un fichier de données des items ne contenant pas ces paramètres. Le scénario le plus courant est celui où les données des réponses aux items n’ont jamais été analysées auparavant. Dans ce cas, le fichier contenant la banque de données des items est simplement utilisé comme une clé


INTRODUCTION À IATA

| 139

de codage. Un autre scénario est celui où on souhaite fixer la valeur des paramètres de certains items déjà estimée lors d’une précédente analyse des données, au lieu de la faire recalculer par IATA. Dans ce cas, on peut laisser a, b et c vides dans les items pour lesquels on souhaite estimer une nouvelle valeur pour les paramètres. Les valeurs pour Level et Content peuvent être saisies manuellement dans l’interface IATA ou laissées vides. Le fichier de données des items contient également d’autres variables. Par exemple, l’information supplémentaire généralement stockée avec les données des items comprend l’énoncé de la question dans la banque des items, une donnée statistique donnant le nombre de fois où l’item a été utilisé, et une liste des tests où l’item apparaît. IATA n’utilisera toutefois pas d’autres variables que les sept énumérées dans le tableau 8.3. L’équipe d’évaluation nationale peut utiliser des informations issues de n’importe quelle source, pourvu qu’elles contiennent les données des items décrites dans le tableau 8.2. Par exemple, les évaluations nationales peuvent obtenir l’autorisation d’utiliser les items d’une évaluation à grande échelle telle que celles administrées par l’Association internationale pour l’évaluation du rendement scolaire, notamment les TIMSS (Tendances de l’enquête internationale sur les mathématiques et les sciences) et le PIRLS (Programme international de recherche en lecture scolaire) (http://timss.bc.edu/). Lorsque des items tirés d’évaluations à grande échelle existantes sont inclus dans une évaluation nationale, les paramètres de ces items peuvent être utilisés pour créer un fichier de données des items à importer dans IATA. Format des clés de codage Dans la colonne intitulée Key du fichier de données d’une banque d’items, il faut fournir à IATA l’information qu’il peut utiliser pour déterminer le score de chaque item. Dans le cas le plus simple, pour les questions à choix multiple à bonne réponse unique, le code alphanumérique correspondant à cette réponse doit être spécifié. La valeur tient compte des majuscules, ce qui signifie, par exemple, que si le code de la bonne réponse est un A majuscule, il doit être spécifié comme tel dans la clé de codage ; si un a


140

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

minuscule est introduit, toutes les réponses à l’item introduites en majuscules seront notées incorrectes. Dans de rares cas, pendant le processus d’examen d’un test, on peut décider qu’un item a plus d’une bonne réponse. Pour spécifier plus d’une valeur dans une clé de codage, il faut saisir la liste des valeurs correctes, séparées par des virgules et sans espace entre les valeurs ou après les virgules. Par exemple, si les réponses A et C sont toutes les deux correctes, la valeur de la clé pour cet item doit être A,C.1 Format des données pour les items à crédit partiel Les items à crédit partiel (ou à réponse graduée) sont des items de test pour lesquels plus d’une valeur de score est possible. Par exemple, au lieu d’avoir un score 0 ou 1, un item pour lequel différents niveaux d’exactitude sont autorisés peut avoir un score 0, 1 ou 2, 0 représentant une tentative de réponse, 1 une réponse partiellement correcte et 2 une réponse parfaite. Pour tenir compte des différents scores, la clé de codage doit comprendre chaque score supérieur à 0. Si le barème de codage utilisé pour des items à crédit partiel utilise des scores qui sont tous supérieurs à 0, alors l’information relative au score le plus bas ne doit pas être saisie dans la clé de codage. Par exemple, si les scores possibles sont 1, 2 et 3, la clé de codage ne doit fournir de l’information que pour les scores 2 et 3. Le format d’une clé de codage à crédit partiel se présente comme suit : <score 1>:<liste de valeurs 1>;<score 2>:<liste de valeurs 2> ; […] <score n>:<liste de valeurs n>. Par exemple, pour un item à crédit partiel ayant trois réponses codées A, B et C, dont les scores sont respectivement 1, 2 et 3, la clé de codage doit être saisie comme suit : 1:A;2:B;3:C. Si un item à crédit partiel a déjà été analysé, il aura un plus grand nombre de paramètres qu’un item de test ordinaire. Le paramètre b de chaque score aura une valeur distincte, tandis que celle du paramètre a sera la même pour tous les scores. Les données de ces items doivent être saisies dans un format spécial. En plus de spécifier la clé de codage complète pour l’entrée principale, il faut également créer une nouvelle entrée pour chaque valeur du score (sauf pour la valeur la plus basse), comme si chaque score était un item de test distinct. Les paramètres de l’entrée principale de l’item doivent rester vierges. Par exemple, si un item peut avoir les scores 0, 1 et 2, il lui faut un


INTRODUCTION À IATA

| 141

total de trois lignes dans le fichier des items : une ligne pour l’item général, où figure uniquement le nom de l’item et la clé de codage ; et deux entrées spécifiques pour les scores 1 et 2 comportant le nom, la clé de codage et les paramètres. Dans chacune de ces entrées spécifiques, le nom est celui de l’item initial suivi de @<valeur du score>. Par exemple, si le nom de l’item initial est TestItem, le nom du score 1 de l’item est TestItem@1. IATA utilise un modèle de réponse à l’item qui exige que les valeurs des paramètres b soient dans le même ordre que les scores. Ainsi, s’il existe deux entrées pour les scores 1 et 2, la valeur du paramètre b pour le score 2 doit être supérieure à celle du score 1 (voir le tableau 8.4). Dans les lignes créées pour les scores d’un item à crédit partiel, la valeur de la clé de codage est également spécifiée d’une manière différente. L’analyse d’un item à crédit partiel suppose qu’un élève ayant obtenu un score donné maîtrise les niveaux de compétence associés aux scores inférieurs. En d’autres termes, si chaque score est traité comme un item de test séparé, un élève ayant un score de crédit partiel élevé est censé avoir satisfait les niveaux de crédit partiel inférieurs. Pour gérer cette situation dans IATA, la clé de codage de chaque score doit comprendre sa ou ses propres valeurs clés, ainsi que les valeurs des scores plus élevés. Un exemple de format adéquat pour un item à crédit partiel ayant les scores 0, 1, 2 et 3 est présenté dans le tableau 8.4. Notons qu’aucune information n’est fournie pour le score le plus bas (0). L’entrée principale de l’item n’a de valeur ni pour les paramètres ni pour Level. Chaque valeur du score étant susceptible de correspondre à une norme de performance différente, la spécification du niveau de l’ensemble de l’item n’a pas de sens. Même si des scores ont déjà été attribués aux réponses, la clé de codage doit néanmoins être spécifiée TABLEAU 8.4 Exemple extrait d’un fichier des items pour un item à crédit partiel Name

a

b

c

PCItem001

Key

Level

1:1;2:2;3:3

Content Parties du discours

PCItem001@1

0,61

−0,43

0

1,2,3

1

Parties du discours

PCItem001@2

0,61

0,22

0

2,3

1

Parties du discours

PCItem001@3

0,61

0,74

0

3

2

Parties du discours


142

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

dans le format voulu. Pour permettre à IATA de noter correctement les réponses, la clé de codage doit fournir à la fois les valeurs figurant dans les données et le score attribué à chaque valeur.

DONNÉES PRODUITES PAR IATA IATA produit plusieurs tableaux de données contenant les spécifications de l’analyse en cours et ses résultats. En général, tous les résultats sont archivés pour une consultation ultérieure. Le tableau 8.5 résume la liste des tableaux de données produits par IATA. Ils peuvent être enregistrés de manière individuelle ou collective, directement à partir d’IATA, dans une variété de formats courants tels qu’Excel (*.xls/*.xlsx), SPSS (*.sav), un texte délimité par des virgules (*.csv) ou par des tabulations (*.txt). Outre les tableaux de données décrits dans le tableau 8.5, IATA produit plusieurs diagrammes, résumés textuels et tableaux de résultats affichés uniquement dans l’interface IATA. Ces résultats peuvent être copiés directement à partir d’IATA et collés dans d’autres documents pour une consultation ultérieure. La méthode de copie dépend du type de résultats. Pour les graphiques, un clic droit sur le corps du graphique affiche un menu contextuel proposant les options : a) copie de l’image dans le presse-papiers ; b) enregistrement de l’image directement dans un fichier ; ou c) impression de l’image. Pour copier les résultats présentés sous la forme d’un tableau, il faut sélectionner les cellules, les lignes ou les colonnes voulues, faire un clic droit et cliquer sur Copy dans le menu contextuel qui s’affiche, ou bien appuyer sur les touches Ctrl+c. Les données sélectionnées peuvent alors être collées dans un fichier texte ou directement dans un tableur Excel ou SPSS.

INTERPRÉTATION DES RÉSULTATS D’IATA Chaque fois qu’IATA produit des résultats d’analyse pour les items individuels, il fournit également des indicateurs synthétiques sous la forme de « symbole de signalisation routière » donnant une idée


INTRODUCTION À IATA

| 143

TABLEAU 8.5 Tableaux de données produits par IATA Tableaux de données

Description

Responses

Données des réponses initiales (y compris les données non liées aux tests) importées dans IATA

Values

Codes des réponses uniques pour tous les items de test et indication précisant si la non-réponse est codée comme manquante valide (saut valide) ou manquante

Scored

Données des réponses jugées correctes (1) ou incorrectes (0) sur base de la clé de codage spécifiée, ainsi que tous les scores synthétiques avec leurs erreurs-types

Items1a

Clés de codage des items et statistiques liées à l’analyse en cours et aux paramètres de l’item

Items2

Clés de codage des items et paramètres du fichier de référence des paramètres des items, utilisé dans la liaison

MergedItems

Liaison, item par item, des items contenus dans les fichiers nouveaux et de référence des paramètres des items, utilisés par le processus de liaison

Eigenvalues

Part de la variance expliquée par chacune des dimensions sous-tendant les réponses aux items

PatternMatrix

Part de la variance de chaque item expliquée par chacune des dimensions sous-tendant les réponses aux items

Levels

Seuils utilisés pour définir les niveaux de compétence

LinkingConstants

Constantes de transformation d’échelle utilisées pour ajuster l’échelle TRI entre les populations ou les échantillons

BookmarkData

Liste ordonnée d’items pouvant être utilisée pour faciliter l’établissement de normes ou la création de définitions pour les niveaux de performance

DIF_<specifications>

Résultats d’une analyse du fonctionnement différentiel des items. La partie <specifications> du nom du tableau résume la variable et les groupes comparés dans l’analyse

CustomTest<name>

Ensemble d’items choisis pour minimiser l’erreur de mesure dans une fourchette spécifique de compétence. <name> est spécifique à l’utilisateur

a. Le tableau de données Items1 produit par IATA à la suite d’une analyse des données des réponses sert non seulement de fichier des données des items, mais génère aussi d’autres statistiques (décrites dans les sections traitant de l’analyse des données des réponses). Elles décrivent le comportement des items dans un échantillon c donné et sont utiles pour orienter l’analyse et la construction des tests. Elles ne doivent pas être conservées dans un fichier des données des items à utiliser par IATA.


144

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

TABLEAU 8.6 Symboles de signalisation routière utilisés par IATA et leur signification Symbole

Signification Un cercle indique qu’il n’y a pas de problèmes majeurs. Un losange indique que les résultats sont loin d’être optimaux. Cet indicateur est utilisé pour suggérer qu’il peut être nécessaire de modifier les spécifications de l’analyse ou l’item lui-même. L’item n’introduit toutefois aucune erreur significative dans les résultats de l’analyse. Un triangle apparaît à côté de tout item potentiellement problématique. Il est utilisé soit pour indiquer les items qui ne peuvent être inclus dans l’analyse en raison de problèmes dans les données ou les spécifications, soit pour recommander un examen plus détaillé des spécifications, des données ou de l’item de test sous-jacents. L’apparition de cet indicateur ne signifie pas nécessairement qu’il y a un problème, mais suggère que les résultats de l’analyse pourraient être plus précis si l’item de test signalé était supprimé ou si les spécifications de l’analyse étaient revues.

générale de la façon d’interpréter les résultats. IATA utilise trois symboles (voir le tableau 8.6). Ces symboles (cercle, losange, triangle) sont affichés en couleur à l’écran. Dans le cas des analyses où de multiples éléments d’information sont pris en compte dans l’interprétation des résultats d’un item spécifique, tels que les résultats de l’analyse de l’item et de la dimensionnalité du test, IATA génère des déclarations interprétatives qui tentent de résumer les différentes statistiques. Ces déclarations sont destinées à suggérer utilement la façon de procéder. Toutefois, chaque fois que IATA recommande de modifier les spécifications de l’analyse ou les items de test, vous devez vérifier que la recommandation est appropriée en examinant les résultats statistiques, les carnets de test réels, ou les deux, ou en discutant des items avec un spécialiste des programmes de cours.

DONNÉES DES ÉCHANTILLONS L’installation d’IATA sur un ordinateur crée sur le bureau une icône pour le répertoire IATA. Celui-ci contient les données de l’échantillon nécessaires pour effectuer les exercices donnés en exemples dans ce livre. Le répertoire des données de l’échantillon IATA contient sept


INTRODUCTION À IATA

| 145

fichiers, dont six de données des réponses au format Excel, et un fichier Excel contenant les clés de codage pour chacun de ces ensembles. Les fichiers sont au format *.xls pour être compatibles avec des logiciels anciens et à code ouvert (en fonction des paramètres de l’ordinateur, l’extension.xls du fichier peut être ou non visible). Les noms et le contenu des fichiers sont les suivants : • PILOT1 : ensemble de données des réponses correspondant à un test pilote contenant des items à choix multiple • CYCLE1 : ensemble de données des réponses correspondant à l’administration d’une évaluation nationale • PILOT2 : ensemble de données des réponses correspondant à un test pilote contenant des items à choix multiple dans un plan de rotation équilibrée • PILOT2PartialCredit : ensemble de données des réponses correspondant à un test pilote contenant des items à choix multiple et à crédit partiel dans un plan de rotation équilibrée • CYCLE2 : ensemble de données des réponses correspondant à l’administration d’une évaluation nationale avec des items communs à une administration précédente • CYCLE3 : ensemble de données des réponses correspondant à l’administration d’une évaluation nationale avec des items communs à une administration précédente • ItemDataAllTests : fichier Excel à plusieurs feuilles contenant les clés de codage et des informations sur les items de chacun des ensembles de données des réponses Ces fichiers de données des échantillons sont des ensembles de données fictives développés dans le seul but de fournir des exemples concrets et des applications pour IATA. Même s’ils reflètent les schémas habituels des réponses des élèves et si les relations entre les données sont similaires à celles observées dans la plupart des évaluations à grande échelle, les résultats et les discussions des résultats de l’analyse ne correspondent à aucune évaluation nationale réelle. Si l’un des fichiers de données des échantillons est supprimé, il peut être récupéré en exécutant le programme IATASetup.exe disponible sur le CD ou sur le site Web d’IATA (http://polymetrika.com/home /IATA).


146

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

SÉQUENCE DES TÂCHES D’ANALYSE ET INTERFACES D’IATA Contrairement aux programmes d’analyse statistique qui proposent un éventail de fonctions accessibles individuellement, IATA fournit des fonctions d’analyse accessibles à travers des séquences de tâches (workflows), où les résultats de chaque étape peuvent être utilisés pour orienter les spécifications ou l’interprétation des résultats des étapes ultérieures. Cinq séquences de tâches sont disponibles dans IATA : • • • • •

Analyse des données des réponses Analyse des données des réponses avec liaison Liaison des données des items Sélection d’items de test optimaux Détermination et attribution de normes de performance

Chaque séquence de tâches répond aux besoins d’objectifs spécifiques susceptibles de survenir dans le cadre d’une évaluation nationale. Les indications qui suivent précisent certaines des situations associées à l’utilisation des séquences de tâches : • Si un test pilote a été effectué et que des informations détaillées sur le comportement des items sont nécessaires pour déterminer le contenu du test final, la séquence de tâches Analyse des données des réponses doit être utilisée. • Si la collecte de données a été réalisée pour la première d’une série d’évaluations nationales, la séquence de tâches Analyse des données des réponses doit être utilisée. • Si de nouvelles échelles de scores sont déterminées pour un échantillon d’élèves auquel un test déjà utilisé dans une évaluation nationale précédente a été administré, la séquence de tâches Analyse des données des réponses doit être utilisée. • Si une évaluation nationale partageant des items avec une évaluation antérieure a été réalisée et que l’on souhaite comparer les résultats des deux, la séquence de tâches Analyse des données des réponses avec liaison ou Liaison des données des items doit être utilisée. • Si l’on souhaite modifier un test et identifier les meilleurs items à retenir dans le nouveau test, tout en maintenant la comparabilité


INTRODUCTION À IATA

| 147

avec le test précédent, la séquence de tâches Sélection d’items de test optimaux doit être utilisée. • Si l’évaluation nationale a déjà été réalisée et qu’au lieu de simplement comparer les élèves les uns aux autres, on souhaite interpréter les résultats d’une manière conforme aux attentes du programme de cours, la séquence de tâches Détermination et attribution de normes de performance doit être utilisée. Pour effectuer une analyse avec IATA, il faut choisir une de ces séquences de tâches dans le menu principal. On y accède en cliquant sur Main Menu en bas à droite de l’écran de sélection de la langue et d’inscription qui est chargé avec IATA (figure 8.2). Vous n’avez pas besoin de saisir des informations dans cet écran pour lancer IATA. La langue par défaut d’IATA est l’anglais, et l’inscription est facultative. L’inscription permet d’accéder à des fonctions d’analyse avancées et

FIGURE 8.2 Sélection initiale de la langue et inscription facultative à IATA


148

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

de recevoir des notifications lorsque des mises à jour d’IATA sont disponibles. La figure 8.3 montre le menu principal d’IATA. Chaque séquence de tâches comprend un ensemble de tâches à exécuter dans un certain ordre. La plupart des séquences partagent de nombreuses tâches. IATA effectue 10 tâches, ayant chacune sa propre interface, qui apparaissent généralement dans l’ordre indiqué dans le tableau 8.7. Toutes les tâches n’apparaissent pas dans toutes les séquences de tâches. Celles-ci sont conçues pour que vous n’ayez à effectuer que les tâches pertinentes pour vos objectifs d’analyse. Le tableau 8.7 relie les tâches aux séquences de tâches. Les deux premières séquences (A, B) comportent des tâches très similaires. Par contre, les trois dernières (C, D, E) n’analysent que les données des items. Toutes les séquences de tâches exigent que les données soient chargées dans IATA et permettent d’enregistrer les résultats.

FIGURE 8.3 Menu principal d’IATA


INTRODUCTION À IATA

| 149

TABLEAU 8.7 Tâches IATA et séquences de tâches qui les utilisent Séquence de tâches Analyse des données des réponses A

Tâche Chargement des données

•

Analyse des Liaison Sélection Détermination/ des données attribution de données d’items des normes de de test des réponses optimaux performance items avec liaison E D C B •

Définition des spécifications de l’analyse

•

•

Analyse des items de test

•

•

Analyse de la dimensionnalité des tests

•

•

Analyse du fonctionnement différentiel des items

•

•

Liaison

•

Définition des échelles de scores pour les résultats des tests

•

•

Sélection des items de test optimaux

•

•

Information pour la détermination de normes de performance

•

•

Enregistrement des résultats

•

•

•

•

•

•

•

• •

•

•

NAVIGATION DANS LES SÉQUENCES DE TÂCHES D’IATA Après avoir sélectionné une séquence de tâches dans le menu principal d’IATA, vous serez dirigé vers le groupe de tâches qui la composent. Chaque tâche a sa propre interface qui vous permet d’indiquer la façon dont IATA doit l’effectuer et, éventuellement, d’afficher les résultats. La boîte d’instructions et les boutons de navigation d’IATA sont présentés dans la figure 8.4. La boîte d’instructions donne un


150

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

FIGURE 8.4 Boîte d’instructions de l’interface des tâches et boutons de navigation d’IATA

résumé des spécifications requises pour chaque tâche ainsi que des suggestions d’interprétation. Un clic sur le bouton <<Back permet d’examiner une tâche précédente ; un clic sur le bouton Next>> permet de passer à la tâche suivante. Notons que, bien qu’IATA n’empêche pas l’utilisateur d’évoluer dans les deux sens à travers la séquence de tâches, les tâches suivantes peuvent ne fournir des résultats significatifs que si les tâches précédentes ont été correctement exécutées. Quelle que soit la séquence où elle apparaît, chaque tâche conserve les mêmes spécifications générales. L’interface des tâches est décrite en détail dans les exemples présentés dans les chapitres 9 à 14 du présent volume. Ces exemples montrent comment utiliser IATA pour effectuer les analyses des données des tests et des items requises dans le cadre d’une évaluation nationale, à l’aide des données du répertoire IATA figurant sur le bureau. Pour analyser vos propres données d’évaluation nationale, créez un nouveau répertoire avec un nom adéquat, tel que NATIONAL_ASSESSMENT_YEAR_1. (Évitez d’utiliser des espaces ou des caractères spéciaux autres que _ dans le nom des fichiers et répertoires.) Vous devez stocker vos données sur les réponses des élèves dans ce répertoire et y enregistrer également les résultats produits par vos analyses. IATA est capable d’analyser les données dans différents formats, tels qu’Excel et SPSS, mais les fichiers de données que vous utilisez doivent néanmoins respecter les structures et les conventions de dénomination décrites dans les tableaux 8.2 et 8.3. Les noms des fichiers de données doivent clairement identifier la source des données.2


INTRODUCTION À IATA

| 151

NOTES 1. Cette exigence de format signifie que les virgules ne peuvent jamais être utilisées comme valeurs des clés de codage. 2. Des informations supplémentaires sur IATA sont disponibles sur http:// polymetrika.com/home/IATA.


9

CHAPITRE

ANALYSE DES DONNÉES ISSUES DE L’ADMINISTRATION D’UN TEST PILOTE

Utilisez l’ensemble de données de l’échantillon PILOT1 pour effectuer cet exercice. La clé de codage pour ce test se trouve dans la feuille PILOT1 du classeur Excel ItemDataAllTests. Ce chapitre présente l’analyse des données d’un test pilote à l’aide du logiciel IATA (Item and Test Analysis) d’analyse des items et tests. La séquence de tâches (workflow) Response data analysis sera utilisée pour analyser les données des réponses à l’aide d’un fichier de clés de codage. Les étapes de la séquence de tâches sont le chargement des données, la spécification de l’analyse, l’analyse des items, l’analyse de la dimensionnalité, l’analyse du fonctionnement différentiel des items et la sélection des items. Les échelles ou normes de performance n’ont pas été calculées, car la distribution de la compétence dans l’échantillon pilote n’est probablement pas représentative de la population. Considérons le scénario suivant : une équipe d’évaluation nationale et ses experts des programmes de cours ont créé un ensemble de nouveaux items à choix multiple pour évaluer les savoirs et savoir-faire mathématiques des élèves de 5e année. Ces items de test, considérés comme représentatifs du programme national de cours, ont été créés pour refléter les principales catégories de contenu déterminées par un comité directeur national (connaissance des nombres, formes et

153


154

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

espace, relations, résolution de problèmes et incertitude). La version définitive du test, prévue pour comprendre 50 items, doit être administrée à des élèves de cinquième année appartenant à tous les niveaux de compétence. Dans un premier temps, l’équipe nationale d’évaluation a administré un test de 80 items aux 262 élèves d’un échantillon constitué à partir de sept établissements dans chacune des trois régions. L’équipe a utilisé un nombre d’items supérieur à celui prévu pour le test définitif en supposant, comme tel est généralement le cas, qu’un certain nombre des items proposés ne conviendront pas pour diverses raisons (par exemple, ils peuvent être trop faciles ou difficiles, les instructions peuvent être confuses, etc.). Certains items peuvent déjà avoir été rejetés par des commissions d’examen avant le prétest. En prévision d’autres problèmes avec certains items, au moins 50 % du nombre d’items requis pour le test définitif ont été ajoutés pour le prétest. Rappelons qu’un test pilote vise à tester les protocoles opérationnels d’une enquête, ainsi qu’à déterminer les items qui composeront le test définitif. Le fichier des réponses contient les réponses données par les élèves aux 80 items à choix multiple ainsi que quelques variables liées à l’établissement (identifiant de la région, identifiant de l’établissement, type et taille de l’établissement), plus les données liées à l’élève (sexe, langue parlée à la maison). Dans le menu principal, cliquez sur la première option, Response data analysis, pour lancer la séquence de tâches de l’analyse des données des réponses (figure 9.1). Si, à un quelconque moment de

FIGURE 9.1 Séquence des tâches d’analyse des données des réponses


ANALYSE DES DONNÉES ISSUES DE L’ADMINISTRATION D’UN TEST PILOTE

| 155

cette séquence, une erreur est signalée ou si les résultats affichés sont différents de ceux attendus, retournez à l’étape précédente ou recommencez l’analyse à partir du menu principal.

ÉTAPE 1 : CHARGEMENT DES DONNÉES DES RÉPONSES Quel que soit le type d’analyse choisi, les données précédemment recueillies ou produites (par exemple, les données du test pilote de l’évaluation nationale ou un fichier des items) doivent, au préalable, avoir été chargées dans IATA. Cette opération est effectuée à l’aide de procédures IATA simples et souples utilisant des boutons pour charger les données des réponses, des items ou des deux. Quel que soit le type d’analyse ou de données, il faut indiquer à IATA le fichier de données à importer et les données du fichier à utiliser. IATA peut importer des fichiers au format SPSS (Statistical Package for Social Sciences) (*.sav), Excel (*.xls, *.xlsx), texte délimité par des tabulations (*.txt) et texte séparé par des virgules (*.csv). Les fichiers Excel pouvant contenir plusieurs feuilles, le nom de celle à importer doit être spécifié. Le premier écran de la séquence de tâches vous demande d’importer un fichier de données des réponses dans IATA. L’interface de chargement des données est présentée dans la figure 9.2. Les instructions commencent par les mots EXAMINEE RESPONSE DATA pour indiquer que vous chargez des données contenant la réponse de chacun des élèves à chacun des items. En dessous des instructions figurent deux champs : le chemin d’accès à un fichier et une liste déroulante permettant de choisir un tableau de données dans le fichier sélectionné. À droite de ces champs se trouve le bouton Open File. En bas de l’écran, un tableau affiche les données de la source sélectionnée. Seules les 500 premières lignes de données de cet ensemble sont affichées. Lorsque le format des fichiers permet d’avoir plusieurs feuilles ou tables dans un même fichier, comme Excel ou Access, le nom de la première feuille ou table apparaît dans la liste déroulante. Sinon, c’est le nom du fichier qui est affiché. Pour les fichiers multitableaux, il est possible que les données souhaitées ne se trouvent pas dans la première feuille ou table. Vérifiez donc que les données voulues ont bien été


156

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

FIGURE 9.2 Écran de chargement des données des réponses

sélectionnées en examinant le contenu du grand tableau affiché dans le bas de l’écran. Si la feuille ou table sélectionnée dans la liste déroulante ne contient pas les données souhaitées, modifiez votre choix. Pour notre exemple, chargez le fichier PILOT1.xls. 1. Cliquez sur Open File afin de sélectionner un fichier. Dans l’explorateur de fichiers, allez vers le répertoire placé sur le bureau, qui contient les données de l’échantillon IATA. 2. Sélectionnez (ou saisissez) PILOT1.xls. 3. Cliquez sur Open ou appuyez sur la touche Enter. Lorsque le fichier s’ouvre, une fenêtre contextuelle vous demande de confirmer que les données sélectionnées contiennent les bonnes données des réponses aux items. Cliquez sur OK pour continuer. Vérifiez que les données de l’échantillon du test pilote sont correctement chargées ; l’écran devrait ressembler à celui de la figure 9.2. Le tableau du bas montre les données de chaque élève ayant participé au test pilote. Les sept premières variables à partir de la gauche


ANALYSE DES DONNÉES ISSUES DE L’ADMINISTRATION D’UN TEST PILOTE

| 157

sont des données démographiques ou liées à l’échantillon associées aux élèves. • • • • • • •

PILOT1STDID : identifiant unique de l’élève SCHOOLID : identifiant unique de l’établissement Sex : sexe (genre) de l’élève (1 = féminin, 2 = masculin) SchoolSize : nombre total d’élèves dans l’établissement Rural : situation géographique de l’établissement (0 = urbain, 1 = rural) Region : identifiant numérique de la région géographique Language : code numérique indiquant si la langue d’enseignement est ou non parlée au domicile de l’élève

Le premier item de mathématiques apparaît dans la colonne 8 intitulée MATHC1019. Faites défiler l’ensemble de données vers la gauche pour vérifier que le fichier contient bien les données des 80 items ; l’en-tête de la dernière colonne doit être MATHC1041. Le nom des items est arbitraire et ne reflète aucunement leur position dans le test. La plupart des cellules contiennent des valeurs A, B, C, ou D correspondant aux options choisies par les élèves. Les cellules affichant la valeur 9 indiquent que l’élève n’a pas répondu à l’item. Comme dans la plupart des échantillons pilotes, les élèves font partie d’un échantillon de convenance plutôt que d’un échantillon aléatoire de la population entière. Le fichier des réponses ne contient par conséquent aucun poids d’échantillonnage. Après avoir vérifié que le bon fichier des réponses a été chargé, cliquez sur Next>>. ÉTAPE 2 : CHARGEMENT DES CLÉS DE CODAGE Les clés de codage des items doivent maintenant être chargées. Comme pour les données des réponses, les données des items sont dans un fichier Excel placé dans le répertoire IATA du bureau. 1. Cliquez sur Open File pour sélectionner le fichier de données. Dans l’explorateur de fichiers, allez vers le répertoire du bureau contenant les données de l’échantillon IATA. 2. Sélectionnez (ou saisissez) ItemDataAllTests.xls. 3. Cliquez sur Open ou appuyez sur la touche Enter.


158

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

Quand le fichier s’ouvre, une fenêtre contextuelle vous signale qu’IATA va estimer tous les paramètres manquants des items. Cliquez sur OK pour continuer. Le fichier sélectionné contient les tableaux correspondant à tous les exemples de ce volume. Assurez-vous que le tableau intitulé PILOT1 a été correctement sélectionné dans la liste déroulante. Vérifiez que les données des items sont correctement chargées ; l’écran devrait ressembler à la figure 9.3. Pour trouver l’information relative à un item donné, triez les items en cliquant sur l’en-tête de la colonne Name. Après avoir vérifié que les bonnes données des items ont été chargées, cliquez sur Next>> pour continuer.

ÉTAPE 3 : SPÉCIFICATION DE L’ANALYSE Toutes les séquences de tâches utilisant les données des réponses demandent certaines spécifications, qui affecteront les résultats de toutes les analyses suivantes. Ces spécifications comprennent des

FIGURE 9.3 Réponses aux items, données de PILOT1


ANALYSE DES DONNÉES ISSUES DE L’ADMINISTRATION D’UN TEST PILOTE

| 159

informations relatives à la clé de codage, l’identification du répondant, la pondération du plan d’échantillonnage et le traitement des codes pour les données manquantes. L’écran d’introduction de ces spécifications est présenté dans la figure 9.4. Le grand tableau de gauche fournit les données Name, Key, Level et Content de tous les items de test repris en tant que variables dans le fichier des réponses. Si un fichier de données des items a été chargé, le tableau ne contient que les variables identifiées comme des items de test, sinon il contient toutes les variables. Si vous avez sauté le chargement d’un fichier des items, vous devez saisir manuellement les spécifications de la clé de codage de chaque item du tableau (voir « Format des clés de codage » dans le chapitre 8 du présent volume). Dans la partie centrale de l’écran figure un bouton Update response value list. Cliquez sur ce bouton pour modifier ou supprimer manuellement les spécifications des clés de codage. Lorsque ce bouton est activé, IATA remplit les deux listes déroulantes avec, respectivement, les variables de réponse pour lesquelles aucune clé de codage n’est spécifiée et l’ensemble des valeurs existantes des

FIGURE 9.4 Spécifications de l’analyse, données de PILOT1


160

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

variables de réponse identifiées comme des items de test. Si vous avez chargé un fichier des items, ces champs seront déjà remplis avec des valeurs. Sous le bouton Update response value list figurent plusieurs contrôles permettant d’introduire des spécifications optionnelles : une liste déroulante pour spécifier l’identifiant (ID), une autre pour sélectionner la variable de poids, et un tableau où définir le traitement des codes pour les valeurs manquantes. La spécification d’une variable ID peut être nécessaire pour fusionner les résultats de test produits par IATA avec d’autres sources de données. La variable ID identifiera chaque élève de façon unique ; si vous ne la spécifiez pas, IATA générera la variable UniqueIdentifier à cet effet. La variable de pondération est utilisée pour s’assurer que les statistiques produites pendant l’analyse sont adaptées au plan d’échantillonnage de l’évaluation nationale, mais, comme mentionné plus haut, elle n’est pas utilisée dans l’analyse des données du test pilote. Si aucune variable de pondération n’est fournie, IATA supposera que tous les élèves ont le même poids (égal à 1). Vous pouvez indiquer à IATA qu’une valeur du code réponse correspond à une réponse manquante en cliquant sur une des cases placées à côté des valeurs dans le tableau Specify missing treatment. Par défaut, IATA suppose que tous les codes réponses représentent des réponses réelles des élèves. Si une case est cochée dans la colonne Incorrect, IATA traitera la valeur correspondante comme une réponse non valide, qui sera codée comme incorrecte. Si une case est cochée dans la colonne Do Not Score, IATA associera le code correspondant à une question omise, qui n’affectera pas les résultats d’un élève. Par défaut, si une quelconque cellule de données des réponses est vide, IATA la traite comme incorrecte, sauf si vous avez manuellement spécifié Do Not Score. Pour notre exercice, les clés de codage et les données des réponses ont déjà été saisies, si bien que la liste des items montrée dans la figure 9.4 ne contient que les variables ayant des clés de codage dans les données des items. Il est judicieux d’examiner le tableau des clés de codage pour vérifier que les clés et les autres données de chaque item sont correctes et complètes. À ce stade, toute erreur en entraînera d’autres dans les tâches suivantes de la séquence. Au milieu


ANALYSE DES DONNÉES ISSUES DE L’ADMINISTRATION D’UN TEST PILOTE

| 161

de l’écran, spécifiez les autres détails de l’analyse. Utilisez les spécifications suivantes : 1. Dans la première liste déroulante, sélectionnez PILOT1STDID (l’ID initialement assigné aux élèves) en tant qu’identifiant (voir la figure 9.2). 2. Les données utilisées n’ayant pas de poids d’échantillonnage, la liste déroulante du second champ doit rester vide. 3. La valeur 9 étant considérée comme incorrecte, vérifiez la case correspondante dans la partie Specify missing treatment du tableau des valeurs. Même si les données PILOT1 ne contiennent aucune entrée vide, vous pouvez conserver la spécification Incorrect attribuée par défaut aux valeurs nulles. Une fois les spécifications introduites, l’écran devrait ressembler à la figure 9.4. Vérifiez que les spécifications sont correctes et cliquez sur Next>> pour continuer. Les données vont être automatiquement traitées. Les étapes de traitement sont la constitution des données, la correction, l’estimation des paramètres, la définition de l’échelle TRI (théorie de la réponse à l’item), le calcul des scores réels et l’analyse factorielle. Tout au long du traitement, son état d’avancement est affiché dans l’interface. Suivant la puissance de l’ordinateur et la taille de l’ensemble de données, cette analyse peut prendre de quelques secondes à plusieurs minutes. Lorsqu’IATA a terminé, les résultats sont affichés dans l’écran d’analyse des items.

ÉTAPE 4 : ANALYSE DES ITEMS Lorsque le traitement des données est terminé, l’écran d’analyse des items est mis à jour avec les résultats, comme le montre la figure 9.5. Cet écran permet d’accéder aux résultats ainsi que d’afficher et enregistrer l’information de diagnostic relative à chaque item de test. Quatre types de résultats sont affichés : • Les statistiques et les paramètres statistiques associés à chaque item (sur la gauche) ;


162

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

FIGURE 9.5 Résultats de l’analyse des items, MATHC1019, données de PILOT1

• Une représentation graphique de la relation entre la compétence de l’élève et la probabilité de réponse correcte à un item, également connue comme la fonction de réponse à l’item (FRI) (en haut à droite) ; • Un tableau de contingence décrivant la proportion des élèves ayant des scores élevés, moyens et faibles qui ont choisi chaque réponse à l’item, également connu en tant qu’analyse des distracteurs (au milieu à droite) ; • Une synthèse en langage naturel des résultats de l’analyse de l’item (en bas à droite). Le tableau situé à gauche dans l’écran d’analyse des items affiche les données statistiques ainsi qu’un symbole décrivant l’adéquation globale de chaque item. Le nom (Name) de chacun d’eux figure dans la colonne à droite des symboles synthétiques. Examinez les résultats détaillés d’un item donné, en utilisant les touches fléchées de votre clavier ou la souris, pour mettre en surbrillance la ligne où figure l’item. Utilisez les cases à cocher placées dans la colonne Use pour intégrer ou


ANALYSE DES DONNÉES ISSUES DE L’ADMINISTRATION D’UN TEST PILOTE

| 163

éliminer des items dans l’analyse. Décochez l’une de ces cases pour exclure l’item de l’analyse. Cliquez ensuite sur le bouton Analyze pour relancer l’analyse avec l’ensemble réduit d’items (les items éliminés restent dans la liste, mais sont signalés par un triangle rouge). Ramenez tous les items à leur état initial en cliquant sur Reset Items et Analyze. Notez qu’un clic sur Reset Items réinitialise tous les items. Pour éliminer définitivement un item de l’analyse, effacez sa clé de codage dans l’écran de spécification de l’analyse. Le bouton Scale ne réestime pas les paramètres des items, il calcule simplement les échelles de scores TRI pour les données des réponses, à l’aide des paramètres des items déjà estimés ou chargés dans IATA à partir d’un fichier de données externe.

Statistiques des items Dans la figure 9.5, les trois colonnes figurant à droite du nom de l’item contiennent les statistiques classiques de l’item : son indice de discrimination (Discr), sa facilité (PVal), parfois appelée difficulté de l’item, bien que les valeurs plus élevées indiquent des items plus faciles ; et sa corrélation bisériale de point (PBis) (voir par exemple, Crocker et Algina, 2006 ; Haladyna, 2004). Si les trois dernières colonnes sont cachées, vous devez utiliser la barre de défilement au bas du tableau pour les visualiser. Elles contiennent l’estimation des paramètres TRI : la pente (paramètre a), la position ou seuil (paramètre b), et le paramètre de pseudo-chance (paramètre c). Généralement, les statistiques classiques peuvent être directement interprétées. La facilité de l’item (PVal) varie entre 0 et 1 et décrit le degré de facilité d’un item pour l’échantillon donné : la valeur 0 indique qu’aucun élève n’a répondu correctement, tandis que 1 indique que tous les élèves ont répondu correctement. L’indice de discrimination de l’item (Discr) et la corrélation bisériale de point (PBis) sont deux mesures alternatives de la même relation, déterminant la force du lien entre les réponses aux différents items et le score global au test. La valeur de ces deux statistiques doit être supérieure à 0,2. Cette recommandation n’est pas absolue, car ces indices sont affectés par des facteurs autres que la discrimination des items, tels que, notamment, la précision de l’ensemble du test. Par exemple, la facilité de l’item tend à limiter la valeur absolue à la fois de l’indice de discrimination et de la


164

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

corrélation bisériale de point. Si la facilité de l’item s’écarte sensiblement de 0,5 (est inférieure à 0,2 ou supérieure à 0,8), l’indice de discrimination et la corrélation bisériale de point sous-estiment la relation entre la compétence et la performance des élèves pour un item de test. Bien que des items extrêmement faciles ou difficiles aient tendance à réduire la relation observée avec la compétence, ils peuvent couvrir une partie importante du programme de cours devant faire partie du test ou comme, par exemple, les items faciles, être nécessaires pour maintenir la motivation des élèves pendant l’épreuve. Pour ces raisons ou d’autres, il est souvent souhaitable d’intégrer un nombre relativement restreint d’items très faciles et très difficiles. Les paramètres de la TRI ne doivent pas être interprétés isolément. Bien que chacun décrive un comportement spécifique de l’item, la relation entre les réponses à l’item et la compétence globale est le résultat d’interactions entre ces trois paramètres ainsi que du niveau individuel de compétence des élèves. Dans notre analyse, la plupart des items sont marqués d’un cercle vert indiquant qu’ils ne présentent aucun problème majeur et sont relativement satisfaisants. En faisant défiler la liste des items vers le bas, vous voyez 13 items avec des symboles en forme de losange (MATHC1047, MATHC1013, MATHC1002, MATHC1070, MATHC1034, MATHC1035, MATHC1032, MATHC1010, MATHC1068, MATHC1046, MATHC1024, MATHC1058 et MATHC1030). Un item (MATHC1075) signalé par un symbole triangulaire est considéré comme potentiellement problématique. La pratique modèle consiste à examiner les résultats de tous les items, quel que soit le symbole synthétique attribué par IATA. Nous nous limiterons ici à quelques exemples. Par défaut, les résultats du premier item, MATHC1019, sont affichés dans le graphique et le tableau de droite. IATA a attribué à cet item un cercle vert1. Chacun des résultats calculés par IATA pour cet item est décrit dans les sections suivantes.

Fonction de réponse à l’item À droite de l’écran d’analyse des items, le diagramme Item Response Function montre la fonction de réponse à l’item (FRI) pour un item


ANALYSE DES DONNÉES ISSUES DE L’ADMINISTRATION D’UN TEST PILOTE

| 165

de test sélectionné (voir la figure 9.5). L’examen de la FRI est généralement plus intuitif que celui des paramètres TRI ou des statistiques de l’item, pour déterminer l’utilité relative d’un item de test. Un item utile a une relation forte avec la compétence, comme l’indique une FRI avec une forme en S bien marquée, où la courbe est presque verticale dans une étroite région. La pente de la FRI de MATHC1019 est toujours positive, mais la relation est faible. Aucune partie de la courbe ne présente une pente abrupte. Cette pente légère corrobore le faible indice de discrimination (Discr = 0,36) et la faible corrélation bisériale de point (Pbis = 0,35). Comme toute méthode de modélisation statistique, la TRI n’est utile que si les données empiriques collent au modèle théorique. Pour chaque item ou valeur d’un score, IATA produit un graphique de la FRI théorique obtenue à l’aide des paramètres estimés ainsi que de la FRI empirique estimée directement à partir de la proportion de réponses correctes à chaque niveau de compétence. Le graphique permet d’évaluer la pertinence de l’utilisation de la TRI pour la description de chaque item. Lorsque le modèle TRI est approprié, la ligne pointillée rouge (empirique) est proche de la ligne pleine noire (théorique), et les écarts entre les deux sont inférieurs à 0,05, en particulier dans la région comprise entre -1 et +1, qui contient beaucoup d’élèves. Pour MATHC1019, les FRI théoriques et empiriques sont presque identiques, ce qui indique que, même si l’item a une faible relation avec la compétence, ses propriétés statistiques sont correctement décrites par la FRI.

Analyse des distracteurs Dans la partie inférieure droite de l’écran d’analyse des items, IATA affiche les statistiques pour chaque valeur des réponses (y compris les codes pour les valeurs manquantes et les valeurs incorrectes) ainsi qu’un résumé textuel de l’analyse (voir la figure 9.5). Pour chaque valeur des réponses, le score moyen en pourcentage de réponses correctes données par les élèves est fourni séparément pour les groupes peu, moyennement et très performants. Le tableau 9.1 donne un exemple de résultats d’une analyse des distracteurs pour un item individuel.


166

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

TABLEAU 9.1 Analyse des distracteurs, MATHC1019, données de PILOT1 Groupe

9(X)

A

B

C

D*

Très performant

0,0

14,1

23,9

14,1

47,9

Moyennement performant

3,1

15,2

37,7

24,1

19,9

Peu performant

8,6

14,3

42,9

22,9

11,4

Total

2,3

14,9

34,0

21,4

27,5

Remarque : L’astérisque signale la réponse correcte

La relation entre la discrimination d’un item et la compétence peut être faible ou même négative pour diverses raisons. Celles-ci comprennent, notamment, une mauvaise formulation de l’énoncé, des instructions confuses, des erreurs d’échantillonnage et des erreurs de saisie ou de codage des réponses. L’analyse des distracteurs permet de détecter et corriger certaines de ces erreurs communes en examinant l’allure des réponses à l’item. Un item qui fonctionne bien doit avoir les caractéristiques suivantes : • Le pourcentage pour l’option correcte (D), désignée par un astérisque (*), doit être élevé pour le groupe très performant et diminuer progressivement pour les groupes moyennement et peu performants. MATHC1019 satisfait cette condition, avec des valeurs respectives de 47,9, 19,9 et 11,4 pour les groupes très performant, moyennement performant et peu performant. • Pour le groupe peu performant, le pourcentage des élèves ayant choisi l’option correcte (D) doit être inférieur à celui des élèves ayant choisi l’une des autres options. Toutes les options incorrectes (A, B, C) pour MATHC1019 répondent à ce critère. • Dans chaque colonne correspondant à une réponse incorrecte, les pourcentages par groupe de performance et pour l’ensemble doivent être à peu près égaux à ceux des autres réponses incorrectes. MATHC1019 ne remplit pas ce critère, car les pourcentages de l’option B sont considérablement plus élevés que ceux des options A et C (un plus grand pourcentage d’élèves de tous niveaux a choisi cette option incorrecte). • Pour le groupe très performant, le pourcentage des élèves ayant choisi l’option correcte (D) doit être plus élevé que celui des élèves ayant choisi chacune des autres options. MATHC1019 répond à


ANALYSE DES DONNÉES ISSUES DE L’ADMINISTRATION D’UN TEST PILOTE

| 167

ce critère : 47,9 est supérieur à la valeur pour les options A (14,1), B (23,9), et C (14,1). • Dans tous les groupes, le pourcentage pour le code valeur manquante doit être proche de zéro. Pour MATHC1019, la proportion des élèves ayant des réponses manquantes (code 9) est plus élevée dans le groupe peu performant (8,6) que dans le groupe très performant (0,0), suggérant ainsi que la décision de traiter le code comme incorrect (plutôt qu’omis) est raisonnable. • Pour le code réponse manquante traité comme omis (désigné par OMIT), les pourcentages doivent être égaux dans tous les groupes de performance. Ce code n’est pas utilisé dans notre exemple. IATA fournit un résumé textuel des résultats de l’item, y compris un avertissement si sa discrimination est beaucoup trop faible. Dans ce cas, il suggère ce qui peut être fait pour l’améliorer. Par exemple, IATA identifie les distracteurs ne suscitant pas efficacement la motivation des répondants (ou ayant des profils statistiques similaires à ceux des réponses correctes). Si IATA détecte un quelconque problème commun dans les données, un résumé textuel des résultats est affiché dans la zone de texte sous le tableau d’analyse des distracteurs. Dans les résultats pour MATHC1019, le résumé textuel affiché en bas à droite recommande d’examiner l’option de réponse A. En examinant le tableau d’analyse des distracteurs, on constate que celle-ci a été choisie par à peu près la même proportion d’élèves très performants et peu performants, indiquant ainsi qu’elle ne fonctionne pas bien en tant que distracteur. L’analyse des distracteurs dans les données d’une évaluation nationale peut également être utile aux fournisseurs de formation continue des enseignants et au personnel responsable des programmes de cours, car elle aide à identifier les idées fausses et erreurs communes des élèves. Les responsables des programmes de cours peuvent également utiliser les données pour juger de la pertinence d’un matériel particulier dans une année scolaire donnée. Comparaison des items Par rapport à l’item précédent (voir la figure 9.6), le deuxième item de test, MATHC1027, a une plus forte relation avec la compétence,


168

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

FIGURE 9.6 Résultats de l’analyse des items, MATHC1027, données de PILOT1

comme le montrent la pente plus raide de la FRI ainsi que les valeurs plus élevées de l’indice de discrimination (0,65) et de la corrélation bisériale de point (0,53). Les FRI théoriques et empiriques sont presque identiques, indiquant ainsi que le modèle théorique de réponse à l’item colle aux données des réponses. Le tableau d’analyse des distracteurs montre que 73,2 % des élèves du groupe très performant ont choisi l’option correcte (C), contre 19,9 % dans le groupe moyennement performant et 8,6 % dans le groupe peu performant. Toutes les valeurs des réponses incorrectes (A, B, D), ainsi que le code réponse manquante (9), ont été plus sélectionnés par les élèves peu performants que par les élèves très performants. Contrairement aux deux items déjà examinés, les items signalés par un symbole triangulaire sont généralement des items médiocres, dont l’intégration dans le test peut générer des résultats erronés ou moins utiles. Le nombre d’items médiocres apparaissant dans un test pilote comme celui-ci peut être minimisé en respectant les lignes directrices de création des items décrites dans le volume 2 de


ANALYSE DES DONNÉES ISSUES DE L’ADMINISTRATION D’UN TEST PILOTE

| 169

FIGURE 9.7 Résultats de l’analyse de l’item, MATHC1075, données de PILOT1

cette série (Anderson et Morgan, 2008). Dans nos données, le seul item signalé par un symbole d’avertissement est MATHC1075 (voir la figure 9.7). En cliquant sur l’item, vous verrez que les résultats indiquent une relation quasi inexistante entre la compétence et les réponses, tant correctes qu’erronées. Malgré le lien toujours présent entre le code réponse manquante et la compétence, le schéma présenté n’est pas évident. Les élèves du groupe peu performant ne sont pas ceux ayant le plus choisi chacune des trois options incorrectes, tandis que les élèves très performants ne sont pas ceux qui l’ont le moins fait. La capacité de discrimination entre les élèves moyennement et peu performants est particulièrement faible pour cet item. L’indice de discrimination est bas (0,14), de même que la corrélation bisériale de point (0,16). L’item peut être lié à la compétence, mais étant donné le petit nombre des élèves ayant correctement répondu (PVal = 0,12), cette relation ne peut être estimée. Les réponses à l’item ne dépendant pas clairement de la compétence, l’intégration de celui-ci dans le test pourrait accroître l’influence des facteurs aléatoires sur les scores du test. L’intégration de cet item


170

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

(et d’autres items problématiques) dans l’analyse risque également de réduire la précision des estimations statistiques pour les autres items, dans la mesure où les statistiques et les paramètres des items sont analysés à l’aide des scores au test. Les items peuvent être éliminés de l’analyse en décochant la case placée à gauche de leur nom. Après l’exclusion d’un item, les résultats doivent être recalculés en cliquant sur Analyze, avant de pouvoir éliminer d’autres items. L’exclusion d’un seul item affecte les résultats de tous les autres. Lorsqu’il existe plusieurs items problématiques, n’en supprimez qu’un à la fois, car certains signalés comme problématiques peuvent ne l’être qu’à cause de l’influence de l’analyse d’autres items plus problématiques sur les résultats. Si trop d’items sont accidentellement éliminés, recochez chacun d’eux ou cliquez sur Reset Items au-dessus de la liste des items pour reconstituer la liste complète des items. Dans notre exemple, supprimez MATHC1075 et relancez l’analyse pour afficher l’écran de la figure 9.8, où les résultats de MATHC1075 sont mis en surbrillance

FIGURE 9.8 Résultats de l’analyse des items après exclusion d’un item, MATHC1075, données de PILOT1


ANALYSE DES DONNÉES ISSUES DE L’ADMINISTRATION D’UN TEST PILOTE

| 171

après exclusion. Notons que les valeurs de Discr et PBis de cet item ont été remplacées par NaN (not a number – pas un nombre) ou des valeurs hors limites, et qu’elles n’affecteront pas les calculs ultérieurs. Le tableau d’analyse des distracteurs figurant à droite de l’écran n’apparaît pas pour les items éliminés, et un message dans le résumé textuel signale que les données du test doivent être réanalysées. Comme seul un item a été supprimé, les statistiques des items restants demeurent relativement inchangées. Vous pouvez continuer à examiner tous les items en cliquant sur chaque ligne de la liste des items ou en naviguant avec les touches fléchées de votre clavier. Notons que les résumés textuels fournis par IATA sont uniquement basés sur les données statistiques et ignorent le contenu des items. Un item auquel IATA attribue une mauvaise note ne doit pas nécessairement être toujours considéré comme mauvais. Une mauvaise note indique néanmoins que l’item ne peut pas fournir une information utile lorsque le test est utilisé avec la population actuelle. En général, les recommandations de modification ou exclusion d’un item fournies par IATA doivent être considérées dans le cadre des objectifs du test et des raisons initiales de l’intégration de l’item. Bien que certains items puissent être conservés en dépit de leurs propriétés statistiques, par exemple pour représenter adéquatement les principaux aspects du programme de cours, tous les items ayant des indices de discrimination négatifs doivent être exclus ou réintroduits (s’ils ont été mal saisis) avant de procéder à d’autres analyses. Ces items introduisent un bruit ou une variation indésirable dans les données des réponses à l’item et réduisent la précision des évaluations des autres items. L’exclusion des items apparemment faibles pendant l’analyse des données pilotes contribue à accroître la précision des résultats statistiques. Toutefois, la sélection de l’ensemble définitif des items après le test pilote ou la mise à l’essai doit être menée conjointement avec des spécialistes de la matière concernée, travaillant en étroite collaboration avec la personne ou l’équipe responsable de la qualité globale du test d’évaluation nationale. Lorsque vous avez terminé l’examen de tous les items, cliquez sur Next>> pour continuer.


172

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

ÉTAPE 5 : DIMENSIONNALITÉ DU TEST Une des hypothèses statistiques de la TRI, et également une exigence pour une interprétation valide des résultats du test, est que la performance des items représente un construct ou une dimension unique et interprétable. Idéalement, le test national d’un construct tel que les mathématiques ou les sciences ne doit mesurer que le construct ou la dimension unique pour lequel il est conçu, à l’exclusion de tout autre, tel que par exemple, la compréhension de l’écrit. Le but de la mesure de la dimensionnalité du test est de détecter tout non-respect des hypothèses voulant a) qu’une dimension unique et dominante influence la performance au test et b) que les relations entre la performance pour des paires ou des groupes d’items s’expliquent par cette dimension dominante. Dans la plupart des cas, la seconde hypothèse procède de la première, mais pour les tests longs (plus de 50 items), de petits groupes d’items peuvent être localement dépendants sans avoir un effet notable sur la dimensionnalité globale du test. L’analyse de la dimensionnalité d’un test détermine à quel point celui-ci mesure différentes dimensions de la compétence et chaque item est lié à chaque dimension. Plus le nombre de dimensions influençant fortement les items est petit, plus les interprétations des scores sont solides. Bien que cette analyse soit insuffisante pour confirmer la validité d’un test, elle peut toutefois fournir des informations importantes sur le contenu de certains items. Les autres aspects de la validité, tels que celle du contenu (un aspect très important dans une évaluation nationale), sont généralement considérés comme plus importants que les données statistiques pour déterminer la validité d’un test ou d’un item. Anderson et Morgan (2008) décrivent les procédures visant à s’assurer de la validité du contenu d’un test. Du point de vue statistique, l’estimation des paramètres TRI et des scores est fondée sur l’hypothèse que la probabilité d’un événement (par exemple, une réponse correcte) dépend d’une dimension unique correspondant à la compétence. Si les items sont conditionnés par d’autres dimensions, les paramètres et les scores estimés seront incorrects. Dans la figure 9.9, le graphique de droite montre à la fois le tracé en éboulis (scree plot) pour l’ensemble du test et les carrés de la


ANALYSE DES DONNÉES ISSUES DE L’ADMINISTRATION D’UN TEST PILOTE

| 173

FIGURE 9.9 Dimensionnalité du test et de l’item, MATHC1019, données de PILOT1

saturation factorielle du premier item, MATHC1019. Un tableau similaire à celui de l’écran d’analyse des items est affiché à gauche. Les symboles synthétiques (décrits dans le chapitre 8 du présent volume) sont affichés dans la colonne F, à côté de la colonne Name, et décrivent la pertinence globale d’un item du point de vue de sa relation avec la dimension principale, commune à la plupart des autres items du test. Le paramètre classique de facilité de l’item (PVal) figure à droite de la colonne Name, tout comme la saturation de l’item par rapport à la dimension primaire (Loading). La saturation, qui va de -1 à +1, est la corrélation entre la performance de chaque item et la dimension primaire du test. Par exemple, la valeur 0,34 de MATHC1019 indique que les réponses corrigées à cet item ont une corrélation de 0,34 avec le score du test global (en pourcentage de réponses correctes). Il n’existe aucune valeur idéale,2 mais les saturations proches de 1 indiquent de meilleurs items. Les résultats affichés dans le tableau doivent être interprétés en même temps que les graphiques affichés à droite. La principale courbe du diagramme est le tracé en éboulis qui décrit la part de la


174

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

variance (valeur propre) expliquée par chaque dimension potentielle (par exemple, la compréhension de l’écrit). Les marques circulaires montrent l’influence relative de chaque dimension potentielle (valeur propre3) sur les résultats globaux du test, tandis que la ligne continue reliant les marques de forme carrée décrit l’influence relative de chaque dimension potentielle sur l’item considéré (carré de la saturation). L’ampleur des valeurs propres est moins importante que l’allure du tracé en éboulis. Pour le test global, celui-ci doit avoir une unique et grande valeur propre sur la gauche, suivie par d’autres valeurs propres d’une ampleur relativement petite et similaire (figure 9.10). La forme en L du tracé, avec seulement deux segments linéaires, suggère qu’une seule dimension commune est responsable des résultats du test PILOT1. Plus le nombre de segments linéaires reliant le point supérieur gauche à la ligne presque horizontale du bas est grand, plus les dimensions susceptibles d’influencer la performance sont nombreuses. Lorsqu’un item est sélectionné dans la liste de gauche, IATA affiche son tracé en éboulis à droite. Idéalement, le tracé de chaque item doit

FIGURE 9.10 Résultats de la dimensionnalité de l’item, MATHC1035, données de PILOT1


ANALYSE DES DONNÉES ISSUES DE L’ADMINISTRATION D’UN TEST PILOTE

| 175

être similaire à celui du test global ; son point le plus élevé doit être situé à l’extrême gauche (correspondant à la dimension principale du test). Les caractéristiques spécifiques de l’item peuvent toutefois conduire à des formes différentes, qui ne sont pas nécessairement problématiques. Par exemple, l’item MATHC1019 affiché dans la figure 9.9 ne l’est pas : bien que certaines saturations non nulles apparaissent pour d’autres dimensions, la plus forte est associée à la dimension primaire. En général, les résultats pour un item ne doivent être vérifiés que lorsque plus d’une dimension sous-tend clairement la performance au test (c’est-à-dire, quand plus de deux segments linéaires distincts sont visibles). Dans ce cas, il faut identifier et examiner les items dont les tracés présentent des carrés de la saturation correspondant aux mêmes dimensions que les valeurs propres problématiques. Une mise en garde doit être apportée dans l’interprétation des tracés en éboulis en ce qui concerne l’effet du paramètre de facilité de l’item. Dans les tests où la majorité des items ont à peu près la même facilité, les items beaucoup plus ou beaucoup moins faciles que les autres ont tendance à engendrer des facteurs de difficulté artificiels, en particulier en cas de distribution non normale des scores en pourcentage de réponses correctes. Les items d’une extrême facilité peuvent sembler définir un facteur de difficulté secondaire, simplement parce que certains élèves (par exemple, très ou peu performants) génèrent des schémas de réponse apparemment liés de façon inhabituellement forte comparés aux relations entre d’autres items du test. Ces facteurs de difficulté ne sont toutefois pas intrinsèquement problématiques. L’examen de la saturation des items peut aider à déterminer si les facteurs secondaires sont des artefacts ou de réels problèmes. Pour déterminer si un facteur secondaire est un facteur de difficulté, il faut examiner la saturation des items ayant un indice de facilité (Pval) faible (<0,2) ou élevé (> 0,8). Si la saturation de ces items présente un pic correspondant à la position du facteur secondaire, celui-ci est probablement un facteur de difficulté et peut être ignoré.

Saturation des items Le modèle de la TRI suppose une indépendance locale entre les items. Elle signifie que les réponses à un item ne doivent pas dépendre des


176

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

réponses à un autre item. Idéalement, dans la TRI, un test doit comprendre des items indépendants dans toutes les dimensions, à l’exception de la dimension primaire du test. Une importante dépendance locale des items peut entraîner une évaluation imprécise des paramètres des items, des statistiques du test et de la compétence des élèves. Par exemple, dans un test de mathématiques, pour une question portant sur la résolution d’un problème complexe, des scores peuvent être attribués aux étapes logiques nécessaires au calcul de la réponse finale. En pareil cas, une réponse incorrecte à l’étape 1 influencera la probabilité d’une réponse correcte à chacune des étapes suivantes. Cet ensemble d’items dépendants ne convient pas pour la modélisation TRI, et l’item devrait être correctement traité comme un seul item à crédit partiel. Comme la dépendance locale n’est généralement problématique que pour des items faiblement liés à la dimension primaire, le moyen le plus efficace d’utiliser cet écran est de trier les items sur la saturation en cliquant une fois sur l’en-tête de la colonne4 Loading (voir la figure 9.10) et en comparant les items à faible saturation afin d’identifier les pics communs dans leurs graphiques de saturation. Si des pics apparaissent pour la même dimension dans les diagrammes de saturation de nombreux items à faible saturation, ceux-ci peuvent avoir une certaine dépendance locale. Comme ces statistiques ont tendance à être sensibles à l’erreur d’échantillonnage, les résultats de l’examen statistique doivent plutôt être utilisés pour motiver un examen plus détaillé du contenu de l’item que pour prendre des décisions définitives. Après le tri des items, sélectionnez l’item MATHC1075. Comme il a été exclu de l’analyse dans l’étape précédente de l’analyse des items, sa saturation est NaN et aucun résultat n’est affiché (le diagramme n’affiche que le tracé en éboulis pour l’ensemble du test). Un symbole triangulaire signale comme problématique tout item dont la dimensionnalité peut affecter l’estimation des autres statistiques. Notons qu’IATA n’a signalé qu’un seul autre item (MATHC1035) à l’aide d’un symbole triangulaire (voir la figure 9.10). L’item est assez faiblement lié à la dimension primaire et a une relation sensiblement plus forte avec la dimension secondaire, suggérant ainsi qu’il peut mesurer une dimension autre que celles de la plupart des autres items.


ANALYSE DES DONNÉES ISSUES DE L’ADMINISTRATION D’UN TEST PILOTE

| 177

Par eux-mêmes, ces résultats ne sont toutefois pas suffisants pour justifier l’exclusion de cet item. Des experts des programmes de cours et des enseignants expérimentés doivent examiner les items statistiquement problématiques pour déterminer si un problème lié au contenu justifie ou non leur exclusion ou leur révision. IATA attribue un symbole en forme de losange à tous les items ayant une saturation plus forte dans une dimension secondaire que dans la dimension primaire du test. Ces items ne posent pas de problème dans les calculs suivants. Un exemple classique est montré dans la figure 9.11 pour MATHC1002. Cet item est lié à plusieurs dimensions, mais comme celles-ci influencent très peu les résultats globaux du test, comme le montrent les relativement faibles valeurs propres (ligne pointillée) correspondant aux pics de forte saturation (ligne continue), le fait que la dimensionnalité de l’item soit ou non acceptable est plus une question de contenu que de statistiques. Tous les tests sont dans une certaine mesure multidimensionnels, car tous les items ne peuvent pas tester exactement la même chose. C’est pourquoi, si le tracé en éboulis général ne signale aucun

FIGURE 9.11 Résultats de la dimensionnalité de l’item, MATHC1002, données de PILOT1


178

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

problème, les effets d’une multidimensionnalité ou codépendance des items seront probablement négligeables. Dans notre exemple, tous les items sont conservés pour les analyses ultérieures, car le tracé en éboulis général ne montre aucun problème. Après avoir terminé l’examen des items, cliquez sur Next>> pour passer à l’écran d’analyse du fonctionnement différentiel des items (FDI).

ÉTAPE 6 : FONCTIONNEMENT DIFFÉRENTIEL DES ITEMS L’analyse du FDI examine le degré de stabilité de la FRI d’un item pour différents groupes d’élèves. Si la FRI diffère entre deux groupes (par exemple, les garçons et les filles), les scores estimés avec elle peuvent être biaisés pour un groupe ou pour les élèves ayant certains niveaux de compétence au sein du groupe. L’analyse du FDI tient compte des différences dans la compétence moyenne des groupes, ce qui signifie que les avantages et inconvénients relatifs exprimés par ses résultats sont indépendants des différences de compétence moyenne dans les groupes. Par exemple, si on s’intéresse au biais lié au sexe dans un item particulier, les résultats de l’analyse du FDI peuvent indiquer si celui-ci est biaisé en faveur des garçons ou des filles après prise en compte de la différence liée au sexe du score global. La figure 9.12 montre l’écran d’analyse du FDI. À gauche figurent les quatre contrôles utilisés pour spécifier l’analyse. La liste déroulante du haut vous permet de sélectionner une variable dans la liste des données des réponses non liées à des items de test. Une fois la variable sélectionnée, IATA affiche ses valeurs dans le tableau Possible Values, avec le pourcentage (non pondéré) d’élèves correspondant. Pour sélectionner les groupes à comparer, cliquez d’abord sur la valeur du groupe d’intérêt souhaité, puis sur la valeur correspondant au groupe de référence. La spécification du groupe d’intérêt et du groupe de référence détermine la façon de calculer les statistiques synthétiques. Pour calculer le biais moyen et les statistiques de stabilité, les évaluations utilisent la distribution des compétences de l’échantillon pour le groupe d’intérêt. Pour modifier les groupes d’intérêt et de


ANALYSE DES DONNÉES ISSUES DE L’ADMINISTRATION D’UN TEST PILOTE

| 179

FIGURE 9.12 Résultats de l’analyse du FDI par sexe, MATHC1046, données de PILOT1

référence, cliquez sur les valeurs du tableau Possible Values ; les valeurs choisies pour les groupes d’intérêt et de référence sont mises à jour dans les champs en bas à gauche. Les statistiques de l’analyse du FDI sont plus sensibles pour le groupe d’intérêt, de sorte que la pratique habituelle consiste à s’assurer qu’il est minoritaire ou constitue un groupe historiquement défavorisé. Dans l’exemple suivant, une analyse du FDI est effectuée à l’aide de la variable Sex pour déterminer si les élèves filles (codées 1) sont désavantagées par rapport à leurs homologues masculins (codés 2). Pour spécifier cette analyse et examiner les résultats, effectuez les étapes suivantes : 1. Dans la liste déroulante de gauche, sélectionnez la variable Sex. Le tableau en dessous affiche les valeurs 1,00 et 2,00, avec chacune une proportion de 50 %, indiquant que l’échantillon comprend un nombre égal d’élèves filles et garçons. 2. Dans le tableau des valeurs, cliquez sur 1,00. Le groupe d’intérêt mentionné dans le champ affiché en dessous reçoit la valeur 1,00 (représentant les filles).


180

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

3. Dans le tableau des valeurs, cliquez sur 2,00. Le groupe de référence mentionné dans le champ du bas prend la valeur 2,00 (représentant les garçons). 4. Cliquez sur Calculate et attendez la fin du calcul. 5. Lorsque celui-ci est terminé, dans la liste des items, cliquez sur l’en-tête de la colonne S-DIF pour trier les items sur cette valeur. Après ces étapes, un écran similaire à celui de la figure 9.12 s’affiche. Dans cet exemple, 15 items sont signalés par un symbole d’avertissement ou d’alerte. Les statistiques S-DIF et U-DIF sont fournies pour chaque item. S-DIF décrit la différence verticale moyenne entre les groupes (d’intérêt moins référence) et U-DIF la différence absolue moyenne entre les groupes. La valeur d’U-DIF est toujours positive et supérieure en valeur absolue à celle de S-DIF. Même si un groupe n’affiche aucun avantage systématique (S-DIF est proche de 0), un item peut avoir une relation plus forte avec la compétence dans ce groupe, comme le montre une valeur statistique U-DIF plus élevée. MATHC1035 est un exemple d’item avec une FDI uniforme, où les valeurs absolues de S-DIF et U-DIF sont identiques (voir la figure 9.13). Pour cet item, l’avantage des filles est apparent tout au long de la fourchette de compétence. Cette différence uniforme suggère qu’à niveau de compétence identique, les filles sont plus susceptibles que les garçons d’avoir de meilleurs résultats pour cet item. La statistique S-DIF indique qu’à compétence comparable, la probabilité de réponse correcte des filles est en moyenne supérieure de 23 % à celle des garçons. Dans l’analyse du FDI, les statistiques et les diagrammes ont tendance à être très sensibles à l’erreur d’échantillonnage, qui peut conduire certains items à présenter des différences apparentes n’existant pas nécessairement dans un plus large échantillon. IATA affiche un symbole d’avertissement lorsque le coefficient de variation5 de l’échantillonnage pour la statistique S-DIF est inférieur à 0,2 (indiquant que la différence observée n’est probablement pas due à une erreur d’échantillonnage) ou lorsqu’une très grande différence dans S-DIF ou U-DIF doit être examinée, même dans de petits échantillons. En raison de la sensibilité à l’erreur d’échantillonnage, les résultats graphiques peuvent parfois être trompeurs. Lorsque le nombre de


ANALYSE DES DONNÉES ISSUES DE L’ADMINISTRATION D’UN TEST PILOTE

| 181

FIGURE 9.13 Résultats de l’analyse du FDI par sexe, MATHC1035, données de PILOT1

répondants aux limites supérieures et inférieures de la fourchette de compétence est faible, les réponses d’un ou deux élèves peuvent dicter l’apparence des graphiques à ces extrémités. Comme les statistiques synthétiques sont pondérées à l’aide du nombre d’élèves du groupe d’intérêt à chaque niveau de compétence, elles ne sont pas aussi affectées que les graphiques par les erreurs aléatoires. Le graphique des résultats de MATHC1042 présenté dans la figure 9.14 est un exemple de la façon dont les résultats graphiques peuvent, dans certains cas, être trompeurs. Bien que le graphique suggère un très important désavantage des filles (zone en gris moyen), la statistique S-DIF réelle (-2,01) indique un désavantage relativement faible. Un FDI peut également être observé lorsque le contenu d’un item n’est pas aussi fortement aligné sur la dimension primaire du test que les autres items. Par exemple, en mathématiques, un objectif d’apprentissage commun pour les élèves plus jeunes est la reconnaissance des outils de mesure dans différentes unités (telles que les centimètres, kilogrammes ou degrés centigrades). Même s’ils sont forts en mathématiques, les élèves des zones reculées ou défavorisées peuvent


182

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

FIGURE 9.14 Résultats de l’analyse du FDI par sexe, MATHC1042, données de PILOT1

ne pas avoir la même exposition à ces outils que ceux des zones urbaines. Ils peuvent, par conséquent, être systématiquement désavantagés pour les items de test nécessitant cette connaissance spécifique. Cet inconvénient n’est toutefois pas une propriété des items de test, mais une conséquence d’un désavantage spécifique dans la compétence. Avant de tirer des conclusions à propos des biais en défaveur de certains élèves, des experts du contenu des programmes de cours, sensibles aux éventuelles différences ethniques, géographiques ou de sexe doivent examiner les items de test pour confirmer qu’un biais détecté dans les données statistiques correspond aux conclusions d’une analyse du contenu. L’analyse du FDI doit être effectuée pour toutes les caractéristiques démographiques et tous les groupes qui seront comparés dans les principales analyses des résultats. La présence d’un FDI pour une caractéristique n’a généralement aucun rapport avec la présence ou l’absence d’un FDI pour une autre caractéristique. Habituellement, les variables les plus importantes à considérer dans l’analyse du FDI sont les variables de stratification de l’échantillon (telles que la région)


ANALYSE DES DONNÉES ISSUES DE L’ADMINISTRATION D’UN TEST PILOTE

| 183

ou les variables du questionnaire contextuel. Les données de PILOT1 comprennent trois variables démographiques : Sex, Language et Region. En tant qu’exercice supplémentaire, vous pouvez effectuer des analyses du FDI pour Language et Region en suivant les mêmes étapes que pour Sex et en veillant à sélectionner le groupe minoritaire comme groupe d’intérêt, puis en cliquant sur Calculate pour mettre à jour les résultats. La figure 9.15 montre le résultat d’une analyse du FDI couramment obtenu pour un test administré dans la langue parlée à la maison par certains élèves, mais pas par tous. Les résultats proviennent de l’analyse du FDI pour l’item MATHC1006. Celui-ci est un exemple extrême de FDI où la réponse correcte est fortement liée à la maîtrise de la langue dans une population (dans ce cas, Language = 2) et a une relation faible ou inexistante dans l’autre (Language = 1). L’analyse IATA du FDI peut servir d’outil de recherche pour déterminer si certains groupes d’élèves ont des problèmes avec des

FIGURE 9.15 Résultats de l’analyse du FDI par langue parlée à la maison par les élèves, MATHC1006, données de PILOT1


184

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

sous-domaines spécifiques. L’analyse du FDI peut également faciliter la compréhension des différences éventuellement introduites dans les versions linguistiques d’un test traduit. La mise en évidence statistique d’un FDI peut être utilisée pour aider les traducteurs à corriger les erreurs de traduction relevées pendant le test pilote ou l’essai. Le but principal de l’analyse du FDI est de susciter la discussion et l’examen des items pilotes et de guider l’interprétation des résultats. Pour chaque analyse du FDI réalisée, IATA enregistre les résultats dans un tableau de données6. Ces résultats, ainsi que les graphiques particulièrement intéressants, doivent être copiés,7 enregistrés et partagés avec les spécialistes du contenu des programmes de cours afin de trouver les possibles explications des différences observées entre les groupes d’intérêt et de référence. S’il est clairement établi qu’un item est biaisé, il doit être exclu des spécifications de l’analyse dans la page 2 d’IATA, et l’analyse précédente doit être à nouveau exécutée. Enfin, parce que les résultats des analyses du FDI sont notoirement sensibles à l’erreur d’échantillonnage, toute décision d’intégrer ou non un item particulier dans la version définitive d’un test, fondée sur la suspicion d’une différence, doit être accompagnée d’une solide justification liée au programme de cours ou au contenu de l’item. Pour la suite de notre exemple, aucun item de test n’est exclu. Après avoir effectué les analyses du FDI et examiné les résultats, cliquez sur Next>>.

ÉTAPE 7 : EXAMEN DES ÉCHELLES DE SCORES La technique consistant à utiliser une mesure numérique pour interpréter la performance à un test est appelée détermination d’une échelle. IATA exprime les résultats de test à l’aide des échelles de scores suivantes : PercentScore, Percentile, RawZScore, ZScore, IRTscore et TrueScore. Elles sont décrites plus en détail dans le tableau 8.1. Dans chacune, la performance est exprimée soit sur une échelle allant de 0 à 100 soit sur une échelle standard avec une moyenne de 0 et un écart-type de 1. Utilisez l’échelle qui convient le mieux à vos objectifs de communication des résultats. Les différentes parties prenantes


ANALYSE DES DONNÉES ISSUES DE L’ADMINISTRATION D’UN TEST PILOTE

| 185

peuvent préférer des types d’échelle différents. En général, IRTscore est l’échelle la plus utile pour la plupart des objectifs, mais du point de vue de la communication, elle présente l’inconvénient d’attribuer un score négatif à environ la moitié des élèves. De nombreux intervenants ignorant comment interpréter les scores négatifs, il est préférable de créer une autre échelle pour qu’aucun score des élèves n’ait une valeur inférieure à zéro. L’écran permettant d’examiner une échelle de scores et d’en créer de nouvelles est présenté dans la figure 9.16. Sur le côté gauche apparaissent une liste déroulante et une fenêtre graphique. La liste permet de choisir le type d’échelle à utiliser pour tracer la distribution des scores. La figure montre le graphique obtenu pour l’échelle de scores sélectionnée, PercentScore. Dans la partie droite, un tableau affiche les statistiques synthétiques correspondantes. En bas à droite, un ensemble de champs permet de redéfinir l’échelle IRTscore en spécifiant une nouvelle déviation standard et une nouvelle moyenne. La procédure de redéfinition de l’échelle ne s’applique qu’à IRTscore, la principale échelle de scores d’IATA.

FIGURE 9.16 Écran d’examen et de définition d’une échelle


186

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

Distribution des scores et fonction d’information du test IATA affiche la distribution des scores sous la forme d’histogrammes où chaque tranche de scores est représentée par une barre d’une hauteur proportionnelle à la part des élèves ayant obtenu un score appartenant à cette tranche. Pour les échelles de scores dont la moyenne est d’environ 0 et l’écart-type d’environ 1 (StandardizedZscore, RawZScore et IRTscore), IATA trace également la fonction d’information du test sous la forme d’une ligne pleine. Elle décrit la précision du test aux différents niveaux de compétence de l’échelle standard utilisée pour les items. Elle est inversement proportionnelle à l’erreur-type de mesure : si l’information du test est élevée, l’erreur-type de mesure est faible. La fonction d’information du test doit être interprétée à la lumière des besoins spécifiques ou de l’objectif du test. Si celui-ci est, par exemple, d’identifier les élèves peu performants, un test plus précis pour les élèves très performants serait inadapté et ne fournirait pas une mesure adéquate pour identifier les élèves peu performants. En général, l’erreur moyenne de mesure pour l’ensemble des élèves est minimisée si la fonction d’information du test est légèrement plus large, mais a la même forme et la même position que la distribution des compétences des élèves évalués. La comparaison de la fonction d’information et de la distribution des scores indique si le test tirerait un avantage d’une modification de l’équilibre des items en vue d’obtenir une plus grande précision pour les élèves très ou peu performants. Statistiques synthétiques Pour chaque échelle de scores au test, IATA produit les statistiques synthétiques suivantes : 1. moyenne ; 2. écart-type ; 3. asymétrie ; 4. kurtosis ; 5. intervalle interquartile ; 6. 25e centile ; 7. médiane ;


ANALYSE DES DONNÉES ISSUES DE L’ADMINISTRATION D’UN TEST PILOTE

| 187

8. 75e centile ; 9. taux de réponse ; 10. fiabilité ; 11. nombre total de répondants ; 12. nombre d’items dans le test ; 13. nombre d’items inclus dans l’analyse. Les huit premières statistiques décrivent la distribution des scores estimés. Utilisez la barre de défilement à droite du tableau des statistiques et valeurs (voir la figure 9.16) pour afficher les cinq dernières lignes. Ces statistiques aident à déterminer l’adéquation de l’échelle de scores à diverses fins (par exemple, l’analyse statistique secondaire ou la présentation par quantile). Ces cinq statistiques décrivent les conditions d’exécution de l’analyse et fournissent une note holistique du test, à vérifier pour confirmer que l’analyse a été effectuée sur les bonnes données et avec des spécifications correctes. Le taux de réponses (Response rate) donne le nombre moyen de réponses valides (non manquantes) pour chaque item. La fiabilité (Reliability) correspond à la précision moyenne du test pour un échantillon donné d’élèves. Les valeurs de ces deux statistiques synthétiques sont comprises entre 0 et 1 et doivent être aussi élevées que possible. Le nombre d’items inclus dans l’analyse (Number of items included in the analysis) reflète le fait que certains items peuvent être exclus s’ils sont considérés comme inadéquats en raison d’une mauvaise formulation, parce qu’ils sont source de confusion pour les élèves ou à cause d’autres insuffisances techniques. Dans notre exemple, le nombre de répondants est 262, le nombre d’items 80, et le nombre d’items acceptables 79 (l’item MATHC1075 a été exclu de l’analyse). L’écran relatif aux échelles est plus utile pour les administrateurs de l’évaluation finale que du test pilote. L’échantillon non pondéré du test pilote n’étant pas représentatif, la distribution des résultats ne peut être généralisée à la population. De plus, aucun résultat du test n’étant appelé à être communiqué, il n’est pas nécessaire de générer des échelles de scores dérivées. Les autres résultats de l’écran d’examen et de définition d’une échelle ne sont pas pertinents pour l’analyse des données de PILOT1. Cliquez sur Next>> pour continuer vers l’étape suivante.


188

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

ÉTAPE 8 : SÉLECTION DES ITEMS DE TEST La sélection optimale des items à l’aide du logiciel IATA est possible quand un fichier de données des items a été chargé ou créé lors de l’analyse des données des réponses. IATA peut sélectionner automatiquement les items sur la base de leurs caractéristiques statistiques, afin de générer le test le plus efficace possible pour une durée et un but donnés. Le principe de base de la mise au point d’un test basée sur la TRI est que le concepteur du test a certaines attentes en matière d’erreur de mesure que le test peut enregistrer aux différents niveaux de compétence ainsi que des exigences concernant l’équilibre du contenu du test. En général, plus le nombre d’items inclus dans un test est élevé, plus celui-ci génère de l’information sur les niveaux de compétence des élèves examinés. Malheureusement, un test comprenant trop d’items n’est généralement ni pratique ni souhaitable ; il peut inutilement perturber la vie des établissements, causer de la fatigue chez les élèves testés et diminuer leur motivation, entraînant ainsi des résultats moins précis. Un test trop long est également coûteux à mettre au point, administrer, corriger et traiter. Pour être efficace, un test ne doit comprendre que les items les plus instructifs du réservoir des items disponibles. IATA peut aider à élaborer un test avec le nombre minimum d’items nécessaires pour répondre aux besoins des responsables des politiques et autres parties prenantes. La détermination du niveau acceptable d’erreur-type dépend de l’objectif de l’évaluation. L’idéal serait de pouvoir construire un test avec un niveau de précision élevé à tous les niveaux de compétence. Il nécessiterait toutefois beaucoup d’items et allongerait ainsi le temps passé par les élèves. Il aurait pour effet de réduire la validité de ses résultats à cause d’une fatigue et d’un ennui des élèves susceptibles d’influencer leurs scores. Lorsqu’un test est normalisé, une information détaillée (et une plus faible erreur de mesure) est requise à tous les niveaux de compétence. Par contre, s’il est fondé sur des critères, l’information n’est requise qu’autour des seuils de compétence pour lesquels des décisions seront prises. La sélection des items au cours de la phase pilote ne doit pas être uniquement déterminée par les résultats de l’analyse statistique. La validité de l’interprétation des résultats est l’aspect le plus


ANALYSE DES DONNÉES ISSUES DE L’ADMINISTRATION D’UN TEST PILOTE

| 189

important de l’élaboration d’un test national d’évaluation. Les items d’un test doivent représenter de façon adéquate et précise le domaine évalué. Les outils les plus importants pour la validité d’un test sont le cadre théorique et le tableau des spécifications, ou plan détaillé, du test. Ce plan aide à déterminer l’équilibre entre les niveaux de contenu et de compétence cognitive à intégrer dans le test (voir Anderson et Morgan, 2008). La figure 9.17 montre l’écran de sélection des items de test optimaux. Sur la gauche, une liste déroulante permet de choisir la source des items à sélectionner. Elle contient toutes les sources de données disponibles et est automatiquement alimentée par IATA sur la base des données chargées et des analyses effectuées (voir le tableau 8.5). Dans notre exemple, la source choisie est Items1, contenant les résultats de l’analyse en cours.8 Sous cette liste déroulante, deux champs servent à spécifier le nom à donner à la sélection des items et le nombre total d’items à sélectionner. Sous ces champs, un tableau affiche la liste des items calibrés figurant dans la source de données choisie, avec leur niveau de compétence (Level) et leur domaine de contenu (Content).

FIGURE 9.17 Résultat de la sélection des items, 50Items, données de PILOT1


190

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

Ces deux données, lues par IATA dans un fichier de données des items, peuvent être directement modifiées à la main dans le tableau. Le processus de sélection statistique n’exige pas de spécifications pour Level et Content, mais le fait de disposer d’une information détaillée pour chaque item aide à optimiser la sélection des items tout en maintenant la représentation voulue du contenu. Cochez la case placée à gauche du nom de l’item pour forcer IATA à sélectionner un item, quelles que soient ses propriétés statistiques. Sous le tableau des items, deux curseurs vous permettent de définir la fourchette de compétence pour laquelle vous souhaitez maximiser la précision du test. Par défaut, ces curseurs sont réglés de façon à ce que la limite inférieure corresponde au 2e centile de compétence et la supérieure au 98e (la valeur sélectionnée est affichée à droite de chaque curseur). En fonction de vos objectifs d’évaluation, vous pouvez rétrécir la plage où la précision sera maximale en modifiant ses limites. IATA sélectionne les items pour minimiser l’erreur-type moyenne de mesure dans cette fourchette de compétence, en supposant que la distribution de la compétence dans l’échantillon des élèves à évaluer est normale. Le but principal du test pilote est d’identifier les items qui seront les plus utiles dans l’administration finale de l’évaluation nationale. Si la compétence des élèves de l’échantillon pilote est perçue comme supérieure à la moyenne, cette perception doit être prise en compte dans la sélection des items. En gardant à l’esprit que vous souhaitez créer un test final de 50 items, saisissez les spécifications suivantes dans IATA : 1. Dans le champ Name of item selection, tapez 50Items (ce nom est arbitraire et est utilisé ici pour pouvoir comparer les résultats obtenus avec ceux du répertoire des données de l’échantillon IATA). 2. Dans le champ Total number of items, saisissez la valeur 50. 3. Déplacez le curseur Upper bound pour qu’il affiche la valeur 80. Elle indique que la sélection des items ne tentera pas de maximiser la précision au-delà du 80e centile de la distribution de la compétence de l’échantillon. Ce paramètre est choisi pour compenser la possibilité d’une compétence plus élevée dans l’échantillon pilote que dans la population générale. 4. Cliquez sur Select Items.


ANALYSE DES DONNÉES ISSUES DE L’ADMINISTRATION D’UN TEST PILOTE

| 191

Lorsqu’IATA a terminé sa tâche, l’écran doit ressembler à celui de la figure 9.17. Dans la liste des items figurant à gauche apparaissent les 50 items sélectionnés (le dernier est MATHC1041). Dans la partie droite, le graphique affiche l’information collective et l’erreur de mesure attendue pour les items sélectionnés s’ils étaient administrés dans le test. Les résultats indiquent que la sélection des items est plus précise autour d’un score de compétence voisin de zéro (compétence moyenne de l’échantillon). En dessous du graphique, le tableau résume la distribution des items sélectionnés en fonction des domaines de contenu et des niveaux cognitifs (pour ces données, tous les items ont reçu par défaut la valeur 1. Ces valeurs peuvent être modifiées directement dans le tableau des items ou chargées dans le fichier initial des données des items). Si les données de ce tableau indiquent que la sélection statistiquement optimale ne correspond pas correctement au plan détaillé du test, vous pouvez modifier l’équilibre du contenu en sélectionnant ou excluant manuellement des items, en cochant ou décochant les cases placées à gauche de leur nom dans le tableau. La sélection manuelle des items met automatiquement à jour le résumé des propriétés du test affiché à droite. La sélection des items est également enregistrée dans IATA comme un tableau de données des items dénommé CustomTest50ItemsA. Comme pour tous les résultats produits par IATA, vous pouvez afficher et exporter ce tableau de données en allant jusqu’au dernier écran de la séquence de tâches (voir l’étape 10 : Affichage et enregistrement des résultats). Les items du tableau sont triés par ordre décroissant de leur adéquation aux critères de sélection. Étant donné le petit nombre d’items de notre analyse, IATA peut être utilisé simplement pour trier tous les items par ordre d’adéquation à la fourchette de compétence spécifiée (c’est-à-dire en dessous du 80e centile de notre échantillon). L’équipe de mise au point du test peut alors examiner le fichier des items et, pendant la sélection pour le test final, utiliser le classement des items par ordre d’adéquation, tout en étant assurée qu’un équilibre approprié est maintenu dans le contenu. Procédez comme suit pour créer une nouvelle sélection d’items : 1. Cliquez sur Clear pour supprimer toutes les sélections précédentes de la liste des items.


192

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

2. Saisissez le nom 79Items pour la nouvelle sélection (si le nom est déjà utilisé, les résultats précédents seront écrasés). 3. Saisissez le nombre maximum d’items disponibles (79) en tant que nombre total d’items. Si vous introduisez un nombre supérieur au nombre d’items disponibles, IATA ne sélectionnera que les items disponibles. 4. Laissez la limite supérieure à 80, car la fourchette de compétence cible n’a pas changé. 5. Cliquez sur Select Items. La figure 9.18 présente quelques-uns des résultats de l’analyse des 79 items pilotes. Un tableau des résultats (appelé CustomTest79Items) a été ajouté à l’ensemble des résultats IATA et peut être consulté dans le dernier écran de la séquence de tâches. Les concepteurs du test peuvent utiliser cette information pour améliorer la qualité des items en identifiant et excluant les items les moins efficaces. Le processus de sélection dépend de la qualité des items disponibles. IATA est incapable d’améliorer la précision dans une fourchette

FIGURE 9.18 Résultat de la sélection des items, 79Items, données de PILOT1


ANALYSE DES DONNÉES ISSUES DE L’ADMINISTRATION D’UN TEST PILOTE

| 193

spécifique de compétence si aucun item ne dispose d’information dans cette fourchette. Le processus automatisé peut aider à sélectionner les meilleurs items disponibles, mais ne peut rendre les items plus précis. Après examen des résultats, cliquez sur Next>> pour continuer.

ÉTAPE 9 : NORMES DE PERFORMANCE Au stade pilote, trop peu de données existent pour soutenir la détermination de normes de performance. Même si une certaine information est disponible sur les propriétés statistiques des items et les spécifications utilisées pour créer les items, aucune ne donne de détails sur la distribution de la compétence dans la population des élèves. Toute tentative de détermination de normes de performance au stade pilote serait par conséquent inutile et potentiellement trompeuse. Comme notre exemple d’analyse des données d’un test pilote ne nécessite aucune détermination de normes, cliquez sur Next>> pour aller vers l’écran d’affichage et d’enregistrement des résultats.

ÉTAPE 10 : AFFICHAGE ET ENREGISTREMENT DES RÉSULTATS Pour toutes les séquences de tâches d’analyse, IATA produit un certain nombre de résultats sous la forme de tableaux de données. Ces résultats peuvent être visualisés et sauvegardés dans le dernier écran de chaque séquence de tâches. Vous pouvez y examiner chacun des tableaux de données des résultats obtenus pendant la séquence des tâches d’analyse. L’écran affiche le tableau sélectionné dans la liste déroulante. Pour changer la source des données, sélectionnez un tableau différent dans cette liste, comme montré dans la figure 9.19 (le tableau 8.5 donne la liste complète et la description des tableaux qui peuvent être produits par IATA). Bien que la création des normes de performance n’ait pas été demandée, le tableau PLevels a néanmoins été automatiquement créé à l’aide des valeurs spécifiées par défaut. Vous pouvez enregistrer ces tableaux de résultats dans un ou plusieurs fichiers de sortie en cliquant sur Save Data. Vous pouvez


194

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

FIGURE 9.19 Examen des résultats de l’analyse, données de PILOT1

enregistrer un seul tableau ou tous les tableaux à la fois dans divers formats. Deux formats de fichiers sont recommandés pour la sauvegarde des résultats IATA : Excel (*.xls, *.xlsx) et SPSS (*.sav). De façon générale, Excel est préférable, car tous les tableaux de données peuvent être sauvegardés dans un même fichier. Les fichiers Excel peuvent également être ouverts dans des logiciels gratuits tels qu’OpenOffice (téléchargeable à partir du site http://www.openoffice.org). Toutefois, les premières versions d’Excel sont limitées à un maximum de 255 variables. Si un fichier de données comprend plus de variables, IATA ne sauvegarde que les 255 premières dans le fichier *.xls. Pour enregistrer des fichiers de données plus grands, utilisez le format *.sav ou *.xlsx. Les fichiers SPSS ont l’avantage de pouvoir stocker efficacement de plus grands tableaux de données ainsi que des métadonnées (si elles sont traitées par le logiciel SPSS). Notons toutefois une importante limitation de SPSS : chaque tableau de données est enregistré dans un fichier séparé. Dans IATA, une fenêtre de dialogue vous demande de spécifier le nom, l’emplacement et le format du fichier de résultat. Introduisez


ANALYSE DES DONNÉES ISSUES DE L’ADMINISTRATION D’UN TEST PILOTE

| 195

ces informations et cliquez sur Save pour terminer l’enregistrement du ou des tableaux.9 Les fichiers résultants contiennent tous les résultats tabulaires produits pendant l’entièreté de la séquence des tâches d’analyse, constituant ainsi la documentation de l’analyse. Pour référence, les résultats de notre exemple d’analyse du tableau Items1 sont contenus dans le fichier ItemDataAllTests.xls. La feuille de calcul contenant les données du tableau Item1 a été renommée ReferenceP1. Dans les résultats enregistrés, les valeurs True (vrai) et False (faux) dans la colonne E (OK) indiquent les items intégrés dans l’analyse finale. Dans ces résultats, seul MATHC1075 a la valeur False. Pour une réelle analyse d’un test pilote (une analyse n’utilisant pas des données fictives), les tableaux de résultats et les graphiques qui ont été copiés et collés pendant la séquence des tâches d’analyse doivent être communiqués aux concepteurs du test, qui pourront les utiliser pour modifier le test en sélectionnant, triant et ajoutant, si nécessaire, des items afin de maximiser la précision et l’utilité du test final.

NOTES 1. Voir le tableau 8.6 pour une description des symboles et leur signification. 2. Une saturation égale à 1 est irréaliste, car elle requiert que chaque répondant obtienne le même score à chaque item. Cette exigence implique que le test ne pourrait donner que deux valeurs de score distinctes, ce qui n’est pas très instructif. 3. Les valeurs affichées dans IATA ont été normalisées pour exprimer la proportion de la variance totale prise en compte pour chaque valeur propre. 4. En cliquant deux fois sur l’en-tête, l’ordre de tri passe à décroissant. 5. Le coefficient de variation de l’échantillonnage est calculé en divisant l’erreur-type de la statistique S-DIF par la valeur absolue de S-DIF. 6. Tous les résultats de notre exemple sont disponibles pour référence et comparaison dans le tableur Excel ReferencePILOT1.xls enregistré dans le répertoire des données de l’échantillon IATA. Les tableaux de résultats de l’analyse du FDI se trouvent dans des feuilles de calcul dont le nom commence par DIF_.


196

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

7. On peut copier les graphiques de l’analyse du FDI en plaçant le curseur sur le diagramme et en utilisant les fonctions Copy et Paste du menu activé par la touche droite de la souris. 8. Pour les analyses impliquant une liaison, sélectionnez à partir des données des items préalablement calibrés (Items2) ou de l’ensemble des items communs à deux sources de données des items (MergedItems). 9. Lorsque tous les tableaux doivent être sauvegardés avec un format de sortie SPSS (*.sav), chaque tableau de résultats est exporté dans un fichier de données (*.sav) séparé, avec un nom identique à celui du tableau, préfixé par le nom introduit.


10

CHAPITRE

ANALYSE COMPLÈTE DES DONNÉES ISSUES DE L’ADMINISTRATION FINALE D’UN TEST

Utilisez l’ensemble de données de l’échantillon CYCLE1 pour effectuer cet exercice. La clé de codage du test se trouve dans la feuille de calcul CYCLE1 du classeur Excel ItemDataAllTests.xls. Les analyses présentées dans ce chapitre sont basées sur la performance des élèves à une évaluation nationale de mathématiques administrée à un échantillon national d’élèves. Le test final comptait 50 items, représentant cinq domaines (connaissance des nombres, formes et espace, relations, résolution de problèmes, et incertitude) dans les proportions déterminées par les spécifications du test. Le plan d’échantillonnage final était un échantillon en grappes stratifié, avec les établissements comme unité primaire d’échantillonnage et un échantillon cible de 30 élèves tirés de chaque établissement. L’échantillon de 79 établissements était constitué pour être représentatif des cinq régions nationales et stratifié en fonction du statut rural/ urbain et de la langue d’enseignement. L’échantillon comptait un total de 2 242 élèves, pour représenter une population d’environ 86 000 individus. Le présent exercice suit les mêmes étapes que l’analyse des données du test pilote présentée dans le chapitre 9. Le test final étant

197


198

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

principalement conçu pour produire et interpréter des scores, l’analyse des items ne comprend généralement pas l’aspect exploratoire de l’analyse des données pilotes. Notre exercice se concentre par conséquent sur les aspects de l’analyse des données du test final qui la distinguent de celle des données pilotes. Outre les analyses effectuées à l’aide des données pilotes, les analyses des données de test complètes, présentées dans ce chapitre, comprennent le calcul des échelles de scores et des normes de performance. Lorsque les étapes de l’analyse sont identiques à celles décrites dans le chapitre 9, reportez-vous à celui-ci. Commencez l’analyse en cliquant sur Response data analysis dans le menu principal d’IATA.

ÉTAPE 1 : SPÉCIFICATION DE L’ANALYSE Les procédures de spécification de l’analyse sont similaires à celles décrites dans le chapitre 9. Pour commencer, chargez un fichier de réponses, puis un fichier de données des items et ensuite, spécifiez l’analyse. Si nécessaire, reportez-vous aux étapes 1 à 3 du chapitre 9 pour des instructions détaillées. Le répertoire des données de l’échantillon IATA contient les fichiers suivants : • le fichier de données des réponses pour le présent chapitre est CYCLE1.xls (contenant 2 242 enregistrements et 58 variables) ; • le fichier de données des items se trouve dans le tableau CYCLE1 du tableur Excel ItemDataAllTests.xls. Assurez-vous que le bon nom de tableau est sélectionné dans l’écran de chargement des données des items. (Le fichier des items CYCLE1 compte 50 enregistrements.) Les items du test d’évaluation nationale sont un sous-ensemble des items pilotes décrits dans le chapitre 9. Les spécifications de l’analyse sont légèrement différentes de celles de l’analyse des données pilotes, principalement en raison de l’utilisation d’un échantillonnage probabiliste pour l’administration complète de l’évaluation nationale. La première différence est le nom de la variable d’identification, CYCLE1STDID. La deuxième


ANALYSE COMPLÈTE DES DONNÉES ISSUES DE L’ADMINISTRATION FINALE D’UN TEST

| 199

est la présence du poids déterminé par le plan d’échantillonnage CYCLE1weight, qui affectera les résultats de l’analyse. Ces variables doivent être sélectionnées dans les listes déroulantes correspondantes. Pour ces données, le code 9 représente les réponses manquantes, qui sont traitées comme incorrectes. Après la saisie des spécifications, l’écran doit ressembler à la figure 10.1. Notons que les données des items de l’évaluation finale comprennent un champ Level (troisième colonne du tableau de gauche). Les données qu’il contient sont des nombres naturels (supérieurs ou égal à 1) qui représentent le niveau de performance ou de compétence attendu que les spécialistes du contenu des programmes de cours ont attribué à chaque item de test. Le niveau 1 est le niveau de performance le plus bas (c’est-à-dire la compétence minimale), et le niveau 4, le plus élevé. Bien qu’un niveau soit attribué à chaque item, il est possible que certains élèves n’atteignent même pas le niveau le plus bas. Après avoir vérifié que les spécifications et les données sont correctes, cliquez sur Next>> pour continuer. L’analyse démarre automatiquement

FIGURE 10.1 Spécifications de l’analyse, données de CYCLE1


200

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

et son état d’avancement s’affiche régulièrement à l’écran. Lorsque les ensembles de données utilisés sont plus grands ou les ordinateurs plus lents, l’analyse peut sembler ralentir à l’étape d’estimation des paramètres, qui prend le plus de temps. Ne fermez pas le programme, IATA continuera de travailler et mettra l’écran à jour une fois l’analyse terminée.

ÉTAPE 2 : RÉSULTATS DE BASE DE L’ANALYSE Après leur identification et exclusion pendant l’analyse des données pilotes, plus aucun des items posant problème ne figure dans l’ensemble de données complet. Vérifiez que les items se comportent de manière appropriée en examinant a) l’analyse des items (écran IATA 4 sur 10) et b) les résultats de la dimensionnalité du test (écran IATA 5 sur 10). Pour les instructions sur la façon d’accomplir ces étapes, reportez-vous aux étapes 4 et 5 décrites dans le chapitre 9. Notez que tous les items figurant dans l’écran IATA 4 sur 10 sont accompagnés de cercles (verts), à l’exception de MATHC1046, qui a été identifié comme quelque peu problématique au chapitre 9, mais malgré tout conservé dans le test. Passez à l’écran du fonctionnement différentiel des items (DIF) (écran IATA 6 sur 10) lorsque vous avez terminé.

ÉTAPE 3 : ANALYSE DU FONCTIONNEMENT DIFFÉRENTIEL DES ITEMS Bien que l’analyse du fonctionnement différentiel des items (DIF) ait été effectuée à l’aide des données du test pilote, il est conseillé de recommencer les analyses sur l’échantillon complet, parce que les résultats de l’analyse DIF sont généralement sensibles aux erreurs d’échantillonnage. Une autre raison de refaire l’analyse DIF est le fait que l’échantillon complet peut comprendre des variables qui n’étaient pas disponibles dans l’échantillon pilote, et que l’échantillon offre un nombre de cas plus satisfaisant. L’analyse DIF est effectuée ici pour examiner la possibilité d’un biais indiquant que les élèves des zones rurales sont défavorisés par rapport à ceux des zones urbaines. Dans les données de CYCLE1,


ANALYSE COMPLÈTE DES DONNÉES ISSUES DE L’ADMINISTRATION FINALE D’UN TEST

| 201

un indicateur prend la valeur 1 lorsque l’élève fréquente un établissement rural et la valeur 0 pour un établissement urbain. Pour spécifier cette analyse et examiner les résultats, suivez les étapes suivantes : 1. Dans la liste déroulante de gauche, sélectionnez la variable Rural. Le tableau figurant juste en dessous est rempli avec les codes 0,00 et 1,00 accompagnés, respectivement, de 56 % et 44 %, le pourcentage (non pondéré) d’élèves fréquentant le type d’établissement. 2. Dans le tableau des valeurs, cliquez sur 1,00. La valeur 1,00 (représentant les élèves ruraux) apparaît dans la zone de texte spécifiant le groupe d’intérêt. 3. Dans le tableau des valeurs, cliquez sur 0.00. La valeur 0,00 (représentant les élèves urbains) apparaît dans la zone de texte spécifiant le groupe de référence. 4. Cliquez sur Calculate et attendez que le calcul soit terminé. 5. Lorsque celui-ci est achevé, cliquez sur l’en-tête de la colonne S-DIF de la liste des items pour les trier sur la valeur de la statistique S-DIF. Lorsque ces étapes sont terminées, l’écran affiché correspond à celui de la figure 10.2. La plupart des valeurs de S-DIF et U-DIF sont inférieures à 5, indiquant qu’après la prise en compte des différences de compétence entre les élèves des zones rurales et urbaines, les différences de performance aux items sont généralement négligeables entre ces deux catégories d’élèves. La réalisation de l’analyse DIF à la dernière étape d’une évaluation nationale a pour but de déterminer si un item devrait être exclu du calcul des scores des élèves. À ce stade, il convient de partager les résultats de l’analyse statistique avec le comité directeur de l’évaluation nationale ; celui-ci déterminera si les items potentiellement problématiques doivent ou non être éliminés. Si un item est exclu, l’analyse doit être relancée soit après avoir supprimé sa clé de codage dans l’écran de spécification de l’analyse, soit après avoir décoché l’item dans l’interface d’analyse des items. Dans notre exemple, on suppose que tous les items sont retenus. Après avoir examiné tous les items, cliquez sur Next>> pour continuer.


202

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

FIGURE 10.2 Résultats de l’analyse DIF par zone, données de CYCLE1, MATHC1043

ÉTAPE 4 : DÉFINITION D’ÉCHELLES L’échelle par défaut utilisée pour calculer les résultats selon la théorie de la réponse à l’item (TRI) est la norme (échelle Z) ayant une moyenne de 0 et un écart-type de 1. De nombreuses parties prenantes semblent éprouver des difficultés avec cette échelle de scores, parce qu’environ une moitié des élèves y auront des scores négatifs. Les scores exprimés dans une fourchette allant de 0 à 100 présentent eux aussi des problèmes de communication : dans l’esprit d’un bon nombre de personnes, un score de 50 représente la note minimale de passage en classe supérieure, ce qui n’est pas nécessairement le cas dans les spécifications du test. À des fins de communication, il n’est pas toujours souhaitable de communiquer les résultats des tests à l’aide d’échelles où des scores peuvent être inférieurs à la moyenne de 50 % ou inférieurs à zéro. Certaines évaluations à grande échelle transforment leurs scores en échelles ayant une moyenne de 500, 100 ou 50, avec des écarts-types respectifs de 100, 20 et 10. Chaque équipe d’évaluation nationale


ANALYSE COMPLÈTE DES DONNÉES ISSUES DE L’ADMINISTRATION FINALE D’UN TEST

| 203

doit choisir le type d’échelle de scores le plus susceptible de faciliter une communication efficace des résultats. La définition d’une échelle peut être réalisée de deux façons dans IATA : la spécification de l’échelle ou le changement d’échelle. La spécification d’une échelle vous permet de préciser la moyenne et l’écart-type souhaités. Le changement d’échelle vous permet d’appliquer une transformation linéaire simple aux scores TRI, ce qui est utile lorsque l’échelle de scores doit être comparée à une échelle définie au cours d’une analyse précédente. Dans ce cas, les paramètres des items du cycle précédent peuvent être utilisés pour estimer les scores au test ou aligner les résultats des données des élèves dans le nouveau cycle, afin que les scores TRI qu’IATA calcule soient comparables aux scores TRI calculés dans le cycle précédent. L’échelle des scores calculés peut alors être modifiée à l’aide de la fonction de changement d’échelle, afin d’être comparable à l’échelle spécifiée dans le cycle précédent. Dans les deux cas, pour que la nouvelle échelle de scores puisse être créée, le nom du nouveau score, l’écart-type et la moyenne doivent être introduits dans les champs appropriés. Lorsque vous cliquez sur le bouton Calculate, IATA calcule les nouveaux scores pour cette échelle et affiche la distribution et les statistiques synthétiques de celles-ci. Contrairement à l’analyse du test pilote, dont la principale fonction est d’éclairer la conception des tests, la fonction première de l’analyse des données de test d’une évaluation nationale est de produire des scores. Notre exercice requiert par conséquent un examen et une spécification plus approfondis des propriétés des scores aux tests, à l’aide de l’écran de définition des échelles. Premièrement, la comparaison entre la distribution des scores de compétence et l’exactitude du test pour chacun de ces scores (aussi appelée fonction d’information du test) donne une idée de la qualité de l’inférence qui peut être tirée au sujet des différentes fourchettes de compétence. Deuxièmement, la création d’une échelle de publication pour le test définit une métrique pour la communication des résultats aux parties concernées. Le graphique de la figure 10.3 montre que l’information du test, représentée par la ligne noire continue, colle bien à la distribution de la compétence dans l’échantillon. Le petit pic de fréquence situé


204

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

FIGURE 10.3 Distribution de la compétence (score TRI) et information du test, données de CYCLE1

à gauche du graphique, à environ -3 sur l’échelle de compétence, correspond aux élèves qui n’ont répondu correctement à aucun item du test. Aucune information suffisante n’existe pour déterminer à quel point les niveaux de compétence de ces élèves sont bas ; et ces derniers reçoivent par conséquent tous le même score arbitrairement faible. Pour examiner la distribution des scores TRI, sélectionnez IRTscore dans la liste déroulante située au-dessus du diagramme. L’écran est mis à jour avec les statistiques détaillées des scores TRI et l’information du test, comme le montre la figure 10.3. La moyenne de la distribution d’IRTscore est -0,02, et son écart-type 1,08. Ces valeurs ne sont pas significatives par elles-mêmes, parce qu’elles représentent l’échelle arbitraire sur laquelle les items ont été calibrés. Comparez ces résultats avec la forme statistiquement idéale de la fonction d’information du test, du point de vue de la maximisation de la fiabilité globale du test pour une population distribuée normalement (montrée dans la figure 10.4). À titre de comparaison,


ANALYSE COMPLÈTE DES DONNÉES ISSUES DE L’ADMINISTRATION FINALE D’UN TEST

| 205

FIGURE 10.4 Comparaison de l’information idéale du test et de la distribution normale

densité relative de la distribution

information relative

–4

–3

–2

–1

0

1

2

3

4

compétence information du test

distribution normale

la distribution normale standard est représentée par une ligne en pointillés. Idéalement, le maximum d’information doit être disponible pour les niveaux de compétence regroupant beaucoup d’élèves, mais il faut aussi suffisamment d’information pour pouvoir distinguer les élèves peu et très performants. Nos résultats indiquent également que le test a été relativement difficile pour les élèves. Le pic de la fonction d’information se situe dans la région de compétence où les élèves sont le plus susceptibles d’obtenir un score de 50 %. Dans la figure 10.3, ce pic est légèrement supérieur au score moyen de -0,02, indiquant ainsi qu’au-dessus de la moyenne, les élèves ont tendance à n’obtenir que 50 % de bonnes réponses. Pour produire une échelle de publication plus utile sur la base du score TRI, utilisez la fonction Add New Scale Score figurant dans le coin inférieur droit de l’interface (voir la figure 10.3). Dans notre exemple, supposons que le comité directeur national ait demandé une nouvelle échelle ayant une moyenne de 500 et un écart-type de 100. Cette échelle est définie au cours du premier cycle de l’évaluation nationale et utilisée dans les rapports des cycles suivants pour


206

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

montrer l’évolution de la performance au fil du temps. Le nom de ce score est NAMscore (score à l’évaluation nationale de mathématiques). Pour introduire ces spécifications, exécutez les étapes suivantes : 1. Saisissez NAMscore dans le champ libellé Add New Scale Score. 2. Saisissez la valeur 100 pour l’écart-type dans le champ Specify St. Deviation. 3. Saisissez la valeur 500 pour la moyenne dans le champ Specify Mean. 4. Vérifiez que l’option Set Scale est sélectionnée. Cela garantit que l’échelle de score produite aura une moyenne exactement égale à 500 et un écart-type exactement égal à 100 pour l’échantillon. L’option Rescale ajustera simplement le score TRI existant à la moyenne et à l’écart-type spécifiés. 5. Cliquez sur Calculate. Après avoir exécuté sa tâche, IATA met l’écran à jour avec le graphique et les statistiques synthétiques de la nouvelle échelle de scores, comme le montre la figure 10.5. La sélection d’une échelle de scores dérivée a relativement peu de limitations. Tout nom valide peut être utilisé pour ce score tant qu’il n’est pas déjà utilisé comme nom d’une variable dans les données des réponses (voir le chapitre 8 pour les conventions de dénomination et les noms de variables réservés). La moyenne peut être n’importe quel nombre réel, et l’écart-type n’importe quel nombre réel supérieur à zéro. Il est toutefois important de veiller à ce que les scores les plus faibles ne soient pas inférieurs à zéro. Le score le plus bas se situant généralement autour de trois à quatre écarts-types au-dessous de la moyenne, il est conseillé de fixer celle-ci à au moins quatre écartstypes au-dessus de zéro. Le choix d’une échelle de publication doit être discuté avec le comité directeur de l’évaluation nationale au moment de la planification, afin que toutes les parties prenantes comprennent la façon d’interpréter les résultats communiqués. Une fois la nouvelle échelle de scores créée, cliquez sur Next>> pour continuer.


ANALYSE COMPLÈTE DES DONNÉES ISSUES DE L’ADMINISTRATION FINALE D’UN TEST

| 207

FIGURE 10.5 Distribution et statistiques synthétiques d’une nouvelle échelle de scores (NAMscore), données de CYCLE1

ÉTAPE 5 : SÉLECTION DES ITEMS DE TEST Les données de CYCLE1 correspondent au cycle initial d’un programme d’évaluation nationale. Si le test doit être utilisé dans des cycles ultérieurs à des fins de comparaison, un lien doit être établi avec les résultats du cycle initial. Pour ce faire, sélectionnez un sous-ensemble d’items à la fois précis et représentatifs du continuum de compétence. Une pratique raisonnable pour maintenir un lien fort entre les cycles consiste à prendre environ 50 % des items communs aux évaluations adjacentes. Ces items s’appellent items d’ancrage. Pour faciliter le processus de sélection des items d’ancrage, utilisez la fonction IATA de sélection des items pour classer les items du test actuel en fonction de leur aptitude à maximiser la précision tout au long de la fourchette de compétence. Pour opérer cette sélection, exécutez les étapes suivantes : 1. Saisissez le nom ItemRanks dans le champ Name of item selection.


208

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

2. Saisissez le nombre 50 dans le champ Total number of items pour sélectionner tous les items. 3. Laissez les limites inférieure et supérieure à leurs valeurs par défaut de 2 et 98. 4. Cliquez sur Select Items. Les résultats complets sont présentés dans la figure 10.6. Tous les items disponibles ont été sélectionnés et classés sur le contenu et le niveau cognitif fournis dans leurs spécifications initiales. Les résultats produits par ces spécifications sont ajoutés à l’ensemble des résultats de l’analyse actuelle, sous la forme d’un tableau IATA de données des items. Celui-ci doit être mis à la disposition des concepteurs de test chargés de modifier le cycle 2 (ou suivant) de l’évaluation nationale, afin qu’ils puissent sélectionner un ensemble d’items communs, en tenant compte de l’information sur le contenu et de la valeur psychométrique de chaque item de test utilisé dans le cycle 1 (premier cycle). Idéalement, un ensemble d’items d’ancrage doit contenir la moitié des items du test complet et représenter le contenu et les spécifications cognitives dans les mêmes proportions FIGURE 10.6 Sélection des items, données de CYCLE1


ANALYSE COMPLÈTE DES DONNÉES ISSUES DE L’ADMINISTRATION FINALE D’UN TEST

| 209

que le test complet. En règle générale, toute liaison statistique où les items communs constituent moins de 20 % du test total est peu susceptible d’être significative, quelles que soient la représentativité du contenu et l’exactitude des items communs. Une méthode pragmatique de sélection des items consiste à commencer par les items les plus souhaitables et à affecter des items aux cellules des nouvelles spécifications du test, en fonction de leur contenu et de leurs niveaux cognitifs, jusqu’à ce que le nombre d’items souhaité soit atteint ou que la liste des items soit épuisée. Une fois qu’IATA a terminé cette analyse, cliquez sur Next>> pour continuer.

ÉTAPE 6 : DÉTERMINATION DE NORMES DE PERFORMANCE La plupart des évaluations contemporaines expriment les résultats en niveaux. Les évaluations internationales telles que le Programme international de recherche en lecture scolaire (PIRLS), le Programme international pour le suivi des acquis des élèves (PISA) et les Tendances de l’enquête internationale sur les mathématiques et les sciences (TIMSS), ainsi que de nombreuses évaluations nationales telles que le National Assessment of Educational Progress (NAEP), présentent les scores de performance des élèves sous la forme de niveaux de performance ou de référence (voir Greaney et Kellaghan, 2008 ; Kellaghan, Greaney et Murray, 2009). L’enquête TIMSS, par exemple, utilise quatre références : faible, intermédiaire, élevé et avancé (Martin, Mullis et Foy, 2008). Plutôt que d’être des seuils statistiques arbitraires tels que les centiles, les normes de performance doivent être significatives parce qu’elles constituent le principal outil utilisé pour synthétiser et communiquer la performance des élèves. Le processus de définition de normes de performance significatives s’appelle la détermination de normes. IATA facilite les procédures d’établissement de normes en spécifiant en premier lieu la probabilité de réponse (PR) correcte à chaque item, et en calculant ensuite les niveaux de compétence (valeurs pour la PR) associés à cette PR. Par exemple, si une PR a été définie à 50 %, la valeur pour la PR d’un item est le niveau de compétence associé à


210

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

50 % de chances de donner une bonne réponse. Une grande diversité de PR, allant généralement de 50 % à 80 %, est utilisée dans les évaluations à grande échelle. Une pratique courante consiste à utiliser 67 %, une valeur souvent statistiquement optimale pour le classement des items. Le choix de la PR doit également être éclairé par des définitions normatives de la probabilité de succès correspondant à la maîtrise dans une année scolaire donnée, et par la compréhension des conséquences du mode d’utilisation des normes. Par exemple, dans un contexte éducatif où les conséquences de l’échec sont plus importantes que celles de la réussite, des PR moins élevées peuvent être privilégiées. Avant d’analyser les données, un panel de parties prenantes, comprenant des spécialistes des programmes de cours et de la pédagogie, doit, en consultation avec le comité directeur de l’évaluation nationale, décider du nombre de niveaux de compétence à utiliser. Certaines évaluations nationales choisissent deux niveaux (par exemple, acceptable et non acceptable), d’autres trois niveaux (faible, adéquat et avancé), et d’autres encore quatre niveaux ou plus. Si le panel de parties prenantes adopte plus de deux niveaux, chacun, à l’exception du plus bas, doit être défini par un ensemble d’items auxquels les élèves affichant ce niveau de performance sont supposés répondre correctement. En général, sauf si une évaluation comprend des centaines d’items (nécessitant un plan de rotation des carnets), le nombre d’items ne permet de définir adéquatement que trois ou quatre niveaux. L’interface d’exécution de cette analyse est présentée dans la figure 10.7. À gauche, une liste déroulante vous permet de choisir la source d’items. Comme dans l’écran de sélection des items, vous avez la possibilité de sélectionner l’une des sources de données des items disponibles dans la séquence de tâches en cours. Dans notre exemple, seul le tableau Items1 est disponible.1 Les items de la source sélectionnée sont affichés dans le tableau figurant sous la liste déroulante. Les valeurs de la colonne Level peuvent être modifiées directement dans chaque ligne. Pour estimer les seuils statistiquement optimaux sur base de la classification actuelle des items, déplacez le curseur vertical placé au centre de l’écran jusqu’à la PR souhaitée. Lorsque l’écran est ouvert, la PR par défaut vaut 67 %, signifiant qu’une


ANALYSE COMPLÈTE DES DONNÉES ISSUES DE L’ADMINISTRATION FINALE D’UN TEST

| 211

FIGURE 10.7 Écran des normes de performance par défaut, données de CYCLE1

probabilité de 67 % d’avoir une réponse correcte à chaque item est utilisée pour classer les items ou estimer les seuils optimaux. Lorsque vous cliquez et faites glisser le curseur vertical pour ajuster la valeur de la PR, IATA met à jour les seuils optimaux et affiche les résultats dans le graphique et le tableau des résultats de droite. Le graphique montre la position de chaque seuil à l’aide de lignes verticales ajoutées à la distribution de la compétence ainsi que la fonction d’information du test. Celle-ci montre l’utilité des niveaux. Par exemple, si un niveau a très peu de répondants, les statistiques synthétiques décrivant les élèves à ce niveau sont trop petites ou instables pour pouvoir être interprétées. De même, si le test n’est pas précis au seuil déterminant un niveau, le classement des élèves à ce niveau sera inexact. Le tableau situé sous le graphique dans la figure 10.7 décrit chaque niveau avec la moyenne et l’écart-type des paramètres b des items. La dernière colonne contient le seuil estimé pour chaque niveau. Par exemple, pour le niveau 4, la moyenne et l’écart-type des paramètres b sont respectivement 0,77 et 0,38. La valeur 0,77 indique que la


212

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

moyenne des paramètres b pour les items du niveau 4 correspond à un score de compétence de 0,77 sur l’échelle TRI. Le seuil du niveau 4 pour une PR de 67 % est de 1,32. Ces statistiques sont utiles pour déterminer si l’attribution des items aux niveaux est raisonnable. Par exemple, si l’écart-type des items à un niveau donné est supérieur à la distance entre les moyennes ou les seuils des niveaux adjacents, la base statistique de la définition des niveaux peut être faible. Dans nos résultats, l’écart-type des niveaux est d’environ 0,35, tandis que la distance entre les niveaux adjacents est comprise entre 0,17 et 0,53, indiquant que les niveaux sont raisonnablement bien définis. Plusieurs méthodes sont utilisées pour déterminer les points de séparation ou seuils les plus appropriés séparant les niveaux de compétence. L’une d’elles est le placement de signets (bookmarking), une procédure basée sur la TRI, qui exploite le fait de disposer à la fois de la difficulté de l’item et de l’aptitude des personnes pour le même trait latent. Elle nécessite qu’un panel d’experts de la détermination de normes (tels que des spécialistes des programmes de cours et des enseignants chevronnés) examine attentivement tous les items du test à la lumière de l’information fournie par les spécifications du test, les programmes de cours, la performance des élèves au test et les définitions normatives des savoirs et savoir-faire des élèves à chaque niveau de compétence (voir Karantonis et Sireci, 2006 ; Mitzel et coll., 2001). Les procédures régissant le fonctionnement des panels pour la sélection, la formation et les interactions des participants, ainsi que leur utilisation de données issues de diverses sources varient. Elles ne sont pas considérées ici. L’accent est plutôt mis sur la façon dont les données générées par IATA peuvent contribuer à la détermination des niveaux de compétence. Au début, le panel prépare une version spécialement conçue du carnet de test de l’évaluation nationale, contenant des items à choix multiple et à réponse construite présentés un par page dans l’ordre de leurs PR. Le panel a pour tâche d’identifier les items situés à la limite de chacun des groupes cognitivement distincts ou niveaux. Il signale ces items en plaçant des signets ou repères dans le carnet de test. Les items sélectionnés pour le groupe de niveau le plus élevé (le niveau 4, par exemple) sont les plus susceptibles d’obtenir des réponses correctes de la part des élèves de ce niveau, mais le sont beaucoup moins de la part


ANALYSE COMPLÈTE DES DONNÉES ISSUES DE L’ADMINISTRATION FINALE D’UN TEST

| 213

des élèves des niveaux inférieurs. De même, les items sélectionnés pour le niveau 3 sont les plus susceptibles d’obtenir des réponses correctes de la part des élèves de ce niveau (ainsi que du niveau 4), mais le sont beaucoup moins de la part des élèves des niveaux inférieurs. Supposons, par exemple, que le panel d’experts a décidé d’utiliser une PR de 50 % pour valider la classification initiale des items par les concepteurs des items. Pour fournir la preuve de la validation, procédez comme suit : 1. Fixez la PR à 50 % en cliquant sur le curseur pour le faire glisser comme montré dans la figure 10.8. 2. Cliquez sur Save Bookmark data. IATA affiche une boîte de dialogue de confirmation pour vous informer que les données ont été sauvegardées. 3. Cliquez sur Next>> pour naviguer vers l’écran de visualisation des résultats. 4. Sélectionnez le tableau BookmarkData dans la liste déroulante.

FIGURE 10.8 Interface des normes de performance, PR = 50 %, données de CYCLE1


214

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

Les résultats de l’analyse des signets sont présentés dans la figure 10.9. Les données de chaque item comprennent le nom de l’item (Name), les paramètres TRI (a, b, c), le niveau initialement attribué (Level), le fichier source des statistiques des items (Source), et la valeur pour la PR 50. Par exemple, pour le troisième item de la figure 10.9 (MATHC1025), les paramètres a et b ont respectivement les valeurs 0,90 et -0,78, le niveau est initialement le niveau 1, avec une valeur pour la PR 50 de -0,70 (indiquant que l’item a une probabilité de 50 % d’avoir un score de compétence de -0,70). (Dans le cas présent, l’item n’a qu’une seule colonne pour la valeur PR, mais un tableau de données avec des signets peut en contenir plusieurs.) Le tableau de résultat sélectionné doit être exporté et communiqué au panel d’experts. Les valeurs figurant dans la colonne RP50 dictent l’ordre de présentation des items dans la méthode utilisant des signets pour la classification des items en niveaux de compétence et la définition des seuils. À l’aide de la procédure des signets, les membres du panel examinent chacun des items dans l’ordre de leurs valeurs pour la PR.

FIGURE 10.9 Données des signets, PR = 50 %, données de CYCLE1


ANALYSE COMPLÈTE DES DONNÉES ISSUES DE L’ADMINISTRATION FINALE D’UN TEST

| 215

Lorsqu’ils rencontrent un item dont ils estiment qu’il correspond à une norme de performance plus élevée, ils placent un signet à cet endroit dans le carnet de tests spécialement conçu. Les valeurs pour la PR précédant immédiatement les signets représentent les seuils proposés pour la détermination des niveaux de compétence. Une combinaison de discussions en groupe et de calcul des moyennes statistiques est généralement utilisée pour réconcilier les seuils établis par les différents examinateurs en vue de la détermination des seuils définitifs, même si ceux-ci ne sont pas statistiquement optimaux. Pour la rédaction des descriptions qualitatives de chaque niveau de compétence, les items sont classés sur la base des seuils définitifs. De nombreux types d’information, notamment les spécifications des items, les références des programmes de cours et les définitions normatives des savoirs et savoir-faire des élèves à chaque niveau de compétence, doivent être fournis en même temps au panel responsable de la détermination des normes. Le panel doit réconcilier les différentes sources d’information pour déterminer les points de séparation les plus utiles et attribuer un niveau aux items de test. Les membres du panel ont toute latitude pour décider d’utiliser le classement des items préétabli par les concepteurs des items au lieu de reclasser les items sur la base des résultats de la procédure de placement de signets. Dans les deux cas, les seuils calculés par IATA sont les seuils statistiquement optimaux pour la classification des items spécifiés. Pour générer les seuils statistiquement optimaux, ajustez simplement la PR au pourcentage souhaité, et IATA effectuera automatiquement le calcul à l’aide de cette PR et de la classification des items par niveau. Il sauvegardera les résultats dans le tableau PLevels de l’ensemble de données des résultats d’analyse. Par défaut, à moins que vous ne saisissiez manuellement les valeurs dans le tableau, IATA sauvegarde les seuils correspondant à une PR de 67 %. Notons qu’IATA ne met pas automatiquement à jour le niveau attribué à l’item ; si les signets ou une autre procédure de classement des items modifient le classement d’un item, le nouveau niveau doit être saisi directement dans les données des items ou directement dans IATA. Vous pouvez modifier manuellement les niveaux dans le tableau des résultats. Après modification des valeurs, le graphique est


216

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

automatiquement mis à jour. Les ajustements les plus couramment effectués comprennent la détermination de seuils équidistants ou de seuils qui, après l’application de constantes d’échelle, apparaissent à chaque incrément entier (par exemple, 5 ou 10). Un avis professionnel est nécessaire lors de la réconciliation entre, d’une part, les données de l’analyse statistique et du contenu et, d’autre part, la nécessité de communiquer les résultats à une audience non spécialiste. Il faut trouver un juste équilibre entre la simplicité et une communication fidèle et précise des différences significatives observées dans la performance des élèves. Dans notre exemple, supposons qu’après avoir examiné les données initiales des signets et d’autres sources d’information, le panel propose de définir les niveaux à l’aide des seuils suivants : -0,85, -0,25, 0,35 et 0,95. En pareil cas, les élèves dont les scores sont inférieurs à -0,85 sont classés dans le niveau 1, ceux dont les scores entrent dans la fourchette -0,85 à -0,24 dans le niveau 2, et ainsi de suite. Cliquez sur <<Back pour revenir à l’écran des normes de performance, où ces points de séparation peuvent être enregistrés dans le fichier de données des résultats et les niveaux appropriés attribués aux élèves. Procédez comme suit : 1. Saisissez les valeurs recommandées par le panel des parties prenantes dans la colonne Threshold des lignes appropriées. Appuyez sur Enter après la dernière saisie pour qu’IATA mette correctement l’interface à jour. 2. Cliquez sur le bouton Add Levels. IATA affecte les élèves au niveau établi sur la base de leurs scores TRI. La figure 10.10 montre l’attribution des seuils définis pour les niveaux de performance. Ceux-ci sont équidistants et comprennent chacun une proportion raisonnable d’élèves. Bien qu’aucune raison mathématique ne justifie un espacement égal, des seuils équidistants sont couramment utilisés dans la plupart des évaluations nationales et internationales, parce qu’ils semblent plus intuitifs pour les non spécialistes, la principale audience des données synthétiques liées aux niveaux de compétence. Dans le tableau de données Scored figurant dans le dernier écran de la séquence des tâches d’analyse, l’enregistrement de chaque élève


ANALYSE COMPLÈTE DES DONNÉES ISSUES DE L’ADMINISTRATION FINALE D’UN TEST

| 217

FIGURE 10.10 Écran des normes de performance avec des seuils définis manuellement, données de CYCLE1

contient la variable Level. Elle contient le niveau de performance attribué à chaque élève sur la base des seuils indiqués dans la figure 10.10. Par exemple, le premier élève de la liste CYCLE1STDID est classé au niveau 4, a un rang en centile de 85,13 et un score TRI de 1,06. Notons que, dans cet exemple, les moyennes et les écartstypes des paramètres b de chaque niveau n’ont pas changé dans le tableau récapitulatif. Parce que ces valeurs sont des statistiques synthétiques des items plutôt que des scores des élèves, elles ne changent que si le classement des items est modifié, ce qui peut se faire soit dans le fichier principal des items, soit directement dans la colonne Level du tableau figurant à gauche dans la figure 10.10. Après avoir utilisé les seuils pour classer les items en niveaux de compétence ou de performance, le panel d’experts doit rédiger les descriptions qualitatives des niveaux, en précisant pour chacun les savoirs et savoir-faire indicatifs de la compétence. Vous pouvez examiner des exemples de description des niveaux et des compétences dans d’autres volumes de cette série, en particulier le volume 1,


218

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

Évaluer les niveaux nationaux de performance dans l’éducation, pour l’étude PISA dans la figure B3.3 (Greaney et Kellaghan, 2008) et le volume 5, Communiquer et utiliser les résultats d’une évaluation nationale des acquis scolaires pour l’étude NAEP dans le tableau 2.6, le Vietnam dans le tableau 2.7, et le Mozambique dans le tableau 6.2 (Kellaghan, Greaney et Murray, 2009). Après avoir déterminé les seuils des normes de performance et les avoir appliqués aux scores des élèves, cliquez sur Next>> pour aller vers l’écran de visualisation et d’enregistrement des résultats.

ÉTAPE 7 : ENREGISTREMENT DES RÉSULTATS Dans l’écran de visualisation et d’enregistrement des résultats, vous pouvez voir les résultats produits par notre exemple. Tous les tableaux doivent être enregistrés à des fins de documentation du projet et pour faciliter la liaison du test avec les données de cycles ultérieurs. À titre de référence, les résultats des données des items de notre exemple d’analyse sont intégrés dans la feuille de calcul ReferenceC1 du fichier ItemDataAllTests.xls.

NOTE 1. Le tableau Items2 est également disponible pour les séquences de tâches d’analyse utilisant la liaison.


11

CHAPITRE

ANALYSE DES CARNETS EN ROTATION

Utilisez l’ensemble de données de l’échantillon PILOT2 pour effectuer cet exercice. La clé de codage se trouve dans la feuille PILOT2 du classeur Excel ItemDataAllTests. La rotation des carnets de test permet de tester un grand nombre d’items en les regroupant dans différents carnets. Le test est administré aux élèves à l’aide de plusieurs carnets, si bien qu’aucun élève n’est testé sur tous les items. En dehors des spécifications de l’analyse initiale, le reste de la séquence de tâches suit les procédures décrites dans les exemples des chapitres précédents.

ÉTAPE 1 : CHARGEMENT DES DONNÉES L’analyse est celle de la séquence de tâches Response data analysis (Analyse des données des réponses). Dans l’écran de chargement des données des réponses des élèves, sélectionnez le fichier de données de l’échantillon PILOT2. Ces données correspondent à l’administration en rotation de trois carnets de test à 712 candidats. Le fichier de données contient un total de 107 variables, dont 99 items. Les items ne sont pas tous repris dans chaque carnet. Cette situation peut se produire quand le comité directeur national de l’évaluation souhaite 219


220

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

que le test couvre l’entièreté d’un programme de cours, et que le nombre des items est par conséquent très élevé. Pour éviter la fatigue des élèves, chacun d’eux est testé à l’aide d’un carnet contenant un sous-ensemble des items. Dans les données de la figure 11.1, la troisième colonne correspond à la variable BOOKLETID. Elle contient un code 1, 2 ou 3 représentant le carnet administré à l’élève. En plus des codes alphabétiques des réponses aux items et du code 9 indiquant une réponse manquante (non visible dans la figure), la valeur 7 est utilisée pour chacun des items ne figurant pas dans le carnet attribué à l’élève. Par exemple, dans les données de la figure, le carnet de l’élève où PILOT2STDID = 2 ne contient pas l’item MATHC2058. Le code 7 est traité comme omis et n’affecte pas les résultats des tests de l’élève. Cliquez sur Next>> pour continuer. Dans l’écran de chargement des données des items, chargez le tableau de données des items PILOT2 du fichier ItemDataAllTests.xls. Il contient 99 records et quatre variables. (Notons que MATHC2047 a les valeurs suivantes : Key = C, Level = 1.00 et Content = item de connaissance des nombres.)

FIGURE 11.1 Réponses des élèves, données de PILOT2


ANALYSE DES CARNETS EN ROTATION

| 221

Vérifiez que les bonnes données des réponses et des items ont été chargées, et cliquez sur Next>> pour passer aux spécifications de l’analyse.

ÉTAPE 2 : SPÉCIFICATIONS DE L’ANALYSE Dans la liste déroulante Select ID (optional), choisissez PILOT2STDID. Dans le tableau Specify missing treatment (optional) affichant les spécifications des exemples précédents, la case figurant dans la colonne Incorrect n’est cochée que pour les réponses manquantes (code 9). Pour traiter la rotation des carnets, vous devez ajouter dans ce tableau le code d’omission (7) pour indiquer que certaines réponses ne doivent pas être corrigées. Pour ce code, cochez la case de la colonne Do Not Score, comme indiqué dans la figure 11.2. Lorsque la valeur 7 figure dans les données des réponses d’un élève, IATA (Item and Test Analysis) ignore l’item et celui-ci n’affecte pas les

FIGURE 11.2 Spécifications de l’analyse, rotation des carnets de test, données de PILOT2


222

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

résultats de l’élève. De même, les participants ayant un code réponse 7 pour un item n’affecteront pas l’estimation des statistiques ou des paramètres de cet item. Après avoir introduit les spécifications de l’analyse, cliquez sur Next>> pour continuer ; l’analyse commence automatiquement. Le temps de calcul dépendant davantage du nombre d’items de test que du nombre d’élèves, l’analyse prendra plus de temps que dans les exemples des chapitres précédents.

ÉTAPE 3 : RÉSULTATS DE L’ANALYSE DES ITEMS Quand IATA a terminé l’analyse, les résultats sont affichés comme dans la figure 11.3, où le tableau de gauche a été déroulé vers le bas pour afficher MATHC2003, qui est signalé par un symbole d’avertissement. Les résultats indiquent que cet item a une faible relation avec la compétence : les élèves ont une probabilité de 0,61 d’y répondre correctement, quel que soit leur niveau de compétence.

FIGURE 11.3 Résultats de l’analyse des items, données de PILOT2, MATHC2003


ANALYSE DES CARNETS EN ROTATION

| 223

IATA suggère que cette faiblesse peut être due à des exigences confuses, généralement associées à des distracteurs peu efficaces. Lorsque les élèves ne comprennent pas l’énoncé d’un item ou qu’aucune réponse n’est correcte sans ambiguïté, ils ont tendance à deviner. Sur le côté droit de l’écran, le tableau d’analyse des distracteurs affiche les données étayant ce résumé, qui montrent que l’option D est le seul distracteur correspondant au comportement souhaité. (Les valeurs 0,0 remplissant la colonne Omit rappellent que le code 7 n’a pas été autorisé à influencer l’estimation.) Pour éviter que MATHC2003 ne réduise la précision des résultats de l’analyse, décochez la case située dans la colonne Use, à côté du nom de l’item, et cliquez sur Analyze pour mettre à jour les résultats. Après avoir examiné les résultats de l’analyse, exécutez les analyses déjà effectuées dans les chapitres précédents. La spécification et l’interprétation des tâches restantes de la séquence sont essentiellement les mêmes que dans les exemples des chapitres précédents. Si l’administration du test s’appuie sur plusieurs carnets de test contenant des ensembles d’items différents, IATA ne peut effectuer l’analyse de la dimensionnalité que si ces carnets ont un nombre suffisant d’items en commun. Prenons, par exemple, trois blocs d’items de test (A, B, C) et trois carnets de test (1, 2, 3). Si le carnet 1 contient les blocs A et B, le carnet 2, les blocs B et C, et le carnet 3, les blocs C et A, la rotation des blocs est complète et aucun item n’est orphelin. Par contre, si le carnet 1 contient les blocs A et B, le carnet 2, les blocs A et B, et le carnet 3, les blocs B et C, le bloc C est orphelin du bloc A, et les corrélations entre les items de ces deux blocs ne peuvent, par conséquent, pas être estimées. Si vous avez des blocs d’items orphelins et que vous souhaitez effectuer une analyse de la dimensionnalité, vous devez exclure les items orphelins de cette analyse ou l’effectuer séparément sur chaque carnet de test. Si des preuves suffisantes confirment que, collectivement, l’ensemble des items évalue une seule dimension, vous pouvez malgré tout intégrer tous les items dans l’analyse estimant les paramètres TRI et les scores des items. Si la rotation est complexe, le principe général est de veiller à ce qu’aucun item de test n’apparaisse que dans un seul carnet. Si, malgré tout, un item n’apparaît que dans un seul carnet, les erreurs d’échantillonnage associées aux estimations de ses paramètres risquent d’être


224

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

plus élevées parce que l’analyse ne portera que sur les items contenus dans ce carnet et les élèves qui l’ont reçu. Lorsque le nombre de carnets où apparaît un item augmente, l’exactitude de l’estimation des paramètres de cet item augmente également. La réexécution, avec les données PILOT2, des analyses effectuées dans les chapitres précédents constitue un exercice indépendant. À titre de référence, les résultats de notre exemple d’analyse des items sont intégrés dans la feuille de calcul ReferenceC1 du fichier ItemDataAllTests.xls.


12

CHAPITRE

ANALYSE DES ITEMS À CRÉDIT PARTIEL

Utilisez l’ensemble de données de l’échantillon PILOT2PartialCredit pour effectuer cet exercice. La clé de codage se trouve dans la feuille PILOT2PartialCredit du classeur Excel ItemDataAllTests. Comme dans le scénario d’évaluation nationale décrit dans les chapitres précédents de ce volume, le présent exemple se situe après l’élaboration de l’instrument de test et introduit l’analyse des items de test à réponse courte corrigés à l’aide de crédits partiels. En dehors des spécifications de l’analyse initiale, le reste de la séquence de tâches suit les procédures décrites dans les exemples des chapitres précédents. Le présent exemple se concentre sur les exigences particulières de l’analyse des items à crédits partiels (voir Anderson et Morgan, 2008).

ÉTAPE 1 : CHARGEMENT DES DONNÉES L’analyse est celle de la séquence de tâches Response data analysis (Analyse des données des réponses). Dans l’écran de chargement des données des réponses des élèves, sélectionnez le fichier de données de l’échantillon PILOT2PartialCredit. Il contient un total de 111 variables et 712 répondants. Les données correspondent à l’administration de 225


226

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

trois carnets de test, pour un total de 103 items, et elles sont identiques à celles utilisées pour l’analyse des carnets en rotation du chapitre 11, avec l’ajout de quatre items à crédits partiels. Pour chacun d’eux, les élèves peuvent obtenir des scores de 0, 1, 2 ou 3, selon la qualité de leurs réponses. IATA (Item and Test Analysis) produit des statistiques pour toutes les valeurs de score supérieures à 0. Les noms des items supplémentaires sont MATHSA001, MATHSA002, MATHSA003 et MATHSA004. Cliquez sur Next>> pour continuer. Dans l’écran de chargement des données des items, chargez le tableau de données des items PILOT2PartialCredit du fichier ItemDataAllTests.xls, comme indiqué dans la figure 12.1. Dans celleci, le tableau des données a été déroulé jusqu’en bas pour afficher les quatre lignes du fichier contenant les données des items à crédit partiel. La clé de codage de ces items contient l’information requise pour attribuer différents scores numériques aux divers codes réponse figurant dans le fichier en fonction de la qualité de la réponse de l’élève. Dans notre exemple, la clé de codage reflète le codage manuel des items : le code réponse 1 correspond au score 1, le code 2 au score 2, et le code 3 au score 3. Aucun score ne doit être spécifié pour

FIGURE 12.1 Clés de codage et métadonnées des items, données de PILOT2


ANALYSE DES ITEMS À CRÉDIT PARTIEL

| 227

le code 0. Si un code réponse ne figure pas dans la clé de codage et n’est pas traité comme manquant, une valeur 0 est attribuée au score correspondant. Vérifiez que les bonnes données des réponses et des items ont été chargées, et cliquez sur Next>> pour passer aux spécifications de l’analyse.

ÉTAPE 2 : SPÉCIFICATIONS DE L’ANALYSE Les données étant essentiellement les mêmes que celles utilisées dans le chapitre 11, conservez les mêmes spécifications pour l’analyse. Dans la liste déroulante Select ID (optional), choisissez PILOT2STDID, et dans le tableau Specify missing treatment (optional), cochez la case de la colonne Do Not Score pour la valeur 7, comme indiqué dans la figure 12.2. Notons que toutes les valeurs utilisées pour les items à crédit partiel figurent également dans le tableau de spécification du traitement des codes.

FIGURE 12.2 Spécifications de l’analyse, rotation des carnets avec des items à crédit partiel, données de PILOT2


228

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

Après avoir introduit les spécifications de l’analyse, cliquez sur Next>> pour continuer ; l’analyse commence automatiquement. Le temps de calcul dépendant davantage du nombre d’items de test que du nombre d’élèves, l’analyse prendra plus de temps que dans les exemples des chapitres précédents.

ÉTAPE 3 : RÉSULTATS DE L’ANALYSE DES ITEMS Quand IATA a terminé l’analyse, les résultats affichés indiquent que MATHC2003 est problématique (figure 12.3). Éliminez cet item de l’analyse en décochant la case figurant dans la colonne Use, à côté de son nom et cliquez sur Analyze pour mettre à jour les résultats. IATA vous demande si les items à crédit partiel doivent être recalibrés ; cliquez sur Yes pour continuer. Dans le tableau situé à gauche dans la figure 12.4, vous pouvez voir les lignes créées automatiquement par IATA pour chacune des valeurs de scores initialement spécifiées dans la clé de codage de chaque item

FIGURE 12.3 Résultats de l’analyse des items, données de PILOT2, MATHC2003


ANALYSE DES ITEMS À CRÉDIT PARTIEL

| 229

FIGURE 12.4 Fonction de réponse à l’item à crédit partiel, données de CYCLE2, MATHSA001, score = 2

à crédit partiel. Dans chaque ligne, la colonne Name contient le symbole @ suivi d’un nombre entier égal à la valeur du score. Pour le calcul des statistiques de l’item, chacune de ces lignes est considérée comme un item correct/incorrect distinct, pour lequel le code de la réponse correcte est supérieur ou égal au nombre entier figurant dans le nom de l’item. IATA crée donc un ensemble de résultats statistiques supplémentaires pour chaque score spécifié dans la clé de codage d’un item à crédit partiel. Par exemple, si un de ces items a des scores (différents de zéro) valant 1 et 2, la facilité de l’item pour le score valant 1 (ItemName@1) donne la proportion des élèves ayant obtenu des scores supérieurs ou égaux à 1 pour l’item, et la facilité de l’item pour le score valant 2 (ItemName@2) décrit la proportion des élèves ayant un score de 2. Dans le tableau d’analyse des distracteurs de la figure 12.4, notez que MATHSA001@2 utilise à la fois les valeurs 2 et 3 des codes réponses saisis, et MATHSA001@1 les valeurs 1, 2 et 3. La facilité d’un item est toujours plus élevée pour les scores plus bas, parce qu’elle comprend tous les élèves ayant obtenu des scores plus élevés.


230

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

Par exemple, la figure 12.4 met en surbrillance les résultats de MATHSA001 pour le score de 2. Pour cet item, PVal (facilité de l’item) vaut 0,90 pour le score de 1 (MATHSA001@1), 0,77 pour le score de 2 (MATHSA001@2), et 0,45 pour le score de 3 (MATHSA001@3). Bien que les statistiques décrivent chaque score séparément, les fonctions de réponse à l’item (FRI) des items à crédit partiel reflètent le fait qu’un élève ne peut obtenir qu’une seule valeur de score par item. La FRI pour un item à crédit partiel est représentée comme un ensemble de courbes caractéristique de la catégorie d’items (CCCI), une par score à l’item. Lorsque la ligne correspondant à un score spécifique est sélectionnée, le graphique montre en gras la CCCI du score choisi. À chaque niveau de compétence, la CCCI exprime la probabilité qu’un répondant doté d’un niveau de compétence donné obtienne un score donné, à l’exclusion de tous les autres. Comme le montre la figure 12.4, quand la compétence augmente, la probabilité de chaque valeur de score commence par augmenter, puis diminue à mesure que l’élève devient plus susceptible d’obtenir des valeurs de score plus élevées. Bien qu’aucune règle simple ne s’applique à l’analyse d’une FRI pour un item à crédit partiel, il est utile de considérer dans quelle fourchette de compétence chaque score a la plus grande probabilité d’être obtenu. Par exemple, la ligne correspondant à la première valeur de score de MATHSA001 est signalée par un symbole d’avertissement. Sa CCCI montre en effet que, quel que soit le niveau de compétence, la probabilité d’obtenir un score de valeur 1 n’est pas supérieure à celle d’obtenir un autre score. La courbe en cloche correspondant à la deuxième valeur de score de MATHSA001 présente un maximum autour de -0,5, montrant que la probabilité d’obtenir un score de valeur 2 est la plus élevée chez les élèves ayant un niveau de compétence inférieur à la moyenne. Ces résultats indiquent que la valeur de score 1 ne fournit pas d’information utile parce que, statistiquement, elle ne se distingue pas de la valeur de score 2. Pour la plupart des items à crédit partiel, la catégorie la plus élevée est généralement la plus utile, parce que les correcteurs humains arrivent généralement à identifier facilement les réponses complètement correctes ou complètement fausses, mais ont plus de difficultés à reconnaître précisément l’exactitude d’étapes intermédiaires.


ANALYSE DES ITEMS À CRÉDIT PARTIEL

| 231

Dans un test pilote, une des principales tâches de l’analyse des items à crédit partiel est de déterminer si toutes les valeurs de score sont utiles et comment améliorer le processus de correction. Par exemple, si une valeur de score (telle que 1) a une faible probabilité d’être attribuée, deux explications sont possibles : soit aucun ou très peu d’élèves ont fourni la réponse correspondant à ce score, soit les correcteurs ne sont pas capables d’identifier quelles réponses y correspondent. Dans le premier cas, les réponses associées au score doivent être rassemblées dans une même catégorie de scores adjacents (par exemple, en fusionnant les scores de valeur 1 et 2 en une catégorie de scores d’une valeur 1 ou 2). Dans le second cas, le problème peut être résolu par une formation plus intense ou normalisée des correcteurs. Ainsi, bien que les résultats des analyses des items dichotomiques (correct/incorrect) soient essentiellement pertinents pour les rédacteurs d’items et les concepteurs de test, ceux des analyses des crédits partiels doivent également être partagés avec les équipes chargées de la correction des carnets de test des élèves. Après avoir examiné les résultats de l’analyse, exécutez les analyses déjà effectuées dans les chapitres précédents. La spécification et l’interprétation des tâches restantes de la séquence sont essentiellement les mêmes que dans les exemples des chapitres précédents. La seule différence est la spécification requise pour les items à crédit partiel dans l’écran de sélection des items. Pour sélectionner correctement les items à crédit partiel, vous devez d’abord saisir manuellement tous les scores obtenus pour les items à crédit partiel, en cochant les scores d’un item et en comptant ensuite chaque valeur de score comme un item distinct lorsque vous saisissez le nombre total d’items. Ainsi, si vous souhaitez sélectionner 10 items, et qu’un de ces items est à crédit partiel avec deux catégories de scores, vous devez spécifier 11 items pour la sélection et présélectionner manuellement les valeurs de score de l’item à crédit partiel souhaité. La réexécution des analyses décrites dans les chapitres précédents avec les données PILOT2 constitue un exercice indépendant. À titre de référence, les résultats de notre exemple d’analyse des items sont intégrés dans la feuille de calcul ReferenceP2PC du fichier ItemDataAllTests.xls.


13

CHAPITRE

COMPARAISON DES ÉVALUATIONS

Utilisez l’ensemble de données de l’échantillon CYCLE2 pour effectuer cet exercice. La clé de codage se trouve dans la feuille CYCLE2 du classeur Excel ItemDataAllTests.xls. Des items communs sont utilisés pour lier les échelles de la théorie de la réponse à l’item (TRI) et de publication des données de CYCLE2 aux échelles correspondantes utilisées dans les données de CYCLE1. Les résultats liés sont utilisés pour définir des échelles de scores et déterminer des normes de performance. Les pouvoirs publics et autres acteurs souhaitent souvent déterminer si les niveaux de performance des élèves ont augmenté, chuté, ou sont restés constants au fil du temps. L’intérêt pour l’évolution des normes est particulièrement élevé en cas de changement dans les programmes de cours ou de réforme importante du système éducatif (par exemple, un changement des niveaux de financement). Les autorités peuvent également s’intéresser aux effets sur la performance des élèves d’un accroissement rapide des inscriptions provoqué par la mise en œuvre de programmes tels que l’Initiative de mise en œuvre accélérée de l’Éducation pour tous, aujourd’hui appelée Partenariat mondial pour l’éducation. Pour autant qu’ils soient solidement liés, les scores d’une évaluation nationale peuvent être comparés à ceux d’une évaluation réalisée précédemment, permettant ainsi de 233


234

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

déterminer si, dans l’intervalle, un changement s’est produit dans la performance des élèves (voir Mislevy, 1992). La liaison des résultats de test est également utile dans d’autres situations. Outre la comparaison des résultats entre les cycles d’une évaluation nationale, les scénarios suivants sont fréquents. Un pays possédant un certain nombre d’instances éducatives peut créer pour chacune d’elles, un test portant sur le contenu du programme de cours spécifique à celle-ci. Si les tests pour les différentes instances partagent des items communs, les scores aux différents tests peuvent être utilisés pour comparer les performances des instances. La liaison des tests peut également être utilisée pour comparer les résultats d’une évaluation internationale et d’une évaluation nationale, à condition que celle-ci comprenne des items précédemment utilisés et calibrés dans l’enquête internationale. Par exemple, si un pays a participé aux Tendances de l’enquête internationale sur les mathématiques et les sciences (TIMSS), l’intégration d’un certain nombre d’items de cette enquête dans une évaluation nationale ultérieure peut aider à détecter si la performance a évolué depuis l’administration précédente des TIMSS. En pareil cas, la procédure de liaison utilisera les paramètres nationaux des items de l’enquête TIMSS contenus dans le fichier des données de référence des items et estimés à l’aide des données des réponses des élèves du pays concerné. Une procédure de liaison peut également être utilisée pour comparer la performance du pays dans une évaluation nationale à celle d’autres pays pour l’enquête TIMSS. Dans ce cas, le fichier des données de référence des items doit comprendre les paramètres des items TIMSS estimés à partir des données TIMSS internationales. Ce chapitre décrit les méthodes requises pour mettre en œuvre un cycle de suivi dans un programme national d’évaluation. Après le lancement du programme, vous devrez utiliser cette séquence de tâches pour vous assurer que l’interprétation des résultats d’un nouveau cycle d’évaluation par les parties prenantes est en accord et comparable avec celle du premier cycle. Dans notre exemple, les données de CYCLE2 représentent le deuxième cycle d’une évaluation nationale, faisant suite au premier cycle, CYCLE1, analysé dans le chapitre 10. La liaison de ces deux évaluations est possible, car le test de CYCLE2 contient plusieurs items d’ancrage qui figuraient également dans le test de CYCLE1. Elle vous permettra de suivre l’évolution de la performance des élèves


COMPARAISON DES ÉVALUATIONS

| 235

FIGURE 13.1 Séquence de tâches de l’analyse des données des réponses avec liaison

au fil du temps. Lorsque différents cycles d’évaluation sont liés à l’aide d’items communs, le nom unique permanent des items permet d’identifier et relier les items utilisés dans chacun des cycles. Ce chapitre se concentre sur les écrans et les spécifications particulières à cette séquence de tâches. Référez-vous aux chapitres précédents pour des explications plus détaillées des écrans communs utilisés dans d’autres séquences de tâches. Dans le menu principal, cliquez sur la première option, Response data analysis with linking, pour ouvrir la séquence de tâches, comme indiqué dans la figure 13.1. Celle-ci doit disposer des données des réponses, des données des items (clés de codage) pour les données des réponses à analyser, et d’un fichier des données de référence des items à utiliser pour ancrer les résultats liés.

ÉTAPE 1: SPÉCIFICATIONS DE L’ANALYSE La séquence de tâches commence par les mêmes étapes initiales de chargement des données que l’analyse des données des réponses. 1. Dans le premier écran de la séquence de tâches, chargez les données des réponses à partir du fichier CYCLE2.xls figurant dans le répertoire IATA des données de l’échantillon. Ces données comprennent 2 484 enregistrements et 61 variables. La première ligne contient les valeurs suivantes : SchoolID = 2 ; Sex = 2 ; SchoolSize = 21 ; et Rural = 0. Cliquez sur Next >>. 2. Dans le deuxième écran, chargez les données des items correspondants. Dans le fichier ItemDataAllTests.xls, sélectionnez le tableau CYCLE2. Il compte 53 enregistrements, dont trois items à crédit partiel, et quatre variables. MATHC2047 a les valeurs


236

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

suivantes : Key = C, Level = 1.00, et Content = connaissance des nombres. Cliquez sur Next >>. 3. Utilisez un écran de chargement des données qui n’a pas déjà été utilisé dans les exemples des chapitres précédents. L’écran demande de spécifier un fichier contenant les données de référence des items. Celles-ci contiennent les paramètres TRI a, b, et c (le cas échéant) estimés à partir d’un échantillon de référence, tel qu’un cycle précédent d’une évaluation nationale ou internationale. Le fichier des données de référence des items doit contenir les données d’au moins quelques items repris dans l’évaluation nationale actuelle. Pour notre exemple, utilisez les résultats produits par l’analyse du fichier de données CYCLE1. Ils se trouvent dans la feuille ReferenceC1 (qui peut éventuellement contenir les résultats des exercices du chapitre 10) du tableur Excel ItemDataAllTests.xls enregistré dans le répertoire IATA des données de l’échantillon. En ouvrant ce fichier, assurez-vous que le tableau sélectionné est bien ReferenceC1. Il compte 50 enregistrements et 11 variables contenant les résultats statistiques décrivant tous les items du premier cycle de l’évaluation nationale. Ces données de référence sont montrées dans la figure 13.2. Dans notre exemple, le test de CYCLE2 comprend 25 items dont les paramètres se trouvent dans le fichier CYCLE1 des données de référence des items. Il est important de conserver le nom des items dans tous les fichiers de données, car dans la procédure de liaison, IATA associe les items à l’aide de ce nom. Notons qu’outre les paramètres a, b, et c, ce fichier contient également plusieurs variables calculées pendant l’analyse des données de CYCLE1 (par exemple, Level, Content, Discr, PVal, PBis, et Loading). Ces variables peuvent être conservées dans le fichier de données, mais ne sont pas utilisées dans l’analyse de liaison. De même, bien que les données de référence des items contiennent des informations sur la totalité des 50 items du test utilisé pour le premier cycle, seules celles des 25 items communs avec le test du second cycle sont utilisées pour évaluer la liaison. Après avoir chargé les trois fichiers de données, cliquez sur Next>> pour passer à l’analyse des items (écran IATA 4 sur 10). Les spécifications de l’analyse sont semblables à celles de CYCLE1. Saisissez ou


COMPARAISON DES ÉVALUATIONS

| 237

FIGURE 13.2 Données de référence des items dans CYCLE1 à lier aux données de CYCLE2

sélectionnez les détails suivants dans l’écran des spécifications de l’analyse, et cliquez sur Next>> pour terminer l’analyse et visualiser les résultats : • La variable d’identification des élèves est CYCLE2STDID. • La variable de poids est CYCLE2Weight. • Le code 9 est considéré comme incorrect. Le passage à l’analyse des items (écran IATA 5 sur 12) déclenche automatiquement l’analyse. Les résultats ne signalent aucun item problématique. En examinant chacun des items, notez que, malgré la diversité des scores aux items à crédit partiel, certains de ces derniers peuvent encore être « faciles » parce que de nombreux répondants y ont obtenu les catégories de score les plus élevées (tels que MATHSA004) et que d’autres peuvent être « difficiles », lorsque relativement peu de répondants y ont obtenu les catégories de score les plus élevées, comme MATHSA005 (figure 13.3).


238

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

FIGURE 13.3 Résultats de l’analyse des items, données de CYCLE2, MATHSA005, score = 1

Poursuivez la séquence de tâches pour examiner les résultats de la dimensionnalité du test et effectuez les analyses de fonctionnement différentiel des items (FDI) qui peuvent présenter un intérêt pour les variables démographiques disponibles (localisation, sexe, langue), en suivant les procédures décrites dans les chapitres précédents. Même si de nombreux items sont accompagnés de symboles d’avertissement pour une ou plusieurs analyses du FDI, dans notre exemple, tous les items sont considérés comme satisfaisants. Après avoir examiné les résultats de l’analyse du FDI, cliquez sur Next>> pour passer à l’écran de liaison.

ÉTAPE 2 : LIAISON DES ITEMS COMMUNS Cliquez sur Calculate à gauche de l’écran (figure 13.4). La liste des 25 items communs aux données de référence et aux nouvelles données issues de l’évaluation nationale est automatiquement sélectionnée et affichée dans un tableau. Dans celui-ci, la première colonne,


COMPARAISON DES ÉVALUATIONS

| 239

FIGURE 13.4 Résultats de la liaison des items communs, entre CYCLE2 et CYCLE1

Use, précise si l’item est ou non inclus dans l’estimation des constantes de liaison (par défaut, tous les items figurant à la fois dans les données de référence et les nouvelles données sont inclus). Pour chaque item, un symbole synthétique de diagnostic apparaît dans la colonne L ; le symbole par défaut (losange jaune) est mis à jour après le calcul des constantes de liaison par IATA. La meilleure façon d’utiliser cet écran est de commencer par calculer les résultats avec tous les items, puis d’examiner l’information de diagnostic pour identifier et éliminer les items ayant des résultats anormaux. Répétez ces deux étapes jusqu’à ce que le lien soit stable. Cliquez sur le bouton Calculate pour estimer les constantes de liaison et évaluer la qualité statistique du lien. Une fois le calcul terminé, IATA affiche un résumé de la qualité du lien dans le graphique de droite et met à jour les symboles synthétiques de diagnostic dans le tableau des items situé à gauche (figure 13.4). Le graphique montre trois lignes : une ligne pleine, une ligne discontinue et une ligne pointillée. Les lignes pleines et discontinues correspondent aux courbes caractéristiques du test (CCT). La CCT d’un test résume le comportement statistique de


240

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

l’ensemble des items, en fournissant une information similaire à celle communiquée par une fonction de réponse à l’item (FRI), mais pour plusieurs items en même temps. Idéalement, les CCT liées et de référence doivent être identiques (si une seule ligne est visible, il est probable que les deux se chevauchent parfaitement), indiquant ainsi que les différences d’ampleur et de variabilité entre les échelles de liaison et de référence sont prises en compte dans toute la fourchette de compétence affichée. La ligne pointillée représente la différence absolue entre les deux CCT, exprimée en proportion du score total au test. La valeur de la différence varie généralement à travers les fourchettes de compétence, indiquant que la liaison n’est pas forcément stable pour toutes les fourchettes de scores. Pour les fourchettes de scores présentant des différences importantes, les résultats liés ne sont pas sur la même échelle que les données de référence et ne sont donc pas comparables. Lorsque la différence moyenne est faible (par exemple, < 0,01), l’erreur peut toutefois être considérée comme négligeable. Dans la figure 13.4, la courbe cible (pleine) représente les items de test de CYCLE1, et la courbe de liaison (en pointillés) représente les items du test de CYCLE2 après liaison. Il est difficile de voir les deux courbes dans la figure, car les CCT cible et liée sont pratiquement identiques, ce qu’indique également la courbe d’erreur avec une valeur constante proche de zéro dans toute la fourchette de compétence.1 Sous le graphique, deux champs affichent les constantes de liaison estimées. La constante de position permet de prendre en compte les différences d’amplitude des échelles initiales des nouvelles données (l’évaluation nationale actuelle) et des données de référence (l’évaluation précédente). La constante d’échelle permet, elle, de prendre en compte les différences dans la variabilité des échelles. Généralement, les deux constantes sont utilisées ensemble : en divisant n’importe quelle valeur exprimée sur l’échelle TRI brute de CYCLE2 (par exemple, le score TRI d’un élève issu des résultats de l’analyse actuelle) par la constante d’échelle, et en ajoutant la constante de position, on obtient le résultat lié directement comparable aux résultats sur l’échelle TRI de CYCLE1. Cette comparabilité signifie qu’une fois la liaison d’échelle appliquée, toutes les différences restantes entre les résultats de CYCLE1 et les résultats transformés de CYCLE2 représentent des différences dans la performance au test et non dans les tests eux-mêmes.


COMPARAISON DES ÉVALUATIONS

| 241

Dans le tableau des items présentés à gauche dans la figure 13.4, les symboles de diagnostic sont mis à jour après le calcul, pour signaler tout lien potentiellement problématique au niveau des items. Un item lié est problématique si sa FRI liée est très différente de celle de référence. En cliquant sur n’importe quel item de la liste, vous pourrez voir les résultats de la fonction de liaison appliquée à chaque item du test. Comme dans la comparaison globale des CCT, la FRI liée doit être similaire à la FRI cible.2 Même si les résultats semblent très bons pour le test global, ils peuvent ne pas l’être pour la fonction de liaison de certains items. Étant donné que les erreurs d’échantillonnage apparaissent davantage au niveau des items, les différences entre les FRI ne sont généralement problématiques que si l’écart entre les FRI liées et de référence est supérieur à 0,053 (voir l’exemple de MATHC1052 dans la figure 13.5). Un exemple fréquent de comportement idiosyncrasique d’un item de test dans une analyse de liaison est la situation dans laquelle, entre les deux cycles du test, une certaine partie du contenu mesuré par un item de liaison a fait l’objet d’une intervention pédagogique (par exemple, une plus grande attention à l’utilisation d’un type de

FIGURE 13.5 Résultats de la liaison des items communs, CYCLE2 à CYCLE1, MATHC1052


242

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

graphique en mathématiques ou à un aspect grammatical en langue). La performance à cet item spécifique ayant des chances de s’être améliorée de manière idiosyncrasique, les constantes de liaison estimées pour l’ensemble des items ne doivent pas prendre en compte les changements spécifiques aux items entre les cycles de test. MATHC1052, signalé par un symbole d’avertissement, est un exemple de ce phénomène. Les résultats pour l’item sont montrés dans la figure 13.5. Bien que les constantes de liaison semblent avoir correctement pris en compte la différence de position de l’item (c’està-dire, sa difficulté par rapport à l’exemple donné), des écarts apparaissent entre les deux lignes, en particulier au niveau de compétence le plus élevé. La FRI cible et la FRI liée ne sont pas confondues, et la ligne en pointillés du bas, exprimant la différence entre les deux, atteint un maximum de 0,08 tout en restant dans l’ensemble inférieure à 0,05. Ces différences sont sans conséquence, et dans la plupart des cas, ce niveau d’erreur ne pose pas de problèmes. Lorsque les différences entre les FRI cible et liée sont suffisamment importantes pour être problématiques (par exemple, si elles sont constamment supérieures à 0,05 sur une large fourchette de compétence), l’item incriminé doit être exclu de l’estimation des constantes de liaison en décochant la case située dans la colonne Use contiguë au nom de l’item et en cliquant sur Calculate. Un ou deux items peuvent sans problème être éliminés, mais lorsqu’ils sont nombreux à être exclus, la validité du lien peut s’affaiblir si les items d’ancrage ne reflètent plus correctement l’équilibre voulu du contenu. Rappelons que la validité du lien dépend à la fois de la stabilité statistique des items et de la cohérence dans la représentation du contenu entre les deux évaluations. Lorsque l’analyse statistique des résultats suggère que certains items devraient être exclus de la liaison, cette recommandation doit être portée à l’attention du comité directeur de l’évaluation nationale avant de prendre une décision. Moins il y a d’items communs entre les deux évaluations à relier, plus le lien est faible. Les résultats indiquent un lien très stable dans le cas de notre échantillon. L’équipe de l’évaluation nationale peut donc être certaine que le test utilisé dans l’évaluation actuelle (CYCLE2) est approprié pour suivre l’évolution des niveaux de performance des élèves depuis l’évaluation nationale précédente.


COMPARAISON DES ÉVALUATIONS

| 243

Au-dessous des constantes de liaison, deux contrôles (une liste déroulante et le bouton Update) vous permettent d’appliquer directement les constantes de liaison aux résultats de l’analyse actuelle. Visualisez les résultats de l’analyse dans l’écran final (écran IATA 12 sur 12) de la séquence de tâches. Pour appliquer les constantes aux paramètres des items dans les résultats actuels (écran IATA 8 sur 12), effectuez les étapes suivantes : 1. Sélectionnez Items1 dans la liste déroulante située dans le bas. 2. Cliquez sur Update. Dans le tableau Items1 des résultats de l’analyse, IATA ajoute les paramètres des items liés, dont l’échelle est maintenant celle fixée par les paramètres de CYCLE1. Les paramètres des items liés sont identifiés comme a_link et b_link. IATA indique si les résultats ont été mis à jour. Pour mettre à jour les scores TRI estimés dans les résultats actuels, effectuez les étapes suivantes : 1. Sélectionnez Scored dans la liste déroulante. 2. Cliquez sur Update. Dans les résultats de l’analyse, IATA ajoute au tableau des scores une variable libellée LinkedScore. Ce score est exprimé sur l’échelle définie par les paramètres des items de CYCLE1. Après la mise à jour des résultats d’Items1 et de Scored, cliquez sur Next>> pour continuer.

ÉTAPE 3 : REDÉFINITION DE L’ÉCHELLE DES RÉSULTATS LIÉS Si vous avez appliqué les constantes de liaison au tableau des données des scores comme décrit dans l’étape 2, l’écran IATA Scale Review and Scale Setting (écran IATA 9 sur 12) comprend le nom LinkedScore dans la liste déroulante située en haut à gauche. Sélectionnez LinkedScore pour afficher les résumés graphiques et statistiques des résultats liés de CYCLE2, exprimés dans l’échelle définie par les données des items de référence CYCLE1. Dans notre exemple, LinkedScore a une moyenne de 0,10 et un écart-type de 1,07. Notons que par défaut, les résultats affichent les statistiques synthétiques


244

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

FIGURE 13.6 Scores au test de CYCLE2 exprimés sur l’échelle de CYCLE1 (NAMscore)

pour PercentScore ; pour afficher les résultats pour LinkedScore, sélectionnez-le dans la liste déroulante. Pour convertir le score TRI lié en une échelle de scores susceptible d’être comparée à la variable NAMscore produite lors de l’analyse des données de CYCLE1, effectuez les étapes suivantes : 1. Saisissez NAMscore dans la zone de texte située en dessous du libellé Add New Scale Score. 2. Dans le champ Specify St. Deviation, saisissez 100, l’écart-type initialement fixé pour les données de CYCLE1. 3. Dans Specify Mean, saisissez 500, la moyenne initialement fixée pour les données de CYCLE1. 4. Sélectionnez l’option Rescale. Cette option fait en sorte que, dans la nouvelle échelle, le score conserve le lien estimé dans l’écran précédent. 5. Cliquez sur Calculate. IATA crée la nouvelle échelle de scores et affiche la distribution et les statistiques descriptives comme montré dans la figure 13.6. La moyenne de 510,36 indique que les résultats de l’évaluation actuelle se sont améliorés de 10,36 points par rapport à la précédente.


COMPARAISON DES ÉVALUATIONS

| 245

La séquence de tâches actuelle étant spécifique à la liaison, IATA produit automatiquement la nouvelle échelle de scores à l’aide du score TRI lié. L’existence d’items liés appropriés a permis à la procédure de liaison d’IATA d’attribuer à NAMscores, pour chacune des deux évaluations, des valeurs exprimées dans une échelle commune et, donc, susceptibles d’être comparées. Après avoir ajouté la nouvelle échelle de scores aux résultats, cliquez sur Next>> pour continuer.

ÉTAPE 4 : DÉTERMINATION DES NORMES DE PERFORMANCE Dans la séquence de tâches Response data analysis with linking, la plupart des tâches sont spécifiées de la même manière que dans les séquences de tâches précédentes. Les analyses de la sélection d’items de l’écran IATA 10 sur 12 peuvent être effectuées comme un exercice indépendant. Les normes de performance sont toutefois traitées différemment. Après la première évaluation nationale, la définition des normes n’est réalisée qu’à titre de validation. Il est utile de revoir périodiquement les seuils pour déterminer si de nouvelles normes de performance doivent être définies (par exemple, si la qualité de l’éducation s’améliore), mais la détermination de nouveaux seuils pour les niveaux de compétence doit généralement coïncider avec des changements majeurs dans les politiques, tels qu’une réforme du programme de cours. Lorsque vous saisissez dans l’écran Developing and assigning performance standards (écran IATA 11 sur 12), deux sources de paramètres des items peuvent être utilisées pour guider le processus de définition des normes : les items utilisés dans l’évaluation actuelle (Items1) ou les items de référence utilisés dans l’évaluation précédente (Items2). Ces sources de paramètres des items peuvent être sélectionnées dans la liste déroulante située à gauche, au-dessus du tableau. Dans la partie inférieure droite de l’écran, un tableau affiche les paramètres et le seuil d’un item choisi dans la source des paramètres des items sélectionnée. Par défaut, les statistiques synthétiques affichées sont les estimations calculées à l’aide des données actuelles (CYCLE2) figurant dans le tableau Items1. La source Items1 est préférable, car Items2 contient tous les items utilisés pour produire les scores au test actuel.


246

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

La détermination des normes ne doit être effectuée que a) si aucune procédure de définition des normes n’a été réalisée pour un cycle d’évaluation précédent ou b) s’il existe une raison de soupçonner que les normes de performance ont changé en raison d’une évolution des attentes normatives relatives aux types de compétences ou à la qualité de l’apprentissage. Notons que la performance des élèves diffère des normes de performance. Par exemple, la performance des élèves augmente lorsque les élèves ont de meilleurs résultats aux tests, tandis que les normes de performance diminuent lorsque les attentes des parties prenantes sont inférieures à ce qui constitue une performance « acceptable ». La reproduction du processus de définition des normes à l’aide des différents ensembles de paramètres des items peut aider à déterminer si les normes de performance sont stables à travers les évaluations. Si tel est le cas, la reproduction de ce processus produit des ensembles similaires de seuils. En reproduisant une procédure de définition des normes, gardez à l’esprit que les paramètres des items du tableau Items1 se rapportent à la distribution de la compétence dans l’évaluation actuelle, avant l’application d’une quelconque liaison, et que les paramètres des items du tableau Items2 se rapportent à la distribution de la compétence dans l’évaluation précédente. Pour comparer les seuils produits par l’analyse de différentes sources de paramètres des items, appliquez les constantes de liaison (par exemple, celles montrées dans la figure 13.5). La performance ayant augmenté par rapport aux données de CYCLE1, les moyennes des paramètres b des items sont plus faibles que pour les items classés au même niveau dans CYCLE1. Vous ne devez toutefois pas estimer de nouveaux seuils dans la séquence de tâches actuelle, car les normes de performance ont été initialement fixées et attribuées lors de l’analyse des données de CYCLE1. Les seuils suivants (établis pour la première évaluation nationale) sont utilisés pour l’évaluation actuelle : • • • •

Niveau 4 : 0,95 Niveau 3 : 0,35 Niveau 2 : −0,25 Niveau 1 : −0,85


COMPARAISON DES ÉVALUATIONS

| 247

FIGURE 13.7 Détermination des normes de performance, données de CYCLE2

Appliquez les normes de performance aux données de CYCLE2 en saisissant manuellement les seuils dans la colonne Threshold du tableau, comme indiqué dans la figure 13.7, puis en cliquant sur le bouton Add Levels. Pour mettre ces seuils à jour, commencez par ajuster la probabilité de réponse à l’aide du curseur situé au milieu de l’écran ; IATA créera un tableau avec des valeurs par défaut, qui pourront être remplacées par les valeurs attribuées dans notre exercice réalisé sur CYCLE1. La variable Level sera ensuite ajoutée au tableau Scored des données des élèves. Bien que les spécifications des normes de performance ne changent pas en fonction de la séquence de tâches, tout comme l’écran de définition de l’échelle, cet écran reconnaît qu’une séquence de tâches de liaison a été utilisée et attribue aux élèves des niveaux fondés sur le score TRI lié plutôt que sur le score TRI brut. Pour notre exemple, les résultats des données des items sont intégrés dans la feuille ReferenceC2 du classeur Excel ItemDataAllTests.xls.


248

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

NOTES 1. Pour des résultats plus intéressants avec une plus grande erreur, reproduisez cette analyse avec les résultats PILOT1 et PILOT2 comme un exercice indépendant. Rappelons que pour arriver à minimiser les erreurs dans les liaisons, les tests liés doivent avoir un nombre d’items d’ancrage et des tailles d’échantillon suffisants pour produire des statistiques correctes. 2. Si vous avez des données des réponses pour les deux évaluations, vous pouvez effectuer une analyse plus précise en analysant la FDI dans la séquence de tâches Response data analysis sur les fichiers de données des réponses combinés à l’aide de l’identifiant des données sources en tant que variable FDI. Les scores TRI produits seront automatiquement liés, mais pas interprétables sur l’échelle de chaque test, à moins que les paramètres des items n’aient été ancrés. 3. La seule exception concerne les items à forte discrimination. D’importantes différences entre les FRI (par exemple, une courbe d’erreur supérieure à 0,05) indiquent généralement des problèmes. Si ces différences n’existent que dans une étroite fourchette de compétence (par exemple, une fourchette de moins de 0,4 point de compétence, deux graduations sur l’axe x par défaut du graphique), elles n’auront pas d’effets négatifs sur la qualité du lien.


14

CHAPITRE

UTILISATIONS PARTICULIÈRES D’IATA

Ce chapitre décrit quatre utilisations spéciales des séquences de tâches d’IATA (Item and Test Analysis). Chacun des écrans concernés a déjà été décrit en détail dans les chapitres précédents de ce volume. Les trois premières parties de ce chapitre (« Liaison des données des items », « Sélection des items de test optimaux » et « Détermination et attribution des normes de performance ») donnent une vue d’ensemble des trois séquences de tâches utilisant les fichiers IATA de données des items comme principales données d’entrée. Ces séquences de tâches sont les plus appropriées lorsque les données des réponses des élèves ont déjà été analysées et que les paramètres des items de test ont été estimés. Elles vous permettent d’effectuer certaines analyses à l’aide de ces paramètres, sans être obligé d’analyser une nouvelle fois les données initiales des réponses des élèves. La possibilité d’effectuer des analyses à l’aide des données des items est utile lorsque les données des réponses des élèves sont inaccessibles (par exemple, pour des raisons de sécurité ou lorsque les capacités de transfert des données sont limitées), mais que les paramètres des items sont disponibles dans des sources telles que des rapports techniques ou de petits tableaux de données. Dans la dernière section, « Analyse

249


250

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

des données des réponses avec les paramètres des items ancrés », les paramètres des items ancrés d’une évaluation nationale précédente sont utilisés pour analyser les données des réponses des élèves issues d’une évaluation ultérieure contenant de nombreux items communs avec la première. Comme les principaux écrans IATA utilisés pour accéder à ces fonctions ont déjà été décrits dans les chapitres précédents, ce chapitre ne fournit pas des instructions complètes, mais se concentre sur les étapes spécifiques à chacun des sujets traités.

LIAISON DES DONNÉES DES ITEMS Le chapitre 13 de ce volume a montré comment calculer les paramètres de liaison dans la même séquence de tâches que l’analyse des données des réponses aux items. En pratique, ces deux opérations peuvent avoir lieu à des moments différents. Par exemple, un ministère de l’Éducation peut conduire une évaluation nationale initiale (CYCLE1) au cours de l’année 1 puis une évaluation nationale de suivi (CYCLE2) au cours de l’année 5, avant d’effectuer ou de commander, au cours de l’année 6, un exercice de liaison à l’aide des paramètres des items estimés pour les deux évaluations. Les analystes peuvent utiliser les constantes de liaison calculées par IATA et mettre à jour les données de CYCLE2 en produisant de nouveaux scores et paramètres liés. Ces nouveaux scores peuvent révéler le degré d’évolution de la performance des élèves entre les années 1 et 5. Pour pouvoir lier les données des items à l’aide de cette méthode, les ensembles de données des évaluations nationales concernées doivent contenir des items d’ancrage communs. Notre exemple lie les résultats de deux évaluations nationales contenus respectivement dans CYCLE1 et CYCLE2. Ils comprennent 25 items communs. Cette séquence de tâches est semblable à celle de l’Analyse des données des réponses avec liaison décrite dans le chapitre 13. Les données de la première évaluation nationale (CYCLE1) ont été analysées dans le chapitre 10. Avant d’entreprendre la liaison des deux


UTILISATIONS PARTICULIÈRES D’IATA

| 251

évaluations, vous devez analyser les données de CYCLE2 en suivant les étapes décrites au chapitre 10. Elles sont résumées ci-dessous : 1. Cliquez sur Response data analysis. 2. Chargez les données enregistrements).

des

élèves

de

CYCLE2

(2 484

3. Chargez les données des items de CYCLE2 (53 enregistrements). 4. Pour le code 9, cochez les données manquantes comme incorrectes. Comme expliqué dans le chapitre 13, rappelons que les codes numériques supplémentaires (0, 1, 2, 3) repris dans ce tableau représentent les scores des items à crédit partiel. Dans les listes déroulantes, sélectionnez ensuite les variables représentant l’identifiant de l’échantillon et le poids dans CYCLE2 (écran IATA 3 sur 10). 5. Dans l’écran d’analyse des items (écran IATA 4 sur 10), n’éliminez aucun item. 6. Pour notre exercice, sautez les analyses de la dimensionnalité et du fonctionnement différentiel des items ainsi que la redéfinition ou définition de l’échelle, la sélection des items et la détermination des normes (écran IATA 5 sur 10 et écran IATA 9 sur 10). 7. Dans l’écran final (écran IATA 10 sur 10), pour confirmer l’exécution correcte de l’analyse, sélectionnez Scored dans la liste déroulante puis faites défiler le tableau jusqu’à la dernière colonne. Le premier étudiant de la liste (CYCLE2STDID) a un score TRI (théorie de la réponse à l’item) de 2,58, un score en centile de 99,37 et un score réel (TrueScore) de 93,26. 8. Enregistrez l’ensemble complet des résultats dans CYCLE2_ UNLINKED.xls. Après l’analyse des données de CYCLE2, sélectionnez Linking item data dans le menu principal. Suivez les étapes ci-dessous : 1. À partir des résultats de l’évaluation actuelle (CYCLE2 dans notre exemple), chargez le fichier de données des élèves qui sera lié aux résultats de l’évaluation précédente (ici, CYCLE1). Il doit contenir la variable IRTscore. Si les résultats à lier ont été


252

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

modifiés, vérifiez que la variable contenant le score TRI non ajusté à l’échelle porte bien le nom IRTscore.1 Pour notre exemple, utilisez le classeur Excel CYCLE2_UNLINKED.xls et chargez la table Scored. Le premier étudiant de la liste, CYCLE2STDID = 1, a un score TRI de 2,58 et un score en centile de 99,37 à la fin de l’enregistrement. Cliquez sur Next>>. 2. Dans l’écran IATA 2 sur 5, chargez les paramètres des items estimés à l’aide des résultats des évaluations actuelle ou précédente. Le tableau de données doit contenir le nom des items ainsi que les paramètres TRI. Dans notre exemple, pour lier les résultats de CYCLE2 à l’échelle utilisée dans CYCLE1, chargez le tableau Items1 figurant dans le classeur Excel CYCLE2_UNLINKED.xls. Ce tableau contient les paramètres des items de l’évaluation nationale de CYCLE2. Ces données sont également disponibles dans la table ReferenceC2 du fichier IATA des données de l’échantillon ItemDataAllTests.xls. Les valeurs du premier item de la liste, MATHC1008, sont les suivantes : Key = A, Level = 3, a = 0,58, b = 0,20. Cliquez sur Next>>. 3. Dans l’écran IATA 3 sur 5, chargez les paramètres des items à partir des résultats estimés pour l’évaluation précédente de CYCLE1. Le fichier doit contenir le nom des items ainsi que les paramètres TRI. Dans notre exemple, pour lier les résultats de CYCLE2 à l’échelle utilisée dans CYCLE1, chargez le tableau ReferenceC1 figurant dans le classeur Excel ItemDataAllTests. xls. Le premier item de la liste, MATHC1005, a les valeurs suivantes : Key = B, Level = 3, a = 0,63, b = 0,21. Cliquez sur Next>>. 4. Cliquez sur Calculate pour estimer les constantes de liaison TRI (écran IATA 4 sur 5). Les deux constantes de liaison, Location et Scale, décrivent la transformation linéaire qui convertit l’échelle TRI de CYCLE2 dans l’échelle TRI de CYCLE1. Vérifiez la qualité de la liaison, notamment les items avec des fonctions de réponse aux items (FRI) liées idiosyncrasiques. Dans notre exemple, la plupart des items présentent des liaisons de bonne qualité, signalées par des cercles verts. Examinez les items problématiques accompagnés de signaux d’avertissement ou d’alerte (losanges jaunes ou triangles rouges). Examinez les graphiques individuels des items,


UTILISATIONS PARTICULIÈRES D’IATA

| 253

en particulier les courbes d’erreur pointillées bleues. Éliminez les items de la liste (de gauche) dont l’estimation de la liaison est constamment supérieure à 0,05 (axe de droite) dans la fourchette allant de −2.0 à +2.0 (sur l’axe de compétence). Si plusieurs items problématiques sont identifiés, éliminez-les un par un. Après chaque exclusion, recalculez les constantes de liaison en cliquant sur Update. La suppression d’un petit nombre d’items problématiques peut suffire à améliorer l’estimation de la liaison des items restants. Inversement, l’élimination d’un grand nombre d’items peut améliorer l’estimation statistique, mais également réduire la validité globale de la liaison. Appliquez les constantes de liaison aux paramètres des items et aux scores au test. Dans notre exemple, les constantes de position et d’échelle estimées à l’aide de l’ensemble complet des items communs valent respectivement 0,106 et 0,988. Vous pouvez utiliser ces constantes pour convertir le score TRI de l’évaluation de CYCLE2 à l’échelle utilisée dans CYCLE1, en multipliant le score TRI de CYCLE2 par 0,988 et en ajoutant 0,106. L’application de ces constantes de liaison indique qu’en moyenne, les scores au test de CYCLE2 sont légèrement moins variés, mais un peu plus élevés que ceux de CYCLE1. Cliquez sur Next>>. 5. Notons que les paramètres liés a et b de l’item MATHC1008 valent respectivement 0,58 et 0,20. Les paramètres liés décrivent le comportement statistique de chaque item de CYCLE2 exprimé dans l’échelle de CYCLE1. Ces informations peuvent s’avérer utiles lorsqu’une équipe d’évaluation nationale souhaite déterminer des normes ou élaborer un nouveau test en utilisant l’ensemble combiné des items. Les sections suivantes de ce chapitre expliquent comment appliquer ces deux fonctions en utilisant uniquement les données des items. Enregistrez les résultats de l’analyse (écran IATA 5 sur 5).

SÉLECTION DES ITEMS DE TEST OPTIMAUX Jusqu’ici, les items de test ont été sélectionnés pendant l’analyse des données des réponses des élèves. Un ministère de l’Éducation peut néanmoins raisonnablement demander qu’un ensemble d’items soit


254

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

tiré d’une évaluation achevée en vue d’évaluations futures. Cette demande peut être émise longtemps après l’analyse des réponses des élèves et la fin des activités du cycle d’évaluation nationale. Les concepteurs de test et les analystes peuvent identifier et sélectionner des items d’ancrage dans une évaluation précédente sans qu’il soit nécessaire de retrouver et analyser une nouvelle fois l’ensemble complet des données des élèves de cette évaluation. Les items d’ancrage forment le cœur, ou au moins une composante majeure, de la nouvelle évaluation à laquelle ils sont ajoutés. Ils sont utilisés pour lier les nouveaux résultats d’évaluation aux résultats existants. Pour s’intégrer à un test bien conçu et établir une liaison stable entre les deux tests, les items d’ancrage doivent permettre d’obtenir la plus grande précision possible tout au long de la fourchette souhaitée de compétence des élèves. Dans le cas présent, la tâche de sélection des items ne requiert que les paramètres des items de l’évaluation précédente. L’exercice suivant montre comment sélectionner les items optimaux pour la liaison de deux évaluations à l’aide des estimations des paramètres des items enregistrées lors de l’analyse des données de l’évaluation précédente. 1. Sélectionnez la séquence de tâches Selecting optimal test items dans le menu principal. 2. Chargez les données des items contenues dans le tableau ReferenceC1 du classeur Excel ItemDataAllTests.xls figurant dans le répertoire IATA de votre bureau (écran IATA 1 sur 3). Ces données doivent inclure le nom et les paramètres TRI des items, ainsi que le niveau et le contenu des items (Level et Content). Le premier item de la liste (ayant le plus petit identifiant) doit être MATHC1005 et avoir les valeurs suivantes : Key = B, Level = 3, a = 0,63 et b = 0,21. Cliquez sur Next>>. 3. Pour fournir à la sélection des items les résultats les plus utiles, le nombre d’items indiqué doit être égal au nombre total d’items du fichier de données des items. Dans notre exemple, le tableau des items ReferenceC1 comptant 50 items, ce nombre doit être spécifié pour la sélection. IATA produit un tableau où


UTILISATIONS PARTICULIÈRES D’IATA

| 255

les items disponibles sont classés dans l’ordre de leur aptitude à mesurer la performance des élèves dans les limites supérieure et inférieure spécifiées. Celles-ci déterminent les rangs centiles approximatifs de l’échantillon initial, pour lesquels les items ont été calibrés (0 représente les élèves les moins performants et 100 les élèves les plus performants). En règle générale, conservez les valeurs par défaut : 2 et 98. Toutefois, si vous prévoyez que la distribution des compétences dans la population des élèves de la nouvelle évaluation nationale sera très différente de celle de l’évaluation précédente, vous pouvez ajuster les limites supérieure et inférieure pour minimiser la sélection d’items inutilement faciles ou difficiles. Par exemple, si vous vous attendez à ce que la compétence de la nouvelle population des élèves soit beaucoup plus élevée que celle de la population initiale, donnez au seuil inférieur une valeur x supérieure à 2 pour indiquer que l’élève le moins performant de la nouvelle population peut avoir un score équivalent à la performance d’un élève classé au xe rang centile de la population initiale. En agissant ainsi, vous réduirez la possibilité de sélectionner des items d’une trop grande facilité pour la nouvelle population. Saisissez un titre tel que AncItems50 (pour items d’ancrage) dans le champ Name of item selection et 50 pour le nombre total d’items. Cliquez sur Select Items. IATA produit un tableau à x niveaux pour les 50 items (écran IATA 2 sur 3). Cliquez sur Next>>. Vérifiez (écran IATA 3 sur 3, montré dans la figure 14.1) que les valeurs de MATHC1029 sont les suivantes : a = 1,33, b = 0,17, Level = 4 et Key = D. 4. Cliquez sur Save Data. IATA nomme les tableaux de sélection des items en plaçant le préfixe CustomTest devant le nom unique que vous avez spécifié dans l’exercice de sélection des items. Dans notre exemple, le fichier de données des 50 items sera enregistré sous le nom CustomTestAncItems50. Vous pouvez utiliser cet écran pour faire des essais avec des nombres d’items sélectionnés différents (par exemple 30 ou 40). Attribuez un nom différent à chaque sélection d’items (dans le champ Name of item selection) si vous souhaitez enregistrer les résultats.


256

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

FIGURE 14.1 Sélection des items de test optimaux, données de CYCLE1

DÉTERMINATION ET ATTRIBUTION DES NORMES DE PERFORMANCE Les normes de performance (telles que moins qu’élémentaire, élémentaire, compétent, avancé ; ou niveaux 1, 2 et 3) sont essentielles pour communiquer les résultats d’une évaluation nationale aux différents types de parties prenantes. Le chapitre 10 de ce volume décrit la détermination des normes de performance comme un exercice relativement simple. Dans la pratique, elle nécessite généralement des itérations impliquant l’examen des résultats statistiques et du contenu des items. Différents intervenants doivent y participer (par exemple, le personnel responsable du programme de cours), dont bon nombre ont probablement peu d’expérience de l’analyse des données ou des statistiques. L’analyse des données des réponses doit être achevée avant d’entamer le processus de détermination des normes. Le panel des parties concernées doit utiliser les paramètres finaux des items pour réaliser cet exercice. La séquence de tâches Developing and assigning performance standards d’IATA permet d’utiliser les résultats d’analyses précédentes


UTILISATIONS PARTICULIÈRES D’IATA

| 257

pour faciliter le processus de détermination des normes. Dans notre exemple, les normes de performance sont déterminées pour les données de CYCLE1, à l’aide des paramètres des items de l’évaluation de CYCLE1. Pour utiliser cette séquence de tâches, vous devez avoir achevé l’analyse des données des réponses aux items et enregistré les tableaux de résultats Items1 et Scored. Si ces données n’ont pas été sauvegardées, refaites l’analyse décrite au chapitre 10. Pour déterminer les normes de performance, il est préférable qu’à la fois les paramètres des items et les scores TRI soient chargés dans IATA. Les scores TRI ne sont toutefois utilisés qu’à titre de référence pour l’estimation des seuils, et l’analyse peut être conduite en n’utilisant que les paramètres des items, sans charger les scores. Examinez la distribution des scores par niveau de compétence défini par les seuils pour déterminer la proportion des élèves correspondante. Comme expliqué précédemment (voir la description du placement de signets dans le chapitre 10), la détermination des normes est une procédure itérative impliquant que des spécialistes du programme de cours et des enseignants chevronnés examinent les items de test à la lumière des données statistiques disponibles. Comme déjà signalé dans le chapitre 10, le but de la détermination des normes n’est pas, ici, de s’aligner sur les points de séparation existants ni d’intégrer de force les données dans des niveaux de compétence précédemment établis, mais plutôt de déterminer les niveaux de compétence les plus utiles et leurs points de séparation sur la base des items disponibles. Plusieurs sessions d’examen et de discussion peuvent être nécessaires pour fixer les seuils. Une fois ceux-ci établis, le chargement des scores TRI dans IATA facilitera l’ajout des niveaux de compétence dans les résultats des élèves. Pour terminer cette séquence de tâches, suivez les étapes ci-dessous. Notons que les étapes 1 à 4 peuvent être répétées plusieurs fois avant que l’ensemble des seuils de performance soit finalisé. 1. Sélectionnez la séquence de tâches Developing and assigning performance standards dans le menu principal. Le premier écran (écran IATA 1 sur 4) vous invite à charger les données des réponses corrigées des élèves. Cette étape est facultative parce que la détermination des normes peut être effectuée en utilisant uniquement les paramètres des items. Si les données sur les scores des élèves


258

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

sont disponibles, elles peuvent vous aider à évaluer l’utilité d’un ensemble de points de séparation, en vous permettant d’estimer la proportion d’élèves correspondant à chaque niveau de compétence proposé. Toutefois, les données des scores des élèves ne sont utiles qu’une fois que les principales itérations de la détermination des normes sont achevées. 2. Comme les points de séparation ne sont pas encore définis, cliquez sur Next>> pour passer à l’écran IATA 2 sur 4. 3. Chargez le fichier de données des items contenant les paramètres TRI et le niveau pré-attribué à chaque item. Dans notre exemple, les résultats à utiliser se trouvent dans le tableau de données des items Items généré automatiquement par IATA. (Ces données sont identiques à celles du tableau ReferenceC1 figurant dans ItemDataAllTests.xls.) Notons qu’un niveau de performance est pré-attribué à chaque item. Cliquez sur Next>>. 4. Suivez la procédure de détermination des normes à l’aide de signets (décrite dans le chapitre 10) comprenant l’estimation de la valeur de la probabilité de réponse (PR), l’enregistrement des données du placement des signets, et l’utilisation de ces données pour faciliter l’examen des items de test par des enseignants, spécialistes du programme de cours et autres parties prenantes du secteur éducatif. Notez que dans une situation réelle, vous pouvez faire des essais avec différentes valeurs de la PR généralement situées entre 0,50 et 0,80. Au cours du processus de détermination des niveaux de performance, il est possible (et même probable) que les discussions de l’équipe d’évaluation nationale aboutissent à la modification des niveaux affectés aux items. Les étapes 1 à 4 devront peut-être être répétées plusieurs fois avec le placement de signets, jusqu’à ce que les participants à la détermination des normes soient convaincus que les seuils approuvés faciliteront une interprétation pertinente des résultats de l’évaluation. 5. Après accord au sein du panel des parties prenantes responsable de la détermination des normes de performance, répétez les étapes 1 à 4, en veillant bien à charger les données des scores TRI


UTILISATIONS PARTICULIÈRES D’IATA

| 259

des élèves au cours de l’étape 1. Dans notre exemple, chargez les données des élèves contenant les scores TRI, qui ont dû être enregistrées dans CYCLE1 à la fin du chapitre 10 (écran IATA 1 sur 4). Dans ces données, le score TRI se trouve dans la variable IRTscore du tableau de données SCORED. Il s’agit des scores estimés par IATA directement à partir des paramètres des items, sans redéfinition de l’échelle ni liaison préalable. Après le chargement des données, faites défiler les réponses des élèves (écran IATA 1 sur 4) pour visualiser les scores TRI. (Le score TRI du deuxième élève de la liste, CYCLE1STDID, vaut 1,764.) Saisissez les points de séparation définitifs dans la colonne Threshold en bas à droite de l’écran (écran IATA 3 sur 4). En comparant les points de séparation verticaux et la zone de distribution des scores, vérifiez que chaque niveau de compétence regroupe une proportion d’élèves susceptible d’être intégrée dans un rapport. Lorsque les niveaux de compétence les plus élevés ou les plus bas comptent très peu d’élèves, il peut être intéressant de fusionner des niveaux de compétence adjacents à des fins de publication. Éventuellement, vous pouvez appliquer les seuils aux données des scores dans l’écran des normes de performance en cliquant sur le bouton Add Levels. Cliquez sur Next>>. 6. Cliquez sur Save pour enregistrer les résultats (écran IATA 4 sur 4) en spécifiant un nom de fichier tel que NAMPerfStand. En règle générale, enregistrez tous les tableaux contenant des données modifiées : PLevels, mis à jour avec les nouveaux seuils ; Items1, où de nouveaux niveaux peuvent avoir été assignés aux items ; et Scored, qui contient le niveau de performance des élèves.

ANALYSE DES DONNÉES DES RÉPONSES AVEC LES PARAMÈTRES DES ITEMS ANCRÉS Dans les chapitres précédents, les paramètres TRI des items étaient supposés inconnus et devaient être estimés à partir des données des réponses des élèves. Les paramètres des items sont calculés pour


260

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

chacune des deux évaluations nationales (CYCLE1 et CYCLE2) et utilisés pour estimer les constantes de liaison. IATA propose également une fonction permettant d’importer les paramètres des items estimés pour une évaluation précédente, qui seront utilisés pour lier celle-ci à une évaluation ultérieure. Il commence par estimer les paramètres pour l’évaluation actuelle et les lie ensuite aux paramètres non ajustés de l’évaluation précédente. Les paramètres des items utilisés dans le processus de liaison sont appelés paramètres des items ancrés. Les paramètres des items ancrés sont les paramètres a, b et c (facultatif) auxquels une valeur est attribuée, avant l’analyse d’un fichier de données des réponses, pour certains items d’un fichier de données des items, de la même manière que pour les items d’ancrage utilisés dans la liaison formelle. Lorsque les données des réponses sont analysées à l’aide des paramètres des items ancrés, les paramètres des nouveaux items ou des items non ancrés sont calculés, tandis que ceux des items ancrés conservent la valeur qui leur a été préattribuée. Les nouveaux résultats estimés, tels que les paramètres TRI des items non ancrés et les scores TRI des élèves, sont exprimés à l’aide de l’échelle définie par les paramètres des items ancrés. Cette méthode est préférable à la liaison formelle lorsque les estimations des paramètres des items obtenues à l’aide des données actuelles des réponses sont de moins bonne qualité que les paramètres obtenus à l’aide des estimations passées. Tel peut être le cas lorsque l’échantillon actuel est beaucoup plus petit ou moins représentatif que celui utilisé pour estimer les paramètres existants des items. Cette méthode est également appropriée lorsqu’il existe déjà des estimations des paramètres pour la majorité (plus de 70 %) des items de l’évaluation actuelle. La seule différence entre l’utilisation des items ancrés et l’exemple décrit dans les chapitres précédents est que, dans la première, certains items ont déjà des paramètres dans le fichier d’entrée des données des items. Prenons un scénario dans lequel le comité directeur de l’évaluation nationale a décidé d’utiliser le test d’un cycle d’évaluation nationale précédent, avec quelques modifications mineures de l’ensemble des items de test. Dans ce cas, il n’est pas nécessaire de suivre la totalité de la procédure de liaison décrite dans le chapitre 13. Pour les relativement peu nombreux nouveaux items utilisés dans l’évaluation


UTILISATIONS PARTICULIÈRES D’IATA

| 261

actuelle, IATA estime automatiquement les paramètres TRI puis les exprime dans la même échelle que celle des paramètres des items ancrés. Les scores TRI finaux des élèves sont basés sur les paramètres à la fois des items nouvellement calibrés et des items ancrés, et sont exprimés sur la même échelle que ceux de ces derniers. Utilisez l’ensemble de données de l’échantillon CYCLE3 pour effectuer cet exercice. Pour ce test, les données des items se trouvent dans le classeur Excel ItemDataAllTests. Elles correspondent au troisième cycle du programme d’évaluation nationale analysé dans les chapitres précédents. Pour ce troisième cycle, le comité directeur de l’évaluation nationale a décidé d’utiliser les items du test de CYCLE2, après avoir apporté quelques modifications mineures au contenu de certains items et remplacé seulement huit items à choix multiple et tous les items à réponse courte. Au lieu de recalculer les nouveaux paramètres et les nouvelles constantes de liaison, le comité a décidé d’utiliser les paramètres des items de CYCLE2 pour ancrer les estimations des paramètres des nouveaux items. Pour effectuer une analyse avec les items ancrés, suivez les étapes ci-dessous. 1. Sélectionnez la séquence de tâches Response data analysis dans le menu principal. 2. Chargez le fichier des réponses des élèves CYCLE3.xls (contenant 2 539 enregistrements et 61 variables) présent dans le répertoire IATA des données de l’échantillon (écran IATA 1 sur 10). Vérifiez que le premier élève listé dans le fichier de données a les valeurs suivantes : SCHOOLID = 30, Sex = 2, SchoolSize = 21, MATHC2047 = C. Cliquez sur Next>>. 3. Chargez le fichier ItemDataAllTests.xls en sélectionnant le tableau CYCLE3 en tant que données des items (écran IATA 2 sur 10). Ce tableau contient 53 enregistrements et 7 variables. Notez que pour MATHC2047, un item de connaissance des nombres, les paramètres a et b valent respectivement 0,80 et −0,75. Contrairement aux fichiers de données des items utilisés dans les analyses précédentes, la valeur des paramètres est fournie pour certains items, mais pas tous, comme indiqué dans la figure 14.2.


262

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

FIGURE 14.2 Données des items de CYCLE3 avec des paramètres pour les items ancrés

Les paramètres ayant une valeur correspondent aux items ancrés. Ces valeurs ont été générées au cours de l’analyse des données de CYCLE2 et exprimées dans l’échelle initialement définie pour l’évaluation de CYCLE1. De nouveaux paramètres estimés à partir des données des réponses ont été attribués à plusieurs items ayant des clés de codage spécifiées, mais pas de valeur pour les paramètres des items (par exemple, MATHC2069). Comme les paramètres ancrés avaient déjà été liés à l’échelle de CYCLE1 au cours de l’analyse précédente, les paramètres nouvellement estimés pendant l’analyse des données actuelles de CYCLE3 ont également été liés à l’échelle de CYCLE1. Cliquez sur Next>> pour définir les spécifications de l’analyse. 4. Définissez la variable d’identification comme CYCLE3STDID, la variable de poids comme CYCLE3Weight et cochez la case réponse incorrecte pour la valeur 9 (écran IATA 3 sur 10). Notons que les valeurs numériques supplémentaires (0, 1, 2, 3) reprises dans le tableau représentent les scores des items à crédit partiel. Cliquez sur Next>> pour lancer l’analyse


UTILISATIONS PARTICULIÈRES D’IATA

| 263

5. Les résultats produits sont montrés dans la figure 14.3. Notons que les paramètres de tous les items ont maintenant une valeur, mais que ceux des items d’ancrage conservent leurs valeurs initiales (voir les valeurs a et b pour MATHC2047 dans les figures 14.2 et 14.3). Contrairement à la liaison au niveau des tests, vous pouvez maintenant constater comment les paramètres des items ancrés correspondent aux données actuelles des réponses en comparant les FRI empiriques et théoriques de chaque item. Par exemple, dans la figure 14.3 correspondant à l’item MATHC2047 qui a utilisé les paramètres des items ancrés, la FRI intitulée Theoretical est établie sur les données de CYCLE2, tandis que celle intitulée Empirical est dérivée des données de CYCLE3. De manière générale, la correspondance des items ancrés est moins bonne que celle des nouveaux items, dont les paramètres sont estimés à partir des données actuelles. Si la correspondance entre les FRI théoriques et empiriques individuelles est faible (c’est-àdire, si l’ampleur de l’écart vertical entre les FRI théoriques et empiriques est de façon continue supérieure à 0,05), et que

FIGURE 14.3 Résultats de l’analyse des items avec les paramètres des items ancrés, données de CYCLE3, MATHC2047


264

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

l’échantillon des nouvelles données des réponses est de grande taille, les items ne doivent pas être utilisés comme paramètres d’ancrage. En revanche, si l’échantillon est de petite taille (par exemple, inférieur à 500), le manque de correspondance entre les FRI théoriques et empiriques peut simplement être causé par une erreur aléatoire, et vous pouvez l’ignorer. Un losange (jaune) accompagne un certain nombre d’items (tels que MATHC1046 et MATHC2034). Ceux-ci sont généralement faiblement liés à la compétence, mais ont été retenus pour notre exercice. Notez qu’un symbole triangulaire (rouge) accompagne le score 1 de l’item à crédit partiel MATHA006 (MATHA006@1). Près de 99 % des élèves ont obtenu un score 1 ou plus pour cet item. Le maintien du score 1 n’influence toutefois pas particulièrement la qualité des résultats. L’indicateur rouge signifie simplement que le score ne se distingue pas clairement de 0 tandis que les scores 2 et 3 de l’item (respectivement, MATHA006@2 et MATHA006@3) sont clairement distincts des autres valeurs de score. En général, la meilleure façon de procéder consiste à revoir le codage de l’item afin de traiter les scores 2 et 3 comme des scores valides (la clé de codage IATA correspondante serait « 2:1;3:2 »). Toutefois, dans cet exemple, le maintien de la clé de codage existante n’a aucun effet négatif parce qu’IATA a ajusté l’estimation des scores pour refléter le faible niveau de compétence associé au score de crédit partiel 1. 6. Vous pouvez sauter les écrans IATA 5 et 6 sur 10 relatifs à l’analyse de la dimensionnalité des tests et du fonctionnement différentiel des items ; ces deux tâches sont semblables à celles réalisées dans les exemples précédents. Cliquez sur Next>>. 7. Les résultats étant automatiquement liés à l’échelle de CYCLE1, la valeur de la moyenne et de l’écart-type d’IRTscore (écran IATA 7 sur 10) dans les données de CYCLE3 peut significativement s’écarter de 0 et 1 (dans le cas présent, moyenne = 0,02, écart-type = 1,04). En définissant l’échelle de résultats utilisant les paramètres des items ancrés, il est important de se rappeler que, comme les scores TRI sont ancrés aux paramètres liés de CYCLE2, vous devez utiliser l’option Rescale pour générer les


UTILISATIONS PARTICULIÈRES D’IATA

| 265

échelles de scores, et préciser la valeur de la moyenne et de l’écarttype utilisée pour définir l’échelle NAMscore dans CYCLE1. Saisissez NAMscore et la valeur initiale de l’écart-type (100) et de la moyenne (500). Cliquez sur Calculate. La moyenne et l’écart-type dans la nouvelle échelle NAMScore valent respectivement 501,71 et 103,96. Cliquez sur Next>>. 8. Sautez la sélection des items (écran IATA 8 sur 10). Les scores TRI étant exprimés sur l’échelle établie avec les données de CYCLE1, appliquez les seuils des normes de performance de CYCLE1 (Niveau 4 = 0,95, Niveau 3 = 0,35, Niveau 2 = −0,25, Niveau 1 = −0,85) aux données de CYCLE3 (écran IATA 9 sur 10). Il n’est pas nécessaire de spécifier le niveau de PR, car les points de séparation sont déjà définis. Le niveau des élèves de CYCLE3 sera ainsi déterminé par rapport aux seuils de CYCLE1. Appuyez sur Enter après avoir saisi la valeur des seuils. Cliquez sur Add Levels pour attribuer les normes ou niveaux de performance aux élèves. Cliquez sur Next>>. 9. Cliquez sur Save Data et enregistrez toutes les tables de résultats pour l’évaluation de CYCLE3. Notons que dans l’ensemble de données SCORED, le premier élève a un score TRI de 1,41 et un score NAM de 641,10. Les résultats de cette analyse des données des items (Items1) sont enregistrés à titre de référence dans la feuille de calcul ReferenceC3 du classeur Excel ItemDataAllTests.xls. Enfin, notons que les paramètres des items ancrés sont particulièrement utiles lorsque l’échantillon de la nouvelle évaluation nationale est de petite taille, les tests se recouvrent fortement, ou les données des réponses sont disponibles pour les deux tests. Dans ce dernier cas, les données des réponses doivent inclure tous les répondants des deux cycles afin de faciliter l’analyse du fonctionnement différentiel des items entre les deux tests, les données des items doivent comprendre les clés de codage de tous les items, et seuls les paramètres des items utilisés dans le cycle précédent ont une valeur. Au cours des différents types d’analyse que nous venons d’examiner, l’équipe d’évaluation peut apporter des modifications, telles que l’exclusion d’items ou l’ajustement des niveaux de compétence ou


266

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

des catégories de contenu du programme de cours. Lorsque le nombre ou l’étendue des modifications sont significatifs, il est préférable de ne pas utiliser la liaison des items. Comme il est probable que les analystes ou autre personnel clé ne soient pas les mêmes d’une évaluation nationale à l’autre, il est important non seulement d’enregistrer tous les tableaux de données, mais aussi de conserver une explication claire des principales décisions et des modifications majeures apportées aux fichiers de données des items. Pour faciliter les futures évaluations nationales, l’analyste doit rédiger, dans un fichier texte ReadMe, une brève description de chaque modification apportée au fichier de données des items au cours de l’analyse actuelle (voir Freeman et O’Malley, 2012).

NOTE 1. Le chargement de ces données est facultatif parce que seuls les paramètres des items sont nécessaires pour l’estimation de la liaison statistique. Si vous ne chargez par les scores TRI au cours de cette étape, appliquez les résultats de la liaison à l’aide d’un autre logiciel, tel que SPSS (Statistical Package for Social Sciences) ou Excel.


15

CHAPITRE

SYNTHÈSE DES EXEMPLES IATA

Les exemples présentés dans la partie II de ce volume fournissent des descriptions détaillées des procédures statistiques les plus courantes utilisées pour créer, mettre en œuvre et entretenir un système national d’évaluation. Après exécution de ces exercices, vous devez avoir appris comment réaliser les tâches suivantes : • Charger les données des réponses des élèves • Charger les données des paramètres des items • Spécifier les clés de codage, les niveaux de performance et la classification du contenu des items • Définir le traitement des données manquantes • Examiner les statistiques classiques des items • Interpréter les fonctions de réponse à l’item et l’analyse de l’erreur des items • Interpréter les résultats de la dimensionnalité des tests • Interpréter les statistiques synthétiques des tests • Définir des échelles de scores pour la publication des résultats • Générer et interpréter les analyses du fonctionnement différentiel des items (FDI) • Estimer et définir les seuils des niveaux de compétence

267


268

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

• Sélectionner des sous-ensembles d’items pour des objectifs d’évaluation spécifiques • Sauvegarder les résultats sur un ordinateur Ces tâches représentent pratiquement toutes les exigences habituelles de l’analyse des tests au cours de la mise en œuvre d’une évaluation nationale. Être capable de reproduire ces exemples tels qu’ils figurent dans ces chapitres ne signifie pas être en mesure d’utiliser ces fonctions avec vos propres données d’évaluation nationale. La prochaine étape de votre processus d’apprentissage est de revoir plusieurs fois chacun des exemples, en suivant exactement les instructions fournies dans les chapitres précédents. Une fois que vous maîtriserez l’interface d’IATA (Item and Test Analysis), vous serez prêt à essayer certains des choix structurant ses analyses. Une fois encore, parcourez chacun des exemples, mais, au lieu de suivre les instructions à la lettre, essayez les options disponibles. Par exemple, qu’arrive-t-il aux résultats de l’analyse lorsque le nombre des items de test est très petit ? Qu’advient-il aux résultats d’une liaison lorsque les items communs sont tous très simples ou très difficiles ? Il existe beaucoup d’autres approches techniques d’analyse des données de test, mais elles ne sont pas reprises dans le cadre de cet ouvrage. Toutefois, si vous les essayez avec les données de l’échantillon IATA et comparez vos résultats avec ceux obtenus dans les exercices des chapitres précédents, vous devriez acquérir une meilleure compréhension des choix convenant aux différentes situations. Lorsque vous analysez les données de votre évaluation nationale, vous devez en premier lieu identifier dans le menu IATA, la séquence de tâches la plus appropriée à votre situation. Plus que vraisemblablement, elle sera assez proche de celle d’un des exemples des chapitres précédents. Certaines situations peuvent nécessiter une combinaison de séquences de tâches, où les résultats d’une séquence ou analyse sont utilisés comme données d’entrée pour une autre. En fin de compte, à mesure que votre expertise se développe, vous vous rendrez compte que des réponses ou solutions uniques et parfaites aux problèmes des évaluations nationales existent rarement. Au mieux, les méthodes statistiques utilisées dans une évaluation moderne permettent de minimiser l’influence des erreurs résultant


SYNTHÈSE DES EXEMPLES IATA

| 269

inévitablement des problèmes liés à la mesure de l’éducation dans le monde réel. La manière dont les équipes nationales choisissent et mettent en œuvre ces méthodes statistiques dépend de leurs objectifs. Quels sont les besoins des parties prenantes ? Quelles sont les conséquences des décisions basées sur les résultats ? Même s’il est très utile, IATA ne constitue jamais qu’un outil permettant de réduire la charge de l’application des méthodes statistiques et de clarifier l’arbitrage des choix analytiques disponibles dans une évaluation nationale.


ANNEXE

II.A

THÉORIE DE LA RÉPONSE À L’ITEM

Deux aspects de l’approche utilisée dans la théorie classique des tests (TCT) pour mesurer la compétence, à savoir la facilité (ou difficulté) de l’item et la discrimination de l’item, ont été décrits dans le chapitre 9. Cette annexe se concentre sur une autre approche, la théorie de la réponse à l’item (TRI), qui unifie les concepts de facilité et de discrimination de l’item. La TRI est également appelée théorie des traits latents. Il s’agit de l’approche la plus largement suivie dans les évaluations à grande échelle. Un bon point de départ pour comprendre la TRI est de comparer ce qui constitue un bon item de test du point de vue de la TCT et de la TRI. Les statistiques classiques de facilité et de discrimination de l’item se concentrent sur la probabilité d’obtention d’une réponse correcte de la part des différents élèves. Inversement, la TRI caractérise les élèves par le type de réponse qu’ils sont susceptibles de donner à l’item et tente de décrire la distribution de la compétence des élèves ayant donné différents types de réponses. Dans la TCT, un bon item de test a une probabilité de réponse correcte très différente suivant le niveau de compétence des élèves, tandis que dans la TRI, pour un bon item de test, la distribution de la compétence des élèves ayant donné une réponse correcte diffère de celle des élèves ayant répondu

271


272

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

de manière erronée. Tandis que la TCT met l’accent sur la probabilité de réponse correcte, la TRI se concentre sur la distribution de la compétence. Même si ces deux points de vue sont généralement en accord, la TRI décrit les items d’une manière beaucoup plus riche et plus utile. Le logiciel Item and Test Analysis (IATA) calcule les résultats à l’aide de diverses méthodes statistiques. La plupart des calculs utilisent des équations à solution analytique, ce qui signifie que les données des réponses des élèves sont utilisées dans une séquence ordonnée d’étapes pour produire la statistique voulue, telle que la moyenne arithmétique. Dans ce type d’équations, les valeurs obtenues à chaque éventuelle étape de calcul sont basées sur les données initiales et les résultats des étapes précédentes. La description détaillée des équations à solution analytique utilisées pour les statistiques classiques des items et autres statistiques synthétiques de base peut être trouvée dans la plupart des manuels de statistiques (par exemple, Crocker et Algina, 2006). Pour certains calculs, IATA doit estimer une statistique, x, basée sur une autre statistique, y, dont la valeur est elle-même basée sur la valeur de x. Dans ces cas, parce que x et y ne peuvent être estimés en même temps, IATA doit utiliser un algorithme itératif. Celui-ci commence généralement par estimer les valeurs de x à partir de valeurs de départ raisonnables de y. Il utilise ensuite les résultats estimés pour x afin de calculer de nouvelles valeurs pour y. Celles-ci sont utilisées pour mettre à jour les valeurs de x, et ainsi de suite jusqu’à ce que les nouvelles itérations ne changent plus substantiellement la valeur des estimations. Cette approche est utilisée dans l’analyse de la dimensionnalité des items et des tests ainsi que pour l’estimation des paramètres TRI des items (voir Seigneur et Novick, 1968). Ces deux calculs nécessitent l’estimation de propriétés des items telles que la saturation et les paramètres TRI. L’analyse de la dimensionnalité utilise un algorithme itératif courant connu sous le nom de décomposition en valeurs singulières, ou DVS (voir http://fr.wikipedia.org/wiki/Décomposition_en_valeurs _singulières), tandis que l’estimation des paramètres TRI nécessite des algorithmes itératifs spécialisés (voir Baker et Kim, 2004). Ces algorithmes commencent par estimer la probabilité que chaque élève


THÉORIE DE LA RÉPONSE À L’ITEM

| 273

réponde correctement à chaque item, et trouvent ensuite les paramètres des items qui reproduisent le mieux ces probabilités. Les nouveaux paramètres sont alors utilisés pour mettre à jour les probabilités estimées, qui sont à leur tour utilisées pour ajuster les estimations des paramètres des items, et ainsi de suite, jusqu’à ce que les estimations produites ne s’améliorent pas substantiellement par rapport aux précédentes. Pour l’estimation des paramètres, IATA utilise une variante de cette approche générale, à la fois plus rapide à calculer et statistiquement plus robuste que d’autres algorithmes. Elle permet d’appliquer la TRI à un éventail d’échantillons de données plus large que celui généralement accepté par d’autres logiciels. Avec l’algorithme d’IATA, la première étape (estimation des probabilités) nécessite le calcul de deux distributions de la compétence pour chaque item : la distribution des élèves ayant donné la réponse correcte et celle des élèves ayant répondu de manière erronée. Ces distributions sont supposées de forme normale, et les deux calculées pour chaque item ont la même variance, mais des moyennes et des amplitudes relatives différentes. Par exemple, si plus d’élèves ont répondu correctement que de manière erronée, l’amplitude de la distribution des premiers sera supérieure à celle des seconds. La somme de ces deux distributions à chaque niveau de compétence donne la distribution de la compétence pour l’ensemble des élèves, et le ratio de la distribution des élèves ayant donné la bonne réponse par rapport à la distribution totale donne la probabilité de réponse correcte estimée à chaque niveau de compétence. Cette approche présente deux avantages par rapport aux autres méthodes : a) elle décrit la probabilité de réponse correcte à tous les niveaux de compétence, plutôt que pour un échantillon arbitraire de niveaux de compétence, et b) les distributions à la fois des élèves ayant donné la réponse correcte et ayant répondu de manière erronée peuvent être décrites à l’aide de la moyenne, pour ceux ayant répondu correctement, et de la proportion de réponses correctes à l’item (pour l’échantillon total, la moyenne est nécessairement égale à zéro et la proportion des réponses incorrectes est, par conséquent, égale à un moins la proportion de réponses correctes). Par contre, la plupart des autres méthodes ne décrivent les probabilités que pour un échantillon de niveaux de compétence définis arbitrairement et peuvent nécessiter de calculer


274

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

indépendamment des centaines de statistiques afin d’estimer les différentes probabilités. Habituellement, elles exigent aussi de spécifier des contraintes ou des règles arbitraires pour corriger les erreurs d’estimation. Les deux distributions présentées dans la figure II.A.1 montrent certaines caractéristiques fondamentales de la TRI. Les deux courbes représentent les distributions de la compétence1 des élèves pour un item de test donné. La courbe continue de gauche décrit la compétence des élèves ayant répondu de manière erronée, tandis que la courbe discontinue (---------) décrit la compétence des élèves ayant correctement répondu. La facilité de l’item considéré étant de 0,50, la hauteur des deux distributions est identique sur l’axe vertical (autant d’élèves ont répondu de manière correcte qu’incorrecte). La compétence moyenne des élèves ayant donné la réponse correcte vaut 0,10, ce qui explique que dans le graphique, le pic de la

FIGURE II.A.1 Distributions de la compétence des élèves ayant répondu de manière correcte et erronée à un item de test donné (facilité = 0,50 ; compétence moyenne des élèves ayant bien répondu = 0) 0,30

0,25

probabilité

0,20

0,15

0,10

0,05

0 –3

–2

–1

0

1

compétence incorrect

correct

2

3


THÉORIE DE LA RÉPONSE À L’ITEM

| 275

distribution des élèves ayant correctement répondu correspond à 0,10 sur l’axe de la compétence. Parce que la moyenne globale des deux populations vaut 0 et que celles-ci sont de taille égale, la compétence moyenne des élèves ayant mal répondu est symétrique à celle des élèves ayant correctement répondu, avec une valeur de -0.10. La taille et la position des deux distributions sont très similaires, indiquant ainsi une faible différence de compétence entre les élèves ayant donné une réponse correcte et erronée. S’il n’y avait aucune différence, les deux distributions seraient identiques, avec une moyenne égale à 0, et les réponses à l’item n’auraient aucune relation avec la compétence. La figure II.A.2 donne un exemple d’item de test beaucoup plus précis, avec également une facilité de 0,50. Il montre une très forte relation entre la réponse à l’item et la compétence, où la compétence moyenne des élèves ayant correctement répondu vaut

FIGURE II.A.2 Distributions de la compétence des élèves ayant répondu de manière correcte et erronée à un item de test donné (facilité = 0,50 ; compétence moyenne des élèves ayant bien répondu = 0,99) 1,6 1,4

probabilité

1,2 1,0 0,8 0,6 0,4 0,2 0 –3

–2

–1

0

1

compétence incorrect

correct

2

3


276

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

approximativement 1 et celle des élèves ayant répondu de manière erronée vaut environ -1. Les distributions ne se chevauchent pas du tout, indiquant ainsi que les compétences des élèves ayant répondu correctement et des élèves ayant répondu de manière erronée sont complètement distinctes. Dans la pratique, il est extrêmement rare que les élèves ayant donné la réponse correcte soient complètement distincts des élèves ayant répondu de manière erronée. Habituellement, il existe une large plage de compétence où les deux distributions se chevauchent. Une transition douce apparaît lorsque l’accroissement de la compétence rend les élèves moins susceptibles de participer à la distribution des élèves ayant mal répondu et plus susceptibles d’entrer dans celle des élèves ayant bien répondu. Cette transition est illustrée dans la figure II.A.3 pour un item ayant une facilité de 0,60 (la distribution des élèves ayant correctement répondu est, par conséquent, supérieure à celle des élèves ayant répondu de manière erronée) et une compétence moyenne des élèves ayant bien répondu de 0,40.

FIGURE II.A.3 Distributions de la compétence des élèves ayant répondu de manière correcte et erronée à un item de test donné et probabilité conditionnelle de réponse correcte (facilité = 0,60 ; compétence moyenne des élèves ayant bien répondu = 0,40) 1,0 0,9 0,8 probabilité

0,7 0,6 0,5 0,4 0,3 0,2 0,1 0 –3

–2

–1

0

1

2

compétence incorrect

correct

pente

seuil

fonction de réponse à l’item

3


THÉORIE DE LA RÉPONSE À L’ITEM

| 277

La courbe brisée, connue en tant que fonction de réponse à l’item (FRI), décrit la taille de la distribution des élèves ayant correctement répondu par rapport à celle de la distribution des élèves ayant répondu de manière erronée. En d’autres termes, dans les plages de compétence où la hauteur de la distribution des élèves ayant correctement répondu est inférieure à celle de la distribution des élèves ayant répondu de manière erronée, la FRI est inférieure à 0,5 ; quand l’inverse est vrai, la FRI est supérieure à 0,5. La transition entre les réponses erronée et correcte est marquée par un seuil (la ligne pointillée verticale de la figure II.A.3) correspondant au point d’intersection des deux distributions. La FRI peut être interprétée comme la probabilité qu’à un niveau de compétence, un répondant appartienne au groupe des élèves ayant correctement répondu. Les valeurs exactes de la FRI sont calculées en divisant la probabilité de la distribution des élèves ayant bien répondu par la somme des probabilités des deux distributions. Si, par exemple, pour une compétence de valeur -1, la probabilité est d’environ 0,06 pour les élèves ayant correctement répondu et d’environ 0,15 pour ceux ayant répondu de manière erronée, alors la FRI vaut 0,06 / (0,06 + 0,15) = 0,29. Parce que la proportion des élèves ayant répondu de manière erronée est l’inverse de la proportion des élèves ayant bien répondu, et que la compétence moyenne des élèves ayant répondu de manière erronée peut être calculée à partir de la compétence moyenne des élèves ayant donné la réponse correcte (étant donné que la moyenne globale est égale à 0), la FRI est une fonction de la facilité de l’item et de la compétence moyenne des élèves ayant répondu de manière correcte. La FRI est décrite par un modèle statistique à 3 paramètres, a, b et c : P(u = 1) = c + (1 − c)/(1 + Exp(D * a * (thêta − b))), où P(u = 1) est la probabilité qu’un élève donne une réponse correcte (ait un score égal à 1). D est une constante utilisée pour mettre les paramètres de l’item à l’échelle ; elle est généralement fixée à -1,7 pour que l’échelle corresponde à l’échelle normale standard. La variable thêta représente la compétence des élèves. Le même modèle décrit les items à crédit partiel où P(u ≥ x) représente tout score supérieur ou


278

|

ANALYSER LES DONNÉES ISSUES D’UNE ÉVALUATION NATIONALE DES ACQUIS

égal à un score de crédit partiel donné, x. Dans le cas d’un crédit partiel, chaque score supérieur à zéro a un ensemble de paramètres. Bien que tous les paramètres interagissent pour décrire le comportement statistique d’un item, le paramètre a reflète essentiellement la distance entre les moyennes des distributions correcte et erronée, le paramètre b, la facilité de l’item, et le paramètre c, la probabilité qu’un élève de la distribution erronée figure par erreur dans la distribution correcte (par exemple, un élève qui a deviné la bonne réponse). Parce que le processus de la TRI est itératif et requiert beaucoup de calculs, des progiciels différents peuvent produire des estimations légèrement différentes et nécessiter des temps de calcul différents. L’algorithme d’estimation d’IATA a tendance à être plus robuste pour un large éventail de tailles d’échantillon et est sensiblement plus rapide que d’autres programmes d’estimation TRI. Alors que d’autres méthodes utilisent des algorithmes d’approximation itératifs pour l’estimation des paramètres des items, IATA les calcule algébriquement à l’aide des équations suivantes : a = −(μ*correct /(−1 + p* + p* μ*correct 2))/1,7 (1 + q/(q + qcorrect)) b = (μincorrect + μ*correct – (2*s 2*LOG(q*/p*))/(μincorrect − μ*correct ))/2 c = q/(q + qcorrect), où p* = (1 − (1 − p)/(1 – c)) q* = q + qcorrect μ*correct = (−μincorrect * (1 – p*))/p* s 2 = 1 − (p* μ*correct 2 + (q*)* μincorrect2 + p* μ*correct + (q*) μincorrect) μcorrect = compétence moyenne des élèves ayant répondu de manière correcte μincorrect = compétence moyenne des élèves ayant répondu de manière erronée p = proportion des élèves ayant répondu de manière correcte q = proportion des élèves ayant répondu de manière erronée


THÉORIE DE LA RÉPONSE À L’ITEM

| 279

qcorrect = proportion des élèves qui ne connaissaient pas la réponse à l’item, mais ont deviné la bonne réponse (cette statistique est estimée en approximant l’asymptote inférieure de la fonction empirique de réponse à l’item). Notons que si la valeur du paramètre c est fixée à 0 (ce qui est une bonne pratique pour une grande variété de situations d’évaluation), alors qcorrect n’a pas besoin d’être estimée. Les nouvelles estimations des paramètres sont utilisées dans chaque cycle d’estimation pour mettre à jour les fonctions de compétence de chaque élève, à l’aide des méthodes décrites par Baker et Kim (2004). Bien que l’algorithme nécessite encore de nombreuses itérations pour produire les estimations finales, la robustesse des équations présentées ci-dessus pour l’estimation des paramètres de l’item réduit considérablement le temps de calcul et accroît la stabilité des estimations.

NOTE 1. Dans la TRI, la compétence des élèves est exprimée à l’aide d’une échelle (souvent appelée thêta) similaire aux scores Z, où le niveau de compétence moyen théorique vaut 0, et l’écart-type, 1. La plupart des élèves ont généralement des scores compris entre -2 et 2, et moins d’un sur mille ont des scores inférieurs à -3 (ou supérieurs à 3).


RÉFÉRENCES

Anderson, P. et G. Morgan. 2008. Developing Tests and Questionnaires for a National Assessment of Educational Achievement. Washington, DC : Banque mondiale. Baker, F. B. et S.-H. Kim. 2004. Item Response Theory : Parameter Estimation Techniques. 2e éd. New York : Marcel Dekker. Bullock, J. G., D. P. Green et S. E. Ha. 2010. « Yes, but What’s the Mechanism? (Don’t Expect an Easy Answer). » Journal of Personality and Social Psychology 98 (4) : 550–58. Crocker, L. et J. Algina. 2006. Introduction to Classical and Modern Test Theory. Pacific Grove, CA: Wadsworth. Cronbach, L. J. 1970. « Test Validation. » Dans Educational Measurement, 2e éd., dirigé par R. L. Thorndyke, 443–507. Washington, DC : American Council on Education. De Ayala, R. J. 2009. The Theory and Practice of Item Response Theory. New York : Guilford Press. DeMars, C. 2010. Item Response Theory. New York : Oxford University Press. Dumais, J. et J. H. Gough. 2012a. « School Sampling and Methodology. » Dans Implementing a National Assessment of Educational Achievement, dirigé par V. Greaney et T. Kellaghan, 57–106. Washington, DC: Banque mondiale.

281


282

|

RÉFÉRENCES

———. 2012b. « Weighting, Estimating, and Sampling Error. » Dans Implementing a National Assessment of Educational Achievement, dirigé par V. Greaney et T. Kellaghan, 181–257. Washington, DC : Banque mondiale. Fan, X. 1998. « Item Response Theory and Classical Test Theory: An Empirical Comparison of Their Item/Person Statistics. » Educational and Psychological Measurement 58(3) : 357–81. Freeman, C. et K. O’Malley. 2012. « Data Preparation, Validation and Management. » Dans Implementing a National Assessment of Educational Achievement, dirigé par V. Greaney et T. Kellaghan, 107–79. Washington, DC : Banque mondiale. Goldstein, H. et R. Wood. 1989. « Five Decades of Item Response Modelling. » British Journal of Mathematical and Statistical Psychology 42 (2) : 139–67. Greaney, V. et T. Kellaghan. 2008. Assessing National Achievement Levels in Education. Washington, DC : Banque mondiale. ———, dir. 2012. Implementing a National Assessment of Educational Achievement. Washington, DC : Banque mondiale. Haladyna, T. M. 2004. Developing and Validating Multiple-Choice Test Items. 3e éd. Mahwah, NJ : Lawrence Erlbaum Associates. Hambleton, R. K., H. Swaminathan et H. J. Rogers. 1991. Fundamentals of Item Response Theory. Newbury Park, CA : Sage. Hutcheson, G. et N. Sofroniou. 1999. The Multivariate Social Scientist. Londres : Sage. Karantonis, A. et S. G. Sireci. 2006. « The Bookmark Standard Setting Method : A Literature Review. » Educational Measurement: Issues and Practice 25 (1) : 4–12. Kellaghan, T. et V. Greaney. 2001. Using Assessment to Improve the Quality of Education. Paris : Organisation des Nations unies pour l’éducation, la science et la culture, Institut international de planification de l’éducation. Kellaghan, T., V. Greaney et T. S. Murray. 2009. Using the Results of a National Assessment of Educational Achievement. Washington, DC : Banque mondiale. Lord, F. M. et M. R. Novick. 1968. Statistical Theories of Mental Test Scores. Reading, MA: Addison-Wesley. Martin, M. O., I. V. S. Mullis et P. Foy (avec J. F. Olson, E. Erberber, C. Prewschoff et J. Galia). 2008. TIMSS 2007 International Science Report: Findings from IEA’s Trends in International Mathematics and Science Study at


RÉFÉRENCES

| 283

the Fourth and Eighth Grades. Chestnut Hill, MA: TIMSS & PIRLS International Study Center, Boston College. Mislevy, R. J. 1992. Linking Educational Assessments: Concepts, Issues, Methods, and Prospects. Princeton, NJ: Educational Testing Service. Mitzel, H. C., D. M. Lewis, R. J. Patz et D. R. Green. 2001. « The Bookmark Procedure: Psychological Perspectives. » Dans Setting Performance Standards: Concepts, Methods, and Perspectives, dirigé par G. J. Cizek, 249–81. Mahwah, NJ : Lawrence Erlbaum Associates. OCDE (Organisation de coopération et de développement économiques). 2007. PISA 2006: Science Competencies for Tomorrow’s World. Volume 1: Analysis. Paris : OCDE. Raudenbush, S. W. et A. S. Bryk. 2002. Hierarchical Linear Models : Applications and Data Analysis Methods, 2e éd. Thousand Oaks, CA : Sage. Snijders, T. A. B. et R. J. Bosker. 1999. Multilevel Analysis : An Introduction to Basic and Advanced Multilevel Modeling. Thousand Oaks, CA : Sage.


Turn static files into dynamic content formats.

Create a flipbook
Évaluations nationales des acquis scolaires, Volume 4 by World Bank Group Publications - Issuu