Sur cette page

Cette page est traduite en français, mais la base de connaissances elle-même, y compris ses pages d'articles, de concepts et de FAQ, est rédigée en anglais. Lire cette page en anglais

Traduction automatique de la page anglaise, non encore relue par une personne de langue maternelle.

Faites correspondre la méthode à la conclusion revendiquée. Si vous voulez savoir si les étudiants ont aimé une activité d'IA, une enquête peut aider. Si vous voulez savoir s'ils ont appris, utilisez des mesures de performance. Une enquête est une mesure auto-déclarée : c'est le bon instrument pour les attitudes et le mauvais pour l'apprentissage, pour les raisons rassemblées sur cette page. Si vous voulez savoir si l'IA a causé une amélioration, il vous faut une condition de comparaison crédible et, de préférence, une répartition aléatoire.

Options de méthode

La page Méthodes de recherche en IAED distingue plusieurs options utiles :

  • Les expériences randomisées offrent l'inférence causale la plus solide.
  • Les plans quasi expérimentaux avant/après ou avec groupes appariés sont souvent plus réalisables dans des classes intactes, mais ils étayent des affirmations causales plus faibles.
  • Les entretiens, groupes de discussion, observations et analyses d'artefacts qualitatifs révèlent des mécanismes et des expériences inattendues.
  • L'analyse qualitative assistée par IA peut réorganiser en quelques minutes des corpus d'entretiens ou d'observations, de sorte que la justifiabilité compte autant que l'exactitude ou la divulgation : consignez les réorganisations documentées qui permettent à un lecteur d'inspecter, de contester et de réviser le chemin qui mène des données à la conclusion.
  • Les méthodes mixtes combinent des preuves de résultats avec des explications des raisons pour lesquelles les effets se sont produits.
  • La recherche fondée sur la conception est utile lorsque des enseignants développent et affinent une intervention de manière itérative dans un cours authentique.

Quel que soit le canal utilisé, trois conditions seulement rendent une affirmation causale interprétable : un traitement décrit avec précision, une condition de comparaison bien définie et une mesure valide d'un apprentissage durable. Weidlich et al. (2025) examinent 19 comparaisons « ChatGPT en éducation » exactement selon ces critères et constatent que 4 seulement (21%) satisfont aux trois : 74% avaient un traitement bien défini, 42% un groupe témoin bien défini et 53% un résultat qui pouvait être qualifié d'apprentissage. Un outil polyvalent introduit en même temps que de nouvelles activités, de la rétroaction ou une conception d'interface confond le médium avec la méthode, si bien qu'un résultat significatif ne peut pas être attribué à l'IA.

Une évaluation de classe gérable

Pour une évaluation de classe gérable, un minimum utile consiste en une mesure de référence, l'intervention, une mesure immédiate après l'intervention et une mesure ultérieure sans assistance. Dans la mesure du possible, incluez une condition de comparaison, comme la pratique existante, l'absence d'IA, un accès libre à l'IA face à une IA étayée, ou deux conceptions alternatives. Mesurez séparément la performance assistée et l'apprentissage indépendant.

La synthèse Évaluation en IAED recommande des résultats tels que le gain d'apprentissage sans assistance, la rétention différée, le transfert vers une nouvelle tâche, la qualité du raisonnement, les conceptions erronées, l'adoption de la rétroaction et la performance des sous-groupes. L'engagement, la satisfaction, les journaux d'usage de l'IA, le sentiment d'efficacité personnelle et l'utilité perçue peuvent être de précieuses mesures secondaires, mais ne doivent pas être traités comme des substituts de l'apprentissage. La charge de travail des enseignants et le temps gagné sont aussi des résultats de mise en œuvre légitimes.

Deux mises en garde s'appliquent à la lecture des résultats. Premièrement, un effet moyen tiré de la littérature guide faiblement une classe particulière : l'audit d'O'Neill (2026) de 14 méta-analyses à fort impact a constaté qu'aucune ne fournissait une base valide pour ses affirmations. Les résultats regroupés de « réussite scolaire » mélangeaient les scores aux tests, la motivation, le sentiment d'efficacité personnelle et les attitudes en une seule estimation ; l'hétérogénéité rapportée était extrême (l'I² allait de 77.2% à 94.4% dans les 13 analyses qui le rapportaient, et 12 de ces 13 dépassaient 80%), les 14 évaluations du biais de publication étaient invalides, 61% des études primaires vérifiées au hasard présentaient des problèmes de validité, et les statistiques qui auraient montré à quel point les résultats individuels se dispersaient réellement étaient largement absentes (quatre analyses seulement rapportaient la variance entre études et deux seulement un intervalle de prédiction, tous deux incluant zéro). Deuxièmement, un score commode peut mesurer le mauvais construit : dans une évaluation de huit agents d'enseignement par IA, l'agent classé troisième selon le score propre à la plateforme arrivait dernier sur une grille validée par des experts, parce que les scores de la plateforme indexaient la performance des étudiants pendant l'interaction plutôt que la qualité de l'enseignement de l'agent. Traitez toute métrique de tableau de bord comme une hypothèse à valider par une mesure liée à la capacité que vous cherchez à développer.

Pour ce que les preuves actuelles montrent et ne montrent pas, et pour ce qui reste peu documenté, voir Utiliser l'IA aide-t-il réellement mes étudiants à apprendre ? et Quelles lacunes notables existe-t-il dans la littérature de recherche sur l'IA en éducation ?.

Intégrer cette page

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.