FAQ
Quelles sont les bonnes pratiques pour rapporter et interpréter la recherche sur l'IA en éducation ?
Traduction automatique de la page anglaise, non encore relue par une personne de langue maternelle.
Vous rédigez une étude sur l'IA en éducation dont l'affirmation est déjà en avance sur sa conception, ou vous en relisez une et cherchez à savoir si le chiffre mis en avant signifie quoi que ce soit. Dans les deux cas, les mêmes six omissions décident du résultat : quel système d'IA a réellement été utilisé, comment il était configuré, quel rôle pédagogique il jouait, si des humains ont conçu ou relu ses productions, ce que la mesure de résultat capturait vraiment, et ce que les auteurs ont fait des biais, des coûts et des limites. Un auteur qui les omet soumet une étude qui ne peut pas être évaluée ; un relecteur qui ne les cherche pas ne peut distinguer une intervention conçue d'une démonstration d'outil recyclée. « Non évaluable », et non « confirmé » ni « réfuté », est le verdict honnête lorsqu'elles manquent.
Les enjeux ne sont pas hypothétiques. O'Neill (2026) a audité 14 méta-analyses évaluées par les pairs affirmant que l'IA améliore l'éducation et a constaté qu'aucune ne fournissait de base valide aux affirmations qu'elle avançait. Bartoš et ses collègues (2026) ont agrégé 1,840 tailles d'effet issues de 67 méta-analyses et constaté qu'une fois le biais de publication modélisé, l'effet moyen tombe à environ un tiers de la médiane publiée (SMD = 0.196 contre 0.67). Denny et ses collègues (2026) ont vérifié 30 références fabriquées dans 14 articles d'enseignement de l'informatique, tous publiés en 2025 ou 2026, un défaut qui atteint les lecteurs précisément parce que les relecteurs ne peuvent pas vérifier chaque entrée d'une bibliographie. La discipline de restitution détermine si la base de preuves du domaine est utilisable ou non. Pour les choix de conception qui la sous-tendent, voir Méthodes de recherche en IA en éducation ; pour le catalogue des modes de défaillance, Limites de la recherche en AIEd. Pour le versant du lecteur, c'est-à-dire ce qu'un praticien fait d'un article une fois qu'il existe, voir Interpréter et appliquer la recherche en AIEd.
La version courte
Six gestes décident si votre affirmation survivra à la relecture :
- Décrivez le système d'IA comme un traitement, et non comme un fournisseur. Modèle, version, configuration, invites, rôle, et le fait que des humains aient conçu ou relu la production.
- Énoncez la justification pédagogique et la comparaison active. Un nom de produit n'est pas une méthode ; la pratique habituelle n'est pas un groupe témoin équitable.
- Faites correspondre la mesure à l'affirmation. Ce que l'instrument capture, sa validation pour cette population, et le caractère différé et non assisté du résultat.
- Validez chaque jugement automatisé. Nommez l'étalon de référence, la cible de calibration et la personne qui a arbitré le désaccord.
- Rapportez l'incertitude de l'analyse, et pas seulement son estimation ponctuelle : effets dépendants, τ², intervalles de prédiction, tailles des sous-groupes, évaluation du biais de publication.
- Rapportez les contreparties : procédure d'éthique et de gouvernance, coût de calcul et coût environnemental, votre propre usage de l'IA, les résultats nuls, et uniquement les citations que vous avez vérifiées.
Décidez ce que vous direz du système d'IA, et écrivez-le de façon à ce qu'on puisse le reconstruire
C'est le contrôle que la plupart des soumissions échouent. Le cadre RAISE (Reporting AI Studies in Education, Allison 2026) est une liste de contrôle de 30 items répartis en dix domaines thématiques, et son diagnostic est précis plutôt que rhétorique : les soumissions omettent régulièrement quel modèle a été utilisé (GPT-4, Claude ou un algorithme sur mesure), comment il était configuré (invites, paramètres de réglage fin), quel rôle il jouait (générateur de rétroaction, co-auteur, tuteur, évaluateur) et si des acteurs humains ont conçu ou relu ses productions. Il reste alors aux relecteurs quatre questions sans réponse : « Que faisait exactement l'IA ? », « Était-ce nécessaire ? », « Est-ce réplicable ? » et « Les affirmations sur les apprentissages sont-elles crédibles ? »
Il va de la justification pédagogique à la spécification au niveau de l'API, à l'interaction entre apprenant et IA, à l'accessibilité et à l'adéquation culturelle, aux participants et au contexte, à l'implication humaine, à la conception, à l'éthique, à la transparence et à la reproductibilité, jusqu'aux limites. Sa matrice d'éthique et de risque associée couvre les risques pour l'autonomie des apprenants, l'équité, la gouvernance des données et la transparence algorithmique. Hwang, Xie, Wah et Gašević (2026) proposent une alternative allégée, TEP-AIED, qui replie transparence, éthique et pédagogie dans une seule structure interdépendante, fournit un tableau de lignes directrices mis en correspondance avec sept sections d'article, et demande aux auteurs d'ajouter une sous-section de méthode intitulée « Transparency, Ethics, and Pedagogy Considerations », car selon eux RAISE est exhaustif mais trop granulaire pour un usage empirique courant. Cette divulgation relève de l'information sur l'usage de l'IA et c'est elle qui rend vérifiables les affirmations sur la vie privée et l'éthique.
Décidez si votre intervention est une méthode ou un produit
La justification pédagogique est le premier domaine de RAISE parce que l'IA n'est pas un outil neutre : sa valeur dépend de l'alignement entre le problème d'apprentissage, une justification théorique et la correspondance entre les objectifs et les mesures de résultat. O'Neill (2026) a constaté que toutes les méta-analyses auditées sauf deux définissaient le traitement comme un outil (ChatGPT, IA générative, « IA ») et qu'un nom de produit n'est pas une pédagogie ; traiter l'exposition à ChatGPT comme une intervention commune revient à méta-analyser les effets du « papier ». Weidlich et ses collègues (2025) tiennent le même raisonnement pour les études primaires : en auditant un sous-ensemble des comparaisons à la base d'une méta-analyse de premier plan, ils ont trouvé que seuls 21% disposaient d'un traitement bien défini, d'un groupe témoin et d'une mesure valide de l'apprentissage, et que la taille d'effet rapportée (g = 0.7) dépassait celle de systèmes de tutorat intelligent conçus à cette fin (0.66), signe que le « traitement » était une sauce secrète hétérogène plutôt qu'une méthode nommée.
Le test : un lecteur compétent pourrait-il reconstruire votre intervention à partir de la seule section de méthode et obtenir la même chose ?
Décidez ce que mesure votre instrument, et donc ce que l'affirmation peut dire
Dans l'audit des preuves d'O'Neill portant sur 46 études primaires tirées au hasard, 28 (61%) présentaient des problèmes de validité, et l'inadéquation de la variable dépendante était la plus fréquente (n = 15), suivie de l'inadéquation de la variable indépendante (n = 11), des problèmes de plan expérimental (n = 7), des problèmes d'extraction des données (n = 6), de l'absence de groupe témoin (n = 6) et de l'attribution non aléatoire des groupes (n = 6). Les résultats multidimensionnels étaient régulièrement agrégés comme s'ils étaient interchangeables : notes de test, qualité des devoirs, Motivation, sentiment d'efficacité personnelle, attitudes et engagement fondus en un seul chiffre de « réussite scolaire ».
Deux habitudes de restitution l'évitent. Indiquez quel construit l'instrument mesure et qu'il a été validé pour cette population : voir Self-Report Measures pour les écarts entre mesures fondées sur la perception et comportements réels, et Assessment Validity sur la validité de construit. Rapportez ensuite un résultat qui ne dépende pas de la croyance de l'apprenant à l'égard de l'aide, car la performance immédiate à la tâche en situation d'assistance n'est pas un gain d'apprentissage : une mini-revue de 2026 portant sur 493 enregistrements et 14 études prioritaires a constaté qu'aucune ne mesurait ensemble la réussite de la vérification et la décision de s'y fier qui suit, par rapport à un étalon de qualité des productions arbitré indépendamment, et rares étaient celles qui dépassaient la performance immédiate pour examiner la rétention ou le transfert différés. Les preuves d'un apprentissage durable restent mitigées, et la décharge cognitive est le mécanisme qui distingue le plus plausiblement les deux.
Décidez comment vos jugements automatisés ont été validés
L'évaluation en AIEd délègue de plus en plus la notation à des modèles, ce qui fait de la procédure de validation une partie du résultat plutôt qu'une annexe. Le compte rendu de Khan Academy sur les indicateurs de son tuteur IA indique que l'engagement cognitif est noté par un juge LLM calibré sur des experts pédagogiques humains à F1 0.83, et que les mouvements des indicateurs provenaient de plus de 40 expériences en conditions réelles en cinq mois plutôt que d'une évaluation hors ligne (Udeshi et ses collègues, 2026). Tseng et ses collègues (2026) montrent que le désaccord entre humains et machines sur la qualité des questions de prétest est systématique plutôt qu'aléatoire, et que l'opérationnalisation de la grille d'évaluation compte plus qu'une invite formulée d'abord comme justification.
L'accord avec des codeurs humains n'est pas la qualité, et le présenter comme tel est une cible pour les relecteurs. Liu et ses collègues (2026) ont fait juger par un expert indépendant 855 ensembles de codes par paires, en aveugle quant à leur source, et ont trouvé un accord humain-LLM (Jaccard moyen 0.30) bien inférieur à l'accord entre humains (0.52), tandis que le vérificateur en aveugle préférait le codage humain et le codage automatique à des taux indiscernables (51.5% contre 48.5%, p = 0.537). Rapportez la cible de calibration, l'étalon de référence et la personne qui a arbitré.
Décidez si la comparaison est équitable et jusqu'où porte l'affirmation
L'équité et la portée échouent de la même manière : un effet important qui signifie moins qu'il n'y paraît. 11 des 14 méta-analyses auditées ne fixaient aucune frontière de population, si bien que « les étudiants » allaient des enfants aux internes en médecine ; un seul cours, établissement, discipline ou pays ne justifie pas une affirmation générale, et les résultats obtenus pour un outil se transposent rarement à un autre. Les effets de nouveauté, le temps supplémentaire passé sur la tâche et une condition de comparaison qui recevait un enseignement habituel plutôt qu'un groupe témoin actif sont les explications habituelles d'un effet important : rapportez donc ce que le groupe témoin faisait réellement, combien de temps chaque groupe a passé, et à quel point l'outil était nouveau. Indiquez aussi la frontière de population, car les effets diffèrent selon les groupes d'apprenants et c'est une frontière non déclarée qui permet à un seul chiffre agrégé de tenir lieu de tous les autres (voir Effets différenciés selon les groupes d'apprenants). Traitez également l'outil comme une cible mouvante : les systèmes propriétaires changent sans préavis, un résultat est donc lié à une version de modèle, et le Benchmark qui a fait sensation dans une version peut ne pas tenir dans la suivante.
Décidez ce que votre analyse peut étayer, et rapportez son incertitude, pas seulement son chiffre phare
Pour les synthèses, rapportez le traitement des effets dépendants, la variance inter-études, les intervalles de prédiction et l'évaluation du biais de publication, et pas seulement l'I². O'Neill a constaté que l'hétérogénéité rapportée était grave partout où elle était donnée (I² de 77.2% à 94.4% sur 13 méta-analyses, dont 12 au-dessus de 80%) et jamais résolue (aucune analyse de modérateur n'atteignait la taille minimale de sous-groupe de dix études), que 12 méta-analyses traitaient comme indépendantes des tailles d'effet dépendantes issues de la même étude, ce qui gonfle les preuves apparentes, et que seules quatre rapportaient la variance inter-études (τ²) et seules deux un intervalle de prédiction, tous deux incluant zéro. Le biais de publication n'était validement évalué nulle part.
Parce que l'I² dépend de la précision, un chiffre d'hétérogénéité doit voyager avec son modèle : Limites de la recherche en AIEd documente une synthèse dont l'hétérogénéité est de I² = 82.98% sous un modèle à effets fixes et de 15.75% sous un modèle à effets aléatoires, si bien qu'un lecteur à qui l'on donne seulement le premier chiffre ne peut pas savoir à quel point le corpus est incohérent. Rapportez le τ² et un intervalle de prédiction à côté ; voir méta-analyse et revue systématique pour les conventions du côté des revues, et actualisez le chiffre phare en conséquence : la moyenne corrigée du biais de Bartoš et de ses collègues était SMD = 0.196 avec un intervalle de prédiction allant de −1.521 à +1.908, couvrant aussi bien un préjudice substantiel qu'un bénéfice substantiel pour une nouvelle étude hypothétique.
Décidez ce que vous divulguez sur l'éthique, les coûts et la gouvernance, et sur votre propre usage de l'IA
Une revue de tous les articles de la conférence AIED 2025 a mis en évidence un schéma d'« adoption des LLM sans divulgation » : la plupart des projets utilisaient des LLM, mais moins d'une poignée rapportait la consommation de ressources ou l'empreinte carbone. Cet article fournit une méthode open source avec des outils de mesure pour le matériel local et le cloud, ainsi qu'une formule pour estimer le coût de calcul de modèles de pointe dont le nombre de paramètres n'est pas divulgué, et soutient que ne pas rapporter ces coûts est en soi un enjeu éthique. Ajoutez la gouvernance des données, le consentement et l'adéquation en matière d'accessibilité et de culture (des items de RAISE ; Universal Design for Learning, Accessibility) : voir Comment la recherche sur l'IA en éducation doit-elle intégrer l'équité, l'accessibilité, la confidentialité, l'éthique et la sécurité pédagogique ? pour un traitement plus complet de ces obligations.
Votre propre usage de l'IA dans le processus de recherche exige la même divulgation. l'analyse PRISMA-LLM de Zabaleta et Lin portant sur 888 articles d'automatisation de revues montre à quel point cette restitution est inégale : depuis 2023, 38.0% des articles sur des logiciels ou des produits ne rapportaient aucune évaluation (contre 9.3% des articles sur les LLM), la richesse moyenne de la restitution était de 6.3 pour les articles sur les LLM contre 3.3 pour les articles sur des logiciels ou des produits, et 84.1% de l'usage des LLM reposait sur des systèmes propriétaires ou hébergés, avec seulement 4.9% de modèles à poids ouverts. Leur cadre sépare la divulgation de la mise en œuvre de l'évaluation sensible aux conséquences, sur cinq niveaux de divulgation, un modèle utilisable pour décrire ce qu'un outil a fait dans une revue. Dai et Chan (2026) ajoutent le versant des auteurs : 27 des 28 chercheurs de troisième cycle utilisaient l'IA générative pour l'idéation, la revue de littérature, l'explication, le traitement des données, la programmation, la rédaction académique, l'édition et la traduction, en calibrant leur usage selon les enjeux et les normes disciplinaires, tout en notant que les politiques institutionnelles portent sur l'enseignement et l'évaluation plutôt que sur les pratiques de recherche.
Décidez quoi faire des résultats nuls et des citations
Denny et ses collègues ont vérifié 30 références fabriquées dans 14 articles, le nombre vérifié dans un symposium technique passant de 3 en 2025 à 17 en 2026 (soit 2.3% des articles de ce symposium cette année-là), et la rédaction assistée par LLM rend bon marché la production d'une citation inventée plausible. Leurs contreparties importent lorsque vous citez cet audit : la plupart des références signalées étaient bénignes, 229 étant des incohérences de métadonnées ACM où le PDF était correct et 188 des variantes bibliographiques valides, le nombre de fabrications est donc délibérément un plancher et la majorité bénigne n'est pas une erreur d'arrondi. Vérifiez chaque entrée que vous ne pouvez pas contrôler personnellement.
Rapporter les résultats nuls et négatifs est l'autre face de la même pièce. Bartoš et ses collègues (2026) ont trouvé des preuves solides de résultats nuls supprimés (chaque test d'Egger p < .0001) et une hétérogénéité extrême (τ = 0.869), sans qu'aucun sous-groupe par résultat, domaine, niveau ou rôle de l'IA ne montre de gains constants. Ils n'ont pas non plus trouvé de différence entre les études publiées avant et après janvier 2023, ce qui affaiblit l'affirmation selon laquelle les outils génératifs modernes produisent spécifiquement des gains.
Les faiblesses documentées du domaine, dans ses propres chiffres
Les taux de base auxquels une affirmation devrait être comparée :
- Validité : 28 des 46 études primaires vérifiées (61%) présentaient des problèmes de validité ; seules 21% des comparaisons auditées disposaient d'un traitement bien défini, d'un groupe témoin et d'une mesure valide.
- Hétérogénéité non résolue : I² de 77.2% à 94.4% sur 13 méta-analyses, 12 au-dessus de 80%, aucune analyse de modérateur atteignant le minimum de dix études, des effets dépendants traités comme indépendants dans 12 cas, et seulement quatre synthèses donnant le τ² contre seulement deux un intervalle de prédiction.
- Biais de publication : non évalué dans les 14 méta-analyses auditées ; chaque test d'Egger dans l'ensemble plus large était significatif (p < .0001), avec τ = 0.869.
- Références : 30 fabrications dans 14 articles, 17 dans un symposium de 2026, soit 2.3% des actes de cette année.
Les objections que vous entendrez
« Les relecteurs veulent de la nouveauté, pas des détails de méthode. » Les revues évoluent en sens inverse : RAISE et TEP-AIED donnent aux rédacteurs un construit à exiger, et la sous-section de méthode de TEP-AIED est un point d'entrée peu contraignant. Ce sont les détails de méthode qui transforment un article non évaluable en article citable.
« Nous n'avons pas la place. » Les cinq niveaux de divulgation sont des niveaux de restitution et non des niveaux de risque, la profondeur d'évaluation d'une chaîne de traitement peut donc tenir en une ou deux phrases. Version, invites et rôle tiennent dans un court paragraphe ; coûts et gouvernance tiennent dans une phrase de limites.
« Tout le monde le rapporte ainsi. » C'est le résultat, et non une défense : 61% des études primaires vérifiées présentent des problèmes de validité, 12 des 13 méta-analyses sont au-dessus de 80% d'hétérogénéité, et 38.0% des articles sur des logiciels ou des produits n'ont aucune évaluation. La norme est le défaut.
« Notre outil est propriétaire, nous ne pouvons donc pas rapporter le modèle. » Rapportez la version, la date de consultation, la configuration, les invites que vous avez fournies, le rôle et les garde-fous. Si le fournisseur ne veut rien dire, cette contrainte appartient aux limites, comme borne de l'affirmation.
« Rapporter les résultats nuls nous nuira. » Les résultats nuls supprimés sont le mécanisme documenté derrière la moyenne corrigée du biais de SMD = 0.196 ; les publier est ce qui garde votre résultat positif lisible.
Liste de contrôle avant soumission
- À rapporter : le modèle, la version, la configuration et les invites, ainsi que le rôle de l'IA dans la conception. À vérifier : pourriez-vous reconstruire l'intervention à partir de la seule section de méthode ?
- À rapporter : la justification pédagogique et la condition de comparaison active. À vérifier : le traitement est-il une méthode nommée plutôt qu'un nom de produit ?
- À rapporter : ce que chaque mesure capture, sa validation pour cette population, et le résultat différé ou non assisté. À vérifier : le chiffre mis en avant correspond-il à la variable dépendante ?
- À rapporter : qui a arbitré les jugements automatisés, par rapport à quel étalon de référence, avec quel accord. À vérifier : l'exactitude ou l'accord est-il utilisé comme s'il s'agissait de la qualité ?
- À rapporter : le traitement des effets dépendants, le τ², les intervalles de prédiction, les tailles des sous-groupes de modérateurs et l'évaluation du biais de publication. À vérifier : l'hétérogénéité est-elle citée avec son modèle et sa précision ?
- À rapporter : l'implication humaine, la gouvernance des données, le consentement, l'accessibilité et l'adéquation culturelle, ainsi que le coût de calcul et le coût environnemental. À vérifier : les affirmations éthiques sont-elles étayées par une procédure décrite plutôt que par des principes affirmés ?
- À rapporter : l'usage de l'IA à l'intérieur du processus de recherche, sur les cinq niveaux de divulgation. À vérifier : la chaîne de relecture ou d'analyse a-t-elle été évaluée, ne serait-ce qu'un peu ?
- À rapporter : les résultats nuls, négatifs et infirmants aux côtés des résultats positifs. À vérifier : la taille d'effet est-elle dégradée en fonction d'un biais de publication probable ?
Ce qui relèverait réellement le niveau d'exigence
Les remèdes proposés dans cette littérature sont institutionnels plutôt qu'individuels. O'Neill recommande une transparence obligatoire des données pour les méta-analyses (tableaux complets des tailles d'effet, structures de dépendance, τ² et intervalles de prédiction), ainsi qu'un filtrage renforcé par les relecteurs et les comités de rédaction et une pratique de rétractation qui fonctionne, en soutenant que ces défaillances sont le produit d'un filtrage défaillant plutôt que des erreurs isolées. PRISMA-LLM propose cinq niveaux de divulgation comme niveaux de restitution plutôt que de risque, afin que la profondeur d'évaluation d'une chaîne de revue soit énoncée clairement ; RAISE et TEP-AIED donnent aux revues un construit à exiger dans les soumissions. Pour des terrains connexes, voir les lacunes notables de la littérature de recherche, Limites de la recherche en AIEd et mesures et méthodes pour évaluer les interventions liées à l'IA. Un remède peu coûteux relève des auteurs : chaque page d'article de cette base de connaissances associe désormais une étude à une section Ce que cela signifie pour la pratique et, le plus souvent, à une section Limites ; écrire l'article de façon à pouvoir remplir honnêtement ces deux sections (l'action qu'un praticien pourrait mener, et la contrainte qui pèse sur elle) est donc une habitude de restitution autant qu'une habitude de rédaction (voir Interpréter et appliquer la recherche en AIEd).