Sur cette page

Cette page est traduite en français, mais la base de connaissances elle-même, y compris ses pages d'articles, de concepts et de FAQ, est rédigée en anglais. Lire cette page en anglais

Traduction automatique de la page anglaise, non encore relue par une personne de langue maternelle.

Si vous pilotez le développement professionnel des enseignants, la pression que vous subissez ressemble probablement à l'un de ces cas : votre vice-recteur veut un programme sur l'IA cette année, la participation est bonne mais rien ne change dans les salles de classe, ou les personnes qui en auraient le plus besoin ne viendront pas. Ces trois situations pointent le même défaut de conception. Ce qui change la pratique d'un enseignant n'est pas d'apprendre ce qu'un outil sait faire ; c'est de consacrer du temps structuré et accompagné à un problème de son propre cours, assez longtemps pour qu'une nouvelle habitude remplace une ancienne, l'institution disant explicitement oui à l'expérimentation au lieu de simplement la tolérer.

La version courte. Cessez d'organiser des démonstrations d'outils. Standardisez un cycle de séance où chaque participant arrive avec un artefact réel de son cours et repart avec une version révisée, intégrez la vérification, la divulgation et la maîtrise des risques dans le modèle de travail plutôt que comme un supplément éthique, étalez le programme sur plus d'une journée et assortissez-le d'un mentorat, constituez des cohortes propres à une discipline, et mesurez à distance les artefacts produits plutôt que le sentiment de confiance du dernier après-midi. Le reste de cette page présente les preuves à l'appui de chacun de ces choix, les conditions institutionnelles qui déterminent s'ils tiennent, et ce qu'il faut répondre à un doyen qui demande si cela a fonctionné.

Pourquoi le modèle de l'atelier sous-performe

La comparaison la plus directe de cette littérature est celle de Bi et ses collègues (2026), qui ont interrogé 568 enseignants de cinq universités puis mené une quasi-expérience avec 160 d'entre eux. Les deux groupes ont bénéficié de quatre ateliers de 90 minutes sur des semaines consécutives, avec un temps de contact identique, la même plateforme et le même accompagnement des animateurs. La différence portait sur le contenu : un groupe suivait un développement professionnel classique sur l'IA générative, l'autre suivait un cycle structuré de formulation d'invites, de relecture des productions, de révision des supports de cours et de réflexion écrite, selon un modèle en sept composantes couvrant les objectifs, les contraintes de la tâche, les critères d'évaluation, la vérification, la divulgation et la maîtrise des risques. Le groupe structuré obtenait de meilleurs scores sur les sept dimensions de préparation, avec son avantage le plus net en conception d'invites, à environ deux écarts-types, et c'était le seul groupe dont le gain en conception d'invites survivait à une évaluation différée : le gain plus modeste du groupe classique était retombé sous le niveau de départ au suivi.

Deux autres résultats expliquent pourquoi les démonstrations se transposent mal. Dans l'étude de Bai et Hsieh (2026), menée auprès de 898 enseignants universitaires sur des échelles AI-TPACK, les enseignants qui comprenaient le fonctionnement des outils génératifs, ou savaient les utiliser avec compétence, n'étaient pas plus enclins à déclarer inventer et mettre en œuvre de nouvelles pratiques pédagogiques que ceux qui en étaient incapables. Le construit intégré AI-TPACK n'avait aucune voie directe vers un comportement innovant : son influence passait entièrement par la littératie en IA, le sentiment d'efficacité personnelle pédagogique et l'identité professionnelle. Autrement dit, la capacité est médiée par la manière dont l'enseignant se perçoit, ce qu'une démonstration d'outil ne traite pas.

Il existe aussi un plafond. Dans une étude intra-sujets menée avec 13 enseignants du supérieur, l'accès à un chatbot augmentait la part des activités atteignant au moins deux tâches de Bloom d'ordre supérieur, de 41.7% à 91.7% (p = .01), et réduisait l'effort cognitif perçu d'une médiane de 6.33 à 3.33 (p = .004), mais la formation à l'usage pédagogique des invites ajoutée par-dessus n'améliorait pas davantage la qualité de la conception et augmentait légèrement l'effort. Et dans un atelier réunissant 60 enseignants de sciences du secondaire, l'élément productif était la relecture collaborative de questions d'évaluation générées par ChatGPT, ce qui faisait apparaître les problèmes de précision conceptuelle et le risque de renforcer les idées fausses. Ce que ces deux études ont en commun : l'apprentissage venait de la critique et de la révision des supports, et non de la présentation de supports.

Quoi construire à la place

L'architecture de conception qui correspond le mieux aux preuves ci-dessus est le cadre i-TPACK de Dogan (2026), construit à partir d'une revue PRISMA sur le développement professionnel lié à l'IA et d'une recherche ayant fait émerger 17 études supplémentaires. Il aligne cinq domaines de connaissances (connaissances technologiques intelligentes, connaissances technologiques de contenu, connaissances technologiques pédagogiques, i-TPACK intégré et éthique de l'IA) sur quatre parcours fondés sur des preuves : l'apprentissage actif, les modèles et exemples, l'accompagnement et l'appui d'experts, ainsi que la rétroaction et la réflexion, le tout régi par cinq principes allant de la synergie collective plutôt que les silos à la flexibilité dans la structure. Sa critique du domaine mérite d'être prise au sérieux avant de copier le programme de qui que ce soit : dans de nombreuses offres existantes, l'éthique est traitée superficiellement ou totalement absente. La limite du cadre est qu'il est conceptuel, sans données de résultats au niveau des programmes.

Traduit en un programme que vous pourriez lancer le trimestre prochain, cela signifie :

  • Chaque séance se termine par un artefact révisé. Les participants apportent un objectif, une grille d'évaluation ou une tâche d'évaluation et repartent avec la version modifiée. Bi et ses collègues (2026) ont mesuré exactement ce cycle, et c'est la version qui a tenu au suivi.
  • Le modèle de travail porte les parties difficiles. La vérification, la divulgation et la maîtrise des risques appartiennent au document de travail que les participants utilisent toute la semaine, et non à un segment de clôture. C'est aussi ce qui donne à l'inquiétude un exutoire utile, ce qui importe plus bas.
  • Traitez la conception de l'évaluation comme la cible la plus productive. Dans le programme de huit heures de Talebzadeh (2026), réparti en quatre séances de deux heures avec 163 enseignants et futurs enseignants, le score total d'AI-PCK passait de 151.65 à 220.14 (d = 2.36, p < .001) et l'effet le plus fort portait sur les grilles d'évaluation (d = 2.19), qui était aussi le domaine le plus faible au prétest. L'écart était plus étroit en méthodes d'enseignement qu'en évaluation.
  • Prévoyez plus d'une journée et ajoutez un mentorat. Dans ce même programme, les futurs enseignants progressaient nettement plus que les enseignants expérimentés (p = .033), surtout dans la conception de tâches fondées sur des scénarios et la conception de grilles. Les enseignants expérimentés jugeaient huit heures trop courtes pour modifier des habitudes profondément ancrées et demandaient un accompagnement à long terme fondé sur le mentorat.
  • Segmentez votre public au lieu de proposer un atelier universel. Sutedjo, Chowdhury et Liu (2026) ont constaté, parmi 127 répondants, que les connaissances pédagogiques de contenu auto-perçues étaient élevées (M = 4.70) et les connaissances de contenu proches du plafond (M = 5.15), tandis que les connaissances technologiques pédagogiques (M = 2.62), les connaissances technologiques de contenu (M = 2.75) et le TPACK global (M = 2.55) étaient nettement plus faibles. Les connaissances de contenu ne présentaient aucune corrélation significative avec un domaine intégrant la technologie (r = .11–.15), la maîtrise disciplinaire ne se transpose donc pas, et ces trois domaines faibles corrélaient entre eux à r = .81–.91, ce qui suggère plausiblement une seule capacité d'enseignement comme socle commun plutôt que trois modules distincts.
  • Décidez si les relations font partie du périmètre. Aponte et ses collègues (2026) soutiennent que l'IA contribue au développement socio-émotionnel des enseignants seulement lorsqu'elle agit comme infrastructure relationnelle (temps protégé pour le mentorat, dialogue entre pairs, communautés de pratique) et proposent la densification relationnelle comme norme, en comptant la confiance, la continuité de l'accompagnement et la co-régulation plutôt que les heures de contact. Deux de leurs affirmations se transposent directement : le temps libéré est réabsorbé en demande supplémentaire à moins que l'institution n'exige formellement qu'il soit réinvesti, et les agents conversationnels peuvent devenir discrètement un substitut sans friction aux négociations humaines difficiles qui produisent la croissance. Leur cadre est une heuristique, et non une affirmation causale testée.

Les conditions institutionnelles décident plus que le programme

Voici le résultat à apporter en réunion de direction. Dans la même étude, les enseignants kazakhstanais déclaraient une préparation initiale supérieure à celle de leurs homologues chinois sur les sept dimensions, avec les écarts les plus larges en transfert disciplinaire, en conception d'invites et en compréhension de base. Pourtant, dans la régression hiérarchique, le coefficient du Kazakhstan, clairement significatif isolément, tombait à la non-significativité, soit une réduction d'environ quatre cinquièmes, dès que l'usage antérieur de l'IA générative, une formation récente à l'IA, le soutien institutionnel, la permission perçue, l'accès à des ressources multilingues, la clarté des politiques et la sensibilité au risque étaient introduits. Le soutien institutionnel et la permission perçue portaient le poids positif le plus fort. La sensibilité au risque était le seul prédicteur jouant contre la préparation. Plus de deux fois plus d'enseignants kazakhstanais que chinois déclaraient une formation liée à l'IA dans les six mois précédents.

Pour une personne responsable de programme, les leviers sont donc locaux et de proximité : pratique concrète, permission explicite d'expérimenter, supports dans les langues dans lesquelles votre corps enseignant travaille réellement, et soutien visible de l'unité. Le cadrage des politiques nationales ne porte pas à lui seul la préparation. Là où la sensibilité au risque mord, la réponse n'est pas de minimiser la prudence mais de lui donner un lieu où s'exercer : la conception de grilles d'évaluation et les routines de vérification sont ce qui transforme l'inquiétude en jugement.

Deux frictions pratiques appartiennent à la même conversation. L'intention d'usage continu était la dimension de satisfaction la mieux notée dans l'étude de Bi et de ses collègues (2026), tandis que l'utilisabilité de l'outil était la moins bien notée : une partie de ce qui ressemble à de la réticence est donc de la friction liée à la plateforme. Et Aponte et ses collègues (2026) situent la limite dure : l'IA ne peut pas compenser une surcharge chronique, des cultures de responsabilité punitive, un leadership faible ou l'absence de temps protégé. Si telles sont vos conditions, un meilleur atelier ne les résoudra pas.

Les sceptiques et les anxieux sont le cœur du sujet, pas l'obstacle

Laidlaw (2026) soutient, à partir d'un récit autoethnographique, que la résistance n'est pas un déficit de compétences. Les enseignants qui demandent à quoi sert d'enseigner dans un monde d'IA générative ne demandent pas comment utiliser un outil en sécurité ; la question est ontologique. Lisant l'IA générative comme un concept seuil (transformatif, problématique, irréversible, intégrateur, borné), elle conclut que l'anxiété, la résistance et la confusion sont des parties nécessaires de son franchissement plutôt que des problèmes à corriger, et ses recommandations inversent l'atelier standard : commencer par des questions d'identité plutôt que par des démonstrations, constituer des cohortes propres à une discipline, accepter des temporalités différentes et considérer comme légitime une non-adoption fondée sur des valeurs disciplinaires. Elle avertit aussi que la communication des règles peut glisser vers une « illusion d'application » qui substitue un discours de conformité à l'accompagnement.

Il y a là aussi un argument de conception en faveur de l'adaptation. Dans l'étude de Bai et Hsieh (2026), l'identité professionnelle prédisait le comportement innovant presque deux fois plus fortement chez les utilisateurs peu fréquents de l'IA que chez les utilisateurs quotidiens, un résultat limite, mais qui suggère que le travail identitaire porte ses fruits surtout auprès des personnes qui touchent à peine aux outils. Sutedjo et ses collègues plaident pour une programmation délibérément propre à chaque discipline parce que l'expertise ne se transpose pas ; Laidlaw veut des cohortes propres à une discipline comme cadre des conversations identitaires ; et Bai et Hsieh suggèrent de différencier selon l'expérience, les utilisateurs occasionnels ayant besoin de repères fondamentaux et les utilisateurs fréquents tirant davantage de projets interdisciplinaires.

Pour le participant anxieux, Aponte et ses collègues (2026) ajoutent une condition de gouvernance plutôt que de motivation : séparer l'accompagnement du bien-être de l'évaluation managériale, minimiser les données, limiter la finalité, maintenir la participation volontaire et garantir une supervision humaine. C'est ce qui permet d'admettre son incertitude sans risque dans un espace médié par l'IA.

La couche affective dispose désormais de son propre instrument. Vassallo (2026) a interrogé 109 universitaires et identifié un « complexe de culpabilité lié à l'IA » : 35% craignaient que l'usage de l'IA nuise à leur crédibilité et 26% déclaraient avoir l'impression de « tricher », la culpabilité anticipée liée à la crédibilité dépassant le remords après usage, la détresse est donc socioprofessionnelle plutôt que privée. Quatre profils se dégagent : les adoptants à l'aise (27%), les non-utilisateurs coupables (29%), les utilisateurs prudents (28%) et les évitants en détresse morale (16%), ce qui signifie qu'un programme unique s'adresse à quatre problèmes différents, et que les 29% qui ressentent de la culpabilité sans utiliser les outils ont besoin d'autre chose que d'une démonstration. L'ampleur de la tâche institutionnelle est visible dans l'enquête AAC&U/Elon auprès de 1,057 enseignants (Watson et Rainie 2026) : 68% déclaraient que leur établissement n'avait pas préparé le corps enseignant à utiliser l'IA générative pour l'enseignement et le mentorat, une proportion similaire pour la recherche, tandis que 26% des répondants n'utilisent pas du tout ces outils, dont 40% des enseignants d'arts et de lettres, et 82% citent la résistance de leurs collègues comme obstacle à l'adoption au niveau du département.

Prouver que cela a fonctionné à qui finance

L'échafaudage institutionnel auquel il vaut la peine de s'aligner est celui de Crompton, Burke et Nickel (2026), dont la recherche fondée sur la conception, menée sur deux macrocycles avec 114 participants (des enseignants de 28 établissements américains et de 11 pays, ainsi que des directeurs de centres d'enseignement et des coordinateurs d'accréditation), a produit six normes couvrant l'ensemble du métier universitaire plutôt que le seul volet enseignement : enseignant, coordonnateur, responsable, chercheur, apprenant et contributeur. L'écart est réel : les cadres et normes existants pour les éducateurs visent les enseignants du primaire et du secondaire ou ne traitent que l'enseignement. Des normes de ce type permettent à un centre de développement d'aligner son offre sur l'évaluation professionnelle et l'accréditation au lieu de proposer des ateliers déconnectés, ce qui est aussi l'argument qui résiste à une revue budgétaire.

Soyez prudent dans votre évaluation, car la majeure partie de cette littérature mesure des déclarations. Bi et ses collègues (2026) ont mesuré une préparation autodéclarée, et non l'enseignement effectif ou l'apprentissage des étudiants, et leurs groupes se sont formés par inscription volontaire et par planification institutionnelle plutôt que par randomisation : leurs résultats sont donc des associations et non des estimations causales. L'étude de Bai et Hsieh (2026) est transversale et auto-sélectionnée, repose sur huit universités d'un seul pays et mesure chaque construit auprès des mêmes répondants à un même moment ; leur échelle d'innovation conserve en outre la formulation d'une mesure générale de l'innovation. Sutedjo et ses collègues ne peuvent établir le sens de la causalité, ce qui importe car leur affirmation la plus forte, selon laquelle les connaissances technologiques agissent comme une passerelle, est exactement ce qu'un plan transversal ne peut trancher. Talebzadeh (2026) rapporte des effets très importants sans randomisation, sans suivi et sans ventilation par discipline : d = 2.36 doit donc se lire comme un résultat à court terme plutôt que comme la preuve d'une pratique durable. Laidlaw (2026) est une réflexion autoethnographique, et Aponte et ses collègues (2026) indiquent que leur cadre est conceptuel.

Une évaluation défendable mesure donc des artefacts plutôt que des opinions : les supports de cours qu'un participant a révisés, les grilles rédigées, les tâches conçues. Elle teste à distance, car l'écart observé dans l'étude de Bi et de ses collègues (2026) n'apparaissait qu'au suivi, où le groupe classique avait régressé et le groupe structuré non. Elle traite la satisfaction et la confiance comme des signaux faibles : Pishtari et ses collègues (2026) notent que les seuls gains de qualité ne prouvent pas une intériorisation, une qualité de conception croissante pouvant tout aussi bien refléter une délégation du travail routinier ou l'acceptation d'une structure générée par l'IA. Et elle ajoute au moins un indicateur relationnel, à la suite d'Aponte et de ses collègues (2026), car améliorer des artefacts tout en isolant les participants n'est pas ce que le programme promettait.

Trois objections, et leurs réponses

« Nous n'avons pas les heures. » Alors dépensez-les autrement plutôt que d'en ajouter. La comparaison de Bi et de ses collègues (2026) maintenait le temps de contact constant, à quatre séances de 90 minutes ; le groupe structuré a surpassé l'autre à budget égal. Six heures organisées autour d'un cycle d'artefacts valent mieux que six heures de démonstrations, et un format plus court consacré aux grilles d'évaluation cible le domaine le plus faible de l'étude de Talebzadeh (2026).

« Nos enseignants ne viendront pas, ou les sceptiques feront tout dérailler. » Ne recrutez pas les sceptiques pour une démonstration. Commencez par des questions d'identité, constituez des cohortes propres à une discipline, acceptez des temporalités différentes et dites à voix haute qu'une non-adoption fondée sur des principes est une position légitime : c'est la recommandation de Laidlaw (2026), et elle retire de la salle le débat sur la conformité. Attendez-vous à ce que le travail identitaire compte surtout chez les utilisateurs peu fréquents, selon Bai et Hsieh (2026).

« Nous ne pouvons pas obliger les gens à s'en servir. » Vous ne le pouvez pas vraiment, mais vous pouvez changer ce que l'institution signale. La permission perçue et le soutien institutionnel portaient le poids positif le plus fort dans l'étude de Bi et de ses collègues (2026) après l'effondrement de l'effet lié au contexte national, si bien que les gestes utiles sont les moins coûteux : affirmer que l'expérimentation est autorisée, protéger le temps de façon formelle pour qu'il ne soit pas réabsorbé, fournir des supports dans les langues de travail du corps enseignant et supprimer les frictions de la plateforme, qui était la dimension la moins bien notée de cette même étude.

Liste de contrôle pour les concepteurs de programmes

  • Ancrez chaque séance dans un artefact réel de cours (un objectif, une grille d'évaluation ou une tâche d'évaluation) que les participants apportent et révisent avant de partir.
  • Placez la vérification, la divulgation et la maîtrise des risques à l'intérieur du modèle de travail, plutôt que d'ajouter l'éthique comme module de clôture.
  • Prévoyez une durée suffisante et associez le programme à un suivi fondé sur le mentorat ; les personnels expérimentés rapportent que les formats courts ne modifient pas des habitudes profondément ancrées.
  • Constituez des cohortes propres à une discipline et différenciez selon le niveau d'expérience au lieu de proposer un atelier universel.
  • Commencez par des questions d'identité avant les démonstrations, et considérez une non-adoption fondée sur des principes comme une position professionnelle légitime.
  • Obtenez un soutien institutionnel, une permission perçue, du temps protégé et un accès dans les langues de travail du corps enseignant : ces éléments pèsent plus que le cadrage des politiques nationales.
  • Évaluez à l'aide d'artefacts, de mesures différées et d'au moins un indicateur relationnel ; rapportez les tailles d'effet honnêtement, en tenant compte des déclarations et des plans transversaux.

Pour la cible de compétences elle-même, voir Quelles compétences les enseignants doivent-ils posséder à l'égard de l'IA ? ; pour intégrer l'IA dans un cours plutôt que dans un atelier, voir Comment l'IA doit-elle être conçue dans l'expérience d'apprentissage ? ; et pour le tableau institutionnel plus large, voir Quels sont les 10 principaux résultats de la recherche sur l'IA en éducation que les enseignants devraient connaître ?.

Intégrer cette page

Copy the code below to embed a chromeless version of this page in a learning management system or other website. The embedded view hides the site header, navigation, and footer.