Une assistance IA pourl’enseignement de la chimie

Un projet de recherche de AG Chemiedidaktik an der Universität Oldenburg : Chemie.KI évalue les réponses des élèves selon la grille d’évaluation que vous définissez et validez – critère par critère, avec des points partiels plutôt qu’une note globale.

  • fondé scientifiquement
  • pour les enseignant·es
  • Universität Oldenburg

Nouveau : Chemie.KI a été complètement révisé et étendu. L’évaluation repose sur une meilleure base, vous pouvez maintenant créer vos propres tâches – et l’inscription est pour l’instant ouverte à tous les enseignant·es en chimie.

Le principe

Comment fonctionne Chemie.KI ?

Pour chaque tâche de chimie, nous définissons une grille d’évaluation fixe avec des critères individuels – par exemple : le terme scientifique a-t-il été utilisé correctement ? la justification a-t-elle été déduite de façon cohérente ? Un modèle de langage examine ensuite la réponse des élèves critère par critère et attribue des points partiels au lieu d’une note globale.

Pour amener l’IA à juger comme un·e enseignant·e expérimenté·e en chimie, nous l’entraînons en outre avec des milliers de réponses d’élèves réelles évaluées par des expert·es. Le modèle apprend ainsi aussi à gérer des réponses incomplètes ou linguistiquement imprécises – et atteint, dans des premières analyses, une qualité d’évaluation proche de celle des évaluateur·rices humain·es.

Le retour

Chaque point a un passage justificatif

Ce n’est pas la réponse dans son ensemble qui est évaluée, mais chaque critère séparément. À chaque point partiel attribué correspond le passage du texte de la réponse sur lequel il se fonde – mis en évidence en couleur et traçable pour les apprenant·es comme pour vous.

Ce que ne couvre pas un critère reste visible comme non atteint : marqué par des points, avec une indication de ce qui aurait manqué pour obtenir le score plein. On n’évalue que ce que la tâche exige.


Essayez vous-même

Choisissez une tâche, rédigez une réponse et faites-la évaluer. Le résultat apparaît dans la carte à côté.

Expliquez pourquoi une solution de soude réagit de façon basique. Indiquez aussi comment le pH varie par rapport à l’eau pure.

Acide‑base · AFB II · 3 points

Expliquez pourquoi une solution de soude réagit de façon basique. Indiquez aussi comment le pH varie par rapport à l’eau pure.

Natriumhydroxid se dissocie dans l’eau en Na+ et OHK1. Par conséquent la concentration des ions hydroxyde augmenteK2 par rapport à celle des ions oxonium, c’est pourquoi le pH de la solution changeK3.

Le passage sur lequel se fonde l’évaluation d’un critère est mis en évidence en couleur. Passez la souris sur un critère ci‑dessous pour faire ressortir son passage justificatif.

  • K1

    La dissociation du solide dans l’eau est correctement nommée avec les deux ions.

    Dissociation décrite

    1/1
  • K2

    L’excès d’ions hydroxyde par rapport aux ions oxonium est cité comme cause.

    Rapport ionique justifié

    1/1
  • K3

    Le fait que le pH change est mentionné – mais pas dans quelle direction par rapport à l’eau pure.

    pH indiqué · Remarque : le pH est supérieur à 7, la valeur de l’eau pure

    0/1

Score obtenu2 von 3

Conception d’une tâche

De la tâche au retour

Quatre étapes, depuis la création de votre tâche jusqu’à l’analyse de l’ensemble du groupe classe.

  1. 1

    Définir la tâche et les critères

    Vous rédigez la tâche et chaque exigence d’évaluation sur une ligne séparée avec le nombre de points. Le total en résulte automatiquement.

    enseignant·e
  2. 2

    Valider la grille d’évaluation

    Chemie.KI génère à partir de cela une solution-type, des règles pour les points partiels et des cas limites. Vous les lisez, corrigez et validez. Sans validation, il n’y a pas d’évaluation.

    enseignant·e
  3. 3

    Modifier le test via Testcode

    Vous regroupez les tâches validées en un test. Votre groupe classe l’ouvre avec un code à cinq chiffres – sans compte, sans nom.

    groupe classe
  4. 4

    Retour et analyse

    Chaque réponse reçoit des points partiels, une justification par critère et le passage justificatif. Vous voyez la classe d’un coup d’œil – y compris les cas limite marqués.

    Les deux
Voir la démo guidée des quatre étapes
À ce jour

Chiffres et faits

Quatre données à l’aune desquelles le projet doit être évalué.

17.693 cas annotés

Réponses d'élèves évaluées par des expert·e·s — la base de toute évaluation.

κ = 0,87 Concordance avec le standard de référence

Les enseignant·e·s atteignent 0,90. Vers l'étude

sans nom Participation par code

Les apprenant·es font les tests via un code à cinq chiffres — sans compte et sans données personnelles.

Commencer

Vous avez tout lu jusqu’à la fin ? Très bien.

Alors commencez – cela ne coûte rien. Créez un compte, validez une tâche, faites participer votre groupe classe avec un code. Le reste vient en essayant.

gratuit dans le cadre du projet de recherche aucune donnée de votre groupe classe nécessaire supprimable à tout moment

Fiabilité

Le contrôle reste entre vos mains

Une IA qui évalue des performances doit rester vérifiable. Quatre dispositions qui garantissent cela.

Rien ne se passe sans validation

Une tâche n’est évaluée que si vous avez lu et validé la grille d’évaluation.

Chemie.KI propose une solution modèle, des règles pour les points partiels et des cas limites – rien ne devient contraignant avant que vous ne l’ayez confirmé. D’ici là, la tâche reste invisible pour votre groupe classe.

Vos critères restent vos critères

Nombre, ordre et valeurs en points sont vérifiés à chaque appel du modèle. Les écarts entraînent l’arrêt – pas une correction silencieuse.

Le modèle peut donc évaluer, mais pas réécrire ce qui est évalué. Un critère auquel vous avez attribué un point ne peut pas soudainement en valoir deux.

Chaque évaluation est recalculée

Les points partiels ne doivent pas dépasser les maxima, la somme doit être correcte. Le système vérifie ces deux éléments.

Le calcul relève de l’arithmétique et non d’une appréciation – il n’a donc pas sa place dans le modèle de langage, mais avant et après celui-ci.

Les cas limites vous reviennent

Les cas incertains sont marqués pour examen au lieu d’être validés automatiquement. Des réponses notées manuellement peuvent être enregistrées comme référence.

Ainsi, au fil du temps, ce n’est pas l’évaluation qui change, mais seulement le nombre de cas que vous devez encore examiner vous-même.

Et si l’IA se trompe ? Vous le voyez : à chaque point partiel correspond le passage justificatif dans le texte de réponse et une justification en une phrase. Une évaluation que vous ne pouvez pas comprendre n’en est pas une, dans le doute.

La qualité moyenne de ces résultats a été mesurée et publiée.

Accéder à l’étude
Tâches

Deux voies vers la tâche évaluée

Vous pouvez utiliser le stock vérifié ou créer vos propres tâches – les deux aboutissent au même test.

Prêt à l’emploi

Tâches du stock

Pour 13 domaines thématiques, 65 tâches vérifiées avec grille d’évaluation prête sont disponibles – étayées par des milliers de réponses d’élèves évaluées par des expert·e·s.

  • Sélectionner la tâche et l’ajouter directement à un test
  • Consulter la grille d’évaluation et la copier pour des tâches propres
  • Utilisable sans préparation
Voir la démo
Créé soi-même

Tâches personnalisées

Saisir une tâche propre, définir des critères, générer une grille d’évaluation, vérifier et valider — pour un thème du corpus existant ou pour un thème personnel.

  • Vous déterminez les critères et les valeurs de points
  • Réglages fins possibles pour l'opérateur, l'AFB et la sévérité
  • Vos propres réponses évaluées peuvent être enregistrées comme calibration
Créer un compte

Les deux voies aboutissent au même résultat : vous regroupez les tâches validées en un test que votre groupe classe ouvre avec un code à cinq chiffres – sans compte et sans nom. Les tâches reprises du stock peuvent encore être adaptées auparavant ; les consignes d’évaluation restent les vôtres.

Vous pouvez d’abord regarder et décider plus tard – la démo ne nécessite aucun compte.

Démo guidée
Chiffres et faits

Ce qui se cache derrière les quatre chiffres

D’où viennent ces données, ce qu’elles signifient – et où sont leurs limites.

17.693 cas annotés

De vraies réponses d’élèves, évaluées par des personnes

Le chiffre correspond à l’état actuel de notre base de données – il ne s’agit pas d’une estimation, mais du nombre de cas comptés lors de l’ouverture de cette page. Chaque cas est une réponse effectivement rédigée en cours de chimie, évaluée critère par critère par des spécialistes.

C’est à partir de cet ensemble que le modèle apprend ce que vaut une réponse en pratique : avec des fautes d’orthographe, des phrases incomplètes, des idées justes formulées avec des mots inhabituels. Il juge donc avec plus d’indulgence qu’une simple recherche de mots-clés et avec plus de rigueur qu’une lecture rapide et bienveillante.

κ = 0,87 Concordance

Proche de deux enseignant·es évaluant la même chose

Cohen’s κ mesure dans quelle mesure deux évaluations concordent – en tenant compte des concordances que le simple hasard permettrait d’expliquer. 1,0 correspondrait à un accord total, 0 à des réponses au hasard.

Lorsque deux enseignant·es expérimenté·es évaluent indépendamment les mêmes réponses, ils obtiennent environ 0,90 dans nos collectes de données. Chemie.KI atteint 0,87 par rapport au standard de référence. L’écart est faible, mais il existe – c’est précisément pourquoi la validation reste entre vos mains et que les cas limites sont signalés.

quelques secondes jusqu'au retour

Un retour tant que la question reste ouverte

L’évaluation est générée pendant le traitement : envoyer, attendre brièvement, lire le retour . La durée exacte dépend de la longueur de la réponse et de la charge du système – il s’agit de secondes, pas de minutes.

La différence didactique ne réside pas dans la rapidité, mais dans le moment choisi : qui n’apprend qu’au bout d’une semaine ce qui n’allait pas a depuis longtemps oublié sa propre réflexion. Qui l’apprend immédiatement peut encore la reprendre.

sans nom Participation par code

Les apprenant·es n’ont pas besoin de compte

Un test s’ouvre à l’aide d’un code à cinq chiffres. Aucun compte n’est créé, aucun nom n’est demandé, aucune adresse e-mail n’est enregistrée – la réponse figure dans la base de données sans personne identifiable derrière.

Pour vous, cela signifie que vous voyez le groupe classe dans son ensemble et chaque réponse individuellement, mais l’association avec un nom n’est établie que là où vous la créez vous-même – dans la salle de classe, et non dans le système.

État et limites : Les chiffres sont recomptés à chaque chargement de la page. La concordance provient d’une collecte de données réalisée à partir d’un ensemble fixe de tâches et ne s’applique pas automatiquement à chaque nouvelle tâche – pour vos propres tâches, elle constitue un point de repère, et non une promesse.

La méthode, la base de données et l’analyse sont décrites en détail.

La science qui se trouve derrière