Résultats et évaluations
Comment mesurer qu'une IA « enseigne bien » ? Google a mis en place des protocoles d'évaluation pilotés par des experts et des essais en classe, plutôt que de se fier aux seuls tests académiques classiques.
L'« arène pour l'apprentissage »
Le principe : faire dialoguer les modèles dans des scénarios d'apprentissage réalistes (par exemple « Explique la photosynthèse à un élève de seconde »), puis faire noter les conversations par des experts.
Dans une évaluation à grande échelle :
- 189 éducateurs ont joué le rôle d'apprenants sur 49 scénarios, en comparant deux modèles à la fois ;
- 206 experts indépendants ont ensuite noté les échanges à l'aveugle, via une grille de 25 critères couvrant les cinq principes pédagogiques.
Préférences des experts (Gemini 2.5 Pro, dérivé de LearnLM)
| Adversaire | Taux de préférence pour le modèle Google |
|---|---|
| Claude 3.7 Sonnet | 71,3 % |
| GPT-4o (API) | 81,8 % |
| ChatGPT-4o | 61,0 % |
| OpenAI o3 | 74,2 % |
Toutes situations confondues, le modèle de Google a été préféré dans 73,2 % des cas par les experts, et arrive en tête du classement de type Elo.
Les premières comparaisons (LearnLM initial, 2024)
Dès la première génération, LearnLM était significativement préféré à ses concurrents de l'époque sur la qualité pédagogique :
| Comparaison | Force de préférence moyenne |
|---|---|
| LearnLM vs GPT-4o | +31 % |
| LearnLM vs Gemini 1.5 Pro | +13 % |
| LearnLM vs Claude 3.5 | +11 % |
Au-delà du laboratoire : un essai en classe
Les évaluations d'experts jugent la qualité des dialogues. Mais qu'en est-il de l'apprentissage réel ? Un essai contrôlé randomisé (RCT) a été mené dans un collège britannique auprès de 165 élèves, en appui à des tuteurs sur une plateforme de mathématiques.
Quelques résultats marquants :
- Remédiation immédiate : 93,0 % avec LearnLM contre 91,2 % pour le tuteur humain.
- Résolution des idées fausses : 95,4 % contre 94,9 %.
- Transfert à de nouveaux problèmes : LearnLM dépasse le tuteur humain de 5,5 points (66,2 % contre 60,7 %).
- Sécurité : zéro message nuisible détecté, et seulement 0,1 % d'erreurs factuelles.
- Efficacité pour les tuteurs : 76,4 % des messages du modèle n'ont demandé aucune retouche (ou une retouche minime).
Ce que les experts ont apprécié
- Un tuteur « qui ne se laisse pas soutirer la réponse ».
- Un étayage clair, découpant les problèmes en étapes lisibles.
- Un questionnement socratique habile, allant parfois jusqu'à inspirer les tuteurs humains eux-mêmes.
- Un ajustement du ton et du rythme selon l'état de l'élève.
Certains participants ont trouvé l'expérience « étonnamment humaine ».
Les limites reconnues
Les chercheurs restent prudents :
- les évaluations reposent sur un nombre fixe de scénarios, ce qui limite la généralisation ;
- elles mesurent surtout des effets à court terme, pas les acquis durables ;
- des études longitudinales et des domaines non scientifiques (créatifs, interprétatifs) restent à explorer ;
- surtout, les auteurs insistent : l'IA doit compléter et non remplacer les enseignants.
Voir les publications dans Ressources.