米テネシー州の学校で行われた2年間の実験で、中学生がKhan Academyの生成AIチューターを利用できるようにすると、数学の学力が小幅に向上することが分かった。一方で、AIを活用した学習の基本的な障害も浮かび上がった。多くの生徒は、個別指導機能をほとんど活用していなかった。

このクラスター無作為化試験は中学校18校を対象とし、もともと授業時間内に組み込まれていた数学の補習にKhanmigoを導入した。システムは答えを示すのではなく、生徒を指導するよう設定された。研究者によると、プログラムを利用する群に割り当てられた生徒の数学の学力は、1学期当たり全国のパーセンタイル順位で1.3ポイント向上した。これは1学年間で約0.06〜0.08標準偏差に相当する。

この結果は、AIチューターが通常の学校環境で学習に貢献し得ることを示すが、既存のデジタル演習に対する劇的な優位性を立証するものではない。研究者は、向上幅はAI支援を含まないKhan Academyの演習に関連して見られたものと同程度だったとしている。この比較は、その上に追加された対話技術と少なくとも同じくらい、周囲の演習の仕組みが重要だった可能性を示している。

利用状況のデータは、効果が控えめだった理由を理解する手がかりになる。参加した生徒の96%がKhanmigoを少なくとも1度は試したものの、中央値に当たる生徒がメッセージを送ったのは、演習を行った日の約3分の1にとどまった。誤答した演習セッションでチューターを使った割合は、わずか17%だった。個々に合わせた助言が最も役立ったかもしれないのは、まさにそうした場面である。

生徒が機能を開いても、やり取りは浅いものにとどまることが多かった。研究では、多くのメッセージが数学的な考え方をめぐる継続的な対話ではなく、単純な解答や、提示されたプロンプトの選択だったと説明している。仕組みとしてはAIの指導役を利用できたが、アクセスを提供するだけでは、生徒がそれをチューターとして扱ったり、実質的な問題解決の対話を続けたりするとは限らなかった。

研究者は、1年間にわたって積極的に参加した場合、0.14標準偏差の効果に相当し得ると推定している。実際の利用にはばらつきがあり、限定的なことも多かったため、この推定値は観測された平均的な効果とは異なる。学校が意味のある参加を増やせれば利益が得られる可能性を示すものだが、プログラムに割り当てられたすべての生徒について測定された結果と読むべきではない。

今回の知見は、生成AIの導入を検討する学校が直面する実務上の問いを絞り込む。信頼性や指導設計は引き続き重要だが、この試験は、利用の仕方が当面の制約になり得ることを示している。生徒が間違えた後もほとんど相談しないチューターは、学習習慣に組み込まれたチューターと同じ支援を提供することはできない。

教育関係者にとって、この試験が示すのは包括的な結論ではなく、慎重に受け止めるべき手がかりである。大規模な実際の学校現場での実験では、Khanmigoを利用できることが小幅な学力向上と関連していたが、従来のオンライン演習を明確に上回る改善ではなかった。今後の導入では、支援を生み出すAIの高度さと同じくらい、生徒がいつ、どのように助けを求めるかにも注目する必要があるかもしれない。