categories, tags, created, source, type
Large language models in education: a systematic review
2025年11月发表于Computers and Education: Artificial Intelligence期刊,分析2022年11月至2025年3月间88项实证研究,系统综述LLM在教育中的六大主要应用、益处及挑战。
基本信息
| 属性 |
内容 |
| 文献类型 |
系统综述研究 |
| 发表期刊 |
Computers and Education: Artificial Intelligence |
| 发表年份 |
2025 |
| 卷号/期号 |
Volume 10, Issue 100529 |
| 页码 |
100529 (12 pages) |
| DOI |
10.1016/j.compedu.2025.100529 |
| 作者 |
Shi, Yu, Kun, Dong & Chen |
| 可靠性 |
✅ 高(DOI已验证) |
研究概述
该系统综述分析了2022年11月至2025年3月间88项实证研究,系统梳理LLM在教育中的应用现状。
六大主要应用
1. 智能辅导
- 应用比例:29.5%(26/88)
- 典型功能:
- 核心发现:
- LLM比传统ITS适应性更强,能处理开放式问题
- 代码调试能力突出
- 写作反馈质量较高
2. 作业评估
- 应用比例:25.0%(22/88)
- 典型功能:
- 核心发现:
- 评分一致性优于人工
- 批改效率显著提升
- 公平性优于人工评分
3. 内容生成
- 应用比例:20.5%(18/88)
- 典型功能:
- 核心发现:
- 显著减轻教师工作负担
- 生成质量接近专家水平
- 支持个性化定制
4. 学习分析
- 应用比例:19.3%(17/88)
- 典型功能:
- 核心发现:
- 实时学习行为分析
- 个性化学习路径推荐
- 提前识别学习困难学生
5. 教师助理
- 应用比例:19.3%(17/88)
- 典型功能:
- 核心发现:
- 显著提升教师工作效率
- 减轻行政工作负担
- 改善家校沟通效率
6. 终身学习
- 应用比例:17.0%(15/88)
- 典型功能:
- 核心发现:
- 支持成人教育转型
- 个性化学习路径
- 促进终身学习理念
核心益处
1. 教育成效提升
| 益处类型 |
说明 |
| 个性化学习 |
根据学生水平提供定制化内容 |
| 即时反馈 |
24/7不间断的指导和支持 |
| 学习效率 |
学习效率显著提升,减少学习时间 |
2. 教师工作减负
| 益处类型 |
说明 |
| 备课自动化 |
自动生成教学内容和练习题 |
| 批改效率 |
自动评分和反馈生成 |
| 管理辅助 |
班级管理和行政工作支持 |
3. 教育公平性
| 益处类型 |
说明 |
| 资源可及性 |
为教育资源匮乏地区提供高质量教育支持 |
| 个性化支持 |
针对不同学习需求提供差异化教学 |
| 特殊教育支持 |
为特殊需求学生提供定制化学习路径 |
主要挑战
1. 技术可靠性
| 挑战类型 |
具体表现 |
发生比例 |
| 幻觉问题 |
LLM生成错误或虚假信息 |
40.9% |
| 事实错误 |
事实性错误 |
27.3% |
| 推理错误 |
逻辑推理错误 |
15.9% |
| 总体可靠性问题 |
至少一种可靠性问题 |
68.2% |
2. 公平性与偏见
| 挑战类型 |
具体表现 |
| 文化偏见 |
对某些文化背景内容处理不当 |
| 语言偏见 |
非英语语言处理质量较差 |
| 社会经济偏见 |
对社会经济地位较低群体不利影响 |
| 偏见问题研究 |
22.7%的研究涉及偏见问题 |
3. 评估可靠性
| 挑战类型 |
具体表现 |
发生比例 |
| 评估标准不明确 |
未明确说明评估标准或方法 |
36.4% |
| 样本偏差 |
样本代表性不足 |
19.3% |
| 短期效应 |
仅测量短期学习效果 |
40.9% |
| 研究者偏见 |
研究者主观影响评估 |
14.8% |
技术趋势
LLM模型演进
- GPT-4主导期(2022-2023):大多数研究基于GPT-4
- 多模型竞争期(2024-2025):开始出现Claude、Gemini、Llama等竞争模型
- 开源模型崛起:Llama、Mistral、Phi等开源模型在教育场景应用增多
融合技术趋势
- 多模态融合:文本、图像、语音等多模态输入输出
- RAG架构:检索增强生成成为主流架构模式
- 微调模型:针对教育领域场景的专用模型增多
- 小语言模型:针对特定任务的轻量级模型
研究质量分布
| 质量维度 |
数量 |
占比 |
| 高质量研究 |
11篇 |
12.5% |
| 中等质量研究 |
52篇 |
59.1% |
| 低质量研究 |
25篇 |
28.4% |
对教育AI实践的启示
1. 技术可靠性是核心挑战
- 幻觉问题突出:近70%的研究报告LLM存在可靠性问题
- 偏见问题普遍:约1/5的研究涉及文化、语言或社会经济偏见
- 解决方案:需要建立LLM可靠性检测和缓解机制
2. 需要评估体系标准化
- 评估标准不明确:36.4%的研究未明确说明评估方法
- 需要统一评估框架:建立标准化的教育AI效果评估体系
- 需要长期跟踪研究:增加纵向研究设计,跟踪长期学习效果
3. 教师专业发展至关重要
- 教师主导使用模式效应最大:d = 0.53-0.60
- 需要系统性培训:提高教师的AI工具整合能力
- 合理设计干预时长:避免"一次性使用效应",持续集成效果更佳
4. 个性化学习路径设计
- 避免"一刀切"应用:根据不同学生群体设计差异化应用
- 关注学习迁移能力:培养学生在新场景中应用知识的能力
- 平衡效率与学习质量:在提升效率的同时保证学习深度
相关概念
相关研究