--- created: 2026-04-14 title: LLM教育应用文献地图 tags: [深度报告, 研究] category: 深度研究报告 --- # LLM教育应用文献地图 > **文献信息** > - **标题**:Large language models in education: a systematic review of empirical applications, benefits, and challenges > - **作者**:Yuhong Shi, Kun Yu, Yifei Dong, Fang Chen > - **机构**:悉尼科技大学数据科学研究所 > - **期刊**:Computers and Education: Artificial Intelligence (2026) > - **DOI**:10.1016/j.caeai.2025.100529 > - **研究覆盖**:2022.11-2025.03,3344篇→88项实证研究 --- ## 一、研究概述 ### 1.1 研究筛选流程 ``` ┌─────────────────────────────────────────────────────────────┐ │ PRISMA筛选流程 (ChatGPT发布后) │ ├─────────────────────────────────────────────────────────────┤ │ │ │ 初始检索:3,344篇 │ │ ↓ │ │ 去重、非期刊/非会议文献:→ 2,022篇 │ │ ↓ │ │ 标题摘要筛选:→ 1,808篇 │ │ ↓ │ │ 全文评估:→ 180篇 │ │ ↓ │ │ 最终纳入:88项实证研究 ✅ │ │ │ └─────────────────────────────────────────────────────────────┘ ``` ### 1.2 核心研究问题 | RQ | 问题 | |----|------| | RQ1 | LLM在教育中的主要应用类型有哪些? | | RQ2 | LLM整合对教学成果的效益和积极影响有何实证证据? | | RQ3 | LLM教育实施中的关键挑战和顾虑是什么? | --- ## 二、六大LLM教育应用分类 ### 2.1 应用类型概览 ``` ┌─────────────────────────────────────────────────────────────┐ │ LLM教育应用六大类型 │ ├─────────────────────────────────────────────────────────────┤ │ │ │ ┌─────────────────────────────────────────────────────┐ │ │ │ 1. 智能辅导系统 (Intelligent Tutoring Systems) │ │ │ │ 论文数:22篇 | 占比最高 │ │ │ │ 代表:Kestin 2025, Baba 2024, Chun 2025 │ │ │ └─────────────────────────────────────────────────────┘ │ │ │ │ ┌─────────────────────────────────────────────────────┐ │ │ │ 2. 学习支持工具 (Learning Support Tools) │ │ │ │ 论文数:21篇 │ │ │ │ 代表:Alvarez 2024, Feng 2025, Gao 2024 │ │ │ └─────────────────────────────────────────────────────┘ │ │ │ │ ┌─────────────────────────────────────────────────────┐ │ │ │ 3. 自动化评估与反馈 (Automated Assessment) │ │ │ │ 论文数:18篇 │ │ │ │ 代表:Ahmed 2025, Wang 2025, Jansen 2025 │ │ │ └─────────────────────────────────────────────────────┘ │ │ │ │ ┌─────────────────────────────────────────────────────┐ │ │ │ 4. 任务支持工具 (Task Support Tools) │ │ │ │ 论文数:14篇 │ │ │ │ 代表:Fan 2025, Zhu 2025, Hou 2024 │ │ │ └─────────────────────────────────────────────────────┘ │ │ │ │ ┌─────────────────────────────────────────────────────┐ │ │ │ 5. 学习内容生成 (Learning Content Generation) │ │ │ │ 论文数:9篇 │ │ │ │ 代表:Bezirhan 2024, Liu 2025, Norberg 2024 │ │ │ └─────────────────────────────────────────────────────┘ │ │ │ │ ┌─────────────────────────────────────────────────────┐ │ │ │ 6. 对话式聊天机器人 (Chatbots) │ │ │ │ 论文数:5篇 │ │ │ │ 代表:Chen 2023, Looi 2025, Mohammed 2025 │ │ │ └─────────────────────────────────────────────────────┘ │ │ │ └─────────────────────────────────────────────────────────────┘ ``` ### 2.2 各应用类型详解 #### 类型1:智能辅导系统 (Intelligent Tutoring Systems) | 参数 | 详情 | |------|------| | 论文数 | 22篇 | | 学科覆盖 | 多学科(STEM、语言、医学等) | | LLM类型 | GPT-3.5 Turbo, GPT-4, ChatGPT等 | | 核心功能 | 自适应学习环境、响应个体需求 | **代表研究**: - Baba et al. (2024):多学科LLM个性化学习系统,t=5.24-6.02, p<0.001 - Kestin 2025:哈佛物理AI导师RCT,后测4.5 vs 3.5分 #### 类型2:学习支持工具 (Learning Support Tools) | 参数 | 详情 | |------|------| | 论文数 | 21篇 | | 学科覆盖 | 数学、工程、语言、计算机科学等 | | 核心功能 | 动机提升、认知技能发展、参与度增强 | **代表研究**: - Alvarez (2024):数学LLM导师,t=-14.453, p<0.001 - Feng & Wang (2025):英语学习中GPT使用,成绩提升20% #### 类型3:自动化评估与反馈 (Automated Assessment) | 参数 | 详情 | |------|------| | 论文数 | 18篇 | | 学科覆盖 | 编程、数据科学、数学、写作等 | | 核心功能 | 评分准确性、学习行为分析、个性化反馈 | **代表研究**: - Alshammari (2025):编程自适应系统,d=1.412, p<0.001 - Meyer et al. (2024):写作反馈,d=0.19, p=0.042 #### 类型4:任务支持工具 (Task Support Tools) | 参数 | 详情 | |------|------| | 论文数 | 14篇 | | 学科覆盖 | 写作、编程、网络安全、计算思维等 | | 核心功能 | 任务规划、实时指导、审查支持 | **代表研究**: - Fan et al. (2025):GPT 4.0写作支持,CI=[-3.858,-0.083], p=0.037 - Zhu et al. (2025):AI数学故事创作 #### 类型5:学习内容生成 (Learning Content Generation) | 参数 | 详情 | |------|------| | 论文数 | 9篇 | | 学科覆盖 | 阅读、STEM、编程、软件工程等 | | 核心功能 | 个性化内容生成、学习体验改善 | **代表研究**: - Bezirhan & von Davier (2023):自适应阅读内容生成 - Liu et al. (2025):STEM内容生成 #### 类型6:对话式聊天机器人 (Chatbots) | 参数 | 详情 | |------|------| | 论文数 | 5篇 | | 学科覆盖 | 科学、语言学习、计算机科学等 | | 核心功能 | 动机、参与度、坚持性培养 | --- ## 三、地区分布 ### 3.1 研究地区分布 ``` ┌─────────────────────────────────────────────────────────────┐ │ 地区研究分布 │ ├─────────────────────────────────────────────────────────────┤ │ │ │ 中国:24.0% (21篇) ████████████████████████████░░░░░ │ │ │ │ 美国:18.2% (16篇) ████████████████████░░░░░░░░░░░░░ │ │ │ │ 欧洲:18.2% (16篇) ████████████████████░░░░░░░░░░░░░ │ │ (德国5, 瑞士2, 其他9国各1) │ │ │ │ 亚洲:13.6% (12篇) ██████████████░░░░░░░░░░░░░░░░░░░ │ │ │ │ 中东:9.1% (8篇) █████████░░░░░░░░░░░░░░░░░░░░░░░░░░ │ │ │ │ 非洲:4.6% (4篇) ████░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░ │ │ │ │ 其他:12.3% (11篇) ████████████░░░░░░░░░░░░░░░░░░░░░░░ │ │ │ └─────────────────────────────────────────────────────────────┘ ``` ### 3.2 地区分布关键洞察 | 洞察 | 描述 | |------|------| | 研究集中度 | 中美合计43.2%,主导全球研究 | | 欧洲多样性 | 12个国家有贡献,德国领先 | | 地区差距 | 非洲仅4.6%,代表性不足 | --- ## 四、学科领域分布 ### 4.1 学科分布 ``` ┌─────────────────────────────────────────────────────────────┐ │ 学科领域分布 │ ├─────────────────────────────────────────────────────────────┤ │ │ │ 计算机与技术:38.6% (34篇) │ │ ┌─────────────────────────────────────────────────────┐ │ │ │ ▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓ │ │ │ │ 其中:编程19, 计算机科学6, 计算思维2等 │ │ │ └─────────────────────────────────────────────────────┘ │ │ │ │ 语言学习与写作:25.0% (22篇) │ │ ┌─────────────────────────────────────────────────────┐ │ │ │ ▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓░░░░░░░░░░░░░░░░░░░░░░ │ │ │ │ 其中:写作16, 非写作语言学习6 │ │ │ └─────────────────────────────────────────────────────┘ │ │ │ │ STEM:18.2% (16篇) │ │ ┌─────────────────────────────────────────────────────┐ │ │ │ ▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓░░░░░░░░░░░░░░░░░░░░░░░░░░░░░ │ │ │ │ 其中:数学8, STEM综合3, 工程2, 科学2 │ │ │ └─────────────────────────────────────────────────────┘ │ │ │ │ 其他:9.1% (8篇) - 医疗3, 阅读2, 艺术/管理/故事技能各1 │ │ 未指定:9.1% (8篇) │ │ │ └─────────────────────────────────────────────────────────────┘ ``` ### 4.2 关键洞察 | 洞察 | 描述 | |------|------| | 计算机主导 | 计算机与编程合计38.6%,远超其他学科 | | 语言学习重要 | 语言学习与写作25%,第二大学科 | | 学科失衡 | 医学、音乐、美术等人文艺术研究稀少 | --- ## 五、教育阶段分布 ### 5.1 阶段分布 ``` ┌─────────────────────────────────────────────────────────────┐ │ 教育阶段分布 │ ├─────────────────────────────────────────────────────────────┤ │ │ │ 高等教育:76.1% (67篇) ████████████████████████████████████░░░░ │ │ │ │ K-12:23.9% (21篇) ██████████████████████░░░░░░░░░░░░░░░░░ │ │ │ └─────────────────────────────────────────────────────────────┘ ``` ### 5.2 关键洞察 | 洞察 | 描述 | |------|------| | 高等教育主导 | 76.1%研究在高等教育场景 | | K-12研究不足 | 仅23.9%,需要更多基础教育研究 | | 正式教育聚焦 | 排除了职业培训和非正式学习 | --- ## 六、教育效益分析 ### 6.1 效益分类 ``` ┌─────────────────────────────────────────────────────────────┐ │ LLM教育五大效益 │ ├─────────────────────────────────────────────────────────────┤ │ │ │ 1. 学业成绩提升 ⭐⭐⭐⭐⭐ │ │ ┌─────────────────────────────────────────────────┐ │ │ │ • 语言学习:Feng 2025 实验组提升20% vs 对照1.2% │ │ │ │ • 编程教育:Nutalapati 2024 d=1.04 │ │ │ │ • 数学学习:Alvarez 2024 t=-14.453, p<0.001 │ │ │ │ • 写作技能:Li 2023 t=2.502, p<0.05 │ │ │ └─────────────────────────────────────────────────┘ │ │ │ │ 2. 学生参与度提升 ⭐⭐⭐⭐ │ │ ┌─────────────────────────────────────────────────┐ │ │ │ • 个性化学习体验增强动机 │ │ │ │ • 24/7可用性突破时空限制 │ │ │ │ • 即时反馈提升学习投入 │ │ │ └─────────────────────────────────────────────────┘ │ │ │ │ 3. 认知能力发展 ⭐⭐⭐ │ │ ┌─────────────────────────────────────────────────┐ │ │ │ • 批判性思维培养(关键评估AI输出时) │ │ │ │ • 问题解决能力发展 │ │ │ │ • 元认知能力提升 │ │ │ └─────────────────────────────────────────────────┘ │ │ │ │ 4. 无障碍可及性 ⭐⭐⭐⭐ │ │ ┌─────────────────────────────────────────────────┐ │ │ │ • 远程学习支持 │ │ │ │ • 个性化学术支持 │ │ │ │ • 打破地理时间限制 │ │ │ └─────────────────────────────────────────────────┘ │ │ │ │ 5. 资源优化 ⭐⭐⭐⭐ │ │ ┌─────────────────────────────────────────────────┐ │ │ │ • 自动化评估减轻教师负担 │ │ │ │ • 高效内容生成 │ │ │ │ • 个性化大规模教学可能 │ │ │ └─────────────────────────────────────────────────┘ │ │ │ └─────────────────────────────────────────────────────────────┘ ``` ### 6.2 效益元分析数据 | 研究 | 效应量 | 领域 | 应用 | |------|--------|------|------| | Alshammari 2025 | d=1.412 | 编程 | 自适应E-learning | | Canonigo 2024 | d=2.36 | 数学 | GeoGebra+ChatGPT | | Nutalapati 2024 | d=1.04 | 编程 | Fine-tuned GPT-3.5 | | Chun et al. 2025 | d=0.86 | 健康 | AI数字教科书 | | Meyer et al. 2024 | d=0.19 | 写作 | GPT-3.5反馈 | --- ## 七、挑战与顾虑 ### 7.1 挑战分类 ``` ┌─────────────────────────────────────────────────────────────┐ │ LLM教育四大挑战 │ ├─────────────────────────────────────────────────────────────┤ │ │ │ 1. 过度依赖 (Over-reliance) ⚠️⚠️⚠️⚠️ │ │ ┌─────────────────────────────────────────────────┐ │ │ │ 表现: │ │ │ │ • 学生不加批判地接受AI输出 │ │ │ │ • 过度使用AI工具 │ │ │ │ • 阻碍调试和分析技能发展 │ │ │ │ 影响: │ │ │ │ • 批判性思维发展受损 │ │ │ │ • 独立解决问题能力退化 │ │ │ └─────────────────────────────────────────────────┘ │ │ │ │ 2. 技术可靠性问题 ⚠️⚠️⚠️ │ │ ┌─────────────────────────────────────────────────┐ │ │ │ • AI幻觉:生成似是而非的错误内容 │ │ │ │ • 黑箱性:透明度不足 │ │ │ │ • 偏见延续:训练数据偏见被维持 │ │ │ │ • 复杂问题处理能力不稳定 │ │ │ └─────────────────────────────────────────────────┘ │ │ │ │ 3. 评估公平性 ⚠️⚠️ │ │ ┌─────────────────────────────────────────────────┐ │ │ │ • LLM评估可能引入偏见 │ │ │ │ • 不公平对待风险 │ │ │ │ • 需要人工审核辅助 │ │ │ │ • 学术诚信问题 │ │ │ └─────────────────────────────────────────────────┘ │ │ │ │ 4. 隐私与安全 ⚠️⚠️ │ │ ┌─────────────────────────────────────────────────┐ │ │ │ • 学生数据收集风险 │ │ │ │ • 数据使用透明度不足 │ │ │ │ • 需要安全框架 │ │ │ └─────────────────────────────────────────────────┘ │ │ │ └─────────────────────────────────────────────────────────────┘ ``` ### 7.2 挑战分布统计 | 挑战类型 | 讨论频次 | 占比 | |----------|----------|------| | 过度依赖 | 17篇 | 19.3% | | 技术可靠性 | 14篇 | 15.9% | | 评估公平性 | 8篇 | 9.1% | | 隐私安全 | 6篇 | 6.8% | --- ## 八、理论框架 ### 8.1 LLM教育应用的五大理论基础 ``` ┌─────────────────────────────────────────────────────────────┐ │ 理论支撑体系 │ ├─────────────────────────────────────────────────────────────┤ │ │ │ 1. 建构主义学习理论 (Vygotsky 1978) │ │ → 支持主动知识建构 │ │ → ZPD理论支持个性化脚手架 │ │ │ │ 2. 认知负荷理论 (Sweller 1988) │ │ → 指导信息呈现和处理 │ │ → LLM调整响应复杂度,管理认知负荷 │ │ │ │ 3. 自我调节学习 (Zimmerman 2000) │ │ → 支持自主技能发展 │ │ → 培养元认知能力 │ │ │ │ 4. 主动学习原则 (Bonwell & Eison 1991) │ │ → 促进参与性学习 │ │ │ │ 5. Hattie & Timperley反馈模型 (2007) │ │ → 指导有效反馈机制 │ │ │ └─────────────────────────────────────────────────────────────┘ ``` --- ## 九、研究空白与未来方向 ### 9.1 当前研究空白 | 空白领域 | 描述 | 建议 | |----------|------|------| | **纵向研究不足** | 缺乏长期效果追踪 | 需要3年以上追踪 | | **K-12研究不足** | 仅23.9%,尤其基础教育 | 加强基础教育研究 | | **学科覆盖不均** | 计算机/语言主导,艺术人文稀少 | 扩展多元学科 | | **地区失衡** | 非洲仅4.6% | 加强发展中国家研究 | | **评估公平性** | 仅9.1%研究涉及 | 深入研究评估影响 | ### 9.2 未来研究方向 | 优先级 | 方向 | 具体建议 | |--------|------|----------| | P0 | 纵向效果追踪 | 3-5年学习成效追踪 | | P1 | K-12专项研究 | 基础教育LLM应用 | | P2 | 评估公平性 | LLM评估的偏见研究 | | P3 | 教师AI能力 | Intelligent-TPACK本土化 | --- ## 十、对项目的启示 ### 10.1 研究价值 | 维度 | 价值 | |------|------| | 证据基础 | 88项实证研究,提供坚实证据链 | | 应用分类 | 六大类型指导实践 | | 挑战识别 | 提前规避风险 | | 理论框架 | 五大理论支撑研究设计 | ### 10.2 中国情境适配 | 国际发现 | 中国适配建议 | |----------|--------------| | 六大应用类型 | 结合国内产品(好未来、猿辅导等)分类 | | 学业成绩提升 | 验证在应试教育环境的效果 | | 过度依赖挑战 | 研究中国学生的依赖模式 | | K-12研究稀少 | 填补中国K-12研究空白 | --- ## 参考文献 [^1]: Shi, Y., Yu, K., Dong, Y., & Chen, F. (2026). Large language models in education: a systematic review of empirical applications, benefits, and challenges. *Computers and Education: Artificial Intelligence*. [DOI: 10.1016/j.caeai.2025.100529](https://doi.org/10.1016/j.caeai.2025.100529) [^2]: Kestin, G. et al. (2025). AI tutoring outperforms in-class active learning. *Nature Scientific Reports*. [DOI: 10.1038/s41598-025-97652-6](https://doi.org/10.1038/s41598-025-97652-6) --- **报告完成时间**:2026-04-08 16:00 **整理人**:狗剩 **版本**:v1.0 **状态**:P2任务完成