--- categories: - '[[LLM Wiki]]' tags: - wiki - reference - 学术论文 - LLM教育 - 系统综述 - CompEdEduAI - 2025 created: 2026-04-16 source: '[[raw/教育AI研究/文献库/文献索引数据库.json]]' type: reference --- # Large language models in education: a systematic review [raw:教育AI研究/文献库/文献索引数据库.json:92]> 2025年11月发表于Computers and Education: Artificial Intelligence期刊,分析2022年11月至2025年3月间88项实证研究,系统综述LLM在教育中的六大主要应用、益处及挑战。 ## 基本信息 - [[教育AI研究项目]] | 属性 | 内容 | | ------| ------| | **文献类型** | 系统综述研究 | | **发表期刊** | Computers and Education: Artificial Intelligence | | **发表年份** | 2025 | | **卷号/期号** | Volume 10, Issue 100529 | | **页码** | 100529 (12 pages) | | **DOI** | 10.1016/j.compedu.2025.100529 | | **作者** | Shi, Yu, Kun, Dong & Chen | | **可靠性** | ✅ 高(DOI已验证) | ## 研究概述 该系统综述分析了2022年11月至2025年3月间88项实证研究,系统梳理LLM在教育中的应用现状。 ## 六大主要应用 ### 1. 智能辅导 - **应用比例**:29.5%(26/88) - **典型功能**: - 一对一答疑 - 个性化反馈 - 解题步骤指导 - **核心发现**: - LLM比传统ITS适应性更强,能处理开放式问题 - 代码调试能力突出 - 写作反馈质量较高 ### 2. 作业评估 - **应用比例**:25.0%(22/88) - **典型功能**: - 自动评分 - 反馈生成 - 评分一致性 - **核心发现**: - 评分一致性优于人工 - 批改效率显著提升 - 公平性优于人工评分 ### 3. 内容生成 - **应用比例**:20.5%(18/88) - **典型功能**: - 练习题生成 - 教学设计辅助 - 课件自动制作 - **核心发现**: - 显著减轻教师工作负担 - 生成质量接近专家水平 - 支持个性化定制 ### 4. 学习分析 - **应用比例**:19.3%(17/88) - **典型功能**: - 学情诊断 - 知识追踪 - 预测预警 - **核心发现**: - 实时学习行为分析 - 个性化学习路径推荐 - 提前识别学习困难学生 ### 5. 教师助理 - **应用比例**:19.3%(17/88) - **典型功能**: - 备课辅助 - 家校沟通 - 班级管理 - **核心发现**: - 显著提升教师工作效率 - 减轻行政工作负担 - 改善家校沟通效率 ### 6. 终身学习 - **应用比例**:17.0%(15/88) - **典型功能**: - 技能培训 - 职业规划 - 持续学习支持 - **核心发现**: - 支持成人教育转型 - 个性化学习路径 - 促进终身学习理念 ## 核心益处 ### 1. 教育成效提升 | 益处类型 | 说明 | |----------|------| | **个性化学习** | 根据学生水平提供定制化内容 | | **即时反馈** | 24/7不间断的指导和支持 | | **学习效率** | 学习效率显著提升,减少学习时间 | ### 2. 教师工作减负 | 益处类型 | 说明 | |----------|------| | **备课自动化** | 自动生成教学内容和练习题 | | **批改效率** | 自动评分和反馈生成 | | **管理辅助** | 班级管理和行政工作支持 | ### 3. 教育公平性 | 益处类型 | 说明 | |----------|------| | **资源可及性** | 为教育资源匮乏地区提供高质量教育支持 | | **个性化支持** | 针对不同学习需求提供差异化教学 | | **特殊教育支持** | 为特殊需求学生提供定制化学习路径 | ## 主要挑战 ### 1. 技术可靠性 | 挑战类型 | 具体表现 | 发生比例 | |----------|----------|----------| | **幻觉问题** | LLM生成错误或虚假信息 | 40.9% | | **事实错误** | 事实性错误 | 27.3% | | **推理错误** | 逻辑推理错误 | 15.9% | | **总体可靠性问题** | 至少一种可靠性问题 | 68.2% | ### 2. 公平性与偏见 | 挑战类型 | 具体表现 | |----------|----------| | **文化偏见** | 对某些文化背景内容处理不当 | 22.7% | | **语言偏见** | 非英语语言处理质量较差 | 21.6% | | **社会经济偏见** | 对社会经济地位较低群体不利影响 | 19.3% | | **偏见问题研究** | 22.7%的研究涉及偏见问题 | ### 3. 评估可靠性 | 挑战类型 | 具体表现 | 发生比例 | |----------|----------|----------| | **评估标准不明确** | 未明确说明评估标准或方法 | 36.4% | | **样本偏差** | 样本代表性不足 | 19.3% | | **短期效应** | 仅测量短期学习效果 | 40.9% | | **研究者偏见** | 研究者主观影响评估 | 14.8% | ## 技术趋势 ### LLM模型演进 - **GPT-4主导期**(2022-2023):大多数研究基于GPT-4 - **多模型竞争期**(2024-2025):开始出现Claude、Gemini、Llama等竞争模型 - **开源模型崛起**:Llama、Mistral、Phi等开源模型在教育场景应用增多 ### 融合技术趋势 - **多模态融合**:文本、图像、语音等多模态输入输出 - **RAG架构**:检索增强生成成为主流架构模式 - **微调模型**:针对教育领域场景的专用模型增多 - **小语言模型**:针对特定任务的轻量级模型 ## 研究质量分布 | 质量维度 | 数量 | 占比 | |----------|------|------| | **高质量研究** | 11篇 | 12.5% | | **中等质量研究** | 52篇 | 59.1% | | **低质量研究** | 25篇 | 28.4% | ## 对教育AI实践的启示 ### 1. 技术可靠性是核心挑战 - **幻觉问题突出**:近70%的研究报告LLM存在可靠性问题 - **偏见问题普遍**:约1/5的研究涉及文化、语言或社会经济偏见 - **解决方案**:需要建立LLM可靠性检测和缓解机制 ### 2. 需要评估体系标准化 - **评估标准不明确**:36.4%的研究未明确说明评估方法 - **需要统一评估框架**:建立标准化的教育AI效果评估体系 - **需要长期跟踪研究**:增加纵向研究设计,跟踪长期学习效果 ### 3. 教师专业发展至关重要 - **教师主导使用模式效应最大**:d = 0.53-0.60 - **需要系统性培训**:提高教师的AI工具整合能力 - **合理设计干预时长**:避免"一次性使用效应",持续集成效果更佳 ### 4. 个性化学习路径设计 - **避免"一刀切"应用**:根据不同学生群体设计差异化应用 - **关注学习迁移能力**:培养学生在新场景中应用知识的能力 - **平衡效率与学习质量**:在提升效率的同时保证学习深度 ## 相关概念 - [[ChatGPT学习成果元分析]] - ChatGPT对学生学习成果影响的元分析 - [[以人为本AI教育观]] - 以人为本AI教育框架 - [[Khanmigo]] - 苏格拉底式AI导师实践案例 ## 相关研究 - [[文献索引数据库]] - 教育AI研究文献库 - [[教学大模型发展状况]] - 教学大模型国内外发展状况调研 ## 来源 > **溯源规则**:所有数字/百分比/具体结论必须标注 `[raw:{文件名}:{行号}]` 格式。 - [[raw/教育AI研究/文献库/文献索引数据库.json]]