--- categories: - '[[LLM Wiki]]' tags: - wiki - methodology - research - experimental-design created: 2026-04-20 source: '[[哈佛RCT深度解读-Kestin-2025]]' type: concept aliases: - RCT - Randomized Controlled Trial relations: - type: part_of target: '[[Kestin]]' description: 同源:哈佛RCT深度解读-Kestin-2025 confidence: 3 - type: extends target: '[[Harvard-大学AI辅导随机对照试验研究]]' confidence: 2 - type: extends target: '[[ITS(智能辅导系统)]]' confidence: 2 --- [raw:哈佛RCT深度解读-Kestin-2025:52]# 随机对照试验(RCT) > **一句话定义**:科学研究中的金标准实验设计,通过随机分配受试者到不同处理组来控制混杂变量,建立因果关系 ## 定义 随机对照试验(Randomized Controlled Trial, RCT)是一种实验研究方法,通过将研究对象随机分配到实验组(接受干预)和对照组(不接受干预或接受标准干预),从而最大限度地控制选择偏差和混杂变量。RCT被认为是评估干预效果的"金标准"(Gold Standard)。 ## 核心特征 ### 1. 随机化(Randomization) | 特征 | 说明 | 价值 | | ------| ------|------| | **随机分组** | 计算机随机分配受试者到实验组或对照组 | 消除选择偏差 | | **大样本量** | 样本足够大以保证统计效力 | 提高结果可靠性 | | **分组平衡** | 各组基线特征无显著差异 | 控制混杂变量 | ### 2. 对照组(Control Group) | 类型 | 说明 | 应用场景 | |------|------|----------| | **无干预对照** | 不接受任何干预 | 评估干预的绝对效果 | | **标准干预对照** | 接受当前标准做法 | 评估新方法是否优于现有方法 | | **安慰剂对照** | 接受无效干预 | 医学研究中控制期望效应 | ### 3. 盲法(Blinding) | 类型 | 说明 | 教育研究中的应用 | |------|------|------------------| | **单盲** | 受试者不知道自己所属组 | 难以实施(学生知道是否使用AI) | | **双盲** | 受试者和研究者都不知道分组 | 难以实施 | | **盲法评估** | 结果评估者不知道分组情况 | 可行(第三方批改作业) | ### 4. 交叉设计(Crossover Design) ``` ┌─────────────────────────────────────────────────────────────┐ │ 交叉设计(Crossover) │ ├─────────────────────────────────────────────────────────────┤ │ │ │ 第1期 ────────────────────────────────────────────────── │ │ ↓ │ │ ┌────────────────┐ ┌────────────────┐ │ │ │ A组学生 │ │ B组学生 │ │ │ │ 干预条件1 │ │ 对照条件1 │ │ │ └────────────────┘ └────────────────┘ │ │ ↓交叉 ↓交叉 │ │ 第2期 ────────────────────────────────────────────────── │ │ ↓ │ │ ┌────────────────┐ ┌────────────────┐ │ │ │ A组学生 │ │ B组学生 │ │ │ │ 对照条件2 │ │ 干预条件2 │ │ │ └────────────────┘ └────────────────┘ │ │ │ └─────────────────────────────────────────────────────────────┘ ``` **交叉设计优势**: - 每名受试者都经历所有条件 - 控制个体差异 - 减少所需样本量 - 提高统计效力 ## 在教育AI研究中的应用 ### 哈佛大学AI辅导RCT案例 | 要素 | 描述 | |------|------| | **受试者** | 194名本科生 | | **随机分配** | 计算机随机分组,保持同伴小组完整性 | | **干预条件** | AI辅导(PS2 Pal)vs 课堂主动学习 | | **测量指标** | 后测分数、学习时间、参与度、学习动机 | | **效应量** | Cohen's d = 0.73–1.3(大型效应) | | **统计显著性** | p < 10⁻⁸(极显著) | ### RCT在教育研究中的价值 | 价值 | 说明 | |------|------| | **因果关系建立** | 明确干预与结果之间的因果联系 | | **效果量化** | 提供效应量指标(如Cohen's d) | | **证据等级最高** | 在证据等级体系中处于顶端 | | **可复现性强** | 随机化保证研究结果的可复现性 | ## 局限性 | 局限 | 说明 | 应对策略 | |------|------|----------| | **生态效度** | 实验室/控制环境可能不反映真实教学场景 | 在真实课程中实施(如哈佛RCT) | | **长期效果** | RCT通常测量短期效果 | 需要纵向追踪研究 | | **成本高昂** | 大样本RCT实施成本高 | 结合准实验研究 | | **实施困难** | 随机化在真实教育环境中可能有伦理或实际困难 | 使用整群随机化等变通方法 | ## 效应量指标 ### Cohen's d | d值范围 | 解释 | 哈佛RCT案例 | |---------|------|--------------| | d < 0.2 | 小型效应 | — | | 0.2 ≤ d < 0.5 | 中型效应 | — | | 0.5 ≤ d < 0.8 | 大型效应 | d = 0.73(接近大型效应) | | d ≥ 0.8 | 超大型效应 | d = 1.3(远超超大型效应) | ### 其他效应量指标 - **r值**:相关系数,范围[-1, 1] - **偏η²(Partial Eta Squared)**:方差解释比例 - **BF₁₀(Bayes Factor)**:贝叶斯因子,量化证据强度 ## 与本Wiki相关 - [[Harvard-大学AI辅导随机对照试验研究]] — RCT在教育AI研究中的应用案例 - [[ITS(智能辅导系统)]] — AI辅导系统需要RCT验证效果 - [[教学大模型]] — 教学大模型的效果需要RCT验证 - [[Productive Failure]] — 教学方法的效果可以通过RCT验证 - [[Cohen's d]] — 效应量计算方法 ## 来源 - [[哈佛RCT深度解读-Kestin-2025]] — 哈佛大学AI辅导随机对照试验深度解读(Nature Scientific Reports) [raw:哈佛RCT深度解读-Kestin-2025:52]# 随机对照试验(RCT) > **一句话定义**:科学研究中的金标准实验设计,通过随机分配受试者到不同处理组来控制混杂变量,建立因果关系 ## 定义 随机对照试验(Randomized Controlled Trial, RCT)是一种实验研究方法,通过将研究对象随机分配到实验组(接受干预)和对照组(不接受干预或接受标准干预),从而最大限度地控制选择偏差和混杂变量。RCT被认为是评估干预效果的"金标准"(Gold Standard)。 ## 核心特征 ### 1. 随机化(Randomization) | 特征 | 说明 | 价值 | |------|------|------| | **随机分组** | 计算机随机分配受试者到实验组或对照组 | 消除选择偏差 | | **大样本量** | 样本足够大以保证统计效力 | 提高结果可靠性 | | **分组平衡** | 各组基线特征无显著差异 | 控制混杂变量 | ### 2. 对照组(Control Group) | 类型 | 说明 | 应用场景 | |------|------|----------| | **无干预对照** | 不接受任何干预 | 评估干预的绝对效果 | | **标准干预对照** | 接受当前标准做法 | 评估新方法是否优于现有方法 | | **安慰剂对照** | 接受无效干预 | 医学研究中控制期望效应 | ### 3. 盲法(Blinding) | 类型 | 说明 | 教育研究中的应用 | |------|------|------------------| | **单盲** | 受试者不知道自己所属组 | 难以实施(学生知道是否使用AI) | | **双盲** | 受试者和研究者都不知道分组 | 难以实施 | | **盲法评估** | 结果评估者不知道分组情况 | 可行(第三方批改作业) | ### 4. 交叉设计(Crossover Design) ``` ┌─────────────────────────────────────────────────────────────┐ │ 交叉设计(Crossover) │ ├─────────────────────────────────────────────────────────────┤ │ │ │ 第1期 ────────────────────────────────────────────────── │ │ ↓ │ │ ┌────────────────┐ ┌────────────────┐ │ │ │ A组学生 │ │ B组学生 │ │ │ │ 干预条件1 │ │ 对照条件1 │ │ │ └────────────────┘ └────────────────┘ │ │ ↓交叉 ↓交叉 │ │ 第2期 ────────────────────────────────────────────────── │ │ ↓ │ │ ┌────────────────┐ ┌────────────────┐ │ │ │ A组学生 │ │ B组学生 │ │ │ │ 对照条件2 │ │ 干预条件2 │ │ │ └────────────────┘ └────────────────┘ │ │ │ └─────────────────────────────────────────────────────────────┘ ``` **交叉设计优势**: - 每名受试者都经历所有条件 - 控制个体差异 - 减少所需样本量 - 提高统计效力 ## 在教育AI研究中的应用 ### 哈佛大学AI辅导RCT案例 | 要素 | 描述 | |------|------| | **受试者** | 194名本科生 | | **随机分配** | 计算机随机分组,保持同伴小组完整性 | | **干预条件** | AI辅导(PS2 Pal)vs 课堂主动学习 | | **测量指标** | 后测分数、学习时间、参与度、学习动机 | | **效应量** | Cohen's d = 0.73–1.3(大型效应) | | **统计显著性** | p < 10⁻⁸(极显著) | ### RCT在教育研究中的价值 | 价值 | 说明 | |------|------| | **因果关系建立** | 明确干预与结果之间的因果联系 | | **效果量化** | 提供效应量指标(如Cohen's d) | | **证据等级最高** | 在证据等级体系中处于顶端 | | **可复现性强** | 随机化保证研究结果的可复现性 | ## 局限性 | 局限 | 说明 | 应对策略 | |------|------|----------| | **生态效度** | 实验室/控制环境可能不反映真实教学场景 | 在真实课程中实施(如哈佛RCT) | | **长期效果** | RCT通常测量短期效果 | 需要纵向追踪研究 | | **成本高昂** | 大样本RCT实施成本高 | 结合准实验研究 | | **实施困难** | 随机化在真实教育环境中可能有伦理或实际困难 | 使用整群随机化等变通方法 | ## 效应量指标 ### Cohen's d | d值范围 | 解释 | 哈佛RCT案例 | |---------|------|--------------| | d < 0.2 | 小型效应 | — | | 0.2 ≤ d < 0.5 | 中型效应 | — | | 0.5 ≤ d < 0.8 | 大型效应 | d = 0.73(接近大型效应) | | d ≥ 0.8 | 超大型效应 | d = 1.3(远超超大型效应) | ### 其他效应量指标 - **r值**:相关系数,范围[-1, 1] - **偏η²(Partial Eta Squared)**:方差解释比例 - **BF₁₀(Bayes Factor)**:贝叶斯因子,量化证据强度 ## 与本Wiki相关 - [[Harvard-大学AI辅导随机对照试验研究]] — RCT在教育AI研究中的应用案例 - [[ITS(智能辅导系统)]] — AI辅导系统需要RCT验证效果 - [[教学大模型]] — 教学大模型的效果需要RCT验证 - [[Productive Failure]] — 教学方法的效果可以通过RCT验证 - [[Cohen's d]] — 效应量计算方法 ## 来源 - [[哈佛RCT深度解读-Kestin-2025]] — 哈佛大学AI辅导随机对照试验深度解读(Nature Scientific Reports)