a6f05ab2d5
- Phase 0: AGENTS.md cleanup (dedup quotes, renumber sections, merge qmd) - Phase 1: typed relations (manage-relations.py, graph-search.py, check-staleness.py, detect-conflicts.py) - Phase 2: frontmatter validator, weekly lint, knowledge promotion, git hooks - Fix .gitignore to track tools/ and .githooks/ - Fix git remote URL (remove plaintext token) - New wiki pages: 504 pages, 34 raw sources
6.5 KiB
6.5 KiB
categories, tags, created, source, type, aliases
| categories | tags | created | source | type | aliases | |||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
|
|
2026-04-20 | 哈佛RCT深度解读-Kestin-2025 | concept |
|
随机对照试验(RCT)
一句话定义:科学研究中的金标准实验设计,通过随机分配受试者到不同处理组来控制混杂变量,建立因果关系
定义
随机对照试验(Randomized Controlled Trial, RCT)是一种实验研究方法,通过将研究对象随机分配到实验组(接受干预)和对照组(不接受干预或接受标准干预),从而最大限度地控制选择偏差和混杂变量。RCT被认为是评估干预效果的"金标准"(Gold Standard)。
核心特征
1. 随机化(Randomization)
| 特征 | 说明 | 价值 |
|---|---|---|
| 随机分组 | 计算机随机分配受试者到实验组或对照组 | 消除选择偏差 |
| 大样本量 | 样本足够大以保证统计效力 | 提高结果可靠性 |
| 分组平衡 | 各组基线特征无显著差异 | 控制混杂变量 |
2. 对照组(Control Group)
| 类型 | 说明 | 应用场景 |
|---|---|---|
| 无干预对照 | 不接受任何干预 | 评估干预的绝对效果 |
| 标准干预对照 | 接受当前标准做法 | 评估新方法是否优于现有方法 |
| 安慰剂对照 | 接受无效干预 | 医学研究中控制期望效应 |
3. 盲法(Blinding)
| 类型 | 说明 | 教育研究中的应用 |
|---|---|---|
| 单盲 | 受试者不知道自己所属组 | 难以实施(学生知道是否使用AI) |
| 双盲 | 受试者和研究者都不知道分组 | 难以实施 |
| 盲法评估 | 结果评估者不知道分组情况 | 可行(第三方批改作业) |
4. 交叉设计(Crossover Design)
┌─────────────────────────────────────────────────────────────┐
│ 交叉设计(Crossover) │
├─────────────────────────────────────────────────────────────┤
│ │
│ 第1期 ────────────────────────────────────────────────── │
│ ↓ │
│ ┌────────────────┐ ┌────────────────┐ │
│ │ A组学生 │ │ B组学生 │ │
│ │ 干预条件1 │ │ 对照条件1 │ │
│ └────────────────┘ └────────────────┘ │
│ ↓交叉 ↓交叉 │
│ 第2期 ────────────────────────────────────────────────── │
│ ↓ │
│ ┌────────────────┐ ┌────────────────┐ │
│ │ A组学生 │ │ B组学生 │ │
│ │ 对照条件2 │ │ 干预条件2 │ │
│ └────────────────┘ └────────────────┘ │
│ │
└─────────────────────────────────────────────────────────────┘
交叉设计优势:
- 每名受试者都经历所有条件
- 控制个体差异
- 减少所需样本量
- 提高统计效力
在教育AI研究中的应用
哈佛大学AI辅导RCT案例
| 要素 | 描述 |
|---|---|
| 受试者 | 194名本科生 |
| 随机分配 | 计算机随机分组,保持同伴小组完整性 |
| 干预条件 | AI辅导(PS2 Pal)vs 课堂主动学习 |
| 测量指标 | 后测分数、学习时间、参与度、学习动机 |
| 效应量 | Cohen's d = 0.73–1.3(大型效应) |
| 统计显著性 | p < 10⁻⁸(极显著) |
RCT在教育研究中的价值
| 价值 | 说明 |
|---|---|
| 因果关系建立 | 明确干预与结果之间的因果联系 |
| 效果量化 | 提供效应量指标(如Cohen's d) |
| 证据等级最高 | 在证据等级体系中处于顶端 |
| 可复现性强 | 随机化保证研究结果的可复现性 |
局限性
| 局限 | 说明 | 应对策略 |
|---|---|---|
| 生态效度 | 实验室/控制环境可能不反映真实教学场景 | 在真实课程中实施(如哈佛RCT) |
| 长期效果 | RCT通常测量短期效果 | 需要纵向追踪研究 |
| 成本高昂 | 大样本RCT实施成本高 | 结合准实验研究 |
| 实施困难 | 随机化在真实教育环境中可能有伦理或实际困难 | 使用整群随机化等变通方法 |
效应量指标
Cohen's d
| d值范围 | 解释 | 哈佛RCT案例 |
|---|---|---|
| d < 0.2 | 小型效应 | — |
| 0.2 ≤ d < 0.5 | 中型效应 | — |
| 0.5 ≤ d < 0.8 | 大型效应 | d = 0.73(接近大型效应) |
| d ≥ 0.8 | 超大型效应 | d = 1.3(远超超大型效应) |
其他效应量指标
- r值:相关系数,范围[-1, 1]
- 偏η²(Partial Eta Squared):方差解释比例
- BF₁₀(Bayes Factor):贝叶斯因子,量化证据强度
与本Wiki相关
- Harvard-大学AI辅导随机对照试验研究 — RCT在教育AI研究中的应用案例
- ITS(智能辅导系统) — AI辅导系统需要RCT验证效果
- 教学大模型 — 教学大模型的效果需要RCT验证
- Productive Failure — 教学方法的效果可以通过RCT验证
- Cohen's d — 效应量计算方法
来源
- 哈佛RCT深度解读-Kestin-2025 — 哈佛大学AI辅导随机对照试验深度解读(Nature Scientific Reports)