Files
llm_wiki/wiki/随机对照试验(RCT).md
T
hehaiguang1123 a6f05ab2d5 Phase 0-2: Schema cleanup, typed relations, event-driven automation
- Phase 0: AGENTS.md cleanup (dedup quotes, renumber sections, merge qmd)
- Phase 1: typed relations (manage-relations.py, graph-search.py, check-staleness.py, detect-conflicts.py)
- Phase 2: frontmatter validator, weekly lint, knowledge promotion, git hooks
- Fix .gitignore to track tools/ and .githooks/
- Fix git remote URL (remove plaintext token)
- New wiki pages: 504 pages, 34 raw sources
2026-07-01 08:05:43 +08:00

140 lines
6.5 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
---
categories:
- "[[LLM Wiki]]"
tags:
- wiki
- methodology
- research
- experimental-design
created: 2026-04-20
source: "[[哈佛RCT深度解读-Kestin-2025]]"
type: concept
aliases:
- RCT
- Randomized Controlled Trial
---
# 随机对照试验(RCT
> **一句话定义**:科学研究中的金标准实验设计,通过随机分配受试者到不同处理组来控制混杂变量,建立因果关系
## 定义
随机对照试验(Randomized Controlled Trial, RCT)是一种实验研究方法,通过将研究对象随机分配到实验组(接受干预)和对照组(不接受干预或接受标准干预),从而最大限度地控制选择偏差和混杂变量。RCT被认为是评估干预效果的"金标准"Gold Standard)。
## 核心特征
### 1. 随机化(Randomization
| 特征 | 说明 | 价值 |
|------|------|------|
| **随机分组** | 计算机随机分配受试者到实验组或对照组 | 消除选择偏差 |
| **大样本量** | 样本足够大以保证统计效力 | 提高结果可靠性 |
| **分组平衡** | 各组基线特征无显著差异 | 控制混杂变量 |
### 2. 对照组(Control Group
| 类型 | 说明 | 应用场景 |
|------|------|----------|
| **无干预对照** | 不接受任何干预 | 评估干预的绝对效果 |
| **标准干预对照** | 接受当前标准做法 | 评估新方法是否优于现有方法 |
| **安慰剂对照** | 接受无效干预 | 医学研究中控制期望效应 |
### 3. 盲法(Blinding
| 类型 | 说明 | 教育研究中的应用 |
|------|------|------------------|
| **单盲** | 受试者不知道自己所属组 | 难以实施(学生知道是否使用AI) |
| **双盲** | 受试者和研究者都不知道分组 | 难以实施 |
| **盲法评估** | 结果评估者不知道分组情况 | 可行(第三方批改作业) |
### 4. 交叉设计(Crossover Design
```
┌─────────────────────────────────────────────────────────────┐
│ 交叉设计(Crossover
├─────────────────────────────────────────────────────────────┤
│ │
│ 第1期 ────────────────────────────────────────────────── │
│ ↓ │
│ ┌────────────────┐ ┌────────────────┐ │
│ │ A组学生 │ │ B组学生 │ │
│ │ 干预条件1 │ │ 对照条件1 │ │
│ └────────────────┘ └────────────────┘ │
│ ↓交叉 ↓交叉 │
│ 第2期 ────────────────────────────────────────────────── │
│ ↓ │
│ ┌────────────────┐ ┌────────────────┐ │
│ │ A组学生 │ │ B组学生 │ │
│ │ 对照条件2 │ │ 干预条件2 │ │
│ └────────────────┘ └────────────────┘ │
│ │
└─────────────────────────────────────────────────────────────┘
```
**交叉设计优势**
- 每名受试者都经历所有条件
- 控制个体差异
- 减少所需样本量
- 提高统计效力
## 在教育AI研究中的应用
### 哈佛大学AI辅导RCT案例
| 要素 | 描述 |
|------|------|
| **受试者** | 194名本科生 |
| **随机分配** | 计算机随机分组,保持同伴小组完整性 |
| **干预条件** | AI辅导(PS2 Palvs 课堂主动学习 |
| **测量指标** | 后测分数、学习时间、参与度、学习动机 |
| **效应量** | Cohen's d = 0.731.3(大型效应) |
| **统计显著性** | p < 10⁻⁸(极显著) |
### RCT在教育研究中的价值
| 价值 | 说明 |
|------|------|
| **因果关系建立** | 明确干预与结果之间的因果联系 |
| **效果量化** | 提供效应量指标(如Cohen's d |
| **证据等级最高** | 在证据等级体系中处于顶端 |
| **可复现性强** | 随机化保证研究结果的可复现性 |
## 局限性
| 局限 | 说明 | 应对策略 |
|------|------|----------|
| **生态效度** | 实验室/控制环境可能不反映真实教学场景 | 在真实课程中实施(如哈佛RCT) |
| **长期效果** | RCT通常测量短期效果 | 需要纵向追踪研究 |
| **成本高昂** | 大样本RCT实施成本高 | 结合准实验研究 |
| **实施困难** | 随机化在真实教育环境中可能有伦理或实际困难 | 使用整群随机化等变通方法 |
## 效应量指标
### Cohen's d
| d值范围 | 解释 | 哈佛RCT案例 |
|---------|------|--------------|
| d < 0.2 | 小型效应 | — |
| 0.2 ≤ d < 0.5 | 中型效应 | — |
| 0.5 ≤ d < 0.8 | 大型效应 | d = 0.73(接近大型效应) |
| d ≥ 0.8 | 超大型效应 | d = 1.3(远超超大型效应) |
### 其他效应量指标
- **r值**:相关系数,范围[-1, 1]
- **偏η²(Partial Eta Squared**:方差解释比例
- **BF₁₀(Bayes Factor**:贝叶斯因子,量化证据强度
## 与本Wiki相关
- [[Harvard-大学AI辅导随机对照试验研究]] — RCT在教育AI研究中的应用案例
- [[ITS(智能辅导系统)]] — AI辅导系统需要RCT验证效果
- [[教学大模型]] — 教学大模型的效果需要RCT验证
- [[Productive Failure]] — 教学方法的效果可以通过RCT验证
- [[Cohen's d]] — 效应量计算方法
## 来源
- [[哈佛RCT深度解读-Kestin-2025]] — 哈佛大学AI辅导随机对照试验深度解读(Nature Scientific Reports