Files
llm_wiki/raw/教育AI研究/真实性核查标准操作程序.md
hehaiguang1123 a6f05ab2d5 Phase 0-2: Schema cleanup, typed relations, event-driven automation
- Phase 0: AGENTS.md cleanup (dedup quotes, renumber sections, merge qmd)
- Phase 1: typed relations (manage-relations.py, graph-search.py, check-staleness.py, detect-conflicts.py)
- Phase 2: frontmatter validator, weekly lint, knowledge promotion, git hooks
- Fix .gitignore to track tools/ and .githooks/
- Fix git remote URL (remove plaintext token)
- New wiki pages: 504 pages, 34 raw sources
2026-07-01 08:05:43 +08:00

414 lines
12 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
---
created: 2026-04-14
title: 🔍 信息真实性核查标准操作程序(SOP)
tags: [输出, 核查, 质量]
category: outputs
---
# 🔍 信息真实性核查标准操作程序(SOP)
> **创建时间**2026-03-31
> **版本**v1.0
> **适用范围**:教育AI研究项目所有产出文档
> **核心原则**:**严禁胡编乱造,所有信息必须有可靠来源**
---
## 🎯 **核查目标与标准**
### **核心目标**
确保研究产出中**100%的信息有可靠来源**,**0%的胡编乱造内容**。
### **质量标准**
| 指标 | 目标值 | 测量方法 |
|------|--------|----------|
| **信源质量分** | ≥80分/篇 | 计算算法见下文 |
| **官方渠道占比** | ≥70% | 统计来源类型 |
| **多重验证率** | ≥50% | 统计有2+来源的信息占比 |
| **链接有效率** | 100% | 检查所有外部链接可访问性 |
| **时效合规率** | 100% | 检查所有信息在时效要求内 |
---
## 🔄 **核查流程(五步法)**
### **第一步:预核查(文档撰写时)**
**执行时机**:撰写每个段落时
**执行人**:研究者(狗剩)
**检查内容**
1. 当前段落是否有任何**未标注来源**的信息?
2. 标注的来源是否来自**官方渠道**?
3. 是否使用了**超过时效**的信息?
4. 是否有任何**推测性表述**未标注为推测?
**输出**
- 每段末尾添加`[来源检查:✅/❌]`标记
- 如有问题,立即修正或标记为`[待验证]`
### **第二步:初稿核查(文档完成后)**
**执行时机**:文档初稿完成时
**执行人**:研究者(狗剩)
**检查工具**:真实性核查清单(见附录)
**检查方法**
1. **逐句扫描**:检查每个句子是否有来源支持
2. **来源验证**:点击每个链接,确认可访问且内容匹配
3. **时效检查**:标注每个信息的时效状态
4. **质量评分**:计算初步信源质量分
**输出**
- 真实性核查报告(包含分数和问题清单)
- 如分数<70分,必须**重做或补充验证**
### **第三步:自动化核查(每日20:00)**
**执行时机**:通过自动化任务执行
**执行工具**:自动化脚本
**检查内容**
1. **链接有效性**:使用HTTP请求检查所有外部链接
2. **时效性计算**:计算每个信息的时效状态
3. **来源类型统计**:统计官方/权威/媒体/其他占比
4. **信源质量分计算**:自动计算并生成报告
**输出**
- 每日真实性核查报告(JSON格式)
- 问题链接清单(需要人工复查)
- 质量分数趋势图
### **第四步:人工抽查(随机)**
**执行时机**:随机时间点
**执行人**:研究者(狗剩)或LH
**检查方法**
1. **随机选择**:从文档中随机选择3-5个信息点
2. **深度验证**:对每个信息点进行源头追溯验证
3. **交叉检查**:查找独立来源进行交叉验证
4. **完整性检查**:检查是否遗漏了应该标注的来源
**输出**
- 人工抽查报告(抽查样本和结果)
- 如发现问题,整篇文档需要重新核查
### **第五步:最终审核(发布前)**
**执行时机**:文档准备发布前
**执行人**LH(最终审批)
**检查内容**
1. **真实性声明**:检查文档末尾的真实性声明
2. **来源完整性**:确认所有关键信息都有来源
3. **质量分数**:确认信源质量分≥80分
4. **个人判断**:基于专业知识的最终判断
**输出**
- 发布批准(或修改要求)
- 最终质量分数记录
---
## 📊 **信源质量分计算算法**
### **基础分数(满分100分)**
```
信源质量分 = 基础分 - 扣分项
```
### **基础分计算(按来源类型加分)**
| 来源类型 | 单个加分 | 说明 |
|----------|----------|------|
| **官方直接来源** | +20分 | 机构官网、政府网站 |
| **顶级学术期刊** | +15分 | Nature、Science、IEEE顶刊 |
| **权威研究报告** | +15分 | 官方白皮书、NSF报告 |
| **核心专利/标准** | +10分 | 已授权专利、国家标准 |
| **企业技术文档** | +10分 | 企业官网技术页面 |
| **权威媒体报道** | +5分 | 新华社、人民日报等 |
| **学术会议论文** | +5分 | 顶会收录论文 |
### **扣分项(严重问题)**
| 问题类型 | 单次扣分 | 说明 |
|----------|----------|------|
| **未标注来源的信息** | -50分 | **严重违规**,可能导致整篇文档无效 |
| **来源链接失效** | -20分 | 需要立即修复或标记 |
| **超过时效要求** | -15分 | 技术>6个月,市场>12个月 |
| **来源可信度低** | -10分 | 使用博客、社交媒体等低可信度来源 |
| **信息无法验证** | -30分 | 标注为[待验证]但仍包含在正文中 |
### **计算公式**
```
信源质量分 =
(官方来源数 × 20 + 学术期刊数 × 15 + ...) / 总信息点数 × 100
- 未标注扣分 - 时效扣分 - 其他扣分
```
**示例**
- 文档有20个信息点
- 10个官方来源(10×20=200
- 5个学术期刊(5×15=75
- 5个企业文档(5×10=50
- 总加分:325
- 基础分:325/20×100=81.25分
- 扣分:1个未标注来源(-50分)
- **最终分数:31.25分(不合格)**
---
## 🛠️ **核查工具与模板**
### **1. 真实性核查清单(每个文档必须使用)**
```markdown
# 真实性核查清单 - [文档名称]
## 🔍 基本信息
- **文档名称**
- **创建时间**
- **核查时间**
- **核查人**
## 📋 检查项
| 检查项 | 要求 | 是否通过 | 备注 |
|--------|------|----------|------|
| **1. 无未标注信息** | 所有信息都有来源标注 | [ ] | |
| **2. 来源可信度** | 官方渠道占比≥70% | [ ] | |
| **3. 链接有效性** | 所有外部链接可访问 | [ ] | |
| **4. 时效合规** | 无超过时效信息 | [ ] | |
| **5. 多重验证** | 关键信息有2+来源 | [ ] | |
| **6. 真实性声明** | 文末有完整声明 | [ ] | |
## 📊 质量评分
- **信息点总数**
- **官方来源数**
- **学术来源数**
- **企业来源数**
- **媒体来源数**
- **信源质量分**
- **是否合格**(≥80分):[ ]
## ⚠️ 问题清单
1.
2.
3.
## ✅ 核查结论
- [ ] 通过,可以发布
- [ ] 有条件通过,需修复问题
- [ ] 不通过,需要重做
```
### **2. 自动化核查脚本配置**
```python
# 真实性核查脚本示例
import requests
from datetime import datetime
class AuthenticityChecker:
def __init__(self, document_path):
self.document_path = document_path
def check_links(self):
"""检查所有链接有效性"""
links = self.extract_links()
results = []
for link in links:
try:
response = requests.get(link, timeout=10)
results.append({
'link': link,
'status': response.status_code,
'valid': response.status_code == 200
})
except:
results.append({'link': link, 'valid': False})
return results
def calculate_score(self):
"""计算信源质量分"""
# 实现评分算法
pass
```
### **3. 每日核查报告模板**
```json
{
"date": "2026-04-01",
"document": "MIT教育技术研究深度分析.md",
"check_results": {
"link_check": {
"total_links": 15,
"valid_links": 15,
"invalid_links": 0,
"validity_rate": 100
},
"source_quality": {
"official_sources": 12,
"academic_sources": 3,
"media_sources": 0,
"official_ratio": 80
},
"timeliness": {
"within_6_months": 10,
"within_12_months": 5,
"beyond_12_months": 0,
"compliance_rate": 100
},
"quality_score": 85.5,
"status": "PASS"
},
"issues": [],
"recommendations": "文档质量优秀,可以发布"
}
```
---
## ⚠️ **违规处理流程**
### **发现违规信息的处理**
1. **立即标记**:在文档中标记违规信息为`[真实性待核实]`
2. **暂停发布**:立即暂停文档发布流程
3. **调查原因**:分析违规原因:
- 疏忽遗漏?
- 来源难以查找?
- 故意编造?
4. **采取行动**
- **A级违规**(未标注来源):整篇文档重做
- **B级违规**(来源低可信度):补充验证或删除
- **C级违规**(时效超期):更新信息或标注时效
### **重复违规的处理**
| 违规次数 | 处理措施 |
|----------|----------|
| **第1次** | 警告,重新培训核查流程 |
| **第2次** | 暂停研究权限1天,深入审查 |
| **第3次** | 暂停研究权限3天,项目审查 |
| **第4次** | 终止研究权限,更换研究者 |
### **故意编造信息的处理**
- **立即终止**:立即终止所有研究权限
- **项目审查**:审查所有已产出文档
- **记录档案**:记录违规行为到研究档案
- **重新评估**:重新评估整个研究项目的可行性
---
## 📝 **文档末尾真实性声明模板**
**每个文档必须在末尾包含以下声明:**
```markdown
---
## 🧾 信息真实性声明
**本文所有信息均经过严格核查,确保来源可靠:**
### 🔗 主要信息来源
1. **[MIT媒体实验室官网项目页面](https://www.media.mit.edu/groups/...)** - 官方直接来源
- 项目编号:EDU-AI-2025-001
- 发布时间:2025年3月
- 主要研究人员:Prof. John Doe
2. **[NSF Award Search数据库](https://www.nsf.gov/awardsearch/...)** - 政府官方来源
- 资助编号:2034567
- 资助金额:$2,500,000
- 资助周期:2024-2027
3. **[IEEE TLT学术期刊](https://ieeexplore.ieee.org/...)** - 学术权威来源
- DOI10.1109/TLT.2025.1234567
- 影响因子:8.7
- 引用次数:42次
### ✅ 核查确认
- [x] 所有信息均有可验证来源
- [x] 所有外部链接均经过有效性检查
- [x] 无超过时效要求的信息
- [x] 无推测性表述未标注为推测
- [x] 信源质量分:85/100(≥80分合格)
### ⚠️ 无信息来源声明
**本文中不包含以下类型内容:**
- ❌ 无来源的"据说"、"据了解"
- ❌ 未验证的社交媒体传闻
- ❌ 匿名专家观点
- ❌ 无法追溯的数据图表
- ❌ 任何形式的胡编乱造
### 📞 信息更正渠道
如发现任何信息不准确,请联系项目负责人进行更正。
---
**最后核查时间**2026-04-01
**核查人**:狗剩(WorkBuddy AI助手)
**批准人**LH
**文档状态**:✅ 已通过真实性核查,可发布
```
---
## 📚 **培训与持续改进**
### **定期培训**
- **每周一**:真实性核查流程复习(15分钟)
- **每月第一周**:新信息来源渠道培训(30分钟)
- **每季度**:案例分析与经验分享(1小时)
### **持续改进机制**
1. **问题记录**:记录每次核查发现的问题
2. **原因分析**:分析问题产生的原因
3. **流程优化**:根据分析结果优化核查流程
4. **工具改进**:改进自动化核查工具
5. **知识更新**:更新信息来源渠道矩阵
### **质量监控指标**
| 指标 | 目标值 | 监控频率 | 改进措施 |
|------|--------|----------|----------|
| **平均信源质量分** | ≥85分 | 每周 | 分析低分原因 |
| **核查时间效率** | ≤30分钟/篇 | 每日 | 优化核查流程 |
| **违规发生率** | <1% | 每月 | 加强培训 |
| **LH满意度** | ≥9/10 | 每周 | 收集反馈改进 |
---
**生效时间**2026年4月1日
**审核周期**:每月审核更新一次
**紧急联系人**:项目负责人
**核心承诺**:我们承诺以最高标准确保信息真实性,绝不妥协。