a6f05ab2d5
- Phase 0: AGENTS.md cleanup (dedup quotes, renumber sections, merge qmd) - Phase 1: typed relations (manage-relations.py, graph-search.py, check-staleness.py, detect-conflicts.py) - Phase 2: frontmatter validator, weekly lint, knowledge promotion, git hooks - Fix .gitignore to track tools/ and .githooks/ - Fix git remote URL (remove plaintext token) - New wiki pages: 504 pages, 34 raw sources
12 KiB
12 KiB
created, title, tags, category
| created | title | tags | category | |||
|---|---|---|---|---|---|---|
| 2026-04-14 | 🔍 信息真实性核查标准操作程序(SOP) |
|
outputs |
🔍 信息真实性核查标准操作程序(SOP)
创建时间:2026-03-31 版本:v1.0 适用范围:教育AI研究项目所有产出文档 核心原则:严禁胡编乱造,所有信息必须有可靠来源
🎯 核查目标与标准
核心目标
确保研究产出中100%的信息有可靠来源,0%的胡编乱造内容。
质量标准
| 指标 | 目标值 | 测量方法 |
|---|---|---|
| 信源质量分 | ≥80分/篇 | 计算算法见下文 |
| 官方渠道占比 | ≥70% | 统计来源类型 |
| 多重验证率 | ≥50% | 统计有2+来源的信息占比 |
| 链接有效率 | 100% | 检查所有外部链接可访问性 |
| 时效合规率 | 100% | 检查所有信息在时效要求内 |
🔄 核查流程(五步法)
第一步:预核查(文档撰写时)
执行时机:撰写每个段落时
执行人:研究者(狗剩)
检查内容:
- 当前段落是否有任何未标注来源的信息?
- 标注的来源是否来自官方渠道?
- 是否使用了超过时效的信息?
- 是否有任何推测性表述未标注为推测?
输出:
- 每段末尾添加
[来源检查:✅/❌]标记 - 如有问题,立即修正或标记为
[待验证]
第二步:初稿核查(文档完成后)
执行时机:文档初稿完成时
执行人:研究者(狗剩)
检查工具:真实性核查清单(见附录)
检查方法:
- 逐句扫描:检查每个句子是否有来源支持
- 来源验证:点击每个链接,确认可访问且内容匹配
- 时效检查:标注每个信息的时效状态
- 质量评分:计算初步信源质量分
输出:
- 真实性核查报告(包含分数和问题清单)
- 如分数<70分,必须重做或补充验证
第三步:自动化核查(每日20:00)
执行时机:通过自动化任务执行
执行工具:自动化脚本
检查内容:
- 链接有效性:使用HTTP请求检查所有外部链接
- 时效性计算:计算每个信息的时效状态
- 来源类型统计:统计官方/权威/媒体/其他占比
- 信源质量分计算:自动计算并生成报告
输出:
- 每日真实性核查报告(JSON格式)
- 问题链接清单(需要人工复查)
- 质量分数趋势图
第四步:人工抽查(随机)
执行时机:随机时间点
执行人:研究者(狗剩)或LH
检查方法:
- 随机选择:从文档中随机选择3-5个信息点
- 深度验证:对每个信息点进行源头追溯验证
- 交叉检查:查找独立来源进行交叉验证
- 完整性检查:检查是否遗漏了应该标注的来源
输出:
- 人工抽查报告(抽查样本和结果)
- 如发现问题,整篇文档需要重新核查
第五步:最终审核(发布前)
执行时机:文档准备发布前
执行人:LH(最终审批)
检查内容:
- 真实性声明:检查文档末尾的真实性声明
- 来源完整性:确认所有关键信息都有来源
- 质量分数:确认信源质量分≥80分
- 个人判断:基于专业知识的最终判断
输出:
- 发布批准(或修改要求)
- 最终质量分数记录
📊 信源质量分计算算法
基础分数(满分100分)
信源质量分 = 基础分 - 扣分项
基础分计算(按来源类型加分)
| 来源类型 | 单个加分 | 说明 |
|---|---|---|
| 官方直接来源 | +20分 | 机构官网、政府网站 |
| 顶级学术期刊 | +15分 | Nature、Science、IEEE顶刊 |
| 权威研究报告 | +15分 | 官方白皮书、NSF报告 |
| 核心专利/标准 | +10分 | 已授权专利、国家标准 |
| 企业技术文档 | +10分 | 企业官网技术页面 |
| 权威媒体报道 | +5分 | 新华社、人民日报等 |
| 学术会议论文 | +5分 | 顶会收录论文 |
扣分项(严重问题)
| 问题类型 | 单次扣分 | 说明 |
|---|---|---|
| 未标注来源的信息 | -50分 | 严重违规,可能导致整篇文档无效 |
| 来源链接失效 | -20分 | 需要立即修复或标记 |
| 超过时效要求 | -15分 | 技术>6个月,市场>12个月 |
| 来源可信度低 | -10分 | 使用博客、社交媒体等低可信度来源 |
| 信息无法验证 | -30分 | 标注为[待验证]但仍包含在正文中 |
计算公式
信源质量分 =
(官方来源数 × 20 + 学术期刊数 × 15 + ...) / 总信息点数 × 100
- 未标注扣分 - 时效扣分 - 其他扣分
示例:
- 文档有20个信息点
- 10个官方来源(10×20=200)
- 5个学术期刊(5×15=75)
- 5个企业文档(5×10=50)
- 总加分:325
- 基础分:325/20×100=81.25分
- 扣分:1个未标注来源(-50分)
- 最终分数:31.25分(不合格)
🛠️ 核查工具与模板
1. 真实性核查清单(每个文档必须使用)
# 真实性核查清单 - [文档名称]
## 🔍 基本信息
- **文档名称**:
- **创建时间**:
- **核查时间**:
- **核查人**:
## 📋 检查项
| 检查项 | 要求 | 是否通过 | 备注 |
|--------|------|----------|------|
| **1. 无未标注信息** | 所有信息都有来源标注 | [ ] | |
| **2. 来源可信度** | 官方渠道占比≥70% | [ ] | |
| **3. 链接有效性** | 所有外部链接可访问 | [ ] | |
| **4. 时效合规** | 无超过时效信息 | [ ] | |
| **5. 多重验证** | 关键信息有2+来源 | [ ] | |
| **6. 真实性声明** | 文末有完整声明 | [ ] | |
## 📊 质量评分
- **信息点总数**:
- **官方来源数**:
- **学术来源数**:
- **企业来源数**:
- **媒体来源数**:
- **信源质量分**:
- **是否合格**(≥80分):[ ]
## ⚠️ 问题清单
1.
2.
3.
## ✅ 核查结论
- [ ] 通过,可以发布
- [ ] 有条件通过,需修复问题
- [ ] 不通过,需要重做
2. 自动化核查脚本配置
# 真实性核查脚本示例
import requests
from datetime import datetime
class AuthenticityChecker:
def __init__(self, document_path):
self.document_path = document_path
def check_links(self):
"""检查所有链接有效性"""
links = self.extract_links()
results = []
for link in links:
try:
response = requests.get(link, timeout=10)
results.append({
'link': link,
'status': response.status_code,
'valid': response.status_code == 200
})
except:
results.append({'link': link, 'valid': False})
return results
def calculate_score(self):
"""计算信源质量分"""
# 实现评分算法
pass
3. 每日核查报告模板
{
"date": "2026-04-01",
"document": "MIT教育技术研究深度分析.md",
"check_results": {
"link_check": {
"total_links": 15,
"valid_links": 15,
"invalid_links": 0,
"validity_rate": 100
},
"source_quality": {
"official_sources": 12,
"academic_sources": 3,
"media_sources": 0,
"official_ratio": 80
},
"timeliness": {
"within_6_months": 10,
"within_12_months": 5,
"beyond_12_months": 0,
"compliance_rate": 100
},
"quality_score": 85.5,
"status": "PASS"
},
"issues": [],
"recommendations": "文档质量优秀,可以发布"
}
⚠️ 违规处理流程
发现违规信息的处理
- 立即标记:在文档中标记违规信息为
[真实性待核实] - 暂停发布:立即暂停文档发布流程
- 调查原因:分析违规原因:
- 疏忽遗漏?
- 来源难以查找?
- 故意编造?
- 采取行动:
- A级违规(未标注来源):整篇文档重做
- B级违规(来源低可信度):补充验证或删除
- C级违规(时效超期):更新信息或标注时效
重复违规的处理
| 违规次数 | 处理措施 |
|---|---|
| 第1次 | 警告,重新培训核查流程 |
| 第2次 | 暂停研究权限1天,深入审查 |
| 第3次 | 暂停研究权限3天,项目审查 |
| 第4次 | 终止研究权限,更换研究者 |
故意编造信息的处理
- 立即终止:立即终止所有研究权限
- 项目审查:审查所有已产出文档
- 记录档案:记录违规行为到研究档案
- 重新评估:重新评估整个研究项目的可行性
📝 文档末尾真实性声明模板
每个文档必须在末尾包含以下声明:
---
## 🧾 信息真实性声明
**本文所有信息均经过严格核查,确保来源可靠:**
### 🔗 主要信息来源
1. **[MIT媒体实验室官网项目页面](https://www.media.mit.edu/groups/...)** - 官方直接来源
- 项目编号:EDU-AI-2025-001
- 发布时间:2025年3月
- 主要研究人员:Prof. John Doe
2. **[NSF Award Search数据库](https://www.nsf.gov/awardsearch/...)** - 政府官方来源
- 资助编号:2034567
- 资助金额:$2,500,000
- 资助周期:2024-2027
3. **[IEEE TLT学术期刊](https://ieeexplore.ieee.org/...)** - 学术权威来源
- DOI:10.1109/TLT.2025.1234567
- 影响因子:8.7
- 引用次数:42次
### ✅ 核查确认
- [x] 所有信息均有可验证来源
- [x] 所有外部链接均经过有效性检查
- [x] 无超过时效要求的信息
- [x] 无推测性表述未标注为推测
- [x] 信源质量分:85/100(≥80分合格)
### ⚠️ 无信息来源声明
**本文中不包含以下类型内容:**
- ❌ 无来源的"据说"、"据了解"
- ❌ 未验证的社交媒体传闻
- ❌ 匿名专家观点
- ❌ 无法追溯的数据图表
- ❌ 任何形式的胡编乱造
### 📞 信息更正渠道
如发现任何信息不准确,请联系项目负责人进行更正。
---
**最后核查时间**:2026-04-01
**核查人**:狗剩(WorkBuddy AI助手)
**批准人**:LH
**文档状态**:✅ 已通过真实性核查,可发布
📚 培训与持续改进
定期培训
- 每周一:真实性核查流程复习(15分钟)
- 每月第一周:新信息来源渠道培训(30分钟)
- 每季度:案例分析与经验分享(1小时)
持续改进机制
- 问题记录:记录每次核查发现的问题
- 原因分析:分析问题产生的原因
- 流程优化:根据分析结果优化核查流程
- 工具改进:改进自动化核查工具
- 知识更新:更新信息来源渠道矩阵
质量监控指标
| 指标 | 目标值 | 监控频率 | 改进措施 |
|---|---|---|---|
| 平均信源质量分 | ≥85分 | 每周 | 分析低分原因 |
| 核查时间效率 | ≤30分钟/篇 | 每日 | 优化核查流程 |
| 违规发生率 | <1% | 每月 | 加强培训 |
| LH满意度 | ≥9/10 | 每周 | 收集反馈改进 |
生效时间:2026年4月1日
审核周期:每月审核更新一次
紧急联系人:项目负责人
核心承诺:我们承诺以最高标准确保信息真实性,绝不妥协。