Phase 0-2: Schema cleanup, typed relations, event-driven automation

- Phase 0: AGENTS.md cleanup (dedup quotes, renumber sections, merge qmd)
- Phase 1: typed relations (manage-relations.py, graph-search.py, check-staleness.py, detect-conflicts.py)
- Phase 2: frontmatter validator, weekly lint, knowledge promotion, git hooks
- Fix .gitignore to track tools/ and .githooks/
- Fix git remote URL (remove plaintext token)
- New wiki pages: 504 pages, 34 raw sources
This commit is contained in:
hehaiguang1123
2026-07-01 08:05:43 +08:00
parent e544d6e04a
commit a6f05ab2d5
1067 changed files with 522992 additions and 819 deletions
@@ -0,0 +1,413 @@
---
created: 2026-04-14
title: 🔍 信息真实性核查标准操作程序(SOP)
tags: [输出, 核查, 质量]
category: outputs
---
# 🔍 信息真实性核查标准操作程序(SOP)
> **创建时间**2026-03-31
> **版本**v1.0
> **适用范围**:教育AI研究项目所有产出文档
> **核心原则**:**严禁胡编乱造,所有信息必须有可靠来源**
---
## 🎯 **核查目标与标准**
### **核心目标**
确保研究产出中**100%的信息有可靠来源**,**0%的胡编乱造内容**。
### **质量标准**
| 指标 | 目标值 | 测量方法 |
|------|--------|----------|
| **信源质量分** | ≥80分/篇 | 计算算法见下文 |
| **官方渠道占比** | ≥70% | 统计来源类型 |
| **多重验证率** | ≥50% | 统计有2+来源的信息占比 |
| **链接有效率** | 100% | 检查所有外部链接可访问性 |
| **时效合规率** | 100% | 检查所有信息在时效要求内 |
---
## 🔄 **核查流程(五步法)**
### **第一步:预核查(文档撰写时)**
**执行时机**:撰写每个段落时
**执行人**:研究者(狗剩)
**检查内容**
1. 当前段落是否有任何**未标注来源**的信息?
2. 标注的来源是否来自**官方渠道**?
3. 是否使用了**超过时效**的信息?
4. 是否有任何**推测性表述**未标注为推测?
**输出**
- 每段末尾添加`[来源检查:✅/❌]`标记
- 如有问题,立即修正或标记为`[待验证]`
### **第二步:初稿核查(文档完成后)**
**执行时机**:文档初稿完成时
**执行人**:研究者(狗剩)
**检查工具**:真实性核查清单(见附录)
**检查方法**
1. **逐句扫描**:检查每个句子是否有来源支持
2. **来源验证**:点击每个链接,确认可访问且内容匹配
3. **时效检查**:标注每个信息的时效状态
4. **质量评分**:计算初步信源质量分
**输出**
- 真实性核查报告(包含分数和问题清单)
- 如分数<70分,必须**重做或补充验证**
### **第三步:自动化核查(每日20:00)**
**执行时机**:通过自动化任务执行
**执行工具**:自动化脚本
**检查内容**
1. **链接有效性**:使用HTTP请求检查所有外部链接
2. **时效性计算**:计算每个信息的时效状态
3. **来源类型统计**:统计官方/权威/媒体/其他占比
4. **信源质量分计算**:自动计算并生成报告
**输出**
- 每日真实性核查报告(JSON格式)
- 问题链接清单(需要人工复查)
- 质量分数趋势图
### **第四步:人工抽查(随机)**
**执行时机**:随机时间点
**执行人**:研究者(狗剩)或LH
**检查方法**
1. **随机选择**:从文档中随机选择3-5个信息点
2. **深度验证**:对每个信息点进行源头追溯验证
3. **交叉检查**:查找独立来源进行交叉验证
4. **完整性检查**:检查是否遗漏了应该标注的来源
**输出**
- 人工抽查报告(抽查样本和结果)
- 如发现问题,整篇文档需要重新核查
### **第五步:最终审核(发布前)**
**执行时机**:文档准备发布前
**执行人**LH(最终审批)
**检查内容**
1. **真实性声明**:检查文档末尾的真实性声明
2. **来源完整性**:确认所有关键信息都有来源
3. **质量分数**:确认信源质量分≥80分
4. **个人判断**:基于专业知识的最终判断
**输出**
- 发布批准(或修改要求)
- 最终质量分数记录
---
## 📊 **信源质量分计算算法**
### **基础分数(满分100分)**
```
信源质量分 = 基础分 - 扣分项
```
### **基础分计算(按来源类型加分)**
| 来源类型 | 单个加分 | 说明 |
|----------|----------|------|
| **官方直接来源** | +20分 | 机构官网、政府网站 |
| **顶级学术期刊** | +15分 | Nature、Science、IEEE顶刊 |
| **权威研究报告** | +15分 | 官方白皮书、NSF报告 |
| **核心专利/标准** | +10分 | 已授权专利、国家标准 |
| **企业技术文档** | +10分 | 企业官网技术页面 |
| **权威媒体报道** | +5分 | 新华社、人民日报等 |
| **学术会议论文** | +5分 | 顶会收录论文 |
### **扣分项(严重问题)**
| 问题类型 | 单次扣分 | 说明 |
|----------|----------|------|
| **未标注来源的信息** | -50分 | **严重违规**,可能导致整篇文档无效 |
| **来源链接失效** | -20分 | 需要立即修复或标记 |
| **超过时效要求** | -15分 | 技术>6个月,市场>12个月 |
| **来源可信度低** | -10分 | 使用博客、社交媒体等低可信度来源 |
| **信息无法验证** | -30分 | 标注为[待验证]但仍包含在正文中 |
### **计算公式**
```
信源质量分 =
(官方来源数 × 20 + 学术期刊数 × 15 + ...) / 总信息点数 × 100
- 未标注扣分 - 时效扣分 - 其他扣分
```
**示例**
- 文档有20个信息点
- 10个官方来源(10×20=200
- 5个学术期刊(5×15=75
- 5个企业文档(5×10=50
- 总加分:325
- 基础分:325/20×100=81.25分
- 扣分:1个未标注来源(-50分)
- **最终分数:31.25分(不合格)**
---
## 🛠️ **核查工具与模板**
### **1. 真实性核查清单(每个文档必须使用)**
```markdown
# 真实性核查清单 - [文档名称]
## 🔍 基本信息
- **文档名称**
- **创建时间**
- **核查时间**
- **核查人**
## 📋 检查项
| 检查项 | 要求 | 是否通过 | 备注 |
|--------|------|----------|------|
| **1. 无未标注信息** | 所有信息都有来源标注 | [ ] | |
| **2. 来源可信度** | 官方渠道占比≥70% | [ ] | |
| **3. 链接有效性** | 所有外部链接可访问 | [ ] | |
| **4. 时效合规** | 无超过时效信息 | [ ] | |
| **5. 多重验证** | 关键信息有2+来源 | [ ] | |
| **6. 真实性声明** | 文末有完整声明 | [ ] | |
## 📊 质量评分
- **信息点总数**
- **官方来源数**
- **学术来源数**
- **企业来源数**
- **媒体来源数**
- **信源质量分**
- **是否合格**(≥80分):[ ]
## ⚠️ 问题清单
1.
2.
3.
## ✅ 核查结论
- [ ] 通过,可以发布
- [ ] 有条件通过,需修复问题
- [ ] 不通过,需要重做
```
### **2. 自动化核查脚本配置**
```python
# 真实性核查脚本示例
import requests
from datetime import datetime
class AuthenticityChecker:
def __init__(self, document_path):
self.document_path = document_path
def check_links(self):
"""检查所有链接有效性"""
links = self.extract_links()
results = []
for link in links:
try:
response = requests.get(link, timeout=10)
results.append({
'link': link,
'status': response.status_code,
'valid': response.status_code == 200
})
except:
results.append({'link': link, 'valid': False})
return results
def calculate_score(self):
"""计算信源质量分"""
# 实现评分算法
pass
```
### **3. 每日核查报告模板**
```json
{
"date": "2026-04-01",
"document": "MIT教育技术研究深度分析.md",
"check_results": {
"link_check": {
"total_links": 15,
"valid_links": 15,
"invalid_links": 0,
"validity_rate": 100
},
"source_quality": {
"official_sources": 12,
"academic_sources": 3,
"media_sources": 0,
"official_ratio": 80
},
"timeliness": {
"within_6_months": 10,
"within_12_months": 5,
"beyond_12_months": 0,
"compliance_rate": 100
},
"quality_score": 85.5,
"status": "PASS"
},
"issues": [],
"recommendations": "文档质量优秀,可以发布"
}
```
---
## ⚠️ **违规处理流程**
### **发现违规信息的处理**
1. **立即标记**:在文档中标记违规信息为`[真实性待核实]`
2. **暂停发布**:立即暂停文档发布流程
3. **调查原因**:分析违规原因:
- 疏忽遗漏?
- 来源难以查找?
- 故意编造?
4. **采取行动**
- **A级违规**(未标注来源):整篇文档重做
- **B级违规**(来源低可信度):补充验证或删除
- **C级违规**(时效超期):更新信息或标注时效
### **重复违规的处理**
| 违规次数 | 处理措施 |
|----------|----------|
| **第1次** | 警告,重新培训核查流程 |
| **第2次** | 暂停研究权限1天,深入审查 |
| **第3次** | 暂停研究权限3天,项目审查 |
| **第4次** | 终止研究权限,更换研究者 |
### **故意编造信息的处理**
- **立即终止**:立即终止所有研究权限
- **项目审查**:审查所有已产出文档
- **记录档案**:记录违规行为到研究档案
- **重新评估**:重新评估整个研究项目的可行性
---
## 📝 **文档末尾真实性声明模板**
**每个文档必须在末尾包含以下声明:**
```markdown
---
## 🧾 信息真实性声明
**本文所有信息均经过严格核查,确保来源可靠:**
### 🔗 主要信息来源
1. **[MIT媒体实验室官网项目页面](https://www.media.mit.edu/groups/...)** - 官方直接来源
- 项目编号:EDU-AI-2025-001
- 发布时间:2025年3月
- 主要研究人员:Prof. John Doe
2. **[NSF Award Search数据库](https://www.nsf.gov/awardsearch/...)** - 政府官方来源
- 资助编号:2034567
- 资助金额:$2,500,000
- 资助周期:2024-2027
3. **[IEEE TLT学术期刊](https://ieeexplore.ieee.org/...)** - 学术权威来源
- DOI10.1109/TLT.2025.1234567
- 影响因子:8.7
- 引用次数:42次
### ✅ 核查确认
- [x] 所有信息均有可验证来源
- [x] 所有外部链接均经过有效性检查
- [x] 无超过时效要求的信息
- [x] 无推测性表述未标注为推测
- [x] 信源质量分:85/100(≥80分合格)
### ⚠️ 无信息来源声明
**本文中不包含以下类型内容:**
- ❌ 无来源的"据说"、"据了解"
- ❌ 未验证的社交媒体传闻
- ❌ 匿名专家观点
- ❌ 无法追溯的数据图表
- ❌ 任何形式的胡编乱造
### 📞 信息更正渠道
如发现任何信息不准确,请联系项目负责人进行更正。
---
**最后核查时间**2026-04-01
**核查人**:狗剩(WorkBuddy AI助手)
**批准人**LH
**文档状态**:✅ 已通过真实性核查,可发布
```
---
## 📚 **培训与持续改进**
### **定期培训**
- **每周一**:真实性核查流程复习(15分钟)
- **每月第一周**:新信息来源渠道培训(30分钟)
- **每季度**:案例分析与经验分享(1小时)
### **持续改进机制**
1. **问题记录**:记录每次核查发现的问题
2. **原因分析**:分析问题产生的原因
3. **流程优化**:根据分析结果优化核查流程
4. **工具改进**:改进自动化核查工具
5. **知识更新**:更新信息来源渠道矩阵
### **质量监控指标**
| 指标 | 目标值 | 监控频率 | 改进措施 |
|------|--------|----------|----------|
| **平均信源质量分** | ≥85分 | 每周 | 分析低分原因 |
| **核查时间效率** | ≤30分钟/篇 | 每日 | 优化核查流程 |
| **违规发生率** | <1% | 每月 | 加强培训 |
| **LH满意度** | ≥9/10 | 每周 | 收集反馈改进 |
---
**生效时间**2026年4月1日
**审核周期**:每月审核更新一次
**紧急联系人**:项目负责人
**核心承诺**:我们承诺以最高标准确保信息真实性,绝不妥协。