diff --git a/tools/experiments/wiki-generation-compare/llm-wiki-test-guide.md b/tools/experiments/wiki-generation-compare/llm-wiki-test-guide.md new file mode 100644 index 0000000..eedfeda --- /dev/null +++ b/tools/experiments/wiki-generation-compare/llm-wiki-test-guide.md @@ -0,0 +1,352 @@ +# nashsu/llm_wiki 手动测试指南 + +## 🎯 测试目标 + +通过手动操作 nashsu/llm_wiki 桌面应用,对比 **Two-Step** 和 **Single-Step** 两种模式在 Wiki 生成质量上的差异。 + +## 📁 准备工作 + +### 1. 应用位置 +- **应用路径**: `D:\Users\hhhh2024\AppData\Local\LLM-Wiki\LLM Wiki.exe` +- **测试文件**: `D:\Applications\app\kepano-obsidian-main\raw\呼吸之间_李谨伯\第一编 从身体入手.md` + +### 2. 测试输出目录 +- A 组输出:`D:\Applications\app\kepano-obsidian-main\tools\experiments\wiki-generation-compare\output\llm-wiki-manual-group-a\` +- B 组输出:`D:\Applications\app\kepano-obsidian-main\tools\experiments\wiki-generation-compare\output\llm-wiki-manual-group-b\` + +--- + +## 🚀 LLM Wiki 应用操作步骤 + +### 步骤 1:启动应用并创建项目 + +1. **启动 LLM Wiki 应用** + ``` + 双击运行:D:\Users\hhhh2024\AppData\Local\LLM-Wiki\LLM Wiki.exe + ``` + +2. **创建新项目** + - 点击 "Create New Project" + - 选择项目模板:`General`(通用模板) + - 项目名称:`Breathing-TaoTest` + - 项目路径:`D:\LLM-Wiki-Test-Project\` + - 点击 "Create" + +3. **配置 LLM API** + - 进入 "Settings"(⚙️ 图标) + - 在 "LLM Provider" 中选择: + - `OpenAI` + - 输入 API Key(已配置在环境变量中) + - 选择模型:`gpt-4o-mini` 或 `gpt-3.5-turbo` + - 点击 "Save" + +--- + +## 📊 A 组测试:Two-Step 模式 + +### 步骤 2A-1:导入测试文件 + +1. 点击 "Sources" 标签页 +2. 点击 "Import" 按钮 +3. 选择测试文件: + ``` + D:\Applications\app\kepano-obsidian-main\raw\呼吸之间_李谨伯\第一编 从身体入手.md + ``` +4. 观察左侧 "Activity Panel": + - 会看到 "Analyzing..." 进度 + - 然后看到 "Generating..." 进度 + +### 步骤 2A-2:观察 Two-Step 流程 + +**预期行为**: +- **Step 1**: LLM 分析文件(约 30-60 秒) + - 提取结构化信息(概念、方法、实体) + - 识别术语关系 + - 推荐创建页面 + +- **Step 2**: LLM 生成 Wiki 页面(约 60-120 秒) + - 根据推荐页面生成完整 Markdown + - 自动创建目录结构 + - 生成 Wikilink 链接 + +### 步骤 2A-3:记录 A 组结果 + +1. **查看生成的 Wiki 页面** + - 点击 "Wiki" 标签页 + - 左侧会显示目录结构: + - `wiki/concepts/` + - `wiki/methods/` + - `wiki/entities/` + - 统计生成的页面数量 + +2. **导出 A 组结果** + - 在 "Wiki" 标签页中,选择所有生成的文件 + - 复制到:`D:\Applications\app\kepano-obsidian-main\tools\experiments\wiki-generation-compare\output\llm-wiki-manual-group-a\` + +3. **记录元数据** + - 记录以下信息: + - 开始时间 + - 结束时间 + - 生成页面数量 + - 是否有错误信息 + +--- + +## 🔄 B 组测试:Single-Step 模式 + +### 步骤 2B-1:创建新项目(避免干扰) + +1. 关闭当前应用 +2. 重新启动 LLM Wiki 应用 +3. 创建新项目:`Breathing-TaoTest-Single` +4. 配置相同的 LLM API + +### 步骤 2B-2:导入测试文件 + +1. 点击 "Sources" 标签页 +2. 点击 "Import" 按钮 +3. 选择同一个测试文件: + ``` + D:\Applications\app\kepano-obsidian-main\raw\呼吸之间_李谨伯\第一编 从身体入手.md + ``` +4. 观察左侧 "Activity Panel": + - 只会看到 "Generating..." 进度 + - 没有 "Analyzing..." 阶段 + +### 步骤 2B-3:观察 Single-Step 流程 + +**预期行为**: +- **Single Step**: LLM 直接生成 Wiki 页面(约 60-120 秒) + - 直接从源文件提取术语 + - 边分析边生成 + - 可能生成的页面数量不同 + +### 步骤 2B-4:记录 B 组结果 + +1. **查看生成的 Wiki 页面** + - 点击 "Wiki" 标签页 + - 统计生成的页面数量 + - 观察页面结构 + +2. **导出 B 组结果** + - 在 "Wiki" 标签页中,选择所有生成的文件 + - 复制到:`D:\Applications\app\kepano-obsidian-main\tools\experiments\wiki-generation-compare\output\llm-wiki-manual-group-b\` + +3. **记录元数据** + - 记录以下信息: + - 开始时间 + - 结束时间 + - 生成页面数量 + - 是否有错误信息 + +--- + +## 📈 手动评估方法 + +由于没有自动化脚本,建议进行以下评估: + +### 1. 术语覆盖度对比 + +| 维度 | A 组 | B 组 | +|------|------|------| +| 生成页面数 | ? 页 | ? 页 | +| 常见术语是否覆盖 | 精气神、天人感应... | 精气神、天人感应... | +| 未覆盖的术语 | ? | ? | + +### 2. Frontmatter 质量检查 + +打开几个生成的页面,检查: +```yaml +--- +categories: + - "[[LLM Wiki]]" +tags: + - wiki + - concept/entity/method +created: 2026-07-03 +source: "[[raw/呼吸之间_李谨伯/第一编 从身体入手.md]]" +type: concept +confidence: 3 +status: active +--- +``` + +### 3. Wikilink 质量 + +- 检查页面间是否有 `[[wikilink]]` 链接 +- 链接是否有效 +- 是否有断链 + +### 4. 内容质量 + +- 定义是否准确引用原文 +- 是否有来源标注(如 `[raw:文件:行号]`) +- 内容结构是否清晰 + +--- + +## 🎬 手动测试记录模板 + +### A 组记录(Two-Step) + +``` +开始时间:___________ +结束时间:___________ +耗时:___________ 分钟 +生成页面数:___________ 页 + +生成的主要页面: +1. ______________ +2. ______________ +3. ______________ + +观察到的特点: +- ______________ +- ______________ +- ______________ + +遇到的问题: +- ______________ +- ______________ +``` + +### B 组记录(Single-Step) + +``` +开始时间:___________ +结束时间:___________ +耗时:___________ 分钟 +生成页面数:___________ 页 + +生成的主要页面: +1. ______________ +2. ______________ +3. ______________ + +观察到的特点: +- ______________ +- ______________ +- ______________ + +遇到的问题: +- ______________ +- ______________ +``` + +--- + +## 📊 对比总结表 + +| 对比维度 | A 组 | B 组 | 结论 | +|---------|------|------|------| +| 术语覆盖率 | __% | __% | ? 优于 | +| 生成速度 | ___ 分钟 | ___ 分钟 | ? 更快 | +| 内容质量 | ? | ? | ? 更好 | +| Frontmatter 规范性 | ? | ? | ? 更好 | +| Wikilink 质量 | ? | ? | ? 更好 | + +--- + +## 🔧 故障排查 + +### 应用无法启动 + +**问题**:双击 exe 文件无反应 + +**解决方案**: +1. 检查是否有杀毒软件拦截 +2. 尝试以管理员身份运行 +3. 查看 Windows 事件日志 + +### API 调用失败 + +**问题**:显示 API 错误 + +**解决方案**: +1. 检查 API Key 是否正确 +2. 检查网络连接 +3. 检查 API 配额是否用尽 +4. 尝试使用其他模型 + +### 文件导入失败 + +**问题**:无法导入测试文件 + +**解决方案**: +1. 确保文件路径正确 +2. 检查文件编码(应为 UTF-8) +3. 尝试将文件复制到项目根目录 + +### 生成页面异常 + +**问题**:生成的页面内容为空或格式错误 + +**解决方案**: +1. 检查 Activity Panel 中的错误信息 +2. 查看 Review 标签页中的需要人工审查的内容 +3. 手动修复后重新 Ingest + +--- + +## 🎯 关键观察点 + +### Two-Step 模式的预期优势 + +1. **分析阶段**: + - 更好的术语识别 + - 结构化信息提取 + - 避免遗漏重要概念 + +2. **生成阶段**: + - 基于分析结果定向生成 + - 内容更加准确 + - 结构更加一致 + +### Single-Step 模式的预期优势 + +1. **效率**: + - 只需一次 LLM 调用 + - 生成速度更快 + - 成本更低 + +2. **简洁**: + - 流程更简单 + - 适合快速迭代 + +--- + +## 📝 测试完成后 + +1. **整理测试结果** + - 将 A/B 两组的记录表整理好 + - 导出生成的页面文件 + - 截图保存关键界面 + +2. **生成对比报告** + - 基于测试记录填写对比总结表 + - 分析两种模式的优缺点 + - 给出推荐结论 + +3. **反馈结果** + - 将测试结果反馈给我 + - 我可以帮助生成详细的对比分析报告 + +--- + +## 🤔 需要注意的问题 + +1. **API 成本**: + - Two-Step 模式需要两次 LLM 调用 + - 单次测试成本约为 $0.05-0.15 + +2. **时间成本**: + - A 组预计 2-5 分钟 + - B 组预计 1-3 分钟 + +3. **网络稳定**: + - 确保网络连接稳定 + - 避免中断测试 + +--- + +**祝测试顺利!如有问题,请随时反馈。** \ No newline at end of file