8.0 KiB
8.0 KiB
nashsu/llm_wiki 手动测试指南
🎯 测试目标
通过手动操作 nashsu/llm_wiki 桌面应用,对比 Two-Step 和 Single-Step 两种模式在 Wiki 生成质量上的差异。
📁 准备工作
1. 应用位置
- 应用路径:
D:\Users\hhhh2024\AppData\Local\LLM-Wiki\LLM Wiki.exe - 测试文件:
D:\Applications\app\kepano-obsidian-main\raw\呼吸之间_李谨伯\第一编 从身体入手.md
2. 测试输出目录
- A 组输出:
D:\Applications\app\kepano-obsidian-main\tools\experiments\wiki-generation-compare\output\llm-wiki-manual-group-a\ - B 组输出:
D:\Applications\app\kepano-obsidian-main\tools\experiments\wiki-generation-compare\output\llm-wiki-manual-group-b\
🚀 LLM Wiki 应用操作步骤
步骤 1:启动应用并创建项目
-
启动 LLM Wiki 应用
双击运行:D:\Users\hhhh2024\AppData\Local\LLM-Wiki\LLM Wiki.exe -
创建新项目
- 点击 "Create New Project"
- 选择项目模板:
General(通用模板) - 项目名称:
Breathing-TaoTest - 项目路径:
D:\LLM-Wiki-Test-Project\ - 点击 "Create"
-
配置 LLM API
- 进入 "Settings"(⚙️ 图标)
- 在 "LLM Provider" 中选择:
OpenAI
- 输入 API Key(已配置在环境变量中)
- 选择模型:
gpt-4o-mini或gpt-3.5-turbo - 点击 "Save"
📊 A 组测试:Two-Step 模式
步骤 2A-1:导入测试文件
- 点击 "Sources" 标签页
- 点击 "Import" 按钮
- 选择测试文件:
D:\Applications\app\kepano-obsidian-main\raw\呼吸之间_李谨伯\第一编 从身体入手.md - 观察左侧 "Activity Panel":
- 会看到 "Analyzing..." 进度
- 然后看到 "Generating..." 进度
步骤 2A-2:观察 Two-Step 流程
预期行为:
-
Step 1: LLM 分析文件(约 30-60 秒)
- 提取结构化信息(概念、方法、实体)
- 识别术语关系
- 推荐创建页面
-
Step 2: LLM 生成 Wiki 页面(约 60-120 秒)
- 根据推荐页面生成完整 Markdown
- 自动创建目录结构
- 生成 Wikilink 链接
步骤 2A-3:记录 A 组结果
-
查看生成的 Wiki 页面
- 点击 "Wiki" 标签页
- 左侧会显示目录结构:
wiki/concepts/wiki/methods/wiki/entities/
- 统计生成的页面数量
-
导出 A 组结果
- 在 "Wiki" 标签页中,选择所有生成的文件
- 复制到:
D:\Applications\app\kepano-obsidian-main\tools\experiments\wiki-generation-compare\output\llm-wiki-manual-group-a\
-
记录元数据
- 记录以下信息:
- 开始时间
- 结束时间
- 生成页面数量
- 是否有错误信息
- 记录以下信息:
🔄 B 组测试:Single-Step 模式
步骤 2B-1:创建新项目(避免干扰)
- 关闭当前应用
- 重新启动 LLM Wiki 应用
- 创建新项目:
Breathing-TaoTest-Single - 配置相同的 LLM API
步骤 2B-2:导入测试文件
- 点击 "Sources" 标签页
- 点击 "Import" 按钮
- 选择同一个测试文件:
D:\Applications\app\kepano-obsidian-main\raw\呼吸之间_李谨伯\第一编 从身体入手.md - 观察左侧 "Activity Panel":
- 只会看到 "Generating..." 进度
- 没有 "Analyzing..." 阶段
步骤 2B-3:观察 Single-Step 流程
预期行为:
- Single Step: LLM 直接生成 Wiki 页面(约 60-120 秒)
- 直接从源文件提取术语
- 边分析边生成
- 可能生成的页面数量不同
步骤 2B-4:记录 B 组结果
-
查看生成的 Wiki 页面
- 点击 "Wiki" 标签页
- 统计生成的页面数量
- 观察页面结构
-
导出 B 组结果
- 在 "Wiki" 标签页中,选择所有生成的文件
- 复制到:
D:\Applications\app\kepano-obsidian-main\tools\experiments\wiki-generation-compare\output\llm-wiki-manual-group-b\
-
记录元数据
- 记录以下信息:
- 开始时间
- 结束时间
- 生成页面数量
- 是否有错误信息
- 记录以下信息:
📈 手动评估方法
由于没有自动化脚本,建议进行以下评估:
1. 术语覆盖度对比
| 维度 | A 组 | B 组 |
|---|---|---|
| 生成页面数 | ? 页 | ? 页 |
| 常见术语是否覆盖 | 精气神、天人感应... | 精气神、天人感应... |
| 未覆盖的术语 | ? | ? |
2. Frontmatter 质量检查
打开几个生成的页面,检查:
---
categories:
- "[[LLM Wiki]]"
tags:
- wiki
- concept/entity/method
created: 2026-07-03
source: "[[raw/呼吸之间_李谨伯/第一编 从身体入手.md]]"
type: concept
confidence: 3
status: active
---
3. Wikilink 质量
- 检查页面间是否有
[[wikilink]]链接 - 链接是否有效
- 是否有断链
4. 内容质量
- 定义是否准确引用原文
- 是否有来源标注(如
[raw:文件:行号]) - 内容结构是否清晰
🎬 手动测试记录模板
A 组记录(Two-Step)
开始时间:___________
结束时间:___________
耗时:___________ 分钟
生成页面数:___________ 页
生成的主要页面:
1. ______________
2. ______________
3. ______________
观察到的特点:
- ______________
- ______________
- ______________
遇到的问题:
- ______________
- ______________
B 组记录(Single-Step)
开始时间:___________
结束时间:___________
耗时:___________ 分钟
生成页面数:___________ 页
生成的主要页面:
1. ______________
2. ______________
3. ______________
观察到的特点:
- ______________
- ______________
- ______________
遇到的问题:
- ______________
- ______________
📊 对比总结表
| 对比维度 | A 组 | B 组 | 结论 |
|---|---|---|---|
| 术语覆盖率 | __% | __% | ? 优于 |
| 生成速度 | ___ 分钟 | ___ 分钟 | ? 更快 |
| 内容质量 | ? | ? | ? 更好 |
| Frontmatter 规范性 | ? | ? | ? 更好 |
| Wikilink 质量 | ? | ? | ? 更好 |
🔧 故障排查
应用无法启动
问题:双击 exe 文件无反应
解决方案:
- 检查是否有杀毒软件拦截
- 尝试以管理员身份运行
- 查看 Windows 事件日志
API 调用失败
问题:显示 API 错误
解决方案:
- 检查 API Key 是否正确
- 检查网络连接
- 检查 API 配额是否用尽
- 尝试使用其他模型
文件导入失败
问题:无法导入测试文件
解决方案:
- 确保文件路径正确
- 检查文件编码(应为 UTF-8)
- 尝试将文件复制到项目根目录
生成页面异常
问题:生成的页面内容为空或格式错误
解决方案:
- 检查 Activity Panel 中的错误信息
- 查看 Review 标签页中的需要人工审查的内容
- 手动修复后重新 Ingest
🎯 关键观察点
Two-Step 模式的预期优势
-
分析阶段:
- 更好的术语识别
- 结构化信息提取
- 避免遗漏重要概念
-
生成阶段:
- 基于分析结果定向生成
- 内容更加准确
- 结构更加一致
Single-Step 模式的预期优势
-
效率:
- 只需一次 LLM 调用
- 生成速度更快
- 成本更低
-
简洁:
- 流程更简单
- 适合快速迭代
📝 测试完成后
-
整理测试结果
- 将 A/B 两组的记录表整理好
- 导出生成的页面文件
- 截图保存关键界面
-
生成对比报告
- 基于测试记录填写对比总结表
- 分析两种模式的优缺点
- 给出推荐结论
-
反馈结果
- 将测试结果反馈给我
- 我可以帮助生成详细的对比分析报告
🤔 需要注意的问题
-
API 成本:
- Two-Step 模式需要两次 LLM 调用
- 单次测试成本约为 $0.05-0.15
-
时间成本:
- A 组预计 2-5 分钟
- B 组预计 1-3 分钟
-
网络稳定:
- 确保网络连接稳定
- 避免中断测试
祝测试顺利!如有问题,请随时反馈。