Files

355 lines
8.0 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# nashsu/llm_wiki 手动测试指南
## 🎯 测试目标
通过手动操作 nashsu/llm_wiki 桌面应用,对比 **Two-Step****Single-Step** 两种模式在 Wiki 生成质量上的差异。
## 📁 准备工作
### 1. 应用位置
- **应用路径**: `D:\Users\hhhh2024\AppData\Local\LLM-Wiki\LLM Wiki.exe`
- **测试文件**: `D:\Applications\app\kepano-obsidian-main\raw\呼吸之间_李谨伯\第一编 从身体入手.md`
### 2. 测试输出目录
- A 组输出:`D:\Applications\app\kepano-obsidian-main\tools\experiments\wiki-generation-compare\output\llm-wiki-manual-group-a\`
- B 组输出:`D:\Applications\app\kepano-obsidian-main\tools\experiments\wiki-generation-compare\output\llm-wiki-manual-group-b\`
---
## 🚀 LLM Wiki 应用操作步骤
### 步骤 1:启动应用并创建项目
1. **启动 LLM Wiki 应用**
```
双击运行:D:\Users\hhhh2024\AppData\Local\LLM-Wiki\LLM Wiki.exe
```
2. **创建新项目**
- 点击 "Create New Project"
- 选择项目模板:`General`(通用模板)
- 项目名称:`Breathing-TaoTest`
- 项目路径:`D:\LLM-Wiki-Test-Project\`
- 点击 "Create"
3. **配置 LLM API**
- 进入 "Settings"(⚙️ 图标)
- 在 "LLM Provider" 中选择:
- `OpenAI`
- 输入 API Key(已配置在环境变量中)
- 选择模型:`gpt-4o-mini``gpt-3.5-turbo`
- 点击 "Save"
---
## 📊 A 组测试:Two-Step 模式
### 步骤 2A-1:导入测试文件
1. 点击 "Sources" 标签页
2. 点击 "Import" 按钮
3. 选择测试文件:
```
D:\Applications\app\kepano-obsidian-main\raw\呼吸之间_李谨伯\第一编 从身体入手.md
```
4. 观察左侧 "Activity Panel"
- 会看到 "Analyzing…" 进度
- 然后看到 "Generating…" 进度
### 步骤 2A-2:观察 Two-Step 流程
**预期行为**
- **Step 1**: LLM 分析文件(约 30-60 秒)
- 提取结构化信息(概念、方法、实体)
- 识别术语关系
- 推荐创建页面
- **Step 2**: LLM 生成 Wiki 页面(约 60-120 秒)
- 根据推荐页面生成完整 Markdown
- 自动创建目录结构
- 生成 Wikilink 链接
### 步骤 2A-3:记录 A 组结果
1. **查看生成的 Wiki 页面**
- 点击 "Wiki" 标签页
- 左侧会显示目录结构:
- `wiki/concepts/`
- `wiki/methods/`
- `wiki/entities/`
- 统计生成的页面数量
2. **导出 A 组结果**
- 在 "Wiki" 标签页中,选择所有生成的文件
- 复制到:`D:\Applications\app\kepano-obsidian-main\tools\experiments\wiki-generation-compare\output\llm-wiki-manual-group-a\`
3. **记录元数据**
- 记录以下信息:
- 开始时间
- 结束时间
- 生成页面数量
- 是否有错误信息
---
## 🔄 B 组测试:Single-Step 模式
### 步骤 2B-1:创建新项目(避免干扰)
1. 关闭当前应用
2. 重新启动 LLM Wiki 应用
3. 创建新项目:`Breathing-TaoTest-Single`
4. 配置相同的 LLM API
### 步骤 2B-2:导入测试文件
1. 点击 "Sources" 标签页
2. 点击 "Import" 按钮
3. 选择同一个测试文件:
```
D:\Applications\app\kepano-obsidian-main\raw\呼吸之间_李谨伯\第一编 从身体入手.md
```
4. 观察左侧 "Activity Panel"
- 只会看到 "Generating…" 进度
- 没有 "Analyzing…" 阶段
### 步骤 2B-3:观察 Single-Step 流程
**预期行为**
- **Single Step**: LLM 直接生成 Wiki 页面(约 60-120 秒)
- 直接从源文件提取术语
- 边分析边生成
- 可能生成的页面数量不同
### 步骤 2B-4:记录 B 组结果
1. **查看生成的 Wiki 页面**
- 点击 "Wiki" 标签页
- 统计生成的页面数量
- 观察页面结构
2. **导出 B 组结果**
- 在 "Wiki" 标签页中,选择所有生成的文件
- 复制到:`D:\Applications\app\kepano-obsidian-main\tools\experiments\wiki-generation-compare\output\llm-wiki-manual-group-b\`
3. **记录元数据**
- 记录以下信息:
- 开始时间
- 结束时间
- 生成页面数量
- 是否有错误信息
---
## 📈 手动评估方法
由于没有自动化脚本,建议进行以下评估:
### 1. 术语覆盖度对比
| 维度 | A 组 | B 组 |
|------|------|------|
| 生成页面数 | ? 页 | ? 页 |
| 常见术语是否覆盖 | 精气神、天人感应… | 精气神、天人感应… |
| 未覆盖的术语 | ? | ? |
### 2. Frontmatter 质量检查
打开几个生成的页面,检查:
```yaml
---
categories:
- "[[LLM Wiki]]"
tags:
- wiki
- concept/entity/method
created: 2026-07-03
source: "[[raw/呼吸之间_李谨伯/第一编 从身体入手.md]]"
type: concept
confidence: 3
status: active
---
```
### 3. Wikilink 质量
- 检查页面间是否有 `[[wikilink]]` 链接
- 链接是否有效
- 是否有断链
### 4. 内容质量
- 定义是否准确引用原文
- 是否有来源标注(如 `[raw:文件:行号]`
- 内容结构是否清晰
---
## 🎬 手动测试记录模板
### A 组记录(Two-Step
```
开始时间:___________
结束时间:___________
耗时:___________ 分钟
生成页面数:___________ 页
生成的主要页面:
1. ______________
2. ______________
3. ______________
观察到的特点:
- ______________
- ______________
- ______________
遇到的问题:
- ______________
- ______________
```
### B 组记录(Single-Step
```
开始时间:___________
结束时间:___________
耗时:___________ 分钟
生成页面数:___________ 页
生成的主要页面:
1. ______________
2. ______________
3. ______________
观察到的特点:
- ______________
- ______________
- ______________
遇到的问题:
- ______________
- ______________
```
---
## 📊 对比总结表
| 对比维度 | A 组 | B 组 | 结论 |
|---------|------|------|------|
| 术语覆盖率 | __% | __% | ? 优于 |
| 生成速度 | ___ 分钟 | ___ 分钟 | ? 更快 |
| 内容质量 | ? | ? | ? 更好 |
| Frontmatter 规范性 | ? | ? | ? 更好 |
| Wikilink 质量 | ? | ? | ? 更好 |
---
## 🔧 故障排查
### 应用无法启动
**问题**:双击 exe 文件无反应
**解决方案**
1. 检查是否有杀毒软件拦截
2. 尝试以管理员身份运行
3. 查看 Windows 事件日志
### API 调用失败
**问题**:显示 API 错误
**解决方案**
1. 检查 API Key 是否正确
2. 检查网络连接
3. 检查 API 配额是否用尽
4. 尝试使用其他模型
### 文件导入失败
**问题**:无法导入测试文件
**解决方案**
1. 确保文件路径正确
2. 检查文件编码(应为 UTF-8
3. 尝试将文件复制到项目根目录
### 生成页面异常
**问题**:生成的页面内容为空或格式错误
**解决方案**
1. 检查 Activity Panel 中的错误信息
2. 查看 Review 标签页中的需要人工审查的内容
3. 手动修复后重新 Ingest
---
## 🎯 关键观察点
### Two-Step 模式的预期优势
1. **分析阶段**
- 更好的术语识别
- 结构化信息提取
- 避免遗漏重要概念
2. **生成阶段**
- 基于分析结果定向生成
- 内容更加准确
- 结构更加一致
### Single-Step 模式的预期优势
1. **效率**
- 只需一次 LLM 调用
- 生成速度更快
- 成本更低
2. **简洁**
- 流程更简单
- 适合快速迭代
---
## 📝 测试完成后
1. **整理测试结果**
- 将 A/B 两组的记录表整理好
- 导出生成的页面文件
- 截图保存关键界面
2. **生成对比报告**
- 基于测试记录填写对比总结表
- 分析两种模式的优缺点
- 给出推荐结论
3. **反馈结果**
- 将测试结果反馈给我
- 我可以帮助生成详细的对比分析报告
---
## 🤔 需要注意的问题
1. **API 成本**
- Two-Step 模式需要两次 LLM 调用
- 单次测试成本约为 $0.05-0.15
2. **时间成本**
- A 组预计 2-5 分钟
- B 组预计 1-3 分钟
3. **网络稳定**
- 确保网络连接稳定
- 避免中断测试
---
**祝测试顺利!如有问题,请随时反馈。**