Files
llm_wiki/tools/experiments/wiki-generation-compare/llm-wiki-test-guide.md
T

8.0 KiB
Raw Blame History

nashsu/llm_wiki 手动测试指南

🎯 测试目标

通过手动操作 nashsu/llm_wiki 桌面应用,对比 Two-StepSingle-Step 两种模式在 Wiki 生成质量上的差异。

📁 准备工作

1. 应用位置

  • 应用路径: D:\Users\hhhh2024\AppData\Local\LLM-Wiki\LLM Wiki.exe
  • 测试文件: D:\Applications\app\kepano-obsidian-main\raw\呼吸之间_李谨伯\第一编 从身体入手.md

2. 测试输出目录

  • A 组输出:D:\Applications\app\kepano-obsidian-main\tools\experiments\wiki-generation-compare\output\llm-wiki-manual-group-a\
  • B 组输出:D:\Applications\app\kepano-obsidian-main\tools\experiments\wiki-generation-compare\output\llm-wiki-manual-group-b\

🚀 LLM Wiki 应用操作步骤

步骤 1:启动应用并创建项目

  1. 启动 LLM Wiki 应用

    双击运行:D:\Users\hhhh2024\AppData\Local\LLM-Wiki\LLM Wiki.exe
    
  2. 创建新项目

    • 点击 "Create New Project"
    • 选择项目模板:General(通用模板)
    • 项目名称:Breathing-TaoTest
    • 项目路径:D:\LLM-Wiki-Test-Project\
    • 点击 "Create"
  3. 配置 LLM API

    • 进入 "Settings"⚙️ 图标)
    • 在 "LLM Provider" 中选择:
      • OpenAI
    • 输入 API Key(已配置在环境变量中)
    • 选择模型:gpt-4o-minigpt-3.5-turbo
    • 点击 "Save"

📊 A 组测试:Two-Step 模式

步骤 2A-1:导入测试文件

  1. 点击 "Sources" 标签页
  2. 点击 "Import" 按钮
  3. 选择测试文件:
    D:\Applications\app\kepano-obsidian-main\raw\呼吸之间_李谨伯\第一编 从身体入手.md
    
  4. 观察左侧 "Activity Panel"
    • 会看到 "Analyzing..." 进度
    • 然后看到 "Generating..." 进度

步骤 2A-2:观察 Two-Step 流程

预期行为

  • Step 1: LLM 分析文件(约 30-60 秒)

    • 提取结构化信息(概念、方法、实体)
    • 识别术语关系
    • 推荐创建页面
  • Step 2: LLM 生成 Wiki 页面(约 60-120 秒)

    • 根据推荐页面生成完整 Markdown
    • 自动创建目录结构
    • 生成 Wikilink 链接

步骤 2A-3:记录 A 组结果

  1. 查看生成的 Wiki 页面

    • 点击 "Wiki" 标签页
    • 左侧会显示目录结构:
      • wiki/concepts/
      • wiki/methods/
      • wiki/entities/
    • 统计生成的页面数量
  2. 导出 A 组结果

    • 在 "Wiki" 标签页中,选择所有生成的文件
    • 复制到:D:\Applications\app\kepano-obsidian-main\tools\experiments\wiki-generation-compare\output\llm-wiki-manual-group-a\
  3. 记录元数据

    • 记录以下信息:
      • 开始时间
      • 结束时间
      • 生成页面数量
      • 是否有错误信息

🔄 B 组测试:Single-Step 模式

步骤 2B-1:创建新项目(避免干扰)

  1. 关闭当前应用
  2. 重新启动 LLM Wiki 应用
  3. 创建新项目:Breathing-TaoTest-Single
  4. 配置相同的 LLM API

步骤 2B-2:导入测试文件

  1. 点击 "Sources" 标签页
  2. 点击 "Import" 按钮
  3. 选择同一个测试文件:
    D:\Applications\app\kepano-obsidian-main\raw\呼吸之间_李谨伯\第一编 从身体入手.md
    
  4. 观察左侧 "Activity Panel"
    • 只会看到 "Generating..." 进度
    • 没有 "Analyzing..." 阶段

步骤 2B-3:观察 Single-Step 流程

预期行为

  • Single Step: LLM 直接生成 Wiki 页面(约 60-120 秒)
    • 直接从源文件提取术语
    • 边分析边生成
    • 可能生成的页面数量不同

步骤 2B-4:记录 B 组结果

  1. 查看生成的 Wiki 页面

    • 点击 "Wiki" 标签页
    • 统计生成的页面数量
    • 观察页面结构
  2. 导出 B 组结果

    • 在 "Wiki" 标签页中,选择所有生成的文件
    • 复制到:D:\Applications\app\kepano-obsidian-main\tools\experiments\wiki-generation-compare\output\llm-wiki-manual-group-b\
  3. 记录元数据

    • 记录以下信息:
      • 开始时间
      • 结束时间
      • 生成页面数量
      • 是否有错误信息

📈 手动评估方法

由于没有自动化脚本,建议进行以下评估:

1. 术语覆盖度对比

维度 A 组 B 组
生成页面数 ? 页 ? 页
常见术语是否覆盖 精气神、天人感应... 精气神、天人感应...
未覆盖的术语 ? ?

2. Frontmatter 质量检查

打开几个生成的页面,检查:

---
categories:
  - "[[LLM Wiki]]"
tags:
  - wiki
  - concept/entity/method
created: 2026-07-03
source: "[[raw/呼吸之间_李谨伯/第一编 从身体入手.md]]"
type: concept
confidence: 3
status: active
---
  • 检查页面间是否有 [[wikilink]] 链接
  • 链接是否有效
  • 是否有断链

4. 内容质量

  • 定义是否准确引用原文
  • 是否有来源标注(如 [raw:文件:行号]
  • 内容结构是否清晰

🎬 手动测试记录模板

A 组记录(Two-Step

开始时间:___________
结束时间:___________
耗时:___________ 分钟
生成页面数:___________ 页

生成的主要页面:
1. ______________
2. ______________
3. ______________

观察到的特点:
- ______________
- ______________
- ______________

遇到的问题:
- ______________
- ______________

B 组记录(Single-Step

开始时间:___________
结束时间:___________
耗时:___________ 分钟
生成页面数:___________ 页

生成的主要页面:
1. ______________
2. ______________
3. ______________

观察到的特点:
- ______________
- ______________
- ______________

遇到的问题:
- ______________
- ______________

📊 对比总结表

对比维度 A 组 B 组 结论
术语覆盖率 __% __% ? 优于
生成速度 ___ 分钟 ___ 分钟 ? 更快
内容质量 ? ? ? 更好
Frontmatter 规范性 ? ? ? 更好
Wikilink 质量 ? ? ? 更好

🔧 故障排查

应用无法启动

问题:双击 exe 文件无反应

解决方案

  1. 检查是否有杀毒软件拦截
  2. 尝试以管理员身份运行
  3. 查看 Windows 事件日志

API 调用失败

问题:显示 API 错误

解决方案

  1. 检查 API Key 是否正确
  2. 检查网络连接
  3. 检查 API 配额是否用尽
  4. 尝试使用其他模型

文件导入失败

问题:无法导入测试文件

解决方案

  1. 确保文件路径正确
  2. 检查文件编码(应为 UTF-8
  3. 尝试将文件复制到项目根目录

生成页面异常

问题:生成的页面内容为空或格式错误

解决方案

  1. 检查 Activity Panel 中的错误信息
  2. 查看 Review 标签页中的需要人工审查的内容
  3. 手动修复后重新 Ingest

🎯 关键观察点

Two-Step 模式的预期优势

  1. 分析阶段

    • 更好的术语识别
    • 结构化信息提取
    • 避免遗漏重要概念
  2. 生成阶段

    • 基于分析结果定向生成
    • 内容更加准确
    • 结构更加一致

Single-Step 模式的预期优势

  1. 效率

    • 只需一次 LLM 调用
    • 生成速度更快
    • 成本更低
  2. 简洁

    • 流程更简单
    • 适合快速迭代

📝 测试完成后

  1. 整理测试结果

    • 将 A/B 两组的记录表整理好
    • 导出生成的页面文件
    • 截图保存关键界面
  2. 生成对比报告

    • 基于测试记录填写对比总结表
    • 分析两种模式的优缺点
    • 给出推荐结论
  3. 反馈结果

    • 将测试结果反馈给我
    • 我可以帮助生成详细的对比分析报告

🤔 需要注意的问题

  1. API 成本

    • Two-Step 模式需要两次 LLM 调用
    • 单次测试成本约为 $0.05-0.15
  2. 时间成本

    • A 组预计 2-5 分钟
    • B 组预计 1-3 分钟
  3. 网络稳定

    • 确保网络连接稳定
    • 避免中断测试

祝测试顺利!如有问题,请随时反馈。