LLMWiki

定位

LLMWiki 是利用大语言模型辅助构建、整理和查询 Wiki 的知识管理方案。它关注如何把分散资料加工为可阅读、可导航、可检索且能够持续更新的知识页面;GBrain 是该方案的工程实现。

方案与实现

本文主要记录 LLMWiki 的目标、知识流程和能力模型。当前分析的具体工程实现是 garrytan/gbrain,其架构、优缺点和功能完成度记录在 GBrain 中。

期望的知识流

原始资料 -> 解析与分块 -> 主题识别 -> 页面生成/更新
         -> 引用与链接 -> 搜索或问答 -> 人工校订

方案能力

资料导入

  • 支持的格式:Markdown、PDF、Office、网页、代码仓库等。
  • 是否支持批量导入、增量同步与重复内容识别。
  • 中文文档的标题、表格、代码块和图片解析质量。

Wiki 生成与组织

  • 能否自动生成目录、主题页面、摘要和标签。
  • 能否识别概念之间的关系并建立内部链接。
  • 页面更新时,是覆盖全文还是进行可审阅的增量修改。
  • 是否保留原文引用,能否追溯生成内容的依据。

检索与问答

  • 采用全文检索、向量检索还是混合检索。
  • 回答能否返回页内定位和可靠引用。
  • 是否支持限定目录、数据源、时间范围或权限范围。

适用场景

  • 将项目文档、会议记录和技术资料整理为团队 Wiki。
  • 为代码仓库生成架构说明、模块索引和常见问题。
  • 对专题资料进行结构化梳理,形成持续演进的研究库。

风险与限制

关键风险

  • 自动生成内容可能出现事实错误或错误归并。
  • 缺少引用溯源时,Wiki 内容难以用于严肃决策。
  • 自动重写可能破坏人工编辑、页面链接或历史版本。
  • 大规模重建索引的模型费用和时间成本需要评估。

验证清单

  • 补充 LLMWiki 的原始方案说明或设计文档。
  • 明确 LLMWiki 的功能边界和核心设计原则。
  • 导入一组包含 Markdown、PDF、表格和代码的中文资料。
  • 检查目录生成、页面拆分、重复消除和内部链接质量。
  • 测试答案引用是否准确、是否能回到原始材料。
  • 测试原始资料变化后的增量更新行为。
  • 对照 GBrain 的实现逐项标记已实现、部分实现和未实现能力。

关联笔记