LLMWiki
定位
LLMWiki 是利用大语言模型辅助构建、整理和查询 Wiki 的知识管理方案。它关注如何把分散资料加工为可阅读、可导航、可检索且能够持续更新的知识页面;GBrain 是该方案的工程实现。
方案与实现
本文主要记录 LLMWiki 的目标、知识流程和能力模型。当前分析的具体工程实现是 garrytan/gbrain,其架构、优缺点和功能完成度记录在 GBrain 中。
期望的知识流
原始资料 -> 解析与分块 -> 主题识别 -> 页面生成/更新
-> 引用与链接 -> 搜索或问答 -> 人工校订方案能力
资料导入
- 支持的格式:Markdown、PDF、Office、网页、代码仓库等。
- 是否支持批量导入、增量同步与重复内容识别。
- 中文文档的标题、表格、代码块和图片解析质量。
Wiki 生成与组织
- 能否自动生成目录、主题页面、摘要和标签。
- 能否识别概念之间的关系并建立内部链接。
- 页面更新时,是覆盖全文还是进行可审阅的增量修改。
- 是否保留原文引用,能否追溯生成内容的依据。
检索与问答
- 采用全文检索、向量检索还是混合检索。
- 回答能否返回页内定位和可靠引用。
- 是否支持限定目录、数据源、时间范围或权限范围。
适用场景
- 将项目文档、会议记录和技术资料整理为团队 Wiki。
- 为代码仓库生成架构说明、模块索引和常见问题。
- 对专题资料进行结构化梳理,形成持续演进的研究库。
风险与限制
关键风险
- 自动生成内容可能出现事实错误或错误归并。
- 缺少引用溯源时,Wiki 内容难以用于严肃决策。
- 自动重写可能破坏人工编辑、页面链接或历史版本。
- 大规模重建索引的模型费用和时间成本需要评估。
验证清单
- 补充 LLMWiki 的原始方案说明或设计文档。
- 明确 LLMWiki 的功能边界和核心设计原则。
- 导入一组包含 Markdown、PDF、表格和代码的中文资料。
- 检查目录生成、页面拆分、重复消除和内部链接质量。
- 测试答案引用是否准确、是否能回到原始材料。
- 测试原始资料变化后的增量更新行为。
- 对照 GBrain 的实现逐项标记已实现、部分实现和未实现能力。