大模型学习导航

概览

本文档是 大模型/ 目录的中心索引,用于按主题快速定位基础原理、应用开发、训练微调、部署工具链、评测选型、论文报告、教程课程和个体重构等资料。

目录统计

  • 总文件数:134 个 Markdown 文件
  • 一级分类:11 个编号目录 + 2 个根目录文档
  • 最后整理:2026-10-02

目录结构概览

大模型/
├── 00-大模型学习导航.md
├── 链接收集.md
├── 01-基础原理/
├── 02-应用开发/
├── 03-训练与微调/
├── 04-部署与工具链/
├── 05-评测与选型/
├── 06-论文与报告/
├── 07-教程与课程/
├── 08-个体重构/
├── 09-Agent/
├── 10-新闻/
├── 11-知识管理/
└── 90-收集箱/

快速入口

方向适合场景入口
基础原理补齐 Token、Transformer、MOE、预训练、推理生成等概念[[大模型/01-基础原理/大模型基础原理总览
应用开发RAG、Agent、MCP、Text2SQL、提示词二、应用开发
训练微调MLX、Unsloth、Axolotl、数据集构造三、训练与微调
部署工具链Ollama、HuggingFace、向量数据库、本地部署四、部署与工具链
评测选型模型体验、AutoGen 模型测试、显卡吞吐测试五、评测与选型
论文报告论文路线、模型解读、行业报告六、论文与报告
教程课程5 分钟手把手系列、B 站学习七、教程与课程
个体重构AI 时代的认知升级、工作流与个人系统重构八、个体重构
Agent 专题Agent 框架、选型、工作流与多智能体九、Agent 专题
临时材料原始剪藏、中转统计、项目备忘十、收集箱

一、基础原理

适合人群:需要理解模型内部机制、补齐概念基础的学习者。

总览

输入表示

Transformer

训练与对齐

推理与可靠性

MOE


二、应用开发

适合人群:AI 应用开发者、Agent/RAG/MCP 系统设计者。

AutoGen

核心概念

Agent 调度

工具调用与网关

MCP

RAG

Text2SQL

提示词信息


三、训练与微调

适合人群:需要做领域模型微调、训练数据构造和本地训练验证的人。

训练方案

微调技术

微调实战

训练笔记维护建议

微调类笔记建议优先记录模型版本、数据集来源、显存/内存环境、训练参数、评估方法和失败现象,方便后续复现实验。


四、部署与工具链

适合人群:本地部署、推理服务、向量数据库和工具链维护人员。

本地部署

Ollama

HuggingFace

向量数据库

算子开发


五、评测与选型

适合人群:模型选型、性能对比、成本评估和 Agent 框架适配验证。

模型体验

模型卡片(Dataview 总对比表)

用法

卡片是选型的数据层:每张卡片的 frontmatter 记录厂商、价格、参数、上下文与约 80 项评测指标(bench 映射),下面一张表把它们转置成「列 = 模型,行 = 维度」。 导航页为保持紧凑,隐藏了「速度与成本」明细组(改 HIDE_GROUPS 即可放出);完整 80+ 行版本见 2026-10 四家 Flash 级模型对比。 只显示至少 2 家有数据的指标(MIN_REPORTERS),单家独有的指标存在于卡片里但不上表。

// ===== 转置对比表:列 = 模型,行 = 维度 =====
// 数据源:同目录 type: model-card 笔记的 frontmatter(顶层字段 + bench 映射)
const DIR = '"大模型/05-评测与选型/模型体验"';
const order = ["GLM-5.3-Flash", "Qwen3.8-Flash", "deepseek-flash", "Gemini 3.8 Flash"];
const rank = m => { const i = order.indexOf(m); return i === -1 ? 99 : i; };
// 只显示至少 N 家有数据的指标;改成 1 可看到全部(含单家独有指标)
const MIN_REPORTERS = 2;
// 导航页默认隐藏「速度与成本」明细,保持表格紧凑;在看板/横评页有完整版
const HIDE_GROUPS = ["速度与成本"];
 
const models = dv.pages(DIR).where(p => p.type === "model-card").array()
  .sort((a, b) => rank(a.model) - rank(b.model));
 
const raw = (p, k) => {
  const b = p.bench;
  if (b && b[k] !== undefined && b[k] !== null) return b[k];
  const v = p[k];
  return (v === undefined || v === null || v === "") ? null : v;
};
const txt = (p, k, fb = "—") => {
  const v = raw(p, k);
  if (v === null) return fb;
  return Array.isArray(v) ? v.join("、") : v;
};
const money = (p, k) => {
  const v = raw(p, k);
  return v === null ? "—" : (p.currency === "USD" ? "$" + v : v + " 元");
};
 
// [分组, 键, 显示名, 方向]  方向:1 = 越大越好,-1 = 越小越好,0 = 不标最优
const METRICS = [
  // —— 跨家聚合指数 ——
  ["聚合指数", "aa_intelligence", "AA 智能指数 v4.3.2", 1],
  ["聚合指数", "eci", "Epoch ECI", 1],
  ["聚合指数", "vals_index", "Vals Index(旧版)", 1],
  ["聚合指数", "vals_index_v21", "Vals Index v2.1", 1],
  ["聚合指数", "gdpval_aa_v2", "GDPval-AA v2(厂商口径 Elo)", 1],
 
  // —— Artificial Analysis 同 harness 的 10 项子评测(四家唯一完全同源可比的一套)——
  ["AA 同 harness", "aa_briefcase", "AA-Briefcase v1.1", 1],
  ["AA 同 harness", "aa_gdpval_v21", "GDPval-AA v2.1", 1],
  ["AA 同 harness", "aa_automationbench", "AutomationBench-AA (%)", 1],
  ["AA 同 harness", "aa_terminal_bench_40", "Terminal-Bench 4.0 (%)", 1],
  ["AA 同 harness", "aa_scicode", "SciCode (%)", 1],
  ["AA 同 harness", "aa_hle", "HLE (% 无工具)", 1],
  ["AA 同 harness", "aa_gdp_pdf", "GDP.pdf (%)", 1],
  ["AA 同 harness", "aa_critpt", "CritPt (%)", 1],
  ["AA 同 harness", "aa_omniscience", "AA-Omniscience(幻觉惩罚项)", 1],
  ["AA 同 harness", "aa_lcr", "AA-LCR v1.1 (%)", 1],
 
  // —— 知识与推理(厂商自报 / 其他第三方)——
  ["知识与推理", "hle_tools", "HLE(厂商带工具口径)", 1],
  ["知识与推理", "hle_verified", "HLE-Verified(厂商)", 1],
  ["知识与推理", "gpqa_diamond", "GPQA Diamond", 1],
  ["知识与推理", "simplebench", "SimpleBench", 1],
  ["知识与推理", "arc_agi_1", "ARC-AGI-1", 1],
  ["知识与推理", "arc_agi_2", "ARC-AGI-2", 1],
  ["知识与推理", "arc_agi_3", "ARC-AGI-3", 1],
  ["知识与推理", "creative_writing", "Creative Writing (Elo)", 1],
  ["知识与推理", "mysterymechanism", "MysteryMechanism", 1],
  ["知识与推理", "frontier_math_v2", "FrontierMath v2", 1],
  ["知识与推理", "matharena_apex", "MathArena Apex", 1],
  ["知识与推理", "proofbench", "ProofBench v1.1 (Lean 4)", 1],
  ["知识与推理", "codeforces", "CodeForces (Elo)", 1],
 
  // —— 编程与终端 ——
  ["编程与终端", "terminal_bench_21", "Terminal-Bench 2.1", 1],
  ["编程与终端", "terminal_bench_30", "Terminal-Bench 3.0", 1],
  ["编程与终端", "deepswe", "DeepSWE v1.1", 1],
  ["编程与终端", "swe_bench_pro", "SWE-bench Pro", 1],
  ["编程与终端", "swe_bench_pro_v2", "SWE-Bench Pro V2", 1],
  ["编程与终端", "swe_bench_multilingual", "SWE-bench Multilingual", 1],
  ["编程与终端", "swe_atlas", "SWE-Atlas", 1],
  ["编程与终端", "nl2repo", "NL2Repo-Bench", 1],
  ["编程与终端", "livecodebench", "LiveCodeBench v6", 1],
  ["编程与终端", "cursorbench_40", "CursorBench 4.0", 1],
  ["编程与终端", "program_bench", "ProgramBench", 1],
  ["编程与终端", "ioi_vals_v2", "IOI (Vals v2)", 1],
  ["编程与终端", "vals_code_migration", "Code Migration(Vals)", 1],
  ["编程与终端", "vals_vibe_code_bench", "Vibe Code Bench v1.1(Vals)", 1],
  ["编程与终端", "vals_terminal_bench_science", "Terminal-Bench Science(Vals)", 1],
 
  // —— Agent 与办公 ——
  ["Agent 与办公", "toolathlon", "Toolathlon Verified", 1],
  ["Agent 与办公", "agents_last_exam", "Agents' Last Exam", 1],
  ["Agent 与办公", "automationbench", "AutomationBench(厂商版)", 1],
  ["Agent 与办公", "osworld_2", "OSWorld 2.0", 1],
  ["Agent 与办公", "androidworld", "AndroidWorld", 1],
  ["Agent 与办公", "tau3_banking", "τ³-Banking", 1],
  ["Agent 与办公", "tau2_banking", "τ²-Banking", 1],
  ["Agent 与办公", "ifbench", "IFBench(指令遵循)", 1],
  ["Agent 与办公", "officeqa_pro", "OfficeQA Pro", 1],
  ["Agent 与办公", "finance_agent_v2", "Finance Agent v2(Vals)", 1],
  ["Agent 与办公", "emb_excel", "EMB(Excel 建模,Vals)", 1],
  ["Agent 与办公", "legal_research", "Legal Research Bench(Vals)", 1],
  ["Agent 与办公", "hlab", "HLAB(法律 Agent,Vals)", 1],
  ["Agent 与办公", "vals_tax_agent", "Tax Agent Bench(Vals)", 1],
  ["Agent 与办公", "itbench_sre", "ITBench SRE", 1],
  ["Agent 与办公", "cybergym", "CyberGym", 1],
  ["Agent 与办公", "sec_bench_pro", "SEC-Bench Pro", 1],
  ["Agent 与办公", "exploitgym", "ExploitGym", 1],
  ["Agent 与办公", "coworkbench", "CoWorkBench(厂商自建)", 1],
  ["Agent 与办公", "jobbench", "JobBench", 1],
 
  // —— 多模态与长文本 ——
  ["多模态与长文本", "mmmu_pro", "MMMU-Pro", 1],
  ["多模态与长文本", "charxiv_rq", "CharXiv RQ", 1],
  ["多模态与长文本", "mathvision", "MathVision", 1],
  ["多模态与长文本", "realworldqa", "RealWorldQA", 1],
  ["多模态与长文本", "babyvision", "BabyVision", 1],
  ["多模态与长文本", "chartography", "Chartography", 1],
  ["多模态与长文本", "lvbench", "LVBench(长视频)", 1],
  ["多模态与长文本", "mmvu", "MMVU(视频)", 1],
  ["多模态与长文本", "mvvbench", "MVBench(视频)", 1],
  ["多模态与长文本", "erqa", "ERQA(具身)", 1],
  ["多模态与长文本", "context_arena", "Context Arena", 1],
  ["多模态与长文本", "zerobench_main", "ZeroBench Main", 1],
 
  // —— 速度与成本 ——
  ["速度与成本", "aa_speed_tps", "输出速度 (tok/s)", 1],
  ["速度与成本", "aa_ttft", "首 token 延迟 (s)", -1],
  ["速度与成本", "aa_time_first_answer", "首个答案 token 延迟 (s)", -1],
  ["速度与成本", "aa_e2e", "端到端响应 (s)", -1],
  ["速度与成本", "aa_time_per_task", "每任务耗时 (s)", -1],
  ["速度与成本", "aa_output_tokens_per_task", "每任务输出 token (k)", 0],
  ["速度与成本", "aa_reasoning_tokens_per_task", "每任务推理 token (k)", 0],
  ["速度与成本", "aa_index_output_tokens", "跑完指数总输出 (M token)", 0],
  ["速度与成本", "aa_input_price_usd", "输入价 ($/百万)", -1],
  ["速度与成本", "aa_output_price_usd", "输出价 ($/百万)", -1],
  ["速度与成本", "aa_cache_hit_usd", "缓存命中价 ($/百万)", -1],
  ["速度与成本", "aa_price_blended", "混合价 ($/百万)", -1],
  ["速度与成本", "aa_cost_per_task_usd", "每任务成本 ($)", -1],
  ["速度与成本", "aa_cost_index_total", "跑完指数总成本 ($)", -1],
  ["速度与成本", "aa_cache_discount_pct", "缓存折扣 (%)", 1],
];
 
const rows = [
  ["厂商", ...models.map(p => txt(p, "vendor"))],
  ["发布", ...models.map(p => { const v = raw(p, "release_date"); return (v && v.toFormat) ? v.toFormat("yyyy-MM-dd") : String(v ?? "—"); })],
  ["价格(输入 / 输出)", ...models.map(p => txt(p, "price_display"))],
  ["缓存命中输入", ...models.map(p => money(p, "price_cache_hit"))],
  ["参数(总 / 激活)", ...models.map(p => txt(p, "params_display"))],
  ["上下文 / 最大输出", ...models.map(p => txt(p, "context_display"))],
  ["输入模态", ...models.map(p => txt(p, "input_modalities"))],
  ["开放权重 / 许可", ...models.map(p => (p.open_weights ? "✅ 开源 · " : "❌ 闭源 · ") + txt(p, "license"))],
  ["本地部署", ...models.map(p => p.local_deploy === true ? "✅ 可本地" : "❌ 仅云")],
  ["接 Agent", ...models.map(p => p.agent_ready === true ? "✅ 可接" : "⚠️ 慎接")],
];
 
for (const [group, key, label, dir] of METRICS) {
  if (HIDE_GROUPS.includes(group)) continue;
  const vals = models.map(p => raw(p, key));
  const present = vals.filter(v => v !== null);
  if (present.length < MIN_REPORTERS) continue;
  const best = dir === 0 ? null : (dir > 0 ? Math.max(...present) : Math.min(...present));
  const cells = vals.map(v => v === null ? "—" : (v === best ? v + " ★" : String(v)));
  const cov = present.length < models.length ? `(${present.length}/${models.length})` : "";
  rows.push([`${group} · ${label}${cov}`, ...cells]);
}
 
rows.push(["定位", ...models.map(p => txt(p, "verdict"))]);
 
dv.table(["维度", ...models.map(p => p.file.link)], rows);

已有的选型横评

性能测试


六、论文与报告

适合人群:研究路线梳理、论文阅读、行业趋势跟踪。

论文学习

行业报告


七、教程与课程

适合人群:快速上手、跟练实操、从零搭建 Demo。

5 分钟手把手

序号主题技术栈链接
1本地部署大模型Ollama + Llama3.1 + Docker + OpenWebUI[[大模型/07-教程与课程/5分钟手把手/1. 使用Mac Book Pro本地部署大模型(Ollama+Llama3.1_8B+Docker+OpenWebUI)
2部署 GraphRAGPycharm + Ollama + LM Studio[[大模型/07-教程与课程/5分钟手把手/2. 本地部署Graphrag(Pycharm+Ollama+LM Studio)
3编写 AI AgentLangChain + Ollama[[大模型/07-教程与课程/5分钟手把手/3. 本地编写一个AI Agent(Langchain + Ollama)
4微调大模型Colab + Unsloth[[大模型/07-教程与课程/5分钟手把手/4. 如何微调一个大模型(Colab + Unsloth)
5编写 RAG 系统Qwen2.5-14b + LlamaIndex + Ollama[[大模型/07-教程与课程/5分钟手把手/5. 本地编写一个RAG系统(Qwen2.5-14b+LlamaIndex + Ollama)
6多 Agent 对话Qwen2.5 + AutoGen + Ollama[[大模型/07-教程与课程/5分钟手把手/6. 本地编写多Agent来对话写文章(Qwen2.5 + Autogen + Ollama)
7Mac 本地微调MLX + Qwen2.5[[大模型/07-教程与课程/5分钟手把手/7. MAC本地微调大模型(MLX + Qwen2.5)
8浏览器自动化Browser Use[[大模型/07-教程与课程/5分钟手把手/8. 本地通过Browser Use进行浏览器AI自动化操作
9ComfyUI 入门ComfyUI[[大模型/07-教程与课程/5分钟手把手/9. ComfyUI从入门到了解~

B 站学习


八、个体重构

适合人群:关注 AI 时代个人能力升级、知识系统重建与工作方式变化的人。

导航

方向


九、Agent 专题

适合人群:希望系统理解 Agent 框架、工作流编排、多智能体协作和选型策略的人。

导航

选型与框架

Agent 工具与 Skills

与现有笔记联动


十、收集箱

适合场景:临时资料、原始剪藏、中转统计、项目备忘。整理时优先判断是否应迁移到前面 01-08 的主题目录。


学习路径推荐

路径一:初学者快速入门

graph LR
    A[B站学习] --> B[5分钟手把手 1-3]
    B --> C[模型体验]
    C --> D[提示词信息]

时间:1-2 周
目标:了解大模型基本概念,能够本地部署和使用。

路径二:应用开发者

graph LR
    A[5分钟手把手 3/5/6] --> B[AutoGen]
    B --> C[MCP]
    C --> D[RAG 与向量数据库]
    D --> E[项目实践]

时间:1-2 个月
目标:能够开发 RAG 系统、多 Agent 应用和工具集成。

路径三:训练微调

graph LR
    A[数据集构造] --> B[微调技术综述]
    B --> C[Unsloth 或 MLX 实战]
    C --> D[模型评估与对比]

时间:2-4 周
目标:完成一次可复现的领域微调实验。

路径四:部署运维

graph LR
    A[本地部署] --> B[Ollama 性能测试]
    B --> C[向量数据库]
    C --> D[备份与打包]

时间:2-4 周
目标:能够独立部署和维护本地大模型与 RAG 基础设施。


技术栈总览

核心框架

框架用途相关笔记
LangChainAI 应用开发[[大模型/07-教程与课程/5分钟手把手/3. 本地编写一个AI Agent(Langchain + Ollama)
LlamaIndexRAG 系统构建[[大模型/07-教程与课程/5分钟手把手/5. 本地编写一个RAG系统(Qwen2.5-14b+LlamaIndex + Ollama)
AutoGen多智能体系统[[大模型/09-Agent/AutoGen
MLXApple Silicon 本地训练[[大模型/03-训练与微调/模型训练/基于 MLX-LM 框架的 Qwen8 微调方案

主要模型

模型系列厂商关注点相关笔记
Qwen阿里中文能力、开源、本地微调[[大模型/06-论文与报告/论文学习/Qwen3模型解读
Gemma 4 / Qwen3.6Google / 阿里新一代模型对比与选型[[大模型/05-评测与选型/模型体验/Gemma 4 与 Qwen3.6-27B 对比
Flash 档(GLM / Qwen / Gemini / DeepSeek)智谱 / 阿里 / Google / DeepSeek价格、速度、Agent 可用性与本地部署[[大模型/05-评测与选型/模型体验/2026-10 四家 Flash 级模型对比
LlamaMeta开源生态、本地部署[[大模型/07-教程与课程/5分钟手把手/1. 使用Mac Book Pro本地部署大模型(Ollama+Llama3.1_8B+Docker+OpenWebUI)

工具生态

工具用途相关笔记
Ollama本地模型运行[[大模型/04-部署与工具链/Ollama/ollama性能测试
Docker容器化部署[[大模型/07-教程与课程/5分钟手把手/1. 使用Mac Book Pro本地部署大模型(Ollama+Llama3.1_8B+Docker+OpenWebUI)
Colab云端训练[[大模型/07-教程与课程/5分钟手把手/4. 如何微调一个大模型(Colab + Unsloth)
LM Studio本地模型管理[[大模型/07-教程与课程/5分钟手把手/2. 本地部署Graphrag(Pycharm+Ollama+LM Studio)
Qdrant向量数据库[[大模型/04-部署与工具链/向量数据库/QDrant的几种使用方式

热点技术关注

当前重点

  1. Agent 框架演进:AutoGen / LangGraph / MCP 等迭代很快,入口见 Agent 导航。
  2. MCP 协议:统一模型与外部工具、资源、Prompt 的连接方式,适合和 Agent 应用结合。
  3. Qwen 系列:中文、开源、本地部署和微调资料较多,是当前目录中的重点模型线索。
  4. 本地训练与推理:MLX、Ollama、Unsloth、vLLM、向量数据库构成实践主线。

维护建议

  • 新增实践笔记优先放到 02-应用开发/、03-训练与微调/、04-部署与工具链/ 或 05-评测与选型/。
  • 临时剪藏先放到 90-收集箱/,二次整理后迁移到对应主题目录。
  • 长文教程建议补充“环境版本、关键步骤、常见问题、参考资料”,便于后续复现。
  • 模型测试笔记建议统一记录模型名称、日期、API 供应商、价格、上下文长度、工具调用能力和主观结论。
  • 单个模型的选型资料优先写成 type: model-card 卡片(见 五、评测与选型),多模型横评写成 type: model-comparison 笔记,这样导航和横评页的 Dataview 表会自动收录。

更新日志

日期更新内容
2026-10-02新增 2026-10 四家 Flash 级模型对比 与 4 张 model-card 模型卡片(GLM-5.3-Flash、Qwen3.8-Flash、deepseek-flash、Gemini 3.8 Flash);「模型体验」小节加入转置对比表(列 = 模型、行 = 维度)。2026-10-02 补充:四张卡片的 bench 映射扩充到 约 80 项指标(AA 同 harness 10 项子评测、知识与推理、编程与终端、Agent 与办公、多模态与长文本、速度与成本),横评表自动收录
2026-10-01新增「算子开发」分类与 TileLang 笔记;清理 17 篇过期笔记并修复断链、更新统计
2026-06-06按当前编号目录重建导航,修正旧路径链接和统计信息
2025-12-27创建导航索引文件

相关资源

使用提示

需要新增资料时,优先从本页选择归档方向;如果还不确定分类,先放入 收集箱中转站,后续再整理。