大模型学习导航
概览
本文档是
大模型/目录的中心索引,用于按主题快速定位基础原理、应用开发、训练微调、部署工具链、评测选型、论文报告、教程课程和个体重构等资料。
目录统计
- 总文件数:134 个 Markdown 文件
- 一级分类:11 个编号目录 + 2 个根目录文档
- 最后整理:2026-10-02
目录结构概览
大模型/
├── 00-大模型学习导航.md
├── 链接收集.md
├── 01-基础原理/
├── 02-应用开发/
├── 03-训练与微调/
├── 04-部署与工具链/
├── 05-评测与选型/
├── 06-论文与报告/
├── 07-教程与课程/
├── 08-个体重构/
├── 09-Agent/
├── 10-新闻/
├── 11-知识管理/
└── 90-收集箱/快速入口
| 方向 | 适合场景 | 入口 |
|---|---|---|
| 基础原理 | 补齐 Token、Transformer、MOE、预训练、推理生成等概念 | [[大模型/01-基础原理/大模型基础原理总览 |
| 应用开发 | RAG、Agent、MCP、Text2SQL、提示词 | 二、应用开发 |
| 训练微调 | MLX、Unsloth、Axolotl、数据集构造 | 三、训练与微调 |
| 部署工具链 | Ollama、HuggingFace、向量数据库、本地部署 | 四、部署与工具链 |
| 评测选型 | 模型体验、AutoGen 模型测试、显卡吞吐测试 | 五、评测与选型 |
| 论文报告 | 论文路线、模型解读、行业报告 | 六、论文与报告 |
| 教程课程 | 5 分钟手把手系列、B 站学习 | 七、教程与课程 |
| 个体重构 | AI 时代的认知升级、工作流与个人系统重构 | 八、个体重构 |
| Agent 专题 | Agent 框架、选型、工作流与多智能体 | 九、Agent 专题 |
| 临时材料 | 原始剪藏、中转统计、项目备忘 | 十、收集箱 |
一、基础原理
适合人群:需要理解模型内部机制、补齐概念基础的学习者。
总览
输入表示
Transformer
训练与对齐
推理与可靠性
MOE
二、应用开发
适合人群:AI 应用开发者、Agent/RAG/MCP 系统设计者。
AutoGen
核心概念
Agent 调度
工具调用与网关
MCP
RAG
Text2SQL
提示词信息
三、训练与微调
适合人群:需要做领域模型微调、训练数据构造和本地训练验证的人。
训练方案
微调技术
微调实战
训练笔记维护建议
微调类笔记建议优先记录模型版本、数据集来源、显存/内存环境、训练参数、评估方法和失败现象,方便后续复现实验。
四、部署与工具链
适合人群:本地部署、推理服务、向量数据库和工具链维护人员。
本地部署
Ollama
HuggingFace
向量数据库
算子开发
五、评测与选型
适合人群:模型选型、性能对比、成本评估和 Agent 框架适配验证。
模型体验
模型卡片(Dataview 总对比表)
用法
卡片是选型的数据层:每张卡片的 frontmatter 记录厂商、价格、参数、上下文与约 80 项评测指标(
bench映射),下面一张表把它们转置成「列 = 模型,行 = 维度」。 导航页为保持紧凑,隐藏了「速度与成本」明细组(改HIDE_GROUPS即可放出);完整 80+ 行版本见 2026-10 四家 Flash 级模型对比。 只显示至少 2 家有数据的指标(MIN_REPORTERS),单家独有的指标存在于卡片里但不上表。
// ===== 转置对比表:列 = 模型,行 = 维度 =====
// 数据源:同目录 type: model-card 笔记的 frontmatter(顶层字段 + bench 映射)
const DIR = '"大模型/05-评测与选型/模型体验"';
const order = ["GLM-5.3-Flash", "Qwen3.8-Flash", "deepseek-flash", "Gemini 3.8 Flash"];
const rank = m => { const i = order.indexOf(m); return i === -1 ? 99 : i; };
// 只显示至少 N 家有数据的指标;改成 1 可看到全部(含单家独有指标)
const MIN_REPORTERS = 2;
// 导航页默认隐藏「速度与成本」明细,保持表格紧凑;在看板/横评页有完整版
const HIDE_GROUPS = ["速度与成本"];
const models = dv.pages(DIR).where(p => p.type === "model-card").array()
.sort((a, b) => rank(a.model) - rank(b.model));
const raw = (p, k) => {
const b = p.bench;
if (b && b[k] !== undefined && b[k] !== null) return b[k];
const v = p[k];
return (v === undefined || v === null || v === "") ? null : v;
};
const txt = (p, k, fb = "—") => {
const v = raw(p, k);
if (v === null) return fb;
return Array.isArray(v) ? v.join("、") : v;
};
const money = (p, k) => {
const v = raw(p, k);
return v === null ? "—" : (p.currency === "USD" ? "$" + v : v + " 元");
};
// [分组, 键, 显示名, 方向] 方向:1 = 越大越好,-1 = 越小越好,0 = 不标最优
const METRICS = [
// —— 跨家聚合指数 ——
["聚合指数", "aa_intelligence", "AA 智能指数 v4.3.2", 1],
["聚合指数", "eci", "Epoch ECI", 1],
["聚合指数", "vals_index", "Vals Index(旧版)", 1],
["聚合指数", "vals_index_v21", "Vals Index v2.1", 1],
["聚合指数", "gdpval_aa_v2", "GDPval-AA v2(厂商口径 Elo)", 1],
// —— Artificial Analysis 同 harness 的 10 项子评测(四家唯一完全同源可比的一套)——
["AA 同 harness", "aa_briefcase", "AA-Briefcase v1.1", 1],
["AA 同 harness", "aa_gdpval_v21", "GDPval-AA v2.1", 1],
["AA 同 harness", "aa_automationbench", "AutomationBench-AA (%)", 1],
["AA 同 harness", "aa_terminal_bench_40", "Terminal-Bench 4.0 (%)", 1],
["AA 同 harness", "aa_scicode", "SciCode (%)", 1],
["AA 同 harness", "aa_hle", "HLE (% 无工具)", 1],
["AA 同 harness", "aa_gdp_pdf", "GDP.pdf (%)", 1],
["AA 同 harness", "aa_critpt", "CritPt (%)", 1],
["AA 同 harness", "aa_omniscience", "AA-Omniscience(幻觉惩罚项)", 1],
["AA 同 harness", "aa_lcr", "AA-LCR v1.1 (%)", 1],
// —— 知识与推理(厂商自报 / 其他第三方)——
["知识与推理", "hle_tools", "HLE(厂商带工具口径)", 1],
["知识与推理", "hle_verified", "HLE-Verified(厂商)", 1],
["知识与推理", "gpqa_diamond", "GPQA Diamond", 1],
["知识与推理", "simplebench", "SimpleBench", 1],
["知识与推理", "arc_agi_1", "ARC-AGI-1", 1],
["知识与推理", "arc_agi_2", "ARC-AGI-2", 1],
["知识与推理", "arc_agi_3", "ARC-AGI-3", 1],
["知识与推理", "creative_writing", "Creative Writing (Elo)", 1],
["知识与推理", "mysterymechanism", "MysteryMechanism", 1],
["知识与推理", "frontier_math_v2", "FrontierMath v2", 1],
["知识与推理", "matharena_apex", "MathArena Apex", 1],
["知识与推理", "proofbench", "ProofBench v1.1 (Lean 4)", 1],
["知识与推理", "codeforces", "CodeForces (Elo)", 1],
// —— 编程与终端 ——
["编程与终端", "terminal_bench_21", "Terminal-Bench 2.1", 1],
["编程与终端", "terminal_bench_30", "Terminal-Bench 3.0", 1],
["编程与终端", "deepswe", "DeepSWE v1.1", 1],
["编程与终端", "swe_bench_pro", "SWE-bench Pro", 1],
["编程与终端", "swe_bench_pro_v2", "SWE-Bench Pro V2", 1],
["编程与终端", "swe_bench_multilingual", "SWE-bench Multilingual", 1],
["编程与终端", "swe_atlas", "SWE-Atlas", 1],
["编程与终端", "nl2repo", "NL2Repo-Bench", 1],
["编程与终端", "livecodebench", "LiveCodeBench v6", 1],
["编程与终端", "cursorbench_40", "CursorBench 4.0", 1],
["编程与终端", "program_bench", "ProgramBench", 1],
["编程与终端", "ioi_vals_v2", "IOI (Vals v2)", 1],
["编程与终端", "vals_code_migration", "Code Migration(Vals)", 1],
["编程与终端", "vals_vibe_code_bench", "Vibe Code Bench v1.1(Vals)", 1],
["编程与终端", "vals_terminal_bench_science", "Terminal-Bench Science(Vals)", 1],
// —— Agent 与办公 ——
["Agent 与办公", "toolathlon", "Toolathlon Verified", 1],
["Agent 与办公", "agents_last_exam", "Agents' Last Exam", 1],
["Agent 与办公", "automationbench", "AutomationBench(厂商版)", 1],
["Agent 与办公", "osworld_2", "OSWorld 2.0", 1],
["Agent 与办公", "androidworld", "AndroidWorld", 1],
["Agent 与办公", "tau3_banking", "τ³-Banking", 1],
["Agent 与办公", "tau2_banking", "τ²-Banking", 1],
["Agent 与办公", "ifbench", "IFBench(指令遵循)", 1],
["Agent 与办公", "officeqa_pro", "OfficeQA Pro", 1],
["Agent 与办公", "finance_agent_v2", "Finance Agent v2(Vals)", 1],
["Agent 与办公", "emb_excel", "EMB(Excel 建模,Vals)", 1],
["Agent 与办公", "legal_research", "Legal Research Bench(Vals)", 1],
["Agent 与办公", "hlab", "HLAB(法律 Agent,Vals)", 1],
["Agent 与办公", "vals_tax_agent", "Tax Agent Bench(Vals)", 1],
["Agent 与办公", "itbench_sre", "ITBench SRE", 1],
["Agent 与办公", "cybergym", "CyberGym", 1],
["Agent 与办公", "sec_bench_pro", "SEC-Bench Pro", 1],
["Agent 与办公", "exploitgym", "ExploitGym", 1],
["Agent 与办公", "coworkbench", "CoWorkBench(厂商自建)", 1],
["Agent 与办公", "jobbench", "JobBench", 1],
// —— 多模态与长文本 ——
["多模态与长文本", "mmmu_pro", "MMMU-Pro", 1],
["多模态与长文本", "charxiv_rq", "CharXiv RQ", 1],
["多模态与长文本", "mathvision", "MathVision", 1],
["多模态与长文本", "realworldqa", "RealWorldQA", 1],
["多模态与长文本", "babyvision", "BabyVision", 1],
["多模态与长文本", "chartography", "Chartography", 1],
["多模态与长文本", "lvbench", "LVBench(长视频)", 1],
["多模态与长文本", "mmvu", "MMVU(视频)", 1],
["多模态与长文本", "mvvbench", "MVBench(视频)", 1],
["多模态与长文本", "erqa", "ERQA(具身)", 1],
["多模态与长文本", "context_arena", "Context Arena", 1],
["多模态与长文本", "zerobench_main", "ZeroBench Main", 1],
// —— 速度与成本 ——
["速度与成本", "aa_speed_tps", "输出速度 (tok/s)", 1],
["速度与成本", "aa_ttft", "首 token 延迟 (s)", -1],
["速度与成本", "aa_time_first_answer", "首个答案 token 延迟 (s)", -1],
["速度与成本", "aa_e2e", "端到端响应 (s)", -1],
["速度与成本", "aa_time_per_task", "每任务耗时 (s)", -1],
["速度与成本", "aa_output_tokens_per_task", "每任务输出 token (k)", 0],
["速度与成本", "aa_reasoning_tokens_per_task", "每任务推理 token (k)", 0],
["速度与成本", "aa_index_output_tokens", "跑完指数总输出 (M token)", 0],
["速度与成本", "aa_input_price_usd", "输入价 ($/百万)", -1],
["速度与成本", "aa_output_price_usd", "输出价 ($/百万)", -1],
["速度与成本", "aa_cache_hit_usd", "缓存命中价 ($/百万)", -1],
["速度与成本", "aa_price_blended", "混合价 ($/百万)", -1],
["速度与成本", "aa_cost_per_task_usd", "每任务成本 ($)", -1],
["速度与成本", "aa_cost_index_total", "跑完指数总成本 ($)", -1],
["速度与成本", "aa_cache_discount_pct", "缓存折扣 (%)", 1],
];
const rows = [
["厂商", ...models.map(p => txt(p, "vendor"))],
["发布", ...models.map(p => { const v = raw(p, "release_date"); return (v && v.toFormat) ? v.toFormat("yyyy-MM-dd") : String(v ?? "—"); })],
["价格(输入 / 输出)", ...models.map(p => txt(p, "price_display"))],
["缓存命中输入", ...models.map(p => money(p, "price_cache_hit"))],
["参数(总 / 激活)", ...models.map(p => txt(p, "params_display"))],
["上下文 / 最大输出", ...models.map(p => txt(p, "context_display"))],
["输入模态", ...models.map(p => txt(p, "input_modalities"))],
["开放权重 / 许可", ...models.map(p => (p.open_weights ? "✅ 开源 · " : "❌ 闭源 · ") + txt(p, "license"))],
["本地部署", ...models.map(p => p.local_deploy === true ? "✅ 可本地" : "❌ 仅云")],
["接 Agent", ...models.map(p => p.agent_ready === true ? "✅ 可接" : "⚠️ 慎接")],
];
for (const [group, key, label, dir] of METRICS) {
if (HIDE_GROUPS.includes(group)) continue;
const vals = models.map(p => raw(p, key));
const present = vals.filter(v => v !== null);
if (present.length < MIN_REPORTERS) continue;
const best = dir === 0 ? null : (dir > 0 ? Math.max(...present) : Math.min(...present));
const cells = vals.map(v => v === null ? "—" : (v === best ? v + " ★" : String(v)));
const cov = present.length < models.length ? `(${present.length}/${models.length})` : "";
rows.push([`${group} · ${label}${cov}`, ...cells]);
}
rows.push(["定位", ...models.map(p => txt(p, "verdict"))]);
dv.table(["维度", ...models.map(p => p.file.link)], rows);已有的选型横评
性能测试
六、论文与报告
适合人群:研究路线梳理、论文阅读、行业趋势跟踪。
论文学习
- AI 学习有哪些论文是推荐的
- 从浅入深的论文学习路线
- Qwen3 模型解读
- 2025 年 LLM 年度回顾 - Simon Willison
- A Few Useful Things to Know About Machine Learning
行业报告
七、教程与课程
适合人群:快速上手、跟练实操、从零搭建 Demo。
5 分钟手把手
| 序号 | 主题 | 技术栈 | 链接 |
|---|---|---|---|
| 1 | 本地部署大模型 | Ollama + Llama3.1 + Docker + OpenWebUI | [[大模型/07-教程与课程/5分钟手把手/1. 使用Mac Book Pro本地部署大模型(Ollama+Llama3.1_8B+Docker+OpenWebUI) |
| 2 | 部署 GraphRAG | Pycharm + Ollama + LM Studio | [[大模型/07-教程与课程/5分钟手把手/2. 本地部署Graphrag(Pycharm+Ollama+LM Studio) |
| 3 | 编写 AI Agent | LangChain + Ollama | [[大模型/07-教程与课程/5分钟手把手/3. 本地编写一个AI Agent(Langchain + Ollama) |
| 4 | 微调大模型 | Colab + Unsloth | [[大模型/07-教程与课程/5分钟手把手/4. 如何微调一个大模型(Colab + Unsloth) |
| 5 | 编写 RAG 系统 | Qwen2.5-14b + LlamaIndex + Ollama | [[大模型/07-教程与课程/5分钟手把手/5. 本地编写一个RAG系统(Qwen2.5-14b+LlamaIndex + Ollama) |
| 6 | 多 Agent 对话 | Qwen2.5 + AutoGen + Ollama | [[大模型/07-教程与课程/5分钟手把手/6. 本地编写多Agent来对话写文章(Qwen2.5 + Autogen + Ollama) |
| 7 | Mac 本地微调 | MLX + Qwen2.5 | [[大模型/07-教程与课程/5分钟手把手/7. MAC本地微调大模型(MLX + Qwen2.5) |
| 8 | 浏览器自动化 | Browser Use | [[大模型/07-教程与课程/5分钟手把手/8. 本地通过Browser Use进行浏览器AI自动化操作 |
| 9 | ComfyUI 入门 | ComfyUI | [[大模型/07-教程与课程/5分钟手把手/9. ComfyUI从入门到了解~ |
B 站学习
八、个体重构
适合人群:关注 AI 时代个人能力升级、知识系统重建与工作方式变化的人。
导航
方向
- 大模型/08-个体重构/01-认知升级
- 大模型/08-个体重构/02-工作流重构
- 大模型/08-个体重构/03-知识系统与第二大脑
- 大模型/08-个体重构/04-职业与组织适配
- 大模型/08-个体重构/05-案例观察
九、Agent 专题
适合人群:希望系统理解 Agent 框架、工作流编排、多智能体协作和选型策略的人。
导航
选型与框架
- Agent 框架选型对比
- OpenAI Agents SDK
- LangGraph
- AutoGen
- Google ADK
- CrewAI
- PydanticAI
- smolagents
- LlamaIndex Agent
- Dify Agent
- OpenClaw
- Hermes
- 个人常驻智能体对比
- Agent Zero
- AutoGPT Platform
- OpenManus
- Manus
- Genspark
- Fellou
- OpenHands
- Letta
- Lindy
- Relevance AI
Agent 工具与 Skills
与现有笔记联动
十、收集箱
适合场景:临时资料、原始剪藏、中转统计、项目备忘。整理时优先判断是否应迁移到前面 01-08 的主题目录。
学习路径推荐
路径一:初学者快速入门
graph LR A[B站学习] --> B[5分钟手把手 1-3] B --> C[模型体验] C --> D[提示词信息]
时间:1-2 周
目标:了解大模型基本概念,能够本地部署和使用。
路径二:应用开发者
graph LR A[5分钟手把手 3/5/6] --> B[AutoGen] B --> C[MCP] C --> D[RAG 与向量数据库] D --> E[项目实践]
时间:1-2 个月
目标:能够开发 RAG 系统、多 Agent 应用和工具集成。
路径三:训练微调
graph LR A[数据集构造] --> B[微调技术综述] B --> C[Unsloth 或 MLX 实战] C --> D[模型评估与对比]
时间:2-4 周
目标:完成一次可复现的领域微调实验。
路径四:部署运维
graph LR A[本地部署] --> B[Ollama 性能测试] B --> C[向量数据库] C --> D[备份与打包]
时间:2-4 周
目标:能够独立部署和维护本地大模型与 RAG 基础设施。
技术栈总览
核心框架
| 框架 | 用途 | 相关笔记 |
|---|---|---|
| LangChain | AI 应用开发 | [[大模型/07-教程与课程/5分钟手把手/3. 本地编写一个AI Agent(Langchain + Ollama) |
| LlamaIndex | RAG 系统构建 | [[大模型/07-教程与课程/5分钟手把手/5. 本地编写一个RAG系统(Qwen2.5-14b+LlamaIndex + Ollama) |
| AutoGen | 多智能体系统 | [[大模型/09-Agent/AutoGen |
| MLX | Apple Silicon 本地训练 | [[大模型/03-训练与微调/模型训练/基于 MLX-LM 框架的 Qwen8 微调方案 |
主要模型
| 模型系列 | 厂商 | 关注点 | 相关笔记 |
|---|---|---|---|
| Qwen | 阿里 | 中文能力、开源、本地微调 | [[大模型/06-论文与报告/论文学习/Qwen3模型解读 |
| Gemma 4 / Qwen3.6 | Google / 阿里 | 新一代模型对比与选型 | [[大模型/05-评测与选型/模型体验/Gemma 4 与 Qwen3.6-27B 对比 |
| Flash 档(GLM / Qwen / Gemini / DeepSeek) | 智谱 / 阿里 / Google / DeepSeek | 价格、速度、Agent 可用性与本地部署 | [[大模型/05-评测与选型/模型体验/2026-10 四家 Flash 级模型对比 |
| Llama | Meta | 开源生态、本地部署 | [[大模型/07-教程与课程/5分钟手把手/1. 使用Mac Book Pro本地部署大模型(Ollama+Llama3.1_8B+Docker+OpenWebUI) |
工具生态
| 工具 | 用途 | 相关笔记 |
|---|---|---|
| Ollama | 本地模型运行 | [[大模型/04-部署与工具链/Ollama/ollama性能测试 |
| Docker | 容器化部署 | [[大模型/07-教程与课程/5分钟手把手/1. 使用Mac Book Pro本地部署大模型(Ollama+Llama3.1_8B+Docker+OpenWebUI) |
| Colab | 云端训练 | [[大模型/07-教程与课程/5分钟手把手/4. 如何微调一个大模型(Colab + Unsloth) |
| LM Studio | 本地模型管理 | [[大模型/07-教程与课程/5分钟手把手/2. 本地部署Graphrag(Pycharm+Ollama+LM Studio) |
| Qdrant | 向量数据库 | [[大模型/04-部署与工具链/向量数据库/QDrant的几种使用方式 |
热点技术关注
当前重点
- Agent 框架演进:AutoGen / LangGraph / MCP 等迭代很快,入口见 Agent 导航。
- MCP 协议:统一模型与外部工具、资源、Prompt 的连接方式,适合和 Agent 应用结合。
- Qwen 系列:中文、开源、本地部署和微调资料较多,是当前目录中的重点模型线索。
- 本地训练与推理:MLX、Ollama、Unsloth、vLLM、向量数据库构成实践主线。
维护建议
- 新增实践笔记优先放到
02-应用开发/、03-训练与微调/、04-部署与工具链/或05-评测与选型/。 - 临时剪藏先放到
90-收集箱/,二次整理后迁移到对应主题目录。 - 长文教程建议补充“环境版本、关键步骤、常见问题、参考资料”,便于后续复现。
- 模型测试笔记建议统一记录模型名称、日期、API 供应商、价格、上下文长度、工具调用能力和主观结论。
- 单个模型的选型资料优先写成
type: model-card卡片(见 五、评测与选型),多模型横评写成type: model-comparison笔记,这样导航和横评页的 Dataview 表会自动收录。
更新日志
| 日期 | 更新内容 |
|---|---|
| 2026-10-02 | 新增 2026-10 四家 Flash 级模型对比 与 4 张 model-card 模型卡片(GLM-5.3-Flash、Qwen3.8-Flash、deepseek-flash、Gemini 3.8 Flash);「模型体验」小节加入转置对比表(列 = 模型、行 = 维度)。2026-10-02 补充:四张卡片的 bench 映射扩充到 约 80 项指标(AA 同 harness 10 项子评测、知识与推理、编程与终端、Agent 与办公、多模态与长文本、速度与成本),横评表自动收录 |
| 2026-10-01 | 新增「算子开发」分类与 TileLang 笔记;清理 17 篇过期笔记并修复断链、更新统计 |
| 2026-06-06 | 按当前编号目录重建导航,修正旧路径链接和统计信息 |
| 2025-12-27 | 创建导航索引文件 |
相关资源
使用提示
需要新增资料时,优先从本页选择归档方向;如果还不确定分类,先放入 收集箱中转站,后续再整理。