2026-10 四家 Flash 级模型对比
结论
四家「Flash 档」最新一代已经挤在同一个智能区间(AA 指数 39–42),真正的差异不在分数,而在单位成本、输出速度、工程完整度和 Agent 兼容性。
- 最便宜:GLM-5.3-Flash 与 Qwen3.8-Flash 并列(0.8 元/百万输入),Qwen 输出略低(2.7 对 2.8 元)。
- 最快:Gemini 3.8 Flash(245 tok/s)与 deepseek-flash(209 tok/s),是国产两个 Flash 的 4–5 倍。
- 最省缓存:deepseek-flash 缓存命中 0.02–0.04 元,折扣 98%。
- 每任务最省:GLM-5.3-Flash(1.24),差约 5 倍。
- 最大的两个坑:Gemini 的 3.75 是引导价,2027-01-01 翻倍;Qwen3.8-Flash 社区实测 Agent 任务卡死、
tool_choice=required不履行。
数据口径说明(重要,决定这张表能不能横着读)
能横着读的唯一一档是「AA 同 harness」那 10 行。 它们来自 Artificial Analysis Intelligence Index v4.3.2 的同一套子评测,四家齐全、档位统一(GLM / Gemini 取 high,DeepSeek 取 max,Qwen 为其开放权重版实测值),是全表可比性最高的一组。
其余行分三类,不要混读:
- 口径随厂商而变:
HLE(厂商带工具)只有 GLM 55.3 与 DeepSeek 63.9 有值,与 AA 行的 HLE 48/40/39/38(无工具)不是一回事;Terminal-Bench 2.1用 Claude Code / mini-SWE 等不同 scaffold;Terminal-Bench 2.1 / 3.0 / 4.0三个版本之间也不可跨版本比较。- 厂商自建基准:
CoWorkBench、JobBench、RecreationBench、ClawEval-MM由 Qwen 自建,跨厂商可比性弱。- 第三方独立:Vals AI 那一组(
Finance Agent v2、EMB、Legal Research、HLAB、Tax Agent、Code Migration、Vibe Code Bench、Terminal-Bench Science)以及 ARC Prize 的 ARC-AGI 系列,是厂商无法挑选对照的,可信度较高。三个已知的数值陷阱:
- AA 指数存在版本断层:Gemini 3.8 Flash 发布期广为引用的 59 是旧版指数,当前 v4.3.2 为 41;GLM 同理(旧版 57 → 现值 42)。混用版本会差出 15 分以上。
- 同一指标多处冲突:Gemini 的 τ³-Banking 官方 38.1% vs AA 45%;GDP.pdf 官方 35.0% vs AA 21%;GLM 的 GPQA Diamond 90.15 在 regolo.ai 被标为「未公布」;Vals Index 在 Vals 官网为 53.11% 而 DataLearner 记 47.22%。
- 厂商自报 vs 独立复现的落差:GLM 的 DeepSWE 官方 63.4、社区复现 58.4;LiveCodeBench 裸代码生成社区仅复现 28.0%,说明其优势高度依赖 agent harness,不等于单次代码生成强。
表中行名后的「(n/4)」表示有几家公布了该指标,
★标出该行最优值(越低越好的行按最小值标)。
总对比表
单一数据源
全表由 模型卡片 的 frontmatter 自动生成:一列一个模型,一行一个对比维度。改卡片即改表,不需要维护第二张表。 跨币种比较看
price_*_usd_equiv(表内按各厂商原始币种显示)。
// ===== 转置对比表:列 = 模型,行 = 维度 =====
// 数据源:同目录 type: model-card 笔记的 frontmatter(顶层字段 + bench 映射)
const DIR = '"大模型/05-评测与选型/模型体验"';
const order = ["GLM-5.3-Flash", "Qwen3.8-Flash", "deepseek-flash", "Gemini 3.8 Flash"];
const rank = m => { const i = order.indexOf(m); return i === -1 ? 99 : i; };
// 只显示至少 N 家有数据的指标;改成 1 可看到全部(含单家独有指标)
const MIN_REPORTERS = 2;
const models = dv.pages(DIR).where(p => p.type === "model-card").array()
.sort((a, b) => rank(a.model) - rank(b.model));
const raw = (p, k) => {
const b = p.bench;
if (b && b[k] !== undefined && b[k] !== null) return b[k];
const v = p[k];
return (v === undefined || v === null || v === "") ? null : v;
};
const txt = (p, k, fb = "—") => {
const v = raw(p, k);
if (v === null) return fb;
return Array.isArray(v) ? v.join("、") : v;
};
const money = (p, k) => {
const v = raw(p, k);
return v === null ? "—" : (p.currency === "USD" ? "$" + v : v + " 元");
};
// [分组, 键, 显示名, 方向] 方向:1 = 越大越好,-1 = 越小越好,0 = 不标最优
// 未收录该指标的模型显示「—」;只有 1 家有数据的指标不显示(见 MIN_REPORTERS)
const METRICS = [
// —— 跨家聚合指数 ——
["聚合指数", "aa_intelligence", "AA 智能指数 v4.3.2", 1],
["聚合指数", "eci", "Epoch ECI", 1],
["聚合指数", "vals_index", "Vals Index(旧版)", 1],
["聚合指数", "vals_index_v21", "Vals Index v2.1", 1],
["聚合指数", "gdpval_aa_v2", "GDPval-AA v2(厂商口径 Elo)", 1],
// —— Artificial Analysis 同 harness 的 10 项子评测(四家唯一完全同源可比的一套)——
["AA 同 harness", "aa_briefcase", "AA-Briefcase v1.1", 1],
["AA 同 harness", "aa_gdpval_v21", "GDPval-AA v2.1", 1],
["AA 同 harness", "aa_automationbench", "AutomationBench-AA (%)", 1],
["AA 同 harness", "aa_terminal_bench_40", "Terminal-Bench 4.0 (%)", 1],
["AA 同 harness", "aa_scicode", "SciCode (%)", 1],
["AA 同 harness", "aa_hle", "HLE (% 无工具)", 1],
["AA 同 harness", "aa_gdp_pdf", "GDP.pdf (%)", 1],
["AA 同 harness", "aa_critpt", "CritPt (%)", 1],
["AA 同 harness", "aa_omniscience", "AA-Omniscience(幻觉惩罚项)", 1],
["AA 同 harness", "aa_lcr", "AA-LCR v1.1 (%)", 1],
// —— 知识与推理(厂商自报 / 其他第三方)——
["知识与推理", "hle_tools", "HLE(厂商带工具口径)", 1],
["知识与推理", "hle_verified", "HLE-Verified(厂商)", 1],
["知识与推理", "gpqa_diamond", "GPQA Diamond", 1],
["知识与推理", "simplebench", "SimpleBench", 1],
["知识与推理", "arc_agi_1", "ARC-AGI-1", 1],
["知识与推理", "arc_agi_2", "ARC-AGI-2", 1],
["知识与推理", "arc_agi_3", "ARC-AGI-3", 1],
["知识与推理", "creative_writing", "Creative Writing (Elo)", 1],
["知识与推理", "mysterymechanism", "MysteryMechanism", 1],
["知识与推理", "frontier_math_v2", "FrontierMath v2", 1],
["知识与推理", "matharena_apex", "MathArena Apex", 1],
["知识与推理", "proofbench", "ProofBench v1.1 (Lean 4)", 1],
["知识与推理", "codeforces", "CodeForces (Elo)", 1],
// —— 编程与终端 ——
["编程与终端", "terminal_bench_21", "Terminal-Bench 2.1", 1],
["编程与终端", "terminal_bench_30", "Terminal-Bench 3.0", 1],
["编程与终端", "deepswe", "DeepSWE v1.1", 1],
["编程与终端", "swe_bench_pro", "SWE-bench Pro", 1],
["编程与终端", "swe_bench_pro_v2", "SWE-Bench Pro V2", 1],
["编程与终端", "swe_bench_multilingual", "SWE-bench Multilingual", 1],
["编程与终端", "swe_atlas", "SWE-Atlas", 1],
["编程与终端", "nl2repo", "NL2Repo-Bench", 1],
["编程与终端", "livecodebench", "LiveCodeBench v6", 1],
["编程与终端", "cursorbench_40", "CursorBench 4.0", 1],
["编程与终端", "program_bench", "ProgramBench", 1],
["编程与终端", "ioi_vals_v2", "IOI (Vals v2)", 1],
["编程与终端", "vals_code_migration", "Code Migration(Vals)", 1],
["编程与终端", "vals_vibe_code_bench", "Vibe Code Bench v1.1(Vals)", 1],
["编程与终端", "vals_terminal_bench_science", "Terminal-Bench Science(Vals)", 1],
// —— Agent 与办公 ——
["Agent 与办公", "toolathlon", "Toolathlon Verified", 1],
["Agent 与办公", "agents_last_exam", "Agents' Last Exam", 1],
["Agent 与办公", "automationbench", "AutomationBench(厂商版)", 1],
["Agent 与办公", "osworld_2", "OSWorld 2.0", 1],
["Agent 与办公", "androidworld", "AndroidWorld", 1],
["Agent 与办公", "tau3_banking", "τ³-Banking", 1],
["Agent 与办公", "tau2_banking", "τ²-Banking", 1],
["Agent 与办公", "ifbench", "IFBench(指令遵循)", 1],
["Agent 与办公", "officeqa_pro", "OfficeQA Pro", 1],
["Agent 与办公", "finance_agent_v2", "Finance Agent v2(Vals)", 1],
["Agent 与办公", "emb_excel", "EMB(Excel 建模,Vals)", 1],
["Agent 与办公", "legal_research", "Legal Research Bench(Vals)", 1],
["Agent 与办公", "hlab", "HLAB(法律 Agent,Vals)", 1],
["Agent 与办公", "vals_tax_agent", "Tax Agent Bench(Vals)", 1],
["Agent 与办公", "itbench_sre", "ITBench SRE", 1],
["Agent 与办公", "cybergym", "CyberGym", 1],
["Agent 与办公", "sec_bench_pro", "SEC-Bench Pro", 1],
["Agent 与办公", "exploitgym", "ExploitGym", 1],
["Agent 与办公", "coworkbench", "CoWorkBench(厂商自建)", 1],
["Agent 与办公", "jobbench", "JobBench", 1],
// —— 多模态与长文本 ——
["多模态与长文本", "mmmu_pro", "MMMU-Pro", 1],
["多模态与长文本", "charxiv_rq", "CharXiv RQ", 1],
["多模态与长文本", "mathvision", "MathVision", 1],
["多模态与长文本", "realworldqa", "RealWorldQA", 1],
["多模态与长文本", "babyvision", "BabyVision", 1],
["多模态与长文本", "chartography", "Chartography", 1],
["多模态与长文本", "lvbench", "LVBench(长视频)", 1],
["多模态与长文本", "mmvu", "MMVU(视频)", 1],
["多模态与长文本", "mvvbench", "MVBench(视频)", 1],
["多模态与长文本", "erqa", "ERQA(具身)", 1],
["多模态与长文本", "context_arena", "Context Arena", 1],
["多模态与长文本", "zerobench_main", "ZeroBench Main", 1],
// —— 速度与成本 ——
["速度与成本", "aa_speed_tps", "输出速度 (tok/s)", 1],
["速度与成本", "aa_ttft", "首 token 延迟 (s)", -1],
["速度与成本", "aa_time_first_answer", "首个答案 token 延迟 (s)", -1],
["速度与成本", "aa_e2e", "端到端响应 (s)", -1],
["速度与成本", "aa_time_per_task", "每任务耗时 (s)", -1],
["速度与成本", "aa_output_tokens_per_task", "每任务输出 token (k)", 0],
["速度与成本", "aa_reasoning_tokens_per_task", "每任务推理 token (k)", 0],
["速度与成本", "aa_index_output_tokens", "跑完指数总输出 (M token)", 0],
["速度与成本", "aa_input_price_usd", "输入价 ($/百万)", -1],
["速度与成本", "aa_output_price_usd", "输出价 ($/百万)", -1],
["速度与成本", "aa_cache_hit_usd", "缓存命中价 ($/百万)", -1],
["速度与成本", "aa_price_blended", "混合价 ($/百万)", -1],
["速度与成本", "aa_cost_per_task_usd", "每任务成本 ($)", -1],
["速度与成本", "aa_cost_index_total", "跑完指数总成本 ($)", -1],
["速度与成本", "aa_cache_discount_pct", "缓存折扣 (%)", 1],
];
const rows = [
["厂商", ...models.map(p => txt(p, "vendor"))],
["发布", ...models.map(p => { const v = raw(p, "release_date"); return (v && v.toFormat) ? v.toFormat("yyyy-MM-dd") : String(v ?? "—"); })],
["价格(输入 / 输出)", ...models.map(p => txt(p, "price_display"))],
["缓存命中输入", ...models.map(p => money(p, "price_cache_hit"))],
["参数(总 / 激活)", ...models.map(p => txt(p, "params_display"))],
["上下文 / 最大输出", ...models.map(p => txt(p, "context_display"))],
["输入模态", ...models.map(p => txt(p, "input_modalities"))],
["开放权重 / 许可", ...models.map(p => (p.open_weights ? "✅ 开源 · " : "❌ 闭源 · ") + txt(p, "license"))],
["本地部署", ...models.map(p => p.local_deploy === true ? "✅ 可本地" : "❌ 仅云")],
["接 Agent", ...models.map(p => p.agent_ready === true ? "✅ 可接" : "⚠️ 慎接")],
];
for (const [group, key, label, dir] of METRICS) {
const vals = models.map(p => raw(p, key));
const present = vals.filter(v => v !== null);
if (present.length < MIN_REPORTERS) continue;
const best = dir === 0 ? null : (dir > 0 ? Math.max(...present) : Math.min(...present));
const cells = vals.map(v => v === null ? "—" : (v === best ? v + " ★" : String(v)));
const cov = present.length < models.length ? `(${present.length}/${models.length})` : "";
rows.push([`${group} · ${label}${cov}`, ...cells]);
}
rows.push(["定位", ...models.map(p => txt(p, "verdict"))]);
dv.table(["维度", ...models.map(p => p.file.link)], rows);怎么读这张表
分数层面几乎打平,差异全在成本、速度和可靠性。
- 智能梯队(AA 同 harness):GLM 42 ≈ Gemini 41 ≈ Qwen 40 ≈ DeepSeek 39,只差 3 分,属同一档。别为这点分差付 5 倍价钱。
- 拆到 10 项子评测,格局完全不同:Gemini 赢在知识推理侧(HLE 48、CritPt 18、GDP.pdf 21、SciCode 57 全为第一),GLM 赢在终端与知识校准(Terminal-Bench 4.0 33、AA-Omniscience +7 为正),DeepSeek 赢在自动化与长上下文(AutomationBench-AA 69、AA-LCR 84 均为第一),Qwen 则在 AA-Briefcase(1588)与 GDPval-AA(1612)上领先,但 AA-Omniscience −10 是四家最低,即幻觉惩罚最重。
- 速度与延迟分化极端:Gemini 245 tok/s 但 TTFT 17.48 s 最慢;DeepSeek 209 tok/s 且 TTFT 0.99 s + 端到端 12.96 s 全场最快;GLM 47 tok/s、每任务耗时 1064 s;Qwen 54.6 tok/s、每任务 1546 s 最慢。所谓「Flash」对 GLM / Qwen 只意味着价格档。
- 成本:GLM 混合价 0.5775 是它的 5.9 倍;跑完一次指数 GLM 1,623。
- 啰嗦度:四家输出 172M–253M token,同类中位数 81–140M,都远超中位数——刊例价低 ≠ 实际便宜。Qwen 每任务输出 108k token(含推理 72k)最啰嗦。
- 本地部署 / 接 Agent 两行:最容易踩坑——开源不等于能本地跑(deepseek-flash 552B / 约 480GiB,标「仅云」),跑分高不等于能接 Agent(Qwen 标「慎接」)。
价格列背后的细则
- GLM-5.3-Flash:缓存存储限时免费;Batch 为标准价 5 折;同架构速度版 GLM-5.3-FlashX 为 2 / 7 元(缓存 0.57),官方称约 200 tok/s。
- Qwen3.8-Flash:2026-08-27 起由 1 / 3 元下调至 0.8 / 2.7 元;Batch 0.4 / 1.35 元;显式缓存创建 1.25 元;北京地域 100 万 tokens 免费额度(90 天内有效);
web_search4 元/千次;不支持模型调优。 - deepseek-flash:峰谷定价,高峰 = 北京时间周一至周五 9:00–12:00、14:00–18:00(不含法定节假日),其余时间含周末全天为空闲价:1 / 4 元,缓存 0.02 元。并发 2500。旧名
deepseek-v4-flash、deepseek-v4-flash-vision-exp与新访问的deepseek-v4-pro均路由到 V4.1 Flash 并按 Flash 价计费。 - Gemini 3.8 Flash:缓存在库 14/千次;2027-01-01 起 7.50,3.6 / 3.7 Flash 同日同幅上涨。另有安全向变体
3.8 Flash Cyber。
结构差异(表里看不出的部分)
- GLM:稀疏 + 线性注意力混合,相比 GLM-5.3 注意力计算量降 3.01 倍、KV Cache 降 4.44 倍;GLM-5 系列首个原生多模态模型,视觉直接进 Coding 循环。
- Qwen:QSA 稀疏 + GDN 线性混合、Gated Residual、51B N-gram Embedding。嵌入表每 token 只读 16 行,可 mmap 到 NVMe——这是它能塞进单台 128GB 小主机的关键;官方称 1M 长上下文高缓存命中可提速 8 倍以上。
- DeepSeek:Causal-Encoder-Decoder 非对称结构(输入激活 8B、输出激活 16B),KV Cache 约 890 字节/token、相比初代缩小 437 倍,HBM 需求降至 1/4、SSD 降至 1/8。
- Gemini:思考 token 按输出价计费(
thoughtsTokenCount与可见输出同价),默认thinking_level = medium,minimal已移除。
逐模型详评
GLM-5.3-Flash(AA 42 / 47.2 tok/s / $0.25 每任务)
代表跑分:Terminal-Bench 2.1 84.3(Opus 4.8 为 85.0、GPT-5.6 Terra 为 87.4)· DeepSWE v1.1 63.4(同门 GLM-5.2 为 46.2)· Toolathlon Verified 78.4 · AutomationBench 48.8 · OfficeQA Pro 62.4 · HLE 带工具 55.3(同门旗舰为 62.5,−7.2)· GPQA Diamond 90.15 优:官方单价最低档、每任务成本最低;雷峰网同题实测(从零开发个人工作台)中结构最完整,登录、模块、CRUD、统计、测试齐全,像标准 SaaS;原生多模态,文档/截图/图表负载有结构性优势。 劣:输出仅 47 tok/s,批处理墙钟时间明显偏长;高难推理是降本代价(HLE −7.2);1M 上下文衰减未被独立测量;本地实测出现「50 字约束超限」「被禁词点名」等指令跟随错误。 本地部署:单机 3-bit(Unsloth GGUF 120.4 GB,128GB 需
--cache-ram 0 --ctx-checkpoints 0)或双机 NVFP4(vLLM TP=2,代码修复仅 38.1 秒)。
Qwen3.8-Flash(AA 40 / 54.6 tok/s / $0.37 每任务)
代表跑分:NL2Repo-Bench 48.1 · Toolathlon Verified 73.5 · DeepSWE 58.7 · CharXiv RQ 90.6(此处领先 GLM 的 89.4)· SWE-bench Pro 官方称领先 Opus 4.6 达 9.1 分 · AndroidWorld / MathVision / ERQA 分别高出 Opus 4.6 22.5 / 25.1 / 31.5 分(口径为开源版 Flash-Next) 优:价格最低档 + 100 万 tokens 免费额度;单机可跑(mmap 方案,DGX Spark 单台常驻 79.4 GiB);DGX Spark 实测中唯一日语机械判定 9/9 全通过,200K 长文 TTFT 仅 101 秒;雷峰网实测更懂个人办公节奏(智能排序、逾期提示、7 天内到期、Markdown 笔记)。 劣:Agent 落地问题突出——社区在线 API 实测生成一个网页耗时 19 分 37 秒、任务频繁死循环,作者评分 40;
tool_choice=required被受理却返回 0 个工具调用;思考链偏长(弱思考档输出 token 可达 GLM 的 5–6 倍);雷峰网实测 UI 有文本溢出、信息密度偏低;开源版为 Qwen Community License 1.0,含月活/营收条件。
deepseek-flash(AA 39 / 208.9 tok/s / $0.27 每任务)
代表跑分:DeepSWE 74.2(Opus 5 为 74.0、GPT-5.6 Sol 为 73.0)· Terminal-Bench 2.1 90.6 · Terminal-Bench 3.0 仅 30 · HLE 36.8(落后 Opus 5 约 20 分) 优:速度 208.9 tok/s 且缓存折扣 98%,长会话成本最优;网易智能三题实测(3D 停车游戏 / 电商下单 / 预约系统)全部通过(V4 Flash 有两题分别出现 3D 场景倒置、重启后订单读不到);生成耗时约为 V4 Flash 的三到四成,输出 token 少 14.4%、总 token 少 44.7%;MIT 许可;腾讯 WorkBuddy/CodeBuddy 与 OpenCode 已全量接入。 劣:HLE 36.8,高难学术推理明确弱项;长程任务稳定性存疑——Terminal-Bench 换到 3.0 后从 90.6 崩到 30;552B / 约 480GiB 权重,社区实测量化后仍可能慢到 1 tok/s 级(一句话等 74 秒),自部署实际不可行。
Gemini 3.8 Flash(AA 41 / 244.7 tok/s / $1.24 每任务)
代表跑分:AA 用旧版指数测得 high 档 59(3.7 Flash high 为 56),但每任务多花约 30% 输出 token,每任务成本从 0.58,耗时 2.2 → 2.5 分钟。Google 官方叙事是「works harder」,不做刷榜。 优:245 tok/s 四家最快;1M 上下文;唯一支持音频输入,全模态统一输入价;有免费层可零成本试;生态与 grounding 集成完善。 劣:思考 token 按输出价计费——一次 10K 输入 + 2K 可见输出 + 6K 思考的请求,思考占整单费用 60%;引导价 2026-12-31 到期后 7.50,那时比 GPT-5.6 Luna(6)贵、与 Sonnet 5 差距缩到约 1.3 倍;默认「更努力」,不显式设置
thinking_level等于放弃成本控制;闭源不可私有化。 降本杠杆:thinking_levelhigh → medium → low 对应每任务 0.41 → $0.24。
选型建议
- 高频办公 / 文档 / 交付物生成(PPTX、DOCX、XLSX) → GLM-5.3-Flash。单价最低、工程完整度最好,Office 与文档是官方主推方向。
- 长会话 Agent / 缓存命中为主 → deepseek-flash。缓存命中 0.02–0.04 元、折扣 98%、209 tok/s,长上下文复用成本最低。
- 延迟敏感的批量通用任务 → Gemini 3.8 Flash。245 tok/s + 免费层起步;上线前必须按路由显式设置
thinking_level,并把 2027-01-01 重新评估写进日历。 - 个人办公问答 / 长文档与代码库阅读 → Qwen3.8-Flash。价格最低档、1M 上下文、多模态齐全;先别接 Agent 流水线,要接的话先自测
tool_choice=required与长会话稳定性。 - 本地 / 私有化部署 → Qwen3.8-Flash-Next 优于 GLM-5.3-Flash。Qwen 靠 mmap 能进单台 128GB,7 分钟起服务;GLM 需要单机 3-bit 硬压或双机 NVFP4,但双机版的等待时间更短(代码修复 38 秒对 87 秒)。deepseek-flash 与 Gemini 排除。
- 中文写作 + 多并发 → 视并发模型定。GLM 单发慢但 TTFT 快;Qwen 思考长,同样 10 题的总耗时可能差 5 倍。
待验证
三个未解问题
- Qwen3.8-Flash 的
tool_choice=required不履行,是解析器问题还是模型本身,社区尚无定论。- GLM-5.3-Flash 的 1M 上下文衰减未被独立测量(官方只给了注意力计算量降 3 倍、KV 降 4.4 倍)。
- 各家 Flash 的量化后质量(GGUF / NVFP4)普遍缺少公开对比——本地部署前建议自测。
模型卡片
上表的四个数据源(每张卡片是 type: model-card,含完整规格、价格表、跑分与优缺点):
字段说明与新增方式
标识:
model、vendor、model_family、tier、release_date规格:open_weights、license、context_window、max_output、total_params_b、active_params_b、input_modalities价格:currency、price_input、price_output、price_cache_hit、price_input_usd_equiv、price_output_usd_equiv评测与判断:aa_intelligence、aa_speed_tps、aa_cost_per_task_usd、aa_cache_discount_pct、local_deploy、agent_ready表内展示(派生字段):price_display、params_display、context_display、key_benchmark、verdict新增模型:在
大模型/05-评测与选型/模型体验/建笔记,设type: model-card并补齐上述字段,总对比表会自动多出一行。确实未公开的字段(如闭源模型的total_params_b)直接省略,不要填 0。
参考资料
- 智谱 API 定价
- GLM-5.3-Flash/FlashX 模型文档
- 阿里云 Qwen3.8-Flash 价格与活动说明
- DeepSeek 模型 & 价格
- DeepSeek V4.1 Flash 发布公告
- Gemini 3.8 Flash pricing: intro rates, thinking tokens, and the real cost per task
- Artificial Analysis — GLM 5.3 Flash
- Artificial Analysis — Qwen3.8-Flash-Next
- Artificial Analysis — DeepSeek V4.1 Flash
- Artificial Analysis — Gemini 3.8 Flash
- 雷峰网:实测 Qwen-3.8 与 GLM-5.3 的 Flash 版
- DevelopersIO:DGX Spark 上 Qwen3.8 与 GLM-5.3-Flash 四构成实测
- 网易智能:DeepSeek V4.1 Flash 初体验