GLM-5.3-Flash
一句话
单价最低档的「旗舰级 Agent 能力 + Flash 级成本」,工程交付完整度最好;但 「Flash」指的是价格档,不是速度档——输出速度只有 47.2 tok/s。
定位
智谱 GLM-5 系列首个原生多模态模型,视觉能力直接进入 Coding 循环(模型能看界面、渲染结果和交互反馈并持续改进)。官方主推场景是 Office、金融研究、专业文档,可交付 PPTX / PDF / DOCX / XLSX。
规格
| 项目 | 值 |
|---|---|
| 发布时间 | 2026-08-26 |
| 开放权重 | 是(MIT) |
| 总参数 / 激活 | 320B / 18B |
| 上下文 | 1M |
| 最大输出 | 128K |
| 输入模态 | 视频、图像、文本、文件 |
| 架构 | 稀疏注意力 + 线性注意力混合 |
| 效率 | 相比 GLM-5.3,注意力计算量降 3.01 倍、KV Cache 降 4.44 倍 |
| 思考控制 | thinking.type=enabled,推荐 reasoning_effort: max |
价格(元/百万 tokens)
| 项目 | GLM-5.3-Flash | GLM-5.3-FlashX |
|---|---|---|
| 输入 | 0.8 | 2 |
| 输出 | 2.8 | 7 |
| 缓存命中 | 0.23 | 0.57 |
- 缓存存储限时免费;Batch API 为标准价 5 折。
- GLM-5.3-FlashX 是同架构速度版,官方称约 200 tokens/s,适合对延迟敏感的线上业务。
独立评测(Artificial Analysis)
| 指标 | 值 |
|---|---|
| 智能指数 | 42(开源权重模型第 4/117,同类中位数 18) |
| 输出速度 | 47.2 tok/s(同类中位数 67,明显偏慢) |
| 首 token 时间 | 1.47 s(优于中位数 2.14 s) |
| 混合价 | 0.50 |
| 每任务成本 | $0.25 |
| 缓存折扣 | 83% |
| 输出啰嗦度 | 180M tokens(同类中位数 140M,偏啰嗦) |
厂商自报跑分(多为 max 档 + 带工具,口径不可混用)
| 基准 | 分数 | 参照 |
|---|---|---|
| Terminal-Bench 2.1 | 84.3 | Claude Opus 4.8 为 85.0、GPT-5.6 Terra 为 87.4 |
| DeepSWE v1.1 | 63.4 | 同门 GLM-5.2 为 46.2 |
| Toolathlon Verified | 78.4 | 同门 GLM-5.3 为 73.0(反而更高) |
| AutomationBench | 48.8 | 同门 GLM-5.2 为 26.2 |
| OfficeQA Pro | 62.4 | — |
| HLE(带工具) | 55.3 | 同门 GLM-5.3 为 62.5(−7.2) |
| GPQA Diamond | 90.15 | — |
优缺点
优势
- 官方单价最低档(与 Qwen3.8-Flash 持平),每任务成本 $0.25 是四家中最低。
- 工程完整度最好:雷峰网同题实测(从零开发个人工作台)中结构最完整,登录、模块、CRUD、统计、测试齐全,像标准 SaaS。
- 原生多模态,文档 / 截图 / 图表类工作负载有结构性优势。
- 首 token 时间 1.47 s,聊天类交互体感不差。
风险
- 输出速度慢:47.2 tok/s,低于同体量模型中位数 67 tok/s;批处理流水线的墙钟时间会明显偏长。
- 高难学术推理是降本代价所在:HLE 比同门旗舰低 7.2 分。
- 1M 上下文的衰减未被独立测量(压缩按定义是以精度换成本)。
- 本地部署实测中出现「50 字约束超限」「被禁词点名」等指令跟随错误。
适用场景
- ✅ 高频办公、文档处理、交付物生成(PPTX/DOCX/XLSX)
- ✅ 需要工程完整度的 Coding Agent 任务
- ✅ 缓存命中为主的批量任务
- ✅ 本地部署:MIT 开源,社区已有单机 3-bit(Unsloth GGUF,120.4 GB)与双机 NVFP4(vLLM TP=2)方案;单机 128GB 需
--cache-ram 0 --ctx-checkpoints 0才能跑完长生成,双机版代码修复仅 38.1 秒 - ⚠️ 不适合对吞吐/墙钟时间敏感的批处理