GLM-5.3-Flash

一句话

单价最低档的「旗舰级 Agent 能力 + Flash 级成本」,工程交付完整度最好;但 「Flash」指的是价格档,不是速度档——输出速度只有 47.2 tok/s。

定位

智谱 GLM-5 系列首个原生多模态模型,视觉能力直接进入 Coding 循环(模型能看界面、渲染结果和交互反馈并持续改进)。官方主推场景是 Office、金融研究、专业文档,可交付 PPTX / PDF / DOCX / XLSX。

规格

项目值
发布时间2026-08-26
开放权重是(MIT)
总参数 / 激活320B / 18B
上下文1M
最大输出128K
输入模态视频、图像、文本、文件
架构稀疏注意力 + 线性注意力混合
效率相比 GLM-5.3,注意力计算量降 3.01 倍、KV Cache 降 4.44 倍
思考控制thinking.type=enabled,推荐 reasoning_effort: max

价格(元/百万 tokens)

项目GLM-5.3-FlashGLM-5.3-FlashX
输入0.82
输出2.87
缓存命中0.230.57
  • 缓存存储限时免费;Batch API 为标准价 5 折。
  • GLM-5.3-FlashX 是同架构速度版,官方称约 200 tokens/s,适合对延迟敏感的线上业务。

独立评测(Artificial Analysis)

指标值
智能指数42(开源权重模型第 4/117,同类中位数 18)
输出速度47.2 tok/s(同类中位数 67,明显偏慢)
首 token 时间1.47 s(优于中位数 2.14 s)
混合价0.50
每任务成本$0.25
缓存折扣83%
输出啰嗦度180M tokens(同类中位数 140M,偏啰嗦)

厂商自报跑分(多为 max 档 + 带工具,口径不可混用)

基准分数参照
Terminal-Bench 2.184.3Claude Opus 4.8 为 85.0、GPT-5.6 Terra 为 87.4
DeepSWE v1.163.4同门 GLM-5.2 为 46.2
Toolathlon Verified78.4同门 GLM-5.3 为 73.0(反而更高)
AutomationBench48.8同门 GLM-5.2 为 26.2
OfficeQA Pro62.4—
HLE(带工具)55.3同门 GLM-5.3 为 62.5(−7.2)
GPQA Diamond90.15—

优缺点

优势

  • 官方单价最低档(与 Qwen3.8-Flash 持平),每任务成本 $0.25 是四家中最低。
  • 工程完整度最好:雷峰网同题实测(从零开发个人工作台)中结构最完整,登录、模块、CRUD、统计、测试齐全,像标准 SaaS。
  • 原生多模态,文档 / 截图 / 图表类工作负载有结构性优势。
  • 首 token 时间 1.47 s,聊天类交互体感不差。

风险

  • 输出速度慢:47.2 tok/s,低于同体量模型中位数 67 tok/s;批处理流水线的墙钟时间会明显偏长。
  • 高难学术推理是降本代价所在:HLE 比同门旗舰低 7.2 分。
  • 1M 上下文的衰减未被独立测量(压缩按定义是以精度换成本)。
  • 本地部署实测中出现「50 字约束超限」「被禁词点名」等指令跟随错误。

适用场景

  • ✅ 高频办公、文档处理、交付物生成(PPTX/DOCX/XLSX)
  • ✅ 需要工程完整度的 Coding Agent 任务
  • ✅ 缓存命中为主的批量任务
  • ✅ 本地部署:MIT 开源,社区已有单机 3-bit(Unsloth GGUF,120.4 GB)与双机 NVFP4(vLLM TP=2)方案;单机 128GB 需 --cache-ram 0 --ctx-checkpoints 0 才能跑完长生成,双机版代码修复仅 38.1 秒
  • ⚠️ 不适合对吞吐/墙钟时间敏感的批处理

相关