GLM-5.3-Flash:新功能、如何访问以及免费替代方案 (2026)

Z.ai 于 2026 年 8 月 25 日发布了 GLM-5.3-Flash 的开源权重,其开发者文档最后更新于 8 月 26 日。
以下所有内容均来自两个官方来源。一个是 zai-org/GLM-5.3-Flash 仓库中的模型卡片。另一个是 Z.ai 开发者文档。两者均于 2026 年 8 月 27 日读取。
什么是 GLM-5.3-Flash
模型卡片的开头有一句值得原封不动引用的声明。Z.ai 写道:“我们推出了 GLM-5.3-Flash,这是 GLM-5 系列中首个原生多模态模型。”
两个数字定义了它的架构。卡片列出“总参数量 320B,而激活参数量仅为 18B”,这是一种稀疏混合设计,而非稠密设计。
卡片做了一项对比声明。它表示该模型“在基准测试和实际工作负载中的表现均优于 GLM-5.2,且价格仅为后者的十分之一”。它还称该模型“在编程和智能体 (agentic) 基准测试中接近 Claude Opus 4.8”。
对于任何想要运行它的人来说,许可证是最关键的部分。仓库元数据中列出的是 MIT,这是目前广泛使用的最宽松的许可证之一。
厂商口中的架构变革
Z.ai 描述了三项具体的改变,而非泛泛的更新。
全新的基座模型。卡片指出 GLM-5.3-Flash “源自一个全新训练的基座模型,其架构和训练配方围绕能力与效率进行了重新设计”。
混合注意力机制。在该系列中,Z.ai 首次结合了“稀疏与线性注意力机制,在大幅降低长上下文服务成本的同时,保留了精准的长上下文处理能力”。
mHC。该模型采用了卡片中所称的“流形约束超连接 (mHC),以进一步提高缩放效率”。
训练语料库也被提及。Z.ai 将效率的提升归功于“我们最新的 30T-token 多模态预训练语料库”。
多模态声明的适用范围与局限
文档具体说明了如何输入图像。Z.ai 的指南指出,需要“向 messages[].content[] 中添加一个 type: image_url 的内容块”,并传入图像 URL 或 Base64 数据 URL。
支持在单个请求中输入多张图像。同一页面指出,可以通过包含多个此类内容块来添加多张图像。
上下文窗口是另一个焦点。文档声明支持“1M-token 的上下文窗口”,评估脚注也通过报告一次“在 1M 上下文下”运行的基准测试证实了这一点。
模型卡片未测试的内容
设立本节是因为,未覆盖的空白往往比亮点更重要。
模型卡片报告了一个名为 BabyVision 的图像基准测试。它还记录了预处理过程:图像会被调整大小,“使其短边至少达到 1.5K 像素”,因此视觉能力是经过真实测量的。
未提及任何表格基准测试。在模型卡片中搜索 table、spreadsheet、document 和 chart 的结果为零匹配。相反,列出的评估涵盖了编程、智能体、终端和自动化。
这种缺失并不代表能力薄弱。它只是意味着,不应该有人向你保证该模型能可靠地读取你的电子表格截图,因为厂商尚未发布相关的测试数据。
还有一个遗漏值得注意。文档中关于定价部分的唯一数字带有限制条件。这使得它不适合作为固定费率引用,因此这里将其省略。
如何获取
有两条途径,分别适合不同的人群。
| 途径 | 您需要什么 | 文档位置 |
|---|---|---|
| 托管 API | Z.ai API 平台账号 | Z.ai 开发者文档中的 GLM-5.3-Flash 指南 |
| 开源权重 | 您自己的 GPU 以及四个推理服务框架之一 | Hugging Face 仓库中的模型卡片 |
对于托管途径,文档指出 GLM-5.3-Flash “现已完全适用于 GLM Coding Plan”。同一行内容还将其归功于原生多模态能力以及三倍的配额。
在规划工作负载之前,评估脚注非常值得一读。它们列出了编程、终端、智能体和自动化基准测试,并且每个测试都列出了自己的上下文长度和裁判模型。这能告诉你厂商针对什么进行了优化。
对于本地部署,卡片列出了四个框架并提供了每个框架的使用指南链接:SGLang、vLLM、TokenSpeed 和 KTransformers。该系列背后的技术报告已发表在 arXiv 上。
想要开源权重?这些是免费替代方案
GLM-5.3-Flash 本身可以根据 MIT 许可证免费下载。如果您想要第二个选择,真正重要的对比是许可证加模态,而不是基准测试排名。
Qwen3.8 是目前已发布的最接近的同类模型。其 Hugging Face模型卡片列出的是 Apache-2.0 许可证,并支持文本、图像和视频。它声明原生上下文为 262,144 个 token,可扩展至 100 万。
我们的 Qwen3.8 评测文章对该版本的发布进行了独立分析。并排阅读这两份模型卡片是确定哪一个更适合您硬件的最快方法。
实际的区别在于您目前正在运行什么。这两个模型都通过相同的开源框架提供服务,因此切换成本通常只是修改配置,而不是重写代码。
模型不等于最终交付物
权重和 API 只是赋予了您一种能力。它们并不能直接生成别人正在等待的报告、幻灯片或清洗好的表格。
这最后一公里是工作流的问题,而不是模型的问题。Powerdrill Bloom 可以直接读取您已有的文件并返回所需的成果。
它的连接器页面列出了 Excel、TSV 和 CSV 处理以及 text-to-SQL 功能。它的图像转文本页面描述了上传 JPG、JPEG、PNG、WEBP 和 GIF 文件。然后,您可以用自然语言对它们进行提问。
请注意第二个页面上坦诚指出的局限性。该页面描述的是对图像要点的总结,以及生成文本的翻译。它并没有描述从照片中提取结构化表格的功能,因此请不要以此为前提进行规划。
方案列在定价页面上,免费层级足以测试工作流的形态。如果您想在真实的导出文件上尝试这最后一公里,请从 Powerdrill Bloom 开始。
常见问题解答
GLM-5.3-Flash 可以免费使用吗?
权重采用 MIT 许可证,因此自行下载和运行不收取任何许可费。服务成本由您自己承担,而托管 API 是另一条独立的商业途径。
GLM-5.3-Flash 可以读取图像吗?
可以。开发者文档描述了一个 image_url 内容块,它接受 URL 或 Base64 数据 URL,并支持在单个请求中输入多张图像。
上下文窗口有多大?
文档声明支持 1M-token 的上下文窗口。已发布的一项评估就是在该完整上下文下运行的。
GLM-5.3-Flash 能理解电子表格和文档吗?
模型卡片未发布表格或文档基准测试,因此没有厂商数据可供引用。请将电子表格读取视为“未测试”,而非已列出的能力。
我可以在什么设备上运行它?
模型卡片列出了 SGLang、vLLM、TokenSpeed 和 KTransformers,并提供了每个框架的使用指南或配方链接。硬件要求应参考这些框架文档,而非模型卡片本身。