智谱开源GLM-5.3-Flash大模型,定价仅前代十分之一
IT时代网8月26日消息,智谱今晚正式上线并开源 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列首个原生多模态模型。新模型总参数 320B、激活 18B,综合能力超过上一代 GLM-5.2。
在 Artificial Analysis 综合智能指数中,GLM-5.3-Flash 取得 57 分,进入全球前沿模型区间,与 Anthropic 最受欢迎的模型 Claude Opus 4.8 得分持平;在自研代码评测里,其编程表现也与 Opus 4.8 相当。价格上,GLM-5.3-Flash 定为 GLM-5.3 的十分之一,限时折扣下为后者的二十分之一、约为 Opus 4.8 的四十分之一。"同样智力,四十分之一价格",意味着前沿智能第一次不必精打细算地用。
正式发布前,智谱以匿名模型 Ox-Alpha(中文社区称"牛来")在 OpenCode 与 OpenRouter 上做了大规模测试。该模型迅速成为当周最受欢迎的模型,创下双平台调用量新高,而全部流量都由国产芯片提供算力支撑。
架构上,GLM-5.3-Flash 专为极低成本设计。总参数量与 GLM-4.5 相当,但激活参数与层数几乎减半,配合 30T token 的多模态预训练语料,用更少算力实现更强性能。它是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,在保持精准长上下文能力的同时,大幅压低长上下文服务成本,并引入流形约束超连接(mHC)提升 Scaling 能力。相较 GLM-5.3,其注意力计算量与 KV 缓存分别降低约 3 倍和 4.4 倍。
作为原生多模态模型,视觉编码被集成进模型本身,使其能自主判断何时"观察"并用视觉反馈指导下一步行动。智谱为此开发了数据合成流水线,覆盖前端 Coding、游戏与 3D 仿真等场景。在 Blender 中,模型曾自主运行 16 小时搭建出约 400 平方米的专业主厨自宅与测试厨房。在办公与专业文档方面,新模型可检查并优化 PPTX、PDF、DOCX、XLSX 等输出,并针对金融、法律场景做了专门优化,能完成合同审查批注、律师函起草等任务。
支撑这套服务的,是智谱首次在大规模流量中启用的大国产芯片集群。集群通过自研高带宽互联网络连接,并基于 SGLang 构建了专用推理引擎;底层做了以算力换带宽、通信换显存等激进内存优化,集群层面采用编码、预填充、解码分离的可独立扩缩容架构。与同硬件初始基线相比,端到端服务性能提升 3 倍,单 token 成本已达与主流英伟达 GPU 相当的水平,证明国产芯片能在大规模场景高效、经济地支撑前沿模型推理。
目前 GLM-5.3-Flash 已面向全球开源,接入 ZCode 等编码平台,并开放 API 调用。

注:本文中包含AI辅助创作的内容。