智谱GLM-5.2上线并开源Coding全球第一
IT时代网6月17日消息,智谱今日正式上线并开源新一代大模型GLM-5.2,该模型专为Coding与长程任务能力而生,在全球百万用户参与盲测的前端开发评估系统Code Arena上取得全球可用模型第一的表现。
从2025年初开始,智谱几乎投入全部力量攻关Coding领域,历时大半年打磨每一个代码环境,先后推出代码基座GLM-4.5和效果最好的国产Coding模型GLM-4.7。但代码还不是AGI的终点,在通往AGI的路上,迎面而来的就是长程任务——完成一个跨越数天、数周乃至数月的极长任务执行。GLM-5.2正是为此而生。
支撑长程任务的第一步是实现1M无损上下文。此前业界1M上下文大多在超过数百K后就开始劣化,主要问题在于不同时增强Coding Agent环境及数据的情况下单纯扩展帮助有限。智谱花了几个月时间扩展1M Coding Agent的训练环境,覆盖自动化研究、性能优化等多个领域,使得GLM-5.2在1M上下文的solid表现有时甚至超过Claude Opus。
多个长程任务基准测试表明,GLM-5.2的表现介于Claude Opus 4.7与4.8之间,是排名最高的开源模型。在FrontierSWE(测试AI能否像软件工程师在数小时尺度上完成复杂技术项目)上,GLM-5.2仅比Opus 4.8低1%,超过GPT-5.5(落后1%)和Opus 4.7(落后11%)。在实际体验中,GLM-5.2曾完成开发、联调、测试到打包上线的完整交付,累计处理88万tokens,几乎用满1M上下文窗口——过去这样的大型工程需要一支团队协作数周。
在Coding体感方面,GLM-5.2在前端、后端、长程任务上的成功率相比前代GLM-5.1均有提升。在Terminal-Bench 2.1(评测AI Agent完成不同类型计算机终端任务)上,GLM-5.2比Opus 4.8低4%,相比GLM-5.1提升了17.5%;在MCP-Atlas(大规模工具调研评测数据集)上,比Opus 4.8仅低0.8%。模型还引入了effort level(思考档位)控制,可在能力、速度、成本之间做出平衡。
技术架构上,GLM-5.2提出IndexShare创新设计,在每四层稀疏注意力层之间复用同一个索引器,在1M上下文长度下将单位token的FLOPs降低至2.9倍。同时改进了用于投机解码的MTP层,将接受长度最多提升20%。训练侧依赖自研Slime框架支撑大规模Agentic RL和OPD训练。
值得关注的是,GLM-5.2已在Day 0完成与华为昇腾、平头哥、摩尔线程、寒武纪、昆仑芯、沐曦、海光、壁仞等国产算力平台的推理适配,在国产芯片集群上实现高吞吐、低延迟、大并发的稳定运行。预计下半年昇腾950超节点上市后,也将成为GLM-5.2强劲的算力底座。
GLM-5.2在Hugging Face与ModelScope开源,模型权重遵循MIT License,可自由下载、部署与商用,无地域限制。vLLM、SGLang、transformers等主流推理框架已提供支持。API已上线并纳入GLM Coding Plan,全量用户可使用。
智谱透露,AGI路上还有更多高山要翻越,下一座目标是完全自治的智能体系统(Autonomous Agent System)。基于长程任务之上,让AI能够自主驱动、协同作业、7×24小时运转的智能体群体将成为新的生产力形态。从"智能助手"走向"数字员工",构建包含成千上万个不同专业"性格"与"技能"的智能体社会,核心技术攻关方向包括Memory、持续学习(Continual Learning)、自我评判(Self-Judge)。

此图片为IT时代网AI生成的示意图
注:本文中包含AI辅助创作的内容。