GLM-5.3 是智谱AI于2026年8月推出的旗舰级开源大模型,以编程能力与网络安全能力为两大核心支柱。模型采用MoE架构,总参数量达7430亿,主要面向代码生成与审计、漏洞挖掘、Agent长程推理等专业场景。发布两周后即开放完整权重,支持企业安全团队、研发组织及个人开发者进行本地化部署与二次开发。
相比上一代GLM-5.2,编程体感提升约50%;在CyberGym基准上取得84.5%的成绩,与GPT-5.6 Sol持平;在漏洞发现与代码安全审计维度上,相较同期发布的Kimi K3展现出明显优势。
基础档案
| 项目 | 详情 |
|---|---|
| 研发方 | 北京智谱华章科技股份有限公司(智谱AI) |
| 发布时间 | 2026年8月14日 |
| 参数体量 | 7430亿,MoE混合专家架构 |
| 核心能力 | 代码编写、安全审计、漏洞发现、Agent推理 |
| 开源节奏 | 发布两周后开放完整模型权重 |
| 体验入口 | ZCode、AutoClaw、扣子、WorkBuddy/CodeBuddy等 |
| 产品定位 | 面向编程与网络安全的开源旗舰模型 |
| 目标人群 | 企业安全工程师、研发团队、独立开发者、白帽研究者 |
核心能力与实测表现
以下数据均来自智谱AI官方技术报告及红队合作团队的实测结果。
编程能力跃升
编程是GLM-5.3相较前代提升最为显著的模块。在Terminal-Bench 3.0(终端命令行任务执行评测)中取得28.3分,位居开源模型第一,明显高于同期Kimi K3的17.4分。DeepSWE v1.1(真实软件工程任务基准)得分从GLM-5.2的46.2跃升至66.9。智谱内部主观测评显示,编程体验已接近Claude Fable 5,在国产开源模型中处于领先位置。
网络安全差异化优势
白帽代码安全审计是GLM-5.3的核心差异化卖点。CyberGym(代码审计与漏洞发现基准)得分84.5%,持平甚至略超Mythos 5(83.8%)和GPT-5.6 Sol(83.6%)。ExploitBench(漏洞利用推理基准)达到54.4%,是GLM-5.2(24.4%)的两倍有余。ExploitGym(6小时漏洞挖掘吞吐测试)完成130项任务,相较前代的39项提升约3.3倍。
不过在深度漏洞利用层面,开源模型与头部闭源模型之间仍有差距:ExploitBench低于Mythos 5的78.0%,ExploitGym吞吐量也落后于Mythos 5的247项。
Token效率突出
在High档位设定下,GLM-5.3仅需约5万tokens即可完成单任务输出,达到Claude Opus 4.8需消耗12万tokens才能实现的准确率。更短的执行路径意味着更低的API调用成本,对高频使用的开发团队尤为有利。
Agent长程任务能力
GDPval-AA v2(覆盖44种职业的真实任务基准)得1769分。模型具备跨文件理解、项目级代码修改和问题定位等能力,已从"辅助写代码"演进为"参与软件工程全流程"的智能体。
红队实战验证成果
发布前两周,智谱联合清华大学、南开大学、奇安信、腾讯玄武等机构开展红队测试,累计发现2404个潜在漏洞,覆盖269个项目。其中最受关注的是一个潜伏40余年的DNS协议级零日漏洞——攻击者仅需少量特殊请求即可将服务器压力放大近8万倍,潜在影响超1000万处公网DNS服务。
GLM-5.3 vs Kimi K3 横向对比
| 对比维度 | GLM-5.3 | Kimi K3 |
|---|---|---|
| 开发方 | 智谱AI | 月之暗面 |
| 模型定位 | 编程+安全双特化 | 通用编程+Agent均衡 |
| 开源状态 | 两周后权重开源 | 已开源 |
| Terminal-Bench 3.0 | 28.3 | 17.4 |
| DeepSWE | 66.9 | 67.5 |
| Agents' Last Exam | 28.5 | 27.6 |
| CyberGym | 84.5% | 80.0% |
| ExploitBench | 54.4% | 32.2% |
| ExploitGym(6h任务数) | 130 | 70 |
两者均为2026年8月发布的国产开源模型,但路径分化明显。GLM-5.3在安全维度的优势是全方位的——CyberGym高出4.5个百分点,ExploitBench高出22个百分点,ExploitGym任务数接近翻倍。编程层面两者互有胜负,Kimi K3在DeepSWE上以67.5略胜66.9。若核心诉求是代码安全审计与漏洞挖掘,GLM-5.3是明确的首选;若侧重通用编程与Agent任务,两者差距不大。
适用场景与推荐人群
GLM-5.3的能力分布呈明显特化特征,以下三类场景受益最为直接:
企业安全团队:代码安全审计、渗透测试辅助、漏洞复现与验证。CyberGym和ExploitBench的高分可直接转化为生产力,红队发现的2404个漏洞也从实战角度验证了其可靠性。
软件研发团队:跨文件代码修改、项目级问题定位等多步骤工程任务。GDPval-AA v2的高分表明其适合承担复杂Agent工作流,而不仅是单段代码补全。
个人开发者与安全研究者:编程辅助、白帽技能学习、开源模型研究与微调。权重开放后可进行本地部署和定制化训练。
适合切换的人群:安全工程师、渗透测试人员、全栈开发者、AI Agent开发者。若日常使用场景主要是写作、问答、翻译等通用任务,GLM-5.2或轻量版已足够,无需急于升级。
使用方式
官方工具:通过ZCode或AutoClaw直接体验。8月14日13:00起,GLM Coding Plan全员额度已重置。
第三方平台:已在扣子、WorkBuddy/CodeBuddy、Qoder/QwenWork等平台开放,开发者可在熟悉的环境中调用。
API与本地部署:API服务随发布上线;完整权重计划两周后开放。安全相关的高级能力仅通过受信访问计划向验证用户开放。
开源策略与已知局限
分层开源机制:
发布两周后开放完整模型权重,期间完成安全评估与加固
敏感攻击能力仅向通过身份审核的受信用户开放,防御能力对开源社区全面开放——此举旨在降低滥用风险
红队发现的2404个漏洞已提交CNNVD、CNVD等国家漏洞库,覆盖269个项目
已知不足:
基座未更新:与GLM-5.2共用基座(同属GLM-5.1系列),全部提升来自后训练,基座智能上限是否接近瓶颈尚不明朗
深度安全仍落后闭源:ExploitBench 54.4% vs Mythos 5的78.0%,ExploitGym 130项 vs Mythos 5的247项
Terminal-Bench绝对分数偏低:28.3虽为开源最佳,但落后于GPT-5.6 Sol的34.6
常见问题
GLM-5.3相比GLM-5.2提升了什么?
基座相同,全部提升来自后训练Scaling。编程体感提升50%,CyberGym从77.2%升至84.5%,ExploitBench从24.4%翻倍至54.4%,ExploitGym吞吐量提升3–4倍。
GLM-5.3和Kimi K3如何选择?
安全相关需求选GLM-5.3(CyberGym 84.5% vs 80.0%,ExploitBench 54.4% vs 32.2%);通用编程和Agent任务两者互有高低(DeepSWE 66.9 vs 67.5),可按偏好选择。
安全能力能否直接使用?
最敏感的攻击能力仅通过受信访问计划向验证用户开放,需身份审核。普通用户可使用编程和代码安全审查功能,防御能力对社区开放。
何时开源?如何部署?
发布两周后开放权重。目前可通过ZCode、AutoClaw、扣子、WorkBuddy/CodeBuddy等平台使用,API同步上线。
本地部署需要多少算力?
7430亿参数MoE架构,FP8全量部署约需800GB显存(如8卡H20/H800服务器),INT4量化后约400GB。以上为工程估算值,具体以官方开源文档为准。个人开发者建议优先使用API或第三方平台。
