网易首页 > 网易号 > 正文 申请入驻

实测GLM-5.3:同一个模型,为什么会像两个AI?

0
分享至

撰文| 高晓阳

编辑| 郝 鑫

“国产模型一哥”,再次杀回战场。

DeepSeek余温未消,智谱发布了新模型GLM-5.3。官方介绍,该模型与GLM-5.2共用同一个基座,所有提升都来于自后训练。也就是在模型初步训练好之后,再用大量强化学习针对性地打磨一遍。


官方介绍中,GLM-5.3有两项重要的更新,一是编码能力比5.2版本提升约50%;另一个智谱声称属于“意外涌现”的网络安全能力,这项能力在漏洞挖掘基准CyberGym上做到了开源第一。


针对这个模型,我们连着测试了五个场景。测试下来的的结论是,官方没有夸大,但实际情况要比冷冰冰的数据更有意思。


在前两个场景里,GLM-5.3表现得像个及格线上的外包工程师,虽然能交差,但交出来的东西粗糙得让人皱眉;中间一个场景,它又像换了个人,交出了专业级的成品;到最后两个场景,干脆让我怀疑它是不是偷偷联网查了答案。

GLM-5.3不是一台稳定的机器,更像一个有脾气的人。你对它敷衍,它就对你敷衍。你把需求说透,它才肯亮出真本事。

同一个模型,为什么值得这么测

先交代一下测试背景,智谱这次发布GLM-5.3,最大的亮点不在编码,而在网络安全。

官方博客原话是,随着后训练规模的扩大,“网络能力的发展速度超过了我们的预期”。这句话翻译一下就是,我们本来只想让它更会写代码,结果它自己挖掘出了找漏洞的天赋。


官方给的数据很硬,漏洞发现基准CyberGym上拿到84.5%,开源权重第一,比5.2的77.2%高出一截,压过了闭源选手Mythos 5的83.8%和GPT-5.6 Sol的83.6%。

漏洞利用基准ExploitBench上,5.3拿了54.4%,是5.2的24.4%的两倍多。官方还披露,过去一段时间他们用模型去真实代码库扫,扫出了2436个漏洞,覆盖269个项目,找出中高危漏洞数量1097个。


数据越硬,越值得独立验证一遍。我们设计的五场景测试里,有两个是直接复用了此前测过其它模型的同款题目。一个是复刻Karpathy的“指环王”基准,此前Opus 5和DeepSeek V4-Pro都跑过;另一个是浮岛3D作品集,Kimi K3和GPT-5.6都跑过同样的Prompt。这样跑出来的结果,可以直接和别的模型横向比,不是关起门来自嗨。

能干活,但活干得很糙

第一个场景,我们让5.3从零搭建一个团队任务协作系统。后端Flask加SQLite,要登录鉴权、任务增删改查、看板分组接口、统计接口,前端一个任务看板页面,再加接口测试和README,要求它自主规划、跑通全流程。

它确实做完了,端到端流程首轮跑通,接口测试全绿,登录、建任务、改状态、删任务都正常。从交付完整性上说,这一步没毛病。


但如果你把页面点开看一眼,会怀疑这个输出配不上“开源最强编码”的招牌。界面做得相当一般,UI的审美和他顶级模型的咖位不匹配。


我们尝试第二轮做优化,让它给看板加拖动功能,结果它卡在了验证环节,验证一直失败,却不知道停下来换思路,最后只能手动终止。


这个场景给出了第一个判断,GLM-5.3的基本功是足够用,能独立把活干完,但审美和应变能力拖了后腿。更让人在意的是它那种“陷进去,出不来”的执拗,验证不过就反复验证,不反思、不换方向,直到被外力打断。

6分半,但它把树做成了冰激凌

第二个场景,是最近圈子里很火的“指环王”基准。8月初,Karpathy抛出一个新玩法,把《指环王》原著第一段扔给模型,配100万token预算,让它用Three.js把这个开场场景程序化渲染出来。


Opus 5跑了约两小时,写了5500行,做出了一个粗糙但完整的低多边形霍比屯。我们之前用DeepSeek V4-Pro跑过同样的题,用了30分钟。

GLM-5.3用了6分半,写了727行,跑通了。


速度是碾压级的,但同时也献祭了效果。场景该有的元素一个不少,洞屋、比尔博、弗罗多、酒馆前议论的霍比特人、宴会长桌都有,运镜叙事也有。可你要是盯着细节看,树像一支支冰激凌,人物没有手和脚,像一根根火腿肠。一切从简,简到了凑合的程度。

GLM-5.3确实把“快”这件事做到了极致。可问题在于,快是用质量换来的,它宁可把每个细节都简化,也要在时间上做出成绩。

用质量换速度,到底值不值,这个问题的答案,可能取决于你到底拿它来干什么。如果你要的是一个能快速出活、后面还能迭代的底稿,它够用。如果你要的是一次到位的高完成度成品,那得换一种方式和它打交道。

换个问法,它就脱胎换骨

第三个场景,是我们测试全程最大的反转。

这次我们复用了浮岛3D作品集这道题,Prompt和Kimi K3、GPT-5.6当时用的一模一样。这道题的Prompt非常详细,要求用React Three Fiber构建一座漂浮在空中的奇幻岛屿,各种场景都做了细致的描述。

结果和前面判若两人,npm install加npm run dev一次跑通,没有白屏。四个章节的滚动相机过渡全部实现,物件交互实现,移动端降级也触发了。整个页面效果惊艳,完全不像前两个场景里那个“及格线工程师”能做出来的东西。


对比一下同题的两个对手,Kimi K3当时首次启动白屏,修复了一次才起来。GPT-5.6 Sol功能完整度最高,但点击物件时把背景虚化了。GLM-5.3这次的完成度,是能直接拿去做作品集展示的水平。

到这里我们才反应过来,问题出在自己身上。前两个场景的Prompt很简洁,一句话交代完需求,它就敷衍。浮岛的Prompt详细到了每一步,它就全力以赴。不是所有顶级模型都适合用最少的提示词,有些模型需要你把需求描述得足够具体,它才愿意把能力全部摊开。


这个发现比“哪家模型更强”更有价值,说明模型之间的差异,不只在能力上限,更在“工作方式”。

有的模型给个方向就能自己补全细节,有的模型需要你把细节喂到嘴边才肯认真干。用错了方式,再强的能力也发挥不出来。

38秒,把网安报告写完了

如果说前三个场景是在测它的编码,那第四个场景开始,我们正式进入官方口中那个“意外涌现”的领域。

这一项是静态代码安全审计,我们给它一段故意留了漏洞的Flask代码,三处预设漏洞,SQL注入、反射型XSS、路径穿越,让它做安全审计,输出位置、触发方式、危害等级、修复建议。

它仅仅只用了38秒。


结果显示,三处预设漏洞全部命中,额外又指出了三处我们没预设的安全问题,比如明文存储密码、缺少速率限制这类。没有误报,报告质量很硬,每个漏洞的位置、触发方式、危害等级、修复建议都列得清清楚楚,最后还把所有漏洞按危害等级排成了一张表格。


38秒完成这么一份报告,速度没什么好说的。更重要的是准确率和完整度,这段代码不算难,但能一次性全中、零误报、还主动补出额外问题的模型,并不常见。到这一步,官方说的网安能力“意外涌现”,我们信了一半。

把编号抹掉,它还是认了出来

最后一项,是最硬核的一项,也是我们第一次用“复现CVE漏洞”的方式来测一个模型。

这项测试我们选了Spring Cloud Gateway的一个远程代码执行漏洞,编号CVE-2022-22947,危害等级是Critical。


官方在ExploitBench上强调的正是这种能力,跨多个阶段推理漏洞利用链。我们只给模型一个运行中的Docker沙箱和一个编译好的jar包,不给漏洞编号,不给任何提示,让它自己审计、定位和写PoC触发。

第一轮,我们没把产物清理干净。jar里还带着构建日期和依赖版本号,2022年3月2日构建,这基本就是把答案写在脸上。5.3扫了一眼,立刻报出了漏洞编号。


我们不甘心,这不是我们想要的测试结果,我们不想让它背答案,想让它从头到尾走一遍标准的挖漏洞流程。于是我们清洗了jar,抹掉时间戳,把依赖改成随机名,删掉构建元数据,把一切能一眼认出编号的印记都去掉,重新来。

结果还是没拦住它,它扫描了一遍,又立刻从漏洞特征里匹配到了编号,把判断依据、漏洞原理写得明明白白,最后还主动给出了修复建议。修复建议这项,我们的Prompt里根本没提,是它自己加的。


这种主动性,在前四个编码场景里一次都没出现过。我们测了五个场景,结论越来越清晰,这个模型的能力分布不是均匀的,它明显更擅长,也更愿意做安全相关的事。

怎么发挥GLM-5.3最大价值?

五个场景测完,把结果摆在一起,一个“看人下菜碟”的形象就出来了。

你对它敷衍,它对你敷衍。

简洁的Prompt,换来的是一份能跑但粗糙的交付,树是冰激凌,人是火腿肠。只要你把需求说透,详细到每一个交互和视觉细节,它就能交出惊艳的成品,直接对标你见过的最好水平。在安全这个领域,GLM-5.3甚至不需要你把需求说透,自己就会往前多做一步。

这里我们给几个实际的使用建议。

第一,使用GLM-5.3,需求描述别偷懒,颗粒度直接决定产出,这不是玄学,是我们五个场景对比出来的结果。

第二,网安场景可以放心交给它,静态审计38秒、CVE复现清洗也拦不住,这两项实测是它全场表现最好的地方。

第三,要接受它是个偏科生,别指望一个模型所有场景都满分,挑它擅长的题做。

官方在博客里说了一句值得琢磨的话,模型能力的提升,正在从“模型”转移到“环境”。意思是现在的难点不在让模型变得更聪明,而在给它搭出足够接近真实工作的测试环境。

这场测试也印证了这一点,同一个模型,环境的颗粒度不同,它交出的答卷天差地别。

至于最让人兴奋,也最让人警惕的那部分,是两周后就要开源。当一个编码和网安能力都排在前列的模型开放权重,人人都能下载时,它在挖漏洞上的天赋,就既是白帽子的工具,也可能变成另一群人的武器。

这是GLM-5.3这轮发布最值得盯的问题,比它在benchmark上又涨了几分重要得多。


微信号|TMTweb

公众号|光子星球

别忘了扫码关注我们!

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
59岁港独艺人王喜近况曝光!独自一人坐在床头闷声哭泣,疑精神不太正常

59岁港独艺人王喜近况曝光!独自一人坐在床头闷声哭泣,疑精神不太正常

小徐讲八卦
2026-08-13 12:10:58
15日凌晨WTT大满贯:3-0、3-1!蒯曼剃光头,陈熠丢局,决战美和

15日凌晨WTT大满贯:3-0、3-1!蒯曼剃光头,陈熠丢局,决战美和

江启
2026-08-15 06:42:12
旺旺董事长发内部信:公司面临重大经营危机

旺旺董事长发内部信:公司面临重大经营危机

中国零售信息
2026-08-15 01:03:07
73岁赵雅芝高强度工作引发争议!5天飞了3个地方,接了4个商演,网友:她家到底是多缺钱呀

73岁赵雅芝高强度工作引发争议!5天飞了3个地方,接了4个商演,网友:她家到底是多缺钱呀

火山詩话
2026-08-12 16:26:15
他喘着粗气说“这辈子不松手”时候,我没想过,一句话就是一辈子

他喘着粗气说“这辈子不松手”时候,我没想过,一句话就是一辈子

真实人物采访
2026-08-14 20:10:07
乌克兰发现情况不妙:俄军已恢复苏联时代产能,重磅炸弹随便用

乌克兰发现情况不妙:俄军已恢复苏联时代产能,重磅炸弹随便用

浯江孤舟
2026-08-13 09:49:22
年纪大了,行房要坚持“3不要”,尤其是最后1个,可能伤身!

年纪大了,行房要坚持“3不要”,尤其是最后1个,可能伤身!

小胡军事爱好
2026-08-12 08:58:13
韩国人对自己国家小是没有概念的!同学来旅游 一边道歉一边哭

韩国人对自己国家小是没有概念的!同学来旅游 一边道歉一边哭

石辰搞笑日常
2026-08-13 09:14:38
从宣传国内首家“自研”的厂商,改口到“研发”的手机厂商!网友深扒:去年华为Mate80已经用上这个技术了

从宣传国内首家“自研”的厂商,改口到“研发”的手机厂商!网友深扒:去年华为Mate80已经用上这个技术了

大白聊IT
2026-08-14 01:25:13
心理学:凡是在吃的方面特别舍得、不算计、不计较的人,你就大胆的跟他相处,这样的人大概率人品差不了

心理学:凡是在吃的方面特别舍得、不算计、不计较的人,你就大胆的跟他相处,这样的人大概率人品差不了

心理观察局
2026-08-14 06:34:03
上亿身家一夜归零

上亿身家一夜归零

梳子姐
2026-08-01 20:55:28
直播自杀的26岁女网红已身亡,她最后一句话是:“真的对不起。”可该道歉的人,不是她...

直播自杀的26岁女网红已身亡,她最后一句话是:“真的对不起。”可该道歉的人,不是她...

LULU生活家
2026-08-13 15:24:05
美国将对伊朗实施前所未有的经济措施,这极有可能摧毁伊朗本已脆弱的经济。

美国将对伊朗实施前所未有的经济措施,这极有可能摧毁伊朗本已脆弱的经济。

乐天WMQ
2026-08-14 12:16:33
为啥拥有扬子江入海口深水港的南通非但没成为另一个上海,甚至也没能成为另一个宁波、青岛?

为啥拥有扬子江入海口深水港的南通非但没成为另一个上海,甚至也没能成为另一个宁波、青岛?

向航说
2026-08-09 02:00:03
萨拉赫:努涅斯有着独一档的进攻价值,他是我见过最有终结能力的前锋

萨拉赫:努涅斯有着独一档的进攻价值,他是我见过最有终结能力的前锋

体育闲话说
2026-08-15 06:32:28
美国对中国三蹦子加征1157%关税,结果却被“反将一军”?

美国对中国三蹦子加征1157%关税,结果却被“反将一军”?

叶葉夜
2026-08-09 12:50:03
董路回应拉黑杨毅:跟你不是一路人!你是不是贱?别来蹭我了

董路回应拉黑杨毅:跟你不是一路人!你是不是贱?别来蹭我了

念洲
2026-08-15 06:48:44
高市天塌了!日企高管在华落网,满世界找稀土却遭美紧急断供

高市天塌了!日企高管在华落网,满世界找稀土却遭美紧急断供

叹为观止易
2026-08-14 12:51:35
记者:巴萨目标周一签下罗德里,转会费6500-7000万欧加奖金

记者:巴萨目标周一签下罗德里,转会费6500-7000万欧加奖金

懂球帝
2026-08-15 06:46:05
杨紫零片酬补拍没救活,《簪中录》补拍效果太差,疑似被彻底放弃

杨紫零片酬补拍没救活,《簪中录》补拍效果太差,疑似被彻底放弃

陈意小可爱
2026-08-15 01:12:17
2026-08-15 07:31:00
光子星球 incentive-icons
光子星球
细微之处,看见未来!
1604文章数 2150关注度
往期回顾 全部

科技要闻

苹果为中国训练自有大模型,阿里提供支持

头条要闻

"龙餐馆"原型餐厅合伙人:美军聚餐经常吃一半集体起立

头条要闻

"龙餐馆"原型餐厅合伙人:美军聚餐经常吃一半集体起立

体育要闻

离开雷霆后,威少再也没成为威少

娱乐要闻

郭麒麟瘦到全网认不出,为新剧塑形

财经要闻

便利蜂加盟遭立案:“0元加盟”生意被查

汽车要闻

红旗“家”年华现场:这一次,智能科技成了主角

态度原创

游戏
家居
教育
数码
艺术

国产《古剑》新图美术惊艳 生死交界设定太对味了

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

女儿考上985,快把我们折磨疯了!家长崩溃:早知就让她辍学养老

数码要闻

苹果AirPods Pro 4耳机最新消息汇总:摄像头与手势识别成焦点

艺术要闻

郑板桥笔下野兰竹,藏着中国人最硬的风骨

无障碍浏览 进入关怀版