(来源:李秀奇 Datawhale)
Datawhale干货
作者:李秀奇,Datawhale成员
昨天智谱发布了最新大模型 GLM-5.3。
据官方所说,GLM-5.3在复杂软件工程、终端操作和更广泛的真实世界 Agent任务上均取得非常显著的进步。
我们当天就安排了实测。接入了 DeepSeek Harness,拉上 GPT-5.6-Sol 做了一场同题实测。
题目是生产级抠图 Web 应用。这里说的「生产级」,指具备账号体系、异常处理、可部署交付、有项目文档的完整应用,不是跑通了 demo 就算。九条验收标准从 A1 可运行、A2 账号体系一直到 A9 项目文档,覆盖了应用上线前该有的每一关。
国产模型加国产 Agent 框架,真写起一套完整应用,能不能和国际顶流掰掰手腕?
先说结论:能,而且差距比我们预想得小。
GLM-5.3 这个版本的整体完成度,和 GPT-5.6-Sol 的差距比我们想象的小。工程细节的完备度上,甚至更像一份真的要上线的交付物。
一、快速上手:把 GLM-5.3 接入 DeepSeek Harness
在看实测结果之前,先解决一个最实际的问题:怎么把 GLM-5.3 接进 DeepSeek Harness。
我们已经把环境准备、模型接入和测试环境搭建整理成了一份保姆级教程。步骤都写清楚了,新手照着做,15 分钟左右就能跑通。
完整 PRD:九条生产级验收标准GLM-5.3 获取地址:https://www.bigmodel.cn/glm-coding
接好之后,就可以把自己的任务交给 GLM-5.3 跑起来。下面来看这次实测的结果。
二、GLM-5.3+DeepSeek Harness 生产级任务实测
真实开发里,难的是工程意识。上线稳不稳、异常处理全不全、边界条件有没有考虑到,这些东西 demo 测不出来,真正上线时才会暴露问题。
所以我们这次的实测让模型从零完成一款生产级抠图 Web 应用,覆盖算法、前后端、账号体系、异常处理、部署和项目文档。
它主要看两件事:核心功能能不能完成,以及代码是否具备继续交付的工程细节。抠图效果用 SAD、MSE、Grad 三项指标衡量,工程部分按九条标准验收。
实测一:前端设计与风格控制
GPT-5.6-Sol 版界面:暗色玻璃拟态风格GLM-5.3 版界面:亮色扁平工具风格社区总结过 AI 生成前端的典型特征:紫蓝渐变、玻璃拟态、发光阴影、hover 弹跳、统一大圆角。五条全中,基本就是 AI 写的。
对照这张清单看两个版本。GPT-5.6-Sol 版几乎全中:暗色底、青蓝紫渐变、玻璃拟态卡片、发光阴影,是现在 AI 工具界面最常见的长相。GLM-5.3 版逐条规避:亮色扁平工具风、单一靛蓝强调色、1px 描边、零投影。
为什么会这样?我猜测原因是,有视觉能力的模型会截图自查,忠实实现需求里描述的样子,但需求描述的不一定就是好设计。描述里说深色科技感,它就给你玻璃拟态加紫蓝渐变,不会质疑这个方向对不对。没有视觉反馈的模型做前端只能靠代码层面的设计惯例,反而不会被平庸的描述带跑偏。
这只是现象,为什么会是这样,我倾向于和视觉反馈回路有关,但证实不了。
实测二:交互细节与功能完整度
风格是主观偏好,但细节有客观对错。
GPT 版下拉菜单里「快速算法」那个选项,白底浅灰字,在深色背景上几乎看不清。我们把两个版本的同一位置放大对比。
GPT-5.6-Sol 版下拉菜单对比度缺陷
GLM-5.3 版同一位置:对比度正常这是最基础的可访问性问题。
对比视图的放大镜,GPT 版在分割线右侧永远采的是结果侧的图像,你在右边放大镜里看到的是抠完图的结果和抠完图的结果对比,失去了意义;GLM 版在分割线两侧分别采样原图和结果图,对比是真对比。历史任务的删除,GPT 版只有 API 层面的接口,界面上没有按钮;GLM 版有删除按钮,直接在界面上就能操作。
实测三:服务端安全与会话管理
这一代 GLM 发布时主打的一个方向是安全能力,官方公布过它在白盒代码审查、漏洞推理这类任务上的表现。更值得关注的是,这种能力会不会渗透到它日常写的业务代码里。
看服务端代码,两个版本的差异很直接。我们实测了两个点。
第一个点,登录限流。我们对两个版本连续发了 12 次错误登录请求。GLM 版前 10 次正常返回参数错误,第 11 次开始返回 429,提示尝试过于频繁,一分钟后才能再试。GPT 版 12 次全部放行,可以无限尝试。也就是说,GPT 版的登录接口对暴力破解是敞开的,GLM 版默认就防了。
第二个点,安全响应头。GLM 版的每个响应都带三个安全头:X-Content-Type-Options 防 MIME 嗅探、X-Frame-Options 防点击劫持、Referrer-Policy 控制来源信息泄漏。GPT 版的响应里一个都没有。这三个头是上线前安全扫描的必查项,漏了任何一个,扫描报告都会亮红。
代码里还有一处:GLM 版的会话过期后会自动清理,启动时清一次,运行中每小时清一次;GPT 版的过期会话永久留在数据库里。
这些差异在界面上完全看不到,功能清单里也不会列。但只要真上线,缺了它们迟早出事。GLM-5.3 这个版本交付的代码,默认就带了安全扫描要查的东西;GPT 版要上线,这些得人工补一遍。
实测四:需求理解与功能扩展
GLM-5.3 这个版本多做了两个功能。
一个是历史任务重跑。GPT 版想调参数重跑同一张图,只能重新上传。GLM 版在服务端留存了原图和 trimap,调完参数点重跑就能生成新任务,前后对比很方便。调参的人都懂,同一张图反复跑是常态。
另一个是批量评测。一键跑 9 张示例图,弹窗出 SAD、MSE、Grad 的对照表,还能导出 CSV(逗号分隔值文件)。改完一版算法想知道整体升了还是降了,点一下就行。
批量评测功能:一键跑 9 张示例图出指标对照表这两个功能在清单之外,是这个版本自己补的。
三、实测结果:核心功能打平,工程细节有差距
实际测试下来,GLM-5.3 和 GPT-5.6-Sol 都完成了 PRD 的核心需求。核心功能和算法效果基本打平,但在前端细节、AI 味规避和服务端安全上,GLM 版做得更完整。
GLM-5.3+DeepSeek Harness:
GPT-5.6-Sol+DeepSeek Harness:
核心功能覆盖和算法基线效果两项打平。PRD 的要求两边都做了,算法也都是经典 closed-form方法的合格实现。
前端风格则各有偏好,GPT 版走视觉冲击力路线,GLM 版走克制工具风路线。
GLM-5.3 这个版本的交付完成度超出预期,加码的是质量细节。
单个任务的实测,得不出通用能力排名。GLM-5.3 不支持视觉输入,需要像素级精细调整的前端场景是它的劣势。测试环境是本地单机,生产环境表现可能不同。
四、不想自己接插件,可以直接用 ZCode
DeepSeek Harness 的思路是「一切皆插件」。模型、工具和工作流都能按自己的需求往里接,更灵活;但相应地,插件需要自己选择、配置和维护。
如果不想自己做插件,可以直接用智谱官方出品的 ZCode。它把 Agent、项目文件、终端、任务过程和代码审查放进同一个桌面工作台,默认集成更完整,可以开箱即用。
写在最后:GLM-5.3,更值得看的是后训练
跑完这次实测,再回头看官方披露的训练细节,GLM-5.3 的后训练值得单独说说。
智谱在技术博客里提到,GLM-5.3的能力相比 GLM-5.2 整体提升了 50%,这部分提升全部来自后训练。放到这次测试里看,这个数字就有了具体的样子:登录限流、安全响应头、会话清理,以及需求之外主动补上的功能,都不是模型把代码写出来就够了,它还得知道一套真正要交付的应用应该长什么样。
当然,单次测试没法把每个差异都直接归因于后训练。但 GLM-5.3 已经说明,模型能力的提升不只靠换一个更大的底座。怎么让模型在真实任务里学会判断、取舍和补全,同样重要。
所以接下来更值得期待的是:如果这套后训练方法放到更大的基座上,效果还能走到哪一步。
想自己试试的朋友,可以先看我们 8 月 13 日发的 DSH 保姆教程把框架搭起来。