六月的 AI 圈,注定不平静。
一边是 OpenAI 低调上线的 GPT-5.6,在 ChatGPT Pro 后台悄然现身,没有盛大发布会,却凭藉 150 万 token 上下文、3D 生成与浏览器自动化能力,在开发者圈引发騷动。
另一边是智谱 AI 发布的 GLM-5.2,以 MIT 开源协议全开放,号称在 SWE-bench Pro 程式能力测试中超越 GPT-5.5,让「开源赶超闭源」的讨论再次升温。
两款模型,两条路径,同一个六月。这不仅是技术参数的较劲,更是两种商业模式的正面交锋。
GPT-5.6 偷跑上线:从语言模型到可执行 Agent 的跃进

GPT-5.6 的现身方式很低调。多位 ChatGPT Pro 用户在后台发现了这个未命名的新模型,经过社群验证,确认就是传聞中的 GPT-5.6。
这次升级的重点,已经不再是「聊得更像人」,而是「做得更多事」。
从泄露的测试反馈来看,GPT-5.6 具备三项关键能力:视觉复刻、SVG 3D 对象生成、以及 Playwright 浏览器自动化。简单来说,它不再只是一个给建议的对话框,而是一个能真的动起来的执行者。
想像一下:你给它一张设计稿,它能直接还原成可执行的网页程式;你描述一个 3D 模型,它能生成可以在浏览器裡旋轉缩放的 SVG 物件;你告诉它「去帮我订一张下周去东京的机票」,它能自动打开浏览器、点击、输入、完成整个流程。
这背后是 OpenAI 的战略轉向——从「语言模型」迈向「可执行 Agent」。奥特曼要的不是一个更会聊天的机器人,而是一个能接管你所有数位生存空间的超级智能体。
上下文窗口也扩展到了 150 万 token,相比 GPT-5.5 的 105 万提升了 43%。这意味著你可以一次性丢给它一整个程式码库、一本书、甚至一个专案的全部文件,它都能完整理解并处理。
但闭源模型的问题也很明显:你永远不知道它的能力边界在哪裡,所有升级都由厂商决定,价格也是他们说了算。
GLM-5.2 开源登场:MIT 协议带来的商业自由度

几乎在同一时间,智谱 AI 扔出了另一颗炸弹——GLM-5.2 正式发布并开源。
这不是那种「开源但跑不动」的噱头。模型权重、推理程式码、部署文件全数摆在 GitHub 和 Hugging Face 上,而且采用最宽松的 MIT 许可证。
MIT 协议意味著什么?简单来说:你可以免费商用、可以修改、可以闭源衍生,几乎没有任何限制,只要在副本中保留原始版权声明即可。
对于企业来说,这是一张商业应用的黄金通行证。不用担心授权费用,不用害怕法律风险,拿过来就能用,甚至可以包装成自己的产品卖。
GLM-5.2 的参数也很有看点:744B 总参数的 MoE 架构,100 万 token 上下文窗口,最大输出 128K token。特别是在长程任务和程式生成方面,表现相当突出。
更有意思的是,发布当天,GLM-5.2 就完成了与华为昇腾、平头哥、摩尔线程、寒武纪等多个国产算力平台的适配。这意味著,不论你用的是什么硬体,基本上都能跑起来。
开源带来的不只是免费,更是可控。你可以把模型部署在自己的伺服器上,数据不用出域,不用担心外泄;你可以根据业务需求微调模型,打造专属版本;你甚至可以参与社区开发,一起推动模型进化。
但开源模型也有它的问题:部署门槛高、需要专业团队维护、更新速度通常比闭源慢。对于中小团队来说,「免费」的代价可能是更高的维护成本。
程式能力对决:SWE-bench 数据背后的真实差距

说了这么多,两款模型的真实能力到底谁强谁弱?
我们来看最有说服力的指标——SWE-bench Pro 程式能力测试。这是一个专门用来评估 AI 解决真实软体工程问题的基准测试,难度很高,能真实反映模型的程式能力。
根据 Artificial Analysis Intelligence Index v4.1 的测评数据,GLM-5.2 以 62.1% 的成绩超越了 GPT-5.5 的 58.6%。这个数字很有意思——开源模型在特定任务上,已经开始超越闭源模型了。
但先别急著下结论。
首先,GPT-5.6 刚刚上线,还没有正式的 SWE-bench 成绩。从泄露的测试反馈来看,它的程式推理能力应该比 GPT-5.5 有明显提升,最终成绩很可能会再次拉开差距。
其次,基准测试成绩不等于实际体验。SWE-bench 测的是「解决特定类型问题的能力」,但真实开发场景要复杂得多——理解业务逻辑、与团队协作、处理遗留程式码、除错优化,这些都不是一个分数能完全涵盖的。
再说,GLM-5.2 的 62.1% 是在特定配置下跑出来的成绩。实际使用中,你能不能发挥出它的全部实力,还要看你的硬体配置、提示词品质、以及使用场景。
比较公允的说法是:在纯程式生成这个维度上,开源模型已经追到了闭源模型的脚后跟,差距正在快速缩小。但在综合能力、多模态体验、生态整合这些方面,闭源模型依然有明显优势。
开发者实战建议:不同场景下的模型选择策略

讲了这么多技术细节,对普通开发者来说,最实际的问题永远是:我该选哪一个?
答案很简单:看场景。
如果你是个人开发者或小团队,做的是通用型应用,比如聊天机器人、内容生成、客服系统,那闭源模型依然是性价比最高的选择。不用管部署、不用管维护、不用管升级,付费就能用,把精力专注在业务逻辑上。GPT-5.6 这类模型的综合体验,目前还是开源难以比拟的。
如果你是中大型企业,对数据隐私有严格要求,或者需要深度定制模型能力,那开源模型值得认真考虑。GLM-5.2 这种 MIT 协议的模型,可以直接部署在内部环境,数据完全可控,还能根据业务场景微调。长期来看,成本可能比大量调用闭源 API 更低。
如果你做的是边缘设备、离线应用,或者对延迟有极高要求,那开源几乎是唯一选择。你可以把模型量化、压缩,部署到各种设备上,不用依赖网路连接。
当然,最理想的方案往往是「混合策略」——核心敏感业务用开源模型自建,通用场景用闭源 API 补位。这样既能保证数据安全,又能享受闭源模型的先进能力。
有一点很重要:不要陷入「参数崇拜」。模型大不大、分数高不高,跟你能不能用好它,是两回事。提示词工程、工作流设计、业务理解,这些「软实力」往往比模型本身更影响最终效果。
六月的这场交锋,只是一个开始。
闭源模型在加速进化,从「聊天」走向「做事」;开源模型在快速追赶,从「能用」走向「好用」。两条路径彼此竞争、互相启发,最终受益的,是每一个开发者和使用者。
不用急著选边站。保持开放的心态,了解各自的优势和限制,根据实际需求做出选择,才是这个 AI 时代最理性的姿态。
毕竟,工具从来不是目的,解决问题才是。
留言