六月的 AI 圈,註定不平靜。
一邊是 OpenAI 低調上線的 GPT-5.6,在 ChatGPT Pro 後台悄然現身,沒有盛大發布會,卻憑藉 150 萬 token 上下文、3D 生成與瀏覽器自動化能力,在開發者圈引發騷動。
另一邊是智譜 AI 發布的 GLM-5.2,以 MIT 開源協議全開放,號稱在 SWE-bench Pro 程式能力測試中超越 GPT-5.5,讓「開源趕超閉源」的討論再次升溫。
兩款模型,兩條路徑,同一個六月。這不僅是技術參數的較勁,更是兩種商業模式的正面交鋒。
GPT-5.6 偷跑上線:從語言模型到可執行 Agent 的躍進

GPT-5.6 的現身方式很低調。多位 ChatGPT Pro 用戶在後台發現了這個未命名的新模型,經過社群驗證,確認就是傳聞中的 GPT-5.6。
這次升級的重點,已經不再是「聊得更像人」,而是「做得更多事」。
從洩露的測試反饋來看,GPT-5.6 具備三項關鍵能力:視覺複刻、SVG 3D 對象生成、以及 Playwright 瀏覽器自動化。簡單來說,它不再只是一個給建議的對話框,而是一個能真的動起來的執行者。
想像一下:你給它一張設計稿,它能直接還原成可執行的網頁程式;你描述一個 3D 模型,它能生成可以在瀏覽器裡旋轉縮放的 SVG 物件;你告訴它「去幫我訂一張下週去東京的機票」,它能自動打開瀏覽器、點擊、輸入、完成整個流程。
這背後是 OpenAI 的戰略轉向——從「語言模型」邁向「可執行 Agent」。奧特曼要的不是一個更會聊天的機器人,而是一個能接管你所有數位生存空間的超級智能體。
上下文窗口也擴展到了 150 萬 token,相比 GPT-5.5 的 105 萬提升了 43%。這意味著你可以一次性丟給它一整個程式碼庫、一本書、甚至一個專案的全部文件,它都能完整理解並處理。
但閉源模型的問題也很明顯:你永遠不知道它的能力邊界在哪裡,所有升級都由廠商決定,價格也是他們說了算。
GLM-5.2 開源登場:MIT 協議帶來的商業自由度

幾乎在同一時間,智譜 AI 扔出了另一顆炸彈——GLM-5.2 正式發布並開源。
這不是那種「開源但跑不動」的噱頭。模型權重、推理程式碼、部署文件全數擺在 GitHub 和 Hugging Face 上,而且採用最寬鬆的 MIT 許可證。
MIT 協議意味著什麼?簡單來說:你可以免費商用、可以修改、可以閉源衍生,幾乎沒有任何限制,只要在副本中保留原始版權聲明即可。
對於企業來說,這是一張商業應用的黃金通行證。不用擔心授權費用,不用害怕法律風險,拿過來就能用,甚至可以包裝成自己的產品賣。
GLM-5.2 的參數也很有看點:744B 總參數的 MoE 架構,100 萬 token 上下文窗口,最大輸出 128K token。特別是在長程任務和程式生成方面,表現相當突出。
更有意思的是,發布當天,GLM-5.2 就完成了與華為昇騰、平頭哥、摩爾線程、寒武紀等多個國產算力平台的適配。這意味著,不論你用的是什麼硬體,基本上都能跑起來。
開源帶來的不只是免費,更是可控。你可以把模型部署在自己的伺服器上,數據不用出域,不用擔心外洩;你可以根據業務需求微調模型,打造專屬版本;你甚至可以參與社區開發,一起推動模型進化。
但開源模型也有它的問題:部署門檻高、需要專業團隊維護、更新速度通常比閉源慢。對於中小團隊來說,「免費」的代價可能是更高的維護成本。
程式能力對決:SWE-bench 數據背後的真實差距

說了這麼多,兩款模型的真實能力到底誰強誰弱?
我們來看最有說服力的指標——SWE-bench Pro 程式能力測試。這是一個專門用來評估 AI 解決真實軟體工程問題的基準測試,難度很高,能真實反映模型的程式能力。
根據 Artificial Analysis Intelligence Index v4.1 的測評數據,GLM-5.2 以 62.1% 的成績超越了 GPT-5.5 的 58.6%。這個數字很有意思——開源模型在特定任務上,已經開始超越閉源模型了。
但先別急著下結論。
首先,GPT-5.6 剛剛上線,還沒有正式的 SWE-bench 成績。從洩露的測試反饋來看,它的程式推理能力應該比 GPT-5.5 有明顯提升,最終成績很可能會再次拉開差距。
其次,基準測試成績不等於實際體驗。SWE-bench 測的是「解決特定類型問題的能力」,但真實開發場景要複雜得多——理解業務邏輯、與團隊協作、處理遺留程式碼、除錯優化,這些都不是一個分數能完全涵蓋的。
再說,GLM-5.2 的 62.1% 是在特定配置下跑出來的成績。實際使用中,你能不能發揮出它的全部實力,還要看你的硬體配置、提示詞品質、以及使用場景。
比較公允的說法是:在純程式生成這個維度上,開源模型已經追到了閉源模型的腳後跟,差距正在快速縮小。但在綜合能力、多模態體驗、生態整合這些方面,閉源模型依然有明顯優勢。
開發者實戰建議:不同場景下的模型選擇策略

講了這麼多技術細節,對普通開發者來說,最實際的問題永遠是:我該選哪一個?
答案很簡單:看場景。
如果你是個人開發者或小團隊,做的是通用型應用,比如聊天機器人、內容生成、客服系統,那閉源模型依然是性價比最高的選擇。不用管部署、不用管維護、不用管升級,付費就能用,把精力專注在業務邏輯上。GPT-5.6 這類模型的綜合體驗,目前還是開源難以比擬的。
如果你是中大型企業,對數據隱私有嚴格要求,或者需要深度定製模型能力,那開源模型值得認真考慮。GLM-5.2 這種 MIT 協議的模型,可以直接部署在內部環境,數據完全可控,還能根據業務場景微調。長期來看,成本可能比大量調用閉源 API 更低。
如果你做的是邊緣設備、離線應用,或者對延遲有極高要求,那開源幾乎是唯一選擇。你可以把模型量化、壓縮,部署到各種設備上,不用依賴網路連接。
當然,最理想的方案往往是「混合策略」——核心敏感業務用開源模型自建,通用場景用閉源 API 補位。這樣既能保證數據安全,又能享受閉源模型的先進能力。
有一點很重要:不要陷入「參數崇拜」。模型大不大、分數高不高,跟你能不能用好它,是兩回事。提示詞工程、工作流設計、業務理解,這些「軟實力」往往比模型本身更影響最終效果。
六月的這場交鋒,只是一個開始。
閉源模型在加速進化,從「聊天」走向「做事」;開源模型在快速追趕,從「能用」走向「好用」。兩條路徑彼此競爭、互相啟發,最終受益的,是每一個開發者和使用者。
不用急著選邊站。保持開放的心態,了解各自的優勢和限制,根據實際需求做出選擇,才是這個 AI 時代最理性的姿態。
畢竟,工具從來不是目的,解決問題才是。
留言