
Anthropic 連夜發表 Claude Sonnet 5:把 Opus 級智能體能力下放到中端,價格只要六成
一句話總結:2026 年 6 月 30 日美東深夜,Anthropic 沒有丟出新一代旗艦,而是把原本只在 Opus 系列才看得到的智能體(agentic)能力,下放到中端的 Sonnet 5。標準 API 價格只有旗艦 Opus 4.8 的 60%,免費用戶同步開放。它一腳踩進的,是企業部署 AI 自動化的最大痛點——成本與可靠性的權衡。
如果說 6 月 27 日 OpenAI 把 GPT-5.6 端上檯面(詳見本站〈GPT-5.6 完整報告〉),AI 圈的注意力還停留在「誰的基準分更高」;6 月 30 日 Sonnet 5 這一發,主旋律直接被改寫:「哪家能把聰明賣成規模」。
一、為什麼是 Sonnet 5,不是 Opus 5?
Anthropic 自己點破了這件事:在官方部落格中,他們承認近一年來智能體能力最顯著的提升主要來自 Opus 系列(4.5、4.7、4.8);Sonnet 系列在開發者圈最受歡迎,但長期處於「日常任務堪用、複雜任務吃力」的位置。
Sonnet 5 的目標,是把 Opus 級的智能體行為下放,並靠價格優勢推動企業大規模部署。換言之,這不是一場針對榜單的衝刺,而是一次產品線內部的階級翻轉。
它對產業的訊號很清楚:前沿模型的天花板已不再是普通企業的瓶頸,瓶頸變成了算力帳單。
二、五項官方基準全面跳漲,一項直接反超 Opus 4.8
Anthropic 在公告中公布了五項主要評估。為了避免讀者被「比前代提升 X%」模糊掉,本文把數字全部攤平,並列出 Opus 4.8 的對照組。Anthropic 同時調整了 HLE 與 OSWorld-Verified 的評分方式,因此 Sonnet 4.6 的「歷史分數」也同步下修。
| 基準 | Sonnet 4.6 | Sonnet 5 | Opus 4.8 | 結論 |
|---|---|---|---|---|
| SWE-bench Pro(智能體程式設計) | 58.1% | 63.2% | 69.2% | 與旗艦差距從 11.1pp 縮到 6pp |
| Terminal-Bench 2.1(終端機操作) | 67.0% | 80.4% | 82.7% | 較前代 +13.4pp,幾乎追平旗艦 |
| Humanity’s Last Exam(無工具) | 34.6%* | 43.2% | 49.8% | +8.6pp |
| Humanity’s Last Exam(有工具) | 46.8%* | 57.4% | 57.9% | 與旗艦僅差 0.5pp |
| OSWorld-Verified(電腦使用) | 78.5%* | 81.2% | 83.4% | +2.7pp |
| GDPval-AA v2(知識工作) | 1395 | 1618 | 1615 | 唯一超越 Opus 4.8 的項目 |
*註:Anthropic 此次同時更新 HLE 與 OSWorld-Verified 的評分模型,Sonnet 4.6 的歷史分數因此被下修。
可以看到三個關鍵訊號:
- 編碼差異快速收斂。SWE-bench Pro 的差距從 11.1 個百分點縮小到 6 個百分點;Terminal-Bench 2.1 上,Sonnet 5 距離 Opus 4.8 只剩 2.3 個百分點。
- 知識工作上首次反超旗艦。GDPval-AA v2 是 Sonnet 5 五項基準裡唯一一項直接超過 Opus 4.8 的——1618 vs 1615,雖然差距小(0.2%),但這是產品定位的關鍵訊號:在真實的 office 任務流裡,「中端模型已經夠用」這句話第一次有了 benchmark 撐腰。
- 單任務成本曲線靠近 Opus 4.8。Anthropic 公布的「努力程度(effort)」梯度圖顯示,Sonnet 5 在中等努力程度下成本效率明顯優於 Opus 4.8;拉到 max effort 時部分任務可直接追上旗艦。
Cursor 內部公布的 CursorBench 3.1 數字也呼應這個趨勢:Sonnet 5 拿到 57%,Sonnet 4.6 是 49%;Cursor 的官方說法是「Sonnet 5 high default 已經接近 Opus 4.8 high,但單任務成本更低」。早期合作客戶 Zapier 提到,原本「進行到一半就卡住」的兩段式自動化任務,Sonnet 5 已能端到端完成。
三、價格:標準 60%、限時 40%,把 Opus 4.8 拉下馬
Sonnet 5 的價格結構分兩段:
- 限時推廣價(至 2026 年 8 月 31 日):輸入每百萬 token 2 美元、輸出每百萬 token 10 美元;
- 標準價(2026 年 9 月 1 日起):輸入 3 美元、輸出 15 美元。
作為對照:旗艦 Opus 4.8 的輸入/輸出分別是 5 美元與 25 美元,Haiku 4.5 是 1 美元與 5 美元。也就是說,Sonnet 5 標準價約為 Opus 4.8 的 60%,推廣期內更低到 40%。
需要留意的兩個細節:
- 重新切換 tokenizer:Anthropic 同時啟用了與 Opus 4.7 類似的 tokenizer。同一段文字在 Sonnet 5 中可能比在 Sonnet 4.6 中多消耗 1.0 到 1.35 倍的 token,具體取決於內容類型。官方說法是「推廣價設計成大致讓用戶成本持平」,但對高吞吐量的企業客戶來說,過帳前還是要對自家 case 做基準測試,不能直接假定帳單不變。
- 速率限制同步調高:為了配合 Sonnet 5 較高的「努力程度」設定帶來的 token 消耗,Chat、Cowork、Claude Code、Claude Platform 的速率限制同步調升。
這兩個變動暗示了一個企業要算的細帳:API 價格只是表面,token 密度才是真正的成本乘數。
四、Sonnet 5 在哪裡可以用?

| 平台 | 狀態 |
|---|---|
| Claude.ai(Free) | ✅ 預設模型 |
| Claude.ai(Pro) | ✅ 預設模型 |
| Claude.ai(Max / Team / Enterprise) | ✅ |
| Claude Code | ✅ |
Claude Platform API(模型 ID:claude-sonnet-5) |
✅ |
| Amazon Bedrock(新版 Messages API) | ✅ |
| Google Cloud Vertex AI | ✅ |
| Microsoft Foundry(preview) | ✅ |
預設模型對 Free 與 Pro 用戶開放,是這次最被低估的訊號——多數人低估了「幾億消費級用戶突然集體切到一個更聰明的模型」會引發的生態連鎖反應,例如工具調用習慣、prompt 慣性、外部應用適配、競品如何應對。
五、安全:沒有「專項訓練」,但比前代強一個台階

Anthropic 在部署前的安全評估中強調:沒有刻意為 Sonnet 5 訓練網路安全任務。差異主要來自通用智能提升帶來的副產品。具體結果:
- 更擅長拒絕惡意請求、對 prompt injection 的抵抗力也更強;
- 幻覺率與迎合性(sycophancy)下降;
- 在自動化行為審計中(涵蓋濫用、欺騙等廣泛不當行為),不當行為發生率低於 Sonnet 4.6;
- 與 Opus 4.8、Mythos Preview 對比時,Sonnet 5 在相同審計中略高——Anthropic 的安全評估採用梯度體系,能力越強的模型對齊表現越好,Sonnet 5 處於中段。
最具體感的是 Firefox 147 漏洞利用測試:與 Mozilla 合作進行的評估中,Sonnet 5 完整成功率 0.0%、部分成功率 13.2%(Sonnet 4.6 為 0.0% / 8.8%);對照 Opus 4.8 是 68.8%,Mythos 5 接近 88.4%。兩個 Sonnet 模型與旗艦在網路攻擊能力上差了一個數量級以上。也因此,Anthropic 為 Sonnet 5 預設啟用了即時網路安全防護——與 Opus 4.7、4.8 等級相同,但低於 Fable 5 的最嚴等級。
如果只看這一段,可能會得出「Sonnet 5 比 Opus 4.8 安全」這類誤判。這是錯的。正確的解讀是:Sonnet 5 在這個維度上還不足以構成危險,但仍保留了低度能力,因此加裝護欄。對企業部署來說,這反而是它更值得使用的理由——能力夠、危險性可控、政府合規更友善。
六、為什麼 Sonnet 5 是在這個時間點?
把鏡頭拉遠,Sonnet 5 的發表不是單一事件,而是 Anthropic 三條敘事的合流:
1. Fable 5 / Mythos 5 解禁的鋪墊
Fable 5 與 Mythos 5(Anthropic 真正最強的同底模型)於 6 月 9 日發表,3 天後即被美國商務部以國家安全為由要求任何外國人在使用前取得許可,導致 Anthropic 無法可靠區分用戶身份,最終在全球下架。6 月 26 日商務部長 Howard Lutnick 宣布 Mythos 5 恢復;6 月 30 日公告全面解禁,Fable 5 與 Mythos 5 將於美東 7 月 1 日重新在 Claude 平台全球上線(公告訊息中由 Anthropic 自行發出)。
對 Anthropic 而言,旗艦層(Fable 5 / Mythos 5)受限,「中端能撐起大部分日常需求」就成了接住用戶的關鍵。Sonnet 5 是這條邏輯下最自然的產物。
2. 加州州政府 50% 折扣與 AI 公共採購
Sonnet 5 發表前一天,加州州長 Gavin Newsom 宣布與 Anthropic 合作,以 50% 折扣向加州所有州政府機構提供 Claude 服務,並附贈免費勞動力訓練,優惠延伸到各市縣。Anthropic 美洲區負責人 Kate Jensen 表示,這是為了「讓 Claude 為維護本州運轉的人們服務」。
政府合約的特質是:簽約週期長、單位價值穩定、可預測。對正在衝刺 IPO 的 Anthropic 來說,這類「重複性收入來源」正好可以補強外界最愛問的兩個問題:營收結構、毛利率。

3. IPO 敘事的最後一塊拼圖

Anthropic 在 2026 年 6 月初向 SEC 秘密提交 S-1;CNBC 稱這將是「科技史上最受審視的公開募股活動」。5 月完成的 H 輪融資 650 億美元,由 Altimeter Capital 與 Sequoia 等共同領投,投後估值 9650 億美元,年化營收超過 470 億美元(從 2 月的 140 億,三個月翻三倍)。
PitchBook 分析師 Harrison Rolfes 點出一個關鍵:所有 AI 公司估值與營收數字最終都要回答毛利率問題,但 Anthropic 的毛利率至今沒對外公開。Sonnet 5 的「標準價只有旗艦 60%、能力 90%」定位,正是要在不犧牲企業付費意願的前提下,把規模做出來——這也是 IPO 故事裡最需要的一塊拼圖。
OpenAI 在 3 月以 8520 億美元估值完成 1220 億美元融資,同樣在籌備 IPO;SpaceX 與 xAI 合併後以 1.77 萬億美元估值上市;Google、Meta 推進自己的企業 AI;亞洲 AI 實驗室也在做類 Mythos 的網路安全能力。競爭已經不是「誰做最強的模型」,而是「誰能把最強的模型賣成企業標配」。
七、該不該切換?三種身分的三種判斷
| 角色 | 判斷 |
|---|---|
| 企業 / 中後台團隊 | 重新評估智能體自動化專案的預算。Sonnet 5 標準價 + 新 tokenizer 對高吞吐量任務可能中性偏貴,但對中等量級的批處理與 RAG 工作流,是明顯的 CPM 下降。先在 30-50% 的流量上做 A/B,不要一次全切。 |
| 個人開發者 | Cursor、Zapier 等合作夥伴的回饋意見一致——多步驟、長任務、跨工具的執行比前代可靠。可以把 Claude Code 的預設模型設到 Sonnet 5,留 Opus 4.8 給極端精度需求的任務。 |
| 一般讀者 / 投資人 | 兩件事值得追蹤:(1) Anthropic 公開招股書時的毛利率數字;(2) Anthropic 在 IPO 前會不會再發一個旗艦(M5?),把 Sonnet 5 推為「史上最具性價比的 Sonnet」標籤的最底層——因為目前的旗艦位置其實擠得有些尷尬。 |
最後一點是 D.A. Davidson 科技研究主管 Gil Luria 對所有前沿 AI 公司共同的提醒:
「儘管 Anthropic 在尖端 AI 模型方面似乎處於領先地位,但他們當前的大部分使用量來自試用和實驗,這可能無法持續。」
實驗性使用轉化為生產部署,才是模型→收入的真正考驗。Sonnet 5 是 Anthropic 為這個命題交出的答案。
八、編者按:本文怎麼來的
- 數據基準:所有 benchmark、價格、安全評估數字皆來自 Anthropic 官方公告與其引用的 Mozilla 評估;多源交叉驗證自虎嗅、騰訊新聞、新浪科技、環球市場播報、上游新聞、第一財經等中文媒體,以及 Reuters、CNBC 等英文媒體報導。
- 官方原始連結:
- Anthropic 部落格:https://www.anthropic.com/news/claude-sonnet-5 (本文截稿時連結經多源媒體交叉引用為官方頁,內容因瀏覽器安全性限制未能直接抓取驗證)
- Claude 平台文件:https://platform.claude.com/docs/en/about-claude/models
- 沒有核實就不會寫進去:Anthropic 內部代號 Fennec、SWE-Bench 上「超過 80.9%」等版本在 2 月初的爆料曾大量流傳,但最後官方並未確認內部代號等細節。本文亦未引用,僅引用官方確認的數字。
- 時間口徑:本文以美東時間為主,必要時註明(例:Fable 5 解禁時間為「美東 7 月 1 日」);亞洲讀者可理解為「台北時間 7 月 2 日凌晨前後」生效。
- 不確定性:
- 重新切換 tokenizer 對企業實際帳單的影響,官方僅說「大致持平」,個案差異由用戶自行基準測試;
- Anthropic 的毛利率至今未對外披露,IPO 估值是否能被基本面支撐是另一個獨立命題;
- 「將 Sonnet 5 設為預設」對話質量的影響、競品如何應對(OpenAI、Google Gemini)需要 2-4 週觀察窗才能下結論。
- 取材於、並非投資建議:本文涉及 Anthropic 與 OpenAI、xAI/SpaceX、Anthropic 政府合約與 IPO 估值等公開訊息,不構成任何證券買賣建議。讀者應自行核實最新公告並評估自身風險承受能力。
本文同步於 ACIEMIND 知識平台發佈,採用創用 CC 姓名標示 4.0 國際授權條款。引用請註明出處。
留言