
Anthropic 连夜发表 Claude Sonnet 5:把 Opus 级智能体能力下放到中端,价格只要六成
一句话总结:2026 年 6 月 30 日美东深夜,Anthropic 没有丢出新一代旗舰,而是把原本只在 Opus 系列才看得到的智能体(agentic)能力,下放到中端的 Sonnet 5。标准 API 价格只有旗舰 Opus 4.8 的 60%,免费用户同步开放。它一脚踩进的,是企业部署 AI 自动化的最大痛点——成本与可靠性的权衡。
如果说 6 月 27 日 OpenAI 把 GPT-5.6 端上檯面(详见本站〈GPT-5.6 完整报告〉),AI 圈的注意力还停留在「谁的基准分更高」;6 月 30 日 Sonnet 5 这一发,主旋律直接被改写:「哪家能把聪明卖成规模」。
一、为什么是 Sonnet 5,不是 Opus 5?
Anthropic 自己点破了这件事:在官方部落格中,他们承认近一年来智能体能力最显著的提升主要来自 Opus 系列(4.5、4.7、4.8);Sonnet 系列在开发者圈最受欢迎,但长期处于「日常任务堪用、复杂任务吃力」的位置。
Sonnet 5 的目标,是把 Opus 级的智能体行为下放,并靠价格优势推动企业大规模部署。换言之,这不是一场針对榜单的冲刺,而是一次产品线内部的阶级翻轉。
它对产业的讯号很清楚:前沿模型的天花板已不再是普通企业的瓶颈,瓶颈变成了算力帐单。
二、五项官方基准全面跳涨,一项直接反超 Opus 4.8
Anthropic 在公告中公布了五项主要评估。为了避免读者被「比前代提升 X%」模糊掉,本文把数字全部摊平,并列出 Opus 4.8 的对照组。Anthropic 同时调整了 HLE 与 OSWorld-Verified 的评分方式,因此 Sonnet 4.6 的「历史分数」也同步下修。
| 基准 | Sonnet 4.6 | Sonnet 5 | Opus 4.8 | 结论 |
|---|---|---|---|---|
| SWE-bench Pro(智能体程式设计) | 58.1% | 63.2% | 69.2% | 与旗舰差距从 11.1pp 缩到 6pp |
| Terminal-Bench 2.1(终端机操作) | 67.0% | 80.4% | 82.7% | 较前代 +13.4pp,几乎追平旗舰 |
| Humanity’s Last Exam(无工具) | 34.6%* | 43.2% | 49.8% | +8.6pp |
| Humanity’s Last Exam(有工具) | 46.8%* | 57.4% | 57.9% | 与旗舰仅差 0.5pp |
| OSWorld-Verified(电脑使用) | 78.5%* | 81.2% | 83.4% | +2.7pp |
| GDPval-AA v2(知识工作) | 1395 | 1618 | 1615 | 唯一超越 Opus 4.8 的项目 |
*注:Anthropic 此次同时更新 HLE 与 OSWorld-Verified 的评分模型,Sonnet 4.6 的历史分数因此被下修。
可以看到三个关键讯号:
- 编码差异快速收敛。SWE-bench Pro 的差距从 11.1 个百分点缩小到 6 个百分点;Terminal-Bench 2.1 上,Sonnet 5 距离 Opus 4.8 只剩 2.3 个百分点。
- 知识工作上首次反超旗舰。GDPval-AA v2 是 Sonnet 5 五项基准裡唯一一项直接超过 Opus 4.8 的——1618 vs 1615,虽然差距小(0.2%),但这是产品定位的关键讯号:在真实的 office 任务流裡,「中端模型已经够用」这句话第一次有了 benchmark 撑腰。
- 单任务成本曲线靠近 Opus 4.8。Anthropic 公布的「努力程度(effort)」梯度图显示,Sonnet 5 在中等努力程度下成本效率明显优于 Opus 4.8;拉到 max effort 时部分任务可直接追上旗舰。
Cursor 内部公布的 CursorBench 3.1 数字也呼应这个趋势:Sonnet 5 拿到 57%,Sonnet 4.6 是 49%;Cursor 的官方说法是「Sonnet 5 high default 已经接近 Opus 4.8 high,但单任务成本更低」。早期合作客户 Zapier 提到,原本「进行到一半就卡住」的两段式自动化任务,Sonnet 5 已能端到端完成。
三、价格:标准 60%、限时 40%,把 Opus 4.8 拉下马
Sonnet 5 的价格结构分两段:
- 限时推广价(至 2026 年 8 月 31 日):输入每百万 token 2 美元、输出每百万 token 10 美元;
- 标准价(2026 年 9 月 1 日起):输入 3 美元、输出 15 美元。
作为对照:旗舰 Opus 4.8 的输入/输出分别是 5 美元与 25 美元,Haiku 4.5 是 1 美元与 5 美元。也就是说,Sonnet 5 标准价约为 Opus 4.8 的 60%,推广期内更低到 40%。
需要留意的两个细节:
- 重新切换 tokenizer:Anthropic 同时启用了与 Opus 4.7 类似的 tokenizer。同一段文字在 Sonnet 5 中可能比在 Sonnet 4.6 中多消耗 1.0 到 1.35 倍的 token,具体取决于内容类型。官方说法是「推广价设计成大致让用户成本持平」,但对高吞吐量的企业客户来说,过帐前还是要对自家 case 做基准测试,不能直接假定帐单不变。
- 速率限制同步调高:为了配合 Sonnet 5 较高的「努力程度」设定带来的 token 消耗,Chat、Cowork、Claude Code、Claude Platform 的速率限制同步调升。
这两个变动暗示了一个企业要算的细帐:API 价格只是表面,token 密度才是真正的成本乘数。
四、Sonnet 5 在哪裡可以用?

| 平台 | 状态 |
|---|---|
| Claude.ai(Free) | ✅ 预设模型 |
| Claude.ai(Pro) | ✅ 预设模型 |
| Claude.ai(Max / Team / Enterprise) | ✅ |
| Claude Code | ✅ |
Claude Platform API(模型 ID:claude-sonnet-5) |
✅ |
| Amazon Bedrock(新版 Messages API) | ✅ |
| Google Cloud Vertex AI | ✅ |
| Microsoft Foundry(preview) | ✅ |
预设模型对 Free 与 Pro 用户开放,是这次最被低估的讯号——多数人低估了「几亿消费级用户突然集体切到一个更聪明的模型」会引发的生态连锁反应,例如工具调用习惯、prompt 惯性、外部应用适配、竞品如何应对。
五、安全:没有「专项训练」,但比前代强一个台阶

Anthropic 在部署前的安全评估中强调:没有刻意为 Sonnet 5 训练网路安全任务。差异主要来自通用智能提升带来的副产品。具体结果:
- 更擅长拒绝恶意请求、对 prompt injection 的抵抗力也更强;
- 幻觉率与迎合性(sycophancy)下降;
- 在自动化行为审计中(涵盖滥用、欺騙等广泛不当行为),不当行为发生率低于 Sonnet 4.6;
- 与 Opus 4.8、Mythos Preview 对比时,Sonnet 5 在相同审计中略高——Anthropic 的安全评估采用梯度体系,能力越强的模型对齐表现越好,Sonnet 5 处于中段。
最具体感的是 Firefox 147 漏洞利用测试:与 Mozilla 合作进行的评估中,Sonnet 5 完整成功率 0.0%、部分成功率 13.2%(Sonnet 4.6 为 0.0% / 8.8%);对照 Opus 4.8 是 68.8%,Mythos 5 接近 88.4%。两个 Sonnet 模型与旗舰在网路攻击能力上差了一个数量级以上。也因此,Anthropic 为 Sonnet 5 预设启用了即时网路安全防护——与 Opus 4.7、4.8 等级相同,但低于 Fable 5 的最严等级。
如果只看这一段,可能会得出「Sonnet 5 比 Opus 4.8 安全」这类误判。这是错的。正确的解读是:Sonnet 5 在这个维度上还不足以构成危险,但仍保留了低度能力,因此加装护栏。对企业部署来说,这反而是它更值得使用的理由——能力够、危险性可控、政府合规更友善。
六、为什么 Sonnet 5 是在这个时间点?
把镜头拉远,Sonnet 5 的发表不是单一事件,而是 Anthropic 三条叙事的合流:
1. Fable 5 / Mythos 5 解禁的铺垫
Fable 5 与 Mythos 5(Anthropic 真正最强的同底模型)于 6 月 9 日发表,3 天后即被美国商务部以国家安全为由要求任何外国人在使用前取得许可,导致 Anthropic 无法可靠区分用户身份,最终在全球下架。6 月 26 日商务部长 Howard Lutnick 宣布 Mythos 5 恢复;6 月 30 日公告全面解禁,Fable 5 与 Mythos 5 将于美东 7 月 1 日重新在 Claude 平台全球上线(公告讯息中由 Anthropic 自行发出)。
对 Anthropic 而言,旗舰层(Fable 5 / Mythos 5)受限,「中端能撑起大部分日常需求」就成了接住用户的关键。Sonnet 5 是这条逻辑下最自然的产物。
2. 加州州政府 50% 折扣与 AI 公共采购
Sonnet 5 发表前一天,加州州长 Gavin Newsom 宣布与 Anthropic 合作,以 50% 折扣向加州所有州政府机构提供 Claude 服务,并附赠免费劳动力训练,优惠延伸到各市县。Anthropic 美洲区负责人 Kate Jensen 表示,这是为了「让 Claude 为维护本州运轉的人们服务」。
政府合约的特质是:签约周期长、单位价值稳定、可预测。对正在冲刺 IPO 的 Anthropic 来说,这类「重复性收入来源」正好可以补强外界最爱问的两个问题:营收结构、毛利率。

3. IPO 叙事的最后一块拼图

Anthropic 在 2026 年 6 月初向 SEC 秘密提交 S-1;CNBC 称这将是「科技史上最受审视的公开募股活动」。5 月完成的 H 輪融资 650 亿美元,由 Altimeter Capital 与 Sequoia 等共同领投,投后估值 9650 亿美元,年化营收超过 470 亿美元(从 2 月的 140 亿,三个月翻三倍)。
PitchBook 分析师 Harrison Rolfes 点出一个关键:所有 AI 公司估值与营收数字最终都要回答毛利率问题,但 Anthropic 的毛利率至今没对外公开。Sonnet 5 的「标准价只有旗舰 60%、能力 90%」定位,正是要在不牺牲企业付费意愿的前提下,把规模做出来——这也是 IPO 故事裡最需要的一块拼图。
OpenAI 在 3 月以 8520 亿美元估值完成 1220 亿美元融资,同样在筹备 IPO;SpaceX 与 xAI 合併后以 1.77 万亿美元估值上市;Google、Meta 推进自己的企业 AI;亚洲 AI 实验室也在做类 Mythos 的网路安全能力。竞争已经不是「谁做最强的模型」,而是「谁能把最强的模型卖成企业标配」。
七、该不该切换?三种身分的三种判断
| 角色 | 判断 |
|---|---|
| 企业 / 中后台团队 | 重新评估智能体自动化专案的预算。Sonnet 5 标准价 + 新 tokenizer 对高吞吐量任务可能中性偏贵,但对中等量级的批处理与 RAG 工作流,是明显的 CPM 下降。先在 30-50% 的流量上做 A/B,不要一次全切。 |
| 个人开发者 | Cursor、Zapier 等合作伙伴的回馈意见一致——多步骤、长任务、跨工具的执行比前代可靠。可以把 Claude Code 的预设模型设到 Sonnet 5,留 Opus 4.8 给极端精度需求的任务。 |
| 一般读者 / 投资人 | 两件事值得追踪:(1) Anthropic 公开招股书时的毛利率数字;(2) Anthropic 在 IPO 前会不会再发一个旗舰(M5?),把 Sonnet 5 推为「史上最具性价比的 Sonnet」标签的最底层——因为目前的旗舰位置其实挤得有些尴尬。 |
最后一点是 D.A. Davidson 科技研究主管 Gil Luria 对所有前沿 AI 公司共同的提醒:
「尽管 Anthropic 在尖端 AI 模型方面似乎处于领先地位,但他们当前的大部分使用量来自试用和实验,这可能无法持续。」
实验性使用轉化为生产部署,才是模型→收入的真正考验。Sonnet 5 是 Anthropic 为这个命题交出的答案。
八、编者按:本文怎么来的
- 数据基准:所有 benchmark、价格、安全评估数字皆来自 Anthropic 官方公告与其引用的 Mozilla 评估;多源交叉验证自虎嗅、腾讯新聞、新浪科技、环球市场播报、上游新聞、第一财经等中文媒体,以及 Reuters、CNBC 等英文媒体报导。
- 官方原始连结:
- Anthropic 部落格:https://www.anthropic.com/news/claude-sonnet-5 (本文截稿时连结经多源媒体交叉引用为官方页,内容因浏览器安全性限制未能直接抓取验证)
- Claude 平台文件:https://platform.claude.com/docs/en/about-claude/models
- 没有核实就不会写进去:Anthropic 内部代号 Fennec、SWE-Bench 上「超过 80.9%」等版本在 2 月初的爆料曾大量流传,但最后官方并未确认内部代号等细节。本文亦未引用,仅引用官方确认的数字。
- 时间口径:本文以美东时间为主,必要时注明(例:Fable 5 解禁时间为「美东 7 月 1 日」);亚洲读者可理解为「台北时间 7 月 2 日凌晨前后」生效。
- 不确定性:
- 重新切换 tokenizer 对企业实际帐单的影响,官方仅说「大致持平」,个案差异由用户自行基准测试;
- Anthropic 的毛利率至今未对外披露,IPO 估值是否能被基本面支撑是另一个独立命题;
- 「将 Sonnet 5 设为预设」对话质量的影响、竞品如何应对(OpenAI、Google Gemini)需要 2-4 周观察窗才能下结论。
- 取材于、并非投资建议:本文涉及 Anthropic 与 OpenAI、xAI/SpaceX、Anthropic 政府合约与 IPO 估值等公开讯息,不构成任何证券买卖建议。读者应自行核实最新公告并评估自身风险承受能力。
本文同步于 ACIEMIND 知识平台发布,采用创用 CC 姓名标示 4.0 国际授权条款。引用请注明出处。
留言