你还在纠结要用 GPT、Claude 还是 Gemini 吗?
2026 年 6 月 22 日,日本 AI 独角兽 Sakana AI 丢出一颗震撼弹。他们没有推出另一个「更大更强」的单体模型,而是发布了一款完全不同的东西——Sakana Fugu,一个专门负责「指挥其他模型」的编排大师。
这个策略直接挑战了整个产业的游戏规则。当所有人都在疯狂堆参数、抢 GPU 的时候,Sakana AI 选择了一条截然不同的路:不靠单一模型称霸,而是让多个顶尖 AI 协同作战。
Fugu 到底是什么?它不是模型,是「指挥家」

简单来说,Sakana Fugu 本身是一个语言模型,但它不直接回答你的问题。它的工作是决定让谁来回答。
当你发送一个请求,Fugu 会自动分析任务性质,然后从它的 Agent 池中挑选最适合的模型组合。复杂的程式码问题?呼叫擅长软体工程的专家。高难度数学推论?换上数学强项的模型。需要多步骤验证?它会自动组建一个包含思考者、执行者、验证者的小队。
整个过程对你完全透明。你只需呼叫一个 OpenAI 兼容的 API 端点,背后的模型切换、任务拆分、结果交叉验证,全部由 Fugu 自动完成。
Sakana AI 把这个定位为「集体智能」的实现。他们认为,AI 的下一个前沿不是单一模型的无限扩张,而是如何识别、组合并放大多个模型的互补优势。
两个版本,两种战场

Fugu 目前提供两个版本,針对不同场景设计:
Fugu(标准版):平衡性能与延迟,适合日常编码、程式码审查、聊天机器人等互动场景。你可以把特定 Agent 移出池子以符合数据隐私或合规要求。
Fugu Ultra(旗舰版):调动更深层的专家 Agent 池,专为高难度、高风险问题设计。早期用户已将它用于 Kaggle 竞赛、论文复现、资安分析和专利调查。
两个版本共用同一个 API 端点,你可以根据工作负載自由切换,无需修改整合代码。
硬核数据:它真的比 Opus 4.8 强?

根据 Sakana AI 官方公布的基准测试数据,Fugu Ultra 在多项权威测试中表现亮眼:
| 基准测试 | Fugu Ultra | Opus 4.8 | Gemini 3.1 Pro | GPT 5.5 |
|---|---|---|---|---|
| SWE-Bench Pro | 73.7 | 69.2 | 54.2 | 58.6 |
| LiveCodeBench | 93.2 | 87.8 | 88.5 | 85.3 |
| GPQA-Diamond | 95.5 | 92.0 | 94.3 | 93.6 |
| Humanity’s Last Exam | 50.0 | 49.8 | 44.4 | 41.4 |
| TerminalBench 2.1 | 82.1 | 74.6 | 70.3 | 78.2 |
SWE-Bench Pro 是衡量软体工程能力的黄金标准,Fugu Ultra 的 73.7 分超过了 Opus 4.8 的 69.2。GPQA-Diamond(研究生级科学问答)达到 95.5,是目前公开可用模型中的最高分。
Sakana AI 宣称 Fugu Ultra 在工程、科学和推理基准上与 Anthropic 的 Fable 5、Mythos Preview 站在同一水平线。值得注意的是,Fable 5 和 Mythos Preview 并不在 Fugu 的 Agent 池中,因为它们不是公开可存取的模型。
背后的技术:进化算法 + 强化学习
Fugu 的核心技术来自两篇 ICLR 2026 论文:TRINITY 和 Conductor。
TRINITY 提出了一个輕量级的「进化协调器」。它使用仅约 1 万参数的輕量头部,为选中的 LLM 动态分配 Thinker(思考者)、Worker(执行者)、Verifier(验证者)三种角色。协调器本身透过进化算法优化,不依赖人工设定的规则。
Conductor 则透过强化学习训练出一个「指挥家」,让它自己发现最优的 Agent 通信模式和协作策略。研究发现,RL 训练出来的协调策略往往是「非直觉但高效」的,人类设计师不太会想到那种分工方式。
这意味著 Fugu 的调度逻辑不是写死的 pipeline,而是学出来的。它会动态地从模型池中组装团队,并透过非显而易见但高效的协作模式来协调它们。
更特别的是,Fugu 能够递回呼叫自己。如果第一次的答案不够好,它会重新评估协调策略并再次启动工作流。这被定位为一种新型的测试时缩放(Test-time Scaling),无需重新训练就能在推理时调整计算量。
实战案例:从古籍到股票交易
Sakana AI 展示了六个具体案例,展现 Fugu 在真实场景中的能力:
AutoResearch:Fugu Ultra 自主运行了 123 次实验,在单张 H100 GPU 上耗时约 14 小时,最终取得最优的 BPB 得分(0.9774),超过所有 frontier 竞争者。
日文古籍识别:处理日本历史文献的阅读顺序恢复时,Fugu 达到 NED 0.80,而竞品模型只有 0.24 或直接失败。
魔方求解器:Fugu 生成的纯 Python 程式码成功解出全部 300 个测试魔方,解法步数从未输给对手(7 胜 293 平 0 负)。
CAD 机械设计:设计了一个可运作的虹膜机构,其他模型产出的设计则存在间隙或不完整。
盲棋对弈:连续四局对弈中保持完美准确率。
股票交易:50 周回测中实现 +19.43% 的平均回报,其他 frontier 模型均低于 15%。
价格与商业模式
Fugu 提供订阅制和按量计费两种方式:
订阅制(同时包含 Fugu 和 Fugu Ultra):
- Standard:$20/月
- Pro:$100/月(10 倍 Standard 额度)
- Max:$200/月(20 倍 Standard 额度)
2026 年 7 月前订阅可免费获得第二个月。
按量计费(Fugu Ultra):
- 输入:10)
- 输出:45)
- 缓存输入:$0.50/1M tokens
这个定价与 Opus 4.8 接近,比 Fable 5 便宜不少。
最大卖点:规避单一供应商风险
Fugu 这次主打的叙事不只是性能,还有AI 主权。
底层模型池可以随时替换。如果某家供应商因出口管制断供、涨价或限流,Fugu 会动态切换到其他模型,业务不会中断。Sakana AI 直接把这上升到「新时代 AI 主权解决方案」的高度。
对于把 AI 用在关键基础设施、金融、政务上的组织,这个卖点极具吸引力。你不再需要担心 Anthropic 突然限制境外访问,或某个 API 被无预警关闭。
争议与现实
当然,Fugu 并非没有质疑声音。
有技术开发者指出,Fugu 本身是闭源的调度器,底层还依赖闭源大模型。你以前至少知道自己在用哪个模型,现在连「用了哪个模型、用了多少 token、成本多少」都不知道,完全黑盒。有人直言:「这不就是个 AI 服务包装器吗?」
另有实测显示,虽然 Fugu Ultra 在复杂任务上表现优异,但在某些简单任务上的性价比可能不如直接使用单一模型。例如有团队实测发现,Fugu 的价格比 GLM 5.2 贵了约 17 倍,虽然输出品质更高。
此外,Fugu 的能力上限理论上取决于它 Agent 池中最强的模型。如果没有顶尖模型可用,编排再精妙也难以突破天花板。
结语:2026 是编排模型元年?
Sakana Fugu 的出现,标志著 AI 竞赛正式进入第二阶段。
过去三年,全球 AI 军备竞赛的关键词是参数、算力、单模型跑分。现在,Fugu 证明了另一条路线的可行性:不追求单一模型无敌,而是靠调度整合全球各类 AI,扬长避短。
这条路线的优势显而易见:灵活可控、风险更低、无惧厂商限流或管制。对于开发者和企业来说,这意味著你不再需要押注单一厂商,而是可以透过一个统一介面,获得集体智能的加成。
无论 Fugu 最终能否颠覆现有格局,它至少证明了一件事:AI 的未来,不只属于最大的模型,也属于最聪明的编排者。
如果你对多智能体系统或 AI 编排技术感兴趣,欢迎在下方留言讨论。你觉得「指挥家模型」会成为下一个主流趋势吗?
留言