你還在糾結要用 GPT、Claude 還是 Gemini 嗎?
2026 年 6 月 22 日,日本 AI 獨角獸 Sakana AI 丟出一顆震撼彈。他們沒有推出另一個「更大更強」的單體模型,而是發布了一款完全不同的東西——Sakana Fugu,一個專門負責「指揮其他模型」的編排大師。
這個策略直接挑戰了整個產業的遊戲規則。當所有人都在瘋狂堆參數、搶 GPU 的時候,Sakana AI 選擇了一條截然不同的路:不靠單一模型稱霸,而是讓多個頂尖 AI 協同作戰。
Fugu 到底是什麼?它不是模型,是「指揮家」

簡單來說,Sakana Fugu 本身是一個語言模型,但它不直接回答你的問題。它的工作是決定讓誰來回答。
當你發送一個請求,Fugu 會自動分析任務性質,然後從它的 Agent 池中挑選最適合的模型組合。複雜的程式碼問題?呼叫擅長軟體工程的專家。高難度數學推論?換上數學強項的模型。需要多步驟驗證?它會自動組建一個包含思考者、執行者、驗證者的小隊。
整個過程對你完全透明。你只需呼叫一個 OpenAI 兼容的 API 端點,背後的模型切換、任務拆分、結果交叉驗證,全部由 Fugu 自動完成。
Sakana AI 把這個定位為「集體智能」的實現。他們認為,AI 的下一個前沿不是單一模型的無限擴張,而是如何識別、組合並放大多個模型的互補優勢。
兩個版本,兩種戰場

Fugu 目前提供兩個版本,針對不同場景設計:
Fugu(標準版):平衡性能與延遲,適合日常編碼、程式碼審查、聊天機器人等互動場景。你可以把特定 Agent 移出池子以符合數據隱私或合規要求。
Fugu Ultra(旗艦版):調動更深層的專家 Agent 池,專為高難度、高風險問題設計。早期用戶已將它用於 Kaggle 競賽、論文復現、資安分析和專利調查。
兩個版本共用同一個 API 端點,你可以根據工作負載自由切換,無需修改整合代碼。
硬核數據:它真的比 Opus 4.8 強?

根據 Sakana AI 官方公布的基準測試數據,Fugu Ultra 在多項權威測試中表現亮眼:
| 基準測試 | Fugu Ultra | Opus 4.8 | Gemini 3.1 Pro | GPT 5.5 |
|---|---|---|---|---|
| SWE-Bench Pro | 73.7 | 69.2 | 54.2 | 58.6 |
| LiveCodeBench | 93.2 | 87.8 | 88.5 | 85.3 |
| GPQA-Diamond | 95.5 | 92.0 | 94.3 | 93.6 |
| Humanity’s Last Exam | 50.0 | 49.8 | 44.4 | 41.4 |
| TerminalBench 2.1 | 82.1 | 74.6 | 70.3 | 78.2 |
SWE-Bench Pro 是衡量軟體工程能力的黃金標準,Fugu Ultra 的 73.7 分超過了 Opus 4.8 的 69.2。GPQA-Diamond(研究生級科學問答)達到 95.5,是目前公開可用模型中的最高分。
Sakana AI 宣稱 Fugu Ultra 在工程、科學和推理基準上與 Anthropic 的 Fable 5、Mythos Preview 站在同一水平線。值得注意的是,Fable 5 和 Mythos Preview 並不在 Fugu 的 Agent 池中,因為它們不是公開可存取的模型。
背後的技術:進化算法 + 強化學習
Fugu 的核心技術來自兩篇 ICLR 2026 論文:TRINITY 和 Conductor。
TRINITY 提出了一個輕量級的「進化協調器」。它使用僅約 1 萬參數的輕量頭部,為選中的 LLM 動態分配 Thinker(思考者)、Worker(執行者)、Verifier(驗證者)三種角色。協調器本身透過進化算法優化,不依賴人工設定的規則。
Conductor 則透過強化學習訓練出一個「指揮家」,讓它自己發現最優的 Agent 通信模式和協作策略。研究發現,RL 訓練出來的協調策略往往是「非直覺但高效」的,人類設計師不太會想到那種分工方式。
這意味著 Fugu 的調度邏輯不是寫死的 pipeline,而是學出來的。它會動態地從模型池中組裝團隊,並透過非顯而易見但高效的協作模式來協調它們。
更特別的是,Fugu 能夠遞迴呼叫自己。如果第一次的答案不夠好,它會重新評估協調策略並再次啟動工作流。這被定位為一種新型的測試時縮放(Test-time Scaling),無需重新訓練就能在推理時調整計算量。
實戰案例:從古籍到股票交易
Sakana AI 展示了六個具體案例,展現 Fugu 在真實場景中的能力:
AutoResearch:Fugu Ultra 自主運行了 123 次實驗,在單張 H100 GPU 上耗時約 14 小時,最終取得最優的 BPB 得分(0.9774),超過所有 frontier 競爭者。
日文古籍識別:處理日本歷史文獻的閱讀順序恢復時,Fugu 達到 NED 0.80,而競品模型只有 0.24 或直接失敗。
魔方求解器:Fugu 生成的純 Python 程式碼成功解出全部 300 個測試魔方,解法步數從未輸給對手(7 勝 293 平 0 負)。
CAD 機械設計:設計了一個可運作的虹膜機構,其他模型產出的設計則存在間隙或不完整。
盲棋對弈:連續四局對弈中保持完美準確率。
股票交易:50 週回測中實現 +19.43% 的平均回報,其他 frontier 模型均低於 15%。
價格與商業模式
Fugu 提供訂閱制和按量計費兩種方式:
訂閱制(同時包含 Fugu 和 Fugu Ultra):
- Standard:$20/月
- Pro:$100/月(10 倍 Standard 額度)
- Max:$200/月(20 倍 Standard 額度)
2026 年 7 月前訂閱可免費獲得第二個月。
按量計費(Fugu Ultra):
- 輸入:10)
- 輸出:45)
- 緩存輸入:$0.50/1M tokens
這個定價與 Opus 4.8 接近,比 Fable 5 便宜不少。
最大賣點:規避單一供應商風險
Fugu 這次主打的敘事不只是性能,還有AI 主權。
底層模型池可以隨時替換。如果某家供應商因出口管制斷供、漲價或限流,Fugu 會動態切換到其他模型,業務不會中斷。Sakana AI 直接把這上升到「新時代 AI 主權解決方案」的高度。
對於把 AI 用在關鍵基礎設施、金融、政務上的組織,這個賣點極具吸引力。你不再需要擔心 Anthropic 突然限制境外訪問,或某個 API 被無預警關閉。
爭議與現實
當然,Fugu 並非沒有質疑聲音。
有技術開發者指出,Fugu 本身是閉源的調度器,底層還依賴閉源大模型。你以前至少知道自己在用哪個模型,現在連「用了哪個模型、用了多少 token、成本多少」都不知道,完全黑盒。有人直言:「這不就是個 AI 服務包裝器嗎?」
另有實測顯示,雖然 Fugu Ultra 在複雜任務上表現優異,但在某些簡單任務上的性價比可能不如直接使用單一模型。例如有團隊實測發現,Fugu 的價格比 GLM 5.2 貴了約 17 倍,雖然輸出品質更高。
此外,Fugu 的能力上限理論上取決於它 Agent 池中最強的模型。如果沒有頂尖模型可用,編排再精妙也難以突破天花板。
結語:2026 是編排模型元年?
Sakana Fugu 的出現,標誌著 AI 競賽正式進入第二階段。
過去三年,全球 AI 軍備競賽的關鍵詞是參數、算力、單模型跑分。現在,Fugu 證明了另一條路線的可行性:不追求單一模型無敵,而是靠調度整合全球各類 AI,揚長避短。
這條路線的優勢顯而易見:靈活可控、風險更低、無懼廠商限流或管制。對於開發者和企業來說,這意味著你不再需要押注單一廠商,而是可以透過一個統一介面,獲得集體智能的加成。
無論 Fugu 最終能否顛覆現有格局,它至少證明了一件事:AI 的未來,不只屬於最大的模型,也屬於最聰明的編排者。
如果你對多智能體系統或 AI 編排技術感興趣,歡迎在下方留言討論。你覺得「指揮家模型」會成為下一個主流趨勢嗎?
留言