技術成長

Sakana Fugu 顛覆 AI 競賽:一個會指揮其他模型的「編排大師」

Sakana Fugu 顛覆 AI 競賽:一個會指揮其他模型的「編排大師」

你還在糾結要用 GPT、Claude 還是 Gemini 嗎?

2026 年 6 月 22 日,日本 AI 獨角獸 Sakana AI 丟出一顆震撼彈。他們沒有推出另一個「更大更強」的單體模型,而是發布了一款完全不同的東西——Sakana Fugu,一個專門負責「指揮其他模型」的編排大師。

這個策略直接挑戰了整個產業的遊戲規則。當所有人都在瘋狂堆參數、搶 GPU 的時候,Sakana AI 選擇了一條截然不同的路:不靠單一模型稱霸,而是讓多個頂尖 AI 協同作戰。

Fugu 到底是什麼?它不是模型,是「指揮家」

多智能體協作概念圖

簡單來說,Sakana Fugu 本身是一個語言模型,但它不直接回答你的問題。它的工作是決定讓誰來回答

當你發送一個請求,Fugu 會自動分析任務性質,然後從它的 Agent 池中挑選最適合的模型組合。複雜的程式碼問題?呼叫擅長軟體工程的專家。高難度數學推論?換上數學強項的模型。需要多步驟驗證?它會自動組建一個包含思考者、執行者、驗證者的小隊。

整個過程對你完全透明。你只需呼叫一個 OpenAI 兼容的 API 端點,背後的模型切換、任務拆分、結果交叉驗證,全部由 Fugu 自動完成。

Sakana AI 把這個定位為「集體智能」的實現。他們認為,AI 的下一個前沿不是單一模型的無限擴張,而是如何識別、組合並放大多個模型的互補優勢。

兩個版本,兩種戰場

AI 指揮家學習編排模型概念圖

Fugu 目前提供兩個版本,針對不同場景設計:

Fugu(標準版):平衡性能與延遲,適合日常編碼、程式碼審查、聊天機器人等互動場景。你可以把特定 Agent 移出池子以符合數據隱私或合規要求。

Fugu Ultra(旗艦版):調動更深層的專家 Agent 池,專為高難度、高風險問題設計。早期用戶已將它用於 Kaggle 競賽、論文復現、資安分析和專利調查。

兩個版本共用同一個 API 端點,你可以根據工作負載自由切換,無需修改整合代碼。

硬核數據:它真的比 Opus 4.8 強?

性能基準測試數據可視化圖

根據 Sakana AI 官方公布的基準測試數據,Fugu Ultra 在多項權威測試中表現亮眼:

基準測試 Fugu Ultra Opus 4.8 Gemini 3.1 Pro GPT 5.5
SWE-Bench Pro 73.7 69.2 54.2 58.6
LiveCodeBench 93.2 87.8 88.5 85.3
GPQA-Diamond 95.5 92.0 94.3 93.6
Humanity’s Last Exam 50.0 49.8 44.4 41.4
TerminalBench 2.1 82.1 74.6 70.3 78.2

SWE-Bench Pro 是衡量軟體工程能力的黃金標準,Fugu Ultra 的 73.7 分超過了 Opus 4.8 的 69.2。GPQA-Diamond(研究生級科學問答)達到 95.5,是目前公開可用模型中的最高分。

Sakana AI 宣稱 Fugu Ultra 在工程、科學和推理基準上與 Anthropic 的 Fable 5、Mythos Preview 站在同一水平線。值得注意的是,Fable 5 和 Mythos Preview 並不在 Fugu 的 Agent 池中,因為它們不是公開可存取的模型。

背後的技術:進化算法 + 強化學習

Fugu 的核心技術來自兩篇 ICLR 2026 論文:TRINITYConductor

TRINITY 提出了一個輕量級的「進化協調器」。它使用僅約 1 萬參數的輕量頭部,為選中的 LLM 動態分配 Thinker(思考者)、Worker(執行者)、Verifier(驗證者)三種角色。協調器本身透過進化算法優化,不依賴人工設定的規則。

Conductor 則透過強化學習訓練出一個「指揮家」,讓它自己發現最優的 Agent 通信模式和協作策略。研究發現,RL 訓練出來的協調策略往往是「非直覺但高效」的,人類設計師不太會想到那種分工方式。

這意味著 Fugu 的調度邏輯不是寫死的 pipeline,而是學出來的。它會動態地從模型池中組裝團隊,並透過非顯而易見但高效的協作模式來協調它們。

更特別的是,Fugu 能夠遞迴呼叫自己。如果第一次的答案不夠好,它會重新評估協調策略並再次啟動工作流。這被定位為一種新型的測試時縮放(Test-time Scaling),無需重新訓練就能在推理時調整計算量。

實戰案例:從古籍到股票交易

Sakana AI 展示了六個具體案例,展現 Fugu 在真實場景中的能力:

AutoResearch:Fugu Ultra 自主運行了 123 次實驗,在單張 H100 GPU 上耗時約 14 小時,最終取得最優的 BPB 得分(0.9774),超過所有 frontier 競爭者。

日文古籍識別:處理日本歷史文獻的閱讀順序恢復時,Fugu 達到 NED 0.80,而競品模型只有 0.24 或直接失敗。

魔方求解器:Fugu 生成的純 Python 程式碼成功解出全部 300 個測試魔方,解法步數從未輸給對手(7 勝 293 平 0 負)。

CAD 機械設計:設計了一個可運作的虹膜機構,其他模型產出的設計則存在間隙或不完整。

盲棋對弈:連續四局對弈中保持完美準確率。

股票交易:50 週回測中實現 +19.43% 的平均回報,其他 frontier 模型均低於 15%。

價格與商業模式

Fugu 提供訂閱制和按量計費兩種方式:

訂閱制(同時包含 Fugu 和 Fugu Ultra)

  • Standard:$20/月
  • Pro:$100/月(10 倍 Standard 額度)
  • Max:$200/月(20 倍 Standard 額度)

2026 年 7 月前訂閱可免費獲得第二個月。

按量計費(Fugu Ultra)

  • 輸入:10)
  • 輸出:45)
  • 緩存輸入:$0.50/1M tokens

這個定價與 Opus 4.8 接近,比 Fable 5 便宜不少。

最大賣點:規避單一供應商風險

Fugu 這次主打的敘事不只是性能,還有AI 主權

底層模型池可以隨時替換。如果某家供應商因出口管制斷供、漲價或限流,Fugu 會動態切換到其他模型,業務不會中斷。Sakana AI 直接把這上升到「新時代 AI 主權解決方案」的高度。

對於把 AI 用在關鍵基礎設施、金融、政務上的組織,這個賣點極具吸引力。你不再需要擔心 Anthropic 突然限制境外訪問,或某個 API 被無預警關閉。

爭議與現實

當然,Fugu 並非沒有質疑聲音。

有技術開發者指出,Fugu 本身是閉源的調度器,底層還依賴閉源大模型。你以前至少知道自己在用哪個模型,現在連「用了哪個模型、用了多少 token、成本多少」都不知道,完全黑盒。有人直言:「這不就是個 AI 服務包裝器嗎?」

另有實測顯示,雖然 Fugu Ultra 在複雜任務上表現優異,但在某些簡單任務上的性價比可能不如直接使用單一模型。例如有團隊實測發現,Fugu 的價格比 GLM 5.2 貴了約 17 倍,雖然輸出品質更高。

此外,Fugu 的能力上限理論上取決於它 Agent 池中最強的模型。如果沒有頂尖模型可用,編排再精妙也難以突破天花板。

結語:2026 是編排模型元年?

Sakana Fugu 的出現,標誌著 AI 競賽正式進入第二階段。

過去三年,全球 AI 軍備競賽的關鍵詞是參數、算力、單模型跑分。現在,Fugu 證明了另一條路線的可行性:不追求單一模型無敵,而是靠調度整合全球各類 AI,揚長避短。

這條路線的優勢顯而易見:靈活可控、風險更低、無懼廠商限流或管制。對於開發者和企業來說,這意味著你不再需要押注單一廠商,而是可以透過一個統一介面,獲得集體智能的加成。

無論 Fugu 最終能否顛覆現有格局,它至少證明了一件事:AI 的未來,不只屬於最大的模型,也屬於最聰明的編排者。


如果你對多智能體系統或 AI 編排技術感興趣,歡迎在下方留言討論。你覺得「指揮家模型」會成為下一個主流趨勢嗎?

支持

拍手支持

喜歡這篇就拍幾下,每位讀者最多 10 次。

本次還可拍 10 次

留言

發表留言

留言需審核後才會顯示。