跳至主要內容

搜尋摘要

目錄
矽谷輕鬆談 節目封面
00:21:41 ~4 分鐘

S2E63 Sakana Fugu 不訓練模型改當指揮官,效能直逼 Anthropic Fable 5?

Sakana AI 是來自東京的日本 AI 新創,以 7B 指揮官模型調度 Claude Opus、GPT-4 Turbo、Gemini 三大前沿模型協同完成任務,旗艦產品 Fugu Ultra 宣稱效能媲美 Claude Fable 5,但實測揭示速度極慢、token 消耗極高,輸出品質未達 Fable 5 水準。

在 Apple Podcasts 收聽

本頁摘要由 AI 自動生成,著作權屬原節目創作者;可能存在錯誤或遺漏,建議收聽 原節目《矽谷輕鬆談》 以獲取完整資訊。

重點摘要

  • Sakana AI 是罕見的日本 AI 新創(總部東京),創辦人包含前 Google Brain 研究員 David Ha(CEO)與 2017 年 Transformer 論文八位共同作者之一的 Llion Jones(CTO)
  • 公司核心策略:不自行從頭訓練大模型,而是以「演化與集體智慧」組合現有前沿模型,繞開與美中 AI 大廠在算力上的直接競爭
  • Fugu Ultra 以一個 7B 參數、強化學習(RL)訓練的指揮官模型,將請求拆解為多個子任務,依模型特長分配給 Claude Opus(程式碼與自然語言)、GPT-4 Turbo(數學推理)、Gemini(事實查詢與科學研究)執行
  • 自家 Benchmark 顯示 Fugu Ultra 部分指標追平 Claude Fable 5,但實測結果「又慢、又貴、品質仍不如 Claude Fable 5」——主持人儲值 20 美元,輸入一個 prompt 後費用立即耗盡,最終輸出甚至不及 Claude Opus 4.8
  • 主持人預測 Sakana AI 作為公司可能很快被市場淡忘,但「組合現有模型提升能力」的概念具有長期生命力,各大模型開發商也可能採用類似架構

詳細內容

Sakana AI 是誰,為何值得關注?

Sakana AI 於 2023 年成立,總部位於東京,在 AI 公司幾乎清一色來自美國或中國的格局下顯得罕見。CEO David Ha 曾在 Google Brain(2016—2022 年)擔任研究員,後赴 Stable Diffusion 開發商 Stability AI 擔任管理職;CTO Llion Jones 則是 2017 年 Google 劃時代論文「Attention Is All You Need」(奠定現代大型語言模型基礎的 Transformer 架構)的八位共同作者之一。主持人特別提到,DeepMind 執行長 Demis Hassabis 與同事 John Jumper 因 AlphaFold 研究共同獲得 2024 年諾貝爾化學獎,但 Jumper 近期也已離職,顯示 AI 頂尖人才正在大規模流動。

核心策略:組合而非自訓,繞開算力軍備競賽

Sakana AI 明確放棄「砸錢買 GPU、累積算力、訓練更大模型」的路線。創辦人在公開訪談中坦言:身為日本公司,資源先天受限,若走傳統路線「本質上是最後一定會輸的」。其替代策略是利用演化演算法與集體智慧,把 Claude Opus(Anthropic)、GPT-4 Turbo(OpenAI)、Gemini(Google)等已有的前沿模型組合起來,試圖讓整體能力超越任何單一模型。中國開源模型(如 Zhipu AI 的 GLM 系列)同期表現已直逼美國頂尖基礎模型,Sakana AI 的定位是在美中 AI 對抗的夾縫中走第三條路。

Fugu Ultra 的運作原理:7B 指揮官 + 多模型協作

Fugu Ultra 採用兩層架構:

指揮官模型(7B 參數,強化學習訓練):接收使用者請求後,生成一套工作流程,具體決定三件事——任務要拆成哪些子步驟、每個子步驟交給哪個模型執行、以及每個執行模型可參考前面哪幾步的輸出。指揮官輸出的是自然語言 prompt(非程式碼),屬端到端訓練。獎勵函數設計較簡單:格式錯誤得 0 分、格式正確但答案錯得 0.5 分、答案正確得 1 分。

執行模型(依特長分配):GPT 系列負責數學推理、Claude Opus 系列負責程式碼與自然語言、Gemini 系列負責事實查詢與科學研究。對於複雜任務,可多層遞迴——在某個子任務中再嵌入一個指揮官,持續往下拆解,理論上可無限延伸。整個流程的 API 格式與 OpenAI 相容,使用者無需修改現有程式碼即可切換。

實測結果 vs. 官方 Benchmark

Sakana AI 自家 Benchmark 顯示 Fugu Ultra 在部分指標超越 Claude Fable 5,並全面超越 Opus、GPT、Gemini 的單一模型——邏輯上「用三個模型組合」確實應優於任一個別模型。但主持人指出,當前多數 Benchmark 已被針對性優化而失去參考價值。

主持人與社群的實際使用結果:

  • 速度極慢:需整合多個模型的回應再統整,等待時間明顯偏長
  • 費用極高:主持人儲值 20 美元,輸入一個 prompt 後費用立即耗盡
  • 輸出品質不如預期:最終輸出結果甚至不及 Claude Opus 4.8,遠不及 Claude Fable 5 上市時明顯的品質躍升感
  • 社群回饋:「概念方向正確」,但實際體驗是「又慢、又貴、還沒更好」

長期展望:概念比公司更耐久

主持人認為 Sakana AI 這間公司可能很快被市場淡忘,更深層的風險在於:若 6 個月後前沿模型能力大幅躍升,現有的整套「模型調度工程」架構可能需要從頭重新設計,因為新模型可能不再需要這些組合機制就能直接達到目標。不過「組合現有模型提升能力」的概念具有長期生命力,各大模型開發商也可能以類似方式整合自家不同規模的模型。

精選語錄

如果他們跟大家一樣,去砸錢,去買 GPU,去買算力,去用更多的 Data,想辦法去蓋出更強的模型,這件事情本質上是最後一定會輸的。

Fable 5 當時一使用的時候就說,這個顯著的好,你體感上就感覺到這個 Fable 5 有一個值的提升,你看得出來這個畫面是更好的……可是 Fugu Ultra 聲稱它的 benchmark 上的表現是跟 Fable 差不多的,但我們自己實測的感覺是,其實沒有。

我就先儲值 20 塊美金去用一個 prompt 去產生,結果 20 塊已經燒完了,結果他還在 debug,然後我把這個半成品開起來,發現這個畫面真的是不太行。

時間軸

  • 開場:介紹 Sakana AI 推出 Fugu 模型,在美中 AI 大廠夾縫中殺出的日本新創
  • 中前段:Sakana AI 公司背景、創辦人介紹(David Ha / Llion Jones)、選擇「組合模型」路線的原因
  • 中段:Fugu 與 Fugu Ultra 的差異;Fugu Ultra 運作原理詳解(指揮官模型架構、強化學習、獎勵函數)
  • 中後段:Benchmark 表現說明與侷限性分析;各模型特長分工說明
  • 後段:主持人實測結果、社群回饋彙整
  • 結尾:主持人對 Sakana AI 長期發展的觀點,以及「模型調度被下一代模型能力取代」的風險

相關主題