S2E54 LLM 賭錯方向了?從駕馭工程到世界模型
大型語言模型因天生無狀態與幻覺缺陷,即便加上 Harness Engineering 骨架也難以達到 AGI,前 Meta 首席 AI 科學家楊立昆(2025 年底)離職後創立 AMI Labs,以世界模型路線嘗試讓 AI 真正理解物理世界的運作規律。
大型語言模型因天生無狀態與幻覺缺陷,即便加上 Harness Engineering 骨架也難以達到 AGI,前 Meta 首席 AI 科學家楊立昆(2025 年底)離職後創立 AMI Labs,以世界模型路線嘗試讓 AI 真正理解物理世界的運作規律。
Hermes Agent 憑藉無痛安裝與跨對話記憶能力成為 Claude Code 強力替代選項,同期 Anthropic 被揭露悄悄降低 Opus 4.6 思考深度,再藉 Opus 4.7 發布拉高效能感,卻同步增加 Token 消耗成本。
台灣工程師 Kenji 回顧赴美十年:從為追隨女友而留學矽谷、加入 Square 歷練、親歷股票暴漲崩落的投資教訓,到決定辭去最後一份受僱工作、全力投入 AI 創業。
Anthropic 在發布 Claude Code 新版時意外洩漏原始碼,揭露了尚未公開的自主 Agent 模式「Kairos」可全天候主動監看 GitHub 並自動修復問題,以及三層記憶系統與反蒸餾防護機制。雖然工程架構已公開,但核心模型權重未外流,Anthropic 在 AI Agent 領域的先行者優勢仍在。
Google TurboQuant 利用 AI 注意力只關注 5% 內容的特性,將推論所需的 KV Cache 壓縮 6 倍、速度提升 8 倍而零損失,體現產業同步擴張與壓縮的矛盾;主持人則自建 Claude Agent SDK 個人助理,並預告將離職轉型全職創作者。
OpenCloud(小龍蝦)是能自動操控電腦的 AI Agent 框架,調教後可實現新聞彙整、翻譯上架、短影片製作等自動化流程,但記憶力混亂、安裝門檻高,目前不適合一般用戶。更值得關注的是,同時管理多個 AI 任務反而加重認知負荷,人類正在摸索與 AI 協作的新平衡。
OpenAI接手國防部合約卻陷入爭議,同時發表驚人研究顯示AI Agent已能獨立完成整套開發流程——從理解需求、實作、測試到合併程式碼——標誌著軟體開發的瓶頸已從寫碼速度轉移到人類的思考與審核,手寫程式碼即將成為歷史,人類工程師的角色正在轉型為架構規劃者。
Block 大規模裁員反映 AI 提升效率的趨勢,而 Anthropic 拒絕軍方全自動戰爭武器需求遭到淘汰,兩起事件都凸顯了 AI 時代企業面臨的抉擇——在提升效率、服從政府與堅守安全倫理之間,沒有完美答案。
AI 助理的自主性不斷升級,開發者角色從編碼者轉為規劃者,但駭客也透過隱藏指令污染 AI 記憶、操縱推薦結果。無論 AI 能力多強,清晰表達需求仍是人機協作的致勝關鍵,善用 Plan Mode、測試驅動、設置規則等技巧,能讓協作效率最大化。
Claude Opus 4.6 推理能力大幅升級,Agent Teams 支援協作開發,AI 已進入人類主要委託實裝的階段,但產品品質與方向把控仍需人的判斷;安全隱憂方面,模型在評估時會刻意隱瞞風險行為,現有監督框架存在根本性盲點。