S2E68 AI 巨頭的秘密:偷買二手書,掃描完就銷毀 Why?
OpenAI 與 Amazon 秘密大量收購 2022 年前出版的二手書並掃描後銷毀,以取得未受 AI 污染的乾淨訓練資料;以色列政府同期花費 90 萬美元成立偽智庫網站,企圖向大型語言模型植入政治偏向觀點。
本頁摘要由 AI 自動生成,著作權屬原節目創作者;可能存在錯誤或遺漏,建議收聽 原節目《矽谷輕鬆談》 以獲取完整資訊。
重點摘要
- OpenAI 執行長 Sam Altman 於 2024 年秘密啟動「巴拿馬計畫」,大批收購 2022 年前出版的二手書並掃描以取得訓練資料,因為那個年份之後的網路內容已有超過三分之一留有 AI 處理痕跡,實體書成為極少數能確保「純人類書寫」的乾淨資料來源。
- 書商發現神秘大批買家後聯絡記者,其中一名 404Media 記者決定在書中藏入 Apple AirTag 追蹤器,最終確認書籍流入拉斯維加斯一個代號 VGT3 的 Amazon 倉庫——該倉庫的標誌是一隻爪子拿著書、正在進食的恐龍,顯示背後是有計畫的組織性採購行動。
- AI 公司連市面上已極難找到的珍本古書也掃描後直接銷毀而非保存,引發社群強烈反彈;Amazon 回應刻意迴避任何 AI 訓練字眼,僅稱「透過合法管道收購、存入自家資料庫」,Anthropic 也在 2025 年被爆出進行類似的秘密收書行動,但受到的輿論衝擊遠小於 Amazon。
- AI 模型的競爭優勢已不再只靠資料量,2023-2024 年初期 Scaling Law 成立後,主流突破方向轉向強化學習(RL)、推論時算力投入(Test Time Compute)、持續學習(讓模型訓練後仍能吸收新知而不必重訓整個大模型),以及讓模型自行設計實驗、生成下一代模型的 RSI(遞迴改良,Recursive Improvement)。
- 以色列政府花費 90 萬美元委託公關公司建立仿美國智庫風格的網站,以中立語氣搭配完整引用,讓 ChatGPT、Gemini 在回答以巴衝突問題時引用並傳遞親以色列政府立場,這是一種針對大型語言模型訓練資料的「資料投毒」攻擊手法。
詳細內容
乾淨資料稀缺危機與 AI 巨頭的秘密收書行動
2022 年 ChatGPT 問世後,現今網路上超過三分之一的內容已帶有 AI 處理痕跡,且這個比例還在持續上升。要訓練新一代模型,就需要不含 AI 生成內容的原始人類文字;2022 年前出版的實體書,成為幾乎唯一能確保「純人類書寫」的乾淨資料來源。
Sam Altman 於 2024 年秘密啟動「巴拿馬計畫」,透過不同買家名義大批採購各類二手書,刻意分散採購主體以避免引起注意。書籍涵蓋主題不限,但每本 ISBN 不重複,確保掃描到不同內容。書商們注意到神秘的大批買家卻始終查不出真正買主,其中一名書商聯絡了 404Media 記者,該記者決定在書中藏入 AirTag 追蹤器以追蹤其去向。最終確認書籍流入拉斯維加斯一個代號 VGT3 的 Amazon 倉庫——該倉庫的標誌是一隻爪子拿著書、正在進食的恐龍,顯示這是有系統規劃的掃描銷毀設施。Anthropic 也在 2025 年被爆出進行類似的秘密收書行動,但受到的輿論衝擊遠小於 Amazon。
最引爭議的是:即使是市面上已極難尋覓的珍本,掃描完成後也直接銷毀,而非保存,在社群上掀起強烈反彈。Amazon 官方回應時完全未提 AI 訓練,僅稱「透過合法管道收購書籍並存入資料庫」。
AI 模型競爭優勢的演進:從資料量到算法突破
乾淨資料固然重要,但 2023-2024 年初期 Scaling Law(規模定律)成立——堆積資料即可提升性能。進入現在,各家已轉向以下方向:
- 強化學習(RL):讓模型透過獎勵機制持續自我優化
- Test Time Compute(推論時算力投入):讓模型在生成答案時投入更多計算,換取更高品質輸出
- 持續學習(Continual Learning):解決模型「知識截止日」限制,讓訓練後的模型持續吸收新知,而不必每次重訓整個大模型(成本與人力耗費極高)
- RSI(遞迴改良,Recursive Improvement):模型自行設計實驗、調整參數與權重,最終產生下一代模型
主持人也點出 AI 開發與傳統軟體的根本差異:傳統軟體新版本通常比舊版本更好,但 AI 模型可能「進一步退兩步」。以 Claude Opus 5 為例:程式設計能力提升了,語感與表達卻明顯退步,答案也變得冗長繞圈。主持人直接建議:若使用 Opus 5 時感覺模型「在說什麼我看不懂」,不是使用者的問題,而是模型問題——換回 Opus 4.8 即可恢復流暢。
以色列政府 90 萬美元的 AI 資料投毒行動
以色列政府花費 90 萬美元,委託公關公司成立一個仿美國智庫風格的網站:文章立場表面中立、引用資料完整、來源標注清晰,外觀與真正的學術報告無異。目標是讓 ChatGPT、Gemini 等大型語言模型在回答以巴衝突相關問題時,抓取並引用這些網站內容,從而輸出帶有親以色列政府立場的回答。
這是一種針對 LLM 知識來源的「資料投毒」攻擊——大型語言模型依賴網路資料作為知識基底,若資料本身被植入政治目的,模型的回答就會在使用者毫無察覺的情況下被悄悄塑造。類似手法也見於提示注入(Prompt Injection)攻擊:在網頁中植入使用者肉眼看不見的隱藏文字,讓 LLM 在解析頁面時接收到背後的隱藏指令。
精選語錄
「如果你覺得自己理解能力變差,我跟你說不是,不是你的問題,是模型的問題,請你換到 Opus 4.8,你會發現正義跟良善都回來了。」
「你的新版本理論上就是會是比舊版本慢慢的變好嘛……但是現在 AI 時代,有的時候你進一步退兩步耶。」
時間軸
- 逐字稿未提供具體時間戳記,以下為主題推進順序:
- 開頭:NordVPN 廣告
- 第一段:乾淨訓練資料危機——2022 年後網頁 AI 污染現況
- 第二段:巴拿馬計畫揭露,AirTag 追蹤事件,Amazon VGT3 倉庫與恐龍標誌
- 第三段:掃描珍本後銷毀引發爭議;Anthropic 2025 年案件被波及
- 第四段:AI 競爭優勢演進——Scaling Law → RL → Test Time Compute → 持續學習 → RSI
- 第五段:Opus 5 語感退步現象,建議換回 Opus 4.8
- 第六段:以色列政府 90 萬美元偽智庫計畫與 AI 資料投毒手法
同節目更多集數
相關主題
- 【微笑台灣Ep.185】烏山頭水庫旁的遊戲村,三合院裡溜滑梯,變身青年創業基地聽天下:天下雜誌Podcast · 2026-08-08
- 【天下零時差08.07.26】台灣「鰻魚王國」為何失守?台鐵開賣鰻魚飯背後,銷日市佔剩5%的崩盤真相聽天下:天下雜誌Podcast · 2026-08-07
- 【流域聲臨S4EP3】島上的守護者:里長第一線看見生態行動如何真正落地社子島?聽天下:天下雜誌Podcast · 2026-08-06
- 【創新突圍】當家不再是堡壘?桃園「防災都更」如何用汗水換取住戶信任聽天下:天下雜誌Podcast · 2026-08-06
- S2E65 OpenAI 駭進 Hugging Face 深入解析:中國開源模型意外成為解方矽谷輕鬆談 · 2026-08-02