跳至主要內容

搜尋摘要

矽谷輕鬆談 節目封面
收聽 00:18:46 閱讀約 5 分鐘

S2E67 AI 浮水印深入解析:為什麼 OpenAI 做好了卻不敢用?

歐盟 AI 法案於 2026 年 8 月 2 日生效,要求所有新模型文字、圖片、聲音、影像輸出須嵌入浮水印;文字浮水印靠「綠紅組別機率偏移」讓選字留下統計指紋,但私鑰不互通與跨模型改寫是現行方案的核心弱點。

在 Apple Podcasts 收聽

本頁摘要由 AI 自動生成,著作權屬原節目創作者;可能存在錯誤或遺漏,建議收聽 原節目《矽谷輕鬆談》 以獲取完整資訊。

重點摘要

  • 歐盟 AI 法案 2026 年 8 月 2 日生效,新模型立即須符合規範,舊模型有四個月緩衝期,最晚 2026 年 12 月 2 日前也必須加入浮水印功能;因為模型無法判斷使用者所在地區,這項規定實際上影響全球所有使用者,不限歐盟境內。
  • Google 於 2023 年率先推出 SynthID 架構,圖片、影像、聲音三種模態的浮水印原理類似:訓練成對的 encoder(嵌入浮水印)與 decoder(偵測浮水印)神經網路,浮水印以人眼不可見的方式藏入內容(如微調像素亮度、加入噪點),偵測時輸出 0 到 1 的機率值而非二元判定。
  • 文字浮水印在 AI 生成每個字時,用前文加上秘密私鑰產生種子,把候選字隨機分為「綠色組」(稍微提高被選機率)與「紅色組」(稍微降低機率),使輸出在統計上留下可偵測的綠色偏移;為避免必然性答案(如「1+1=2」中的「2」若被分入紅色組就無法輸出),設計上只調整機率而不完全禁止紅色組字。
  • OpenAI 在 2024 年開發出準確率號稱 99.99% 的文字浮水印,但問卷顯示有 30% 用戶表示加上浮水印後會減少使用頻率,功能因此被整個擱置至今;主持人指出到 2026 年 AI 已成職場標配,若重做問卷,答案可能截然不同。
  • 現行 AI 浮水印有兩大結構性弱點:一是私鑰由各家廠商各自管理,只有各自的廠商能操作自己的私鑰,沒有跨平台通用驗證機制;二是用模型 A(如 Gemini)生成帶有浮水印的文字,交由模型 B(如 Claude)改寫後,改寫文字既不符合 A 的私鑰統計特徵,也不帶有 B 的浮水印,因此落入雙方驗證系統都無法識別的灰色地帶。

詳細內容

歐盟 AI 法案與浮水印義務

歐盟《人工智慧法案》的浮水印條款於 2026 年 8 月 2 日正式生效,要求所有新推出的 AI 模型,無論生成的是文字、圖片、聲音或影像,都必須在輸出內容中嵌入可識別的 AI 浮水印。2026 年 8 月 2 日前已存在的舊模型享有四個月緩衝期,須於 2026 年 12 月 2 日前完成浮水印功能部署。

這項規定的實際影響範圍遠超歐盟境內:因為模型本身無法識別使用者是否身處歐盟,主流 AI 服務商(包括已宣布跟進的 Anthropic)若要繼續對全球用戶開放服務,等同必須將浮水印功能套用到所有輸出,台灣用戶也在影響範圍內。

圖片、影像、聲音的 SynthID 架構

Google 是 AI 浮水印的先驅,2023 年推出 SynthID 架構,最初應用於圖片,後擴展至影像與聲音。三種模態的技術原理類似:

  • 嵌入端(Encoder):針對不同媒體格式產生浮水印 pattern,以人眼不可辨識的方式植入(如微調特定像素亮度、加入微量噪點)。
  • 偵測端(Decoder / Detector):配對訓練的神經網路,輸出 0 到 1 之間的機率值(例如 0.9 代表 90% 機率為 AI 生成),而非二元結論。

兩個網路是配對訓練的,因此對常見後製處理(如壓縮、裁切)具有一定容錯能力。

文字浮水印的機制:綠紅組別法

文字是離散符號,無法直接操作像素,因此浮水印方案必須嵌入生成過程本身。

基礎方案(綠紅組別機率偏移)

LLM 在逐 token 生成(即文字接龍)時,系統以「已生成的上下文」加上「秘密私鑰」計算隨機種子,再用種子將當前所有候選詞彙隨機分為兩組:

  • 綠色組:被選機率稍微上調
  • 紅色組:被選機率稍微下調,比例約各 50%

關鍵設計在於「只調整機率,不完全禁止」:紅色組字仍有機會被選中,這是為了避免高確定性場景被卡死——例如「1+1=」後面幾乎確定接「2」,若「2」被分入紅色組且完全禁止,就會產生不合理的輸出。

此外,同一個字在文章不同位置可能被分入不同組別,因為每次的上下文都不同,種子隨之改變,組別分配也隨之改變。偵測時,只要統計目標文字中「綠色組 token 的比例」是否顯著高於隨機期望值,就能判斷是否為 AI 生成。

Google SynthID 改進版(G 值雙採樣法)

SynthID 文字版不採用分組,而是為每個候選 token 計算一個 G 值(類似擲硬幣,結果為 0 或 1)。生成時改為從機率分佈中採樣兩次,再選出 G 值較高的 token 保留。這個方法在概念上更細膩,但同樣存在其局限性。

OpenAI 擱置浮水印的決策

OpenAI 在 2024 年開發出準確率號稱 99.99% 的文字浮水印系統,幾乎完成部署。但在正式上線前所做的用戶問卷中,有約 30% 的用戶表示若加上 AI 浮水印,他們會降低使用頻率——這是一個不可忽視的流失比例,最終導致 OpenAI 決定將功能擱置至今。

主持人觀察,2024 年時 AI 使用仍屬選擇性,但 2026 年 AI 已是職場標配,若今天重做同一份問卷,30% 的反對比例可能已大幅下滑。

現行浮水印的核心弱點

弱點一:私鑰不互通,缺乏通用驗證機制

所有浮水印方案都依賴秘密私鑰——嵌入與偵測都需要同一把鑰匙,只有各自的廠商能操作自己的私鑰。目前各家廠商各自管理自己的私鑰,沒有跨平台統一驗證標準,外界無法自行驗證任何一家的浮水印效果。

弱點二:跨模型改寫可破壞浮水印

以模型 A(如 Gemini)生成帶有浮水印的文字,再交由模型 B(如 Claude)改寫,改寫後的文字既不符合 A 的私鑰統計特徵,也不會帶有 B 的浮水印,因此落入雙方驗證系統都無法識別的灰色地帶。跨模型改寫因此成為現行方案的天然規避漏洞。

精選語錄

「你在 2026 年的這個時代,我相信已經是變成 By default,你在工作上,你在做任何事情的時候,你一定要使用 AI。」

「我們做的是調整機率,不是禁止——所以即便你是被選到紅色組,你這些字還是有機會被選到。」

時間軸

逐字稿中無明確時間戳記,以下為主題順序:

  • 開場:歐盟 AI 法案浮水印規定(2026 年 8 月 2 日生效、2026 年 12 月 2 日舊模型截止)
  • 背景:Google SynthID 起源(2023 年,圖片 → 影像 → 聲音 → 文字)
  • 圖片、影像、聲音浮水印技術原理(encoder-decoder 配對神經網路)
  • 文字浮水印技術原理(綠紅組別機率偏移法)
  • Google SynthID 文字版改進(G 值雙採樣法)
  • OpenAI 2024 年擱置文字浮水印事件(30% 用戶反對)
  • 主持人對 2026 年 AI 普及化的觀察
  • 現行浮水印技術兩大缺陷分析
  • 結語

相關主題