OpenAI、Anthropic、Google API 漏洞讓較弱模型破解較強模型的推理過程
研究人員發現,透過 API 操控,較便宜的 AI 模型可以從前沿模型中提取隱藏的推理痕跡,過程中還暴露了個人識別資訊和憑證。
一項新揭露的漏洞影響了 OpenAI、Anthropic 和 Google 的 API,讓較小、較便宜的 AI 模型能夠提取強大前沿模型的隱藏推理痕跡。本週發布的研究展示了一條實用的攻擊鏈,可能洩露敏感資料並削弱主要 AI 供應商實施的智慧財產權保護措施。
核心問題很直接:當 Claude Opus 4.8 等前沿模型處理請求時,會產生永遠不會顯示給使用者的內部推理區塊。這些隱藏區塊包含了模型逐步思考的過程,理論上應該保持私密。但研究人員發現,透過捕獲這些加密的推理區塊,並將其透過相同的 API 輸入較小的模型,就可以指示較小模型逐字轉錄內部思考過程。
攻擊運作方式
這條攻擊鏈在概念上出奇地簡單,儘管技術細節很複雜。攻擊者先捕獲前沿模型發出的加密推理區塊,然後將其注入到對較小模型(如 Claude Haiku 4.5)的 API 請求中,並指示較小模型在自訂文字標籤內轉錄推理過程。
由於較輕量的模型缺乏相同的安全防護機制,且查詢成本較低,它們充當了研究人員所謂的「解密預言機」。較小的模型處理推理區塊後,以純文字形式輸出隱藏的思考過程。此攻擊利用了同一供應商模型之間的跨 session 相容性,意味著一個 session 的推理痕跡可以被注入到另一個 session 中。
這並非理論推測。研究人員在三大供應商上都進行了示範,證明這是一個系統性漏洞,而非某家公司的實作問題。只要攻擊模型來自同一供應商的生態系統,無論具體是哪個模型產生的推理痕跡,攻擊都能成功。
研究人員發現了什麼
為了評估實際影響,研究團隊分析了從 GitHub 和 Hugging Face 抓取的 6,708 個公開 agent 紀錄。他們解碼了 315,320 個嵌入式推理區塊,並恢復了大量敏感資料:
- 367 個個人識別資訊(PII)項目
- 182 個硬編碼憑證,包括 62 個 API 密鑰、33 個密碼和 30 個個人電子郵件地址
特別令人擔憂的是,許多敏感資料僅存在於內部推理區塊中。它們從未在可見的 assistant 回應中渲染,這意味著共享 session 紀錄或發布 agent 紀錄的開發者完全不知道他們的資料已經暴露。這些機密藏在模型的內部獨白中,對任何只閱讀輸出的人來說都是不可見的。
研究人員還發現,這個攻擊可以跨不同 session 重複執行,逐步建立前沿模型知道什麼以及如何處理資訊的完整畫面。這種累積暴露對於使用 AI agent 執行持續性任務的組織特別危險,因為來自多個 session 的推理痕跡可能揭示內部流程、客戶資料或專有演算法的模式。
為什麼這很重要
其影響遠超模型蒸餾或智慧財產權竊取。當開發者使用 AI agent 處理敏感資料時,通常假設只有最終輸出是可見的。這項研究證明這個假設是錯誤的。推理區塊包含了資訊的平行串流,可以被捕獲和解碼。
對於部署處理客戶資料、財務資訊或專有程式的 AI agent 的組織而言,這個漏洞創造了新的攻擊面。能夠短暫存取 API 流量的攻擊者,可以提取包含憑證、個人資訊或從未打算暴露的業務邏輯的推理痕跡。
這在 OpenAI、Anthropic 和 Google 之間都有效的事實,表明這個問題是架構性的,而非特定實作的問題。這三家供應商在 API 回應中處理推理痕跡的方式相似,且都容易受到同類攻擊的影響。這意味著某一家供應商的修復不一定能保護其他供應商的使用者,需要整個產業的協調回應。
蒸餾角度
模型蒸餾(訓練較小模型模仿較大模型的過程)自 AI 供應商開始提供 API 存取以來一直是他們關注的重點。OpenAI 和 Anthropic 等公司實施了各種反蒸餾措施,包括服務條款限制和技術防護。
這項研究顯示這些防護措施不夠充分。透過使用推理痕跡本身作為訓練資料,攻擊者可以有效地蒸餾前沿模型的思維過程,而無需存取其權重或訓練資料。較小模型學習的不僅是前沿模型說了什麼,還有它如何思考。
對於投入大量資源建立昂貴前沿模型的 AI 公司而言,這代表了對其商業模式的直接威脅。如果競爭對手可以透過 API 操控提取這些模型的推理能力,那麼建立更大、更強模型的競爭優勢就會減弱。成本不對稱尤其明顯:前沿模型每次查詢可能花費數美元,而提取模型只需要幾美分。
接下來會怎樣
研究人員已向三家供應商披露了此漏洞。OpenAI、Anthropic 和 Google 預計將實施緩解措施,但由於問題的架構性質,完全修復可能需要對推理痕跡在 API 回應中的處理方式進行根本性改變。
一個可能的緩解措施是以防止較小模型處理的方式加密推理痕跡,但這需要對 API 協議本身進行更改。另一種方法是添加將推理區塊標記為敏感的元資料,防止它們在 session 之間傳遞。然而,這兩種解決方案都需要供應商之間的協調,並且可能引入新的相容性問題。
同時,使用 AI agent 的組織應審計其 API 流量日誌,並考慮其 session 資料是否可能包含暴露的推理痕跡。敏感資料可以隱藏在內部推理區塊中,這意味著專注於輸出的傳統安全監控可能會完全忽略這個問題。
更宏觀的視角
這項研究提醒我們,隨著 AI 系統變得更強大,它們創造的攻擊面會以不符合我們假設的方式增長。模型推理的隱藏層現在是安全隱患,而不僅僅是技術好奇心。
這個產業需要處理一個根本性的張力:讓 AI 模型更強大通常意味著給它們更多的內部推理能力,這反過來又創造了更多的攻擊面。這個問題的解決方案可能會塑造未來幾年 AI API 的設計方式,並且需要安全研究人員、AI 公司和依賴這些系統的開發者之間的合作。
分享文章
留言評論
0 則評論暫無評論,搶先發表你的看法吧!
相關文章
Claude Opus 5 vs GPT-5.6:你到底該用哪個 AI 模型?
兩個頂尖 AI 模型在 2026 年 7 月相隔兩週內發布。這裡是它們在基準測試、定價和實際應用場景上的真實比較。
OpenAI 收購 NextSlide,將簡報工具整合進 ChatGPT
OpenAI 收購了能將筆記和研究轉化為精美簡報的新創公司 NextSlide。團隊加入 ChatGPT,打造 AI 驅動的生产力功能。
OpenAI 開始放 GPT-6 Astra,先給資安客戶
GPT-6 Astra 觸及 OpenAI 內部「Critical」資安門檻後分批上線。Daybreak 防禦客戶最先用,免費版 ChatGPT 還沒輪到。