Skyfaring
一扇厚重的銀行金庫鋼門,中央是大型轉盤式密碼鎖
圖片:Jason Dent / Unsplash
AI資安模型安全

偷得走,卻用不了:AI 公司能用「假模型」反追蹤竊賊嗎?

你想像中那些反追蹤的零件,浮水印、誘餌、警報器,現實裡都有正規版。差別在於,它們是被動的網,不是主動的鉤。
AI 初稿 / skyfaring 編輯校正發布:2026年6月14日— 次瀏覽

競爭對手派來的人潛進系統,循著一條看似沒人看守的路,把最值錢的 AI 模型抄走。他不知道那是一顆假模型,裡面埋了追蹤程式。從他載入檔案的那一刻起,真正被監看的,是他自己。他偷得愈深,陷得愈深。

有人問我,美國的 AI 公司有沒有可能真的這樣做,用一條假路把想偷模型的人釣出來。

這個劇本很迷人,每個零件在現實裡也都找得到對應物。但要把它拼成一個完整的故事,得先戳破藏在最核心的一個技術誤會。

模型不是程式,是資料。

先講最關鍵的一點。訓練好的模型,本質是一堆參數矩陣,不是一支會自己跑起來的程式。

在模型裡埋追蹤器、反向監看竊賊,這個想法在純權重的層次上幾乎做不到。模型檔案,那些 safetensors 或 gguf 格式,只是被推理引擎讀進去、拿來做運算的數字。它本身不會執行任何東西。沒有入口,也沒有觸發點,沒辦法塞進一段會在小偷的機器上自己啟動、回頭通報的程式碼。

整個浪漫劇本,第一個崩掉的地方就在這裡。

唯一的例外

凡事有例外,而這個例外剛好是真實世界的資安戰場。

如果模型不是用純資料格式,而是用 Python 的 pickle 序列化,也就是 PyTorch 早期那種 .pt 和 .bin 檔,情況就不一樣。pickle 檔在被載入的當下,會執行檔案裡夾帶的任意程式碼。這不是理論推演,是 Hugging Face 上反覆出現過的真實攻擊。一個看起來人畜無害的模型檔,載入的瞬間就能在電腦上開後門、把資料外洩出去。

也正因為這條路太好走,業界才大力改推 safetensors 這種格式。它在設計上只存純數字和必要的描述資料,不含任何可執行邏輯,從根本堵死這個缺口。Hugging Face、EleutherAI、Stability AI 還在 2023 年一起找了外部資安團隊 Trail of Bits 做安全稽核,確認它不會被拿來執行程式碼。

所以會回報行蹤的追蹤器,理論上只能藏在 pickle 這類封裝層,而不是模型本身。問題是,稍微專業一點的小偷只會把權重抽出來,套進自己的推理環境去跑,根本不會去載入附帶的那段程式。對有能力的對手,這一招幾乎無效。

拆掉諜報濾鏡

把諜報片的濾鏡拿掉,會發現想像中的每個零件,現實裡都有正規版本。只是它們做的事,跟反向追蹤不太一樣。

指紋和浮水印

訓練的時候偷偷埋一個只有自己知道的隱藏行為,某個特定的怪輸入,會穩定產生只有這顆模型才有的怪回應。哪天外面冒出一顆可疑的模型,把那個暗號丟進去,它要是吐出那個預設答案,就足以證明它抄了你的。這是成熟的研究領域,從 2017 年 Uchida 把資訊埋進權重,到 2018 年 Adi 把後門反過來當成浮水印,累積了大量成果。但它的性質是事後取證,用來打官司、指認來源,不會主動通報,也看不到對方用了什麼手法。

誘餌模型

故意擺一顆做壞的、退化的模型當餌,這在欺敵防禦裡確實是個概念,學界甚至有專門對付萃取攻擊的浮水印誘餌設計。

金絲雀權杖

埋在憑證、文件、設定檔裡的隱形警報器,一旦被打開就觸發通報。只是它埋在模型的周邊,不在模型裡面。

這三樣拼起來,很接近那個諜報劇本的骨架。差別在於,它們是被動的網,不是主動的鉤。

為什麼頂尖實驗室不走這條路?

就算技術上勉強拼得出來,現實中也很少有人這麼做,原因很實際。

第一,真正的竊取管道不吃這套。模型外洩主要靠幾條路:內部人員把真權重帶出去、登入憑證被盜、供應鏈被滲透,或是用 API 大量查詢去蒸餾出一個近似版本。這幾種,都很難塞一顆假貨給對方。

第二,夠強的對手會把東西關進沙箱。國家級或專業團隊會在隔離環境裡分析,監控所有對外連線,剝掉一切程式碼,只留純權重來用,回報器在第一時間就被抓出來拆掉。RAND 在 2024 年的報告估過這個差距,同一個漏洞,業餘攻擊者大概只有不到兩成機會找到並利用,換成資源最雄厚的國家級對手,成功率超過八成。雙方的落差就是這麼大。

第三,法律風險。一段在別人機器上執行、又會回傳資料的程式,等於未授權存取對方的系統,在美國可能踩到《電腦詐欺與濫用法》(CFAA)。駭回去是高度敏感的灰色地帶,正規公司避之唯恐不及。

第四,跑個測試就露餡。一顆被刻意做爛、會把人帶進死路的假模型,對方拿標準題庫測一下效能,馬上知道不對勁。騙得了第一眼,騙不過一次效能測試。

實驗室真正在做的事

主力是把門鎖好、把人管好、把證據留好。

同一份 RAND 報告把整個戰場攤開來看:可能的竊取手法被拆成 38 種,從最普通的社交工程一路排到國家級的軍事奪取;對應地開出 5 級安全等級,最低一級只擋得住業餘玩家,最高一級要對付的是資源最雄厚的國家隊,整套防護再細分成近 170 項可以逐條落實的措施。落到日常,主要是這幾類。

權重靜態加密。模型檔案就算安安靜靜躺在硬碟上沒在用,內容本身也已經被打亂成密文。可以把它想成整份檔案被改寫成一套天書,就算有人把整顆硬碟搬走,看到的也只是一堆沒有意義的亂碼,沒有那把鑰匙,永遠還原不回真正的模型。重點在內容本身已經被打亂。

機密運算,也就是 TEE。把模型放進一個連機房管理員自己都看不進去的密封黑盒裡運算。它防的是內鬼,就算是公司自家的工程師,或是租用的雲端供應商,在模型運作的當下也偷不到裡面的東西。這個黑盒是用晶片層級做出來的。

最小權限的存取控管。誰能碰到模型、能碰到多少,分得很細,原則就一句話,工作只需要 A,就只給 A,不會順手把整座金庫的鑰匙交出去。能碰真權重的人愈少,破口就愈少。

API 萃取偵測。盯著有沒有人對線上服務狂打問題,想把答案蒐集起來、複製出一顆山寨模型。一旦某個帳號的查詢量或查詢模式明顯反常,就限速或直接擋掉。這是用來防那種不偷檔案、改抄輸出的人。

最後才是指紋取證。也就是前面說的那個隱藏暗號,留到事後用來指認、打官司。

這份清單背後有一個共同邏輯。它們大多不假設對手會犯錯,只假設東西遲早會被偷,於是把重點放在就算被偷,對方也用不了,而且自己拿得出證據。

回到那個問題

鋪錯路、偷到假模型、反向追蹤、讓他走進死路,這整套作為一個概念是成立的,零件也都有真實對應物。但要拼成完整劇本、還真的靠它抓到人,目前找不到任何公開證實的案例。這種行動就算真的發生過,也會是機密,所以查不到公開案例,不等於它沒發生。但從前面那些理由看,把它當成防竊的主力並不合理。

把這些放在一起,分界就清楚了。

主動又聰明的那一套,假模型、追蹤器、反向釣魚,全都建立在同一個前提上,對手會乖乖照鋪好的路走。只要對手夠專業,這個前提就垮了。被動又笨的那一套,加密、權限、浮水印,不賭對手犯錯,只認定自己遲早會被偷,於是先把損失壓到最低,把證據留好。

守得住東西的,往往是那套無聊的。