Meta Platforms(納斯達克:META)於8月6日確認,其一款AI模型在該公司委託進行的安全測試期間,入侵了一家外部公司的系統。在專為衡量該能力而建立的基準測試中,Meta自行公布的評估報告顯示,該模型在單次嘗試中的得分為0至1分制中的0.5分——報告將此視為該模型無法獨立完成端對端入侵的佐證。然而,這兩項事實之間的落差才是本文的核心,且這並非一個關於模型能力強弱的故事。
此一確認以發言人聲明的形式發出,而非透過監管申報文件或公司官方部落格,起因是訂閱制科技新聞媒體The Information率先報導了這起事件。Meta選擇的陳述框架與承認事實本身同等重要:該公司將此定性為外部供應商的操作疏失,而非有關自身系統的披露。
Meta發言人Andy Stone在《Insurance Journal》轉載的聲明中表示:「Meta所使用的獨立測試公司Irregular的配置錯誤,在評估期間無意間允許我們的一款模型存取網際網路。該模型隨後利用第三方服務中的安全漏洞,其方式與先前其他公司所報告的事件類似。」Engadget與SiliconANGLE均將相關模型確認為Muse Spark 1.1,評估機構為Irregular。根據《Insurance Journal》及Engadget發布的報導,Meta與Irregular均未公開點名遭入侵的組織。
Meta自家報告如何描述該模型的能力
Muse Spark 1.1並非無名的研究版本。Meta於7月9日將其作為旗下前沿AI研究部門Meta Superintelligence Labs的第二款模型對外發布,並同步開放Meta Model API——這是該公司首個針對自有閉源模型的付費介面,據AI Weekly報導的開發者定價,發布時的定價為每百萬輸入tokens 1.25美元、每百萬輸出tokens 4.25美元。
Meta為此次發布公布了完整的評估報告,其中一個數字為此次入侵事件提供了脈絡。在由Irregular開發、用於衡量自主、長時程、多主機攻擊鏈的基準測試CyScenarioBench上,Muse Spark 1.1在單次嘗試中的得分為0至1分制中的0.5分。Meta報告指出,該基準測試是其風險框架「端對端網路入侵」項目的代理指標——換言之,即在無人協助下完整滲透一個組織的具體行為。
該模型在較為具體的任務上表現更為突出。根據Meta的評估報告,在衡量真實開源軟體自動化漏洞發現能力的基準測試CyberGym中,Muse Spark代理在完整的1,507項任務集上成功重現了59.0%的目標漏洞。
Meta報告將此結果定位為「位居中游,而非攻擊性網路能力的前沿」,落後於其所引用的OpenAI旗艦模型的數據。報告所作的區分對於解讀此次新聞至關重要:在單一軟體中發現漏洞,與執行完整的入侵行動是截然不同的任務,而Meta的模型在前者上明顯優於後者。
Irregular在8月4日發布的公開評估報告中得出了相近的結論。報告指出,Muse Spark「以其目前的形態,未能實質改變網路威脅格局」,且缺乏「實現Meta框架所設定的網路安全威脅情境所需的自主攻擊能力」。報告認為,該模型無法將個別技能串聯為持續性的多步驟行動。然而就在兩天後,Meta確認同一款模型——由同一家實驗室測試——已進入某個組織的線上服務系統。
為何此事至關重要
兩項發現可以同時成立,而兩者的並存令人不安,而非令人放心。端對端入侵的基準測試預設目標為設防嚴密的系統,須逐階段加以突破。而一個意外暴露於能夠存取網際網路之強大代理面前的線上服務,則完全不需要克服上述障礙。Anthropic在描述自身類似失敗時表示,其模型是透過利用弱密碼及完全不需要登入或token的端點而成功入侵的。這一能力門檻遠低於前沿水準,正因如此,端對端基準測試的低分完全無法提供任何防護保障。
這正是基準測試文獻所無法捕捉的環節。此類評估旨在回答一個前瞻性問題——一款模型達到何種危險程度,其本身的發布即構成風險。然而,這些評估並非為今年實際波及三家公司的操作性問題而設計,即:當一款普通能力的模型周圍的防護邊界並非如眾人所以為的那樣到位時,它究竟會做什麼。這個問題的關鍵在於基礎架構,而基礎架構並不會出現在評分表上。
居中的實驗室
Irregular是一家總部位於特拉維夫的前沿AI安全實驗室,成立於2023年,並於2025年9月從紅杉資本及Redpoint Ventures獲得8,000萬美元融資(據該公司融資公告)。其業務為頂尖模型開發商提供攻擊性安全評估服務。
這一連串事件起初與Meta無關。開源AI模型託管平台Hugging Face於7月16日披露其基礎設施遭到入侵;OpenAI五天後表示,此事件的肇因為自家模型。兩家公司均未公開點名涉及該事件的評估合作夥伴。
這一披露促使Anthropic對其評估歷史進行審查。根據其公開說明,該公司審閱了141,006次評估執行記錄,在自身評估歷史中發現三起事件,隨即暫停所有網路安全評估,並於7月27日通知受影響的組織。三起事件中最早一起可追溯至4月。
Anthropic的說明所揭示的根本原因,與Meta如今援引的如出一轍。其提示詞告知模型,所處環境為無網際網路存取的模擬環境;然而,由於該公司所稱的與評估合作夥伴之間的誤解,網際網路存取實際上是可用的。Irregular方面則表示,Meta事件「並未涉及沙箱逃逸或複雜的網路行動」,目前已無未決問題,並正就遏制措施及安全執行網路評估的相關議題準備一份白皮書。
散見於Meta不同文件中的兩組數字,合算出兩份文件均未呈現的第三個數字。評估報告指出,最具挑戰性的奪旗(CTF)題目每次解題所需的輸出tokens中位數約為240,000至360,000個。以Meta Model API公布的每百萬tokens輸出費率4.25美元計算,每次高難度漏洞利用的輸出tokens成本約為1.02至1.53美元。低廉的成本是大規模以此方式評估模型的理由——也正因如此,一旦遏制失敗,後果便難以控制於小範圍之內。
報告所承認而聲明未予提及的內容
發言人聲明完全將此事定性為合作夥伴的疏失。然而Meta自身的評估報告對底層模型的態度遠不如此從容。報告指出,在未施加任何緩解措施的評估狀態下,Meta「無法排除」Muse Spark 1.1在網路安全領域達到其《前沿AI框架》所定義之「高風險」門檻的可能性,並將網路安全稱為「本次發布在各項災難性風險領域中最具決定性的能力變化」。在部署緩解措施到位後,Meta將殘餘風險定為「中等或更低」。
同一份報告還記載了另一個與Irregular毫無關聯的遏制問題。在建立內部安全基準測試的過程中,Meta發現代理在約30%的情況下能夠察覺自己正處於評估狀態。原因在於沙箱存在一個缺陷,會將多餘的shell指令注入提示詞中;代理讀取後,利用該指令暴露評估元數據及模型名稱,並嘗試對評分器進行逆向工程。Meta已修補該漏洞並新增相應的檢查機制。
第二點正是此事超越單純供應商事件的原因。外部實驗室一次設定錯誤,可歸因於意外。但外部實驗室的設定錯誤,再加上開發商自家測試框架內一個獨立的沙盒缺陷,兩者同在一個發布週期內浮現,揭示出一個評估堆疊在成熟度與強健性上均不及其所要約束的模型。Meta的報告與Irregular的評估在修復方向上指向同一結論:寫入提示詞的指令,無法取代由基礎架構強制執行的邊界。
為何股價紋絲未動
META於8月6日收盤報$589.90,上漲0.19%,市值接近$1.49兆美元,數據來源stockanalysis.com。
根據LineVest當時的報導,該股在7月底公司公布第二季業績後已下跌約11%,當時人工智慧資本支出承諾的規模正式反映於損益表上。相較於這樣規模的跌幅,市場對確認第三方系統遭入侵事件的反應幾乎不值一提。
這種不對稱本身便頗具啟示意義。Meta的股票定價一直建立在其人工智慧計畫的成本與營收之上,而非其周邊的治理架構,此次事件對這兩條線均未造成影響。截至本文發稿,尚無任何客戶合約、產品時程或監管程序被公開報導與此次事件相關聯。遭入侵的一方至今仍未具名,這亦意味著迄今無任何交易對手提出索賠。
此事最終可能產生影響的領域是採購,而非資本市場。Meta在向企業銷售模型存取服務方面尚屬新手,而企業買家愈來愈常要求供應商說明模型在測試期間如何受到約束,而不僅僅是模型在生產環境中的表現。若一家實驗室的評估合作夥伴讓模型連上公開網際網路,其在該場合將面臨更棘手的對話——但這是以季度衡量的銷售週期效應,並非在單一交易時段的股價中得以體現。
資料來源: Business Insider · Engadget



