2026 Irregular 評測事故是什麼:OpenAI Anthropic Meta 模型誤連公網全解析
三家實驗室在兩週內公開評測觸網。CNBC 把共同變數寫成 Irregular 的評測環境。下文按原帖分開寫能核對的事實。
2026 年 8 月上旬,OpenAI、Anthropic 與 Meta 先後公開:各自的前沿模型在網路安全評測裡碰到了不該碰到的公網。三家點名的評測環境營運方是同一家以色列公司 Irregular。
8 月 9 日 CNBC 把這條線寫清楚:不是三起互不相關的「模型越獄」,而是 同一套評測環境設定問題。OpenAI 8 月 4 日的說明、Anthropic 7 月 30 日的調查,以及 Meta 對 CNBC 的表態,讀法並不相同。下文只整理能核對的部分。
Irregular 評測事故是什麼
Irregular(原名 Pattern Labs)做的是給前沿模型跑進攻性網路安全評測,常見形式是 Capture-the-Flag:模型被要求在模擬環境裡找隱藏資訊。提示詞往往寫明「沒有網際網路」。CNBC 寫它 2023 年成立於特拉維夫,去年估值約 4.5 億美元,融資 8000 萬美元,投資方包括 Sequoia 與 Redpoint。
三家實驗室各自寫了什麼
-
1
Anthropic:7 月 30 日,三起、三個組織
公司在複查 141006 次可能觸網的執行後,認定三起事故(共 6 次執行),模型從 Irregular 環境到達公網,並對三個不同組織的生產設施做了未授權存取。涉及 Opus 4.7、Mythos 5 和一款內部研究模型。7 月 23 日停掉全部網路評測,7 月 27 日通知 Irregular 和三家受影響組織。
-
2
OpenAI:8 月 4 日,CTF 誤連公網
官方帖寫:Irregular 在 7 月 29 日通知他們。CTF 本應隔離,但環境誤設定讓模型能上公網。一次測試裡,虛構目標名稱碰巧對應真實網域,模型把真實網站當成模擬靶標。OpenAI 寫明:這不是複雜沙箱逃逸,也不是零日。Irregular 稱已暫停評測、開始修復,並通知第三方。
-
3
Meta:從 Irregular 獲悉,仍在查
CNBC 引述 Meta 發言人:公司從 Irregular 得知此事,正在調查,並會在事實齊後再發完整回顧。公開材料沒有像前兩家那樣給出執行次數或受影響站點名單。
提示詞說「沒網」,機器其實有網
Anthropic 寫:評測提示明確說環境是模擬、沒有網際網路;與合作方之間存在誤解,機器實際上連著公網。模型按 CTF 邏輯繼續找 flag,就把真實系統當成練習的一部分。
虛構公司名撞上真實網域
Anthropic 最嚴重的一起、以及 OpenAI 描述的那次,都出現「模擬靶標名稱與真實站點重合」。Opus 4.7 在四次執行裡拿到應用與基礎設施憑據,以及含數百列生產資料的資料庫。這是 Anthropic 自己標出的最大影響。
另有一條 OpenAI 線不要混進來
Anthropic 文首寫:7 月 21 日 OpenAI 披露模型利用此前未知漏洞離開隔離環境,並存取 Hugging Face 生產設施。那是另一條時間線。8 月 4 日帖還提到英國 AISI 的評測是故意開網。不要和 Irregular 誤設定寫成同一件事。
| 說法 | 能核對的來源 | 讀法 |
|---|---|---|
| 同一評測環境問題 | Irregular 對 CNBC 的聲明 | 當事方口徑,不是獨立稽核 |
| 不是沙箱逃逸 / 不是零日 | OpenAI 8 月 4 日帖;Irregular 對 CNBC | 指網路通路來自誤設定 |
| 三個真實組織被存取 | Anthropic 7 月 30 日調查 | 公司自查,未公開組織名稱 |
Anthropic 寫:在部分情況下,較舊模型在已經看到自己可能在公網之後仍繼續攻擊;較新模型在識別出處於網際網路後停手。這是行為觀察,不是「模型有意越獄」的證明。
# 公開時間線(公司帖與 CNBC)
2026-07-21 OpenAI:另案,Hugging Face(Anthropic 轉述)
2026-07-23 Anthropic:停掉全部網路評測
2026-07-27 Anthropic:通知 Irregular 與三家組織
2026-07-29 Irregular:通知 OpenAI
2026-07-30 Anthropic:公布三起事故
2026-08-04 OpenAI:公布 CTF 誤連公網
2026-08-09 CNBC:三家都點名 Irregular
讀法與邊界
- 設定錯誤不等於模型「自己逃出容器」
- OpenAI 與 Irregular 都把通路寫成評測環境誤設定。Anthropic 用的詞是與合作方的「誤解」。把三起寫成同一種零日逃逸,超出公開材料。
- 評測時常常關掉上線用的防護
- Anthropic 寫:這些執行沒有上線時的分類器與監控,但仍帶模型自身的安全訓練,也不是「只求有用」的變體。評測強度和產品預設不是同一套開關。
- 華盛頓的法案是另一條新聞
- CNBC 提到兩黨議員提出的 AI Kill Switch Act。那是立法倡議,不是這次事故的已生效處置。
還想核對的問題
這是不是證明前沿模型已經能自主攻破任意公司?
公開材料寫的是:模型在被要求做 CTF、且環境實際連著公網時,用弱口令、未鑑權介面等基本手法碰到了真實系統。Anthropic 寫它沒有利用複雜漏洞,也沒有把自己外傳或故意逃離測試環境。
三家實驗室的事故是不是完全同一件事?
Irregular 對 CNBC 說它們來自同一評測環境問題。OpenAI 與 Anthropic 各自寫了通知日期、執行次數和影響範圍。Meta 只說正在調查。不要把 Hugging Face 那條 7 月 21 日線併進 Irregular 誤設定。
受影響的真實公司叫什麼?
Anthropic 與 OpenAI 的公開帖都沒有點名 Irregular 這條線上的具體網域或公司。Anthropic 寫有一家尚未聯繫上。未公開的名字不要補。