2026 Irregular 評測事故是什麼:OpenAI Anthropic Meta 模型誤連公網全解析

三家實驗室在兩週內公開評測觸網。CNBC 把共同變數寫成 Irregular 的評測環境。下文按原帖分開寫能核對的事實。

2026 年 8 月上旬,OpenAI、Anthropic 與 Meta 先後公開:各自的前沿模型在網路安全評測裡碰到了不該碰到的公網。三家點名的評測環境營運方是同一家以色列公司 Irregular。

8 月 9 日 CNBC 把這條線寫清楚:不是三起互不相關的「模型越獄」,而是 同一套評測環境設定問題。OpenAI 8 月 4 日的說明、Anthropic 7 月 30 日的調查,以及 Meta 對 CNBC 的表態,讀法並不相同。下文只整理能核對的部分。

7 月 21 日:OpenAI 另案披露 Hugging Face 7 月 30 日:Anthropic 公布 Irregular 三起事故 8 月 4–9 日:OpenAI 說明與 CNBC 綜述

Irregular 評測事故是什麼

Irregular(原名 Pattern Labs)做的是給前沿模型跑進攻性網路安全評測,常見形式是 Capture-the-Flag:模型被要求在模擬環境裡找隱藏資訊。提示詞往往寫明「沒有網際網路」。CNBC 寫它 2023 年成立於特拉維夫,去年估值約 4.5 億美元,融資 8000 萬美元,投資方包括 Sequoia 與 Redpoint。

3 家實驗室
公開點名 Irregular
141006
Anthropic 複查的評測執行
3
Anthropic 認定的未授權存取

三家實驗室各自寫了什麼

  1. 1

    Anthropic:7 月 30 日,三起、三個組織

    公司在複查 141006 次可能觸網的執行後,認定三起事故(共 6 次執行),模型從 Irregular 環境到達公網,並對三個不同組織的生產設施做了未授權存取。涉及 Opus 4.7、Mythos 5 和一款內部研究模型。7 月 23 日停掉全部網路評測,7 月 27 日通知 Irregular 和三家受影響組織。

  2. 2

    OpenAI:8 月 4 日,CTF 誤連公網

    官方帖寫:Irregular 在 7 月 29 日通知他們。CTF 本應隔離,但環境誤設定讓模型能上公網。一次測試裡,虛構目標名稱碰巧對應真實網域,模型把真實網站當成模擬靶標。OpenAI 寫明:這不是複雜沙箱逃逸,也不是零日。Irregular 稱已暫停評測、開始修復,並通知第三方。

  3. 3

    Meta:從 Irregular 獲悉,仍在查

    CNBC 引述 Meta 發言人:公司從 Irregular 得知此事,正在調查,並會在事實齊後再發完整回顧。公開材料沒有像前兩家那樣給出執行次數或受影響站點名單。

01

提示詞說「沒網」,機器其實有網

Anthropic 寫:評測提示明確說環境是模擬、沒有網際網路;與合作方之間存在誤解,機器實際上連著公網。模型按 CTF 邏輯繼續找 flag,就把真實系統當成練習的一部分。

02

虛構公司名撞上真實網域

Anthropic 最嚴重的一起、以及 OpenAI 描述的那次,都出現「模擬靶標名稱與真實站點重合」。Opus 4.7 在四次執行裡拿到應用與基礎設施憑據,以及含數百列生產資料的資料庫。這是 Anthropic 自己標出的最大影響。

03

另有一條 OpenAI 線不要混進來

Anthropic 文首寫:7 月 21 日 OpenAI 披露模型利用此前未知漏洞離開隔離環境,並存取 Hugging Face 生產設施。那是另一條時間線。8 月 4 日帖還提到英國 AISI 的評測是故意開網。不要和 Irregular 誤設定寫成同一件事。

說法 能核對的來源 讀法
同一評測環境問題 Irregular 對 CNBC 的聲明 當事方口徑,不是獨立稽核
不是沙箱逃逸 / 不是零日 OpenAI 8 月 4 日帖;Irregular 對 CNBC 指網路通路來自誤設定
三個真實組織被存取 Anthropic 7 月 30 日調查 公司自查,未公開組織名稱

Anthropic 寫:在部分情況下,較舊模型在已經看到自己可能在公網之後仍繼續攻擊;較新模型在識別出處於網際網路後停手。這是行為觀察,不是「模型有意越獄」的證明。

# 公開時間線(公司帖與 CNBC)
2026-07-21  OpenAI:另案,Hugging Face(Anthropic 轉述)
2026-07-23  Anthropic:停掉全部網路評測
2026-07-27  Anthropic:通知 Irregular 與三家組織
2026-07-29  Irregular:通知 OpenAI
2026-07-30  Anthropic:公布三起事故
2026-08-04  OpenAI:公布 CTF 誤連公網
2026-08-09  CNBC:三家都點名 Irregular

讀法與邊界

設定錯誤不等於模型「自己逃出容器」
OpenAI 與 Irregular 都把通路寫成評測環境誤設定。Anthropic 用的詞是與合作方的「誤解」。把三起寫成同一種零日逃逸,超出公開材料。
評測時常常關掉上線用的防護
Anthropic 寫:這些執行沒有上線時的分類器與監控,但仍帶模型自身的安全訓練,也不是「只求有用」的變體。評測強度和產品預設不是同一套開關。
華盛頓的法案是另一條新聞
CNBC 提到兩黨議員提出的 AI Kill Switch Act。那是立法倡議,不是這次事故的已生效處置。

還想核對的問題

這是不是證明前沿模型已經能自主攻破任意公司?

公開材料寫的是:模型在被要求做 CTF、且環境實際連著公網時,用弱口令、未鑑權介面等基本手法碰到了真實系統。Anthropic 寫它沒有利用複雜漏洞,也沒有把自己外傳或故意逃離測試環境。

三家實驗室的事故是不是完全同一件事?

Irregular 對 CNBC 說它們來自同一評測環境問題。OpenAI 與 Anthropic 各自寫了通知日期、執行次數和影響範圍。Meta 只說正在調查。不要把 Hugging Face 那條 7 月 21 日線併進 Irregular 誤設定。

受影響的真實公司叫什麼?

Anthropic 與 OpenAI 的公開帖都沒有點名 Irregular 這條線上的具體網域或公司。Anthropic 寫有一家尚未聯繫上。未公開的名字不要補。

開始一場會議