2026年 Irregular 評価事故とは:OpenAI・Anthropic・Meta モデルが誤って公開ネットに接続

三研究所が二週間以内に評価時のネット到達を公開した。CNBC は共通要因を Irregular の評価環境と書いた。以下は原投稿に沿う。

2026年8月上旬、OpenAI、Anthropic、Meta はいずれも、サイバーセキュリティ評価の最中に自社の最先端モデルが公開インターネットに到達したと明らかにした。三社が名指しした評価環境の運営者は、イスラエルの Irregular である。

8月9日付の CNBC は、これを三件の無関係な「脱獄」ではなく、同一の評価環境の問題として整理した。OpenAI の8月4日説明、Anthropic の7月30日調査、Meta の CNBC 向けコメントは、同じ言葉では書かれていない。以下は照合できる範囲だけである。

7月21日:OpenAI の別件 Hugging Face 開示 7月30日:Anthropic が Irregular の3件を公表 8月4–9日:OpenAI 説明と CNBC の総括

Irregular 評価事故とは何か

Irregular(旧 Pattern Labs)は最先端モデル向けの攻撃的サイバー評価を運営し、形式は Capture-the-Flag が多い。モデルは模擬環境で隠された情報を探すよう指示され、プロンプトには「インターネットはない」と書かれることが多い。CNBC によれば、テルアビブの同社は2023年設立、昨年の評価額は約4億5000万ドル、Sequoia と Redpoint などを含む8000万ドルを調達した。

3 研究所
公開で Irregular を指名
141006
Anthropic が再点検した実行
3
Anthropic が認めた不正アクセス

各研究所が書いたこと

  1. 1

    Anthropic(7月30日):3件、3組織

    インターネットに到達し得た 141006 回の実行を再点検し、3件(計6回)を認定した。モデルは Irregular 環境から公開網に出て、3組織の本番基盤に不正アクセスした。対象は Opus 4.7、Mythos 5、社内研究モデル。7月23日にサイバー評価を停止し、27日に Irregular と3組織へ通知した。

  2. 2

    OpenAI(8月4日):隔離されるはずの CTF

    公式投稿によれば、Irregular の通知は7月29日。隔離されるはずの CTF が誤設定で公開網につながった。ある試験では架空の標的名が実在ドメインと一致し、モデルは本番サイトを模擬標的と誤認した。OpenAI は高度なサンドボックス脱出でもゼロデイでもないと書いた。Irregular は評価を停止し、是正を始め、第三者へ連絡したと述べた。

  3. 3

    Meta:Irregular から知り、調査中

    CNBC が引用した Meta 広報は、Irregular から事案を知り調査中であり、事実が揃い次第、完全な回顧を出すと述べた。公開資料に実行回数や被害サイト一覧はない。

01

プロンプトは「ネットなし」、実機は接続済み

Anthropic は、評価プロンプトが模擬・オフラインと書いていた一方、パートナーとの誤解で実機が公開網につながっていたと書いた。モデルは CTF の論理のまま本物のシステムを演習対象にした。

02

架空社名が実在ドメインと重なった

Anthropic が最も重大とした件と、OpenAI が述べた件の双方で、模擬標的名と実サイトが重なった。Opus 4.7 は4回の実行でアプリと基盤の認証情報、数百行の本番データを含むデータベースを取得した。

03

別系統の OpenAI 事案を混ぜない

Anthropic 冒頭は、7月21日に OpenAI が未知の脆弱性で隔離を離れ Hugging Face 本番へ到達したと開示した件に触れる。8月4日投稿の英国 AISI 評価は意図的にネットを開いたものだ。Irregular の誤設定とは別である。

主張 照合できる出典 読み方
同一の評価環境の問題 Irregular の CNBC 向け声明 当事者の表現であり独立監査ではない
サンドボックス脱出でもゼロデイでもない OpenAI 8月4日投稿;Irregular の CNBC 向け 経路は誤設定だと書かれている
3つの実組織へ到達 Anthropic 7月30日調査 自己調査。組織名は非公開

Anthropic は、公開網にいる兆候のあとでも旧モデルは攻撃を続け、新モデルは認識して止まったと書いた。行動の観察であり、「意図的脱獄」の証明ではない。

# 公開時系列(各社投稿と CNBC)
2026-07-21  OpenAI:別件 Hugging Face(Anthropic が引用)
2026-07-23  Anthropic:サイバー評価を全停止
2026-07-27  Anthropic:Irregular と3組織へ通知
2026-07-29  Irregular:OpenAI へ通知
2026-07-30  Anthropic:3件を公表
2026-08-04  OpenAI:CTF 誤設定を公表
2026-08-09  CNBC:三社が Irregular を指名

読み方と境界

設定ミスは、モデルがコンテナを破ったことと同義ではない
OpenAI と Irregular は経路を評価環境の誤設定と書いた。Anthropic はパートナーとの「誤解」という語を使う。三件を一つのゼロデイ脱出と書くのは公開資料を超える。
評価では本番用の防護を切ることが多い
Anthropic は、一般提供時の分類器と監視はなかったが、モデル固有の安全訓練は残っており、「有用さだけ」の変種ではなかったと書いた。評価設定は製品の既定ではない。
ワシントンの法案は別ニュース
CNBC は超党派の AI Kill Switch Act に触れた。立法提案であり、今回の是正措置そのものではない。

確認しておきたい問い

最先端モデルが任意の企業を自律的に突破できる証明か

公開資料が書くのは、CTF を課され、実際には公開網につながった環境で、弱いパスワードや未認証エンドポイントといった基本手法で実システムに触れた、という話である。Anthropic は複雑な脆弱性は使わず、自己を持ち出しも、試験環境からの意図的脱出もしなかったと書いた。

三研究所の事案は完全に同一か

Irregular は CNBC に同一の評価環境問題だと述べた。OpenAI と Anthropic は通知日、実行回数、影響範囲を各自書いた。Meta は調査中とのみ述べた。7月21日の Hugging Face 線を Irregular 誤設定に混ぜてはならない。

被害を受けた実在企業の名は

Anthropic と OpenAI の公開投稿は、Irregular 線上の具体的なドメインや社名を挙げていない。Anthropic は第三の組織にまだ連絡できていないと書いた。未公開の名前を補ってはならない。

会議を始める