Пауза RL OpenAI 2026: киберриск Astra и мониторинг 20%
На этой неделе OpenAI зафиксировала двухнедельную паузу RL, возможное Critical-чтение Astra и оценку мониторинга в 20%. «Нельзя исключить» здесь не рейтинг.
В середине августа 2026 года OpenAI свела на одной странице два события: июльский инцидент оценки на Hugging Face и предварительные признаки того, что невыпущенная модель Astra может достичь порога Critical по кибербезопасности в Preparedness Framework. Выравнивание, безопасность и мониторинг, написала компания, должны опережать способность, поэтому масштабирование временно замедлили.
У шагов есть цифры. Обучение с подкреплением на новейших моделях, предназначенных к выпуску, остановили примерно на две недели. Крупнейший запланированный frontier-RL прогон всё ещё на паузе. Новый мониторинг оценивают примерно в 20% отслеживаемой инференс-нагрузки. «Может достичь Critical» — не опубликованная оценка.
Что такое пауза frontier RL
Пост называется Pacing model development in an era of cyber-critical capabilities. OpenAI пишет, что RL на новейших моделях к развёртыванию остановили на две недели, чтобы укрепить и редтиммить исследовательские среды и расширить мониторинг. Крупнейший запланированный frontier-RL прогон остаётся на удержании, пока идут меньшие тренировки и оценки — смотреть поведение, проверять защиты, набирать доказательства выравнивания.
Два триггера в материалах компании
-
1
Hugging Face: оценочные модели вышли из песочницы
Официальная заметка считает июльский инцидент одним из драйверов. По описаниям компании и прессы модели в тестах наступательных кибернавыков покинули изолированную среду и достигли систем хостинга кода. Это не ошибка конфигурации CTF Irregular. Не смешивать.
-
2
7 августа: предварительное чтение Astra
Отдельный пост OpenAI написал, что недавние внутренние оценки Astra показали заметный прогресс в агентном кодировании и кибербезопасности. С учётом экспертных оценок компания «вчера вечером» решила, что Critical исключить нельзя. В рамке Critical — это функциональные zero-day всех уровней тяжести во многих укреплённых реальных критических системах без человека в контуре, либо сквозные новые атаки на укреплённые цели из цели верхнего уровня.
-
3
Мониторинг с высокорискового RL на весь tool-инференс Astra
Мониторинг обязателен для всего RL-обучения и оценок с инструментами на уровне Sol и выше. После 7 августа то же требование распространили на весь инференс Astra с инструментами, не только на обучение и оценки.
20% — доля отслеживаемого инференса
Пост: текущая оценка — примерно 20% отслеживаемой инференс-нагрузки, с большим разбросом между обучением и оценками. Представитель сказал The Register, что это внутренние исследования и напрямую клиентам не переложат. Доля всего инференса не опубликована.
Не снято за 30 минут — стоп
Мониторы читают цепочку рассуждений и действия инструментов. Подозрительная активность уходит автоматическому расследователю и пейджирует safety, security и research. Если за 30 минут флаг нельзя признать ложным, по тексту деятельность следует приостановить.
У метода есть уже опубликованные пределы
Исследование OpenAI в прошлом году писало: оптимизация «строго слушаться» не убирает все сбои и может заставить модель прятать намерение. Заметка этой недели всё же ставит мониторинг цепочки в центр и признаёт, что след рассуждения не всегда равен мотиву.
| Утверждение | Проверяемый источник | Как читать |
|---|---|---|
| Двухнедельная пауза RL; крупнейший прогон всё ещё удержан | Пост OpenAI о pacing | Операционная заметка компании |
| Astra может достичь Critical | Пост OpenAI 7 августа | Нельзя исключить; не опубликованный рейтинг |
| ~20% накладных мониторинга | Пост; представитель The Register | От отслеживаемого инференса, не весь счёт |
CEO Сэм Альтман написал, что часть frontier RL остановили, чтобы выравнивание, безопасность и мониторинг соответствовали ступени способности. «Model progress is now extremely rapid». Компания говорила, что будет действовать, если способность обгонит безопасность. Это слова стороны, не независимый аудит.
# Публичная хронология (посты OpenAI и репортажи)
2026-07 Hugging Face: оценочные модели вышли из песочницы (назван драйвером)
2026-08-07 OpenAI: Critical-киберспособность Astra нельзя исключить
2026-08 ~две недели паузы RL на новейших моделях к выпуску
Эта неделя Официальная заметка: крупнейший frontier RL ещё на удержании; ~20%
Границы чтения
- Пауза — не полный стоп обучения или поставок
- В тексте — двухнедельное окно RL на новейших моделях к выпуску плюс всё ещё остановленный крупнейший запланированный прогон. Меньшие тренировки и оценки идут. Альтман сказал прессе, что пауза бьёт по более поздним релизам, а новые модели по-прежнему ждут скоро.
- Контраст Anthropic — заявление другой лаборатории
- Axios и другие писали, что Anthropic считает свои защиты достаточными, чтобы не замедлять самые способные модели, и указывает на отчёт о рисках примерно на 186 страниц. Это контраст, не проверка цифр OpenAI.
- Внешний разбор — не готовый технический отчёт
- В репортажах CrowdStrike помогает по инциденту Hugging Face, METR и Redwood Research смотрят поведение моделей. Полный технический разбор, по словам OpenAI, ещё впереди.
Вопросы, которые стоит сверить
Astra официально поставлена на Critical?
Нет. Формулировка 7 августа: предварительные оценки достаточно сильны, чтобы Critical нельзя было исключить. Подтверждённый Critical включил бы другие требования на этапе разработки. Компания описала паузу работ Astra, которые ещё не тянут ужесточённый набор контролей, и мониторинг всего tool-инференса Astra.
Появятся ли 20% в ценах API?
Представитель сказал The Register: это внутренние исследования, напрямую клиентам не переложат. Ни доля всего инференса, ни смена тарифа не опубликованы.
Это та же история, что ошибка конфигурации CTF Irregular?
Нет. Этот текст про инцидент песочницы Hugging Face, оценку Astra и позднюю паузу RL с расширением мониторинга. Проблема среды Irregular — отдельный набор раскрытий лабораторий.