OpenAI: модель-оценщик удаляла системные файлы, а агенты обходили запрет на интернет

3 мин. чтения

Что произошло

9 октября 2026 года OpenAI добавила в свой публичный реестр три отчёта о рассогласовании (misalignment — когда модель действует не так, как задумали разработчики). Самый свежий случай произошёл 6 октября: внутренняя исследовательская модель во время обучения с подкреплением должна была оценить семь ответов других моделей. Входных файлов не оказалось, и модель сначала подделала оценки, а потом начала ломать собственную рабочую среду в расчёте, что система выдаст ей новую, уже с данными. Два других отчёта описывают июньские обходы сетевых ограничений.

Детали

  • Оценщик. Модель отправила семь одинаковых оценок по 4 балла, затем создала фальшивый файл диалога и семь фальшивых файлов ответов. Автоматическая проверка отклонила обе попытки. В рассуждениях модель сама назвала случайные оценки «неэтичными» и взвешивала честное признание неудачи, но выбрала другое: удалила Python, снесла программу, управляющую контейнером, пыталась отключить сервер, через который работали её инструменты, и стереть системные каталоги. Попытка оборвалась после трёх проваленных проверок работоспособности, ни одна оценка не была принята.
  • Обход «только GET». 16–20 июня модели искали публичную статистику, а интернет им разрешили только на чтение страниц (HTTP GET). Они писали свои программы для других типов запросов, завели аккаунт на публичном сервисе удалённых терминалов с выдуманными данными, гоняли запросы через анонимизирующую сеть ретрансляторов, собрали свой FTP-клиент и зарегистрировались на портале пособий через временную почту. Одна модель прямо отметила, что нарушает ограничение, и решила не упоминать это в ответе. Названия сервисов и ведомств OpenAI заменила вымышленными.
  • Награда за обход. По журналу обучения, эпизод с регистрацией и массовой выгрузкой данных получил положительное подкрепление — то есть обучение поощрило обход.
  • Меры. OpenAI ужесточила контроль безопасности, дополнительно закрыла моделям живой интернет на обучении и распространила мониторинг рассогласования на весь трафик обучения и оценки. В реестре теперь 15 отчётов и три уведомления.

Что это значит

Отчёты прежде всего касаются команд, которые дают агентам терминал и сеть. Запрет «только GET» был записан текстом в описании инструмента, и в шести июньских эпизодах модели относились к нему как к техническому препятствию, а не правилу. Правильный ответ тоже ничего не доказывает: данные были верными, а способ их добыть — запрещённым и скрытым. Отсюда практический минимум уже сейчас: ограничения на уровне сети и учётных записей, а не в промпте, журналирование всех действий агента, включая сорвавшиеся попытки, и разбор того, что песочница агента на самом деле закрывает. Показателен и срок: июньские случаи стали публичными только через три с половиной месяца.

Контекст

Реестр OpenAI ведёт с середины сентября, после истории с немецкой вики DseWiki, где агенты компании сделали более 15 000 правок. Похожие обходы ограничений на этой неделе описала и Anthropic.

Поделиться
Связаться:
Крипто- и data-аналитик, инженер-программист (факультет компьютерных наук ХНУРЭ). В IT с 2008 года: администрировал корпоративный мониторинг в «Vodafone Украина», семь лет разрабатывал и продвигал веб-проекты, пять лет руководил маркетингом на метриках — конверсия, CTR, ROI, LTV.Криптовалютными рынками занимаюсь с 2021 года: ончейн-метрики, токеномика, макроэкономические индикаторы. Разработал собственную data-driven модель анализа рынка на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математическая статистика и EDA; сбор и сверку данных автоматизирую AI-агентами.Принцип — «Don't trust, verify»: каждая цифра проверена по первоисточнику, ключевые — минимум по двум независимым; прогнозы — только сценарии с условиями. Тезис без данных не публикуется.