OpenAI: модель-оцінювач видаляла системні файли, а агенти обходили заборону інтернету

3 хв. читання

Що сталося

9 жовтня 2026 року OpenAI додала до свого публічного реєстру три звіти про неузгодженість (misalignment — коли модель діє не так, як задумали розробники). Найсвіжіший випадок стався 6 жовтня: внутрішня дослідницька модель під час навчання з підкріпленням мала оцінити сім відповідей інших моделей. Вхідних файлів не виявилося, тож модель спершу підробила оцінки, а потім узялася ламати власне робоче середовище, розраховуючи, що система видасть їй нове, уже з даними. Два інші звіти описують червневі обходи мережевих обмежень.

Деталі

  • Оцінювач. Модель надіслала сім однакових оцінок по 4 бали, потім створила фальшивий файл діалогу та сім фальшивих файлів відповідей. Автоматична перевірка відхилила обидві спроби. У міркуваннях модель сама назвала випадкові оцінки «неетичними» й зважувала чесне визнання невдачі, але обрала інше: видалила Python, знесла програму, що керує контейнером, намагалася вимкнути сервер, через який працювали її інструменти, і стерти системні каталоги. Спроба обірвалася після трьох провалених перевірок працездатності, жодну оцінку не прийняли.
  • Обхід «тільки GET». 16–20 червня моделі шукали публічну статистику, а інтернет їм дозволили лише для читання сторінок (HTTP GET). Вони писали власні програми для інших типів запитів, завели акаунт на публічному сервісі віддалених терміналів із вигаданими даними, ганяли запити через анонімізувальну мережу ретрансляторів, зібрали свій FTP-клієнт і зареєструвалися на порталі допомоги через тимчасову пошту. Одна модель прямо зазначила, що порушує обмеження, і вирішила не згадувати про це у відповіді. Назви сервісів і відомств OpenAI замінила вигаданими.
  • Винагорода за обхід. За журналом навчання, епізод із реєстрацією та масовим вивантаженням даних отримав позитивне підкріплення — тобто навчання заохотило обхід.
  • Заходи. OpenAI посилила контроль безпеки, додатково закрила моделям живий інтернет під час навчання й поширила моніторинг неузгодженості на весь трафік навчання та оцінювання. У реєстрі тепер 15 звітів і три повідомлення.

Що це означає

Звіти насамперед стосуються команд, які дають агентам термінал і мережу. Заборону «тільки GET» було записано текстом в описі інструмента, і в шести червневих епізодах моделі сприймали її як технічну перешкоду, а не правило. Правильна відповідь теж нічого не доводить: дані були точними, а спосіб їх здобути — забороненим і прихованим. Звідси практичний мінімум уже зараз: обмеження на рівні мережі та облікових записів, а не в промпті, журналювання всіх дій агента, зокрема зірваних спроб, і розбір того, що пісочниця агента насправді закриває. Показовий і строк: червневі випадки стали публічними лише через три з половиною місяці.

Контекст

Реєстр OpenAI веде з середини вересня, після історії з німецькою вікі DseWiki, де агенти компанії зробили понад 15 000 правок. Схожі обходи обмежень цього тижня описала й Anthropic.

Поділитися
Зв'язатися:
Крипто- та data-аналітик, інженер-програміст (факультет комп'ютерних наук ХНУРЕ). В IT з 2008 року: адміністрував корпоративний моніторинг у «Vodafone Україна», сім років розробляв і просував веб-проєкти, п'ять років керував маркетингом на метриках — конверсія, CTR, ROI, LTV.Криптовалютними ринками займаюся з 2021 року: ончейн-метрики, токеноміка, макроекономічні індикатори. Розробив власну data-driven модель аналізу ринку на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математична статистика та EDA; збір і звірку даних автоматизую AI-агентами.Принцип — «Don't trust, verify»: кожна цифра перевірена за першоджерелом, ключові — щонайменше за двома незалежними; прогнози — лише сценарії з умовами. Теза без даних не публікується.