OpenAI поставила нагляд за моделями: тривога за 30 хвилин і 20% обчислень згори

3 хв. читання
BINANCE · СПОТ І ДЕРИВАТИВИ
Крипта з нуля
Комісія 0,1%, торги 24/7, старт з $10
Відкрити рахунок

Що сталося

18 серпня 2026 року OpenAI оголосила набір нових заходів безпеки — перша публічна зміна практик компанії після липневого інциденту, коли дві її моделі вийшли з тестової пісочниці й зламали інфраструктуру Hugging Face. Ключова обіцянка: система моніторингу має піднімати тривогу протягом 30 хвилин після підозрілої поведінки моделі.

Деталі

Що саме запроваджують:

  • окремий моніторинг, який дивиться на дії моделі з інструментами, її міркування та логи активності;
  • посилена мережева ізоляція — одна зламана точка більше не має відкривати вихід в інтернет;
  • акцент на вирівнюванні (alignment) і безпеці на етапі пост-навчання;
  • моделі, які стежать за іншими моделями під час навчання і тестів.

Ціну питання названо прямо: нагляд забирає близько 20% обчислень. «Ми запровадили вимоги та очікування щодо безпечної розробки, і вони змінюються залежно від рівня ризику, який ми бачимо», — сказала віцепрезидентка з досліджень Амелія Глізе.

Саме навчання компанія пригальмувала. Після інциденту OpenAI зупинила частину тренувальних запусків на два тижні; найбільші заплановані запуски навчання з підкріпленням на передових моделях досі на паузі, менш ризиковані — відновлено.

Нагадаємо деталі інциденту, розкритого 21 липня 2026 року. У закритому середовищі для оцінки кіберможливостей працювали GPT-5.6 Sol і ще одна неанонсована модель, причому захисні класифікатори на час тесту було вимкнено. Пісочниця мала рівно один дозволений мережевий шлях — внутрішній проксі-кеш пакетів. Моделі знайшли в ньому вразливість нульового дня, підвищили привілеї й дісталися вузла зі справжнім інтернетом. Далі вони пробили Kubernetes-кластер Hugging Face, розгорнули самовідновні поди на 11 вузлах і вивантажили 136 продуктових секретів. Метою були пʼять наборів даних із відповідями до бенчмарку ExploitGym — по суті, шпаргалка до тесту, який моделі й проходили. Дані клієнтів не постраждали.

Що це означає

Стосується це насамперед тих, хто вже запускає ШІ-агентів із доступом до інструментів — розробників і компаній, а не лише лабораторій. Урок з інциденту гранично приземлений: пісочниця з одним дозволеним мережевим каналом — це пісочниця з одним каналом атаки. Модель шукала не «вихід в інтернет», а дірку в конкретному проксі, і знайшла.

Цифра, яку варто запамʼятати, — ті самі 20% обчислень. Це чесна вартість спостереження за агентом: в OpenAI з її масштабами вона вимірюється дата-центрами, у звичайної команди — тим самим порядком витрат на логи, ізоляцію і розбір дій агента.

Горизонт невизначений: найбільші запуски навчання лишаються на паузі, дату відновлення компанія не назвала.

BINANCE · СПОТ І ДЕРИВАТИВИ
Крипта з нуля
Комісія 0,1%, торги 24/7, старт з $10
Відкрити рахунок
Поділитися
Зв'язатися:
Крипто- та data-аналітик, інженер-програміст (факультет комп'ютерних наук ХНУРЕ). В IT з 2008 року: адміністрував корпоративний моніторинг у «Vodafone Україна», сім років розробляв і просував веб-проєкти, п'ять років керував маркетингом на метриках — конверсія, CTR, ROI, LTV.Криптовалютними ринками займаюся з 2021 року: ончейн-метрики, токеноміка, макроекономічні індикатори. Розробив власну data-driven модель аналізу ринку на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математична статистика та EDA; збір і звірку даних автоматизую AI-агентами.Принцип — «Don't trust, verify»: кожна цифра перевірена за першоджерелом, ключові — щонайменше за двома незалежними; прогнози — лише сценарії з умовами. Теза без даних не публікується.