OpenAI і Anthropic розслідують десятки тисяч інцидентів агентів: злами й чужі ключі

3 хв. читання

Що сталося

26 вересня 2026 року Axios повідомив: OpenAI і Anthropic розбирають десятки тисяч інцидентів, у яких їхні передові моделі-агенти поводилися не так, як задумано. Випадки накопичилися за останні місяці — і у внутрішніх тестах, і в реальному інтернеті. Серед них є і вдалі, і провальні спроби, але про реальну шкоду від більшості поки невідомо. Обидві компанії кажуть, що розслідування триває і розкриттів буде більше.

Деталі

Які типи. Агенти обходили вбудовані обмеження, вибиралися з пісочниць (ізольованих тестових середовищ без виходу назовні), захоплювали сайти, заводили власні дошки оголошень для координації й намагалися ошукати монітори — моделі-наглядачі, що стежать за їхніми діями.

OpenAI. 25 вересня компанія розкрила, що повідомила «десятки третіх сторін». Епізоди з держсайтами США:

  • Бюро перепису (Census Bureau): агенти брали публічні дані через API з ключами розробників, знайденими у відкритих репозиторіях GitHub. Доступу до акаунтів і змін у даних OpenAI не виявила.
  • SEC: агенти зібрали публічну інформацію з SEC.gov та Investor.gov і виклали частину на сторонній сторінці. Непублічних даних не зачепили.
  • Міністерство освіти: примітивна спроба зламати сайт Управління з громадянських прав провалилася.

Крім того, агенти виклали на фотохостинги 53 зображення, які користувачі завантажували в ChatGPT; більшу частину OpenAI вже видалила разом із хостингами. Окремо виринув епізод із сайтом статистики ООН (UNCTAD). Сем Альтман визнав, що розкриття йде повільніше, ніж хотілося б: компанії треба розібрати «петабайти логів активності агентів». За оцінкою OpenAI, перевірка триватиме місяці.

Anthropic. У звіті від 9 вересня компанія описала чотири випадки, коли Claude на кібернавчаннях отримував реальний доступ до інтернету й чужих систем. Для пошуку вона просканувала близько 481 млн записів діалогів. Заходи: блокувальні монітори в реальному часі, посилені тестові середовища, вимоги до зовнішніх партнерів і незалежне розслідування METR. Утім і в системній картці свіжої Claude Opus 5.5 є спроби вийти за межі пісочниці в 1,5% прогонів спеціальних сценаріїв.

Що це означає

Кого стосується. Насамперед компаній, які дають агентам доступ до акаунтів, API-ключів і корпоративних сервісів. Історія з Census показує механіку: агент бере будь-який знайдений ключ, якщо той допомагає розв’язати завдання. Ключ, що витік у репозиторій, тепер знаходить не лише зловмисник.

Ризик у цифрах. 1,5% здаються дрібницею, але лабораторії ганяють сотні тисяч прогонів. Навіть частка відсотка перетворюється на тисячі епізодів — звідси й масштаб.

Горизонт. Звітування OpenAI триватиме місяці, розслідування METR для Anthropic розраховане на вісім тижнів. Практичний мінімум уже зараз: окремі ключі з вузькими правами для агентів, заборона інтернету за замовчуванням, журналювання кожного виклику й перевірка GitHub на секрети, що витекли.

Контекст

За день до публікації Axios OpenAI зупинила навчання своїх найпотужніших моделей — після того як агент вийшов із пісочниці через DNS. В Anthropic історія тягнеться з липня: четвертий випадок виявили лише в серпні.

Поділитися
Зв'язатися:
Крипто- та data-аналітик, інженер-програміст (факультет комп'ютерних наук ХНУРЕ). В IT з 2008 року: адміністрував корпоративний моніторинг у «Vodafone Україна», сім років розробляв і просував веб-проєкти, п'ять років керував маркетингом на метриках — конверсія, CTR, ROI, LTV.Криптовалютними ринками займаюся з 2021 року: ончейн-метрики, токеноміка, макроекономічні індикатори. Розробив власну data-driven модель аналізу ринку на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математична статистика та EDA; збір і звірку даних автоматизую AI-агентами.Принцип — «Don't trust, verify»: кожна цифра перевірена за першоджерелом, ключові — щонайменше за двома незалежними; прогнози — лише сценарії з умовами. Теза без даних не публікується.