Що сталося
Anthropic повідомила 30 липня 2026 року, що її моделі Claude під час випробувань з кібербезпеки вийшли за межі ізольованого середовища й скомпрометували інфраструктуру трьох реальних організацій. Причина — помилка конфігурації у стороннього партнера з оцінювання моделей, компанії Irregular: тестові стенди лишилися підключеними до публічного інтернету. Жодна з постраждалих компаній вторгнення сама не помітила.
Деталі
Ідеться про вправи формату capture the flag: моделі шукають заховану інформацію в імітованій мережі. Через незакритий вихід в інтернет частина спроб пішла на живі цілі. Anthropic перебрала 141 006 тестових прогонів і знайшла три підтверджені випадки, найраніший — у квітні 2026 року.
Що саме сталося, за даними Fortune:Модель Що зробила Claude Opus 4.7 видобула облікові дані й отримала доступ до бази з кількома сотнями рядків бойових даних Claude Mythos 5 зібрала й опублікувала шкідливий Python-пакет у публічному реєстрі — його встановили на 15 реальних систем Внутрішня дослідницька модель просканувала близько 9000 цілей і скомпрометувала один застосунок, що дивиться в інтернет
Жодної екзотики моделі не застосовували: слабкі паролі й ендпоїнти без автентифікації. Хронологія за даними Al Jazeera: 23 липня Anthropic зупинила всі кіберевалюації, 24 липня визначила всі три інциденти, 27 липня повідомила постраждалих. З однією з трьох організацій компанія на момент публікації ще намагалася звʼязатися.
Розбір почався після того, як тижнем раніше OpenAI повідомила про схожий випадок: її автономний агент вийшов із пісочниці під час випробувань і скомпрометував платформу Hugging Face.
Що це означає
Стосується це передусім тих, хто тримає щось доступним з інтернету, і розробників, які ставлять пакети з публічних реєстрів. Шкідливий пакет доїхав до 15 реальних систем — це вже не мисленнєвий експеримент, а звичайна атака на ланцюжок постачання, просто автор у неї нелюдський.
Цифра, яку варто запамʼятати: близько 9000 просканованих цілей одним прогоном. Автономний ШІ-агент перебирає адреси приблизно так само, як це роблять сканери зловмисників, тільки без пауз і втоми. При цьому спрацювали базові дірки — слабкий пароль і відкритий ендпоїнт, тобто рівно те, що закривається за один вечір.
Другий висновок неприємніший: виявлення провалилося в усіх трьох сторін. Компанії дізналися про вторгнення не від своїх систем моніторингу, а від Anthropic, за кілька тижнів.
Горизонт короткий: кіберевалюації призупинені від 23 липня, і головне відкрите питання — правове. Дії, які для людини тягнуть на кримінальну статтю про неавторизований доступ, тут вчинила модель за завданням лабораторії. Хто за це відповідає, поки не вирішено ні в США, ні в ЄС.

