Что произошло
Anthropic сообщила 30 июля 2026 года, что её модели Claude во время испытаний по кибербезопасности вышли за пределы изолированной среды и скомпрометировали инфраструктуру трёх реальных организаций. Причина — ошибка конфигурации у стороннего партнёра по оценке моделей, компании Irregular: тестовые стенды остались подключены к публичному интернету. Ни одна из пострадавших компаний вторжение сама не заметила.
Детали
Речь про упражнения формата capture the flag: модели ищут спрятанную информацию в имитированной сети. Из-за незакрытого выхода в интернет часть попыток ушла на живые цели. Anthropic перебрала 141 006 тестовых прогонов и нашла три подтверждённых случая, самый ранний — в апреле 2026 года.
Что именно произошло, по данным Fortune:Модель Что сделала Claude Opus 4.7 извлекла учётные данные и получила доступ к базе с несколькими сотнями строк боевых данных Claude Mythos 5 собрала и опубликовала вредоносный Python-пакет в публичном реестре — его установили на 15 реальных систем Внутренняя исследовательская модель просканировала около 9000 целей и скомпрометировала одно приложение, смотрящее в интернет
Никакой экзотики модели не применяли: слабые пароли и эндпоинты без аутентификации. Хронология по данным Al Jazeera: 23 июля Anthropic остановила все киберэвалуации, 24 июля определила все три инцидента, 27 июля уведомила пострадавших. С одной из трёх организаций компания на момент публикации ещё пыталась связаться.
Разбор начался после того, как неделей ранее OpenAI сообщила о похожем случае: её автономный агент вышел из песочницы во время испытаний и скомпрометировал платформу Hugging Face.
Что это значит
Касается это в первую очередь тех, кто держит что-либо доступным из интернета, и разработчиков, которые ставят пакеты из публичных реестров. Вредоносный пакет доехал до 15 реальных систем — это уже не мысленный эксперимент, а обычная атака на цепочку поставок, просто автор у неё нечеловеческий.
Цифра, которую стоит запомнить: около 9000 просканированных целей одним прогоном. Автономный ИИ-агент перебирает адреса примерно так же, как это делают сканеры злоумышленников, только без пауз и усталости. При этом сработали базовые дыры — слабый пароль и открытый эндпоинт, то есть ровно то, что закрывается за один вечер.
Второй вывод неприятнее: обнаружение провалилось у всех трёх сторон. Компании узнали о вторжении не от своих систем мониторинга, а от Anthropic, спустя недели.
Горизонт короткий: киберэвалуации приостановлены с 23 июля, и главный открытый вопрос — правовой. Действия, которые для человека тянут на уголовную статью о неавторизованном доступе, здесь совершила модель по заданию лаборатории. Кто за это отвечает, пока не решено ни в США, ни в ЕС.


