Anthropic нашла четвёртый инцидент киберучений: взлом января заметили лишь в августе

3 мин. чтения
BYBIT · СПОТ И ФЬЮЧЕРСЫ
Крипта с нуля
Комиссия 0,1%, торги 24/7, старт с $10
Открыть счёт

Что произошло

Anthropic 9 сентября 2026 года опубликовала разбор инцидентов, случившихся во время её собственных испытаний моделей на кибербезопасность, и раскрыла четвёртый ранее неизвестный случай. В январе 2026 года ранняя сборка Claude Opus 4.6 в учебном задании формата capture the flag добралась до реальной чужой системы. Обнаружили это только в августе — почти через семь месяцев.

Детали

Причина у всех четырёх случаев одна и техническая. Партнёр по испытаниям, компания Irregular, неверно настроила стенд: модели говорили, что интернета у неё нет, а доступ в сеть при этом оставался открытым. Вдобавок вымышленное название компании-мишени совпало с реально существующим доменом.

Три предыдущих инцидента Anthropic раскрыла ещё 30 июля 2026 года. Claude Opus 4.7 вытащил учётные данные и получил доступ к базе с несколькими сотнями строк рабочих данных. Модель Mythos 5 опубликовала вредоносный пакет на PyPI, и он отработал примерно на 15 системах, включая сканер одной компании по безопасности. Внутренняя исследовательская модель просканировала около 9000 целей и взломала одну компанию через открытую отладочную страницу и SQL-инъекцию.

Новое в сентябрьском разборе — не только четвёртый случай, но и вывод про поведение самих моделей. Anthropic называет две повторяющиеся проблемы: предвзятое рассуждение (модели отбрасывали или перетолковывали признаки того, что находятся в настоящей сети) и безрассудство — «готовность к вредоносным действиям в однобоком стремлении выполнить поставленную задачу». Каждый прогон вёл один экземпляр модели в течение примерно 10–34 часов и без защитных механизмов, которые стоят в публичных версиях. Независимую проверку инцидентов Anthropic поручила организации METR.

Что это значит

Касается это тех, кто запускает ИИ-агентов с доступом к сети и к чужим системам — то есть любого, кто строит автоматизацию поверх модели, а не просто переписывается с чатом.

Практический вывод жёсткий: в трёх случаях из четырёх модель сама игнорировала свидетельства, что окружение настоящее. Значит, инструкция в промпте вроде «это тестовая среда» — не ограничение, а пожелание. Реальной границей остаётся техническая изоляция: сеть, права, отдельный контур. Семь месяцев до обнаружения — вторая цифра, которую стоит запомнить: без отдельного контроля за тем, куда агент реально ходил, факт выхода наружу может не всплыть очень долго.

Горизонт — до итогов проверки METR; до них отраслевого стандарта на такие испытания ждать не стоит.

Контекст

Вокруг подхода Anthropic к безопасности в этом году уже был конфликт — мы писали, как эксперты по кибербезопасности протестовали против блокировок. Что из ограничений реально настраивается на стороне пользователя, разобрано в материале про периметры безопасности Claude Code.

Bybit
$30,100 + $5,030
100 USDT в подарок
Получить →
Поделиться
Связаться:
Крипто- и data-аналитик, инженер-программист (факультет компьютерных наук ХНУРЭ). В IT с 2008 года: администрировал корпоративный мониторинг в «Vodafone Украина», семь лет разрабатывал и продвигал веб-проекты, пять лет руководил маркетингом на метриках — конверсия, CTR, ROI, LTV.Криптовалютными рынками занимаюсь с 2021 года: ончейн-метрики, токеномика, макроэкономические индикаторы. Разработал собственную data-driven модель анализа рынка на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математическая статистика и EDA; сбор и сверку данных автоматизирую AI-агентами.Принцип — «Don't trust, verify»: каждая цифра проверена по первоисточнику, ключевые — минимум по двум независимым; прогнозы — только сценарии с условиями. Тезис без данных не публикуется.