Anthropic год не фильтровала био-запросы подрядчиков: 133 млн диалогов мимо защиты

3 мин. чтения
BYBIT · СПОТ И ФЬЮЧЕРСЫ
Крипта с нуля
Комиссия 0,1%, торги 24/7, старт с $10
Открыть счёт

Что произошло

Anthropic опубликовала 14 августа 2026 года отчёт о рисках (Redacted Risk Report) и признала в нём собственный промах. Классификаторы, которые блокируют опасные запросы про биологическое и химическое оружие, не работали на трафике подрядчиков — с мая 2025 года по апрель 2026-го, почти год. Через эту дыру прошло около 133 млн обменов сообщениями от примерно 50 000 человек.

Детали

Речь о людях, которые оценивают ответы моделей — так называемая разметка обратной связи. Нанимают их внешние подрядчики, и Anthropic прямо пишет, что сама этих людей не проверяла: отбор был на стороне вендоров, а у многих из них не было процедур, способных отсеять даже низкоуровневого злоумышленника.

Причина сбоя — технический флаг, задуманный только для внутреннего использования. Он выключал не только блокировку, но и запись срабатываний: подозрительный запрос не попадал ни в логи, ни на ревью. Большинство размётчиков при этом имели доступ к свободному диалогу с моделями, а не к урезанному интерфейсу «оцени готовый ответ».

Задним числом компания прогнала по всем репликам людей классификатор на базе Claude Sonnet 5. Результат:

Что проверялиСколько
Помечено как высокий биориск1197 диалогов
Из них от внутренних команд Anthropic757
Из остатка — упражнения red teamвсе, кроме 62
Разобрано вручную62 + 30 случайных red-team

Явных признаков опасного использования не нашли — только несколько диалогов двойного назначения на академическом уровне. Транскрипты сохранились почти по всему трафику, кроме примерно 1%: там пользователь не нажал «отправить».

Что это значит

Кого касается в первую очередь — не рядовых пользователей Claude, а компании, которые строят продукты на чужих моделях и закладываются на то, что «у вендора защита включена». Здесь она была выключена год, и никто этого не замечал, потому что тот же флаг отключил и сигнализацию.

Масштаб риска стоит читать трезво в обе стороны. 133 млн диалогов — это не сбой на час, и полной картины нет даже задним числом: срабатывания не записывались, а по 1% трафика транскриптов вовсе не осталось. С другой стороны, ретро-проверка нашла всего 62 подозрительных диалога вне red team, и все они разобраны вручную. Сама Anthropic делает более неприятный вывод: раз такая дыра нашлась, вероятность других, ещё не найденных, выше, чем считалось.

Горизонт — прямо сейчас. Отчёт уже опубликован, и это готовый материал для регуляторов, которые как раз спорят, можно ли доверять самоконтролю разработчиков моделей.

Контекст

Anthropic — одна из немногих компаний, которые публикуют такие разборы собственных провалов, и в этом же документе описано ещё несколько сбоев процессов безопасности. Ситуация с надзором за передовыми моделями меняется быстро: в США государство уже взяло под контроль выпуск топовых AI-моделей, и подобные отчёты становятся аргументом в этом споре.

BYBIT EARN
Крипта лежит?
Bybit Earn: процент капает каждый день
Открыть Earn
Поделиться
Связаться:
Крипто- и data-аналитик, инженер-программист (факультет компьютерных наук ХНУРЭ). В IT с 2008 года: администрировал корпоративный мониторинг в «Vodafone Украина», семь лет разрабатывал и продвигал веб-проекты, пять лет руководил маркетингом на метриках — конверсия, CTR, ROI, LTV.Криптовалютными рынками занимаюсь с 2021 года: ончейн-метрики, токеномика, макроэкономические индикаторы. Разработал собственную data-driven модель анализа рынка на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математическая статистика и EDA; сбор и сверку данных автоматизирую AI-агентами.Принцип — «Don't trust, verify»: каждая цифра проверена по первоисточнику, ключевые — минимум по двум независимым; прогнозы — только сценарии с условиями. Тезис без данных не публикуется.