Anthropic рік не фільтрувала біозапити підрядників: 133 млн діалогів повз захист

3 хв. читання
BINANCE · СПОТ І ДЕРИВАТИВИ
Крипта з нуля
Комісія 0,1%, торги 24/7, старт з $10
Відкрити рахунок

Що сталося

Anthropic оприлюднила 14 серпня 2026 року звіт про ризики (Redacted Risk Report) і визнала в ньому власний прокол. Класифікатори, які блокують небезпечні запити про біологічну та хімічну зброю, не працювали на трафіку підрядників — із травня 2025 року до квітня 2026-го, майже рік. Крізь цю діру пройшло близько 133 млн обмінів повідомленнями від приблизно 50 000 людей.

Деталі

Ідеться про людей, які оцінюють відповіді моделей — так зване розмічання зворотного зв’язку. Наймають їх зовнішні підрядники, і Anthropic прямо пише, що сама цих людей не перевіряла: відбір був на боці постачальників, а в багатьох із них не було процедур, здатних відсіяти навіть низькорівневого зловмисника.

Причина збою — технічний прапорець, задуманий лише для внутрішнього використання. Він вимикав не тільки блокування, а й запис спрацювань: підозрілий запит не потрапляв ані в логи, ані на ревю. Більшість розмітників при цьому мали доступ до вільного діалогу з моделями, а не до врізаного інтерфейсу «оціни готову відповідь».

Заднім числом компанія прогнала по всіх репліках людей класифікатор на базі Claude Sonnet 5. Результат:

Що перевірялиСкільки
Позначено як високий біоризик1197 діалогів
Із них від внутрішніх команд Anthropic757
Із залишку — вправи red teamусі, крім 62
Розібрано вручну62 + 30 випадкових red-team

Явних ознак небезпечного використання не знайшли — лише кілька діалогів подвійного призначення на академічному рівні. Транскрипти збереглися майже по всьому трафіку, крім приблизно 1%: там користувач не натиснув «надіслати».

Що це означає

Кого це стосується насамперед — не пересічних користувачів Claude, а компаній, які будують продукти на чужих моделях і розраховують, що «у постачальника захист увімкнено». Тут його було вимкнено рік, і ніхто цього не помічав, бо той самий прапорець вимкнув і сигналізацію.

Масштаб ризику варто читати тверезо в обидва боки. 133 млн діалогів — це не збій на годину, і повної картини немає навіть заднім числом: спрацювання не записувалися, а по 1% трафіку транскриптів не лишилося взагалі. З іншого боку, ретроперевірка знайшла всього 62 підозрілих діалоги поза red team, і всі вони розібрані вручну. Сама Anthropic робить неприємніший висновок: якщо така діра знайшлася, ймовірність інших, ще не знайдених, вища, ніж вважалося.

Горизонт — просто зараз. Звіт уже опублікований, і це готовий матеріал для регуляторів, які саме сперечаються, чи можна довіряти самоконтролю розробників моделей.

Контекст

Anthropic — одна з небагатьох компаній, які публікують такі розбори власних провалів, і в цьому ж документі описано ще кілька збоїв процесів безпеки. Ситуація з наглядом за передовими моделями змінюється швидко: у США держава вже взяла під контроль випуск топових AI-моделей, і подібні звіти стають аргументом у цій суперечці.

BINANCE SIMPLE EARN
Крипта лежить?
Simple Earn: відсоток нараховується щодня
Відкрити Earn
Поділитися
Зв'язатися:
Крипто- та data-аналітик, інженер-програміст (факультет комп'ютерних наук ХНУРЕ). В IT з 2008 року: адміністрував корпоративний моніторинг у «Vodafone Україна», сім років розробляв і просував веб-проєкти, п'ять років керував маркетингом на метриках — конверсія, CTR, ROI, LTV.Криптовалютними ринками займаюся з 2021 року: ончейн-метрики, токеноміка, макроекономічні індикатори. Розробив власну data-driven модель аналізу ринку на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математична статистика та EDA; збір і звірку даних автоматизую AI-агентами.Принцип — «Don't trust, verify»: кожна цифра перевірена за першоджерелом, ключові — щонайменше за двома незалежними; прогнози — лише сценарії з умовами. Теза без даних не публікується.