Що сталося
Anthropic оприлюднила 14 серпня 2026 року звіт про ризики (Redacted Risk Report) і визнала в ньому власний прокол. Класифікатори, які блокують небезпечні запити про біологічну та хімічну зброю, не працювали на трафіку підрядників — із травня 2025 року до квітня 2026-го, майже рік. Крізь цю діру пройшло близько 133 млн обмінів повідомленнями від приблизно 50 000 людей.
Деталі
Ідеться про людей, які оцінюють відповіді моделей — так зване розмічання зворотного зв’язку. Наймають їх зовнішні підрядники, і Anthropic прямо пише, що сама цих людей не перевіряла: відбір був на боці постачальників, а в багатьох із них не було процедур, здатних відсіяти навіть низькорівневого зловмисника.
Причина збою — технічний прапорець, задуманий лише для внутрішнього використання. Він вимикав не тільки блокування, а й запис спрацювань: підозрілий запит не потрапляв ані в логи, ані на ревю. Більшість розмітників при цьому мали доступ до вільного діалогу з моделями, а не до врізаного інтерфейсу «оціни готову відповідь».
Заднім числом компанія прогнала по всіх репліках людей класифікатор на базі Claude Sonnet 5. Результат:Що перевіряли Скільки Позначено як високий біоризик 1197 діалогів Із них від внутрішніх команд Anthropic 757 Із залишку — вправи red team усі, крім 62 Розібрано вручну 62 + 30 випадкових red-team
Явних ознак небезпечного використання не знайшли — лише кілька діалогів подвійного призначення на академічному рівні. Транскрипти збереглися майже по всьому трафіку, крім приблизно 1%: там користувач не натиснув «надіслати».
Що це означає
Кого це стосується насамперед — не пересічних користувачів Claude, а компаній, які будують продукти на чужих моделях і розраховують, що «у постачальника захист увімкнено». Тут його було вимкнено рік, і ніхто цього не помічав, бо той самий прапорець вимкнув і сигналізацію.
Масштаб ризику варто читати тверезо в обидва боки. 133 млн діалогів — це не збій на годину, і повної картини немає навіть заднім числом: спрацювання не записувалися, а по 1% трафіку транскриптів не лишилося взагалі. З іншого боку, ретроперевірка знайшла всього 62 підозрілих діалоги поза red team, і всі вони розібрані вручну. Сама Anthropic робить неприємніший висновок: якщо така діра знайшлася, ймовірність інших, ще не знайдених, вища, ніж вважалося.
Горизонт — просто зараз. Звіт уже опублікований, і це готовий матеріал для регуляторів, які саме сперечаються, чи можна довіряти самоконтролю розробників моделей.
Контекст
Anthropic — одна з небагатьох компаній, які публікують такі розбори власних провалів, і в цьому ж документі описано ще кілька збоїв процесів безпеки. Ситуація з наглядом за передовими моделями змінюється швидко: у США держава вже взяла під контроль випуск топових AI-моделей, і подібні звіти стають аргументом у цій суперечці.



