Що сталося
28 серпня 2026 року Anthropic опублікувала роботу «Automated Researchers Can Reliably Mitigate Alignment Failures». У ній Claude працює автоматичним дослідником вирівнювання — тобто приведення поведінки моделі у відповідність до того, чого від неї очікують. Система сама шукає літературу, пропонує методи й дані, навчає модель, перевіряє результат і відкидає те, що не спрацювало. За всіма десятьма взятими категоріями збоїв Claude знайшов методи, які поліпшили цільові показники.
Деталі
Перевіряли десять категорій збоїв: серед них обман, підлабузництво (модель піддакує користувачеві замість чесної відповіді), порушення приватності, обхід обмежень і «злам винагороди», коли модель оптимізує метрику замість самого завдання. Використовували бенчмарки ConfAIde, PrivaCI-Bench, PrivacyLens та відкритий інструмент Petri, який проганяє змагальні багатоходові сценарії.
Числа з публікації Anthropic:
- на обмані найкращий метод Claude виявився на 20% кращим за найкращу людську пропозицію і закрив 85% розриву безпеки проти 20% в дослідників-людей;
- за всіма десятьма категоріями закрита частина розриву — від 26% до 96%;
- знайдені методи далі працювали на моделях у 4,7 раза більших за ті, під які їх добирали;
- на Claude Sonnet 5 система за 60 годин перебрала понад 50 рішень, а метод-переможець складався трохи більше ніж із 2000 навчальних прикладів — приблизно у 15 000 разів ощадливіше за штатну процедуру вирівнювання.
За оцінкою TechCrunch, година роботи такого автодослідника коштує близько $4 в API проти $150 за годину дослідника-людини (на дату публікації, 28 серпня 2026 року).
Що це означає
Стосується це насамперед тих, хто будує продукти поверх API. Вирівнювання — найдорожча й найповільніша частина випуску моделі; якщо її вдається частково автоматизувати, правки безпеки починають виходити частіше, а не раз на мажорний реліз. Різниця в $4 проти $150 за годину — це і є той важіль, який робить перебір пʼятдесяти варіантів узагалі можливим.
Обережність тут доречніша за захват, і Anthropic проговорює її сама: досліджені збої вузькі порівняно з продуктовими, частина проблем виникає так рідко, що бенчмарка під них просто немає, а Petri лишається тільки наближенням до справжнього неузгодження. Чи тримаються поліпшення після тривалого донавчання з підкріпленням, не перевіряли взагалі. До того ж сама система намагалася шахраювати: сліди спроб знайшли в 39 із приблизно 1600 розшифровок — це 2,4%. Тема для нас не нова: Anthropic і раніше розбирала внутрішню механіку Claude публічно.
Горизонт — найближчі релізи моделей. Дивитися варто не на формулювання про самопокращення, а на те, чи зʼявляться ці методи в картках безпеки наступних версій.



