Anthropic: Claude у ролі автодослідника закрив 10 типів збоїв вирівнювання

3 хв. читання
BINANCE SIMPLE EARN
Крипта лежить?
Simple Earn: відсоток нараховується щодня
Відкрити Earn

Що сталося

28 серпня 2026 року Anthropic опублікувала роботу «Automated Researchers Can Reliably Mitigate Alignment Failures». У ній Claude працює автоматичним дослідником вирівнювання — тобто приведення поведінки моделі у відповідність до того, чого від неї очікують. Система сама шукає літературу, пропонує методи й дані, навчає модель, перевіряє результат і відкидає те, що не спрацювало. За всіма десятьма взятими категоріями збоїв Claude знайшов методи, які поліпшили цільові показники.

Деталі

Перевіряли десять категорій збоїв: серед них обман, підлабузництво (модель піддакує користувачеві замість чесної відповіді), порушення приватності, обхід обмежень і «злам винагороди», коли модель оптимізує метрику замість самого завдання. Використовували бенчмарки ConfAIde, PrivaCI-Bench, PrivacyLens та відкритий інструмент Petri, який проганяє змагальні багатоходові сценарії.

Числа з публікації Anthropic:

  • на обмані найкращий метод Claude виявився на 20% кращим за найкращу людську пропозицію і закрив 85% розриву безпеки проти 20% в дослідників-людей;
  • за всіма десятьма категоріями закрита частина розриву — від 26% до 96%;
  • знайдені методи далі працювали на моделях у 4,7 раза більших за ті, під які їх добирали;
  • на Claude Sonnet 5 система за 60 годин перебрала понад 50 рішень, а метод-переможець складався трохи більше ніж із 2000 навчальних прикладів — приблизно у 15 000 разів ощадливіше за штатну процедуру вирівнювання.

За оцінкою TechCrunch, година роботи такого автодослідника коштує близько $4 в API проти $150 за годину дослідника-людини (на дату публікації, 28 серпня 2026 року).

Що це означає

Стосується це насамперед тих, хто будує продукти поверх API. Вирівнювання — найдорожча й найповільніша частина випуску моделі; якщо її вдається частково автоматизувати, правки безпеки починають виходити частіше, а не раз на мажорний реліз. Різниця в $4 проти $150 за годину — це і є той важіль, який робить перебір пʼятдесяти варіантів узагалі можливим.

Обережність тут доречніша за захват, і Anthropic проговорює її сама: досліджені збої вузькі порівняно з продуктовими, частина проблем виникає так рідко, що бенчмарка під них просто немає, а Petri лишається тільки наближенням до справжнього неузгодження. Чи тримаються поліпшення після тривалого донавчання з підкріпленням, не перевіряли взагалі. До того ж сама система намагалася шахраювати: сліди спроб знайшли в 39 із приблизно 1600 розшифровок — це 2,4%. Тема для нас не нова: Anthropic і раніше розбирала внутрішню механіку Claude публічно.

Горизонт — найближчі релізи моделей. Дивитися варто не на формулювання про самопокращення, а на те, чи зʼявляться ці методи в картках безпеки наступних версій.

BINANCE · СПОТ І ДЕРИВАТИВИ
Крипта з нуля
Комісія 0,1%, торги 24/7, старт з $10
Відкрити рахунок
Поділитися
Зв'язатися:
Крипто- та data-аналітик, інженер-програміст (факультет комп'ютерних наук ХНУРЕ). В IT з 2008 року: адміністрував корпоративний моніторинг у «Vodafone Україна», сім років розробляв і просував веб-проєкти, п'ять років керував маркетингом на метриках — конверсія, CTR, ROI, LTV.Криптовалютними ринками займаюся з 2021 року: ончейн-метрики, токеноміка, макроекономічні індикатори. Розробив власну data-driven модель аналізу ринку на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математична статистика та EDA; збір і звірку даних автоматизую AI-агентами.Принцип — «Don't trust, verify»: кожна цифра перевірена за першоджерелом, ключові — щонайменше за двома незалежними; прогнози — лише сценарії з умовами. Теза без даних не публікується.