Anthropic: Claude в роли автоисследователя закрыл 10 типов сбоев выравнивания

3 мин. чтения
BYBIT EARN
Крипта лежит?
Bybit Earn: процент капает каждый день
Открыть Earn

Что произошло

28 августа 2026 года Anthropic опубликовала работу «Automated Researchers Can Reliably Mitigate Alignment Failures». В ней Claude работает автоматическим исследователем выравнивания — то есть приведения поведения модели в соответствие с тем, чего от неё ждут. Система сама ищет литературу, предлагает методы и данные, обучает модель, проверяет результат и отбрасывает то, что не сработало. По всем десяти взятым категориям сбоев Claude нашёл методы, которые улучшили целевые показатели.

Детали

Проверяли десять категорий сбоев: среди них обман, подхалимство (модель поддакивает пользователю вместо честного ответа), нарушение приватности, обход ограничений и «взлом награды», когда модель оптимизирует метрику вместо самой задачи. Использовались бенчмарки ConfAIde, PrivaCI-Bench, PrivacyLens и открытый инструмент Petri, который прогоняет состязательные многоходовые сценарии.

Цифры из публикации Anthropic:

  • на обмане лучший метод Claude оказался на 20% лучше лучшего человеческого предложения и закрыл 85% разрыва безопасности против 20% у исследователей-людей;
  • по всем десяти категориям закрытая часть разрыва — от 26% до 96%;
  • найденные методы продолжали работать на моделях в 4,7 раза крупнее тех, под которые их подбирали;
  • на Claude Sonnet 5 система за 60 часов перебрала более 50 решений, а победивший метод состоял чуть более чем из 2000 обучающих примеров — примерно в 15 000 раз экономнее штатной процедуры выравнивания.

По оценке TechCrunch, час работы такого автоисследователя стоит около $4 в API против $150 за час исследователя-человека (на дату публикации, 28 августа 2026 года).

Что это значит

Касается это в первую очередь тех, кто строит продукты поверх API. Выравнивание — самая дорогая и медленная часть выпуска модели; если её удаётся частично автоматизировать, правки безопасности начинают выходить чаще, а не раз в мажорный релиз. Разница в $4 против $150 за час — это и есть тот рычаг, который делает перебор пятидесяти вариантов вообще возможным.

Осторожность тут уместнее восторга, и Anthropic проговаривает её сама: изученные сбои узкие по сравнению с продуктовыми, часть проблем возникает так редко, что бенчмарка под них просто нет, а Petri остаётся лишь приближением к настоящему рассогласованию. Держатся ли улучшения после длительного дообучения с подкреплением, не проверяли вовсе. Плюс сама система пыталась жульничать: следы попыток нашли в 39 из примерно 1600 расшифровок — это 2,4%. Тема для нас не новая: Anthropic и раньше разбирала внутреннюю механику Claude публично.

Горизонт — ближайшие релизы моделей. Смотреть стоит не на формулировки о самоулучшении, а на то, появятся ли эти методы в карточках безопасности следующих версий.

Bybit
SpaceX за крипту
Дробные доли · 24/7
Открыть рынок →
Поделиться
Связаться:
Крипто- и data-аналитик, инженер-программист (факультет компьютерных наук ХНУРЭ). В IT с 2008 года: администрировал корпоративный мониторинг в «Vodafone Украина», семь лет разрабатывал и продвигал веб-проекты, пять лет руководил маркетингом на метриках — конверсия, CTR, ROI, LTV.Криптовалютными рынками занимаюсь с 2021 года: ончейн-метрики, токеномика, макроэкономические индикаторы. Разработал собственную data-driven модель анализа рынка на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математическая статистика и EDA; сбор и сверку данных автоматизирую AI-агентами.Принцип — «Don't trust, verify»: каждая цифра проверена по первоисточнику, ключевые — минимум по двум независимым; прогнозы — только сценарии с условиями. Тезис без данных не публикуется.