Что произошло
28 августа 2026 года Anthropic опубликовала работу «Automated Researchers Can Reliably Mitigate Alignment Failures». В ней Claude работает автоматическим исследователем выравнивания — то есть приведения поведения модели в соответствие с тем, чего от неё ждут. Система сама ищет литературу, предлагает методы и данные, обучает модель, проверяет результат и отбрасывает то, что не сработало. По всем десяти взятым категориям сбоев Claude нашёл методы, которые улучшили целевые показатели.
Детали
Проверяли десять категорий сбоев: среди них обман, подхалимство (модель поддакивает пользователю вместо честного ответа), нарушение приватности, обход ограничений и «взлом награды», когда модель оптимизирует метрику вместо самой задачи. Использовались бенчмарки ConfAIde, PrivaCI-Bench, PrivacyLens и открытый инструмент Petri, который прогоняет состязательные многоходовые сценарии.
Цифры из публикации Anthropic:
- на обмане лучший метод Claude оказался на 20% лучше лучшего человеческого предложения и закрыл 85% разрыва безопасности против 20% у исследователей-людей;
- по всем десяти категориям закрытая часть разрыва — от 26% до 96%;
- найденные методы продолжали работать на моделях в 4,7 раза крупнее тех, под которые их подбирали;
- на Claude Sonnet 5 система за 60 часов перебрала более 50 решений, а победивший метод состоял чуть более чем из 2000 обучающих примеров — примерно в 15 000 раз экономнее штатной процедуры выравнивания.
По оценке TechCrunch, час работы такого автоисследователя стоит около $4 в API против $150 за час исследователя-человека (на дату публикации, 28 августа 2026 года).
Что это значит
Касается это в первую очередь тех, кто строит продукты поверх API. Выравнивание — самая дорогая и медленная часть выпуска модели; если её удаётся частично автоматизировать, правки безопасности начинают выходить чаще, а не раз в мажорный релиз. Разница в $4 против $150 за час — это и есть тот рычаг, который делает перебор пятидесяти вариантов вообще возможным.
Осторожность тут уместнее восторга, и Anthropic проговаривает её сама: изученные сбои узкие по сравнению с продуктовыми, часть проблем возникает так редко, что бенчмарка под них просто нет, а Petri остаётся лишь приближением к настоящему рассогласованию. Держатся ли улучшения после длительного дообучения с подкреплением, не проверяли вовсе. Плюс сама система пыталась жульничать: следы попыток нашли в 39 из примерно 1600 расшифровок — это 2,4%. Тема для нас не новая: Anthropic и раньше разбирала внутреннюю механику Claude публично.
Горизонт — ближайшие релизы моделей. Смотреть стоит не на формулировки о самоулучшении, а на то, появятся ли эти методы в карточках безопасности следующих версий.



