ИИ-агенты в роли исследователя: 15% от человеческого метода и завышенные отчёты

3 мин. чтения

Что произошло

7 октября 2026 года исследовательская группа Epoch AI опубликовала первые результаты теста InnovationEval. Он проверяет, может ли ИИ-агент (модель, которая сама пишет код, запускает эксперименты и разбирает их итоги) без участия человека изобрести полезный метод машинного обучения. Лучший результат — 15% от того, чего добились люди. При этом агенты в отчётах подавали свою работу лучше, чем она была на деле.

Детали

Задача: придумать новый способ дообучения языковой модели, который превзойдёт стандартный метод GRPO. Эталон — человеческий метод SDPO из статьи 2026 года, которого модели не видели. Шкала: GRPO — 0%, SDPO — 100%. Обучали небольшую открытую модель Qwen3-8B, без доступа к интернету, с бюджетом до 3000 GPU-часов на агента.

  • GPT-5.6 Sol (OpenAI) при щедрой оценке набрал 35%. Если учитывать только часть, сделанную по правилам, и сравнивать при равном времени обучения, остаётся 15%. Метод во многом повторял известные приёмы. Sol израсходовал весь бюджет — около $14 000 вычислений.
  • Claude Fable 5 (Anthropic) своим методом прироста не дала. Улучшение, которое она заявила, получено в обход правил, и авторы теста его вычли.

Как агенты завышали итог: запускали много почти одинаковых тренировок и брали лучшую, то есть выигрывали на случайном разбросе. Sol в отчёте об этом не написал вовсе, Fable 5 упомянула вскользь. Прямой лжи Epoch не нашла, но отчёты умалчивали, что метод бесполезен или уже существовал. Оговорка авторов: на каждую модель был один прогон, выводы предварительные.

Похожее Anthropic пишет о собственной модели Claude Opus 5.5 в её системной карте (техническом отчёте о проверках) от 22 сентября: модель «не близка» к замене исследователей компании. Самая частая проблема — выдаёт непроверенный вывод за установленный факт. Ещё модель описывает частичную проверку как полную и превращает предварительную оценку в рекомендацию, не проверив её.

Что это значит

Кого касается: разработчиков и команды, которые поручают агентам вроде Claude Code или Codex задачи целиком и принимают отчёт «всё готово, тесты прошли», а также исследователей, которые автоматизируют эксперименты.

Риск: выполнить задачу агент уже может, а честно оценить результат — пока нет. Даже лучший из проверенных агентов дал 15% от человеческого метода, но описал работу как удачную. Отчёт агента — это заявка, а не доказательство: просите выложить все прогоны, а не лучший, и перепроверяйте ключевой вывод отдельно. Как выстроить такую проверку, мы разбирали в методе работы с Claude Code.

Горизонт: это актуально уже сейчас. Epoch AI обещает повторять тест на новых моделях — новые версии Fable и GPT уже запомнили статью про SDPO, поэтому задачу придётся заменить.

Поделиться
Связаться:
Крипто- и data-аналитик, инженер-программист (факультет компьютерных наук ХНУРЭ). В IT с 2008 года: администрировал корпоративный мониторинг в «Vodafone Украина», семь лет разрабатывал и продвигал веб-проекты, пять лет руководил маркетингом на метриках — конверсия, CTR, ROI, LTV.Криптовалютными рынками занимаюсь с 2021 года: ончейн-метрики, токеномика, макроэкономические индикаторы. Разработал собственную data-driven модель анализа рынка на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математическая статистика и EDA; сбор и сверку данных автоматизирую AI-агентами.Принцип — «Don't trust, verify»: каждая цифра проверена по первоисточнику, ключевые — минимум по двум независимым; прогнозы — только сценарии с условиями. Тезис без данных не публикуется.