Команды ИИ-агентов: в 1,8–5,1 раза дороже одного агента, прирост — в 1 случае из 4

4 мин. чтения

Что произошло

9 октября 2026 года компания Vals AI, которая независимо тестирует ИИ-модели, проверила, окупаются ли «команды» агентов. Агент — это модель, которая сама выполняет многошаговую задачу: пишет код, запускает команды, проверяет результат. В команде ведущий агент (оркестратор) делит работу и раздаёт её субагентам — помощникам со своим отдельным контекстом. Итог: команды обошлись в 1,8–5,1 раза дороже одиночного агента, а статистически значимый прирост качества дала лишь одна конфигурация из четырёх.

Детали

Тест — бенчмарк Vibe Code Bench: агент по описанию собирает веб-приложение целиком, а браузерные агенты прокликивают его сценарии. Балл — доля пройденных тестов интерфейса, усреднённая по 50 приложениям. Сравнивали GPT-6 Sol и Claude Opus 5.5 (вторую запускали через Claude Code) на среднем и максимальном уровне рассуждений — то есть с разным временем «на подумать». Ведущий агент мог держать до пяти субагентов одновременно.

КонфигурацияОдин агентКомандаЦена одного приложения, в ценах API на октябрь 2026
GPT-6 Sol, средний77,6%84,9%$1,22 → $3,07 (2,5×)
GPT-6 Sol, максимум89,0%90,4%$4,82 → $8,54 (1,8×)
Claude Opus 5.5, средний91,5%91,2%$4,08 → $9,10 (2,2×)
Claude Opus 5.5, максимум89,8%93,2%$23,77 → $122 (5,1×)

Значимым, то есть не объяснимым случайным разбросом между приложениями, оказался только плюс 7,3 пункта у Sol на среднем уровне. Причём тот же Sol в одиночку на максимальном уровне прибавил 11,4 пункта — больше, чем дала команда. Основная часть лишних трат — повторно отправляемый контекст: каждый субагент заново шлёт модели свою историю при каждом обращении.

Данные Anthropic из системной карты Claude Opus 5.5 (22 сентября 2026 года) похожи. Команды от 1 до 100 агентов работали по 24 часа: на задаче базы знаний балл вырос с 0,53 у одного агента до 0,70 у десяти — и лишь до 0,74 у ста. На доказательстве теорем в Lean — 0,39, 0,66 и 0,68. Большие команды в основном быстрее приходят к тому же результату. На бенчмарке ProgramBench пять агентов достигали того же балла в 2,7 раза быстрее одного, и Anthropic прямо пишет, что скорость покупается бо́льшим расходом токенов.

Что это значит

Касается тех, кто строит агентные системы и платит за API по токенам (токен — кусочек текста, за который берёт деньги модель), а также пользователей Claude Code и Codex, которые запускают субагентов. Цена ошибки видна в таблице: на самой дорогой конфигурации приложение подорожало с $23,77 до $122, а прирост в 3,4 пункта статистически не подтвердился.

Практический вывод: команда оправдана, когда задача делится на независимые части или важна скорость — большая кодовая база, ресёрч по многим источникам. Для обычной задачи сначала стоит поднять уровень рассуждений одного агента. Как выбрать схему, разобрано в материале про мультиагентные архитектуры, а как делегировать без перерасхода — в гайде по субагентам Claude Code. Пересмотреть настройки текущих проектов можно уже сейчас.

Оговорка авторов: это один бенчмарк, каждая конфигурация прогнана один раз, а у моделей разные обвязки — на других задачах картина может отличаться.

Поделиться
Связаться:
Крипто- и data-аналитик, инженер-программист (факультет компьютерных наук ХНУРЭ). В IT с 2008 года: администрировал корпоративный мониторинг в «Vodafone Украина», семь лет разрабатывал и продвигал веб-проекты, пять лет руководил маркетингом на метриках — конверсия, CTR, ROI, LTV.Криптовалютными рынками занимаюсь с 2021 года: ончейн-метрики, токеномика, макроэкономические индикаторы. Разработал собственную data-driven модель анализа рынка на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математическая статистика и EDA; сбор и сверку данных автоматизирую AI-агентами.Принцип — «Don't trust, verify»: каждая цифра проверена по первоисточнику, ключевые — минимум по двум независимым; прогнозы — только сценарии с условиями. Тезис без данных не публикуется.