Что произошло
9 октября 2026 года компания Vals AI, которая независимо тестирует ИИ-модели, проверила, окупаются ли «команды» агентов. Агент — это модель, которая сама выполняет многошаговую задачу: пишет код, запускает команды, проверяет результат. В команде ведущий агент (оркестратор) делит работу и раздаёт её субагентам — помощникам со своим отдельным контекстом. Итог: команды обошлись в 1,8–5,1 раза дороже одиночного агента, а статистически значимый прирост качества дала лишь одна конфигурация из четырёх.
Детали
Тест — бенчмарк Vibe Code Bench: агент по описанию собирает веб-приложение целиком, а браузерные агенты прокликивают его сценарии. Балл — доля пройденных тестов интерфейса, усреднённая по 50 приложениям. Сравнивали GPT-6 Sol и Claude Opus 5.5 (вторую запускали через Claude Code) на среднем и максимальном уровне рассуждений — то есть с разным временем «на подумать». Ведущий агент мог держать до пяти субагентов одновременно.
| Конфигурация | Один агент | Команда | Цена одного приложения, в ценах API на октябрь 2026 |
|---|---|---|---|
| GPT-6 Sol, средний | 77,6% | 84,9% | $1,22 → $3,07 (2,5×) |
| GPT-6 Sol, максимум | 89,0% | 90,4% | $4,82 → $8,54 (1,8×) |
| Claude Opus 5.5, средний | 91,5% | 91,2% | $4,08 → $9,10 (2,2×) |
| Claude Opus 5.5, максимум | 89,8% | 93,2% | $23,77 → $122 (5,1×) |
Значимым, то есть не объяснимым случайным разбросом между приложениями, оказался только плюс 7,3 пункта у Sol на среднем уровне. Причём тот же Sol в одиночку на максимальном уровне прибавил 11,4 пункта — больше, чем дала команда. Основная часть лишних трат — повторно отправляемый контекст: каждый субагент заново шлёт модели свою историю при каждом обращении.
Данные Anthropic из системной карты Claude Opus 5.5 (22 сентября 2026 года) похожи. Команды от 1 до 100 агентов работали по 24 часа: на задаче базы знаний балл вырос с 0,53 у одного агента до 0,70 у десяти — и лишь до 0,74 у ста. На доказательстве теорем в Lean — 0,39, 0,66 и 0,68. Большие команды в основном быстрее приходят к тому же результату. На бенчмарке ProgramBench пять агентов достигали того же балла в 2,7 раза быстрее одного, и Anthropic прямо пишет, что скорость покупается бо́льшим расходом токенов.
Что это значит
Касается тех, кто строит агентные системы и платит за API по токенам (токен — кусочек текста, за который берёт деньги модель), а также пользователей Claude Code и Codex, которые запускают субагентов. Цена ошибки видна в таблице: на самой дорогой конфигурации приложение подорожало с $23,77 до $122, а прирост в 3,4 пункта статистически не подтвердился.
Практический вывод: команда оправдана, когда задача делится на независимые части или важна скорость — большая кодовая база, ресёрч по многим источникам. Для обычной задачи сначала стоит поднять уровень рассуждений одного агента. Как выбрать схему, разобрано в материале про мультиагентные архитектуры, а как делегировать без перерасхода — в гайде по субагентам Claude Code. Пересмотреть настройки текущих проектов можно уже сейчас.
Оговорка авторов: это один бенчмарк, каждая конфигурация прогнана один раз, а у моделей разные обвязки — на других задачах картина может отличаться.
