Що сталося
9 жовтня 2026 року компанія Vals AI, яка незалежно тестує моделі ШІ, перевірила, чи окупаються «команди» агентів. Агент — це модель, яка сама виконує багатокрокове завдання: пише код, запускає команди, перевіряє результат. У команді провідний агент (оркестратор) ділить роботу й роздає її субагентам — помічникам з власним окремим контекстом. Підсумок: команди коштували в 1,8–5,1 раза більше, ніж один агент, а статистично значущий приріст якості дала лише одна конфігурація з чотирьох.
Деталі
Тест — бенчмарк Vibe Code Bench: агент за описом збирає вебзастосунок повністю, а браузерні агенти проклікують його сценарії. Бал — частка пройдених тестів інтерфейсу, усереднена за 50 застосунками. Порівнювали GPT-6 Sol і Claude Opus 5.5 (другу запускали через Claude Code) на середньому й максимальному рівні міркувань — тобто з різним часом «на подумати». Провідний агент міг тримати до п’яти субагентів одночасно.
| Конфігурація | Один агент | Команда | Ціна одного застосунку, за цінами API на жовтень 2026 |
|---|---|---|---|
| GPT-6 Sol, середній | 77,6% | 84,9% | $1,22 → $3,07 (2,5×) |
| GPT-6 Sol, максимум | 89,0% | 90,4% | $4,82 → $8,54 (1,8×) |
| Claude Opus 5.5, середній | 91,5% | 91,2% | $4,08 → $9,10 (2,2×) |
| Claude Opus 5.5, максимум | 89,8% | 93,2% | $23,77 → $122 (5,1×) |
Значущим, тобто таким, що не пояснюється випадковим розкидом між застосунками, виявився лише плюс 7,3 пункту в Sol на середньому рівні. Причому той самий Sol сам-один на максимальному рівні додав 11,4 пункту — більше, ніж дала команда. Основна частина зайвих витрат — повторно надісланий контекст: кожен субагент знову передає моделі свою історію під час кожного звернення.
Дані Anthropic із системної картки Claude Opus 5.5 (22 вересня 2026 року) схожі. Команди від 1 до 100 агентів працювали по 24 години: на завданні бази знань бал зріс з 0,53 в одного агента до 0,70 у десяти — і лише до 0,74 у сотні. На доведенні теорем у Lean — 0,39, 0,66 і 0,68. Великі команди здебільшого швидше доходять до того самого результату. На бенчмарку ProgramBench п’ять агентів досягали того самого балу у 2,7 раза швидше за одного, і Anthropic прямо пише, що швидкість купується більшою витратою токенів.
Що це означає
Стосується тих, хто будує агентні системи й платить за API за токени (токен — шматочок тексту, за який бере гроші модель), а також користувачів Claude Code і Codex, які запускають субагентів. Ціну помилки видно в таблиці: на найдорожчій конфігурації застосунок подорожчав з $23,77 до $122, а приріст у 3,4 пункту статистично не підтвердився.
Практичний висновок: команда виправдана, коли завдання ділиться на незалежні частини або важлива швидкість — велика кодова база, ресерч за багатьма джерелами. Для звичайного завдання спершу варто підняти рівень міркувань одного агента. Як обрати схему, розібрано в матеріалі про мультиагентні архітектури, а як делегувати без перевитрат — у гайді про субагентів Claude Code. Переглянути налаштування поточних проєктів можна вже зараз.
Застереження авторів: це один бенчмарк, кожну конфігурацію прогнали один раз, а в моделей різна обв’язка — на інших завданнях картина може відрізнятися.
