Команди ШІ-агентів: у 1,8–5,1 раза дорожчі за одного агента, приріст — лише в 1 з 4

4 хв. читання

Що сталося

9 жовтня 2026 року компанія Vals AI, яка незалежно тестує моделі ШІ, перевірила, чи окупаються «команди» агентів. Агент — це модель, яка сама виконує багатокрокове завдання: пише код, запускає команди, перевіряє результат. У команді провідний агент (оркестратор) ділить роботу й роздає її субагентам — помічникам з власним окремим контекстом. Підсумок: команди коштували в 1,8–5,1 раза більше, ніж один агент, а статистично значущий приріст якості дала лише одна конфігурація з чотирьох.

Деталі

Тест — бенчмарк Vibe Code Bench: агент за описом збирає вебзастосунок повністю, а браузерні агенти проклікують його сценарії. Бал — частка пройдених тестів інтерфейсу, усереднена за 50 застосунками. Порівнювали GPT-6 Sol і Claude Opus 5.5 (другу запускали через Claude Code) на середньому й максимальному рівні міркувань — тобто з різним часом «на подумати». Провідний агент міг тримати до п’яти субагентів одночасно.

КонфігураціяОдин агентКомандаЦіна одного застосунку, за цінами API на жовтень 2026
GPT-6 Sol, середній77,6%84,9%$1,22 → $3,07 (2,5×)
GPT-6 Sol, максимум89,0%90,4%$4,82 → $8,54 (1,8×)
Claude Opus 5.5, середній91,5%91,2%$4,08 → $9,10 (2,2×)
Claude Opus 5.5, максимум89,8%93,2%$23,77 → $122 (5,1×)

Значущим, тобто таким, що не пояснюється випадковим розкидом між застосунками, виявився лише плюс 7,3 пункту в Sol на середньому рівні. Причому той самий Sol сам-один на максимальному рівні додав 11,4 пункту — більше, ніж дала команда. Основна частина зайвих витрат — повторно надісланий контекст: кожен субагент знову передає моделі свою історію під час кожного звернення.

Дані Anthropic із системної картки Claude Opus 5.5 (22 вересня 2026 року) схожі. Команди від 1 до 100 агентів працювали по 24 години: на завданні бази знань бал зріс з 0,53 в одного агента до 0,70 у десяти — і лише до 0,74 у сотні. На доведенні теорем у Lean — 0,39, 0,66 і 0,68. Великі команди здебільшого швидше доходять до того самого результату. На бенчмарку ProgramBench п’ять агентів досягали того самого балу у 2,7 раза швидше за одного, і Anthropic прямо пише, що швидкість купується більшою витратою токенів.

Що це означає

Стосується тих, хто будує агентні системи й платить за API за токени (токен — шматочок тексту, за який бере гроші модель), а також користувачів Claude Code і Codex, які запускають субагентів. Ціну помилки видно в таблиці: на найдорожчій конфігурації застосунок подорожчав з $23,77 до $122, а приріст у 3,4 пункту статистично не підтвердився.

Практичний висновок: команда виправдана, коли завдання ділиться на незалежні частини або важлива швидкість — велика кодова база, ресерч за багатьма джерелами. Для звичайного завдання спершу варто підняти рівень міркувань одного агента. Як обрати схему, розібрано в матеріалі про мультиагентні архітектури, а як делегувати без перевитрат — у гайді про субагентів Claude Code. Переглянути налаштування поточних проєктів можна вже зараз.

Застереження авторів: це один бенчмарк, кожну конфігурацію прогнали один раз, а в моделей різна обв’язка — на інших завданнях картина може відрізнятися.

Поділитися
Зв'язатися:
Крипто- та data-аналітик, інженер-програміст (факультет комп'ютерних наук ХНУРЕ). В IT з 2008 року: адміністрував корпоративний моніторинг у «Vodafone Україна», сім років розробляв і просував веб-проєкти, п'ять років керував маркетингом на метриках — конверсія, CTR, ROI, LTV.Криптовалютними ринками займаюся з 2021 року: ончейн-метрики, токеноміка, макроекономічні індикатори. Розробив власну data-driven модель аналізу ринку на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математична статистика та EDA; збір і звірку даних автоматизую AI-агентами.Принцип — «Don't trust, verify»: кожна цифра перевірена за першоджерелом, ключові — щонайменше за двома незалежними; прогнози — лише сценарії з умовами. Теза без даних не публікується.