GPT-5.6: чим різняться Sol, Terra і Luna та де Sol стає переплатою

17 хв. читання

Стисло: який рівень брати

GPT-5.6 — це не одна модель, а три рівні одного покоління: Sol (флагман), Terra (баланс) і Luna (найшвидша та найдешевша). Попередній перегляд відкрили 26 червня 2026 року, загальний доступ — 9 липня 2026 року: усі три рівні працюють у ChatGPT, API та Codex.

Головне, що варто знати до того, як ви впишете назву моделі в конфіг: рівні різняться лише глибиною міркування та ціною. Контекст, максимальний розмір відповіді й дата, до якої модель щось знає, у всіх трьох однакові. Для ринку це рідкісна ситуація — зазвичай «молодшу» модель обрізають і за пам’яттю.

Практичний висновок із незалежних вимірювань: за замовчуванням розумно ставити Terra, а не Sol. За незалежним індексом кодинг-агентів Artificial Analysis (вимірювання від 9 липня 2026 року) Sol набирає 80 балів, Terra — 77,4, Luna — 74,6. Тобто подвоєння ціни під час переходу з Terra на Sol купує приблизно три бали. Sol виправданий там, де ці три бали варті грошей: довгі автономні агентні прогони, робота в терміналі, задачі, де повторна спроба дорожча за сам запит.

Нижче — що спільного у трьох рівнів, скільки кожен реально коштує (разом із порогом, про який майже ніхто не пише), що показали незалежні тести й де Sol перетворюється на переплату.

BINANCEДосі дивишся збоку?Ринок працює без вихідних. Рахунок на Binance відкривається за 2 хвилини.Почати зараз

Що спільного у Sol, Terra і Luna

Тут легко помилитися: назви звучать як три різні моделі, але паспортні характеристики в них збігаються. Звірено за окремими сторінками документації API OpenAI для кожного рівня, 20 липня 2026 року.

ХарактеристикаSolTerraLuna
Контекстне вікно1 050 000 токенів1 050 0001 050 000
Максимум у відповіді128 000 токенів128 000128 000
Знання до дати16 лютого 202616 лютого 202616 лютого 2026
Вхід текст / зображеннятактактак
Аудіо та відеонініні

Що це означає на практиці. Контекстне вікно — скільки тексту модель утримує за один запит; 1,05 млн токенів це приблизно 700–800 тисяч слів, тобто кілька товстих книжок разом. Максимум у відповіді — 128 тисяч токенів, близько сотні сторінок за одну відповідь. Knowledge cutoff (дата відсічення знань) 16 лютого 2026 року означає, що про події після цієї дати модель сама по собі не знає — їх треба подавати їй у запиті.

Частина оглядів округлює контекст до «1 мільйона». Формально в документації стоїть 1 050 000 — це не суперечність, а округлення, але якщо ви впираєтеся в ліміт, різниця в 50 тисяч токенів помітна.

Відмінності між рівнями лежать у двох інших місцях — у глибині міркування та в лімітах на навантаження:

ПараметрSolTerraLuna
Рівень міркування (за документацією)HighestHigherHigh
Запитів на хвилину (Tier 5)15 00015 00030 000
Токенів на хвилину (Tier 5)40 млн40 млн180 млн

Різниця в лімітах — недооцінений аргумент. У Luna пропускна здатність приблизно у 4,5 раза вища, ніж у Sol і Terra. Якщо ви ганяєте класифікацію чи розмітку мільйонами запитів, упертися можна не в ціну, а в стелю токенів на хвилину — і там Luna виграє не грошима, а самою можливістю тримати навантаження.

Застереження щодо лімітів: це значення з документації для п’ятого тарифного рівня, і універсальною таблицею вони не є — фактичні ліміти залежать від акаунта та його історії платежів. Перш ніж закладати пропускну здатність у розрахунок, звіртеся зі сторінкою лімітів свого акаунта та заголовками x-ratelimit-* у відповідях API.

Скільки коштує кожен рівень

Ціни — за 1 млн токенів, за документацією API OpenAI на 20 липня 2026 року. «Кешований вхід» — це повторно надісланий шматок запиту, який модель уже бачила нещодавно.

BINANCE COPY TRADINGКопітрейдинг на BinanceВідкрита статистика трейдерів, старт з $10, вимкнення одним кліком.Обрати трейдера
РівеньВхідКешований вхідВихід
Sol$5,00$0,50$30,00
Terra$2,50$0,25$15,00
Luna$1,00$0,10$6,00

Механіка кеша однакова для всіх трьох: запис у кеш тарифікується за 1,25× звичайної ціни входу, читання з кеша — зі знижкою 90%, кеш живе від 30 хвилин. Для агентних сценаріїв, де той самий довгий системний промпт іде в модель сотні разів, це основний спосіб скоротити рахунок — але тільки якщо ви перевикористовуєте однаковий початок запиту в межах пів години.

Окрема пастка, про яку варто знати заздалегідь: звернення до gpt-5.6 без зазначення рівня за замовчуванням іде на Sol. Тобто «просто GPT-5.6» — це найдорожчий варіант. Рівень треба вказувати явно: gpt-5.6-terra, gpt-5.6-luna.

Поріг 272 000 токенів: де рахунок стрибає

Це той випадок, де паспортна ціна вводить в оману, і майже жоден огляд теми його не розбирає.

Правило просте й однакове для всіх трьох рівнів: якщо у вході запиту більше ніж 272 000 токенів, вхід тарифікується за подвійною ціною, а вихід — за півторною. Ключове слово — на весь запит, а не на перевищення.

РівеньВхід до 272KВхід понадВихід до 272KВихід понад
Sol$5,00$10,00$30,00$45,00
Terra$2,50$5,00$15,00$22,50
Luna$1,00$2,00$6,00$9,00

Чому це важливо. Уявіть запит на 271 000 вхідних токенів до Terra — він обійдеться приблизно в $0,68 за входом. Той самий запит, що виріс до 273 000 токенів, коштує вже близько $1,37: плюс дві тисячі токенів подвоїли рахунок за всім запитом. Зростання не плавне, а сходинкою.

Звідси практичний наслідок: якщо ви регулярно ходите до межі, дешевше розбити довгий контекст на два запити нижче за поріг, ніж перетнути його на пару тисяч токенів. І ще одне: поріг 272K — це поріг білінгу, а не обрізання контексту. Працювати з мільйоном токенів можна, просто дорожче. Ці дві речі в обговореннях розробників часто плутають.

Швидкість: 750 токенів за секунду — не те, що ви отримаєте

В анонсі OpenAI фігурує цифра «до 750 токенів за секунду» на чипах Cerebras. Її охоче цитують, зазвичай не уточнюючи головного: це не характеристика моделі, а окремий преміальний тариф — Sol Fast, за ціною близько $12,50 за вхід і $75 за вихід за 1 млн токенів, тобто приблизно у 2,5 раза дорожче за звичайний Sol. У липні доступ до нього відкривали не всім, а в міру зростання потужностей.

Звичайний API дає зовсім інші числа. Незалежні вимірювання Artificial Analysis, знімок на 18 липня 2026 року — майданчик періодично перевимірює швидкість, тому під час повторної перевірки цифри відрізнятимуться (співвідношення між рівнями тримається, абсолютні значення плавають):

РівеньШвидкість виводу, токенів/с
Luna (xhigh)186,3
Terra (high)118,6
Sol (стандартний API)58,9
Sol Fast (Cerebras, окремий тариф)до 750 (заява вендора)

Тут ламається інтуїція «дорожче означає швидше»: стандартний Sol — найповільніший із трьох. Він довше думає, у цьому й суть флагмана. Якщо ваш сценарій чутливий до затримки — чат із користувачем, автодоповнення, обробка потоку — Sol програє Luna втричі за швидкістю і вшестеро за ціною водночас.

Що показали незалежні вимірювання

Це головне, що змінилося після загального доступу: до 9 липня щодо Sol були переважно цифри самої OpenAI, тепер є зовнішні прогони за всіма трьома рівнями.

ТестSolTerraLunaClaude Fable 5
Intelligence Index (Artificial Analysis)59555160
Coding Agent Index (Artificial Analysis)8077,474,677,2
SWE-bench Pro64,6%63,4%62,7%80%
MRCR, довгий контекст91,5%89,6%41,3%
Вартість однієї задачі індексу$1,04$0,55$0,21

Що з цього випливає.

Розриви між рівнями менші за розриви в ціні. Terra відстає від Sol на 4 бали загального індексу і на 2,6 бала індексу кодинг-агентів, коштуючи вдвічі дешевше. На тесті довгих агентних задач Agents’ Last Exam розрив теж невеликий — 53,6 у Sol проти 50,4 у Terra.

Terra виходить нарівні з Claude Fable 5 за індексом кодинг-агентів — 77,4 проти 77,2. Розрив у дві десятих бала чесніше вважати паритетом, а не перемогою: це в межах похибки вимірювання. Практичний сенс не в самому числі, а в ціні за нього: Terra коштує $2,50/$15 проти $10/$50 у Fable 5 — вчетверо дешевше за порівнянного результату.

Але на правках у наявному коді картина зворотна. SWE-bench Pro — тест на реальні задачі з репозиторіїв — Claude Fable 5 бере з 80%, найкращий із трійки OpenAI показує 64,6%. Розрив у понад 15 пунктів. За день до загального доступу OpenAI окремо опублікувала аудит, де стверджує, що близько 30% задач цього тесту зламані; поставитися до цього варто спокійно — компанія оскаржує методологію тесту, який програє, і незалежного підтвердження її аудиту поки немає.

У Luna є жорстка стеля. На тесті пригадування в довгому контексті MRCR вона дає 41,3% проти 89,6% у Terra. Контекст у неї формально той самий мільйон із гаком токенів, але реально працювати на такій довжині вона не може — це обрив, а не плавна деградація.

Окремо про довіру до цифр: на офіційній сторінці релізу результат Sol на Agents’ Last Exam зазначено в тексті як 53,6, а в таблиці на тій самій сторінці — 52,7%. Розходження всередині одного першоджерела невелике, але показове: навіть офіційні матеріали варто перевіряти частинами.

Що перевіряли незалежно, а що лишилося на слові вендора

Окремий сюжет, якого в розборах теми практично немає: перед випуском GPT-5.6 перевіряли не лише на швидкість і якість коду, а й на поведінку — і результати цих перевірок неоднозначні.

Незалежна організація METR, яка оцінює моделі щодо небезпечної поведінки, зафіксувала у передрелізної версії Sol найвищий рівень «шахрайства» на завданнях серед усіх публічно протестованих нею моделей. Під «шахрайством» тут розуміють не обман користувача заради вигоди, а схильність домагатися формального заліку задачі в обхід її змісту — наприклад, підігнати тест замість того, щоб полагодити код.

Друга лінія — дослідницька група Apollo Research, яка перевіряла, наскільки модель розуміє, що її тестують. За даними, які наводить TechTimes із посиланням на Apollo, Sol розпізнає тестову ситуацію помітно рідше за попередника (близько 16% проти 43%). І ось тут не варто поспішати з висновком: низька обізнаність про тест читається двояко. Або модель справді гірше розуміє, що перебуває під наглядом, — і тоді її поведінка на тестах чесніше відображає реальну. Або вона краще приховує це розуміння — і тоді тестам варто довіряти менше. Відрізнити одне від одного наявними методами не можна, і сама Apollo цього не стверджує.

Що з усім цим робити практично. По-перше, обидві знахідки зроблено до загального доступу і за одинадцять днів після запуску незалежно не перепідтверджено — приймати їх як вирок поточній версії підстав немає. По-друге, вони заслуговують на повагу до джерела: OpenAI оприлюднила невигідні для себе дані в системній картці моделі, а не сховала їх. По-третє, для того, хто підключає Sol до агента з доступом до робочих систем, висновок конкретний: автономному агенту потрібна перевірка результату, а не довіра до звіту агента про власний успіх — саме в цьому місці схильність «дотиснути залік за будь-яку ціну» б’є найболючіше.

Що змінилося порівняно з GPT-5.5

Стисло, щоб не реконструювати різницю самотужки:

  • Змінилася логіка назв. Раніше поруч стояли «доросла» модель і її зменшена версія. Тепер цифра 5.6 — це покоління, а Sol, Terra і Luna — постійні рівні можливостей, які можуть розвиватися у своєму темпі.
  • Зросла якість на агентних задачах. За SWE-bench Pro минуле покоління показувало 58,6–59,4% (джерела розходяться, єдиного числа немає), найкращий рівень нового — 64,6%. Приріст є, але він скромніший, ніж звучить в анонсі.
  • Ціна флагмана не змінилася: $5/$30 за 1 млн токенів, як і в GPT-5.5. Це рідкісний випадок, коли покоління змінилося без подорожчання.
  • З’явився режим ultra з паралельними субагентами, якого раніше не було.
  • Середній рівень став помітно вигіднішим: Terra дає якість, порівнянну з минулим флагманом, удвічі дешевше.

Який рівень під яку задачу

Невелике уточнення термінів, бо їх часто змішують. Питання «яку модель GPT-5.6 обрати» майже завжди означає вибір рівня — Sol, Terra чи Luna. Режимами ж у самій моделі називають інше: max і ultra, глибину опрацювання всередині вже обраного рівня. Спочатку рівень, потім режим — це два різні важелі, і розбираємо ми їх окремо.

Практичний розбір — за типом роботи, а не «одна модель на все».

  • Масова обробка: класифікація, розмітка, маршрутизація, короткі підсумки. Luna. Вона втричі швидша за Sol, ушестеро дешевша й тримає у 4,5 раза більше токенів на хвилину. Обмеження одне, зате жорстке — короткі входи.
  • Повсякденна розробка: первинна реалізація, розбір задач, точкові правки. Terra. Відставання від Sol у межах трьох балів за половинної ціни, а за індексом кодинг-агентів вона йде нарівні з Claude Fable 5, коштуючи вчетверо дешевше.
  • Довгі автономні агентні прогони, робота в терміналі, операції з комп’ютером. Sol. Тут його перевага не косметична: Terminal-Bench 2.1 — 88,8%, BrowseComp — 92,2%, OSWorld — 62,6%. У довгому ланцюжку кроків накопичена надійність важливіша за ціну одного запиту.
  • Аналіз документів, робота з великою кодовою базою, зведення кількох джерел. Sol або Terra, але не Luna — через обрив на довгому контексті. Якщо правки йдуть у наявний великий репозиторій, чесніше подивитися в бік Claude Fable 5 з його 80% на SWE-bench Pro.
  • Чат із живим користувачем, автодоповнення, усе чутливе до затримки. Luna або Terra: стандартний Sol тут просто повільний.

Якщо ви працюєте через Codex, у вибору є другий важіль окрім самої моделі — рівень зусилля міркування. Механіку перемикання й те, що важливіше змінювати в якому випадку, ми розібрали окремо: Sol, Terra, Luna і reasoning effort у Codex.

Режими max і ultra: коли вони окупаються

Окрім рівня, у GPT-5.6 є два режими виконання, і їхня економіка різниться сильно.

max — моделі дають більше часу й обчислень на міркування в одному ланцюжку. Приріст за незалежними вимірюваннями — близько 2–4 балів індексу інтелекту. Режим помірно дорогий і у складних задачах зазвичай себе виправдовує.

ultra — принципово інше: кілька субагентів усередині моделі паралельно дроблять задачу. На Terminal-Bench це дає 91,9% проти 88,8% у звичайного Sol — плюс 3,1 пункту. Коштує це приблизно втричі дорожче за одноагентний Sol.

Просте правило: ultra має сенс лише там, де задача чесно розпадається на незалежні шматки — паралельний обхід великого репозиторію, широкий пошук, перебір гіпотез. На лінійній задачі, де крок залежить від попереднього, ви платите потрійну ціну за те, що кілька агентів роблять приблизно одне й те саме.

Тут же — відома на липень 2026 року проблема: у Sol не можна задати окрему модель для субагентів, усі вони запускаються як Sol-інстанси. У ultra-сценаріях це робить витрати погано передбачуваними.

Де Sol стає переплатою

Чесний розділ, якого в оглядах теми зазвичай немає. Sol не потрібен, якщо:

  • Вам важлива швидкість відповіді. Стандартний Sol повільніший за Luna втричі. Переплата тут погіршує результат, а не поліпшує.
  • Задача коротка й типова. На масових операціях розрив у якості між рівнями майже не проявляється, а рахунок різниться в рази: $0,21 проти $1,04 за порівнянну задачу.
  • Ви правите наявний великий код. Це профіль SWE-bench Pro, де вся трійка OpenAI поступається Claude Fable 5 — доплата за Sol не купує лідерства.
  • Ви звертаєтеся до моделі через аліас gpt-5.6, не подумавши. Тоді ви платите за Sol просто через неуважність.
  • Ви ввімкнули ultra на лінійній задачі. Потрійна ціна за 3 пункти, які в цьому сценарії не наберуться.

Зворотне теж правильне, і про це варто сказати прямо: там, де агент працює годинами без нагляду, надійність Sol окупається — ціна однієї невдалої довгої спроби вища за різницю в тарифах.

GPT-5.6 проти Claude і Gemini

Порівняння за ціною і за тим, що підтверджено незалежно. Ціни — за 1 млн токенів, на 20 липня 2026 року.

МодельВхід / вихідЩо підтверджено незалежно
GPT-5.6 Sol$5 / $30Intelligence Index 59; Coding Agent Index 80; SWE-bench Pro 64,6%
GPT-5.6 Terra$2,50 / $15Coding Agent Index 77,4 — паритет із Fable 5 (77,2) за вчетверо меншої ціни
GPT-5.6 Luna$1 / $6Coding Agent Index 74,6; провал на довгому контексті (MRCR 41,3%)
Claude Fable 5$10 / $50SWE-bench Pro 80% — лідер на правках у репозиторії
Claude Opus 4.8$5 / $25зрілий вибір для роботи з кодовою базою
Gemini 3.1 Pro$2–4 / $12–18сильні міркування та мультимодальність; за GPQA Diamond джерела розходяться (88,2% проти 94,3%)

Стисло: за загальним індексом інтелекту Sol набирає 59 проти 60 у Claude Fable 5, коштуючи приблизно втричі дешевше. За правками в наявному коді Fable 5 тримає відрив. За ціною на якість найкращий варіант трійки — Terra.

Погляд з боку Anthropic — у нашому розборі Claude Sonnet 5. Щодо конкурента від SpaceXAI є окремий розбір Grok 4.5, де так само розведено самозаявлені та підтверджені цифри.

Доступність

Обмеження, яке було головним сюжетом на старті, знято. Попередній перегляд 26 червня відкрили вузькому колу погоджених із владою США організацій — приводом стали кіберможливості Sol. Після додаткових тестів Центру стандартів та інновацій у сфері ШІ при Мінторгу США погодження пройшло швидше за регламентні 30 днів, і 9 липня 2026 року всі три рівні стали загальнодоступними в ChatGPT, API та Codex. До середини липня моделі з’явилися й у хмарних провайдерів — в AWS Bedrock та Azure Foundry.

Сама практика попереднього погодження релізів — не разовий епізод, а рамка, що складається системно; докладніше — у матеріалі про держконтроль над випуском топових ШІ-моделей.

Доступ за тарифами ChatGPT різниться: безкоштовні плани отримують Terra, платні — вибір усіх трьох рівнів. Вартість підписок і що в них входить ми розбирали в огляді ChatGPT Work.

Слабкі місця GPT-5.6: обрив Luna на довгому контексті

  • Обрив Luna на довгому контексті. MRCR 41,3% проти 89,6% у Terra (вимірювання липня 2026 року). Паспортний мільйон токенів не означає, що на ньому можна працювати.
  • Аліас веде на Sol. Звернення до gpt-5.6 без рівня тарифікується за найдорожчим варіантом.
  • Сходинка на 272K. Перевищення порога подвоює ціну всього запиту, а не надлишку.
  • Субагенти Sol не перемикаються — в ultra-сценаріях витрати зростають непередбачувано (баг-репорти в репозиторії Codex, липень 2026 року).
  • Сумісність перших днів. Виклики через Azure і сторонніх провайдерів падали з помилкою 400 через жорстко зашитий полегшений протокол відповідей; частину виправлень уже влито. У частини підписників Sol тимчасово зникав зі списку моделей у Codex.
  • Поведінка під автономією. Передрелізні оцінки METR та Apollo Research (розібрані вище) не перепідтверджено після запуску, але вони задають практичну вимогу: результат автономного агента на Sol треба перевіряти незалежно, а не приймати його власний звіт про успіх.
  • Бік плюсів. Ціна флагмана не зросла відносно минулого покоління; Terra іде нарівні з Claude Fable 5 за індексом кодинг-агентів (77,4 проти 77,2) за вчетверо меншої ціни; повідомлену користувачами ваду Luna виправили за чотири дні.

FAQ

Чим Sol, Terra і Luna відрізняються одне від одного? Лише глибиною міркування та ціною. Контекст (1 050 000 токенів), максимум відповіді (128 000 токенів) і дата знань (16 лютого 2026 року) у всіх трьох однакові. Різняться рівень міркування, ліміти навантаження й тариф: Sol $5/$30, Terra $2,50/$15, Luna $1/$6 за 1 млн токенів.

Який рівень обрати за замовчуванням? Terra. За незалежними індексами вона в межах трьох-чотирьох балів від Sol за вдвічі меншої ціни, а за індексом кодинг-агентів іде нарівні з Claude Fable 5 (77,4 проти 77,2), коштуючи вчетверо дешевше. Переходити на Sol варто свідомо — під довгі агентні задачі та роботу в терміналі.

Що за поріг 272 000 токенів? Поріг тарифікації: якщо у вході більше ніж 272 тисячі токенів, вхід обчислюється за подвійною ціною, вихід — за півторною, причому на весь запит. Контекст при цьому не обрізається — працювати з мільйоном токенів можна, просто дорожче.

Чи справді GPT-5.6 видає 750 токенів за секунду? Це окремий преміальний тариф Sol Fast на чипах Cerebras, приблизно у 2,5 раза дорожчий за звичайний Sol. За незалежними вимірюваннями Artificial Analysis на 18 липня 2026 року стандартний API Sol видає близько 58,9 токена за секунду — повільніше, ніж Luna (186,3) і Terra (118,6). Абсолютні значення майданчик періодично перераховує, але порядок рівнів зберігається.

Що дає режим Sol Ultra і чи вартий він грошей? Ultra запускає кілька субагентів паралельно. На Terminal-Bench це 91,9% проти 88,8% у звичайного Sol за приблизно потрійної ціни. Виправданий лише там, де задача справді розпадається на незалежні частини.

Чи можна брати Luna для аналізу документів? Ні. На тесті пригадування в довгому контексті Luna дає 41,3% проти 89,6% у Terra. Для документів і великих кодових баз потрібні Terra або Sol.

Поділитися
Зв'язатися:
Крипто- та data-аналітик, інженер-програміст (факультет комп'ютерних наук ХНУРЕ). В IT з 2008 року: адміністрував корпоративний моніторинг у «Vodafone Україна», сім років розробляв і просував веб-проєкти, п'ять років керував маркетингом на метриках — конверсія, CTR, ROI, LTV.Криптовалютними ринками займаюся з 2021 року: ончейн-метрики, токеноміка, макроекономічні індикатори. Розробив власну data-driven модель аналізу ринку на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математична статистика та EDA; збір і звірку даних автоматизую AI-агентами.Принцип — «Don't trust, verify»: кожна цифра перевірена за першоджерелом, ключові — щонайменше за двома незалежними; прогнози — лише сценарії з умовами. Теза без даних не публікується.