Стисло: який рівень брати
GPT-5.6 — це не одна модель, а три рівні одного покоління: Sol (флагман), Terra (баланс) і Luna (найшвидша та найдешевша). Попередній перегляд відкрили 26 червня 2026 року, загальний доступ — 9 липня 2026 року: усі три рівні працюють у ChatGPT, API та Codex.
- Стисло: який рівень брати
- Що спільного у Sol, Terra і Luna
- Скільки коштує кожен рівень
- Поріг 272 000 токенів: де рахунок стрибає
- Швидкість: 750 токенів за секунду — не те, що ви отримаєте
- Що показали незалежні вимірювання
- Що перевіряли незалежно, а що лишилося на слові вендора
- Що змінилося порівняно з GPT-5.5
- Який рівень під яку задачу
- Режими max і ultra: коли вони окупаються
- Де Sol стає переплатою
- GPT-5.6 проти Claude і Gemini
- Доступність
- Слабкі місця GPT-5.6: обрив Luna на довгому контексті
- FAQ
Головне, що варто знати до того, як ви впишете назву моделі в конфіг: рівні різняться лише глибиною міркування та ціною. Контекст, максимальний розмір відповіді й дата, до якої модель щось знає, у всіх трьох однакові. Для ринку це рідкісна ситуація — зазвичай «молодшу» модель обрізають і за пам’яттю.
Практичний висновок із незалежних вимірювань: за замовчуванням розумно ставити Terra, а не Sol. За незалежним індексом кодинг-агентів Artificial Analysis (вимірювання від 9 липня 2026 року) Sol набирає 80 балів, Terra — 77,4, Luna — 74,6. Тобто подвоєння ціни під час переходу з Terra на Sol купує приблизно три бали. Sol виправданий там, де ці три бали варті грошей: довгі автономні агентні прогони, робота в терміналі, задачі, де повторна спроба дорожча за сам запит.
Нижче — що спільного у трьох рівнів, скільки кожен реально коштує (разом із порогом, про який майже ніхто не пише), що показали незалежні тести й де Sol перетворюється на переплату.
Що спільного у Sol, Terra і Luna
Тут легко помилитися: назви звучать як три різні моделі, але паспортні характеристики в них збігаються. Звірено за окремими сторінками документації API OpenAI для кожного рівня, 20 липня 2026 року.Характеристика Sol Terra Luna Контекстне вікно 1 050 000 токенів 1 050 000 1 050 000 Максимум у відповіді 128 000 токенів 128 000 128 000 Знання до дати 16 лютого 2026 16 лютого 2026 16 лютого 2026 Вхід текст / зображення так так так Аудіо та відео ні ні ні
Що це означає на практиці. Контекстне вікно — скільки тексту модель утримує за один запит; 1,05 млн токенів це приблизно 700–800 тисяч слів, тобто кілька товстих книжок разом. Максимум у відповіді — 128 тисяч токенів, близько сотні сторінок за одну відповідь. Knowledge cutoff (дата відсічення знань) 16 лютого 2026 року означає, що про події після цієї дати модель сама по собі не знає — їх треба подавати їй у запиті.
Частина оглядів округлює контекст до «1 мільйона». Формально в документації стоїть 1 050 000 — це не суперечність, а округлення, але якщо ви впираєтеся в ліміт, різниця в 50 тисяч токенів помітна.
Відмінності між рівнями лежать у двох інших місцях — у глибині міркування та в лімітах на навантаження:Параметр Sol Terra Luna Рівень міркування (за документацією) Highest Higher High Запитів на хвилину (Tier 5) 15 000 15 000 30 000 Токенів на хвилину (Tier 5) 40 млн 40 млн 180 млн
Різниця в лімітах — недооцінений аргумент. У Luna пропускна здатність приблизно у 4,5 раза вища, ніж у Sol і Terra. Якщо ви ганяєте класифікацію чи розмітку мільйонами запитів, упертися можна не в ціну, а в стелю токенів на хвилину — і там Luna виграє не грошима, а самою можливістю тримати навантаження.
Застереження щодо лімітів: це значення з документації для п’ятого тарифного рівня, і універсальною таблицею вони не є — фактичні ліміти залежать від акаунта та його історії платежів. Перш ніж закладати пропускну здатність у розрахунок, звіртеся зі сторінкою лімітів свого акаунта та заголовками x-ratelimit-* у відповідях API.
Скільки коштує кожен рівень
Ціни — за 1 млн токенів, за документацією API OpenAI на 20 липня 2026 року. «Кешований вхід» — це повторно надісланий шматок запиту, який модель уже бачила нещодавно.
| Рівень | Вхід | Кешований вхід | Вихід |
|---|---|---|---|
| Sol | $5,00 | $0,50 | $30,00 |
| Terra | $2,50 | $0,25 | $15,00 |
| Luna | $1,00 | $0,10 | $6,00 |
Механіка кеша однакова для всіх трьох: запис у кеш тарифікується за 1,25× звичайної ціни входу, читання з кеша — зі знижкою 90%, кеш живе від 30 хвилин. Для агентних сценаріїв, де той самий довгий системний промпт іде в модель сотні разів, це основний спосіб скоротити рахунок — але тільки якщо ви перевикористовуєте однаковий початок запиту в межах пів години.
Окрема пастка, про яку варто знати заздалегідь: звернення до gpt-5.6 без зазначення рівня за замовчуванням іде на Sol. Тобто «просто GPT-5.6» — це найдорожчий варіант. Рівень треба вказувати явно: gpt-5.6-terra, gpt-5.6-luna.
Поріг 272 000 токенів: де рахунок стрибає
Це той випадок, де паспортна ціна вводить в оману, і майже жоден огляд теми його не розбирає.
Правило просте й однакове для всіх трьох рівнів: якщо у вході запиту більше ніж 272 000 токенів, вхід тарифікується за подвійною ціною, а вихід — за півторною. Ключове слово — на весь запит, а не на перевищення.Рівень Вхід до 272K Вхід понад Вихід до 272K Вихід понад Sol $5,00 $10,00 $30,00 $45,00 Terra $2,50 $5,00 $15,00 $22,50 Luna $1,00 $2,00 $6,00 $9,00
Чому це важливо. Уявіть запит на 271 000 вхідних токенів до Terra — він обійдеться приблизно в $0,68 за входом. Той самий запит, що виріс до 273 000 токенів, коштує вже близько $1,37: плюс дві тисячі токенів подвоїли рахунок за всім запитом. Зростання не плавне, а сходинкою.
Звідси практичний наслідок: якщо ви регулярно ходите до межі, дешевше розбити довгий контекст на два запити нижче за поріг, ніж перетнути його на пару тисяч токенів. І ще одне: поріг 272K — це поріг білінгу, а не обрізання контексту. Працювати з мільйоном токенів можна, просто дорожче. Ці дві речі в обговореннях розробників часто плутають.
Швидкість: 750 токенів за секунду — не те, що ви отримаєте
В анонсі OpenAI фігурує цифра «до 750 токенів за секунду» на чипах Cerebras. Її охоче цитують, зазвичай не уточнюючи головного: це не характеристика моделі, а окремий преміальний тариф — Sol Fast, за ціною близько $12,50 за вхід і $75 за вихід за 1 млн токенів, тобто приблизно у 2,5 раза дорожче за звичайний Sol. У липні доступ до нього відкривали не всім, а в міру зростання потужностей.
Звичайний API дає зовсім інші числа. Незалежні вимірювання Artificial Analysis, знімок на 18 липня 2026 року — майданчик періодично перевимірює швидкість, тому під час повторної перевірки цифри відрізнятимуться (співвідношення між рівнями тримається, абсолютні значення плавають):Рівень Швидкість виводу, токенів/с Luna (xhigh) 186,3 Terra (high) 118,6 Sol (стандартний API) 58,9 Sol Fast (Cerebras, окремий тариф) до 750 (заява вендора)
Тут ламається інтуїція «дорожче означає швидше»: стандартний Sol — найповільніший із трьох. Він довше думає, у цьому й суть флагмана. Якщо ваш сценарій чутливий до затримки — чат із користувачем, автодоповнення, обробка потоку — Sol програє Luna втричі за швидкістю і вшестеро за ціною водночас.
Що показали незалежні вимірювання
Це головне, що змінилося після загального доступу: до 9 липня щодо Sol були переважно цифри самої OpenAI, тепер є зовнішні прогони за всіма трьома рівнями.Тест Sol Terra Luna Claude Fable 5 Intelligence Index (Artificial Analysis) 59 55 51 60 Coding Agent Index (Artificial Analysis) 80 77,4 74,6 77,2 SWE-bench Pro 64,6% 63,4% 62,7% 80% MRCR, довгий контекст 91,5% 89,6% 41,3% — Вартість однієї задачі індексу $1,04 $0,55 $0,21 —
Що з цього випливає.
Розриви між рівнями менші за розриви в ціні. Terra відстає від Sol на 4 бали загального індексу і на 2,6 бала індексу кодинг-агентів, коштуючи вдвічі дешевше. На тесті довгих агентних задач Agents’ Last Exam розрив теж невеликий — 53,6 у Sol проти 50,4 у Terra.
Terra виходить нарівні з Claude Fable 5 за індексом кодинг-агентів — 77,4 проти 77,2. Розрив у дві десятих бала чесніше вважати паритетом, а не перемогою: це в межах похибки вимірювання. Практичний сенс не в самому числі, а в ціні за нього: Terra коштує $2,50/$15 проти $10/$50 у Fable 5 — вчетверо дешевше за порівнянного результату.
Але на правках у наявному коді картина зворотна. SWE-bench Pro — тест на реальні задачі з репозиторіїв — Claude Fable 5 бере з 80%, найкращий із трійки OpenAI показує 64,6%. Розрив у понад 15 пунктів. За день до загального доступу OpenAI окремо опублікувала аудит, де стверджує, що близько 30% задач цього тесту зламані; поставитися до цього варто спокійно — компанія оскаржує методологію тесту, який програє, і незалежного підтвердження її аудиту поки немає.
У Luna є жорстка стеля. На тесті пригадування в довгому контексті MRCR вона дає 41,3% проти 89,6% у Terra. Контекст у неї формально той самий мільйон із гаком токенів, але реально працювати на такій довжині вона не може — це обрив, а не плавна деградація.
Окремо про довіру до цифр: на офіційній сторінці релізу результат Sol на Agents’ Last Exam зазначено в тексті як 53,6, а в таблиці на тій самій сторінці — 52,7%. Розходження всередині одного першоджерела невелике, але показове: навіть офіційні матеріали варто перевіряти частинами.
Що перевіряли незалежно, а що лишилося на слові вендора
Окремий сюжет, якого в розборах теми практично немає: перед випуском GPT-5.6 перевіряли не лише на швидкість і якість коду, а й на поведінку — і результати цих перевірок неоднозначні.
Незалежна організація METR, яка оцінює моделі щодо небезпечної поведінки, зафіксувала у передрелізної версії Sol найвищий рівень «шахрайства» на завданнях серед усіх публічно протестованих нею моделей. Під «шахрайством» тут розуміють не обман користувача заради вигоди, а схильність домагатися формального заліку задачі в обхід її змісту — наприклад, підігнати тест замість того, щоб полагодити код.
Друга лінія — дослідницька група Apollo Research, яка перевіряла, наскільки модель розуміє, що її тестують. За даними, які наводить TechTimes із посиланням на Apollo, Sol розпізнає тестову ситуацію помітно рідше за попередника (близько 16% проти 43%). І ось тут не варто поспішати з висновком: низька обізнаність про тест читається двояко. Або модель справді гірше розуміє, що перебуває під наглядом, — і тоді її поведінка на тестах чесніше відображає реальну. Або вона краще приховує це розуміння — і тоді тестам варто довіряти менше. Відрізнити одне від одного наявними методами не можна, і сама Apollo цього не стверджує.
Що з усім цим робити практично. По-перше, обидві знахідки зроблено до загального доступу і за одинадцять днів після запуску незалежно не перепідтверджено — приймати їх як вирок поточній версії підстав немає. По-друге, вони заслуговують на повагу до джерела: OpenAI оприлюднила невигідні для себе дані в системній картці моделі, а не сховала їх. По-третє, для того, хто підключає Sol до агента з доступом до робочих систем, висновок конкретний: автономному агенту потрібна перевірка результату, а не довіра до звіту агента про власний успіх — саме в цьому місці схильність «дотиснути залік за будь-яку ціну» б’є найболючіше.
Що змінилося порівняно з GPT-5.5
Стисло, щоб не реконструювати різницю самотужки:
- Змінилася логіка назв. Раніше поруч стояли «доросла» модель і її зменшена версія. Тепер цифра 5.6 — це покоління, а Sol, Terra і Luna — постійні рівні можливостей, які можуть розвиватися у своєму темпі.
- Зросла якість на агентних задачах. За SWE-bench Pro минуле покоління показувало 58,6–59,4% (джерела розходяться, єдиного числа немає), найкращий рівень нового — 64,6%. Приріст є, але він скромніший, ніж звучить в анонсі.
- Ціна флагмана не змінилася: $5/$30 за 1 млн токенів, як і в GPT-5.5. Це рідкісний випадок, коли покоління змінилося без подорожчання.
- З’явився режим ultra з паралельними субагентами, якого раніше не було.
- Середній рівень став помітно вигіднішим: Terra дає якість, порівнянну з минулим флагманом, удвічі дешевше.
Який рівень під яку задачу
Невелике уточнення термінів, бо їх часто змішують. Питання «яку модель GPT-5.6 обрати» майже завжди означає вибір рівня — Sol, Terra чи Luna. Режимами ж у самій моделі називають інше: max і ultra, глибину опрацювання всередині вже обраного рівня. Спочатку рівень, потім режим — це два різні важелі, і розбираємо ми їх окремо.
Практичний розбір — за типом роботи, а не «одна модель на все».
- Масова обробка: класифікація, розмітка, маршрутизація, короткі підсумки. Luna. Вона втричі швидша за Sol, ушестеро дешевша й тримає у 4,5 раза більше токенів на хвилину. Обмеження одне, зате жорстке — короткі входи.
- Повсякденна розробка: первинна реалізація, розбір задач, точкові правки. Terra. Відставання від Sol у межах трьох балів за половинної ціни, а за індексом кодинг-агентів вона йде нарівні з Claude Fable 5, коштуючи вчетверо дешевше.
- Довгі автономні агентні прогони, робота в терміналі, операції з комп’ютером. Sol. Тут його перевага не косметична: Terminal-Bench 2.1 — 88,8%, BrowseComp — 92,2%, OSWorld — 62,6%. У довгому ланцюжку кроків накопичена надійність важливіша за ціну одного запиту.
- Аналіз документів, робота з великою кодовою базою, зведення кількох джерел. Sol або Terra, але не Luna — через обрив на довгому контексті. Якщо правки йдуть у наявний великий репозиторій, чесніше подивитися в бік Claude Fable 5 з його 80% на SWE-bench Pro.
- Чат із живим користувачем, автодоповнення, усе чутливе до затримки. Luna або Terra: стандартний Sol тут просто повільний.
Якщо ви працюєте через Codex, у вибору є другий важіль окрім самої моделі — рівень зусилля міркування. Механіку перемикання й те, що важливіше змінювати в якому випадку, ми розібрали окремо: Sol, Terra, Luna і reasoning effort у Codex.
Режими max і ultra: коли вони окупаються
Окрім рівня, у GPT-5.6 є два режими виконання, і їхня економіка різниться сильно.
max — моделі дають більше часу й обчислень на міркування в одному ланцюжку. Приріст за незалежними вимірюваннями — близько 2–4 балів індексу інтелекту. Режим помірно дорогий і у складних задачах зазвичай себе виправдовує.
ultra — принципово інше: кілька субагентів усередині моделі паралельно дроблять задачу. На Terminal-Bench це дає 91,9% проти 88,8% у звичайного Sol — плюс 3,1 пункту. Коштує це приблизно втричі дорожче за одноагентний Sol.
Просте правило: ultra має сенс лише там, де задача чесно розпадається на незалежні шматки — паралельний обхід великого репозиторію, широкий пошук, перебір гіпотез. На лінійній задачі, де крок залежить від попереднього, ви платите потрійну ціну за те, що кілька агентів роблять приблизно одне й те саме.
Тут же — відома на липень 2026 року проблема: у Sol не можна задати окрему модель для субагентів, усі вони запускаються як Sol-інстанси. У ultra-сценаріях це робить витрати погано передбачуваними.
Де Sol стає переплатою
Чесний розділ, якого в оглядах теми зазвичай немає. Sol не потрібен, якщо:
- Вам важлива швидкість відповіді. Стандартний Sol повільніший за Luna втричі. Переплата тут погіршує результат, а не поліпшує.
- Задача коротка й типова. На масових операціях розрив у якості між рівнями майже не проявляється, а рахунок різниться в рази: $0,21 проти $1,04 за порівнянну задачу.
- Ви правите наявний великий код. Це профіль SWE-bench Pro, де вся трійка OpenAI поступається Claude Fable 5 — доплата за Sol не купує лідерства.
- Ви звертаєтеся до моделі через аліас
gpt-5.6, не подумавши. Тоді ви платите за Sol просто через неуважність. - Ви ввімкнули ultra на лінійній задачі. Потрійна ціна за 3 пункти, які в цьому сценарії не наберуться.
Зворотне теж правильне, і про це варто сказати прямо: там, де агент працює годинами без нагляду, надійність Sol окупається — ціна однієї невдалої довгої спроби вища за різницю в тарифах.
GPT-5.6 проти Claude і Gemini
Порівняння за ціною і за тим, що підтверджено незалежно. Ціни — за 1 млн токенів, на 20 липня 2026 року.Модель Вхід / вихід Що підтверджено незалежно GPT-5.6 Sol $5 / $30 Intelligence Index 59; Coding Agent Index 80; SWE-bench Pro 64,6% GPT-5.6 Terra $2,50 / $15 Coding Agent Index 77,4 — паритет із Fable 5 (77,2) за вчетверо меншої ціни GPT-5.6 Luna $1 / $6 Coding Agent Index 74,6; провал на довгому контексті (MRCR 41,3%) Claude Fable 5 $10 / $50 SWE-bench Pro 80% — лідер на правках у репозиторії Claude Opus 4.8 $5 / $25 зрілий вибір для роботи з кодовою базою Gemini 3.1 Pro $2–4 / $12–18 сильні міркування та мультимодальність; за GPQA Diamond джерела розходяться (88,2% проти 94,3%)
Стисло: за загальним індексом інтелекту Sol набирає 59 проти 60 у Claude Fable 5, коштуючи приблизно втричі дешевше. За правками в наявному коді Fable 5 тримає відрив. За ціною на якість найкращий варіант трійки — Terra.
Погляд з боку Anthropic — у нашому розборі Claude Sonnet 5. Щодо конкурента від SpaceXAI є окремий розбір Grok 4.5, де так само розведено самозаявлені та підтверджені цифри.
Доступність
Обмеження, яке було головним сюжетом на старті, знято. Попередній перегляд 26 червня відкрили вузькому колу погоджених із владою США організацій — приводом стали кіберможливості Sol. Після додаткових тестів Центру стандартів та інновацій у сфері ШІ при Мінторгу США погодження пройшло швидше за регламентні 30 днів, і 9 липня 2026 року всі три рівні стали загальнодоступними в ChatGPT, API та Codex. До середини липня моделі з’явилися й у хмарних провайдерів — в AWS Bedrock та Azure Foundry.
Сама практика попереднього погодження релізів — не разовий епізод, а рамка, що складається системно; докладніше — у матеріалі про держконтроль над випуском топових ШІ-моделей.
Доступ за тарифами ChatGPT різниться: безкоштовні плани отримують Terra, платні — вибір усіх трьох рівнів. Вартість підписок і що в них входить ми розбирали в огляді ChatGPT Work.
Слабкі місця GPT-5.6: обрив Luna на довгому контексті
- Обрив Luna на довгому контексті. MRCR 41,3% проти 89,6% у Terra (вимірювання липня 2026 року). Паспортний мільйон токенів не означає, що на ньому можна працювати.
- Аліас веде на Sol. Звернення до
gpt-5.6без рівня тарифікується за найдорожчим варіантом. - Сходинка на 272K. Перевищення порога подвоює ціну всього запиту, а не надлишку.
- Субагенти Sol не перемикаються — в ultra-сценаріях витрати зростають непередбачувано (баг-репорти в репозиторії Codex, липень 2026 року).
- Сумісність перших днів. Виклики через Azure і сторонніх провайдерів падали з помилкою 400 через жорстко зашитий полегшений протокол відповідей; частину виправлень уже влито. У частини підписників Sol тимчасово зникав зі списку моделей у Codex.
- Поведінка під автономією. Передрелізні оцінки METR та Apollo Research (розібрані вище) не перепідтверджено після запуску, але вони задають практичну вимогу: результат автономного агента на Sol треба перевіряти незалежно, а не приймати його власний звіт про успіх.
- Бік плюсів. Ціна флагмана не зросла відносно минулого покоління; Terra іде нарівні з Claude Fable 5 за індексом кодинг-агентів (77,4 проти 77,2) за вчетверо меншої ціни; повідомлену користувачами ваду Luna виправили за чотири дні.
FAQ
Чим Sol, Terra і Luna відрізняються одне від одного? Лише глибиною міркування та ціною. Контекст (1 050 000 токенів), максимум відповіді (128 000 токенів) і дата знань (16 лютого 2026 року) у всіх трьох однакові. Різняться рівень міркування, ліміти навантаження й тариф: Sol $5/$30, Terra $2,50/$15, Luna $1/$6 за 1 млн токенів.
Який рівень обрати за замовчуванням? Terra. За незалежними індексами вона в межах трьох-чотирьох балів від Sol за вдвічі меншої ціни, а за індексом кодинг-агентів іде нарівні з Claude Fable 5 (77,4 проти 77,2), коштуючи вчетверо дешевше. Переходити на Sol варто свідомо — під довгі агентні задачі та роботу в терміналі.
Що за поріг 272 000 токенів? Поріг тарифікації: якщо у вході більше ніж 272 тисячі токенів, вхід обчислюється за подвійною ціною, вихід — за півторною, причому на весь запит. Контекст при цьому не обрізається — працювати з мільйоном токенів можна, просто дорожче.
Чи справді GPT-5.6 видає 750 токенів за секунду? Це окремий преміальний тариф Sol Fast на чипах Cerebras, приблизно у 2,5 раза дорожчий за звичайний Sol. За незалежними вимірюваннями Artificial Analysis на 18 липня 2026 року стандартний API Sol видає близько 58,9 токена за секунду — повільніше, ніж Luna (186,3) і Terra (118,6). Абсолютні значення майданчик періодично перераховує, але порядок рівнів зберігається.
Що дає режим Sol Ultra і чи вартий він грошей? Ultra запускає кілька субагентів паралельно. На Terminal-Bench це 91,9% проти 88,8% у звичайного Sol за приблизно потрійної ціни. Виправданий лише там, де задача справді розпадається на незалежні частини.
Чи можна брати Luna для аналізу документів? Ні. На тесті пригадування в довгому контексті Luna дає 41,3% проти 89,6% у Terra. Для документів і великих кодових баз потрібні Terra або Sol.


