OpenAI запустила Ultrafast: GPT-5.6 Sol швидша в 14 разів на чипах Cerebras

3 хв. читання
BINANCE COPY TRADING
Копіюй профі
Binance повторить угоди трейдера за тебе
Почати

Що сталося

13 серпня 2026 року OpenAI відкрила прев’ю Ultrafast — режиму обслуговування, у якому GPT-5.6 Sol працює до 14 разів швидше за звичайний і видає до 750 токенів на секунду. Режим запускається спершу в API, доступ поки що отримала обмежена група клієнтів, і розширюватиметься він у міру зростання потужностей. Обчислює при цьому не звичний GPU-кластер: за швидкістю стоїть партнерство з виробником чипів Cerebras.

Деталі

Ключова заява OpenAI: Ultrafast — це той самий рівень інтелекту, що й у стандартного GPT-5.6 Sol, відрізняється тільки швидкість видачі. Жодної урізаної чи дистильованої версії моделі.

Швидкість пояснюється архітектурою Cerebras Wafer-Scale Engine: чип завбільшки з цілу кремнієву пластину несе 44 ГБ SRAM просто на кристалі, і ваги моделі лежать у цій пам’яті. Звичайний прискорювач змушений постійно тягнути ваги із зовнішньої пам’яті, і саме пропускна здатність пам’яті, а не арифметика, обмежує швидкість генерації. Тут це вузьке місце усунуто.

Цільові сценарії, які називає OpenAI, — корпоративні та чутливі до затримки: реагування на інциденти, підтримка клієнтів, аналіз фінансових ринків і процеси в електронній комерції. Формулювання компанії — «більше корисної роботи за секунду».

Ціни на новий режим не оголошено. В Anthropic є свій швидкий режим для Claude, але за швидкістю видачі він із цією цифрою не порівнюється.

Що це означає

Кого стосується: тих, хто будує на API не чат, а робочі процеси — агентів, які роблять ланцюжок із десятків викликів поспіль, та інтерфейси, де людина чекає на відповідь наживо.

Що змінюється, у цифрах: порахуймо на зрозумілому прикладі. Відповідь довжиною 2 000 токенів за типових для флагманів ~54 токенів на секунду забирає близько 37 секунд. На 750 токенах на секунду та сама відповідь видається приблизно за 2,7 секунди. Для чату різниця приємна, але не критична. Для агента, який робить 20 кроків поспіль, це різниця між «дванадцять хвилин» і «близько хвилини» — тобто між фоновим завданням та інтерактивним інструментом. Швидкість тут перестає бути зручністю і стає окремим важелем вибору моделі, нарівні з якістю та ціною.

Головний невідомий параметр — гроші. Тарифи не названо, а пластини Cerebras — річ дорога. Доки ціну не оголосять, порівнювати Ultrafast зі звичайним режимом за вартістю завдання не можна, і будь-які розрахунки окупності передчасні.

Горизонт: зараз це обмежене прев’ю для відібраних клієнтів в API. Коли режим відкриють ширше, OpenAI не уточнила — прив’язка йде до введення нових потужностей. Чим різняться самі рівні моделі, ми розбирали в огляді GPT-5.6 Sol, Terra і Luna.

BINANCE COPY TRADING
Копіюй профі
Binance повторить угоди трейдера за тебе
Почати
Поділитися
Зв'язатися:
Крипто- та data-аналітик, інженер-програміст (факультет комп'ютерних наук ХНУРЕ). В IT з 2008 року: адміністрував корпоративний моніторинг у «Vodafone Україна», сім років розробляв і просував веб-проєкти, п'ять років керував маркетингом на метриках — конверсія, CTR, ROI, LTV.Криптовалютними ринками займаюся з 2021 року: ончейн-метрики, токеноміка, макроекономічні індикатори. Розробив власну data-driven модель аналізу ринку на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математична статистика та EDA; збір і звірку даних автоматизую AI-агентами.Принцип — «Don't trust, verify»: кожна цифра перевірена за першоджерелом, ключові — щонайменше за двома незалежними; прогнози — лише сценарії з умовами. Теза без даних не публікується.