OpenAI запустила Ultrafast: GPT-5.6 Sol быстрее в 14 раз на чипах Cerebras

3 мин. чтения
Bybit
SpaceX за крипту
Дробные доли · 24/7
Открыть рынок →

Что произошло

13 августа 2026 года OpenAI открыла превью Ultrafast — режима обслуживания, в котором GPT-5.6 Sol работает до 14 раз быстрее обычного и выдаёт до 750 токенов в секунду. Режим запускается сначала в API, доступ пока получила ограниченная группа клиентов, и расширяться он будет по мере роста мощностей. Считает при этом не привычный GPU-кластер: за скоростью стоит партнёрство с производителем чипов Cerebras.

Детали

Ключевое заявление OpenAI: Ultrafast — это тот же уровень интеллекта, что и у стандартного GPT-5.6 Sol, отличается только скорость выдачи. Никакой урезанной или дистиллированной версии модели.

Скорость объясняется архитектурой Cerebras Wafer-Scale Engine: чип размером с целую кремниевую пластину несёт 44 ГБ SRAM прямо на кристалле, и веса модели лежат в этой памяти. Обычный ускоритель вынужден постоянно тянуть веса из внешней памяти, и именно пропускная способность памяти, а не арифметика, ограничивает скорость генерации. Здесь это узкое место убрано.

Целевые сценарии, которые называет OpenAI, — корпоративные и чувствительные к задержке: реагирование на инциденты, поддержка клиентов, анализ финансовых рынков и процессы в электронной коммерции. Формулировка компании — «больше полезной работы в секунду».

Цены на новый режим не объявлены. У Anthropic есть свой быстрый режим для Claude, но по скорости выдачи он с этой цифрой не сравнивается.

Что это значит

Кого касается: тех, кто строит на API не чат, а рабочие процессы — агентов, которые делают цепочку из десятков вызовов подряд, и интерфейсы, где человек ждёт ответ вживую.

Что меняется, в цифрах: посчитаем на понятном примере. Ответ длиной 2 000 токенов при типичных для флагманов ~54 токенах в секунду занимает около 37 секунд. На 750 токенах в секунду тот же ответ выдаётся примерно за 2,7 секунды. Для чата разница приятная, но не критичная. Для агента, который делает 20 шагов подряд, это разница между «двенадцать минут» и «около минуты» — то есть между фоновой задачей и интерактивным инструментом. Скорость здесь перестаёт быть удобством и становится отдельным рычагом выбора модели, наравне с качеством и ценой.

Главный неизвестный параметр — деньги. Тарифы не названы, а пластины Cerebras — штука дорогая. Пока цену не объявили, сравнивать Ultrafast с обычным режимом по стоимости задачи нельзя, и любые расчёты окупаемости преждевременны.

Горизонт: сейчас это ограниченное превью для отобранных клиентов в API. Когда режим откроют шире, OpenAI не уточнила — привязка идёт к вводу новых мощностей. Чем различаются сами уровни модели, мы разбирали в обзоре GPT-5.6 Sol, Terra и Luna.

BYBIT EARN
Крипта лежит?
Bybit Earn: процент капает каждый день
Открыть Earn
Поделиться
Связаться:
Крипто- и data-аналитик, инженер-программист (факультет компьютерных наук ХНУРЭ). В IT с 2008 года: администрировал корпоративный мониторинг в «Vodafone Украина», семь лет разрабатывал и продвигал веб-проекты, пять лет руководил маркетингом на метриках — конверсия, CTR, ROI, LTV.Криптовалютными рынками занимаюсь с 2021 года: ончейн-метрики, токеномика, макроэкономические индикаторы. Разработал собственную data-driven модель анализа рынка на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математическая статистика и EDA; сбор и сверку данных автоматизирую AI-агентами.Принцип — «Don't trust, verify»: каждая цифра проверена по первоисточнику, ключевые — минимум по двум независимым; прогнозы — только сценарии с условиями. Тезис без данных не публикуется.