DeepSeek V4.1-Flash вышла с контекстом на 1 млн токенов и кэшем по $0,003 за миллион

3 мин. чтения
BYBIT · СПОТ И ФЬЮЧЕРСЫ
Крипта с нуля
Комиссия 0,1%, торги 24/7, старт с $10
Открыть счёт

Что произошло

DeepSeek 10 сентября 2026 года выпустила модель DeepSeek-V4.1-Flash. Это смесь экспертов (MoE — архитектура, где на каждый запрос включается лишь часть сети) на 552 млрд параметров с контекстным окном в 1 млн токенов. Веса выложены на Hugging Face под лицензией MIT, то есть коммерческое использование разрешено без отдельных условий.

Детали

Главная инженерная идея — резко сократить работу при чтении длинного ввода. На этапе чтения запроса активны около 8 млрд параметров, на этапе генерации ответа — 16 млрд. Кэш ключей и значений сжат до 890 байт на токен, примерно вчетверо меньше, чем у предыдущей V4-Flash.

Из этого следует цена. По тарифам DeepSeek на дату релиза 1 млн токенов кэшированного ввода стоит $0,003 в непиковые часы и $0,006 в пиковые, некэшированный ввод — $0,15 и $0,30, вывод — $0,60 и $1,20. Пиковыми считаются будни с 01:00 до 04:00 и с 06:00 до 10:00 UTC, остальное время дешевле вдвое.

С бенчмарками картина неоднородная, и заголовок «обошла GPT-5.6 Sol и Claude Opus 5» описывает её лишь частично. На DeepSWE v1.1 у модели 74,2 против 74,0 у Opus 5 и 73,0 у GPT-5.6 Sol — разница внутри погрешности. На Terminal-Bench 3.0 у неё 30,0 против 43,3 у Opus 5, на Terminal-Bench 4.0 — 31,2 против 51,8. На GPQA Diamond — 90,9.

Что это значит

Касается это тех, кто гоняет через API длинные повторяющиеся контексты: документацию, кодовую базу, большие своды правил. Именно здесь кэш даёт основную экономию — префикс на 500 тыс. токенов, прочитанный сто раз, обходится примерно в $0,15 в непиковые часы против $15–25 у моделей-конкурентов.

А вот «открытая лицензия» здесь не равна «запущу дома». 552 млрд параметров не помещаются в потребительскую память, сколько бы их ни активировалось на запрос: малое число активных параметров удешевляет обслуживание на сервере, а не требования к железу. Практический путь для частного пользователя — сторонние провайдеры, которые уже разворачивают модель, а не локальный запуск.

Горизонт — ближайшие недели: цену и качество стоит сверять после того, как модель появится у независимых провайдеров и обрастёт замерами вне бенчмарков самого разработчика.

Контекст

Прошлую версию линейки мы разбирали отдельно — обзор DeepSeek V4 Flash объясняет, за счёт чего младшая модель обходила старшую Pro. Про то, что из открытых фронтир-моделей реально запускается на домашнем железе, — в материале о локальном запуске GLM.

Bybit
$30,100 + $5,030
100 USDT в подарок
Получить →
Поделиться
Связаться:
Крипто- и data-аналитик, инженер-программист (факультет компьютерных наук ХНУРЭ). В IT с 2008 года: администрировал корпоративный мониторинг в «Vodafone Украина», семь лет разрабатывал и продвигал веб-проекты, пять лет руководил маркетингом на метриках — конверсия, CTR, ROI, LTV.Криптовалютными рынками занимаюсь с 2021 года: ончейн-метрики, токеномика, макроэкономические индикаторы. Разработал собственную data-driven модель анализа рынка на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математическая статистика и EDA; сбор и сверку данных автоматизирую AI-агентами.Принцип — «Don't trust, verify»: каждая цифра проверена по первоисточнику, ключевые — минимум по двум независимым; прогнозы — только сценарии с условиями. Тезис без данных не публикуется.