Что произошло
DeepSeek 10 сентября 2026 года выпустила модель DeepSeek-V4.1-Flash. Это смесь экспертов (MoE — архитектура, где на каждый запрос включается лишь часть сети) на 552 млрд параметров с контекстным окном в 1 млн токенов. Веса выложены на Hugging Face под лицензией MIT, то есть коммерческое использование разрешено без отдельных условий.
Детали
Главная инженерная идея — резко сократить работу при чтении длинного ввода. На этапе чтения запроса активны около 8 млрд параметров, на этапе генерации ответа — 16 млрд. Кэш ключей и значений сжат до 890 байт на токен, примерно вчетверо меньше, чем у предыдущей V4-Flash.
Из этого следует цена. По тарифам DeepSeek на дату релиза 1 млн токенов кэшированного ввода стоит $0,003 в непиковые часы и $0,006 в пиковые, некэшированный ввод — $0,15 и $0,30, вывод — $0,60 и $1,20. Пиковыми считаются будни с 01:00 до 04:00 и с 06:00 до 10:00 UTC, остальное время дешевле вдвое.
С бенчмарками картина неоднородная, и заголовок «обошла GPT-5.6 Sol и Claude Opus 5» описывает её лишь частично. На DeepSWE v1.1 у модели 74,2 против 74,0 у Opus 5 и 73,0 у GPT-5.6 Sol — разница внутри погрешности. На Terminal-Bench 3.0 у неё 30,0 против 43,3 у Opus 5, на Terminal-Bench 4.0 — 31,2 против 51,8. На GPQA Diamond — 90,9.
Что это значит
Касается это тех, кто гоняет через API длинные повторяющиеся контексты: документацию, кодовую базу, большие своды правил. Именно здесь кэш даёт основную экономию — префикс на 500 тыс. токенов, прочитанный сто раз, обходится примерно в $0,15 в непиковые часы против $15–25 у моделей-конкурентов.
А вот «открытая лицензия» здесь не равна «запущу дома». 552 млрд параметров не помещаются в потребительскую память, сколько бы их ни активировалось на запрос: малое число активных параметров удешевляет обслуживание на сервере, а не требования к железу. Практический путь для частного пользователя — сторонние провайдеры, которые уже разворачивают модель, а не локальный запуск.
Горизонт — ближайшие недели: цену и качество стоит сверять после того, как модель появится у независимых провайдеров и обрастёт замерами вне бенчмарков самого разработчика.
Контекст
Прошлую версию линейки мы разбирали отдельно — обзор DeepSeek V4 Flash объясняет, за счёт чего младшая модель обходила старшую Pro. Про то, что из открытых фронтир-моделей реально запускается на домашнем железе, — в материале о локальном запуске GLM.


