Коротко (TL;DR)
- 31 июля 2026 года DeepSeek выпустила финальную версию V4 Flash — сборку 0731. API вышел в публичную бету, веса выложены на Hugging Face под лицензией MIT.
- Модель не стала больше. Архитектура и размер те же, что у апрельского Preview: 284 млрд параметров всего, 13 млрд активных на токен. Весь прирост дало переобучение на этапе post-training.
- Прирост на агентских тестах крупный. По вендорской таблице Terminal-Bench 2.1 — 82,7 против 72,1 у старшей V4 Pro (Preview), DeepSWE — 54,4 против 12,8.
- Цена — главный аргумент. $0,14 за миллион входных токенов, $0,0028 при попадании в кэш и $0,28 за миллион выходных. Медиана по сопоставимому классу моделей — $0,43 и $1,20 соответственно (Artificial Analysis).
- Контекст — 1 млн токенов, предел вывода — 384 тыс.
- Главная оговорка. Часть опубликованных тестов — внутренние наборы вендора, а прогоны шли на собственном harness DeepSeek. По независимому индексу фактической точности модель ведёт себя заметно хуже флагманов.
Дальше — что именно поменялось, откуда взялась вторая цифра параметров, сколько стоит типовая агентская сессия, что нужно для запуска у себя и кому эта модель не подходит.
- Коротко (TL;DR)
- Что вышло 31 июля
- Сколько в ней параметров: 284B или 304B
- Бенчмарки: что опубликовал вендор
- Что говорят независимые замеры
- Где она в общей картине
- Цены и во сколько обходится работа
- Миллион токенов контекста: что это значит на практике
- Как попробовать
- Запуск у себя: что реально нужно
- Что именно разрешает лицензия MIT
- DSpark: зачем модуль в чекпойнте
- Слабые места
- Кому подходит, а кому нет
- Что в итоге
- Частые вопросы
Что вышло 31 июля
DeepSeek перевела V4 Flash из превью в релиз. В журнале изменений API формулировка прямая: способ вызова не меняется, достаточно указать имя модели deepseek-v4-flash — и вы работаете с новой версией.
Ключевая фраза в той же документации: сборка 0731 сохраняет архитектуру и размер версии V4-Flash-Preview и была только заново переобучена на этапе post-training. То есть это не «новая модель» в привычном смысле — это та же модель, которую иначе дообучили.
Отдельно вендор отмечает нативную поддержку формата Responses API и адаптацию под Codex — то есть модель целенаправленно готовили под агентские сценарии, где она сама вызывает инструменты, а не просто отвечает текстом.
Post-training простыми словами — это этап после основного обучения, когда модель уже «знает язык», и её учат вести себя нужным образом: следовать инструкциям, пользоваться инструментами, не разваливаться на длинных задачах. Меняется поведение, а не объём знаний.
Сколько в ней параметров: 284B или 304B
Это первое, обо что спотыкается читатель. На карточке Hugging Face указано 304 млрд параметров, а в документации и разборах — 284 млрд. Обе цифры верны, и вот почему.
Базовая модель — 284 млрд параметров, из них на каждый токен активируется примерно 13 млрд. Это архитектура MoE (Mixture of Experts, «смесь экспертов»): сеть разбита на много подсетей-экспертов, и для каждого токена маршрутизатор включает лишь несколько из них. За счёт этого считать дешевле, чем если бы работала вся сеть целиком.
304 млрд — это размер чекпойнта, который лежит в репозитории. Вместе с базовой моделью туда упакован модуль спекулятивного декодирования DSpark, и его веса считаются вместе с остальными. Модель от этого «умнее» не стала — просто в одном файле лежат две вещи.
Практический вывод: когда планируете память под запуск, ориентируйтесь на то, что скачали, а не на красивое число из статьи.
Бенчмарки: что опубликовал вендор
Таблица из карточки модели — сравнение сборки 0731 со старшей V4 Pro в статусе Preview.Тест V4 Flash 0731 V4 Pro (Preview) Проверяем снаружи Terminal Bench 2.1 82,7 72,1 да DeepSWE 54,4 12,8 да NL2Repo 54,2 38,5 частично Cybergym 76,7 52,7 частично DSBench-FullStack 68,7 41,8 нет, внутренний тест
Разрыв выглядит эффектно, и сам вендор формулирует это так: 0731 обходит V4 Pro (Preview) при заметно меньшем числе активных параметров.
Три оговорки, без которых таблицу читать нельзя.
Первая: DSBench-FullStack и DSBench-Hard — внутренние наборы задач DeepSeek. Их нельзя воспроизвести со стороны, поэтому две самые «показательные» строки проверке не поддаются. Осмысленно сравнивать с другими моделями можно по Terminal Bench и DeepSWE.
Вторая: прогоны шли на собственном harness DeepSeek в так называемом minimal mode. Harness — это программная обвязка вокруг модели: она собирает системный промпт, разбирает вызовы инструментов, управляет состоянием и повторами. Своя обвязка обычно снисходительна к особенностям формата именно своей модели. Цифры, полученные на своём harness, нельзя напрямую ставить рядом с цифрами, полученными на чужом стандартном.
Третья: задачи DeepSWE были выложены в открытый доступ вместе с логикой проверки. Когда структура тестов известна заранее, последующее дообучение может — намеренно или нет — подстроиться под это распределение. Это не обвинение, а причина смотреть на прирост в 4 раза с холодной головой.
Что говорят независимые замеры
Artificial Analysis, которая гоняет модели по собственной методике, ставит V4 Flash 0731 индекс интеллекта 50 — третье место из 101 модели в её выборке при медиане 25 по сопоставимому классу. То есть по совокупной «толковости» модель действительно наверху.
Там же есть цифра, которая объясняет часть экономики: за один прогон оценки модель выдала 210 млн выходных токенов. Это много — модель многословна. Для платящего по выходным токенам это прямая статья расходов.
Отдельный сюжет — фактическая точность. Разбор yage.ai, опирающийся на индекс AA-Omniscience, приводит по сборке 0731 долю галлюцинаций 84% при точности ответов 37%; у превью было 96%. Для сравнения там же приводится порядок 37% у флагманов уровня Claude Sonnet 5. На публичной карточке Artificial Analysis отдельной строки с этим числом нет, поэтому цифру стоит держать в голове как оценку конкретного разбора, а не как официальный показатель. Смысл её при этом понятен и без точного значения: модель склонна сочинять, а не признаваться в незнании.
Где она в общей картине
V4 Flash вышла посреди недели, когда открытые модели выкатывали одну за другой. За шесть дней конца июля — начала августа 2026 года появились сразу три релиза с открытыми весами, и сравнение между ними — самое честное, что можно сделать, потому что все три проверяемы.Модель Terminal-Bench 2.1 Индекс интеллекта (Artificial Analysis) Веса DeepSeek V4 Flash 0731 82,7 (вендор) 50 открыты, MIT Kimi K3 88,3 (вендор) 57 заявлены открытыми, скачать нельзя DeepSeek V4 Pro (Preview) 72,1 (вендор) — не в этом виде
Читать таблицу нужно с той же оговоркой, что и всё остальное: все цифры Terminal-Bench здесь вендорские, и каждая модель гонялась в своей обвязке. Строгого «при прочих равных» тут нет ни у кого. Независимая колонка — только индекс Artificial Analysis, и по ней Kimi K3 впереди.
Зато у V4 Flash есть то, чего нет у соседей по таблице: веса реально лежат и реально скачиваются. У Kimi K3 открытость на момент нашего разбора оставалась заявленной, но не осуществимой. Разница между «модель открытая» и «модель у меня на диске» — как раз то, что отличает V4 Flash от всей остальной таблицы.
Цены и во сколько обходится работа
Официальный прайс на миллион токенов:Что Цена Вход, промах мимо кэша $0,14 Вход, попадание в кэш $0,0028 Выход $0,28 Контекст 1 млн токенов Предел вывода 384 тыс. токенов
Кэш здесь — это когда начало запроса совпадает с уже обработанным ранее. В агентских сценариях так бывает постоянно: системный промпт и описание инструментов не меняются от шага к шагу. Разница между $0,14 и $0,0028 — почти в пятьдесят раз, и именно она делает длинные диалоги дешёвыми.
Прикинем типовую агентскую сессию. Допустим, агент делает 20 шагов, на каждом отправляет 30 тыс. токенов контекста (из них 25 тыс. попадают в кэш) и получает 2 тыс. токенов ответа. Считаем: вход из кэша 20 × 25 000 = 500 тыс. токенов по $0,0028 — это $0,0014; вход мимо кэша 20 × 5 000 = 100 тыс. по $0,14 — $0,014; выход 20 × 2 000 = 40 тыс. по $0,28 — $0,0112. Итого около $0,027 за сессию, меньше трёх центов.
Но честная метрика — не цена сессии, а цена принятой задачи. Если из-за многословности и ошибок формата половину результатов приходится переделывать, реальная стоимость удваивается. Дешёвый токен не равен дешёвому результату — и это главное, что стоит проверить на своих задачах, прежде чем переносить на модель продакшн.
Миллион токенов контекста: что это значит на практике
Цифра «1M» звучит так, будто в модель можно залить библиотеку. На практике есть три ограничения, о которых стоит знать заранее.
Первое: контекст и вывод считаются из одного бюджета не везде одинаково. Не стоит исходить из того, что в любом рантайме вам дадут миллион входных токенов и сверху ещё 384 тысячи выходных. Как именно окно делится между промптом, историей и ответом, зависит от того, через что вы работаете, — это надо проверять в своей среде, а не выводить из строчки в прайсе.
Второе: длинный контекст стоит памяти. При локальном запуске KV-кэш (то, где хранится «память» о прочитанных токенах) растёт вместе с длиной диалога, и он добавляется к весам модели, а не входит в них. Замер на восьми ускорителях B200 показателен: при полном миллионном контексте и шести параллельных запросах суммарная скорость падала примерно до 182 токенов в секунду. Работать можно, но это уже не «мгновенный ответ».
Третье: длинный контекст не равен вниманию. Способность принять миллион токенов не означает, что модель одинаково хорошо помнит начало и конец. Практический совет прежний: подавать не «всё подряд», а отобранное — и проверять на своих данных, с какой длины качество начинает проседать.
Как попробовать
Три способа, от самого быстрого к самому основательному.
Через официальный API. Регистрируетесь на платформе DeepSeek, получаете ключ, указываете имя модели deepseek-v4-flash. Формат вызова совместим с привычным, отдельной миграции не требуется. Это же самый дешёвый вариант войти: несколько центов покрывают день экспериментов.
Через агрегатор. Модель доступна на OpenRouter и в облачных платформах вроде Baseten. Смысл в том, что один ключ даёт доступ сразу к десяткам моделей, и переключаться между ними можно, не меняя код. Цена будет чуть выше официальной — это плата за удобство.
Локально. Скачиваете квантованную сборку в формате GGUF и запускаете в подходящем рантайме. Практический порядок действий: посчитать доступную память, выбрать квант, который в неё влезает с запасом на KV-кэш, скачать, прогнать свой набор проверочных задач и сравнить с тем же набором на API. Последний шаг пропускают чаще всего — а он и показывает, сколько качества съел выбранный квант.
Запуск у себя: что реально нужно
Веса под MIT — это не маркетинг, лицензия действительно разрешает коммерческое использование. Вопрос только в железе.
Главная ловушка MoE. Активных параметров 13 млрд, но в память нужно положить все 284 млрд. Причина простая: маршрутизатор может выбрать любого из 256 экспертов на любом токене, поэтому держать в памяти «только нужных» невозможно. Экономия MoE — в скорости счёта, а не в объёме памяти.
Ориентиры по размерам квантованных сборок (данные Unsloth):Квант Размер Что нужно 8-бит (близко к оригиналу) ~162 ГБ сервер с большой памятью 3-бит ~103 ГБ машина от ~110 ГБ RAM INT4 (сообщество) около половины исходного сборка уровня 4× RTX 4090, с потерей качества
Квантование — это огрубление весов: числа хранят с меньшей точностью, файл становится меньше, качество немного падает. Насколько именно — зависит от рецепта, и «четыре бита» у разных авторов означают разное.
Откуда взялась именно сборка из четырёх RTX 4090: у каждой такой карты 24 ГБ видеопамяти, то есть четыре штуки дают 96 ГБ суммарно. Это ровно тот порог, за которым INT4-версия начинает помещаться — но без запаса на KV-кэш, поэтому длинный контекст на такой конфигурации будет упираться в память раньше, чем в скорость. Считать надо не «влезли ли веса», а «влезли ли веса плюс кэш на нужной вам длине диалога».
Для сравнения масштаба: старшей V4 Pro даже в 4 битах нужно порядка 430 ГБ, то есть уже кластер. Flash в этом смысле — единственная модель своего уровня, которую реально держать на одной машине. Если хочется потренироваться на чём-то попроще, у нас есть разбор локального запуска моделей DeepSeek предыдущего поколения — механика та же, требования скромнее.
Что именно разрешает лицензия MIT
Формулировка в репозитории прямая: репозиторий и веса модели распространяются по лицензии MIT. Это самая мягкая из распространённых лицензий, и на практике она означает четыре вещи.
Можно использовать коммерчески. Никаких порогов по выручке, числу пользователей или отраслям — в отличие от лицензий, где право пользоваться моделью пропадает, как только бизнес вырастает.
Можно дообучать и менять. Файнтюн под свою предметную область, дистилляция в модель поменьше, любые правки — всё разрешено, и результат остаётся вашим.
Можно распространять дальше, в том числе внутри своего платного продукта, сохранив текст лицензии и указание авторства.
Нет обязанности открывать своё. MIT не «заразна»: она не требует, чтобы ваш код или ваша дообученная версия тоже стали открытыми.
Оговорка одна, и она общая для всех открытых моделей: лицензия распространяется на веса и код, но не отвечает за то, что модель сгенерирует. Ответственность за результат остаётся на том, кто её применил, — и на фоне высокой доли галлюцинаций это не формальность.
DSpark: зачем модуль в чекпойнте
DSpark — это блочный «черновик»: отдельный маленький модуль предсказывает сразу несколько следующих токенов, а основная модель их проверяет одним проходом. Если угадал — получаем несколько токенов по цене одного шага.
Замеры на 8× B200 показывают порядок эффекта: без спекулятивного декодирования генерация упирается примерно в 600 токенов в секунду, с DSpark при 16 параллельных запросах поднимается примерно до 790. При полном контексте в 1 млн токенов и шести параллельных запросах — около 182 токенов в секунду суммарно.
Важно понимать, что DSpark не делает модель умнее — он ускоряет выдачу. Точность при включённом ускорении совпадает с обычным режимом в пределах погрешности прогонов. Подробнее сам механизм мы разбирали в обзоре старшей DeepSeek V4 Pro.
Слабые места
- Галлюцинации. Модель предпочитает выдать ответ, а не сказать «не знаю». Для справочных сценариев это плохо: всё, что она сообщает как факт, нужно проверять.
- Многословность. Длинные ответы — это и дополнительные деньги за выходные токены, и больше поверхности для ошибки.
- Формат вызова инструментов. На практике встречаются четыре типовые проблемы:
nullв необязательных полях, JSON-массив, отданный строкой, массив, завёрнутый в один объект, и пути к файлам в виде Markdown-ссылок. Если ваш парсер строгий, агент будет спотыкаться. - Непрозрачность бенчмарков. Часть тестов внутренние, harness свой, задачи DeepSWE были опубликованы заранее.
- Память под локальный запуск. 284 млрд параметров придётся держать целиком независимо от того, сколько активируется.
Кому подходит, а кому нет
Подходит, если у вас агент или конвейер, где важен объём работы и цена за токен: массовая обработка кода, длинные диалоги с повторяющимся системным промптом, задачи, где результат всё равно проверяется тестами или ревью. Подходит, если принципиально держать модель у себя — тут у неё в своём классе почти нет конкурентов.
Не подходит, если нужна фактическая надёжность без проверки: справочные ответы пользователям, работа с документами, где ошибка дорога, любые сценарии, где никто не перечитывает вывод. Не подходит, если у вас нет ни бюджета на API, ни машины с сотней с лишним гигабайт памяти — «открытые веса» в таком случае остаются теоретической возможностью.
Что в итоге
Главный результат этого релиза не в баллах. DeepSeek показала, что серьёзный скачок в агентских задачах можно получить без увеличения модели — одним переобучением. Это меняет ожидания: следующий заметный шаг не обязательно будет стоить очередного порядка вычислений.
Второй результат — ценовой. Модель уровня «выше среднего по классу» с открытыми весами и ценой втрое ниже медианы делает разговор про «дорогой ИИ» менее убедительным. Но перед переносом продакшна стоит посчитать не цену токена, а цену принятой задачи — на своих данных и своём harness.
Частые вопросы
Чем 0731 отличается от предыдущей V4 Flash Preview? Архитектура и размер те же. Отличие — в post-training: модель заново дообучили, что подняло агентские метрики и добавило поддержку Responses API и адаптацию под Codex.
Правда ли, что Flash обходит старшую Pro? По вендорской таблице — да, на агентских тестах. Но сравнение идёт с версией Pro в статусе Preview, часть тестов внутренние, и прогоны шли на собственном harness DeepSeek. На своих задачах результат может отличаться.
Сколько стоит DeepSeek V4 Flash в API? $0,14 за миллион входных токенов при промахе мимо кэша, $0,0028 при попадании и $0,28 за миллион выходных. Контекст — 1 млн токенов, предел вывода — 384 тыс.
Можно ли запустить DeepSeek V4 Flash локально? Да, веса открыты по MIT. Восьмибитная сборка занимает около 162 ГБ, трёхбитная — около 103 ГБ и запускается на машине от ~110 ГБ памяти. Все 284 млрд параметров должны быть в памяти целиком.
Что такое DSpark и нужен ли он мне? Модуль спекулятивного декодирования: ускоряет генерацию, не меняя качества. Если вы обслуживаете модель сами — включать стоит, прирост измеримый. При работе через API он вас не касается.
Стоит ли переходить на неё с платного флагмана? Зависит от сценария. Для массовых агентских задач с проверяемым результатом экономия реальная. Для задач, где ответ уходит пользователю без проверки, разница в фактической точности перевешивает разницу в цене.




