DeepSeek V4 Flash 0731: модель не выросла ни на грамм — а на агентских тестах обошла старшую Pro

20 мин. чтения
BYBIT EARN
Крипта лежит?
Bybit Earn: процент капает каждый день
Открыть Earn

Коротко (TL;DR)

  • 31 июля 2026 года DeepSeek выпустила финальную версию V4 Flash — сборку 0731. API вышел в публичную бету, веса выложены на Hugging Face под лицензией MIT.
  • Модель не стала больше. Архитектура и размер те же, что у апрельского Preview: 284 млрд параметров всего, 13 млрд активных на токен. Весь прирост дало переобучение на этапе post-training.
  • Прирост на агентских тестах крупный. По вендорской таблице Terminal-Bench 2.1 — 82,7 против 72,1 у старшей V4 Pro (Preview), DeepSWE — 54,4 против 12,8.
  • Цена — главный аргумент. $0,14 за миллион входных токенов, $0,0028 при попадании в кэш и $0,28 за миллион выходных. Медиана по сопоставимому классу моделей — $0,43 и $1,20 соответственно (Artificial Analysis).
  • Контекст — 1 млн токенов, предел вывода — 384 тыс.
  • Главная оговорка. Часть опубликованных тестов — внутренние наборы вендора, а прогоны шли на собственном harness DeepSeek. По независимому индексу фактической точности модель ведёт себя заметно хуже флагманов.

Дальше — что именно поменялось, откуда взялась вторая цифра параметров, сколько стоит типовая агентская сессия, что нужно для запуска у себя и кому эта модель не подходит.

Что вышло 31 июля

DeepSeek перевела V4 Flash из превью в релиз. В журнале изменений API формулировка прямая: способ вызова не меняется, достаточно указать имя модели deepseek-v4-flash — и вы работаете с новой версией.

Ключевая фраза в той же документации: сборка 0731 сохраняет архитектуру и размер версии V4-Flash-Preview и была только заново переобучена на этапе post-training. То есть это не «новая модель» в привычном смысле — это та же модель, которую иначе дообучили.

Отдельно вендор отмечает нативную поддержку формата Responses API и адаптацию под Codex — то есть модель целенаправленно готовили под агентские сценарии, где она сама вызывает инструменты, а не просто отвечает текстом.

BYBITВсё ещё смотришь со стороны?Рынок работает без выходных. Счёт на Bybit открывается за 2 минуты.Начать сейчас

Post-training простыми словами — это этап после основного обучения, когда модель уже «знает язык», и её учат вести себя нужным образом: следовать инструкциям, пользоваться инструментами, не разваливаться на длинных задачах. Меняется поведение, а не объём знаний.

Сколько в ней параметров: 284B или 304B

Это первое, обо что спотыкается читатель. На карточке Hugging Face указано 304 млрд параметров, а в документации и разборах — 284 млрд. Обе цифры верны, и вот почему.

Базовая модель — 284 млрд параметров, из них на каждый токен активируется примерно 13 млрд. Это архитектура MoE (Mixture of Experts, «смесь экспертов»): сеть разбита на много подсетей-экспертов, и для каждого токена маршрутизатор включает лишь несколько из них. За счёт этого считать дешевле, чем если бы работала вся сеть целиком.

304 млрд — это размер чекпойнта, который лежит в репозитории. Вместе с базовой моделью туда упакован модуль спекулятивного декодирования DSpark, и его веса считаются вместе с остальными. Модель от этого «умнее» не стала — просто в одном файле лежат две вещи.

Практический вывод: когда планируете память под запуск, ориентируйтесь на то, что скачали, а не на красивое число из статьи.

Бенчмарки: что опубликовал вендор

Таблица из карточки модели — сравнение сборки 0731 со старшей V4 Pro в статусе Preview.

ТестV4 Flash 0731V4 Pro (Preview)Проверяем снаружи
Terminal Bench 2.182,772,1да
DeepSWE54,412,8да
NL2Repo54,238,5частично
Cybergym76,752,7частично
DSBench-FullStack68,741,8нет, внутренний тест

Разрыв выглядит эффектно, и сам вендор формулирует это так: 0731 обходит V4 Pro (Preview) при заметно меньшем числе активных параметров.

BYBIT COPY TRADINGКопитрейдинг на BybitОткрытая статистика трейдеров, старт с $10, отключение в один клик.Выбрать трейдера

Три оговорки, без которых таблицу читать нельзя.

Первая: DSBench-FullStack и DSBench-Hard — внутренние наборы задач DeepSeek. Их нельзя воспроизвести со стороны, поэтому две самые «показательные» строки проверке не поддаются. Осмысленно сравнивать с другими моделями можно по Terminal Bench и DeepSWE.

Вторая: прогоны шли на собственном harness DeepSeek в так называемом minimal mode. Harness — это программная обвязка вокруг модели: она собирает системный промпт, разбирает вызовы инструментов, управляет состоянием и повторами. Своя обвязка обычно снисходительна к особенностям формата именно своей модели. Цифры, полученные на своём harness, нельзя напрямую ставить рядом с цифрами, полученными на чужом стандартном.

Третья: задачи DeepSWE были выложены в открытый доступ вместе с логикой проверки. Когда структура тестов известна заранее, последующее дообучение может — намеренно или нет — подстроиться под это распределение. Это не обвинение, а причина смотреть на прирост в 4 раза с холодной головой.

Что говорят независимые замеры

Artificial Analysis, которая гоняет модели по собственной методике, ставит V4 Flash 0731 индекс интеллекта 50 — третье место из 101 модели в её выборке при медиане 25 по сопоставимому классу. То есть по совокупной «толковости» модель действительно наверху.

Там же есть цифра, которая объясняет часть экономики: за один прогон оценки модель выдала 210 млн выходных токенов. Это много — модель многословна. Для платящего по выходным токенам это прямая статья расходов.

Отдельный сюжет — фактическая точность. Разбор yage.ai, опирающийся на индекс AA-Omniscience, приводит по сборке 0731 долю галлюцинаций 84% при точности ответов 37%; у превью было 96%. Для сравнения там же приводится порядок 37% у флагманов уровня Claude Sonnet 5. На публичной карточке Artificial Analysis отдельной строки с этим числом нет, поэтому цифру стоит держать в голове как оценку конкретного разбора, а не как официальный показатель. Смысл её при этом понятен и без точного значения: модель склонна сочинять, а не признаваться в незнании.

Где она в общей картине

V4 Flash вышла посреди недели, когда открытые модели выкатывали одну за другой. За шесть дней конца июля — начала августа 2026 года появились сразу три релиза с открытыми весами, и сравнение между ними — самое честное, что можно сделать, потому что все три проверяемы.

МодельTerminal-Bench 2.1Индекс интеллекта (Artificial Analysis)Веса
DeepSeek V4 Flash 073182,7 (вендор)50открыты, MIT
Kimi K388,3 (вендор)57заявлены открытыми, скачать нельзя
DeepSeek V4 Pro (Preview)72,1 (вендор)не в этом виде

Читать таблицу нужно с той же оговоркой, что и всё остальное: все цифры Terminal-Bench здесь вендорские, и каждая модель гонялась в своей обвязке. Строгого «при прочих равных» тут нет ни у кого. Независимая колонка — только индекс Artificial Analysis, и по ней Kimi K3 впереди.

Зато у V4 Flash есть то, чего нет у соседей по таблице: веса реально лежат и реально скачиваются. У Kimi K3 открытость на момент нашего разбора оставалась заявленной, но не осуществимой. Разница между «модель открытая» и «модель у меня на диске» — как раз то, что отличает V4 Flash от всей остальной таблицы.

Цены и во сколько обходится работа

Официальный прайс на миллион токенов:

ЧтоЦена
Вход, промах мимо кэша$0,14
Вход, попадание в кэш$0,0028
Выход$0,28
Контекст1 млн токенов
Предел вывода384 тыс. токенов

Кэш здесь — это когда начало запроса совпадает с уже обработанным ранее. В агентских сценариях так бывает постоянно: системный промпт и описание инструментов не меняются от шага к шагу. Разница между $0,14 и $0,0028 — почти в пятьдесят раз, и именно она делает длинные диалоги дешёвыми.

Прикинем типовую агентскую сессию. Допустим, агент делает 20 шагов, на каждом отправляет 30 тыс. токенов контекста (из них 25 тыс. попадают в кэш) и получает 2 тыс. токенов ответа. Считаем: вход из кэша 20 × 25 000 = 500 тыс. токенов по $0,0028 — это $0,0014; вход мимо кэша 20 × 5 000 = 100 тыс. по $0,14 — $0,014; выход 20 × 2 000 = 40 тыс. по $0,28 — $0,0112. Итого около $0,027 за сессию, меньше трёх центов.

Но честная метрика — не цена сессии, а цена принятой задачи. Если из-за многословности и ошибок формата половину результатов приходится переделывать, реальная стоимость удваивается. Дешёвый токен не равен дешёвому результату — и это главное, что стоит проверить на своих задачах, прежде чем переносить на модель продакшн.

Миллион токенов контекста: что это значит на практике

Цифра «1M» звучит так, будто в модель можно залить библиотеку. На практике есть три ограничения, о которых стоит знать заранее.

Первое: контекст и вывод считаются из одного бюджета не везде одинаково. Не стоит исходить из того, что в любом рантайме вам дадут миллион входных токенов и сверху ещё 384 тысячи выходных. Как именно окно делится между промптом, историей и ответом, зависит от того, через что вы работаете, — это надо проверять в своей среде, а не выводить из строчки в прайсе.

Второе: длинный контекст стоит памяти. При локальном запуске KV-кэш (то, где хранится «память» о прочитанных токенах) растёт вместе с длиной диалога, и он добавляется к весам модели, а не входит в них. Замер на восьми ускорителях B200 показателен: при полном миллионном контексте и шести параллельных запросах суммарная скорость падала примерно до 182 токенов в секунду. Работать можно, но это уже не «мгновенный ответ».

Третье: длинный контекст не равен вниманию. Способность принять миллион токенов не означает, что модель одинаково хорошо помнит начало и конец. Практический совет прежний: подавать не «всё подряд», а отобранное — и проверять на своих данных, с какой длины качество начинает проседать.

Как попробовать

Три способа, от самого быстрого к самому основательному.

Через официальный API. Регистрируетесь на платформе DeepSeek, получаете ключ, указываете имя модели deepseek-v4-flash. Формат вызова совместим с привычным, отдельной миграции не требуется. Это же самый дешёвый вариант войти: несколько центов покрывают день экспериментов.

Через агрегатор. Модель доступна на OpenRouter и в облачных платформах вроде Baseten. Смысл в том, что один ключ даёт доступ сразу к десяткам моделей, и переключаться между ними можно, не меняя код. Цена будет чуть выше официальной — это плата за удобство.

Локально. Скачиваете квантованную сборку в формате GGUF и запускаете в подходящем рантайме. Практический порядок действий: посчитать доступную память, выбрать квант, который в неё влезает с запасом на KV-кэш, скачать, прогнать свой набор проверочных задач и сравнить с тем же набором на API. Последний шаг пропускают чаще всего — а он и показывает, сколько качества съел выбранный квант.

Запуск у себя: что реально нужно

Веса под MIT — это не маркетинг, лицензия действительно разрешает коммерческое использование. Вопрос только в железе.

Главная ловушка MoE. Активных параметров 13 млрд, но в память нужно положить все 284 млрд. Причина простая: маршрутизатор может выбрать любого из 256 экспертов на любом токене, поэтому держать в памяти «только нужных» невозможно. Экономия MoE — в скорости счёта, а не в объёме памяти.

Ориентиры по размерам квантованных сборок (данные Unsloth):

КвантРазмерЧто нужно
8-бит (близко к оригиналу)~162 ГБсервер с большой памятью
3-бит~103 ГБмашина от ~110 ГБ RAM
INT4 (сообщество)около половины исходногосборка уровня 4× RTX 4090, с потерей качества

Квантование — это огрубление весов: числа хранят с меньшей точностью, файл становится меньше, качество немного падает. Насколько именно — зависит от рецепта, и «четыре бита» у разных авторов означают разное.

Откуда взялась именно сборка из четырёх RTX 4090: у каждой такой карты 24 ГБ видеопамяти, то есть четыре штуки дают 96 ГБ суммарно. Это ровно тот порог, за которым INT4-версия начинает помещаться — но без запаса на KV-кэш, поэтому длинный контекст на такой конфигурации будет упираться в память раньше, чем в скорость. Считать надо не «влезли ли веса», а «влезли ли веса плюс кэш на нужной вам длине диалога».

Для сравнения масштаба: старшей V4 Pro даже в 4 битах нужно порядка 430 ГБ, то есть уже кластер. Flash в этом смысле — единственная модель своего уровня, которую реально держать на одной машине. Если хочется потренироваться на чём-то попроще, у нас есть разбор локального запуска моделей DeepSeek предыдущего поколения — механика та же, требования скромнее.

Что именно разрешает лицензия MIT

Формулировка в репозитории прямая: репозиторий и веса модели распространяются по лицензии MIT. Это самая мягкая из распространённых лицензий, и на практике она означает четыре вещи.

Можно использовать коммерчески. Никаких порогов по выручке, числу пользователей или отраслям — в отличие от лицензий, где право пользоваться моделью пропадает, как только бизнес вырастает.

Можно дообучать и менять. Файнтюн под свою предметную область, дистилляция в модель поменьше, любые правки — всё разрешено, и результат остаётся вашим.

Можно распространять дальше, в том числе внутри своего платного продукта, сохранив текст лицензии и указание авторства.

Нет обязанности открывать своё. MIT не «заразна»: она не требует, чтобы ваш код или ваша дообученная версия тоже стали открытыми.

Оговорка одна, и она общая для всех открытых моделей: лицензия распространяется на веса и код, но не отвечает за то, что модель сгенерирует. Ответственность за результат остаётся на том, кто её применил, — и на фоне высокой доли галлюцинаций это не формальность.

DSpark: зачем модуль в чекпойнте

DSpark — это блочный «черновик»: отдельный маленький модуль предсказывает сразу несколько следующих токенов, а основная модель их проверяет одним проходом. Если угадал — получаем несколько токенов по цене одного шага.

Замеры на 8× B200 показывают порядок эффекта: без спекулятивного декодирования генерация упирается примерно в 600 токенов в секунду, с DSpark при 16 параллельных запросах поднимается примерно до 790. При полном контексте в 1 млн токенов и шести параллельных запросах — около 182 токенов в секунду суммарно.

Важно понимать, что DSpark не делает модель умнее — он ускоряет выдачу. Точность при включённом ускорении совпадает с обычным режимом в пределах погрешности прогонов. Подробнее сам механизм мы разбирали в обзоре старшей DeepSeek V4 Pro.

Слабые места

  • Галлюцинации. Модель предпочитает выдать ответ, а не сказать «не знаю». Для справочных сценариев это плохо: всё, что она сообщает как факт, нужно проверять.
  • Многословность. Длинные ответы — это и дополнительные деньги за выходные токены, и больше поверхности для ошибки.
  • Формат вызова инструментов. На практике встречаются четыре типовые проблемы: null в необязательных полях, JSON-массив, отданный строкой, массив, завёрнутый в один объект, и пути к файлам в виде Markdown-ссылок. Если ваш парсер строгий, агент будет спотыкаться.
  • Непрозрачность бенчмарков. Часть тестов внутренние, harness свой, задачи DeepSWE были опубликованы заранее.
  • Память под локальный запуск. 284 млрд параметров придётся держать целиком независимо от того, сколько активируется.

Кому подходит, а кому нет

Подходит, если у вас агент или конвейер, где важен объём работы и цена за токен: массовая обработка кода, длинные диалоги с повторяющимся системным промптом, задачи, где результат всё равно проверяется тестами или ревью. Подходит, если принципиально держать модель у себя — тут у неё в своём классе почти нет конкурентов.

Не подходит, если нужна фактическая надёжность без проверки: справочные ответы пользователям, работа с документами, где ошибка дорога, любые сценарии, где никто не перечитывает вывод. Не подходит, если у вас нет ни бюджета на API, ни машины с сотней с лишним гигабайт памяти — «открытые веса» в таком случае остаются теоретической возможностью.

Что в итоге

Главный результат этого релиза не в баллах. DeepSeek показала, что серьёзный скачок в агентских задачах можно получить без увеличения модели — одним переобучением. Это меняет ожидания: следующий заметный шаг не обязательно будет стоить очередного порядка вычислений.

Второй результат — ценовой. Модель уровня «выше среднего по классу» с открытыми весами и ценой втрое ниже медианы делает разговор про «дорогой ИИ» менее убедительным. Но перед переносом продакшна стоит посчитать не цену токена, а цену принятой задачи — на своих данных и своём harness.

Частые вопросы

Чем 0731 отличается от предыдущей V4 Flash Preview? Архитектура и размер те же. Отличие — в post-training: модель заново дообучили, что подняло агентские метрики и добавило поддержку Responses API и адаптацию под Codex.

Правда ли, что Flash обходит старшую Pro? По вендорской таблице — да, на агентских тестах. Но сравнение идёт с версией Pro в статусе Preview, часть тестов внутренние, и прогоны шли на собственном harness DeepSeek. На своих задачах результат может отличаться.

Сколько стоит DeepSeek V4 Flash в API? $0,14 за миллион входных токенов при промахе мимо кэша, $0,0028 при попадании и $0,28 за миллион выходных. Контекст — 1 млн токенов, предел вывода — 384 тыс.

Можно ли запустить DeepSeek V4 Flash локально? Да, веса открыты по MIT. Восьмибитная сборка занимает около 162 ГБ, трёхбитная — около 103 ГБ и запускается на машине от ~110 ГБ памяти. Все 284 млрд параметров должны быть в памяти целиком.

Что такое DSpark и нужен ли он мне? Модуль спекулятивного декодирования: ускоряет генерацию, не меняя качества. Если вы обслуживаете модель сами — включать стоит, прирост измеримый. При работе через API он вас не касается.

Стоит ли переходить на неё с платного флагмана? Зависит от сценария. Для массовых агентских задач с проверяемым результатом экономия реальная. Для задач, где ответ уходит пользователю без проверки, разница в фактической точности перевешивает разницу в цене.

Bybit
SpaceX за крипту
Дробные доли · 24/7
Открыть рынок →
Поделиться
Связаться:
Крипто- и data-аналитик, инженер-программист (факультет компьютерных наук ХНУРЭ). В IT с 2008 года: администрировал корпоративный мониторинг в «Vodafone Украина», семь лет разрабатывал и продвигал веб-проекты, пять лет руководил маркетингом на метриках — конверсия, CTR, ROI, LTV.Криптовалютными рынками занимаюсь с 2021 года: ончейн-метрики, токеномика, макроэкономические индикаторы. Разработал собственную data-driven модель анализа рынка на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математическая статистика и EDA; сбор и сверку данных автоматизирую AI-агентами.Принцип — «Don't trust, verify»: каждая цифра проверена по первоисточнику, ключевые — минимум по двум независимым; прогнозы — только сценарии с условиями. Тезис без данных не публикуется.