DeepSeek V4 Flash 0731: модель не виросла ні на грам — а на агентських тестах обійшла старшу Pro

20 хв. читання

Коротко (TL;DR)

  • 31 липня 2026 року DeepSeek випустила фінальну версію V4 Flash — збірку 0731. API вийшов у публічну бету, ваги виклали на Hugging Face під ліцензією MIT.
  • Модель не стала більшою. Архітектура й розмір ті самі, що в квітневого Preview: 284 млрд параметрів усього, 13 млрд активних на токен. Увесь приріст дало перенавчання на етапі post-training.
  • Приріст на агентських тестах великий. За вендорською таблицею Terminal-Bench 2.1 — 82,7 проти 72,1 у старшої V4 Pro (Preview), DeepSWE — 54,4 проти 12,8.
  • Ціна — головний аргумент. $0,14 за мільйон вхідних токенів, $0,0028 при влученні в кеш і $0,28 за мільйон вихідних. Медіана по зіставному класу моделей — $0,43 і $1,20 відповідно (Artificial Analysis).
  • Контекст — 1 млн токенів, межа виводу — 384 тис.
  • Головне застереження. Частина опублікованих тестів — внутрішні набори вендора, а прогони йшли на власному harness DeepSeek. За незалежним індексом фактичної точності модель поводиться помітно гірше за флагманів.

Далі — що саме змінилося, звідки взялася друга цифра параметрів, скільки коштує типова агентська сесія, що потрібно для запуску в себе і кому ця модель не підходить.

Що вийшло 31 липня

DeepSeek перевела V4 Flash із прев’ю в реліз. У журналі змін API формулювання пряме: спосіб виклику не змінюється, достатньо вказати ім’я моделі deepseek-v4-flash — і ви працюєте з новою версією.

Ключова фраза в тій самій документації: збірка 0731 зберігає архітектуру й розмір версії V4-Flash-Preview і була лише заново перенавчена на етапі post-training. Тобто це не «нова модель» у звичному сенсі — це та сама модель, яку інакше донавчили.

Окремо вендор зазначає нативну підтримку формату Responses API та адаптацію під Codex — тобто модель цілеспрямовано готували під агентські сценарії, де вона сама викликає інструменти, а не просто відповідає текстом.

BINANCEДосі дивишся збоку?Ринок працює без вихідних. Рахунок на Binance відкривається за 2 хвилини.Почати зараз

Post-training простими словами — це етап після основного навчання, коли модель уже «знає мову», і її вчать поводитися потрібним чином: дотримуватися інструкцій, користуватися інструментами, не розвалюватися на довгих задачах. Змінюється поведінка, а не обсяг знань.

Скільки в ній параметрів: 284B чи 304B

Це перше, обо що спотикається читач. На картці Hugging Face указано 304 млрд параметрів, а в документації та розборах — 284 млрд. Обидві цифри правильні, і ось чому.

Базова модель — 284 млрд параметрів, з них на кожен токен активується приблизно 13 млрд. Це архітектура MoE (Mixture of Experts, «суміш експертів»): мережа розбита на багато підмереж-експертів, і для кожного токена маршрутизатор вмикає лише кілька з них. За рахунок цього рахувати дешевше, ніж якби працювала вся мережа цілком.

304 млрд — це розмір чекпойнта, який лежить у репозиторії. Разом із базовою моделлю туди спаковано модуль спекулятивного декодування DSpark, і його ваги рахуються разом з рештою. Модель від цього «розумнішою» не стала — просто в одному файлі лежать дві речі.

Практичний висновок: коли плануєте пам’ять під запуск, орієнтуйтеся на те, що завантажили, а не на гарне число зі статті.

Бенчмарки: що опублікував вендор

Таблиця з картки моделі — порівняння збірки 0731 зі старшою V4 Pro у статусі Preview.

ТестV4 Flash 0731V4 Pro (Preview)Перевіряємо ззовні
Terminal Bench 2.182,772,1так
DeepSWE54,412,8так
NL2Repo54,238,5частково
Cybergym76,752,7частково
DSBench-FullStack68,741,8ні, внутрішній тест

Розрив має ефектний вигляд, і сам вендор формулює це так: 0731 обходить V4 Pro (Preview) за помітно меншої кількості активних параметрів.

BINANCE COPY TRADINGКопітрейдинг на BinanceВідкрита статистика трейдерів, старт з $10, вимкнення одним кліком.Обрати трейдера

Три застереження, без яких таблицю читати не можна.

Перше: DSBench-FullStack і DSBench-Hard — внутрішні набори задач DeepSeek. Їх неможливо відтворити збоку, тому два найпоказовіші рядки перевірці не піддаються. Осмислено порівнювати з іншими моделями можна за Terminal Bench і DeepSWE.

Друге: прогони йшли на власному harness DeepSeek у так званому minimal mode. Harness — це програмна обв’язка навколо моделі: вона збирає системний промпт, розбирає виклики інструментів, керує станом і повторами. Своя обв’язка зазвичай поблажлива до особливостей формату саме своєї моделі. Цифри, отримані на своєму harness, не можна прямо ставити поруч із цифрами, отриманими на чужому стандартному.

Третє: задачі DeepSWE були викладені у відкритий доступ разом із логікою перевірки. Коли структура тестів відома заздалегідь, подальше донавчання може — навмисно чи ні — підлаштуватися під цей розподіл. Це не звинувачення, а причина дивитися на приріст у 4 рази з холодною головою.

Що кажуть незалежні заміри

Artificial Analysis, яка ганяє моделі за власною методикою, ставить V4 Flash 0731 індекс інтелекту 50 — третє місце зі 101 моделі в її вибірці за медіани 25 по зіставному класу. Тобто за сукупною «тямущістю» модель справді нагорі.

Там само є цифра, яка пояснює частину економіки: за один прогін оцінки модель видала 210 млн вихідних токенів. Це багато — модель багатослівна. Для того, хто платить за вихідні токени, це пряма стаття витрат.

Окремий сюжет — фактична точність. Розбір yage.ai, що спирається на індекс AA-Omniscience, наводить за збіркою 0731 частку галюцинацій 84% за точності відповідей 37%; у прев’ю було 96%. Для порівняння там само наводиться порядок 37% у флагманів рівня Claude Sonnet 5. На публічній картці Artificial Analysis окремого рядка з цим числом немає, тому цифру варто тримати в голові як оцінку конкретного розбору, а не як офіційний показник. Сенс її при цьому зрозумілий і без точного значення: модель схильна вигадувати, а не зізнаватися в незнанні.

Де вона в загальній картині

V4 Flash вийшла посеред тижня, коли відкриті моделі викочували одну за одною. За шість днів кінця липня — початку серпня 2026 року з’явилися одразу три релізи з відкритими вагами, і порівняння між ними — найчесніше, що можна зробити, бо всі три перевіряються.

МодельTerminal-Bench 2.1Індекс інтелекту (Artificial Analysis)Ваги
DeepSeek V4 Flash 073182,7 (вендор)50відкриті, MIT
Kimi K388,3 (вендор)57заявлені відкритими, завантажити не можна
DeepSeek V4 Pro (Preview)72,1 (вендор)не в цьому вигляді

Читати таблицю треба з тим самим застереженням, що й усе інше: усі цифри Terminal-Bench тут вендорські, і кожна модель ганялася у своїй обв’язці. Строгого «за інших рівних» тут немає ні в кого. Незалежна колонка — лише індекс Artificial Analysis, і за ним Kimi K3 попереду.

Зате у V4 Flash є те, чого немає в сусідів по таблиці: ваги реально лежать і реально завантажуються. У Kimi K3 відкритість на момент нашого розбору залишалася заявленою, але не здійсненною. Різниця між «модель відкрита» і «модель у мене на диску» — саме те, що відрізняє V4 Flash від усієї решти таблиці.

Ціни і скільки коштує робота

Офіційний прайс на мільйон токенів:

ЩоЦіна
Вхід, промах повз кеш$0,14
Вхід, влучення в кеш$0,0028
Вихід$0,28
Контекст1 млн токенів
Межа виводу384 тис. токенів

Кеш тут — це коли початок запиту збігається з уже обробленим раніше. В агентських сценаріях так буває постійно: системний промпт і опис інструментів не змінюються від кроку до кроку. Різниця між $0,14 і $0,0028 — майже в п’ятдесят разів, і саме вона робить довгі діалоги дешевими.

Прикинемо типову агентську сесію. Припустимо, агент робить 20 кроків, на кожному надсилає 30 тис. токенів контексту (з них 25 тис. влучають у кеш) і отримує 2 тис. токенів відповіді. Рахуємо: вхід із кешу 20 × 25 000 = 500 тис. токенів по $0,0028 — це $0,0014; вхід повз кеш 20 × 5 000 = 100 тис. по $0,14 — $0,014; вихід 20 × 2 000 = 40 тис. по $0,28 — $0,0112. Разом близько $0,027 за сесію, менше ніж три центи.

Але чесна метрика — не ціна сесії, а ціна прийнятої задачі. Якщо через багатослівність і помилки формату половину результатів доводиться переробляти, реальна вартість подвоюється. Дешевий токен не дорівнює дешевому результату — і це головне, що варто перевірити на своїх задачах, перш ніж переносити на модель продакшн.

Мільйон токенів контексту: що це означає на практиці

Цифра «1M» звучить так, ніби в модель можна залити бібліотеку. На практиці є три обмеження, про які варто знати заздалегідь.

Перше: контекст і вивід рахуються з одного бюджету не скрізь однаково. Не варто виходити з того, що в будь-якому рантаймі вам дадуть мільйон вхідних токенів і зверху ще 384 тисячі вихідних. Як саме вікно ділиться між промптом, історією та відповіддю, залежить від того, через що ви працюєте, — це треба перевіряти у своєму середовищі, а не виводити з рядка в прайсі.

Друге: довгий контекст коштує пам’яті. При локальному запуску KV-кеш (те, де зберігається «пам’ять» про прочитані токени) зростає разом із довжиною діалогу, і він додається до ваг моделі, а не входить у них. Замір на восьми прискорювачах B200 показовий: за повного мільйонного контексту й шести паралельних запитів сумарна швидкість падала приблизно до 182 токенів на секунду. Працювати можна, але це вже не «миттєва відповідь».

Третє: довгий контекст не дорівнює увазі. Здатність прийняти мільйон токенів не означає, що модель однаково добре пам’ятає початок і кінець. Практична порада колишня: подавати не «все підряд», а відібране — і перевіряти на своїх даних, з якої довжини якість починає просідати.

Як спробувати

Три способи, від найшвидшого до найґрунтовнішого.

Через офіційний API. Реєструєтеся на платформі DeepSeek, отримуєте ключ, вказуєте ім’я моделі deepseek-v4-flash. Формат виклику сумісний зі звичним, окремої міграції не потрібно. Це ж найдешевший варіант увійти: кілька центів покривають день експериментів.

Через агрегатор. Модель доступна на OpenRouter і в хмарних платформах на кшталт Baseten. Сенс у тому, що один ключ дає доступ одразу до десятків моделей, і перемикатися між ними можна, не змінюючи код. Ціна буде трохи вища за офіційну — це плата за зручність.

Локально. Завантажуєте квантовану збірку у форматі GGUF і запускаєте у придатному рантаймі. Практичний порядок дій: порахувати доступну пам’ять, вибрати квант, який у неї влізає із запасом на KV-кеш, завантажити, прогнати свій набір перевірочних задач і порівняти з тим самим набором на API. Останній крок пропускають найчастіше — а він і показує, скільки якості з’їв обраний квант.

Запуск у себе: що реально потрібно

Ваги під MIT — це не маркетинг, ліцензія справді дозволяє комерційне використання. Питання лише в залізі.

Головна пастка MoE. Активних параметрів 13 млрд, але в пам’ять потрібно покласти всі 284 млрд. Причина проста: маршрутизатор може вибрати будь-якого з 256 експертів на будь-якому токені, тому тримати в пам’яті «лише потрібних» неможливо. Економія MoE — у швидкості обчислення, а не в обсязі пам’яті.

Орієнтири за розмірами квантованих збірок (дані Unsloth):

КвантРозмірЩо потрібно
8-біт (близько до оригіналу)~162 ГБсервер із великою пам’яттю
3-біт~103 ГБмашина від ~110 ГБ RAM
INT4 (спільнота)близько половини вихідногозбірка рівня 4× RTX 4090, із втратою якості

Квантування — це огрублення ваг: числа зберігають із меншою точністю, файл стає меншим, якість трохи падає. Наскільки саме — залежить від рецепта, і «чотири біти» в різних авторів означають різне.

Звідки взялася саме збірка з чотирьох RTX 4090: у кожної такої карти 24 ГБ відеопам’яті, тобто чотири штуки дають 96 ГБ сумарно. Це рівно той поріг, за яким INT4-версія починає вміщатися — але без запасу на KV-кеш, тому довгий контекст на такій конфігурації впиратиметься в пам’ять раніше, ніж у швидкість. Рахувати треба не «чи влізли ваги», а «чи влізли ваги плюс кеш на потрібній вам довжині діалогу».

Для порівняння масштабу: старшій V4 Pro навіть у 4 бітах потрібно близько 430 ГБ, тобто вже кластер. Flash у цьому сенсі — єдина модель свого рівня, яку реально тримати на одній машині. Якщо хочеться потренуватися на чомусь простішому, у нас є розбір локального запуску моделей DeepSeek попереднього покоління — механіка та сама, вимоги скромніші.

Що саме дозволяє ліцензія MIT

Формулювання в репозиторії пряме: репозиторій і ваги моделі поширюються за ліцензією MIT. Це найм’якша з поширених ліцензій, і на практиці вона означає чотири речі.

Можна використовувати комерційно. Жодних порогів за виручкою, кількістю користувачів чи галузями — на відміну від ліцензій, де право користуватися моделлю зникає, щойно бізнес виростає.

Можна донавчати і змінювати. Файнтюн під свою предметну область, дистиляція в модель меншого розміру, будь-які правки — усе дозволено, і результат залишається вашим.

Можна поширювати далі, зокрема всередині свого платного продукту, зберігши текст ліцензії та вказівку авторства.

Немає обов’язку відкривати своє. MIT не «заразна»: вона не вимагає, щоб ваш код чи ваша донавчена версія теж стали відкритими.

Застереження одне, і воно спільне для всіх відкритих моделей: ліцензія поширюється на ваги й код, але не відповідає за те, що модель згенерує. Відповідальність за результат залишається на тому, хто її застосував, — і на тлі високої частки галюцинацій це не формальність.

DSpark: навіщо модуль у чекпойнті

DSpark — це блоковий «чернетник»: окремий маленький модуль передбачає одразу кілька наступних токенів, а основна модель їх перевіряє одним проходом. Якщо вгадав — отримуємо кілька токенів за ціною одного кроку.

Заміри на 8× B200 показують порядок ефекту: без спекулятивного декодування генерація впирається приблизно в 600 токенів на секунду, з DSpark за 16 паралельних запитів піднімається приблизно до 790. За повного контексту в 1 млн токенів і шести паралельних запитів — близько 182 токенів на секунду сумарно.

Важливо розуміти, що DSpark не робить модель розумнішою — він пришвидшує видачу. Точність за ввімкненого пришвидшення збігається зі звичайним режимом у межах похибки прогонів. Докладніше сам механізм ми розбирали в огляді старшої DeepSeek V4 Pro.

Слабкі місця

  • Галюцинації. Модель воліє видати відповідь, а не сказати «не знаю». Для довідкових сценаріїв це погано: усе, що вона повідомляє як факт, потрібно перевіряти.
  • Багатослівність. Довгі відповіді — це і додаткові гроші за вихідні токени, і більше поверхні для помилки.
  • Формат виклику інструментів. На практиці трапляються чотири типові проблеми: null у необов’язкових полях, JSON-масив, відданий рядком, масив, загорнутий в один об’єкт, і шляхи до файлів у вигляді Markdown-посилань. Якщо ваш парсер суворий, агент спотикатиметься.
  • Непрозорість бенчмарків. Частина тестів внутрішні, harness свій, задачі DeepSWE були опубліковані заздалегідь.
  • Пам’ять під локальний запуск. 284 млрд параметрів доведеться тримати цілком незалежно від того, скільки активується.

Кому підходить, а кому ні

Підходить, якщо у вас агент або конвеєр, де важливий обсяг роботи і ціна за токен: масова обробка коду, довгі діалоги з повторюваним системним промптом, задачі, де результат усе одно перевіряється тестами чи ревʼю. Підходить, якщо принципово тримати модель у себе — тут у неї у своєму класі майже немає конкурентів.

Не підходить, якщо потрібна фактична надійність без перевірки: довідкові відповіді користувачам, робота з документами, де помилка дорога, будь-які сценарії, де ніхто не перечитує вивід. Не підходить, якщо у вас немає ні бюджету на API, ні машини зі сотнею з лишком гігабайтів пам’яті — «відкриті ваги» в такому разі залишаються теоретичною можливістю.

Що в підсумку

Головний результат цього релізу не в балах. DeepSeek показала, що серйозний стрибок в агентських задачах можна отримати без збільшення моделі — одним перенавчанням. Це змінює очікування: наступний помітний крок не обов’язково коштуватиме чергового порядку обчислень.

Другий результат — ціновий. Модель рівня «вище за середній по класу» з відкритими вагами і ціною втричі нижчою за медіану робить розмову про «дорогий ШІ» менш переконливою. Але перед перенесенням продакшну варто порахувати не ціну токена, а ціну прийнятої задачі — на своїх даних і своєму harness.

Часті запитання

Чим 0731 відрізняється від попередньої V4 Flash Preview? Архітектура й розмір ті самі. Відмінність — у post-training: модель заново донавчили, що підняло агентські метрики й додало підтримку Responses API та адаптацію під Codex.

Чи правда, що Flash обходить старшу Pro? За вендорською таблицею — так, на агентських тестах. Але порівняння йде з версією Pro у статусі Preview, частина тестів внутрішні, і прогони йшли на власному harness DeepSeek. На своїх задачах результат може відрізнятися.

Скільки коштує DeepSeek V4 Flash в API? $0,14 за мільйон вхідних токенів при промаху повз кеш, $0,0028 при влученні і $0,28 за мільйон вихідних. Контекст — 1 млн токенів, межа виводу — 384 тис.

Чи можна запустити DeepSeek V4 Flash локально? Так, ваги відкриті за MIT. Восьмибітна збірка займає близько 162 ГБ, трибітна — близько 103 ГБ і запускається на машині від ~110 ГБ пам’яті. Усі 284 млрд параметрів мають бути в пам’яті цілком.

Що таке DSpark і чи потрібен він мені? Модуль спекулятивного декодування: пришвидшує генерацію, не змінюючи якості. Якщо ви обслуговуєте модель самі — вмикати варто, приріст вимірний. Під час роботи через API він вас не стосується.

Чи варто переходити на неї з платного флагмана? Залежить від сценарію. Для масових агентських задач із перевірюваним результатом економія реальна. Для задач, де відповідь іде користувачу без перевірки, різниця у фактичній точності переважує різницю в ціні.

Поділитися
Зв'язатися:
Крипто- та data-аналітик, інженер-програміст (факультет комп'ютерних наук ХНУРЕ). В IT з 2008 року: адміністрував корпоративний моніторинг у «Vodafone Україна», сім років розробляв і просував веб-проєкти, п'ять років керував маркетингом на метриках — конверсія, CTR, ROI, LTV.Криптовалютними ринками займаюся з 2021 року: ончейн-метрики, токеноміка, макроекономічні індикатори. Розробив власну data-driven модель аналізу ринку на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математична статистика та EDA; збір і звірку даних автоматизую AI-агентами.Принцип — «Don't trust, verify»: кожна цифра перевірена за першоджерелом, ключові — щонайменше за двома незалежними; прогнози — лише сценарії з умовами. Теза без даних не публікується.