Коротко (TL;DR)
- 31 липня 2026 року DeepSeek випустила фінальну версію V4 Flash — збірку 0731. API вийшов у публічну бету, ваги виклали на Hugging Face під ліцензією MIT.
- Модель не стала більшою. Архітектура й розмір ті самі, що в квітневого Preview: 284 млрд параметрів усього, 13 млрд активних на токен. Увесь приріст дало перенавчання на етапі post-training.
- Приріст на агентських тестах великий. За вендорською таблицею Terminal-Bench 2.1 — 82,7 проти 72,1 у старшої V4 Pro (Preview), DeepSWE — 54,4 проти 12,8.
- Ціна — головний аргумент. $0,14 за мільйон вхідних токенів, $0,0028 при влученні в кеш і $0,28 за мільйон вихідних. Медіана по зіставному класу моделей — $0,43 і $1,20 відповідно (Artificial Analysis).
- Контекст — 1 млн токенів, межа виводу — 384 тис.
- Головне застереження. Частина опублікованих тестів — внутрішні набори вендора, а прогони йшли на власному harness DeepSeek. За незалежним індексом фактичної точності модель поводиться помітно гірше за флагманів.
Далі — що саме змінилося, звідки взялася друга цифра параметрів, скільки коштує типова агентська сесія, що потрібно для запуску в себе і кому ця модель не підходить.
- Коротко (TL;DR)
- Що вийшло 31 липня
- Скільки в ній параметрів: 284B чи 304B
- Бенчмарки: що опублікував вендор
- Що кажуть незалежні заміри
- Де вона в загальній картині
- Ціни і скільки коштує робота
- Мільйон токенів контексту: що це означає на практиці
- Як спробувати
- Запуск у себе: що реально потрібно
- Що саме дозволяє ліцензія MIT
- DSpark: навіщо модуль у чекпойнті
- Слабкі місця
- Кому підходить, а кому ні
- Що в підсумку
- Часті запитання
Що вийшло 31 липня
DeepSeek перевела V4 Flash із прев’ю в реліз. У журналі змін API формулювання пряме: спосіб виклику не змінюється, достатньо вказати ім’я моделі deepseek-v4-flash — і ви працюєте з новою версією.
Ключова фраза в тій самій документації: збірка 0731 зберігає архітектуру й розмір версії V4-Flash-Preview і була лише заново перенавчена на етапі post-training. Тобто це не «нова модель» у звичному сенсі — це та сама модель, яку інакше донавчили.
Окремо вендор зазначає нативну підтримку формату Responses API та адаптацію під Codex — тобто модель цілеспрямовано готували під агентські сценарії, де вона сама викликає інструменти, а не просто відповідає текстом.
Post-training простими словами — це етап після основного навчання, коли модель уже «знає мову», і її вчать поводитися потрібним чином: дотримуватися інструкцій, користуватися інструментами, не розвалюватися на довгих задачах. Змінюється поведінка, а не обсяг знань.
Скільки в ній параметрів: 284B чи 304B
Це перше, обо що спотикається читач. На картці Hugging Face указано 304 млрд параметрів, а в документації та розборах — 284 млрд. Обидві цифри правильні, і ось чому.
Базова модель — 284 млрд параметрів, з них на кожен токен активується приблизно 13 млрд. Це архітектура MoE (Mixture of Experts, «суміш експертів»): мережа розбита на багато підмереж-експертів, і для кожного токена маршрутизатор вмикає лише кілька з них. За рахунок цього рахувати дешевше, ніж якби працювала вся мережа цілком.
304 млрд — це розмір чекпойнта, який лежить у репозиторії. Разом із базовою моделлю туди спаковано модуль спекулятивного декодування DSpark, і його ваги рахуються разом з рештою. Модель від цього «розумнішою» не стала — просто в одному файлі лежать дві речі.
Практичний висновок: коли плануєте пам’ять під запуск, орієнтуйтеся на те, що завантажили, а не на гарне число зі статті.
Бенчмарки: що опублікував вендор
Таблиця з картки моделі — порівняння збірки 0731 зі старшою V4 Pro у статусі Preview.Тест V4 Flash 0731 V4 Pro (Preview) Перевіряємо ззовні Terminal Bench 2.1 82,7 72,1 так DeepSWE 54,4 12,8 так NL2Repo 54,2 38,5 частково Cybergym 76,7 52,7 частково DSBench-FullStack 68,7 41,8 ні, внутрішній тест
Розрив має ефектний вигляд, і сам вендор формулює це так: 0731 обходить V4 Pro (Preview) за помітно меншої кількості активних параметрів.
Три застереження, без яких таблицю читати не можна.
Перше: DSBench-FullStack і DSBench-Hard — внутрішні набори задач DeepSeek. Їх неможливо відтворити збоку, тому два найпоказовіші рядки перевірці не піддаються. Осмислено порівнювати з іншими моделями можна за Terminal Bench і DeepSWE.
Друге: прогони йшли на власному harness DeepSeek у так званому minimal mode. Harness — це програмна обв’язка навколо моделі: вона збирає системний промпт, розбирає виклики інструментів, керує станом і повторами. Своя обв’язка зазвичай поблажлива до особливостей формату саме своєї моделі. Цифри, отримані на своєму harness, не можна прямо ставити поруч із цифрами, отриманими на чужому стандартному.
Третє: задачі DeepSWE були викладені у відкритий доступ разом із логікою перевірки. Коли структура тестів відома заздалегідь, подальше донавчання може — навмисно чи ні — підлаштуватися під цей розподіл. Це не звинувачення, а причина дивитися на приріст у 4 рази з холодною головою.
Що кажуть незалежні заміри
Artificial Analysis, яка ганяє моделі за власною методикою, ставить V4 Flash 0731 індекс інтелекту 50 — третє місце зі 101 моделі в її вибірці за медіани 25 по зіставному класу. Тобто за сукупною «тямущістю» модель справді нагорі.
Там само є цифра, яка пояснює частину економіки: за один прогін оцінки модель видала 210 млн вихідних токенів. Це багато — модель багатослівна. Для того, хто платить за вихідні токени, це пряма стаття витрат.
Окремий сюжет — фактична точність. Розбір yage.ai, що спирається на індекс AA-Omniscience, наводить за збіркою 0731 частку галюцинацій 84% за точності відповідей 37%; у прев’ю було 96%. Для порівняння там само наводиться порядок 37% у флагманів рівня Claude Sonnet 5. На публічній картці Artificial Analysis окремого рядка з цим числом немає, тому цифру варто тримати в голові як оцінку конкретного розбору, а не як офіційний показник. Сенс її при цьому зрозумілий і без точного значення: модель схильна вигадувати, а не зізнаватися в незнанні.
Де вона в загальній картині
V4 Flash вийшла посеред тижня, коли відкриті моделі викочували одну за одною. За шість днів кінця липня — початку серпня 2026 року з’явилися одразу три релізи з відкритими вагами, і порівняння між ними — найчесніше, що можна зробити, бо всі три перевіряються.Модель Terminal-Bench 2.1 Індекс інтелекту (Artificial Analysis) Ваги DeepSeek V4 Flash 0731 82,7 (вендор) 50 відкриті, MIT Kimi K3 88,3 (вендор) 57 заявлені відкритими, завантажити не можна DeepSeek V4 Pro (Preview) 72,1 (вендор) — не в цьому вигляді
Читати таблицю треба з тим самим застереженням, що й усе інше: усі цифри Terminal-Bench тут вендорські, і кожна модель ганялася у своїй обв’язці. Строгого «за інших рівних» тут немає ні в кого. Незалежна колонка — лише індекс Artificial Analysis, і за ним Kimi K3 попереду.
Зате у V4 Flash є те, чого немає в сусідів по таблиці: ваги реально лежать і реально завантажуються. У Kimi K3 відкритість на момент нашого розбору залишалася заявленою, але не здійсненною. Різниця між «модель відкрита» і «модель у мене на диску» — саме те, що відрізняє V4 Flash від усієї решти таблиці.
Ціни і скільки коштує робота
Офіційний прайс на мільйон токенів:Що Ціна Вхід, промах повз кеш $0,14 Вхід, влучення в кеш $0,0028 Вихід $0,28 Контекст 1 млн токенів Межа виводу 384 тис. токенів
Кеш тут — це коли початок запиту збігається з уже обробленим раніше. В агентських сценаріях так буває постійно: системний промпт і опис інструментів не змінюються від кроку до кроку. Різниця між $0,14 і $0,0028 — майже в п’ятдесят разів, і саме вона робить довгі діалоги дешевими.
Прикинемо типову агентську сесію. Припустимо, агент робить 20 кроків, на кожному надсилає 30 тис. токенів контексту (з них 25 тис. влучають у кеш) і отримує 2 тис. токенів відповіді. Рахуємо: вхід із кешу 20 × 25 000 = 500 тис. токенів по $0,0028 — це $0,0014; вхід повз кеш 20 × 5 000 = 100 тис. по $0,14 — $0,014; вихід 20 × 2 000 = 40 тис. по $0,28 — $0,0112. Разом близько $0,027 за сесію, менше ніж три центи.
Але чесна метрика — не ціна сесії, а ціна прийнятої задачі. Якщо через багатослівність і помилки формату половину результатів доводиться переробляти, реальна вартість подвоюється. Дешевий токен не дорівнює дешевому результату — і це головне, що варто перевірити на своїх задачах, перш ніж переносити на модель продакшн.
Мільйон токенів контексту: що це означає на практиці
Цифра «1M» звучить так, ніби в модель можна залити бібліотеку. На практиці є три обмеження, про які варто знати заздалегідь.
Перше: контекст і вивід рахуються з одного бюджету не скрізь однаково. Не варто виходити з того, що в будь-якому рантаймі вам дадуть мільйон вхідних токенів і зверху ще 384 тисячі вихідних. Як саме вікно ділиться між промптом, історією та відповіддю, залежить від того, через що ви працюєте, — це треба перевіряти у своєму середовищі, а не виводити з рядка в прайсі.
Друге: довгий контекст коштує пам’яті. При локальному запуску KV-кеш (те, де зберігається «пам’ять» про прочитані токени) зростає разом із довжиною діалогу, і він додається до ваг моделі, а не входить у них. Замір на восьми прискорювачах B200 показовий: за повного мільйонного контексту й шести паралельних запитів сумарна швидкість падала приблизно до 182 токенів на секунду. Працювати можна, але це вже не «миттєва відповідь».
Третє: довгий контекст не дорівнює увазі. Здатність прийняти мільйон токенів не означає, що модель однаково добре пам’ятає початок і кінець. Практична порада колишня: подавати не «все підряд», а відібране — і перевіряти на своїх даних, з якої довжини якість починає просідати.
Як спробувати
Три способи, від найшвидшого до найґрунтовнішого.
Через офіційний API. Реєструєтеся на платформі DeepSeek, отримуєте ключ, вказуєте ім’я моделі deepseek-v4-flash. Формат виклику сумісний зі звичним, окремої міграції не потрібно. Це ж найдешевший варіант увійти: кілька центів покривають день експериментів.
Через агрегатор. Модель доступна на OpenRouter і в хмарних платформах на кшталт Baseten. Сенс у тому, що один ключ дає доступ одразу до десятків моделей, і перемикатися між ними можна, не змінюючи код. Ціна буде трохи вища за офіційну — це плата за зручність.
Локально. Завантажуєте квантовану збірку у форматі GGUF і запускаєте у придатному рантаймі. Практичний порядок дій: порахувати доступну пам’ять, вибрати квант, який у неї влізає із запасом на KV-кеш, завантажити, прогнати свій набір перевірочних задач і порівняти з тим самим набором на API. Останній крок пропускають найчастіше — а він і показує, скільки якості з’їв обраний квант.
Запуск у себе: що реально потрібно
Ваги під MIT — це не маркетинг, ліцензія справді дозволяє комерційне використання. Питання лише в залізі.
Головна пастка MoE. Активних параметрів 13 млрд, але в пам’ять потрібно покласти всі 284 млрд. Причина проста: маршрутизатор може вибрати будь-якого з 256 експертів на будь-якому токені, тому тримати в пам’яті «лише потрібних» неможливо. Економія MoE — у швидкості обчислення, а не в обсязі пам’яті.
Орієнтири за розмірами квантованих збірок (дані Unsloth):Квант Розмір Що потрібно 8-біт (близько до оригіналу) ~162 ГБ сервер із великою пам’яттю 3-біт ~103 ГБ машина від ~110 ГБ RAM INT4 (спільнота) близько половини вихідного збірка рівня 4× RTX 4090, із втратою якості
Квантування — це огрублення ваг: числа зберігають із меншою точністю, файл стає меншим, якість трохи падає. Наскільки саме — залежить від рецепта, і «чотири біти» в різних авторів означають різне.
Звідки взялася саме збірка з чотирьох RTX 4090: у кожної такої карти 24 ГБ відеопам’яті, тобто чотири штуки дають 96 ГБ сумарно. Це рівно той поріг, за яким INT4-версія починає вміщатися — але без запасу на KV-кеш, тому довгий контекст на такій конфігурації впиратиметься в пам’ять раніше, ніж у швидкість. Рахувати треба не «чи влізли ваги», а «чи влізли ваги плюс кеш на потрібній вам довжині діалогу».
Для порівняння масштабу: старшій V4 Pro навіть у 4 бітах потрібно близько 430 ГБ, тобто вже кластер. Flash у цьому сенсі — єдина модель свого рівня, яку реально тримати на одній машині. Якщо хочеться потренуватися на чомусь простішому, у нас є розбір локального запуску моделей DeepSeek попереднього покоління — механіка та сама, вимоги скромніші.
Що саме дозволяє ліцензія MIT
Формулювання в репозиторії пряме: репозиторій і ваги моделі поширюються за ліцензією MIT. Це найм’якша з поширених ліцензій, і на практиці вона означає чотири речі.
Можна використовувати комерційно. Жодних порогів за виручкою, кількістю користувачів чи галузями — на відміну від ліцензій, де право користуватися моделлю зникає, щойно бізнес виростає.
Можна донавчати і змінювати. Файнтюн під свою предметну область, дистиляція в модель меншого розміру, будь-які правки — усе дозволено, і результат залишається вашим.
Можна поширювати далі, зокрема всередині свого платного продукту, зберігши текст ліцензії та вказівку авторства.
Немає обов’язку відкривати своє. MIT не «заразна»: вона не вимагає, щоб ваш код чи ваша донавчена версія теж стали відкритими.
Застереження одне, і воно спільне для всіх відкритих моделей: ліцензія поширюється на ваги й код, але не відповідає за те, що модель згенерує. Відповідальність за результат залишається на тому, хто її застосував, — і на тлі високої частки галюцинацій це не формальність.
DSpark: навіщо модуль у чекпойнті
DSpark — це блоковий «чернетник»: окремий маленький модуль передбачає одразу кілька наступних токенів, а основна модель їх перевіряє одним проходом. Якщо вгадав — отримуємо кілька токенів за ціною одного кроку.
Заміри на 8× B200 показують порядок ефекту: без спекулятивного декодування генерація впирається приблизно в 600 токенів на секунду, з DSpark за 16 паралельних запитів піднімається приблизно до 790. За повного контексту в 1 млн токенів і шести паралельних запитів — близько 182 токенів на секунду сумарно.
Важливо розуміти, що DSpark не робить модель розумнішою — він пришвидшує видачу. Точність за ввімкненого пришвидшення збігається зі звичайним режимом у межах похибки прогонів. Докладніше сам механізм ми розбирали в огляді старшої DeepSeek V4 Pro.
Слабкі місця
- Галюцинації. Модель воліє видати відповідь, а не сказати «не знаю». Для довідкових сценаріїв це погано: усе, що вона повідомляє як факт, потрібно перевіряти.
- Багатослівність. Довгі відповіді — це і додаткові гроші за вихідні токени, і більше поверхні для помилки.
- Формат виклику інструментів. На практиці трапляються чотири типові проблеми:
nullу необов’язкових полях, JSON-масив, відданий рядком, масив, загорнутий в один об’єкт, і шляхи до файлів у вигляді Markdown-посилань. Якщо ваш парсер суворий, агент спотикатиметься. - Непрозорість бенчмарків. Частина тестів внутрішні, harness свій, задачі DeepSWE були опубліковані заздалегідь.
- Пам’ять під локальний запуск. 284 млрд параметрів доведеться тримати цілком незалежно від того, скільки активується.
Кому підходить, а кому ні
Підходить, якщо у вас агент або конвеєр, де важливий обсяг роботи і ціна за токен: масова обробка коду, довгі діалоги з повторюваним системним промптом, задачі, де результат усе одно перевіряється тестами чи ревʼю. Підходить, якщо принципово тримати модель у себе — тут у неї у своєму класі майже немає конкурентів.
Не підходить, якщо потрібна фактична надійність без перевірки: довідкові відповіді користувачам, робота з документами, де помилка дорога, будь-які сценарії, де ніхто не перечитує вивід. Не підходить, якщо у вас немає ні бюджету на API, ні машини зі сотнею з лишком гігабайтів пам’яті — «відкриті ваги» в такому разі залишаються теоретичною можливістю.
Що в підсумку
Головний результат цього релізу не в балах. DeepSeek показала, що серйозний стрибок в агентських задачах можна отримати без збільшення моделі — одним перенавчанням. Це змінює очікування: наступний помітний крок не обов’язково коштуватиме чергового порядку обчислень.
Другий результат — ціновий. Модель рівня «вище за середній по класу» з відкритими вагами і ціною втричі нижчою за медіану робить розмову про «дорогий ШІ» менш переконливою. Але перед перенесенням продакшну варто порахувати не ціну токена, а ціну прийнятої задачі — на своїх даних і своєму harness.
Часті запитання
Чим 0731 відрізняється від попередньої V4 Flash Preview? Архітектура й розмір ті самі. Відмінність — у post-training: модель заново донавчили, що підняло агентські метрики й додало підтримку Responses API та адаптацію під Codex.
Чи правда, що Flash обходить старшу Pro? За вендорською таблицею — так, на агентських тестах. Але порівняння йде з версією Pro у статусі Preview, частина тестів внутрішні, і прогони йшли на власному harness DeepSeek. На своїх задачах результат може відрізнятися.
Скільки коштує DeepSeek V4 Flash в API? $0,14 за мільйон вхідних токенів при промаху повз кеш, $0,0028 при влученні і $0,28 за мільйон вихідних. Контекст — 1 млн токенів, межа виводу — 384 тис.
Чи можна запустити DeepSeek V4 Flash локально? Так, ваги відкриті за MIT. Восьмибітна збірка займає близько 162 ГБ, трибітна — близько 103 ГБ і запускається на машині від ~110 ГБ пам’яті. Усі 284 млрд параметрів мають бути в пам’яті цілком.
Що таке DSpark і чи потрібен він мені? Модуль спекулятивного декодування: пришвидшує генерацію, не змінюючи якості. Якщо ви обслуговуєте модель самі — вмикати варто, приріст вимірний. Під час роботи через API він вас не стосується.
Чи варто переходити на неї з платного флагмана? Залежить від сценарію. Для масових агентських задач із перевірюваним результатом економія реальна. Для задач, де відповідь іде користувачу без перевірки, різниця у фактичній точності переважує різницю в ціні.



