Що сталося
DeepSeek 10 вересня 2026 року випустила модель DeepSeek-V4.1-Flash. Це суміш експертів (MoE — архітектура, де на кожен запит вмикається лише частина мережі) на 552 млрд параметрів із контекстним вікном на 1 млн токенів. Ваги викладено на Hugging Face під ліцензією MIT, тобто комерційне використання дозволене без окремих умов.
Деталі
Головна інженерна ідея — різко скоротити роботу під час читання довгого вводу. На етапі читання запиту активні близько 8 млрд параметрів, на етапі генерації відповіді — 16 млрд. Кеш ключів і значень стиснуто до 890 байтів на токен, приблизно вчетверо менше, ніж у попередньої V4-Flash.
З цього випливає ціна. За тарифами DeepSeek на дату релізу 1 млн токенів кешованого вводу коштує $0,003 у непікові години і $0,006 у пікові, некешований ввід — $0,15 і $0,30, вивід — $0,60 і $1,20. Піковими вважаються будні з 01:00 до 04:00 і з 06:00 до 10:00 UTC, решта часу дешевша вдвічі.
З бенчмарками картина неоднорідна, і заголовок «обійшла GPT-5.6 Sol і Claude Opus 5» описує її лише частково. На DeepSWE v1.1 у моделі 74,2 проти 74,0 в Opus 5 і 73,0 в GPT-5.6 Sol — різниця в межах похибки. На Terminal-Bench 3.0 у неї 30,0 проти 43,3 в Opus 5, на Terminal-Bench 4.0 — 31,2 проти 51,8. На GPQA Diamond — 90,9.
Що це означає
Стосується це тих, хто ганяє через API довгі повторювані контексти: документацію, кодову базу, великі зводи правил. Саме тут кеш дає основну економію — префікс на 500 тис. токенів, прочитаний сто разів, обходиться приблизно в $0,15 у непікові години проти $15–25 у моделей-конкурентів.
А от «відкрита ліцензія» тут не дорівнює «запущу вдома». 552 млрд параметрів не вміщаються в споживчу пам’ять, скільки б їх не активувалося на запит: мала кількість активних параметрів здешевлює обслуговування на сервері, а не вимоги до заліза. Практичний шлях для приватного користувача — сторонні провайдери, які вже розгортають модель, а не локальний запуск.
Горизонт — найближчі тижні: ціну і якість варто звіряти після того, як модель з’явиться в незалежних провайдерів і обросте замірами поза бенчмарками самого розробника.
Контекст
Попередню версію лінійки ми розбирали окремо — огляд DeepSeek V4 Flash пояснює, за рахунок чого молодша модель обходила старшу Pro. Про те, що з відкритих фронтир-моделей реально запускається на домашньому залізі, — у матеріалі про локальний запуск GLM.


