DeepSeek V4.1-Flash вийшла з контекстом на 1 млн токенів і кешем по $0,003 за мільйон

3 хв. читання
BINANCE COPY TRADING
Копіюй профі
Binance повторить угоди трейдера за тебе
Почати

Що сталося

DeepSeek 10 вересня 2026 року випустила модель DeepSeek-V4.1-Flash. Це суміш експертів (MoE — архітектура, де на кожен запит вмикається лише частина мережі) на 552 млрд параметрів із контекстним вікном на 1 млн токенів. Ваги викладено на Hugging Face під ліцензією MIT, тобто комерційне використання дозволене без окремих умов.

Деталі

Головна інженерна ідея — різко скоротити роботу під час читання довгого вводу. На етапі читання запиту активні близько 8 млрд параметрів, на етапі генерації відповіді — 16 млрд. Кеш ключів і значень стиснуто до 890 байтів на токен, приблизно вчетверо менше, ніж у попередньої V4-Flash.

З цього випливає ціна. За тарифами DeepSeek на дату релізу 1 млн токенів кешованого вводу коштує $0,003 у непікові години і $0,006 у пікові, некешований ввід — $0,15 і $0,30, вивід — $0,60 і $1,20. Піковими вважаються будні з 01:00 до 04:00 і з 06:00 до 10:00 UTC, решта часу дешевша вдвічі.

З бенчмарками картина неоднорідна, і заголовок «обійшла GPT-5.6 Sol і Claude Opus 5» описує її лише частково. На DeepSWE v1.1 у моделі 74,2 проти 74,0 в Opus 5 і 73,0 в GPT-5.6 Sol — різниця в межах похибки. На Terminal-Bench 3.0 у неї 30,0 проти 43,3 в Opus 5, на Terminal-Bench 4.0 — 31,2 проти 51,8. На GPQA Diamond — 90,9.

Що це означає

Стосується це тих, хто ганяє через API довгі повторювані контексти: документацію, кодову базу, великі зводи правил. Саме тут кеш дає основну економію — префікс на 500 тис. токенів, прочитаний сто разів, обходиться приблизно в $0,15 у непікові години проти $15–25 у моделей-конкурентів.

А от «відкрита ліцензія» тут не дорівнює «запущу вдома». 552 млрд параметрів не вміщаються в споживчу пам’ять, скільки б їх не активувалося на запит: мала кількість активних параметрів здешевлює обслуговування на сервері, а не вимоги до заліза. Практичний шлях для приватного користувача — сторонні провайдери, які вже розгортають модель, а не локальний запуск.

Горизонт — найближчі тижні: ціну і якість варто звіряти після того, як модель з’явиться в незалежних провайдерів і обросте замірами поза бенчмарками самого розробника.

Контекст

Попередню версію лінійки ми розбирали окремо — огляд DeepSeek V4 Flash пояснює, за рахунок чого молодша модель обходила старшу Pro. Про те, що з відкритих фронтир-моделей реально запускається на домашньому залізі, — у матеріалі про локальний запуск GLM.

BINANCE · СПОТ І ДЕРИВАТИВИ
Крипта з нуля
Комісія 0,1%, торги 24/7, старт з $10
Відкрити рахунок
Поділитися
Зв'язатися:
Крипто- та data-аналітик, інженер-програміст (факультет комп'ютерних наук ХНУРЕ). В IT з 2008 року: адміністрував корпоративний моніторинг у «Vodafone Україна», сім років розробляв і просував веб-проєкти, п'ять років керував маркетингом на метриках — конверсія, CTR, ROI, LTV.Криптовалютними ринками займаюся з 2021 року: ончейн-метрики, токеноміка, макроекономічні індикатори. Розробив власну data-driven модель аналізу ринку на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математична статистика та EDA; збір і звірку даних автоматизую AI-агентами.Принцип — «Don't trust, verify»: кожна цифра перевірена за першоджерелом, ключові — щонайменше за двома незалежними; прогнози — лише сценарії з умовами. Теза без даних не публікується.