Qwen3.8-Flash-Next: 6 млрд активних із 125 і перевага над DeepSeek-V4-Flash у коді

4 хв. читання
BINANCE COPY TRADING
Копіюй профі
Binance повторить угоди трейдера за тебе
Почати

Що сталося

26 серпня 2026 року команда Qwen (Alibaba) виклала Qwen3.8-Flash-Next — дослідницьку модель, яку сама називає раннім прев’ю архітектури Qwen4. Це MoE-модель (mixture of experts: мережа поділена на «експертів», і на кожен токен працює лише частина з них) на 125 млрд параметрів, з яких на токен активні 6 млрд. Ваги відкриті: Hugging Face, ModelScope, GitHub із технічним звітом.

Головна заява — про економіку. За даними Qwen, модель випереджає попередній флагман Qwen3.7-Plus (397 млрд параметрів, 17 млрд активних) у коді та офісних завданнях, а навчання коштувало приблизно 1/9 від його вартості.

Деталі

ПараметрQwen3.8-Flash-Next
Параметрів усього / активних125 млрд / 6 млрд (+51 млрд n-gram-ембедингів, +4 млрд MTP)
Експерти512, на токен 10 маршрутизованих + 1 спільний
Шари48: гібрид Gated DeltaNet і Qwen Sparse Attention
Контекст262 144 токени, розширюється до 1 млн
Ліцензіяqwen-community-1.0
Ваги на диску (bf16)близько 180 млрд параметрів у safetensors
Ціна API Qwen3.8-Flash (на 27 серпня)$0,15 за 1 млн вхідних, $0,47 за 1 млн вихідних токенів

Незвична частина архітектури — шар n-gram-ембедингів на 51 млрд параметрів (таблиця готових представлень для пар і трійок токенів). За описом The Decoder, він розрахований на роботу у звичайній оперативній пам’яті, а не на відеокарті, тому до «активних 6 млрд» не входить.

Бенчмарки за даними Qwen (блог і картка моделі): SWE-bench Pro — 62,5 проти 56,0 у DeepSeek-V4-Flash і 53,4 у Claude Opus 4.6; CoWorkBench — 73,9 проти 45,1 і 68,2; GPQA Diamond — 91,7 проти 90,8 і 91,3. Це заміри самого вендора, незалежних перевірок поки немає — нагадаємо, що DeepSeek V4 Flash у нашому огляді теж показував розрив між заявленими й живими результатами.

Продакшен-версія під назвою Qwen3.8-Flash уже доступна через QwenCloud із контекстом 1 млн токенів; кешований ввід коштує $0,016 за 1 млн токенів (на 27 серпня).

Що це означає

Стосується це двох груп. Перша — ті, хто запускає моделі локально. «6 млрд активних» не означає «вміститься у 24 ГБ»: у пам’ять треба покласти всі 125 млрд плюс n-gram-таблицю. Найстисліша GGUF-квантизація Unsloth (UD-IQ1_S) важить 72,5 ГБ, розумна UD-IQ4_XS — 93,7 ГБ, UD-Q4_K_XL — 111 ГБ. Це рівень Qwen3 на власному ПК не з однією відеокартою, а з Mac Studio на 128–192 ГБ єдиної пам’яті або сервера з великим обсягом RAM. Офіційні приклади запуску у vLLM і SGLang розраховані на 4 GPU (tensor-parallel 4), підтримка у vLLM на 27 серпня ще в пул-реквесті.

Друга група — розробники, які платять за API. За $0,15 і $0,47 за мільйон токенів модель претендує на роль дешевої «робочої конячки» для агентних і кодових завдань, де рахунок іде на десятки мільйонів токенів на день; виграш у ціні за завдання варто перевіряти на власному навантаженні, а не за таблицею бенчмарків.

Горизонт — Qwen4: якщо гібрид лінійної уваги та розрідженого MoE з n-gram-шаром справді дає таку економію навчання, наступний флагман Alibaba вийде за тією самою схемою. Перші незалежні прогони спільнота вже публікує, зокрема на Mac з M2 Ultra, де швидкість генерації без режиму міркувань тримається близько 20 токенів за секунду — це наводка із соцмереж, а не офіційний замір.

BINANCE SIMPLE EARN
Крипта лежить?
Simple Earn: відсоток нараховується щодня
Відкрити Earn
Поділитися
Зв'язатися:
Крипто- та data-аналітик, інженер-програміст (факультет комп'ютерних наук ХНУРЕ). В IT з 2008 року: адміністрував корпоративний моніторинг у «Vodafone Україна», сім років розробляв і просував веб-проєкти, п'ять років керував маркетингом на метриках — конверсія, CTR, ROI, LTV.Криптовалютними ринками займаюся з 2021 року: ончейн-метрики, токеноміка, макроекономічні індикатори. Розробив власну data-driven модель аналізу ринку на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математична статистика та EDA; збір і звірку даних автоматизую AI-агентами.Принцип — «Don't trust, verify»: кожна цифра перевірена за першоджерелом, ключові — щонайменше за двома незалежними; прогнози — лише сценарії з умовами. Теза без даних не публікується.