Що сталося
26 серпня 2026 року команда Qwen (Alibaba) виклала Qwen3.8-Flash-Next — дослідницьку модель, яку сама називає раннім прев’ю архітектури Qwen4. Це MoE-модель (mixture of experts: мережа поділена на «експертів», і на кожен токен працює лише частина з них) на 125 млрд параметрів, з яких на токен активні 6 млрд. Ваги відкриті: Hugging Face, ModelScope, GitHub із технічним звітом.
Головна заява — про економіку. За даними Qwen, модель випереджає попередній флагман Qwen3.7-Plus (397 млрд параметрів, 17 млрд активних) у коді та офісних завданнях, а навчання коштувало приблизно 1/9 від його вартості.
Деталі
| Параметр | Qwen3.8-Flash-Next |
|---|---|
| Параметрів усього / активних | 125 млрд / 6 млрд (+51 млрд n-gram-ембедингів, +4 млрд MTP) |
| Експерти | 512, на токен 10 маршрутизованих + 1 спільний |
| Шари | 48: гібрид Gated DeltaNet і Qwen Sparse Attention |
| Контекст | 262 144 токени, розширюється до 1 млн |
| Ліцензія | qwen-community-1.0 |
| Ваги на диску (bf16) | близько 180 млрд параметрів у safetensors |
| Ціна API Qwen3.8-Flash (на 27 серпня) | $0,15 за 1 млн вхідних, $0,47 за 1 млн вихідних токенів |
Незвична частина архітектури — шар n-gram-ембедингів на 51 млрд параметрів (таблиця готових представлень для пар і трійок токенів). За описом The Decoder, він розрахований на роботу у звичайній оперативній пам’яті, а не на відеокарті, тому до «активних 6 млрд» не входить.
Бенчмарки за даними Qwen (блог і картка моделі): SWE-bench Pro — 62,5 проти 56,0 у DeepSeek-V4-Flash і 53,4 у Claude Opus 4.6; CoWorkBench — 73,9 проти 45,1 і 68,2; GPQA Diamond — 91,7 проти 90,8 і 91,3. Це заміри самого вендора, незалежних перевірок поки немає — нагадаємо, що DeepSeek V4 Flash у нашому огляді теж показував розрив між заявленими й живими результатами.
Продакшен-версія під назвою Qwen3.8-Flash уже доступна через QwenCloud із контекстом 1 млн токенів; кешований ввід коштує $0,016 за 1 млн токенів (на 27 серпня).
Що це означає
Стосується це двох груп. Перша — ті, хто запускає моделі локально. «6 млрд активних» не означає «вміститься у 24 ГБ»: у пам’ять треба покласти всі 125 млрд плюс n-gram-таблицю. Найстисліша GGUF-квантизація Unsloth (UD-IQ1_S) важить 72,5 ГБ, розумна UD-IQ4_XS — 93,7 ГБ, UD-Q4_K_XL — 111 ГБ. Це рівень Qwen3 на власному ПК не з однією відеокартою, а з Mac Studio на 128–192 ГБ єдиної пам’яті або сервера з великим обсягом RAM. Офіційні приклади запуску у vLLM і SGLang розраховані на 4 GPU (tensor-parallel 4), підтримка у vLLM на 27 серпня ще в пул-реквесті.
Друга група — розробники, які платять за API. За $0,15 і $0,47 за мільйон токенів модель претендує на роль дешевої «робочої конячки» для агентних і кодових завдань, де рахунок іде на десятки мільйонів токенів на день; виграш у ціні за завдання варто перевіряти на власному навантаженні, а не за таблицею бенчмарків.
Горизонт — Qwen4: якщо гібрид лінійної уваги та розрідженого MoE з n-gram-шаром справді дає таку економію навчання, наступний флагман Alibaba вийде за тією самою схемою. Перші незалежні прогони спільнота вже публікує, зокрема на Mac з M2 Ultra, де швидкість генерації без режиму міркувань тримається близько 20 токенів за секунду — це наводка із соцмереж, а не офіційний замір.



