Что произошло
26 августа 2026 года команда Qwen (Alibaba) выложила Qwen3.8-Flash-Next — исследовательскую модель, которую сама называет ранним превью архитектуры Qwen4. Это MoE-модель (mixture of experts: сеть разбита на «экспертов», и на каждый токен работает лишь часть из них) на 125 млрд параметров, из которых на токен активны 6 млрд. Веса открыты: Hugging Face, ModelScope, GitHub с техотчётом.
Главное заявление — экономика. По данным Qwen, модель обходит прошлый флагман Qwen3.7-Plus (397 млрд параметров, 17 млрд активных) в коде и офисных задачах, а обучение обошлось примерно в 1/9 его стоимости.
Детали
| Параметр | Qwen3.8-Flash-Next |
|---|---|
| Параметры всего / активных | 125 млрд / 6 млрд (+51 млрд n-gram-эмбеддингов, +4 млрд MTP) |
| Эксперты | 512, на токен 10 маршрутизируемых + 1 общий |
| Слои | 48: гибрид Gated DeltaNet и Qwen Sparse Attention |
| Контекст | 262 144 токена, расширяется до 1 млн |
| Лицензия | qwen-community-1.0 |
| Веса на диске (bf16) | около 180 млрд параметров в safetensors |
| Цена API Qwen3.8-Flash (на 27 августа) | $0,15 за 1 млн входных, $0,47 за 1 млн выходных токенов |
Необычная часть архитектуры — слой n-gram-эмбеддингов на 51 млрд параметров (таблица готовых представлений для пар и троек токенов). По описанию The Decoder, он рассчитан на работу в обычной оперативной памяти, а не на видеокарте, поэтому в «активные 6 млрд» не входит.
Бенчмарки по данным Qwen (блог и карточка модели): SWE-bench Pro — 62,5 против 56,0 у DeepSeek-V4-Flash и 53,4 у Claude Opus 4.6; CoWorkBench — 73,9 против 45,1 и 68,2; GPQA Diamond — 91,7 против 90,8 и 91,3. Это замеры самого вендора, независимых проверок пока нет — напомним, что DeepSeek V4 Flash в нашем обзоре тоже показывал разрыв между заявленными и живыми результатами.
Продакшен-версия под именем Qwen3.8-Flash уже доступна через QwenCloud с контекстом 1 млн токенов; кэшированный ввод стоит $0,016 за 1 млн токенов (на 27 августа).
Что это значит
Касается это двух групп. Первая — те, кто запускает модели локально. «6 млрд активных» не значит «влезет в 24 ГБ»: в память нужно уместить все 125 млрд плюс n-gram-таблицу. Самая сжатая GGUF-квантизация Unsloth (UD-IQ1_S) весит 72,5 ГБ, разумная UD-IQ4_XS — 93,7 ГБ, UD-Q4_K_XL — 111 ГБ. Это уровень Qwen3 на своём ПК не с одной видеокартой, а с Mac Studio на 128–192 ГБ единой памяти или сервера с большим объёмом RAM. Официальные примеры запуска в vLLM и SGLang рассчитаны на 4 GPU (tensor-parallel 4), поддержка в vLLM на 27 августа ещё в пулл-реквесте.
Вторая группа — разработчики, платящие за API. При $0,15 и $0,47 за миллион токенов модель претендует на роль дешёвой «рабочей лошадки» для агентных и кодовых задач, где счёт идёт на десятки миллионов токенов в день; выигрыш в цене за задачу нужно проверять на своей нагрузке, а не по таблице бенчмарков.
Горизонт — Qwen4: если гибрид линейного внимания и разрежённого MoE с n-gram-слоем действительно даёт такую экономию обучения, следующий флагман Alibaba выйдет на той же схеме. Первые независимые прогоны сообщество уже публикует, в том числе на Mac с M2 Ultra, где скорость генерации без режима рассуждений держится около 20 токенов в секунду — это наводка из соцсетей, а не официальный замер.


