Qwen3.8-Flash-Next: 6 млрд активных из 125 и обгон DeepSeek-V4-Flash в коде

4 мин. чтения
BYBIT EARN
Крипта лежит?
Bybit Earn: процент капает каждый день
Открыть Earn

Что произошло

26 августа 2026 года команда Qwen (Alibaba) выложила Qwen3.8-Flash-Next — исследовательскую модель, которую сама называет ранним превью архитектуры Qwen4. Это MoE-модель (mixture of experts: сеть разбита на «экспертов», и на каждый токен работает лишь часть из них) на 125 млрд параметров, из которых на токен активны 6 млрд. Веса открыты: Hugging Face, ModelScope, GitHub с техотчётом.

Главное заявление — экономика. По данным Qwen, модель обходит прошлый флагман Qwen3.7-Plus (397 млрд параметров, 17 млрд активных) в коде и офисных задачах, а обучение обошлось примерно в 1/9 его стоимости.

Детали

ПараметрQwen3.8-Flash-Next
Параметры всего / активных125 млрд / 6 млрд (+51 млрд n-gram-эмбеддингов, +4 млрд MTP)
Эксперты512, на токен 10 маршрутизируемых + 1 общий
Слои48: гибрид Gated DeltaNet и Qwen Sparse Attention
Контекст262 144 токена, расширяется до 1 млн
Лицензияqwen-community-1.0
Веса на диске (bf16)около 180 млрд параметров в safetensors
Цена API Qwen3.8-Flash (на 27 августа)$0,15 за 1 млн входных, $0,47 за 1 млн выходных токенов

Необычная часть архитектуры — слой n-gram-эмбеддингов на 51 млрд параметров (таблица готовых представлений для пар и троек токенов). По описанию The Decoder, он рассчитан на работу в обычной оперативной памяти, а не на видеокарте, поэтому в «активные 6 млрд» не входит.

Бенчмарки по данным Qwen (блог и карточка модели): SWE-bench Pro — 62,5 против 56,0 у DeepSeek-V4-Flash и 53,4 у Claude Opus 4.6; CoWorkBench — 73,9 против 45,1 и 68,2; GPQA Diamond — 91,7 против 90,8 и 91,3. Это замеры самого вендора, независимых проверок пока нет — напомним, что DeepSeek V4 Flash в нашем обзоре тоже показывал разрыв между заявленными и живыми результатами.

Продакшен-версия под именем Qwen3.8-Flash уже доступна через QwenCloud с контекстом 1 млн токенов; кэшированный ввод стоит $0,016 за 1 млн токенов (на 27 августа).

Что это значит

Касается это двух групп. Первая — те, кто запускает модели локально. «6 млрд активных» не значит «влезет в 24 ГБ»: в память нужно уместить все 125 млрд плюс n-gram-таблицу. Самая сжатая GGUF-квантизация Unsloth (UD-IQ1_S) весит 72,5 ГБ, разумная UD-IQ4_XS — 93,7 ГБ, UD-Q4_K_XL — 111 ГБ. Это уровень Qwen3 на своём ПК не с одной видеокартой, а с Mac Studio на 128–192 ГБ единой памяти или сервера с большим объёмом RAM. Официальные примеры запуска в vLLM и SGLang рассчитаны на 4 GPU (tensor-parallel 4), поддержка в vLLM на 27 августа ещё в пулл-реквесте.

Вторая группа — разработчики, платящие за API. При $0,15 и $0,47 за миллион токенов модель претендует на роль дешёвой «рабочей лошадки» для агентных и кодовых задач, где счёт идёт на десятки миллионов токенов в день; выигрыш в цене за задачу нужно проверять на своей нагрузке, а не по таблице бенчмарков.

Горизонт — Qwen4: если гибрид линейного внимания и разрежённого MoE с n-gram-слоем действительно даёт такую экономию обучения, следующий флагман Alibaba выйдет на той же схеме. Первые независимые прогоны сообщество уже публикует, в том числе на Mac с M2 Ultra, где скорость генерации без режима рассуждений держится около 20 токенов в секунду — это наводка из соцсетей, а не официальный замер.

BYBIT · СПОТ И ФЬЮЧЕРСЫ
Крипта с нуля
Комиссия 0,1%, торги 24/7, старт с $10
Открыть счёт
Поделиться
Связаться:
Крипто- и data-аналитик, инженер-программист (факультет компьютерных наук ХНУРЭ). В IT с 2008 года: администрировал корпоративный мониторинг в «Vodafone Украина», семь лет разрабатывал и продвигал веб-проекты, пять лет руководил маркетингом на метриках — конверсия, CTR, ROI, LTV.Криптовалютными рынками занимаюсь с 2021 года: ончейн-метрики, токеномика, макроэкономические индикаторы. Разработал собственную data-driven модель анализа рынка на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математическая статистика и EDA; сбор и сверку данных автоматизирую AI-агентами.Принцип — «Don't trust, verify»: каждая цифра проверена по первоисточнику, ключевые — минимум по двум независимым; прогнозы — только сценарии с условиями. Тезис без данных не публикуется.