Solar Open 2 на 250 миллиардов параметров: корейская открытая модель, которая работает как маленькая — но требует памяти как большая

20 мин. чтения
Bybit
$30,100 + $5,030
100 USDT в подарок
Получить →

TL;DR

Корейская лаборатория Upstage выложила в открытый доступ Solar Open 2 — модель на 250 миллиардов параметров, из которых при обработке каждого слова работают только 15 миллиардов. Заявленные бенчмарки на уровне лучших открытых моделей, окно контекста в миллион токенов, лицензия разрешает коммерческое использование.

Что важно знать до того, как вы решите её попробовать:

  • Экономия касается вычислений, а не памяти. «15 миллиардов активных» не означает, что модель поместится в маленькую видеокарту: в память надо положить все 250 миллиардов весов. Минимум — 4 ускорителя H200, с квантованием — 2.
  • Русского и украинского в списке поддерживаемых языков нет. Официально заявлены только английский, корейский и японский, а токенизатор специально затачивали под корейский.
  • Все цифры бенчмарков — от самого разработчика. Независимых проверок на 26 июля 2026 года ещё нет.
  • Лицензия не совсем «свободная». Любая модель, дообученная на её основе, обязана носить в названии слово Solar и метку «Built with Solar».
  • На доступном железе она работает медленно. Два независимых замера на паре DGX Spark дают около 15 токенов в секунду — это скорость чтения человека вслух.

Ниже — что внутри, чего она реально стоит и кому подходит.

Словарик: пять терминов, без которых дальше будет сложно

Параметры — числа-настройки внутри модели. Чем их больше, тем больше знаний она способна вместить.

Bybit · Rewards Hubдо $30,100Внеси депозит, торгуй 14 дней — и забери награды в Rewards HubЗабрать бонус →

MoE (Mixture of Experts, «смесь экспертов») — устройство, при котором модель разбита на много небольших подсетей-«экспертов», и на каждое слово включаются только несколько из них. Это как большая справочная библиотека, где на конкретный вопрос отвечают два-три профильных сотрудника, а не весь штат.

Активные параметры — сколько из общего числа реально считается на каждом шаге. У Solar Open 2 это 15 миллиардов из 250.

Контекст — сколько текста модель держит «в голове» за один раз, измеряется в токенах (примерно 3–4 символа каждый).

Квантование — сжатие модели за счёт огрубления чисел: вместо 16 бит на каждый вес пишут 4. Модель худеет в разы, качество проседает слегка.

Что это за модель и откуда взялась

Solar Open 2 выпустила Upstage — корейская компания, которая ведёт государственную программу по созданию собственных базовых моделей Кореи. Это тот случай, когда за релизом стоит не только бизнес, но и политика: страна хочет иметь фронтирную модель, не зависящую от американских и китайских лабораторий, и с сильным родным языком.

Даты релиза в источниках расходятся: официальный блог Upstage датирует запуск 22 июля 2026 года, The Korea Times — 23 июля. Спор решается просто: репозиторий модели на Hugging Face создан 22 июля 2026 года в 02:40 UTC — мы проверили это через API площадки. Вместе с весами опубликован технический отчёт.

Предшественник — Solar Open 1 (102 миллиарда параметров, 12 миллиардов активных) — вышел в январе 2026 года. Прирост между поколениями Upstage измеряет двузначными числами: например, на тесте GPQA-Diamond 66,16 у первой версии против 86,26 у второй.

SpaceX · xStockSpaceX — частная компания. Торгуй её токеном на Bybit за крипту.Торговать SpaceX →

Это второй заметный релиз в рамках корейской программы: параллельно государство финансирует конкурирующие модели ещё нескольких компаний.

Архитектура: как 250 миллиардов работают как 15

Главный инженерный трюк модели — в двух местах сразу.

Первое: смесь экспертов. В модели 320 «маршрутизируемых» экспертов плюс один общий. На каждый токен включаются 8 маршрутизируемых и общий — итого около 15 миллиардов параметров из 250. Для сравнения, у Solar Open 1 экспертов было 128; здесь их число выросло в два с половиной раза.

Второе: гибридное внимание. Внимание — механизм, которым модель решает, на какие части текста смотреть. Обычное («softmax») внимание точное, но его стоимость растёт квадратично: удвоили длину текста — вчетверо выросли затраты. «Линейное» внимание дешевле, но грубее.

Upstage чередует их: один слой обычного внимания на три линейных, и так двенадцать раз по всем 48 слоям. В итоге 12 слоёв (25%) — точные, 36 (75%) — линейные. Память под хранение контекста нужна примерно вчетверо меньше, чем у модели той же формы на одном только обычном внимании.

Третье, самое необычное: позиционного кодирования нет вообще. Обычно модели явно сообщают, какое слово каким по счёту идёт. Здесь этот механизм убрали полностью — относительный порядок несут сами линейные слои. Практическое следствие, о котором пишут авторы отчёта: длина контекста перестаёт быть ограничена тем, на каких длинах модель училась.

Обучали её примерно на 12 триллионах токенов (10 триллионов общего этапа, 1 триллион «интенсивного» и 0,9 триллиона на растягивание контекста) на ускорителях NVIDIA B200. Любопытная деталь из отчёта: 5,69 миллиарда весов — 2,3% модели — перенесены из первой версии, остальное обучено с нуля.

Бенчмарки: что заявлено и как к этому относиться

Сразу главная оговорка: все цифры ниже — из карточки модели и технического отчёта самой Upstage. Независимых замеров на момент публикации нет, и отраслевые издания прямо просят считать эти результаты заявкой вендора, а не установленным фактом. Мы приводим их именно в таком статусе.

ТестЧто меряетSolar Open 2
MMLU-Proширокие академические знания86,2
GPQA-Diamondвопросы уровня аспирантуры86,3
LiveCodeBenchпрограммирование92,4
SWE-Bench Verifiedпочинка реальных багов в репозиториях70,4
HMMT 2602олимпиадная математика93,9
AIME 2026математические соревнования95,7
IFBenchточность следования инструкции80,0
APEX-Agentsработа в роли агента16,6
Terminal Bench Hardзадачи в командной строке28,3

По корейскому языку картина отдельная и для Upstage главная: средний балл 85,4 против 84,9 у DeepSeek-V4-Flash, 80,8 у GPT-5.4 mini и 69,6 у Claude Haiku 4.5. На внутреннем тесте Ko-GDPval (170 рабочих сценариев из 58 профессий) — 86,8 против 86,9 у DeepSeek-V4-Pro, модели в шесть с лишним раз крупнее.

Вот это сравнение и есть сильнейший аргумент релиза: результат уровня модели на 1,6 триллиона параметров при собственных 250 миллиардах.

Где модель проседает — по признанию самих авторов

Хорошая новость для доверия к отчёту: Upstage не прячет слабые места.

Главный провал — Terminal Bench Hard: 28,3 при 34,1–41,7 у фронтирных моделей. Это задачи, где агент работает в командной строке: ставит пакеты, чинит окружение, разбирается с ошибками сборки. То есть ровно та работа, ради которой «агентную» модель и берут.

Авторы отчёта формулируют оставшиеся пробелы так: инженерия уровня репозитория и терминала на английском наборе агентных задач, а также точность мелких чисел в офисных документах.

Отдельно стоит заметить дисбаланс внутри самих цифр: 92,4 на LiveCodeBench (изолированные задачи по программированию) и 28,3 на Terminal Bench Hard — это про разные вещи. Модель хорошо пишет код в вакууме и заметно хуже справляется с грязной реальностью, где надо разбираться с чужим проектом.

Сколько железа нужно на самом деле

Здесь чаще всего и возникает недопонимание. Фраза «всего 15 миллиардов активных» звучит так, будто модель нетребовательна. Это не так.

Считать надо от полного веса, а не от активного. В памяти должны лежать все 250 миллиардов параметров: заранее неизвестно, какие эксперты понадобятся на следующем слове, поэтому все они должны быть под рукой. Активные 15 миллиардов экономят вычисления и электричество, но не видеопамять.

Простой расчёт: 250 миллиардов весов по 2 байта (формат BF16) — это около 500 гигабайт только под веса, плюс память под контекст. Официальная карточка это подтверждает: минимум 4 ускорителя H200, рекомендуется 8.

ВариантВес моделиЧто нужно
BF16 (без сжатия)500,6 ГБминимум 4×H200, рекомендуется 8×H200
NVFP4 (4 бита)153,3 ГБ2×H200 или пара машин класса DGX Spark; только Blackwell
INT4сопоставимо с NVFP4работает шире по поколениям карт
Q4_K_M (оценка агрегаторов)~154,9 ГБрекомендуют от 179 ГБ видеопамяти

Цифры по BF16 и NVFP4 — из карточек Upstage и Nota AI; оценка Q4_K_M — из справочника willitrunai, то есть расчётная, а не измеренная.

Ловушка квантования. Сжатие почти бесплатно по качеству: средний балл падает с 81,57 до 81,35, а на LiveCodeBench даже растёт с 87,03 до 88,55. Но у формата NVFP4 есть жёсткое условие — он опирается на тензорные ядра FP4, появившиеся только в архитектуре Blackwell (B200, GB200). Карты поколений Hopper, Ada и Ampere эту версию не запустят вовсе. Если у вас парк на H100 или A100 — вам нужна версия INT4, а не NVFP4.

Реальная скорость: два независимых замера

Самое ценное, что появилось после релиза, — не пресс-релизы, а замеры энтузиастов на форуме разработчиков NVIDIA. Оба сделаны на паре DGX Spark — компактных машинах на чипе GB10.

Первый замер (24 июля 2026 года, версия NVFP4): веса заняли около 77 ГиБ на узел, 153 ГБ суммарно. Генерация — 15,8 токена в секунду, а на глубине контекста в 32 тысячи токенов — 15,4 токена в секунду, то есть падение всего 2,5%. Чтение запроса идёт куда быстрее генерации: 983 токена в секунду, а на длинном контексте — до 1711. Время до первого слова при коротком запросе — 523–559 миллисекунд.

Второй замер (22 июля 2026 года, версия INT4, та же пара машин): чтение 2227 токенов в секунду, генерация около 14–15 токенов в секунду.

Две независимые проверки сошлись на одном числе — примерно 15 токенов в секунду. Это медленно для диалога (человек читает быстрее, чем модель пишет), но вполне приемлемо для фонового агента, который сам разбирает документы, пока вы заняты другим. Если планируете такой сценарий, стоит заранее посмотреть, что вообще тянет DGX Spark. По деньгам это самый дешёвый вход в модель такого класса: одна такая машина стоит $3 999 (данные на 29 июня 2026 года), то есть пара — около $8 тысяч. Сравните с четырьмя ускорителями H200, где счёт идёт на сотни тысяч долларов, — и станет понятно, почему замеры делают именно на этих коробках.

Ещё одна деталь из замеров, важная для длинного контекста: перевод кэша в формат FP8 увеличил ёмкость с 1,33 до 2,67 миллиона токенов — в десять с лишним раз по вместимости. При этом максимальная длина контекста в конкретном рабочем запуске составила 262 144 токена, а не заявленный миллион. Это не обман со стороны Upstage: миллион — предел архитектуры, а конкретный потолок ставит объём памяти под кэш на вашем железе.

И субъективная оценка от практика, тестировавшего NVFP4: результат на его рабочих задачах «близко, но субъективно не дотягивает» до модели MiMo-V2.5. Одно мнение — не приговор, но это первый независимый голос, и он осторожнее пресс-релиза.

Ловушка copy-paste: официального GGUF не существует

Отдельное предупреждение для тех, кто пойдёт запускать модель по инструкции из справочника.

Сайты-агрегаторы вроде willitrunai выдают готовую команду для llama.cpp, которая скачивает файл Solar-Open2-250B-Q4_K_M.gguf из официального репозитория Upstage. Такого файла там нет. Мы проверили содержимое репозитория через API Hugging Face: 108 файлов, ни одного с расширением .gguf. Официальный репозиторий раздаёт веса в формате safetensors, а четырёхбитные сборки делают сторонние команды — Nota AI (INT4, INT4-GlobalPruned, NVFP4) и отдельные энтузиасты. Команда из справочника завершится ошибкой загрузки.

Рабочие пути на сегодня — vLLM или SGLang с квантованной версией от Nota AI, либо форк Transformers от самой Upstage. Это, к слову, хорошая иллюстрация общего правила: команды с сайтов-каталогов моделей генерируются по шаблону и не всегда проверяются на существование файлов.

Русский и украинский: прямой ответ

Это вопрос, который наши читатели задают первым, и в англоязычных обзорах на него не отвечают вовсе.

Официально модель поддерживает три языка: английский, корейский и японский. Ни русского, ни украинского в списке нет — ни в карточке модели, ни в блоге, ни в техническом отчёте.

Более того, устройство работает против кириллицы. Токенизатор — собственный, байтовый BPE со словарём на 196 608 позиций, и обучали его на корпусе с намеренным перекосом в корейский язык. Результат Upstage приводит с гордостью: на корейском рабочем тексте модель тратит 4,41 байта на токен против 3,54 у лучшей глобальной модели — примерно на 24% эффективнее.

Обратная сторона той же медали: чем сильнее словарь заточен под один язык, тем хуже он дробит остальные. Для языка, который в корпусе не выделяли, тот же текст съест больше токенов — а значит, будет дороже по API, медленнее по генерации и быстрее упрётся в лимит контекста.

Технически модель на кириллице что-то ответит — базовое понимание есть у любой крупной модели, обучавшейся на веб-данных. Но рассчитывать на качество уровня заявленных бенчмарков не стоит: их измеряли на английском, корейском и японском.

Лицензия: где подвох

Формально всё хорошо: Upstage Solar License построена на основе Apache 2.0, коммерческое использование разрешено, дообучение и дистилляция — тоже.

Условия, которые стоит прочитать до того, как строить на модели продукт:

  • производная модель обязана носить префикс Solar в названии;
  • нужно отображать метку «Built with Solar»;
  • копию лицензии требуется включать в поставку.

Для личных экспериментов это ничто. Для компании, которая хочет дообучить модель под себя и продавать её под собственным брендом, — существенное ограничение: имя чужого продукта в названии вашего. Отраслевые аналитики называют это прямо: это не та «апачевская» открытость, которую ожидают юридические отделы, и именно она, вероятно, удержит распространение модели в корейском и японском корпоративном контуре.

Сравните с другими открытыми флагманами: там условия обычно мягче, и это влияет на выбор сильнее, чем разница в пару баллов на бенчмарке.

Риски и ограничения: сводка

  1. Бенчмарки не проверены независимо (на 26 июля 2026 года). Все результаты — от разработчика.
  2. Признанная слабость в терминальных агентных задачах: 28,3 против 34,1–41,7 у фронтира.
  3. Нет поддержки русского и украинского, токенизатор заточен под корейский.
  4. Лицензионные ограничения на производные модели — префикс Solar и обязательная метка.
  5. NVFP4 требует Blackwell; на H100, A100 и потребительских картах прошлых поколений эта версия не заработает.
  6. Заявленный миллион контекста недостижим на обычном железе: реальный запуск упёрся в 262 тысячи токенов.
  7. Высокий порог входа: 153 гигабайта видеопамяти даже в сжатом виде — это не домашний компьютер.

Противовес, чтобы картина была честной: квантование почти не портит качество, длинный контекст работает без заметного замедления (падение 2,5% на 32 тысячах токенов), а результат на корейских офисных задачах при шестикратно меньшем размере, чем у конкурента, — это настоящее инженерное достижение, а не маркетинг.

Кому она нужна, а кому нет

Стоит присмотреться, если вы:

  • работаете с корейским или японским языком — здесь у модели реальное, измеренное преимущество;
  • строите фонового агента для разбора документов, где 15 токенов в секунду достаточно;
  • располагаете серверными ускорителями и хотите модель, которую можно держать полностью у себя;
  • изучаете архитектуры: гибридное внимание без позиционного кодирования — редкий и хорошо задокументированный пример.

Скорее всего, не ваш вариант, если вы:

  • работаете на русском или украинском — посмотрите на модели с заявленной многоязычностью;
  • хотите запустить модель на домашнем компьютере или одной видеокарте — 153 гигабайта не поместятся никуда из доступного;
  • нужен интерактивный диалоговый помощник — скорость не та;
  • планируете дообучить и продавать под своим брендом — упрётесь в лицензию;
  • ждёте, что модель заменит агента в терминале — по собственным цифрам Upstage, это её слабое место.

Как попробовать без своего сервера

Три пути, от простого к сложному:

  1. Playground Upstage — веб-интерфейс на сайте компании. Пробный доступ был открыт до 31 июля 2026 года; проверяйте актуальность условий на момент чтения.
  2. Через API Upstage. Отдельного публичного прайса на Solar Open 2 на момент публикации нет; для ориентира — проприетарная Solar Pro 3 стоит $0,15 за миллион входящих токенов и $0,60 за миллион исходящих (данные на 26 июля 2026 года).
  3. Аренда сервера с нужными ускорителями и развёртывание через vLLM с квантованной версией. Разумный вариант, если нужно проверить модель на своих данных, но покупать железо преждевременно.

FAQ

Можно ли запустить Solar Open 2 на игровой видеокарте? Нет. Даже в четырёхбитном сжатии веса занимают около 153 гигабайт, а самые доступные потребительские карты имеют 24–32 гигабайта. Разница не преодолевается никакими настройками. Минимальный рабочий вариант — два серверных ускорителя H200 или пара специализированных мини-станций.

Правда ли, что модель понимает миллион токенов текста? Архитектура это допускает, и Upstage заявляет такое окно. Но на практике предел ставит память под кэш контекста: в задокументированном запуске на паре DGX Spark максимум составил 262 144 токена. Чтобы получить заявленный миллион, нужно значительно больше видеопамяти.

Насколько сильно квантование портит качество? По данным Nota AI, средний балл по набору тестов падает с 81,57 до 81,35 — разница в пределах погрешности, а на тесте по программированию результат даже вырос. Практический вывод: четырёхбитную версию можно брать без сомнений, если ваше железо её поддерживает.

Чем она отличается от других открытых моделей такого размера? Тремя вещами: гибридным вниманием (три четверти слоёв — линейные), полным отказом от позиционного кодирования и очень низкой долей активных параметров — 15 миллиардов из 250. Плюс тем, что её осознанно затачивали под корейский язык, а не под универсальную многоязычность.

Можно ли использовать её в коммерческом продукте? Да, лицензия это разрешает. Но если вы дообучаете модель и распространяете результат, название обязано начинаться с «Solar», а в продукте должна быть видна метка «Built with Solar». Для внутреннего использования внутри компании ограничение практически незаметно, для собственного брендированного продукта — существенно.

Стоит ли ждать независимых замеров? Да, и это разумно. На 26 июля 2026 года все опубликованные бенчмарки предоставлены самим разработчиком. Первые независимые сигналы уже появились на форуме NVIDIA — они подтверждают заявленную скорость, но по качеству ответов осторожнее пресс-релиза.

Bybit
SpaceX за крипту
Дробные доли · 24/7
Открыть рынок →
Поделиться
Связаться:
Крипто- и data-аналитик, инженер-программист (факультет компьютерных наук ХНУРЭ). В IT с 2008 года: администрировал корпоративный мониторинг в «Vodafone Украина», семь лет разрабатывал и продвигал веб-проекты, пять лет руководил маркетингом на метриках — конверсия, CTR, ROI, LTV.Криптовалютными рынками занимаюсь с 2021 года: ончейн-метрики, токеномика, макроэкономические индикаторы. Разработал собственную data-driven модель анализа рынка на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математическая статистика и EDA; сбор и сверку данных автоматизирую AI-агентами.Принцип — «Don't trust, verify»: каждая цифра проверена по первоисточнику, ключевые — минимум по двум независимым; прогнозы — только сценарии с условиями. Тезис без данных не публикуется.