TL;DR
Корейська лабораторія Upstage виклала у відкритий доступ Solar Open 2 — модель на 250 мільярдів параметрів, з яких під час обробки кожного слова працюють лише 15 мільярдів. Заявлені бенчмарки на рівні найкращих відкритих моделей, вікно контексту в мільйон токенів, ліцензія дозволяє комерційне використання.
- TL;DR
- Словничок: п’ять термінів, без яких далі буде складно
- Що це за модель і звідки взялася
- Архітектура: як 250 мільярдів працюють як 15
- Бенчмарки: що заявлено і як до цього ставитися
- Де модель просідає — за визнанням самих авторів
- Скільки заліза потрібно насправді
- Реальна швидкість: два незалежні заміри
- Пастка copy-paste: офіційного GGUF не існує
- Українська та російська: пряма відповідь
- Ліцензія: де підступ
- Ризики та обмеження: зведення
- Кому вона потрібна, а кому ні
- Як спробувати без свого сервера
- FAQ
Що варто знати до того, як ви вирішите її спробувати:
- Економія стосується обчислень, а не пам’яті. «15 мільярдів активних» не означає, що модель поміститься в маленьку відеокарту: у пам’ять треба покласти всі 250 мільярдів ваг. Мінімум — 4 прискорювачі H200, з квантуванням — 2.
- Української та російської у списку підтримуваних мов немає. Офіційно заявлені лише англійська, корейська та японська, а токенізатор спеціально загострювали під корейську.
- Усі цифри бенчмарків — від самого розробника. Незалежних перевірок станом на 26 липня 2026 року ще немає.
- Ліцензія не зовсім «вільна». Будь-яка модель, донавчена на її основі, зобов’язана мати в назві слово Solar і позначку «Built with Solar».
- На доступному залізі вона працює повільно. Два незалежні заміри на парі DGX Spark дають близько 15 токенів на секунду — це швидкість читання людини вголос.
Нижче — що всередині, чого вона реально варта і кому підходить.
Словничок: п’ять термінів, без яких далі буде складно
Параметри — числа-налаштування всередині моделі. Що їх більше, то більше знань вона здатна вмістити.
MoE (Mixture of Experts, «суміш експертів») — будова, за якої модель розбита на багато невеликих підмереж-«експертів», і на кожне слово вмикаються лише кілька з них. Це як велика довідкова бібліотека, де на конкретне питання відповідають два-три профільні співробітники, а не весь штат.
Активні параметри — скільки із загального числа реально обчислюється на кожному кроці. У Solar Open 2 це 15 мільярдів із 250.
Контекст — скільки тексту модель тримає «в голові» за один раз, вимірюється в токенах (приблизно 3–4 символи кожен).
Квантування — стиснення моделі через огрублення чисел: замість 16 біт на кожну вагу пишуть 4. Модель худне в рази, якість просідає злегка.
Що це за модель і звідки взялася
Solar Open 2 випустила Upstage — корейська компанія, яка веде державну програму зі створення власних базових моделей Кореї. Це той випадок, коли за релізом стоїть не лише бізнес, а й політика: країна хоче мати фронтирну модель, незалежну від американських і китайських лабораторій, із сильною рідною мовою.
Дати релізу в джерелах розходяться: офіційний блог Upstage датує запуск 22 липня 2026 року, The Korea Times — 23 липня. Суперечка розв’язується просто: репозиторій моделі на Hugging Face створено 22 липня 2026 року о 02:40 UTC — ми перевірили це через API майданчика. Разом із вагами опубліковано технічний звіт.
Попередник — Solar Open 1 (102 мільярди параметрів, 12 мільярдів активних) — вийшов у січні 2026 року. Приріст між поколіннями Upstage вимірює двозначними числами: наприклад, на тесті GPQA-Diamond 66,16 у першої версії проти 86,26 у другої.
Це другий помітний реліз у межах корейської програми: паралельно держава фінансує конкурентні моделі ще кількох компаній.
Архітектура: як 250 мільярдів працюють як 15
Головний інженерний трюк моделі — у двох місцях одразу.
Перше: суміш експертів. У моделі 320 «маршрутизованих» експертів плюс один спільний. На кожен токен вмикаються 8 маршрутизованих і спільний — разом близько 15 мільярдів параметрів із 250. Для порівняння, у Solar Open 1 експертів було 128; тут їхня кількість зросла у два з половиною раза.
Друге: гібридна увага. Увага — механізм, яким модель вирішує, на які частини тексту дивитися. Звичайна («softmax») увага точна, але її вартість зростає квадратично: подвоїли довжину тексту — вчетверо зросли витрати. «Лінійна» увага дешевша, але грубіша.
Upstage чергує їх: один шар звичайної уваги на три лінійні, і так дванадцять разів по всіх 48 шарах. У підсумку 12 шарів (25%) — точні, 36 (75%) — лінійні. Пам’яті під зберігання контексту потрібно приблизно вчетверо менше, ніж у моделі тієї самої форми на самій лише звичайній увазі.
Третє, найнезвичніше: позиційного кодування немає взагалі. Зазвичай моделі явно повідомляють, яке слово яким за рахунком іде. Тут цей механізм прибрали повністю — відносний порядок несуть самі лінійні шари. Практичний наслідок, про який пишуть автори звіту: довжина контексту перестає бути обмеженою тим, на яких довжинах модель навчалася.
Навчали її приблизно на 12 трильйонах токенів (10 трильйонів загального етапу, 1 трильйон «інтенсивного» і 0,9 трильйона на розтягування контексту) на прискорювачах NVIDIA B200. Цікава деталь зі звіту: 5,69 мільярда ваг — 2,3% моделі — перенесені з першої версії, решту навчено з нуля.
Бенчмарки: що заявлено і як до цього ставитися
Одразу головне застереження: усі цифри нижче — з картки моделі та технічного звіту самої Upstage. Незалежних замірів на момент публікації немає, і галузеві видання прямо просять вважати ці результати заявкою вендора, а не встановленим фактом. Ми наводимо їх саме в такому статусі.Тест Що міряє Solar Open 2 MMLU-Pro широкі академічні знання 86,2 GPQA-Diamond питання рівня аспірантури 86,3 LiveCodeBench програмування 92,4 SWE-Bench Verified лагодження реальних багів у репозиторіях 70,4 HMMT 2602 олімпіадна математика 93,9 AIME 2026 математичні змагання 95,7 IFBench точність дотримання інструкції 80,0 APEX-Agents робота в ролі агента 16,6 Terminal Bench Hard завдання в командному рядку 28,3
За корейською мовою картина окрема і для Upstage головна: середній бал 85,4 проти 84,9 у DeepSeek-V4-Flash, 80,8 у GPT-5.4 mini і 69,6 у Claude Haiku 4.5. На внутрішньому тесті Ko-GDPval (170 робочих сценаріїв із 58 професій) — 86,8 проти 86,9 у DeepSeek-V4-Pro, моделі в шість із гаком разів більшої.
Ось це порівняння і є найсильнішим аргументом релізу: результат рівня моделі на 1,6 трильйона параметрів за власних 250 мільярдів.
Де модель просідає — за визнанням самих авторів
Добра новина для довіри до звіту: Upstage не ховає слабких місць.
Головний провал — Terminal Bench Hard: 28,3 за 34,1–41,7 у фронтирних моделей. Це завдання, де агент працює в командному рядку: ставить пакети, лагодить оточення, розбирається з помилками збірки. Тобто рівно та робота, заради якої «агентну» модель і беруть.
Автори звіту формулюють залишкові прогалини так: інженерія рівня репозиторію і термінала на англійському наборі агентних завдань, а також точність дрібних чисел в офісних документах.
Окремо варто зауважити дисбаланс усередині самих цифр: 92,4 на LiveCodeBench (ізольовані завдання з програмування) і 28,3 на Terminal Bench Hard — це про різні речі. Модель добре пише код у вакуумі й помітно гірше дає раду брудній реальності, де треба розбиратися з чужим проєктом.
Скільки заліза потрібно насправді
Тут найчастіше й виникає непорозуміння. Фраза «лише 15 мільярдів активних» звучить так, ніби модель невибаглива. Це не так.
Рахувати треба від повної ваги, а не від активної. У пам’яті мають лежати всі 250 мільярдів параметрів: заздалегідь невідомо, які експерти знадобляться на наступному слові, тому всі вони мають бути під рукою. Активні 15 мільярдів заощаджують обчислення та електрику, але не відеопам’ять.
Простий розрахунок: 250 мільярдів ваг по 2 байти (формат BF16) — це близько 500 гігабайтів лише під ваги, плюс пам’ять під контекст. Офіційна картка це підтверджує: мінімум 4 прискорювачі H200, рекомендовано 8.Варіант Вага моделі Що потрібно BF16 (без стиснення) 500,6 ГБ мінімум 4×H200, рекомендовано 8×H200 NVFP4 (4 біти) 153,3 ГБ 2×H200 або пара машин класу DGX Spark; лише Blackwell INT4 зіставно з NVFP4 працює ширше за поколіннями карт Q4_K_M (оцінка агрегаторів) ~154,9 ГБ рекомендують від 179 ГБ відеопам’яті
Цифри щодо BF16 і NVFP4 — з карток Upstage і Nota AI; оцінка Q4_K_M — з довідника willitrunai, тобто розрахункова, а не виміряна.
Пастка квантування. Стиснення майже безкоштовне за якістю: середній бал падає з 81,57 до 81,35, а на LiveCodeBench навіть зростає з 87,03 до 88,55. Але у формату NVFP4 є жорстка умова — він спирається на тензорні ядра FP4, що з’явилися лише в архітектурі Blackwell (B200, GB200). Карти поколінь Hopper, Ada та Ampere цю версію не запустять узагалі. Якщо у вас парк на H100 чи A100 — вам потрібна версія INT4, а не NVFP4.
Реальна швидкість: два незалежні заміри
Найцінніше, що з’явилося після релізу, — не пресрелізи, а заміри ентузіастів на форумі розробників NVIDIA. Обидва зроблені на парі DGX Spark — компактних машинах на чипі GB10.
Перший замір (24 липня 2026 року, версія NVFP4): ваги зайняли близько 77 ГіБ на вузол, 153 ГБ сумарно. Генерація — 15,8 токена на секунду, а на глибині контексту в 32 тисячі токенів — 15,4 токена на секунду, тобто падіння лише 2,5%. Читання запиту йде значно швидше за генерацію: 983 токени на секунду, а на довгому контексті — до 1711. Час до першого слова за короткого запиту — 523–559 мілісекунд.
Другий замір (22 липня 2026 року, версія INT4, та сама пара машин): читання 2227 токенів на секунду, генерація близько 14–15 токенів на секунду.
Дві незалежні перевірки зійшлися на одному числі — приблизно 15 токенів на секунду. Це повільно для діалогу (людина читає швидше, ніж модель пише), але цілком прийнятно для фонового агента, який сам розбирає документи, поки ви зайняті іншим. Якщо плануєте такий сценарій, варто заздалегідь подивитися, що взагалі тягне DGX Spark. За грошима це найдешевший вхід у модель такого класу: одна така машина коштує $3 999 (дані на 29 червня 2026 року), тобто пара — близько $8 тисяч. Порівняйте з чотирма прискорювачами H200, де рахунок іде на сотні тисяч доларів, — і стане зрозуміло, чому заміри роблять саме на цих коробках.
Ще одна деталь із замірів, важлива для довгого контексту: переведення кешу у формат FP8 збільшило місткість з 1,33 до 2,67 мільйона токенів — у десять із гаком разів за вмістимістю. Водночас максимальна довжина контексту в конкретному робочому запуску становила 262 144 токени, а не заявлений мільйон. Це не обман з боку Upstage: мільйон — межа архітектури, а конкретну стелю ставить обсяг пам’яті під кеш на вашому залізі.
І суб’єктивна оцінка від практика, що тестував NVFP4: результат на його робочих завданнях «близько, але суб’єктивно не дотягує» до моделі MiMo-V2.5. Одна думка — не вирок, але це перший незалежний голос, і він обережніший за пресреліз.
Пастка copy-paste: офіційного GGUF не існує
Окреме попередження для тих, хто піде запускати модель за інструкцією з довідника.
Сайти-агрегатори на кшталт willitrunai видають готову команду для llama.cpp, яка завантажує файл Solar-Open2-250B-Q4_K_M.gguf з офіційного репозиторію Upstage. Такого файлу там немає. Ми перевірили вміст репозиторію через API Hugging Face: 108 файлів, жодного з розширенням .gguf. Офіційний репозиторій роздає ваги у форматі safetensors, а чотирибітні збірки роблять сторонні команди — Nota AI (INT4, INT4-GlobalPruned, NVFP4) та окремі ентузіасти. Команда з довідника завершиться помилкою завантаження.
Робочі шляхи на сьогодні — vLLM або SGLang з квантованою версією від Nota AI, або форк Transformers від самої Upstage. Це, до речі, добра ілюстрація загального правила: команди із сайтів-каталогів моделей генеруються за шаблоном і не завжди перевіряються на існування файлів.
Українська та російська: пряма відповідь
Це питання, яке наші читачі ставлять першим, і в англомовних оглядах на нього не відповідають зовсім.
Офіційно модель підтримує три мови: англійську, корейську та японську. Ані української, ані російської в переліку немає — ні в картці моделі, ні в блозі, ні в технічному звіті.
Ба більше, будова працює проти кирилиці. Токенізатор — власний, байтовий BPE зі словником на 196 608 позицій, і навчали його на корпусі з навмисним перекосом у корейську мову. Результат Upstage наводить із гордістю: на корейському робочому тексті модель витрачає 4,41 байта на токен проти 3,54 у найкращої глобальної моделі — приблизно на 24% ефективніше.
Зворотний бік тієї самої медалі: що сильніше словник загострений під одну мову, то гірше він дробить решту. Для мови, яку в корпусі не виділяли, той самий текст з’їсть більше токенів — а отже, буде дорожчим за API, повільнішим за генерацією і швидше впреться в ліміт контексту.
Технічно модель кирилицею щось відповість — базове розуміння є в будь-якої великої моделі, що навчалася на вебданих. Але розраховувати на якість рівня заявлених бенчмарків не варто: їх міряли англійською, корейською та японською.
Ліцензія: де підступ
Формально все добре: Upstage Solar License побудована на основі Apache 2.0, комерційне використання дозволене, донавчання та дистиляція — теж.
Умови, які варто прочитати до того, як будувати на моделі продукт:
- похідна модель зобов’язана мати префікс Solar у назві;
- потрібно відображати позначку «Built with Solar»;
- копію ліцензії треба включати в постачання.
Для особистих експериментів це ніщо. Для компанії, яка хоче донавчити модель під себе і продавати її під власним брендом, — суттєве обмеження: ім’я чужого продукту в назві вашого. Галузеві аналітики називають це прямо: це не та «апачівська» відкритість, якої очікують юридичні відділи, і саме вона, ймовірно, втримає поширення моделі в корейському та японському корпоративному контурі.
Порівняйте з іншими відкритими флагманами: там умови зазвичай м’якші, і це впливає на вибір сильніше, ніж різниця в пару балів на бенчмарку.
Ризики та обмеження: зведення
- Бенчмарки не перевірені незалежно (станом на 26 липня 2026 року). Усі результати — від розробника.
- Визнана слабкість у термінальних агентних завданнях: 28,3 проти 34,1–41,7 у фронтира.
- Немає підтримки української та російської, токенізатор загострений під корейську.
- Ліцензійні обмеження на похідні моделі — префікс Solar і обов’язкова позначка.
- NVFP4 потребує Blackwell; на H100, A100 і споживчих картах минулих поколінь ця версія не запрацює.
- Заявлений мільйон контексту недосяжний на звичайному залізі: реальний запуск упрівся в 262 тисячі токенів.
- Високий поріг входу: 153 гігабайти відеопам’яті навіть у стиснутому вигляді — це не домашній комп’ютер.
Противага, щоб картина була чесною: квантування майже не псує якість, довгий контекст працює без помітного вповільнення (падіння 2,5% на 32 тисячах токенів), а результат на корейських офісних завданнях за шестикратно меншого розміру, ніж у конкурента, — це справжнє інженерне досягнення, а не маркетинг.
Кому вона потрібна, а кому ні
Варто придивитися, якщо ви:
- працюєте з корейською або японською мовою — тут у моделі реальна, виміряна перевага;
- будуєте фонового агента для розбору документів, де 15 токенів на секунду достатньо;
- маєте серверні прискорювачі й хочете модель, яку можна тримати повністю в себе;
- вивчаєте архітектури: гібридна увага без позиційного кодування — рідкісний і добре задокументований приклад.
Найімовірніше, не ваш варіант, якщо ви:
- працюєте українською або російською — подивіться на моделі із заявленою багатомовністю;
- хочете запустити модель на домашньому комп’ютері чи одній відеокарті — 153 гігабайти не помістяться нікуди з доступного;
- потрібен інтерактивний діалоговий помічник — швидкість не та;
- плануєте донавчити й продавати під своїм брендом — упретеся в ліцензію;
- чекаєте, що модель замінить агента в терміналі — за власними цифрами Upstage, це її слабке місце.
Як спробувати без свого сервера
Три шляхи, від простого до складного:
- Playground Upstage — вебінтерфейс на сайті компанії. Пробний доступ був відкритий до 31 липня 2026 року; перевіряйте актуальність умов на момент читання.
- Через API Upstage. Окремого публічного прайсу на Solar Open 2 на момент публікації немає; для орієнтиру — пропрієтарна Solar Pro 3 коштує $0,15 за мільйон вхідних токенів і $0,60 за мільйон вихідних (дані на 26 липня 2026 року).
- Оренда сервера з потрібними прискорювачами і розгортання через vLLM з квантованою версією. Розумний варіант, якщо треба перевірити модель на своїх даних, але купувати залізо зарано.
FAQ
Чи можна запустити Solar Open 2 на ігровій відеокарті? Ні. Навіть у чотирибітному стисненні ваги займають близько 153 гігабайтів, а найдоступніші споживчі карти мають 24–32 гігабайти. Різниця не долається жодними налаштуваннями. Мінімальний робочий варіант — два серверні прискорювачі H200 або пара спеціалізованих мінистанцій.
Чи правда, що модель розуміє мільйон токенів тексту? Архітектура це допускає, і Upstage заявляє таке вікно. Але на практиці межу ставить пам’ять під кеш контексту: у задокументованому запуску на парі DGX Spark максимум становив 262 144 токени. Щоб отримати заявлений мільйон, потрібно значно більше відеопам’яті.
Наскільки сильно квантування псує якість? За даними Nota AI, середній бал за набором тестів падає з 81,57 до 81,35 — різниця в межах похибки, а на тесті з програмування результат навіть зріс. Практичний висновок: чотирибітну версію можна брати без вагань, якщо ваше залізо її підтримує.
Чим вона відрізняється від інших відкритих моделей такого розміру? Трьома речами: гібридною увагою (три чверті шарів — лінійні), повною відмовою від позиційного кодування і дуже низькою часткою активних параметрів — 15 мільярдів із 250. Плюс тим, що її свідомо загострювали під корейську мову, а не під універсальну багатомовність.
Чи можна використовувати її в комерційному продукті? Так, ліцензія це дозволяє. Але якщо ви донавчаєте модель і поширюєте результат, назва зобов’язана починатися з «Solar», а в продукті має бути видно позначку «Built with Solar». Для внутрішнього використання всередині компанії обмеження практично непомітне, для власного брендованого продукту — суттєве.
Чи варто чекати на незалежні заміри? Так, і це розумно. Станом на 26 липня 2026 року всі опубліковані бенчмарки надані самим розробником. Перші незалежні сигнали вже з’явилися на форумі NVIDIA — вони підтверджують заявлену швидкість, але щодо якості відповідей обережніші за пресреліз.
