DGX Spark, Mac Studio і Strix Halo: 120B тримають усі три, 70B буксує у двох

35 хв. читання

Коротко (TL;DR)

  • Усі три машини тримають у пам’яті модель на 120 млрд параметрів, і всі три спотикаються на щільній моделі на 70 млрд. Причина одна: генерація впирається не в обчислення, а у швидкість читання ваг із пам’яті.
  • На генерації розрив між DGX Spark і Strix Halo — 13%. На обробці промпта — п’ятиразовий. Саме тому машини, які в чаті відчуваються однаково, поводяться геть по-різному, щойно ви даєте їм довгий документ.
  • Щільна 70B у 4-бітному кванті: 2,7–4,42 ток/с на DGX Spark, 4,5–5,05 на Strix Halo. Це швидкість читання по складах. Mac Studio M3 Ultra за смугою пам’яті втричі швидший, але публічного заміру з описаною методикою на цій моделі знайти не вдалося.
  • MoE-модель gpt-oss-120b іде в усіх: 38,55–58,72 ток/с (DGX Spark), 34,13–55,57 (Strix Halo), 70,79 у Mac Studio — остання цифра трапляється рівно в одному джерелі й ніким не підтверджена.
  • Одна й та сама таблиця гуляє половиною видачі і тягне за собою помилку: половина порівнянь приписує Strix Halo пропускну здатність 273 ГБ/с, хоча це цифра DGX Spark.
  • Ціни перезібрав дефіцит пам’яті: DGX Spark подорожчав на 18% у лютому 2026, Framework Desktop зі 128 ГБ — з $1 999 до $3 449, а конфігурацію Mac Studio на 512 ГБ знято з продажу в березні 2026. Дані станом на 15 серпня 2026.

Своїх машин у нас немає — жодної з трьох. Тому далі немає жодного рядка «ми прогнали»: це зведення чужих замірів до однієї методики, і біля кожної цифри написано, чий це прогін, на якій моделі, в якому кванті, яким бекендом і на якій довжині промпта.

Що спільного у DGX Spark, Mac Studio і Strix Halo: єдина пам’ять

Усі три машини побудовані на одній ідеї — єдиній пам’яті (unified memory). Звичайний ігровий ПК тримає два окремі пули: системну оперативну пам’ять для процесора і відеопам'ять на карті. Модель, яка не влізла у відеопам’ять, або не запускається, або частково обчислюється процесором і працює болісно повільно. У машинах з єдиною пам’яттю пул один, і прискорювач адресує його цілком.

Звідси головний виграш: влазить більше. У NVIDIA DGX Spark — 128 ГБ LPDDR5x, у Mac Studio на M3 Ultra — до 256 ГБ, у Ryzen AI Max+ 395 — до 128 ГБ LPDDR5X-8000. Дискретна RTX 5090 дає 32 ГБ. Модель вагою 59 ГБ на карту не покласти взагалі, а на будь-яку з цих трьох коробок — можна. Про сам бокс NVIDIA та його софтовий стек у нас є окремий розбір.

І звідси ж головна плата: рахує повільніше. Швидкість генерації тексту визначається тим, як швидко залізо встигає прочитати ваги моделі з пам’яті. У RTX 5090 смуга пам’яті — 1 792 ГБ/с, у RTX 3090 — близько 936 ГБ/с. У наших трьох машин:

МашинаПам’ятьСмуга за паспортомСмуга виміряна
NVIDIA DGX Spark (GB10)128 ГБ LPDDR5x, когерентна273 ГБ/сокремого публічного заміру немає
Apple Mac Studio M3 Ultraдо 256 ГБ єдиної пам’яті819 ГБ/сокремого публічного заміру немає
AMD Ryzen AI Max+ 395 (Strix Halo)до 128 ГБ LPDDR5X-8000, шина 256 біт256 ГБ/с212–215 ГБ/с

Є і третя відмінність, про яку в порівняннях зазвичай мовчать: у трьох машин різний ступінь «єдності» пам’яті. У DGX Spark пам’ять когерентна — процесор і прискорювач бачать ті самі адреси, ділити нічого не треба. В Apple те саме. А у Strix Halo пам’ять ділиться: під Windows драйвер Adrenalin віддає відеоядру до 96 ГБ зі 128 через механізм Variable Graphics Memory, під Linux стелю піднімають параметрами ядра. Як саме це налаштовується і що ламається без налаштування — у докладному розборі Ryzen AI Max+ 395. Обмін між процесорною та графічною частиною йде зі швидкістю близько 84 ГБ/с — це ще одне вузьке місце, якого у двох інших машин немає.

Далі — не переказ цих розборів. Кожен із них відповідає на питання «що потягне ця машина». Тут питання інше: яку з трьох брати під конкретну модель, і чому відповідь залежить не від кількості мільярдів у її назві.

Як ми відбирали цифри: модель, квант, бекенд, довжина контексту

Цифра «стільки-то токенів на секунду» без п’яти уточнень не означає нічого. Ось ці п’ять:

  1. Яка модель. Щільна (dense) чи MoE — різниця у швидкості кратна, пояснення нижче.
  2. Який квант. Квантування — це стиснення ваг моделі: замість 16 біт на число зберігають 8, 4 або менше. Модель на 70 млрд параметрів у 4-бітному кванті важить близько 40 ГБ, у 8-бітному — удвічі більше, і читається удвічі довше.
  3. Який бекенд і його версія. llama.cpp з CUDA, Metal, Vulkan чи ROCm — це різні програми, а не різні назви однієї.
  4. Яка довжина промпта і глибина контексту. Мітка pp2048 означає обробку промпта на 2048 токенів, tg32 — генерацію 32 токенів, tg128@d32768 — генерацію за вже набраного контексту у 32 768 токенів. Це різні тести, і складати їх в одну колонку не можна.
  5. Коли знято замір. Стек змінюється швидше за залізо: у Strix Halo цифри на gpt-oss-120b зросли з 34,13 до 55,57 ток/с за пів року без жодної зміни в машині.

За цими правилами ми відбракували більшу частину того, що лежить у видачі. Що саме відлетіло:

  • Рядки без бекенда. У двох популярних порівняннях у колонці «backend» стоять прочерки, хоча на Strix Halo один лише вибір бекенда змінює результат удвічі.
  • Цифра «30–35 ток/с на щільній Llama 3.3 70B» у Strix Halo. Трапляється на кількох контент-сайтах, не супроводжується ані бекендом, ані версією стеку і розходиться з двома незалежними замірами вшестеро. Першоджерела в неї не знайшлося.
  • Передруки. Таблиця 1723,07 / 339,87 / 863,73 дослівно повторюється щонайменше у трьох великих порівняннях. Це не три підтвердження, а одне: у всіх одне джерело — зведення Hardware Corner.
  • Помилка, яка їде разом із таблицею. Два з цих порівнянь приписують Strix Halo смугу пам’яті 273 ГБ/с. Це паспортна цифра DGX Spark. У Strix Halo паспорт — 256 ГБ/с, виміряна величина — 212–215.

Опорною точкою ми взяли офіційний файл бенчмарків llama.cpp по DGX Spark: там вказані і збірка (11fb327bf), і версія CUDA (13.0), і драйвер (580.95.05), і всі параметри прогону — розмір батча 2048, flash attention увімкнено, усі шари на прискорювачі. Такий паспорт заміру — рідкість, і саме до нього ми зводимо решту цифр.

Швидкість на 70B і 120B: DGX Spark, Mac Studio і Strix Halo у таблиці

Головна таблиця статті. Цифри — швидкість генерації (decode), тобто видачі відповіді; обробка промпта розібрана в наступному розділі окремо, бо вона поводиться інакше. Усі дані — станом на 15 серпня 2026.

МодельТипВагаDGX SparkMac Studio M3 UltraStrix HaloЧим і як міряли
Llama 3.x 70B, Q4щільна~40 ГБ4,42заміру з методикою немає5,05Ollama (Spark); llama.cpp Vulkan, pp512/tg128 (Halo)
Llama 3.3 70B, FP8щільна~70 ГБ2,7–3н/дн/дvLLM, батч 1
Shisa V2 70B, Q4_K_Mщільна~41 ГБн/дн/д5,0 (Vulkan) / 4,5 (rocWMMA)llama.cpp b5863, ROCm 7.0 nightly
Command-A 111B, Q8щільна~110 ГБн/д3,24н/дKoboldCpp, контекст 13,7 тис.
Llama 3.1 405B, q6щільна~330 ГБн/д1,25н/дKoboldCpp, контекст 12,4 тис.
gpt-oss-120b, MXFP4MoE, ~5B активних59 ГБ38,55 → 58,7270,79 (одне джерело)34,13 → 55,57llama-bench, tg32
Llama 4 Scout 109B, Q4MoE, 17B активних57,9 ГБн/дн/д20,23llama.cpp Vulkan, tg128
Qwen3 32B, Q4_K_Mщільна~18 ГБ10,7н/дн/дllama.cpp, контекст 512
Qwen3 30B-A3BMoE, 3,3B активних~17 ГБ89,3 (Q4_K_M)н/д100,04 (IQ4_XS)llama.cpp (Spark); RADV Vulkan (Halo)

Стрілка в рядку gpt-oss-120b — це не розкид замірів, а хронологія: ліворуч цифра осіннього стеку 2025 року, праворуч — весняно-літнього 2026. Машина та сама.

Три висновки читаються просто з таблиці.

Перший: на щільній 70B ніхто не виграє. Чотири незалежні заміри на двох машинах дають 2,7–5,05 ток/с. Для порівняння: людина читає вголос приблизно 3–4 слова на секунду, а токен зазвичай коротший за слово. Тобто модель видає текст повільніше, ніж ви його читаєте вголос. Працювати так можна лише у фоновому режимі — поставив задачу, пішов.

Другий: на MoE-моделі того самого класу все раптом добре. gpt-oss-120b формально втричі більша, а йде у 7–14 разів швидше за щільну 70B. Розгадка — в архітектурі.

Третій: у Mac Studio M3 Ultra у цій таблиці зяючі діри, і це не наші лінощі. Apple-машину міряють рідше за всіх, і майже ніколи — із зазначенням бекенда. Єдина цифра Mac Studio на gpt-oss-120b трапляється рівно в одному джерелі; в офіційних бенчмарках llama.cpp по цій моделі Apple представлена не M3 Ultra, а M2 Ultra — 1244,57 ток/с на промпті (pp2048) і 79,68 на генерації, але вже за міткою tg128, а не tg32, тобто і її в одну колонку з рештою не поставити. Ми лишили рядок у таблиці з поміткою, а не викинули, бо його цитують повсюдно — і читачеві корисно знати, що за ним стоїть.

Щільна модель проти MoE: чому 120 млрд швидші за 32 млрд

MoE (mixture of experts, «суміш експертів») — це модель, розбита на багато спеціалізованих підмереж. На кожен токен активується лише мала їх частина. У gpt-oss-120b усього 116,83 млрд параметрів, а обчислюється близько 5 млрд. У Llama 4 Scout зі 109 млрд активні 17 млрд.

Ключовий момент, який часто плутають: у пам’яті лежать УСІ параметри. AMD у власному блозі формулює це прямо: «усі 109 млрд параметрів мають зберігатися в пам’яті, тобто займаний обсяг такий самий, як у щільної моделі на 109 млрд». Заощаджується не місце, а читання.

Цифра, яка це доводить, знята на одній і тій самій машині: на DGX Spark щільна Qwen3 32B дає 10,7 ток/с, а MoE Qwen3 30B — 89,3 ток/с. Розрив восьмиразовий за майже однакової кількості параметрів. Якщо ви обираєте машину під конкретну задачу, починати треба з питання «яка в моєї моделі архітектура», а не «скільки в ній мільярдів». Що обрати з моделей — розбирали в гайді з локальних моделей.

Prompt processing: чому довгий промпт ламає обіцянку «тягне 120B»

Робота моделі ділиться на дві фази. Prefill (prompt processing) — прочитати й осмислити те, що ви надіслали. Decode (generation) — видати відповідь по одному токену. Перша фаза впирається в обчислювальну потужність, друга — у швидкість пам’яті. Тому та сама машина може бути швидкою в одному й повільною в іншому.

Ось де розходяться наші три коробки — на одній моделі та одній мітці тесту:

МашинаОбробка промпта (pp2048)Генерація (tg32)У скільки разів prefill швидший за decode
DGX Spark1 723,07 → 2 443,9138,55 → 58,72×42
Mac Studio M3 Ultra863,73 (одне джерело)70,79 (одне джерело)×12
Strix Halo339,87 → 50034,13 → 55,57×10
3× RTX 3090 (для калібрування)1 641,89124,03×13
Швидкість обробки промпта на моделі gpt-oss-120b: DGX Spark 1723, Mac Studio M3 Ultra 864, Strix Halo 340 і три RTX 3090 — 1642 токени на секунду
Швидкість генерації на тій самій моделі gpt-oss-120b: DGX Spark 38,6, Mac Studio M3 Ultra 70,8, Strix Halo 34,1 і три RTX 3090 — 124 токени на секунду

Два графіки вище — одна й та сама модель, один і той самий тест, різні фази роботи. На першому Strix Halo відстає від DGX Spark уп’ятеро, на другому різниця зникає. Порядок машин між графіками змінюється повністю — і саме це робить питання «яка швидша» безглуздим без уточнення, про яку фазу мова.

Розрив між DGX Spark і Strix Halo на генерації — 13%. На обробці промпта — п’ятиразовий. Це і є та розвилка, заради якої варто читати порівняння: машини, які в короткому чаті невідрізнимі, розходяться в рази, щойно ви даєте їм документ.

Наскільки це відчутно в секундах, показав єдиний замір, де prefill і decode розвели за часом явно. Команда EXO Labs прогнала Llama-3.1 8B у FP16 із промптом на 8192 токени та генерацією 32 токенів: DGX Spark обробив промпт за 1,47 секунди, Mac Studio M3 Ultra — за 5,57. На генерації порядок зворотний: 2,87 секунди у Spark проти 0,85 у Mac. У множниках це 3,8× на користь Spark на prefill і 3,4× на користь Mac на decode.

Застереження обов’язкове: цей замір зробили розробники програми, яка з’єднує дві машини у зв’язку, — тобто зацікавлена сторона. Цифри при цьому сходяться із загальною картиною за обчисленнями та смугою пам’яті, тому ми їх наводимо, але як замір вендора софту, а не незалежної лабораторії.

Контекст 32K: DGX Spark втрачає 36% на промпті і 27% на генерації

Обидві фази деградують у міру набору контексту, і тут у нас є єдиний повний ряд — на DGX Spark:

Глибина контекстуОбробка промптаГенерація
0 (чистий старт)2 443,9158,72
32 768 токенів1 567,0842,76

Обробка просіла на 36%, генерація — на 27%. У Strix Halo падіння залежить від бекенда: на контексті 32K стандартний ROCm видає 17,82 ток/с, Vulkan — 31,54, а зібрана вручну гілка rocWMMA — 36,43. Щодо Mac Studio такого ряду у відкритому доступі немає взагалі; є лише якісні спостереження власників, що на документі в 40–50 тисяч токенів машина стає помітно повільнішою.

Саме тут ламається обіцянка «тягне модель на 120 млрд параметрів». Тягне — у сенсі «вміщується в пам’ять» і «видає 40–70 токенів на секунду в короткому чаті». Але задача, заради якої зазвичай і купують 128 ГБ (розбір великого репозиторію, пошук по своїй базі документів, агент із довгою історією), — це якраз довгий промпт, і там розклад визначають зовсім інші цифри.

Пропускна здатність пам’яті передбачає tok/s краще за TOPS

Просте правило, яке працює точніше за будь-який маркетинговий слайд:

Стеля швидкості генерації ≈ пропускна здатність пам’яті ÷ обсяг ваг моделі.

Перевіримо на щільній 70B у 4-бітному кванті (близько 40 ГБ; у FP8 — близько 70 ГБ):

МашинаВиміряна (чи паспортна) смугаМодельРозрахункова стеляЗамір
DGX Spark273 ГБ/с70B FP8, ~70 ГБ~3,9 ток/с2,7–3
DGX Spark273 ГБ/с70B Q4, ~40 ГБ~6,8 ток/с4,42
Strix Halo215 ГБ/с (виміряно)70B Q4, ~40 ГБ~5,4 ток/с4,5–5,05
Mac Studio M3 Ultra819 ГБ/с70B Q4, ~40 ГБ~20 ток/сзаміру немає

Розрахунок дає верхню межу, а реальність до неї не дотягує — частина смуги йде на KV-кеш, накладні витрати бекенда і неідеальну роботу контролера пам’яті. Наскільки саме не дотягує, залежить від машини: у DGX Spark заміри дають 65–77% від розрахункової стелі, у Strix Halo — 83–94%. Абсолютну цифру формула не замінює, але порядок величини передбачає точно, і це найкращий наявний інструмент для машини, яку ви ще не купили.

Показова історія: на форумі розробників NVIDIA людина поскаржилася, що Llama 3.3 70B у FP8 видає в неї 2–3 токени на секунду, і запитала, що вона налаштувала не так. Відповідь була — нічого. Розрахунок 273 ГБ/с ÷ 70 ГБ ≈ 3,9 за реальних 2,7–3 означає, що машина працює штатно, просто задача їй не за профілем.

Тепер зіставимо це з тим, що пишуть у рекламних матеріалах:

Що заявляє вендорЩо виміряно незалежно
NVIDIA: «до 1 PFLOP FP4»101 TFLOPS BF16 і 207 TFLOPS FP8 (тест MAMF)
NVIDIA: «інференс моделей до 200 млрд параметрів»вміщуються — за квантування у FP4; швидкість не заявлено
Apple: «LLM обсягом понад 600 млрд параметрів»стосується конфігурації на 512 ГБ, знятої з продажу в березні 2026
AMD: «до 128 млрд параметрів», «до 15 ток/с» на Llama 4 Scout20,23 ток/с на тій самій моделі в Q4 — тут вендор радше занизив
AMD: NPU на 50+ TOPSу llama.cpp NPU не бере участі; на ньому Mistral 7B дає 4–5 ток/с проти ~40 на відеоядрі

Висновок із таблиці простий: TOPS і петафлопси — це про пікову обчислювальну потужність в ідеальному режимі, а генерація тексту впирається в пам’ять. Єдина цифра з рекламного буклета, за якою можна щось передбачити, — це обсяг і смуга пам’яті. Все інше треба перевіряти.

Окрема деталь про NPU. У Strix Halo є окремий нейропроцесор, і його 50 TOPS винесені на всі слайди. У llama.cpp — головному рушії для запуску моделей удома — він не задіяний взагалі. Незалежний тест показав: Mistral 7B на NPU дає 4–5 токенів на секунду, тоді як те саме на вбудованому відеоядрі — близько 40.

CUDA, Metal і ROCm: що реально запуститься на кожній машині

Залізо у трьох машин ближче одне до одного, ніж програмне забезпечення. Тут розрив більший, ніж у цифрах.

DGX SparkMac Studio M3 UltraStrix Halo
ПлатформаCUDAMetal / MLXROCm, Vulkan
llama.cppз коробки, CUDAз коробки, MetalVulkan з коробки, ROCm із застереженнями
Ollama / LM Studioтактактак
vLLM (сервер, батчі)такобмеженообмежено
TensorRT-LLM, NIMтакніні
Донавчання (LoRA, QLoRA)штатнопомітно складнішепомітно складніше
Що доведеться збирати рукамимайже нічогомайже нічогогілку rocWMMA під довгий контекст

Ціна ручної роботи вимірювана. На gpt-oss-120b за контексту 32K стандартний ROCm видає 17,82 ток/с, Vulkan — 31,54, зібрана вручну гілка rocWMMA — 36,43. Тобто людина, яка просто поставила ROCm і не стала розбиратися, отримує половину від можливого. Той самий ефект на щільній 70B, але в інший бік: обробка промпта в HIP із rocWMMA — 94,7 ток/с проти 26,4 у Vulkan, різниця в 3,6 раза за майже однакової швидкості генерації. Оптимального бекенда «на всі випадки» в AMD поки немає — обирати доводиться під задачу.

На донавчанні розрив теж виміряний, і це єдина дисципліна, де дві машини порівняли по-справжньому однією методикою. У тесті The Register QLoRA на Llama 3.1 70B зайняла близько 20 хвилин на DGX Spark і трохи більше ніж 50 хвилин на Strix Halo. Mac Studio в цьому порівнянні не брав участі — під тренування Apple-машини беруть рідко саме через відсутність CUDA.

Ще одна деталь, яку видно лише в динаміці: стек продовжує змінюватися просто зараз. 14 серпня 2026 в llama.cpp ухвалили патч, що змінює спосіб визначення доступної пам’яті на APU від AMD, — і виріс він із коду, який додавали заради DGX Spark. Будь-який замір у цій ніші має термін придатності.

Ціна результату: долар за токен на секунду і за гігабайт пам’яті

Ціни станом на 15 серпня 2026. Рахуємо два показники: скільки коштує один токен на секунду на gpt-oss-120b (за свіжими замірами) і скільки коштує один гігабайт пам’яті, доступної моделі.

МашинаЦінаПам’ять під модель$/ГБГенерація на 120B$ за 1 ток/с
DGX Spark Founders Edition$4 699128 ГБ$36,758,72$80
Framework Desktop (Strix Halo, 128 ГБ)$3 44996 ГБ (Windows)$35,955,57$62
Міні-ПК на Strix Halo з тесту The Register$2 199–2 94996 ГБ (Windows)$22,9–30,755,57$40–53
Mac Studio M3 Ultra, 96 ГБбазова конфігурація96 ГБ70,79 (одне джерело)

Базову ціну Mac Studio Apple на сторінці магазину не показує, тому колонки за ним ми лишили порожніми, а не підставили цифру з других рук. Відомо інше: апгрейд пам’яті до 256 ГБ коштує $2 000 — до березня 2026 він коштував $1 600.

Історія цін тут важливіша за самі ціни, бо вона пояснює, чому будь-яка порівняльна таблиця в цій ніші живе тижні:

  • DGX Spark. NVIDIA офіційно підняла ціну Founders Edition з $3 999 до $4 699 — оголошення від 25 лютого 2026, причина названа прямо: «світові обмеження постачання пам’яті». Конфігурація при цьому не змінювалася.
  • Framework Desktop. Зі 128 ГБ на старті коштував $1 999, на 15 серпня 2026 в конфігураторі — $3 449, і в наявності його немає. Зростання в 1,7 раза.
  • Mac Studio. У перший тиждень березня 2026 Apple прибрала з продажу конфігурацію на 512 ГБ (вона коштувала $9 499) і підняла ціну апгрейду до 256 ГБ на $400. Саме ці 512 ГБ були єдиною причиною купувати Mac Studio під найбільші відкриті моделі — у них цілком вміщувався DeepSeek R1 на 671 млрд параметрів.

Останній пункт варто підкреслити, бо його досі не помітили популярні порівняння: матеріали, написані в серпні 2026, досі протиставляють «128 ГБ у DGX Spark проти 512 ГБ у Mac Studio». Купити ці 512 ГБ новими не можна вже пів року.

Окремо про енергію. У DGX Spark блок живлення на 240 Вт за TDP чипа 140 Вт — це єдина з трьох машин, у якої обидві цифри є в офіційній специфікації. AMD публікує діапазон TDP платформи, а не споживання конкретного бокса під навантаженням мовною моделлю; Apple не публікує нічого. Звести всі три машини за ватами з офіційних даних не можна, тому розрахунок «токенів на ват» ми не робимо — він був би наполовину вигаданим.

Чому цифри не сходяться: різні стенди, дати й версії бекендів

Ось усе, що заважає вважати таблиці вище остаточними.

Жодна лабораторія не виміряла всі три машини сама. З шістнадцяти розібраних матеріалів у жодному немає потрійного порівняння на одному стенді з однією методикою. Найближче — тест The Register, де на одному стенді порівняли дві машини з трьох. Усе інше — зведення чужих прогонів, включно з нашим.

Дати роз’їжджаються на місяці. Заміри Strix Halo, які найчастіше цитують, зняті восени 2025 року; свіжі прогони на збірках травня–червня 2026 дають у 1,6 раза більше. У DGX Spark та сама історія: 1 737 ток/с на промпті в жовтні 2025 проти 2 444 у свіжому офіційному файлі. Порівнювати осінні цифри однієї машини з літніми цифрами іншої некоректно, і ми намагалися цього уникнути — але в головній таблиці такі пари лишилися, і це позначено стрілками.

Кванти різні. DGX Spark частіше міряють у MXFP4 і NVFP4, Strix Halo — у MXFP4, Q4_K_XL і BF16, Mac — у Q4 і MLX. Жодного однакового кванта на всіх трьох машинах у відкритих замірах немає. Наскільки при цьому відрізняється якість відповідей — окрема тема, яку цифрами tok/s не закрити.

Рядок Mac Studio у головній таблиці стоїть на одному джерелі. Ми шукали підтвердження цілеспрямовано: в офіційних бенчмарках llama.cpp по gpt-oss-120b Apple представлена M2 Ultra, а не M3 Ultra, і бекенд у широко цитованого рядка не названий взагалі.

Часу до першого токена немає майже ніде. Практично вся суперечка «prefill проти decode» — це суперечка про те, скільки секунд ви дивитеся на порожній екран. Абсолютні секунди є лише в EXO і лише на моделі 8B.

Що зміниться найближчим часом. В AMD дозріває ROCm і гілка rocWMMA — розрив зі стандартним ROCm уже дворазовий на користь ручної збірки, і коли ці оптимізації доїдуть до релізів, цифри Strix Halo зростуть іще раз. У NVIDIA приріст дає зв’язка NVFP4 і спекулятивне декодування. Apple змінює покоління чипів і, судячи з березневого рішення, конфігурації пам’яті. Будь-яку таблицю в цій ніші має сенс перевіряти раз на квартал.

Ризики купівлі: що знецінить вибір за найближчі пів року

  • Пам’ять розпаяна в усіх трьох. У DGX Spark 128 ГБ зафіксовані конструктивно, у Framework Desktop LPDDR5x незнімна (сама компанія пояснювала, що модульну пам’ять на 256-бітній шині зробити не вийшло), в Apple пам’ять в упаковці чипа. Помилку з обсягом під час купівлі апгрейдом не лікують.
  • Дефіцит пам’яті триває. За пів року 2026-го він підняв ціну DGX Spark на 18%, Framework Desktop — у 1,7 раза і змусив Apple прибрати топову конфігурацію. Ставка на «почекаю, подешевшає» поки не виправдовується.
  • Екосистема AMD вимагає часу власника. Різниця між «поставив ROCm» і «зібрав rocWMMA» — дворазова. Той, хто не готовий поратися, отримує гіршу половину заявлених цифр.
  • Обіцянка «тягне 120B» тримається на архітектурі MoE. Змініть модель на щільну того самого класу — і швидкість впаде кратно. Планувати купівлю під «моделі на 100 млрд» без уточнення архітектури не можна.
  • Заяви вендорів не переносяться в таблицю як заміри. «До 1 PFLOP FP4», «понад 600 млрд параметрів», «до 128 млрд» — це межі можливого за ідеальних умов, а не те, що ви побачите в терміналі.
  • Дискретні карти нікуди не поділися. Три вживані RTX 3090 дають 124 ток/с на тій самій gpt-oss-120b — удвічі більше за свіжу цифру DGX Spark (58,72) — за 72 ГБ сумарної відеопам’яті й геть іншого енергоспоживання. Якщо ваша модель вміщується у відеопам’ять, єдина пам’ять вам не потрібна взагалі.

Яку з трьох брати під вашу модель: три сценарії

Прямої поради, яку коробку замовляти, тут немає. Нижче — пороги, за якими рішення ухвалюється саме.

Сценарій 1. Модель вміщується у 32 ГБ (до 30B у 4-бітному кванті). Жодна з трьох машин тут не потрібна. Дискретна відеокарта дасть кратно більше токенів на секунду за ті самі або менші гроші. Орієнтири за конфігураціями — у загальному гайді із заліза під локальні моделі.

Сценарій 2. Потрібні MoE-моделі класу 100–120 млрд параметрів і довгий контекст. Тут розвилка проходить за типом навантаження:

  • переважно короткі діалоги — різниця між машинами в межах 13–25%, вирішує ціна, і Strix Halo у боксі за $2 200–3 400 виглядає раціональніше;
  • документи, пошук по своїй базі, агенти з довгою історією — prefill вирішує все, і п’ятиразова перевага DGX Spark на обробці промпта перетворюється на різницю між трьома секундами очікування і п’ятнадцятьма;
  • потрібен CUDA (наявний код, vLLM, TensorRT-LLM, донавчання) — альтернативи DGX Spark серед цих трьох немає.

Сценарій 3. Потрібні щільні моделі більші за 70 млрд параметрів. Чесна відповідь: жодна з трьох машин не дасть комфортної швидкості за батча 1. Шукайте або найширшу смугу пам’яті (Mac Studio на M3 Ultra), або змиріться з фоновим режимом, або дивіться в бік збірки на кількох дискретних картах.

Ще один варіант, який варто знати: машини можна з’єднувати. Два DGX Spark зв’язуються безпосередньо через ConnectX-7 і, за заявою NVIDIA, тягнуть моделі до 405 млрд параметрів. А EXO показала зв’язку, де обробку промпта бере DGX Spark, а генерацію — Mac Studio: 2,8× до одного Mac. Незалежного повторення цього заміру поки немає, і робили його розробники самого софту. Про модульність конкретного бокса на Strix Halo — у його окремому розборі, посилання вище в розділі про ціни.

Часті запитання

Скільки токенів на секунду треба, щоб локальний чат не дратував?

Універсального порогу немає, але є орієнтир від швидкості читання: комфортний темп починається приблизно з 15–20 токенів на секунду, а розмовним відчувається 30 і вище. Усе, що нижче 10, годиться для фонових задач — поставити й повернутися. Щільна модель на 70 млрд параметрів на цих машинах дає 2,7–5 токенів на секунду, тобто потрапляє саме у фоновий режим, а не в інтерактивний.

Чому MoE-модель на 120 млрд параметрів працює швидше за щільну на 32 млрд?

Бо швидкість генерації визначається обсягом ваг, які треба прочитати з пам’яті на кожен токен. У MoE активується мала частина мережі: у gpt-oss-120b зі 117 млрд параметрів обчислюється близько 5 млрд. Щільна модель читає всі свої ваги цілком. Замір на одній машині це підтверджує: 89,3 токена на секунду в MoE на 30 млрд проти 10,7 у щільної на 32 млрд.

Чи можна запустити DeepSeek R1 на 671B на будь-якій із цих трьох машин?

У 4-бітному кванті ця модель займає близько 350–400 ГБ. Стільки пам’яті була лише в Mac Studio в конфігурації на 512 ГБ, і Apple зняла її з продажу в березні 2026 — зараз максимум становить 256 ГБ. У DGX Spark і Strix Halo по 128 ГБ, модель туди не вміщується. Лишаються варіанти з об’єднанням кількох машин або агресивніше квантування з втратою якості.

Скільки пам’яті реально лишиться під модель після операційної системи?

У DGX Spark і Mac Studio пам’ять когерентна: ділити її між процесором і прискорювачем не треба, але система все одно займає частину, тому під модель плануйте на 10–20 ГБ менше номіналу. У Strix Halo ситуація інша: під Windows відеоядру віддають до 96 ГБ зі 128 через механізм Variable Graphics Memory, під Linux стелю піднімають параметрами ядра. Без цього налаштування модель може мовчки поїхати обчислюватися на процесор.

Чи впливає NPU на швидкість локальної мовної моделі?

Практично ні. Нейропроцесор у Strix Halo рекламується як 50+ TOPS, але llama.cpp його не використовує, а спеціалізовані шляхи дають менше, ніж вбудоване відеоядро: незалежний тест показав 4–5 токенів на секунду на Mistral 7B через NPU проти приблизно 40 на відеоядрі. Під час вибору машини під запуск LLM цифра TOPS у NPU практичного значення не має.

Чи є сенс з’єднувати дві машини в кластер?

Сенс є, але виграш залежить від того, що саме ви з’єднуєте. Два DGX Spark зв’язуються безпосередньо через ConnectX-7 на 200 Гбіт/с, і NVIDIA заявляє підтримку моделей до 405 млрд параметрів. Цікавіший випадок — зв’язка різнорідних машин: EXO показала схему, де промпт обробляє DGX Spark, а токени генерує Mac Studio, і це дає 2,8× до одного Mac. Замір зроблено розробником софту й незалежно не повторено.

Поділитися
Зв'язатися:
Крипто- та data-аналітик, інженер-програміст (факультет комп'ютерних наук ХНУРЕ). В IT з 2008 року: адміністрував корпоративний моніторинг у «Vodafone Україна», сім років розробляв і просував веб-проєкти, п'ять років керував маркетингом на метриках — конверсія, CTR, ROI, LTV.Криптовалютними ринками займаюся з 2021 року: ончейн-метрики, токеноміка, макроекономічні індикатори. Розробив власну data-driven модель аналізу ринку на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математична статистика та EDA; збір і звірку даних автоматизую AI-агентами.Принцип — «Don't trust, verify»: кожна цифра перевірена за першоджерелом, ключові — щонайменше за двома незалежними; прогнози — лише сценарії з умовами. Теза без даних не публікується.