DGX Spark, Mac Studio и Strix Halo: 120B держат все три, 70B буксует у двух

35 мин. чтения

Коротко (TL;DR)

  • Все три машины держат в памяти модель на 120 млрд параметров, и все три спотыкаются на плотной модели на 70 млрд. Причина одна: генерация упирается не в вычисления, а в скорость чтения весов из памяти.
  • На генерации разрыв между DGX Spark и Strix Halo — 13%. На обработке промпта — пятикратный. Именно поэтому машины, которые в чате ощущаются одинаково, ведут себя совершенно по-разному, как только вы даёте им длинный документ.
  • Плотная 70B в 4-битном кванте: 2,7–4,42 ток/с на DGX Spark, 4,5–5,05 на Strix Halo. Это скорость чтения по слогам. Mac Studio M3 Ultra по полосе памяти быстрее втрое, но публичного замера с описанной методикой на этой модели найти не удалось.
  • MoE-модель gpt-oss-120b идёт у всех: 38,55–58,72 ток/с (DGX Spark), 34,13–55,57 (Strix Halo), 70,79 у Mac Studio — последняя цифра встречается ровно в одном источнике и никем не подтверждена.
  • Одна и та же таблица гуляет по половине выдачи и тащит за собой ошибку: половина сравнений приписывает Strix Halo пропускную способность 273 ГБ/с, хотя это цифра DGX Spark.
  • Цены пересобрал дефицит памяти: DGX Spark подорожал на 18% в феврале 2026, Framework Desktop со 128 ГБ — с $1 999 до $3 449, а конфигурация Mac Studio на 512 ГБ снята с продажи в марте 2026. Данные на 15 августа 2026.

Своих машин у нас нет — ни одной из трёх. Поэтому дальше нет ни строчки «мы прогнали»: это сведение чужих замеров к одной методике, и у каждой цифры написано, чей это прогон, на какой модели, в каком кванте, каким бекендом и на какой длине промпта.

Что общего у DGX Spark, Mac Studio и Strix Halo: единая память

Все три машины построены на одной идее — единой памяти (unified memory). Обычный игровой ПК держит два раздельных пула: системную оперативную память для процессора и видеопамять на карте. Модель, которая не влезла в видеопамять, либо не запускается, либо частично считается процессором и работает мучительно медленно. В машинах с единой памятью пул один, и ускоритель адресует его целиком.

Отсюда главный выигрыш: влезает больше. У NVIDIA DGX Spark — 128 ГБ LPDDR5x, у Mac Studio на M3 Ultra — до 256 ГБ, у Ryzen AI Max+ 395 — до 128 ГБ LPDDR5X-8000. Дискретная RTX 5090 даёт 32 ГБ. Модель весом 59 ГБ на карту не положить вовсе, а на любую из этих трёх коробок — можно. Про сам бокс NVIDIA и его софтовый стек у нас есть отдельный разбор.

И отсюда же главная плата: считает медленнее. Скорость генерации текста определяется тем, как быстро железо успевает прочитать веса модели из памяти. У RTX 5090 полоса памяти — 1 792 ГБ/с, у RTX 3090 — около 936 ГБ/с. У наших трёх машин:

МашинаПамятьПолоса по паспортуПолоса измеренная
NVIDIA DGX Spark (GB10)128 ГБ LPDDR5x, когерентная273 ГБ/сотдельного публичного замера нет
Apple Mac Studio M3 Ultraдо 256 ГБ единой памяти819 ГБ/сотдельного публичного замера нет
AMD Ryzen AI Max+ 395 (Strix Halo)до 128 ГБ LPDDR5X-8000, шина 256 бит256 ГБ/с212–215 ГБ/с

Есть и третье отличие, о котором в сравнениях обычно молчат: у трёх машин разная степень «единости» памяти. У DGX Spark память когерентная — процессор и ускоритель видят одни и те же адреса, делить ничего не нужно. У Apple то же самое. А у Strix Halo память делится: под Windows драйвер Adrenalin отдаёт видеоядру до 96 ГБ из 128 через механизм Variable Graphics Memory, под Linux потолок поднимают параметрами ядра. Как именно это настраивается и что ломается без настройки — в подробном разборе Ryzen AI Max+ 395. Обмен между процессорной и графической частью идёт со скоростью около 84 ГБ/с — это ещё одно узкое место, которого у двух других машин нет.

Дальше — не пересказ этих разборов. Каждый из них отвечает на вопрос «что потянет эта машина». Здесь вопрос другой: какую из трёх брать под конкретную модель, и почему ответ зависит не от числа миллиардов в её названии.

Как мы отбирали цифры: модель, квант, бекенд, длина контекста

Цифра «столько-то токенов в секунду» без пяти уточнений не значит ничего. Вот эти пять:

  1. Какая модель. Плотная (dense) или MoE — разница в скорости кратная, объяснение ниже.
  2. Какой квант. Квантование — это сжатие весов модели: вместо 16 бит на число хранят 8, 4 или меньше. Модель на 70 млрд параметров в 4-битном кванте весит около 40 ГБ, в 8-битном — вдвое больше, и читается вдвое дольше.
  3. Какой бекенд и его версия. llama.cpp с CUDA, Metal, Vulkan или ROCm — это разные программы, а не разные названия одной.
  4. Какая длина промпта и глубина контекста. Метка pp2048 означает обработку промпта в 2048 токенов, tg32 — генерацию 32 токенов, tg128@d32768 — генерацию при уже набранном контексте в 32 768 токенов. Это разные тесты, и складывать их в одну колонку нельзя.
  5. Когда снят замер. Стек меняется быстрее железа: у Strix Halo цифры на gpt-oss-120b выросли с 34,13 до 55,57 ток/с за полгода без единого изменения в машине.

По этим правилам мы отбраковали большую часть того, что лежит в выдаче. Что именно улетело:

  • Строки без бекенда. В двух популярных сравнениях в колонке «backend» стоят прочерки, хотя на Strix Halo один только выбор бекенда меняет результат вдвое.
  • Цифра «30–35 ток/с на плотной Llama 3.3 70B» у Strix Halo. Встречается на нескольких контент-сайтах, не сопровождается ни бекендом, ни версией стека и расходится с двумя независимыми замерами в шесть раз. Первоисточника у неё не нашлось.
  • Перепечатки. Таблица 1723,07 / 339,87 / 863,73 дословно повторяется как минимум у трёх крупных сравнений. Это не три подтверждения, а одно: у всех один источник — сводка Hardware Corner.
  • Ошибка, которая едет вместе с таблицей. Два из этих сравнений (включая единственное русскоязычное) приписывают Strix Halo полосу памяти 273 ГБ/с. Это паспортная цифра DGX Spark. У Strix Halo паспорт — 256 ГБ/с, измеренная величина — 212–215.

Опорной точкой мы взяли официальный файл бенчмарков llama.cpp по DGX Spark: там указаны и сборка (11fb327bf), и версия CUDA (13.0), и драйвер (580.95.05), и все параметры прогона — размер батча 2048, flash attention включён, все слои на ускорителе. Такой паспорт замера — редкость, и именно к нему мы приводим остальные цифры.

Скорость на 70B и 120B: DGX Spark, Mac Studio и Strix Halo в таблице

Главная таблица статьи. Цифры — скорость генерации (decode), то есть выдачи ответа; обработка промпта разобрана в следующем разделе отдельно, потому что она ведёт себя иначе. Все данные — на 15 августа 2026.

МодельТипВесDGX SparkMac Studio M3 UltraStrix HaloЧем и как мерили
Llama 3.x 70B, Q4плотная~40 ГБ4,42замера с методикой нет5,05Ollama (Spark); llama.cpp Vulkan, pp512/tg128 (Halo)
Llama 3.3 70B, FP8плотная~70 ГБ2,7–3н/дн/дvLLM, батч 1
Shisa V2 70B, Q4_K_Mплотная~41 ГБн/дн/д5,0 (Vulkan) / 4,5 (rocWMMA)llama.cpp b5863, ROCm 7.0 nightly
Command-A 111B, Q8плотная~110 ГБн/д3,24н/дKoboldCpp, контекст 13,7 тыс.
Llama 3.1 405B, q6плотная~330 ГБн/д1,25н/дKoboldCpp, контекст 12,4 тыс.
gpt-oss-120b, MXFP4MoE, ~5B активных59 ГБ38,55 → 58,7270,79 (один источник)34,13 → 55,57llama-bench, tg32
Llama 4 Scout 109B, Q4MoE, 17B активных57,9 ГБн/дн/д20,23llama.cpp Vulkan, tg128
Qwen3 32B, Q4_K_Mплотная~18 ГБ10,7н/дн/дllama.cpp, контекст 512
Qwen3 30B-A3BMoE, 3,3B активных~17 ГБ89,3 (Q4_K_M)н/д100,04 (IQ4_XS)llama.cpp (Spark); RADV Vulkan (Halo)

Стрелка в строке gpt-oss-120b — это не разброс замеров, а хронология: слева цифра осеннего стека 2025 года, справа — весенне-летнего 2026. Машина та же.

Три вывода читаются прямо из таблицы.

Первый: на плотной 70B никто не выигрывает. Четыре независимых замера на двух машинах дают 2,7–5,05 ток/с. Для сравнения: человек читает вслух примерно 3–4 слова в секунду, а токен обычно короче слова. То есть модель выдаёт текст медленнее, чем вы его читаете вслух. Работать так можно только в фоновом режиме — поставил задачу, ушёл.

Второй: на MoE-модели того же класса всё внезапно хорошо. gpt-oss-120b формально втрое крупнее, а идёт в 7–14 раз быстрее плотной 70B. Разгадка — в архитектуре.

Третий: у Mac Studio M3 Ultra в этой таблице зияющие дыры, и это не наша лень. Apple-машину меряют реже всех, и почти никогда — с указанием бекенда. Единственная цифра Mac Studio на gpt-oss-120b встречается ровно в одном источнике; в официальных бенчмарках llama.cpp по этой модели Apple представлена не M3 Ultra, а M2 Ultra — 1244,57 ток/с на промпте (pp2048) и 79,68 на генерации, но уже по метке tg128, а не tg32, то есть и её в одну колонку с остальными не поставить. Мы оставили строку в таблице с пометкой, а не выбросили, потому что её цитируют повсеместно — и читателю полезно знать, что за ней стоит.

Плотная модель против MoE: почему 120 млрд быстрее 32 млрд

MoE (mixture of experts, «смесь экспертов») — это модель, разбитая на много специализированных подсетей. На каждый токен активируется лишь малая их часть. В gpt-oss-120b всего 116,83 млрд параметров, а считается около 5 млрд. У Llama 4 Scout из 109 млрд активны 17 млрд.

Ключевой момент, который часто путают: в памяти лежат ВСЕ параметры. AMD в собственном блоге формулирует это прямо: «все 109 млрд параметров должны храниться в памяти, то есть занимаемый объём такой же, как у плотной модели на 109 млрд». Экономится не место, а чтение.

Цифра, которая это доказывает, снята на одной и той же машине: на DGX Spark плотная Qwen3 32B даёт 10,7 ток/с, а MoE Qwen3 30B — 89,3 ток/с. Разрыв восьмикратный при почти одинаковом числе параметров. Если вы выбираете машину под конкретную задачу, начинать надо с вопроса «какая у моей модели архитектура», а не «сколько в ней миллиардов». Что выбрать из моделей — разбирали в гайде по локальным моделям.

Prompt processing: почему длинный промпт ломает обещание «тянет 120B»

Работа модели делится на две фазы. Prefill (prompt processing) — прочитать и осмыслить то, что вы прислали. Decode (generation) — выдать ответ по одному токену. Первая фаза упирается в вычислительную мощность, вторая — в скорость памяти. Поэтому одна и та же машина может быть быстрой в одном и медленной в другом.

Вот где расходятся наши три коробки — на одной модели и одной метке теста:

МашинаОбработка промпта (pp2048)Генерация (tg32)Во сколько раз prefill быстрее decode
DGX Spark1 723,07 → 2 443,9138,55 → 58,72×42
Mac Studio M3 Ultra863,73 (один источник)70,79 (один источник)×12
Strix Halo339,87 → 50034,13 → 55,57×10
3× RTX 3090 (для калибровки)1 641,89124,03×13
Скорость обработки промпта на модели gpt-oss-120b: DGX Spark 1723, Mac Studio M3 Ultra 864, Strix Halo 340 и три RTX 3090 — 1642 токена в секунду
Скорость генерации на той же модели gpt-oss-120b: DGX Spark 38,6, Mac Studio M3 Ultra 70,8, Strix Halo 34,1 и три RTX 3090 — 124 токена в секунду

Два графика выше — одна и та же модель, один и тот же тест, разные фазы работы. На первом Strix Halo отстаёт от DGX Spark впятеро, на втором разница исчезает. Порядок машин между графиками меняется полностью — и именно это делает вопрос «какая быстрее» бессмысленным без уточнения, о какой фазе речь.

Разрыв между DGX Spark и Strix Halo на генерации — 13%. На обработке промпта — пятикратный. Это и есть та развилка, ради которой стоит читать сравнение: машины, которые в коротком чате неотличимы, расходятся в разы, как только вы даёте им документ.

Насколько это ощутимо в секундах, показал единственный замер, где prefill и decode развели по времени явно. Команда EXO Labs прогнала Llama-3.1 8B в FP16 с промптом на 8192 токена и генерацией 32 токенов: DGX Spark обработал промпт за 1,47 секунды, Mac Studio M3 Ultra — за 5,57. На генерации порядок обратный: 2,87 секунды у Spark против 0,85 у Mac. В множителях это 3,8× в пользу Spark на prefill и 3,4× в пользу Mac на decode.

Оговорка обязательная: этот замер сделали разработчики программы, которая соединяет две машины в связку, — то есть заинтересованная сторона. Цифры при этом сходятся с общей картиной по компьюту и полосе памяти, поэтому мы их приводим, но как замер вендора софта, а не независимой лаборатории.

Контекст 32K: DGX Spark теряет 36% на промпте и 27% на генерации

Обе фазы деградируют по мере набора контекста, и здесь у нас есть единственный полный ряд — на DGX Spark:

Глубина контекстаОбработка промптаГенерация
0 (чистый старт)2 443,9158,72
32 768 токенов1 567,0842,76

Обработка просела на 36%, генерация — на 27%. У Strix Halo падение зависит от бекенда: на контексте 32K стандартный ROCm выдаёт 17,82 ток/с, Vulkan — 31,54, а собранная вручную ветка rocWMMA — 36,43. По Mac Studio такого ряда в открытом доступе нет вовсе; есть только качественные наблюдения владельцев, что на документе в 40–50 тысяч токенов машина становится заметно медленнее.

Именно здесь ломается обещание «тянет модель на 120 млрд параметров». Тянет — в смысле «помещается в память» и «выдаёт 40–70 токенов в секунду в коротком чате». Но задача, ради которой обычно и покупают 128 ГБ (разбор большого репозитория, поиск по своей базе документов, агент с длинной историей), — это как раз длинный промпт, и там расклад определяют совсем другие цифры.

Пропускная способность памяти предсказывает tok/s лучше, чем TOPS

Простое правило, которое работает точнее любого маркетингового слайда:

Потолок скорости генерации ≈ пропускная способность памяти ÷ объём весов модели.

Проверим на плотной 70B в 4-битном кванте (около 40 ГБ; в FP8 — около 70 ГБ):

МашинаИзмеренная (или паспортная) полосаМодельРасчётный потолокЗамер
DGX Spark273 ГБ/с70B FP8, ~70 ГБ~3,9 ток/с2,7–3
DGX Spark273 ГБ/с70B Q4, ~40 ГБ~6,8 ток/с4,42
Strix Halo215 ГБ/с (измерено)70B Q4, ~40 ГБ~5,4 ток/с4,5–5,05
Mac Studio M3 Ultra819 ГБ/с70B Q4, ~40 ГБ~20 ток/сзамера нет

Расчёт даёт верхнюю границу, а реальность до неё не дотягивает — часть полосы уходит на KV-кэш, накладные расходы бекенда и неидеальную работу контроллера памяти. Насколько именно не дотягивает, зависит от машины: у DGX Spark замеры дают 65–77% от расчётного потолка, у Strix Halo — 83–94%. Абсолютную цифру формула не заменяет, но порядок величины предсказывает точно, и это лучший имеющийся инструмент для машины, которую вы ещё не купили.

Показательная история: на форуме разработчиков NVIDIA человек пожаловался, что Llama 3.3 70B в FP8 выдаёт у него 2–3 токена в секунду, и спросил, что он настроил не так. Ответ был — ничего. Расчёт 273 ГБ/с ÷ 70 ГБ ≈ 3,9 при реальных 2,7–3 означает, что машина работает штатно, просто задача ей не по профилю.

Теперь сопоставим это с тем, что пишут в рекламных материалах:

Что заявляет вендорЧто измерено независимо
NVIDIA: «до 1 PFLOP FP4»101 TFLOPS BF16 и 207 TFLOPS FP8 (тест MAMF)
NVIDIA: «инференс моделей до 200 млрд параметров»помещаются — при квантовании в FP4; скорость не заявлена
Apple: «LLM объёмом более 600 млрд параметров»относится к конфигурации на 512 ГБ, снятой с продажи в марте 2026
AMD: «до 128 млрд параметров», «до 15 ток/с» на Llama 4 Scout20,23 ток/с на той же модели в Q4 — здесь вендор занизил
AMD: NPU на 50+ TOPSв llama.cpp NPU не участвует; на нём Mistral 7B даёт 4–5 ток/с против ~40 на видеоядре

Вывод из таблицы простой: TOPS и петафлопсы — это про пиковую вычислительную мощность в идеальном режиме, а генерация текста упирается в память. Единственная цифра из рекламного буклета, по которой можно что-то предсказать, — это объём и полоса памяти. Всё остальное надо перепроверять.

Отдельная деталь про NPU. У Strix Halo есть отдельный нейропроцессор, и его 50 TOPS вынесены на все слайды. В llama.cpp — главном движке для запуска моделей дома — он не задействован вообще. Независимый тест показал: Mistral 7B на NPU даёт 4–5 токенов в секунду, тогда как то же самое на встроенном видеоядре — около 40.

CUDA, Metal и ROCm: что реально запустится на каждой машине

Железо у трёх машин ближе друг к другу, чем программное обеспечение. Здесь разрыв больше, чем в цифрах.

DGX SparkMac Studio M3 UltraStrix Halo
ПлатформаCUDAMetal / MLXROCm, Vulkan
llama.cppиз коробки, CUDAиз коробки, MetalVulkan из коробки, ROCm с оговорками
Ollama / LM Studioдадада
vLLM (сервер, батчи)даограниченноограниченно
TensorRT-LLM, NIMданетнет
Дообучение (LoRA, QLoRA)штатнозаметно сложнеезаметно сложнее
Что придётся собирать рукамипочти ничегопочти ничеговетку rocWMMA под длинный контекст

Цена ручной работы измерима. На gpt-oss-120b при контексте 32K стандартный ROCm выдаёт 17,82 ток/с, Vulkan — 31,54, собранная вручную ветка rocWMMA — 36,43. То есть человек, который просто поставил ROCm и не стал разбираться, получает половину от возможного. Тот же эффект на плотной 70B, но в другую сторону: обработка промпта у HIP с rocWMMA — 94,7 ток/с против 26,4 у Vulkan, разница в 3,6 раза при почти одинаковой скорости генерации. Оптимального бекенда «на все случаи» у AMD пока нет — выбирать приходится под задачу.

На дообучении разрыв тоже измерен, и это единственная дисциплина, где две машины сравнили по-настоящему одной методикой. В тесте The Register QLoRA на Llama 3.1 70B заняла около 20 минут на DGX Spark и чуть больше 50 минут на Strix Halo. Mac Studio в этом сравнении не участвовал — под тренировку Apple-машины берут редко именно из-за отсутствия CUDA.

Ещё одна деталь, которую видно только в динамике: стек продолжает меняться прямо сейчас. 14 августа 2026 в llama.cpp приняли патч, меняющий способ определения доступной памяти на APU от AMD, — и вырос он из кода, который добавляли ради DGX Spark. Любой замер в этой нише имеет срок годности.

Цена результата: доллар за токен в секунду и за гигабайт памяти

Цены на 15 августа 2026. Считаем два показателя: сколько стоит один токен в секунду на gpt-oss-120b (по свежим замерам) и сколько стоит один гигабайт памяти, доступной модели.

МашинаЦенаПамять под модель$/ГБГенерация на 120B$ за 1 ток/с
DGX Spark Founders Edition$4 699128 ГБ$36,758,72$80
Framework Desktop (Strix Halo, 128 ГБ)$3 44996 ГБ (Windows)$35,955,57$62
Мини-ПК на Strix Halo из теста The Register$2 199–2 94996 ГБ (Windows)$22,9–30,755,57$40–53
Mac Studio M3 Ultra, 96 ГБбазовая конфигурация96 ГБ70,79 (один источник)

Базовую цену Mac Studio Apple на странице магазина не показывает, поэтому колонки по нему мы оставили пустыми, а не подставили цифру из вторых рук. Известно другое: апгрейд памяти до 256 ГБ стоит $2 000 — до марта 2026 он стоил $1 600.

История цен здесь важнее самих цен, потому что она объясняет, почему любая сравнительная таблица в этой нише живёт недели:

  • DGX Spark. NVIDIA официально подняла цену Founders Edition с $3 999 до $4 699 — объявление от 25 февраля 2026, причина названа прямо: «мировые ограничения поставок памяти». Конфигурация при этом не менялась.
  • Framework Desktop. Со 128 ГБ на старте стоил $1 999, на 15 августа 2026 в конфигураторе — $3 449, и в наличии его нет. Рост в 1,7 раза.
  • Mac Studio. В первую неделю марта 2026 Apple убрала из продажи конфигурацию на 512 ГБ (она стоила $9 499) и подняла цену апгрейда до 256 ГБ на $400. Именно эти 512 ГБ были единственной причиной покупать Mac Studio под самые крупные открытые модели — в них целиком помещался DeepSeek R1 на 671 млрд параметров.

Последний пункт стоит подчеркнуть, потому что его до сих пор не заметили популярные сравнения: материалы, написанные в августе 2026, всё ещё противопоставляют «128 ГБ у DGX Spark против 512 ГБ у Mac Studio». Купить эти 512 ГБ новыми нельзя уже полгода.

Отдельно про энергию. У DGX Spark блок питания на 240 Вт при TDP чипа 140 Вт — это единственная из трёх машин, у которой обе цифры есть в официальной спецификации. AMD публикует диапазон TDP платформы, а не потребление конкретного бокса под нагрузкой языковой моделью; Apple не публикует ничего. Свести все три машины по ваттам из официальных данных нельзя, поэтому расчёт «токенов на ватт» мы не делаем — он был бы наполовину выдуманным.

Почему цифры не сходятся: разные стенды, даты и версии бекендов

Вот всё, что мешает считать таблицы выше окончательными.

Ни одна лаборатория не измерила все три машины сама. Из шестнадцати разобранных материалов ни в одном нет тройного сравнения на одном стенде с одной методикой. Самое близкое — тест The Register, где на одном стенде сравнили две машины из трёх. Всё остальное — сведение чужих прогонов, включая наше.

Даты разъезжаются на месяцы. Замеры Strix Halo, которые чаще всего цитируют, сняты осенью 2025 года; свежие прогоны на сборках мая–июня 2026 дают в 1,6 раза больше. У DGX Spark та же история: 1 737 ток/с на промпте в октябре 2025 против 2 444 в свежем официальном файле. Сравнивать осенние цифры одной машины с летними цифрами другой некорректно, и мы старались этого избежать — но в главной таблице такие пары остались, и это помечено стрелками.

Кванты разные. DGX Spark чаще меряют в MXFP4 и NVFP4, Strix Halo — в MXFP4, Q4_K_XL и BF16, Mac — в Q4 и MLX. Ни одного одинакового кванта на всех трёх машинах в открытых замерах нет. Насколько при этом отличается качество ответов — отдельная тема, которую цифрами tok/s не закрыть.

Строка Mac Studio в главной таблице стоит на одном источнике. Мы искали подтверждение целенаправленно: в официальных бенчмарках llama.cpp по gpt-oss-120b Apple представлена M2 Ultra, а не M3 Ultra, и бекенд у широко цитируемой строки не назван вовсе.

Времени до первого токена нет почти нигде. Практически весь спор «prefill против decode» — это спор о том, сколько секунд вы смотрите на пустой экран. Абсолютные секунды есть только у EXO и только на модели 8B.

Что изменится в ближайшее время. У AMD дозревает ROCm и ветка rocWMMA — разрыв со стандартным ROCm уже двукратный в пользу ручной сборки, и когда эти оптимизации доедут до релизов, цифры Strix Halo вырастут ещё раз. У NVIDIA прирост даёт связка NVFP4 и спекулятивное декодирование. Apple меняет поколения чипов и, судя по мартовскому решению, конфигурации памяти. Любую таблицу в этой нише имеет смысл перепроверять раз в квартал.

Риски покупки: что обесценит выбор за ближайшие полгода

  • Память распаяна у всех троих. У DGX Spark 128 ГБ фиксированы конструктивно, у Framework Desktop LPDDR5x несъёмная (сама компания объясняла, что модульную память на 256-битной шине сделать не вышло), у Apple память в упаковке чипа. Ошибку с объёмом при покупке апгрейдом не лечат.
  • Дефицит памяти продолжается. За полгода 2026-го он поднял цену DGX Spark на 18%, Framework Desktop — в 1,7 раза и вынудил Apple убрать топовую конфигурацию. Ставка на «подожду, подешевеет» пока не оправдывается.
  • Экосистема AMD требует времени владельца. Разница между «поставил ROCm» и «собрал rocWMMA» — двукратная. Тот, кто не готов возиться, получает худшую половину заявленных цифр.
  • Обещание «тянет 120B» держится на архитектуре MoE. Смените модель на плотную того же класса — и скорость упадёт кратно. Планировать покупку под «модели на 100 млрд» без уточнения архитектуры нельзя.
  • Заявления вендоров не переносятся в таблицу как замеры. «До 1 PFLOP FP4», «более 600 млрд параметров», «до 128 млрд» — это границы возможного при идеальных условиях, а не то, что вы увидите в терминале.
  • Дискретные карты никуда не делись. Три подержанные RTX 3090 дают 124 ток/с на той же gpt-oss-120b — вдвое больше свежей цифры DGX Spark (58,72) — при 72 ГБ суммарной видеопамяти и совсем другом энергопотреблении. Если ваша модель влезает в видеопамять, единая память вам не нужна вовсе.

Какую из трёх брать под вашу модель: три сценария

Прямого совета, какую коробку заказывать, здесь нет. Ниже — пороги, по которым решение принимается само.

Сценарий 1. Модель влезает в 32 ГБ (до 30B в 4-битном кванте). Ни одна из трёх машин здесь не нужна. Дискретная видеокарта даст кратно больше токенов в секунду за те же или меньшие деньги. Ориентиры по конфигурациям — в общем гайде по железу под локальные модели.

Сценарий 2. Нужны MoE-модели класса 100–120 млрд параметров и длинный контекст. Здесь развилка проходит по типу нагрузки:

  • в основном короткие диалоги — разница между машинами в пределах 13–25%, решает цена, и Strix Halo в боксе за $2 200–3 400 выглядит рациональнее;
  • документы, поиск по своей базе, агенты с длинной историей — prefill решает всё, и пятикратный перевес DGX Spark на обработке промпта превращается в разницу между тремя секундами ожидания и пятнадцатью;
  • нужен CUDA (существующий код, vLLM, TensorRT-LLM, дообучение) — альтернативы DGX Spark среди этих трёх нет.

Сценарий 3. Нужны плотные модели крупнее 70 млрд параметров. Честный ответ: ни одна из трёх машин не даст комфортной скорости при батче 1. Ищите либо самую широкую полосу памяти (Mac Studio на M3 Ultra), либо смиритесь с фоновым режимом, либо смотрите в сторону сборки на нескольких дискретных картах.

Ещё один вариант, который стоит знать: машины можно соединять. Два DGX Spark связываются напрямую через ConnectX-7 и, по заявлению NVIDIA, тянут модели до 405 млрд параметров. А EXO показала связку, где обработку промпта берёт DGX Spark, а генерацию — Mac Studio: 2,8× к одному Mac. Независимого повторения этого замера пока нет, и делали его разработчики самого софта. Про модульность конкретного бокса на Strix Halo — в его отдельном разборе, ссылка выше в разделе про цены.

FAQ

Сколько токенов в секунду нужно, чтобы локальный чат не раздражал?

Универсального порога нет, но есть ориентир от скорости чтения: комфортный темп начинается примерно с 15–20 токенов в секунду, а разговорным ощущается 30 и выше. Всё, что ниже 10, годится для фоновых задач — поставить и вернуться. Плотная модель на 70 млрд параметров на этих машинах даёт 2,7–5 токенов в секунду, то есть попадает именно в фоновый режим, а не в интерактивный.

Почему MoE-модель на 120 млрд параметров работает быстрее плотной на 32 млрд?

Потому что скорость генерации определяется объёмом весов, которые нужно прочитать из памяти на каждый токен. У MoE активируется малая часть сети: в gpt-oss-120b из 117 млрд параметров считается около 5 млрд. Плотная модель читает все свои веса целиком. Замер на одной машине это подтверждает: 89,3 токена в секунду у MoE на 30 млрд против 10,7 у плотной на 32 млрд.

Можно ли запустить DeepSeek R1 на 671B на любой из этих трёх машин?

В 4-битном кванте эта модель занимает около 350–400 ГБ. Столько памяти была только у Mac Studio в конфигурации на 512 ГБ, и Apple сняла её с продажи в марте 2026 — сейчас максимум составляет 256 ГБ. У DGX Spark и Strix Halo по 128 ГБ, модель туда не помещается. Остаются варианты с объединением нескольких машин или более агрессивное квантование с потерей качества.

Сколько памяти реально останется под модель после операционной системы?

У DGX Spark и Mac Studio память когерентная: делить её между процессором и ускорителем не нужно, но система всё равно занимает часть, поэтому под модель планируйте на 10–20 ГБ меньше номинала. У Strix Halo ситуация иная: под Windows видеоядру отдают до 96 ГБ из 128 через механизм Variable Graphics Memory, под Linux потолок поднимают параметрами ядра. Без этой настройки модель может молча уехать считаться на процессор.

Влияет ли NPU на скорость локальной языковой модели?

Практически нет. Нейропроцессор у Strix Halo рекламируется как 50+ TOPS, но llama.cpp его не использует, а специализированные пути дают меньше, чем встроенное видеоядро: независимый тест показал 4–5 токенов в секунду на Mistral 7B через NPU против примерно 40 на видеоядре. При выборе машины под запуск LLM цифра TOPS у NPU практического значения не имеет.

Есть ли смысл соединять две машины в кластер?

Смысл есть, но выигрыш зависит от того, что именно вы соединяете. Два DGX Spark связываются напрямую через ConnectX-7 на 200 Гбит/с, и NVIDIA заявляет поддержку моделей до 405 млрд параметров. Более интересный случай — связка разнородных машин: EXO показала схему, где промпт обрабатывает DGX Spark, а токены генерирует Mac Studio, и это даёт 2,8× к одному Mac. Замер сделан разработчиком софта и независимо не повторён.

Поделиться
Связаться:
Крипто- и data-аналитик, инженер-программист (факультет компьютерных наук ХНУРЭ). В IT с 2008 года: администрировал корпоративный мониторинг в «Vodafone Украина», семь лет разрабатывал и продвигал веб-проекты, пять лет руководил маркетингом на метриках — конверсия, CTR, ROI, LTV.Криптовалютными рынками занимаюсь с 2021 года: ончейн-метрики, токеномика, макроэкономические индикаторы. Разработал собственную data-driven модель анализа рынка на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математическая статистика и EDA; сбор и сверку данных автоматизирую AI-агентами.Принцип — «Don't trust, verify»: каждая цифра проверена по первоисточнику, ключевые — минимум по двум независимым; прогнозы — только сценарии с условиями. Тезис без данных не публикуется.