Коротко (TL;DR)
- Все три машины держат в памяти модель на 120 млрд параметров, и все три спотыкаются на плотной модели на 70 млрд. Причина одна: генерация упирается не в вычисления, а в скорость чтения весов из памяти.
- На генерации разрыв между DGX Spark и Strix Halo — 13%. На обработке промпта — пятикратный. Именно поэтому машины, которые в чате ощущаются одинаково, ведут себя совершенно по-разному, как только вы даёте им длинный документ.
- Плотная 70B в 4-битном кванте: 2,7–4,42 ток/с на DGX Spark, 4,5–5,05 на Strix Halo. Это скорость чтения по слогам. Mac Studio M3 Ultra по полосе памяти быстрее втрое, но публичного замера с описанной методикой на этой модели найти не удалось.
- MoE-модель gpt-oss-120b идёт у всех: 38,55–58,72 ток/с (DGX Spark), 34,13–55,57 (Strix Halo), 70,79 у Mac Studio — последняя цифра встречается ровно в одном источнике и никем не подтверждена.
- Одна и та же таблица гуляет по половине выдачи и тащит за собой ошибку: половина сравнений приписывает Strix Halo пропускную способность 273 ГБ/с, хотя это цифра DGX Spark.
- Цены пересобрал дефицит памяти: DGX Spark подорожал на 18% в феврале 2026, Framework Desktop со 128 ГБ — с $1 999 до $3 449, а конфигурация Mac Studio на 512 ГБ снята с продажи в марте 2026. Данные на 15 августа 2026.
Своих машин у нас нет — ни одной из трёх. Поэтому дальше нет ни строчки «мы прогнали»: это сведение чужих замеров к одной методике, и у каждой цифры написано, чей это прогон, на какой модели, в каком кванте, каким бекендом и на какой длине промпта.
- Коротко (TL;DR)
- Что общего у DGX Spark, Mac Studio и Strix Halo: единая память
- Как мы отбирали цифры: модель, квант, бекенд, длина контекста
- Скорость на 70B и 120B: DGX Spark, Mac Studio и Strix Halo в таблице
- Prompt processing: почему длинный промпт ломает обещание «тянет 120B»
- Пропускная способность памяти предсказывает tok/s лучше, чем TOPS
- CUDA, Metal и ROCm: что реально запустится на каждой машине
- Цена результата: доллар за токен в секунду и за гигабайт памяти
- Почему цифры не сходятся: разные стенды, даты и версии бекендов
- Риски покупки: что обесценит выбор за ближайшие полгода
- Какую из трёх брать под вашу модель: три сценария
- FAQ
Что общего у DGX Spark, Mac Studio и Strix Halo: единая память
Все три машины построены на одной идее — единой памяти (unified memory). Обычный игровой ПК держит два раздельных пула: системную оперативную память для процессора и видеопамять на карте. Модель, которая не влезла в видеопамять, либо не запускается, либо частично считается процессором и работает мучительно медленно. В машинах с единой памятью пул один, и ускоритель адресует его целиком.
Отсюда главный выигрыш: влезает больше. У NVIDIA DGX Spark — 128 ГБ LPDDR5x, у Mac Studio на M3 Ultra — до 256 ГБ, у Ryzen AI Max+ 395 — до 128 ГБ LPDDR5X-8000. Дискретная RTX 5090 даёт 32 ГБ. Модель весом 59 ГБ на карту не положить вовсе, а на любую из этих трёх коробок — можно. Про сам бокс NVIDIA и его софтовый стек у нас есть отдельный разбор.
И отсюда же главная плата: считает медленнее. Скорость генерации текста определяется тем, как быстро железо успевает прочитать веса модели из памяти. У RTX 5090 полоса памяти — 1 792 ГБ/с, у RTX 3090 — около 936 ГБ/с. У наших трёх машин:Машина Память Полоса по паспорту Полоса измеренная NVIDIA DGX Spark (GB10) 128 ГБ LPDDR5x, когерентная 273 ГБ/с отдельного публичного замера нет Apple Mac Studio M3 Ultra до 256 ГБ единой памяти 819 ГБ/с отдельного публичного замера нет AMD Ryzen AI Max+ 395 (Strix Halo) до 128 ГБ LPDDR5X-8000, шина 256 бит 256 ГБ/с 212–215 ГБ/с
Есть и третье отличие, о котором в сравнениях обычно молчат: у трёх машин разная степень «единости» памяти. У DGX Spark память когерентная — процессор и ускоритель видят одни и те же адреса, делить ничего не нужно. У Apple то же самое. А у Strix Halo память делится: под Windows драйвер Adrenalin отдаёт видеоядру до 96 ГБ из 128 через механизм Variable Graphics Memory, под Linux потолок поднимают параметрами ядра. Как именно это настраивается и что ломается без настройки — в подробном разборе Ryzen AI Max+ 395. Обмен между процессорной и графической частью идёт со скоростью около 84 ГБ/с — это ещё одно узкое место, которого у двух других машин нет.
Дальше — не пересказ этих разборов. Каждый из них отвечает на вопрос «что потянет эта машина». Здесь вопрос другой: какую из трёх брать под конкретную модель, и почему ответ зависит не от числа миллиардов в её названии.
Как мы отбирали цифры: модель, квант, бекенд, длина контекста
Цифра «столько-то токенов в секунду» без пяти уточнений не значит ничего. Вот эти пять:
- Какая модель. Плотная (dense) или MoE — разница в скорости кратная, объяснение ниже.
- Какой квант. Квантование — это сжатие весов модели: вместо 16 бит на число хранят 8, 4 или меньше. Модель на 70 млрд параметров в 4-битном кванте весит около 40 ГБ, в 8-битном — вдвое больше, и читается вдвое дольше.
- Какой бекенд и его версия. llama.cpp с CUDA, Metal, Vulkan или ROCm — это разные программы, а не разные названия одной.
- Какая длина промпта и глубина контекста. Метка
pp2048означает обработку промпта в 2048 токенов,tg32— генерацию 32 токенов,tg128@d32768— генерацию при уже набранном контексте в 32 768 токенов. Это разные тесты, и складывать их в одну колонку нельзя. - Когда снят замер. Стек меняется быстрее железа: у Strix Halo цифры на gpt-oss-120b выросли с 34,13 до 55,57 ток/с за полгода без единого изменения в машине.
По этим правилам мы отбраковали большую часть того, что лежит в выдаче. Что именно улетело:
- Строки без бекенда. В двух популярных сравнениях в колонке «backend» стоят прочерки, хотя на Strix Halo один только выбор бекенда меняет результат вдвое.
- Цифра «30–35 ток/с на плотной Llama 3.3 70B» у Strix Halo. Встречается на нескольких контент-сайтах, не сопровождается ни бекендом, ни версией стека и расходится с двумя независимыми замерами в шесть раз. Первоисточника у неё не нашлось.
- Перепечатки. Таблица
1723,07 / 339,87 / 863,73дословно повторяется как минимум у трёх крупных сравнений. Это не три подтверждения, а одно: у всех один источник — сводка Hardware Corner. - Ошибка, которая едет вместе с таблицей. Два из этих сравнений (включая единственное русскоязычное) приписывают Strix Halo полосу памяти 273 ГБ/с. Это паспортная цифра DGX Spark. У Strix Halo паспорт — 256 ГБ/с, измеренная величина — 212–215.
Опорной точкой мы взяли официальный файл бенчмарков llama.cpp по DGX Spark: там указаны и сборка (11fb327bf), и версия CUDA (13.0), и драйвер (580.95.05), и все параметры прогона — размер батча 2048, flash attention включён, все слои на ускорителе. Такой паспорт замера — редкость, и именно к нему мы приводим остальные цифры.
Скорость на 70B и 120B: DGX Spark, Mac Studio и Strix Halo в таблице
Главная таблица статьи. Цифры — скорость генерации (decode), то есть выдачи ответа; обработка промпта разобрана в следующем разделе отдельно, потому что она ведёт себя иначе. Все данные — на 15 августа 2026.Модель Тип Вес DGX Spark Mac Studio M3 Ultra Strix Halo Чем и как мерили Llama 3.x 70B, Q4 плотная ~40 ГБ 4,42 замера с методикой нет 5,05 Ollama (Spark); llama.cpp Vulkan, pp512/tg128 (Halo) Llama 3.3 70B, FP8 плотная ~70 ГБ 2,7–3 н/д н/д vLLM, батч 1 Shisa V2 70B, Q4_K_M плотная ~41 ГБ н/д н/д 5,0 (Vulkan) / 4,5 (rocWMMA) llama.cpp b5863, ROCm 7.0 nightly Command-A 111B, Q8 плотная ~110 ГБ н/д 3,24 н/д KoboldCpp, контекст 13,7 тыс. Llama 3.1 405B, q6 плотная ~330 ГБ н/д 1,25 н/д KoboldCpp, контекст 12,4 тыс. gpt-oss-120b, MXFP4 MoE, ~5B активных 59 ГБ 38,55 → 58,72 70,79 (один источник) 34,13 → 55,57 llama-bench, tg32 Llama 4 Scout 109B, Q4 MoE, 17B активных 57,9 ГБ н/д н/д 20,23 llama.cpp Vulkan, tg128 Qwen3 32B, Q4_K_M плотная ~18 ГБ 10,7 н/д н/д llama.cpp, контекст 512 Qwen3 30B-A3B MoE, 3,3B активных ~17 ГБ 89,3 (Q4_K_M) н/д 100,04 (IQ4_XS) llama.cpp (Spark); RADV Vulkan (Halo)
Стрелка в строке gpt-oss-120b — это не разброс замеров, а хронология: слева цифра осеннего стека 2025 года, справа — весенне-летнего 2026. Машина та же.
Три вывода читаются прямо из таблицы.
Первый: на плотной 70B никто не выигрывает. Четыре независимых замера на двух машинах дают 2,7–5,05 ток/с. Для сравнения: человек читает вслух примерно 3–4 слова в секунду, а токен обычно короче слова. То есть модель выдаёт текст медленнее, чем вы его читаете вслух. Работать так можно только в фоновом режиме — поставил задачу, ушёл.
Второй: на MoE-модели того же класса всё внезапно хорошо. gpt-oss-120b формально втрое крупнее, а идёт в 7–14 раз быстрее плотной 70B. Разгадка — в архитектуре.
Третий: у Mac Studio M3 Ultra в этой таблице зияющие дыры, и это не наша лень. Apple-машину меряют реже всех, и почти никогда — с указанием бекенда. Единственная цифра Mac Studio на gpt-oss-120b встречается ровно в одном источнике; в официальных бенчмарках llama.cpp по этой модели Apple представлена не M3 Ultra, а M2 Ultra — 1244,57 ток/с на промпте (pp2048) и 79,68 на генерации, но уже по метке tg128, а не tg32, то есть и её в одну колонку с остальными не поставить. Мы оставили строку в таблице с пометкой, а не выбросили, потому что её цитируют повсеместно — и читателю полезно знать, что за ней стоит.
Плотная модель против MoE: почему 120 млрд быстрее 32 млрд
MoE (mixture of experts, «смесь экспертов») — это модель, разбитая на много специализированных подсетей. На каждый токен активируется лишь малая их часть. В gpt-oss-120b всего 116,83 млрд параметров, а считается около 5 млрд. У Llama 4 Scout из 109 млрд активны 17 млрд.
Ключевой момент, который часто путают: в памяти лежат ВСЕ параметры. AMD в собственном блоге формулирует это прямо: «все 109 млрд параметров должны храниться в памяти, то есть занимаемый объём такой же, как у плотной модели на 109 млрд». Экономится не место, а чтение.
Цифра, которая это доказывает, снята на одной и той же машине: на DGX Spark плотная Qwen3 32B даёт 10,7 ток/с, а MoE Qwen3 30B — 89,3 ток/с. Разрыв восьмикратный при почти одинаковом числе параметров. Если вы выбираете машину под конкретную задачу, начинать надо с вопроса «какая у моей модели архитектура», а не «сколько в ней миллиардов». Что выбрать из моделей — разбирали в гайде по локальным моделям.
Prompt processing: почему длинный промпт ломает обещание «тянет 120B»
Работа модели делится на две фазы. Prefill (prompt processing) — прочитать и осмыслить то, что вы прислали. Decode (generation) — выдать ответ по одному токену. Первая фаза упирается в вычислительную мощность, вторая — в скорость памяти. Поэтому одна и та же машина может быть быстрой в одном и медленной в другом.
Вот где расходятся наши три коробки — на одной модели и одной метке теста:Машина Обработка промпта (pp2048) Генерация (tg32) Во сколько раз prefill быстрее decode DGX Spark 1 723,07 → 2 443,91 38,55 → 58,72 ×42 Mac Studio M3 Ultra 863,73 (один источник) 70,79 (один источник) ×12 Strix Halo 339,87 → 500 34,13 → 55,57 ×10 3× RTX 3090 (для калибровки) 1 641,89 124,03 ×13 

Два графика выше — одна и та же модель, один и тот же тест, разные фазы работы. На первом Strix Halo отстаёт от DGX Spark впятеро, на втором разница исчезает. Порядок машин между графиками меняется полностью — и именно это делает вопрос «какая быстрее» бессмысленным без уточнения, о какой фазе речь.
Разрыв между DGX Spark и Strix Halo на генерации — 13%. На обработке промпта — пятикратный. Это и есть та развилка, ради которой стоит читать сравнение: машины, которые в коротком чате неотличимы, расходятся в разы, как только вы даёте им документ.
Насколько это ощутимо в секундах, показал единственный замер, где prefill и decode развели по времени явно. Команда EXO Labs прогнала Llama-3.1 8B в FP16 с промптом на 8192 токена и генерацией 32 токенов: DGX Spark обработал промпт за 1,47 секунды, Mac Studio M3 Ultra — за 5,57. На генерации порядок обратный: 2,87 секунды у Spark против 0,85 у Mac. В множителях это 3,8× в пользу Spark на prefill и 3,4× в пользу Mac на decode.
Оговорка обязательная: этот замер сделали разработчики программы, которая соединяет две машины в связку, — то есть заинтересованная сторона. Цифры при этом сходятся с общей картиной по компьюту и полосе памяти, поэтому мы их приводим, но как замер вендора софта, а не независимой лаборатории.
Контекст 32K: DGX Spark теряет 36% на промпте и 27% на генерации
Обе фазы деградируют по мере набора контекста, и здесь у нас есть единственный полный ряд — на DGX Spark:Глубина контекста Обработка промпта Генерация 0 (чистый старт) 2 443,91 58,72 32 768 токенов 1 567,08 42,76
Обработка просела на 36%, генерация — на 27%. У Strix Halo падение зависит от бекенда: на контексте 32K стандартный ROCm выдаёт 17,82 ток/с, Vulkan — 31,54, а собранная вручную ветка rocWMMA — 36,43. По Mac Studio такого ряда в открытом доступе нет вовсе; есть только качественные наблюдения владельцев, что на документе в 40–50 тысяч токенов машина становится заметно медленнее.
Именно здесь ломается обещание «тянет модель на 120 млрд параметров». Тянет — в смысле «помещается в память» и «выдаёт 40–70 токенов в секунду в коротком чате». Но задача, ради которой обычно и покупают 128 ГБ (разбор большого репозитория, поиск по своей базе документов, агент с длинной историей), — это как раз длинный промпт, и там расклад определяют совсем другие цифры.
Пропускная способность памяти предсказывает tok/s лучше, чем TOPS
Простое правило, которое работает точнее любого маркетингового слайда:
Потолок скорости генерации ≈ пропускная способность памяти ÷ объём весов модели.
Проверим на плотной 70B в 4-битном кванте (около 40 ГБ; в FP8 — около 70 ГБ):Машина Измеренная (или паспортная) полоса Модель Расчётный потолок Замер DGX Spark 273 ГБ/с 70B FP8, ~70 ГБ ~3,9 ток/с 2,7–3 DGX Spark 273 ГБ/с 70B Q4, ~40 ГБ ~6,8 ток/с 4,42 Strix Halo 215 ГБ/с (измерено) 70B Q4, ~40 ГБ ~5,4 ток/с 4,5–5,05 Mac Studio M3 Ultra 819 ГБ/с 70B Q4, ~40 ГБ ~20 ток/с замера нет
Расчёт даёт верхнюю границу, а реальность до неё не дотягивает — часть полосы уходит на KV-кэш, накладные расходы бекенда и неидеальную работу контроллера памяти. Насколько именно не дотягивает, зависит от машины: у DGX Spark замеры дают 65–77% от расчётного потолка, у Strix Halo — 83–94%. Абсолютную цифру формула не заменяет, но порядок величины предсказывает точно, и это лучший имеющийся инструмент для машины, которую вы ещё не купили.
Показательная история: на форуме разработчиков NVIDIA человек пожаловался, что Llama 3.3 70B в FP8 выдаёт у него 2–3 токена в секунду, и спросил, что он настроил не так. Ответ был — ничего. Расчёт 273 ГБ/с ÷ 70 ГБ ≈ 3,9 при реальных 2,7–3 означает, что машина работает штатно, просто задача ей не по профилю.
Теперь сопоставим это с тем, что пишут в рекламных материалах:Что заявляет вендор Что измерено независимо NVIDIA: «до 1 PFLOP FP4» 101 TFLOPS BF16 и 207 TFLOPS FP8 (тест MAMF) NVIDIA: «инференс моделей до 200 млрд параметров» помещаются — при квантовании в FP4; скорость не заявлена Apple: «LLM объёмом более 600 млрд параметров» относится к конфигурации на 512 ГБ, снятой с продажи в марте 2026 AMD: «до 128 млрд параметров», «до 15 ток/с» на Llama 4 Scout 20,23 ток/с на той же модели в Q4 — здесь вендор занизил AMD: NPU на 50+ TOPS в llama.cpp NPU не участвует; на нём Mistral 7B даёт 4–5 ток/с против ~40 на видеоядре
Вывод из таблицы простой: TOPS и петафлопсы — это про пиковую вычислительную мощность в идеальном режиме, а генерация текста упирается в память. Единственная цифра из рекламного буклета, по которой можно что-то предсказать, — это объём и полоса памяти. Всё остальное надо перепроверять.
Отдельная деталь про NPU. У Strix Halo есть отдельный нейропроцессор, и его 50 TOPS вынесены на все слайды. В llama.cpp — главном движке для запуска моделей дома — он не задействован вообще. Независимый тест показал: Mistral 7B на NPU даёт 4–5 токенов в секунду, тогда как то же самое на встроенном видеоядре — около 40.
CUDA, Metal и ROCm: что реально запустится на каждой машине
Железо у трёх машин ближе друг к другу, чем программное обеспечение. Здесь разрыв больше, чем в цифрах.DGX Spark Mac Studio M3 Ultra Strix Halo Платформа CUDA Metal / MLX ROCm, Vulkan llama.cpp из коробки, CUDA из коробки, Metal Vulkan из коробки, ROCm с оговорками Ollama / LM Studio да да да vLLM (сервер, батчи) да ограниченно ограниченно TensorRT-LLM, NIM да нет нет Дообучение (LoRA, QLoRA) штатно заметно сложнее заметно сложнее Что придётся собирать руками почти ничего почти ничего ветку rocWMMA под длинный контекст
Цена ручной работы измерима. На gpt-oss-120b при контексте 32K стандартный ROCm выдаёт 17,82 ток/с, Vulkan — 31,54, собранная вручную ветка rocWMMA — 36,43. То есть человек, который просто поставил ROCm и не стал разбираться, получает половину от возможного. Тот же эффект на плотной 70B, но в другую сторону: обработка промпта у HIP с rocWMMA — 94,7 ток/с против 26,4 у Vulkan, разница в 3,6 раза при почти одинаковой скорости генерации. Оптимального бекенда «на все случаи» у AMD пока нет — выбирать приходится под задачу.
На дообучении разрыв тоже измерен, и это единственная дисциплина, где две машины сравнили по-настоящему одной методикой. В тесте The Register QLoRA на Llama 3.1 70B заняла около 20 минут на DGX Spark и чуть больше 50 минут на Strix Halo. Mac Studio в этом сравнении не участвовал — под тренировку Apple-машины берут редко именно из-за отсутствия CUDA.
Ещё одна деталь, которую видно только в динамике: стек продолжает меняться прямо сейчас. 14 августа 2026 в llama.cpp приняли патч, меняющий способ определения доступной памяти на APU от AMD, — и вырос он из кода, который добавляли ради DGX Spark. Любой замер в этой нише имеет срок годности.
Цена результата: доллар за токен в секунду и за гигабайт памяти
Цены на 15 августа 2026. Считаем два показателя: сколько стоит один токен в секунду на gpt-oss-120b (по свежим замерам) и сколько стоит один гигабайт памяти, доступной модели.Машина Цена Память под модель $/ГБ Генерация на 120B $ за 1 ток/с DGX Spark Founders Edition $4 699 128 ГБ $36,7 58,72 $80 Framework Desktop (Strix Halo, 128 ГБ) $3 449 96 ГБ (Windows) $35,9 55,57 $62 Мини-ПК на Strix Halo из теста The Register $2 199–2 949 96 ГБ (Windows) $22,9–30,7 55,57 $40–53 Mac Studio M3 Ultra, 96 ГБ базовая конфигурация 96 ГБ — 70,79 (один источник) —
Базовую цену Mac Studio Apple на странице магазина не показывает, поэтому колонки по нему мы оставили пустыми, а не подставили цифру из вторых рук. Известно другое: апгрейд памяти до 256 ГБ стоит $2 000 — до марта 2026 он стоил $1 600.
История цен здесь важнее самих цен, потому что она объясняет, почему любая сравнительная таблица в этой нише живёт недели:
- DGX Spark. NVIDIA официально подняла цену Founders Edition с $3 999 до $4 699 — объявление от 25 февраля 2026, причина названа прямо: «мировые ограничения поставок памяти». Конфигурация при этом не менялась.
- Framework Desktop. Со 128 ГБ на старте стоил $1 999, на 15 августа 2026 в конфигураторе — $3 449, и в наличии его нет. Рост в 1,7 раза.
- Mac Studio. В первую неделю марта 2026 Apple убрала из продажи конфигурацию на 512 ГБ (она стоила $9 499) и подняла цену апгрейда до 256 ГБ на $400. Именно эти 512 ГБ были единственной причиной покупать Mac Studio под самые крупные открытые модели — в них целиком помещался DeepSeek R1 на 671 млрд параметров.
Последний пункт стоит подчеркнуть, потому что его до сих пор не заметили популярные сравнения: материалы, написанные в августе 2026, всё ещё противопоставляют «128 ГБ у DGX Spark против 512 ГБ у Mac Studio». Купить эти 512 ГБ новыми нельзя уже полгода.
Отдельно про энергию. У DGX Spark блок питания на 240 Вт при TDP чипа 140 Вт — это единственная из трёх машин, у которой обе цифры есть в официальной спецификации. AMD публикует диапазон TDP платформы, а не потребление конкретного бокса под нагрузкой языковой моделью; Apple не публикует ничего. Свести все три машины по ваттам из официальных данных нельзя, поэтому расчёт «токенов на ватт» мы не делаем — он был бы наполовину выдуманным.
Почему цифры не сходятся: разные стенды, даты и версии бекендов
Вот всё, что мешает считать таблицы выше окончательными.
Ни одна лаборатория не измерила все три машины сама. Из шестнадцати разобранных материалов ни в одном нет тройного сравнения на одном стенде с одной методикой. Самое близкое — тест The Register, где на одном стенде сравнили две машины из трёх. Всё остальное — сведение чужих прогонов, включая наше.
Даты разъезжаются на месяцы. Замеры Strix Halo, которые чаще всего цитируют, сняты осенью 2025 года; свежие прогоны на сборках мая–июня 2026 дают в 1,6 раза больше. У DGX Spark та же история: 1 737 ток/с на промпте в октябре 2025 против 2 444 в свежем официальном файле. Сравнивать осенние цифры одной машины с летними цифрами другой некорректно, и мы старались этого избежать — но в главной таблице такие пары остались, и это помечено стрелками.
Кванты разные. DGX Spark чаще меряют в MXFP4 и NVFP4, Strix Halo — в MXFP4, Q4_K_XL и BF16, Mac — в Q4 и MLX. Ни одного одинакового кванта на всех трёх машинах в открытых замерах нет. Насколько при этом отличается качество ответов — отдельная тема, которую цифрами tok/s не закрыть.
Строка Mac Studio в главной таблице стоит на одном источнике. Мы искали подтверждение целенаправленно: в официальных бенчмарках llama.cpp по gpt-oss-120b Apple представлена M2 Ultra, а не M3 Ultra, и бекенд у широко цитируемой строки не назван вовсе.
Времени до первого токена нет почти нигде. Практически весь спор «prefill против decode» — это спор о том, сколько секунд вы смотрите на пустой экран. Абсолютные секунды есть только у EXO и только на модели 8B.
Что изменится в ближайшее время. У AMD дозревает ROCm и ветка rocWMMA — разрыв со стандартным ROCm уже двукратный в пользу ручной сборки, и когда эти оптимизации доедут до релизов, цифры Strix Halo вырастут ещё раз. У NVIDIA прирост даёт связка NVFP4 и спекулятивное декодирование. Apple меняет поколения чипов и, судя по мартовскому решению, конфигурации памяти. Любую таблицу в этой нише имеет смысл перепроверять раз в квартал.
Риски покупки: что обесценит выбор за ближайшие полгода
- Память распаяна у всех троих. У DGX Spark 128 ГБ фиксированы конструктивно, у Framework Desktop LPDDR5x несъёмная (сама компания объясняла, что модульную память на 256-битной шине сделать не вышло), у Apple память в упаковке чипа. Ошибку с объёмом при покупке апгрейдом не лечат.
- Дефицит памяти продолжается. За полгода 2026-го он поднял цену DGX Spark на 18%, Framework Desktop — в 1,7 раза и вынудил Apple убрать топовую конфигурацию. Ставка на «подожду, подешевеет» пока не оправдывается.
- Экосистема AMD требует времени владельца. Разница между «поставил ROCm» и «собрал rocWMMA» — двукратная. Тот, кто не готов возиться, получает худшую половину заявленных цифр.
- Обещание «тянет 120B» держится на архитектуре MoE. Смените модель на плотную того же класса — и скорость упадёт кратно. Планировать покупку под «модели на 100 млрд» без уточнения архитектуры нельзя.
- Заявления вендоров не переносятся в таблицу как замеры. «До 1 PFLOP FP4», «более 600 млрд параметров», «до 128 млрд» — это границы возможного при идеальных условиях, а не то, что вы увидите в терминале.
- Дискретные карты никуда не делись. Три подержанные RTX 3090 дают 124 ток/с на той же gpt-oss-120b — вдвое больше свежей цифры DGX Spark (58,72) — при 72 ГБ суммарной видеопамяти и совсем другом энергопотреблении. Если ваша модель влезает в видеопамять, единая память вам не нужна вовсе.
Какую из трёх брать под вашу модель: три сценария
Прямого совета, какую коробку заказывать, здесь нет. Ниже — пороги, по которым решение принимается само.
Сценарий 1. Модель влезает в 32 ГБ (до 30B в 4-битном кванте). Ни одна из трёх машин здесь не нужна. Дискретная видеокарта даст кратно больше токенов в секунду за те же или меньшие деньги. Ориентиры по конфигурациям — в общем гайде по железу под локальные модели.
Сценарий 2. Нужны MoE-модели класса 100–120 млрд параметров и длинный контекст. Здесь развилка проходит по типу нагрузки:
- в основном короткие диалоги — разница между машинами в пределах 13–25%, решает цена, и Strix Halo в боксе за $2 200–3 400 выглядит рациональнее;
- документы, поиск по своей базе, агенты с длинной историей — prefill решает всё, и пятикратный перевес DGX Spark на обработке промпта превращается в разницу между тремя секундами ожидания и пятнадцатью;
- нужен CUDA (существующий код, vLLM, TensorRT-LLM, дообучение) — альтернативы DGX Spark среди этих трёх нет.
Сценарий 3. Нужны плотные модели крупнее 70 млрд параметров. Честный ответ: ни одна из трёх машин не даст комфортной скорости при батче 1. Ищите либо самую широкую полосу памяти (Mac Studio на M3 Ultra), либо смиритесь с фоновым режимом, либо смотрите в сторону сборки на нескольких дискретных картах.
Ещё один вариант, который стоит знать: машины можно соединять. Два DGX Spark связываются напрямую через ConnectX-7 и, по заявлению NVIDIA, тянут модели до 405 млрд параметров. А EXO показала связку, где обработку промпта берёт DGX Spark, а генерацию — Mac Studio: 2,8× к одному Mac. Независимого повторения этого замера пока нет, и делали его разработчики самого софта. Про модульность конкретного бокса на Strix Halo — в его отдельном разборе, ссылка выше в разделе про цены.
FAQ
Сколько токенов в секунду нужно, чтобы локальный чат не раздражал?
Универсального порога нет, но есть ориентир от скорости чтения: комфортный темп начинается примерно с 15–20 токенов в секунду, а разговорным ощущается 30 и выше. Всё, что ниже 10, годится для фоновых задач — поставить и вернуться. Плотная модель на 70 млрд параметров на этих машинах даёт 2,7–5 токенов в секунду, то есть попадает именно в фоновый режим, а не в интерактивный.
Почему MoE-модель на 120 млрд параметров работает быстрее плотной на 32 млрд?
Потому что скорость генерации определяется объёмом весов, которые нужно прочитать из памяти на каждый токен. У MoE активируется малая часть сети: в gpt-oss-120b из 117 млрд параметров считается около 5 млрд. Плотная модель читает все свои веса целиком. Замер на одной машине это подтверждает: 89,3 токена в секунду у MoE на 30 млрд против 10,7 у плотной на 32 млрд.
Можно ли запустить DeepSeek R1 на 671B на любой из этих трёх машин?
В 4-битном кванте эта модель занимает около 350–400 ГБ. Столько памяти была только у Mac Studio в конфигурации на 512 ГБ, и Apple сняла её с продажи в марте 2026 — сейчас максимум составляет 256 ГБ. У DGX Spark и Strix Halo по 128 ГБ, модель туда не помещается. Остаются варианты с объединением нескольких машин или более агрессивное квантование с потерей качества.
Сколько памяти реально останется под модель после операционной системы?
У DGX Spark и Mac Studio память когерентная: делить её между процессором и ускорителем не нужно, но система всё равно занимает часть, поэтому под модель планируйте на 10–20 ГБ меньше номинала. У Strix Halo ситуация иная: под Windows видеоядру отдают до 96 ГБ из 128 через механизм Variable Graphics Memory, под Linux потолок поднимают параметрами ядра. Без этой настройки модель может молча уехать считаться на процессор.
Влияет ли NPU на скорость локальной языковой модели?
Практически нет. Нейропроцессор у Strix Halo рекламируется как 50+ TOPS, но llama.cpp его не использует, а специализированные пути дают меньше, чем встроенное видеоядро: независимый тест показал 4–5 токенов в секунду на Mistral 7B через NPU против примерно 40 на видеоядре. При выборе машины под запуск LLM цифра TOPS у NPU практического значения не имеет.
Есть ли смысл соединять две машины в кластер?
Смысл есть, но выигрыш зависит от того, что именно вы соединяете. Два DGX Spark связываются напрямую через ConnectX-7 на 200 Гбит/с, и NVIDIA заявляет поддержку моделей до 405 млрд параметров. Более интересный случай — связка разнородных машин: EXO показала схему, где промпт обрабатывает DGX Spark, а токены генерирует Mac Studio, и это даёт 2,8× к одному Mac. Замер сделан разработчиком софта и независимо не повторён.
