Mac Studio M5 Ultra для LLM: 4,3x — это prefill, а генерация быстрее в 1,5–1,9 раза

29 мин. чтения
Bybit
$30,100 + $5,030
100 USDT в подарок
Получить →

Коротко (TL;DR)

  • Mac Studio M5 Ultra возвращает до 512 ГБ единой памяти, а её пропускная способность выросла до 1,2 ТБ/с. Это на 50% больше, чем у M3 Ultra (819 ГБ/с), и примерно в 4,4 раза больше, чем у NVIDIA DGX Spark (273 ГБ/с).
  • Заявленные Apple «до 4,3x» — это пиковая вычислительная мощность для ИИ, а не скорость ответа. В независимом замере MacStories на двух моделях обработка промпта (prefill) ускорилась в 2,5 раза. Генерация текста (decode) на коротком промпте выросла в 1,54–1,58 раза, на длинном контексте — до 1,9 раза, в среднем автор теста насчитал около 70%.
  • Цена: от $5 499 за 96 ГБ, $9 499 за 256 ГБ (данные на 26 сентября 2026). Конфигурация 512 ГБ приедет в конце октября 2026, цену Apple не назвала.
  • Против DGX Spark Mac выигрывает генерацию и объём, DGX Spark — экосистему CUDA и цену входа. Дообучение и код под датацентровый стек NVIDIA — аргумент за Spark при любой полосе памяти.
  • Против RTX 5090 Mac проигрывает на моделях до 32 ГБ (5090 быстрее и в prefill, и в генерации), но выигрывает всё, что в 32 ГБ не помещается.

Своей машины у нас нет, поэтому ниже нет строк «мы прогнали». Это разбор чужих замеров с указанием, кто мерил, на какой модели и каким софтом.

Что нового в Mac Studio M5 Ultra против M3 Ultra: чип и память

M5 Ultra — это четыре кристалла в одном корпусе: два M5 Max, каждый из двух частей, соединены мостом UltraFusion с пропускной способностью более 4,4 ТБ/с между кристаллами. Для локального ИИ важны два изменения. Первое — в каждом из 80 ядер GPU появился Neural Accelerator, блок для матричных вычислений. Второе — память стала быстрее на 50%.

Сравнение M5 Ultra с M3 Ultra и соседями по линейке (по официальному анонсу Apple от 25 августа 2026, таблицам Ars Technica и Pinggy):

ПараметрM5 Ultra 30/64M5 Ultra 36/80M3 Ultra (2025)M5 Max
CPU30 ядер36 ядер (12 super + 24 performance)до 32 ядер18 ядер
GPU64 ядра с Neural Accelerators80 ядер с Neural Acceleratorsдо 80 ядер, без нейроускорителейдо 40 ядер с Neural Accelerators
Единая памятьтолько 96 ГБ96 / 256 / 512 ГБдо 512 ГБдо 128 ГБ
Пропускная способность1 228,8 ГБ/с1 228,8 ГБ/с819,2 ГБ/с460 ГБ/с (32 ядра GPU) или 614 ГБ/с (40 ядер)
Стартовая цена$5 499 (96 ГБ)$9 499 (256 ГБ)$3 999 (март 2025), $5 299 после повышения в июне 2026$2 499

Предыдущее поколение со всеми его цифрами мы разбирали в обзоре Mac Studio M3 Ultra для нейросетей. Здесь только то, что изменилось.

BYBIT COPY TRADINGКопитрейдинг на BybitОткрытая статистика трейдеров, старт с $10, отключение в один клик.Выбрать трейдера

Ловушка конфигуратора: 256 и 512 ГБ только со старшим чипом

Лестница памяти у M5 Ultra идёт скачками: 96 ГБ, затем сразу 256 ГБ, затем 512 ГБ. Промежуточных 128 и 192 ГБ нет. И главное: базовый чип 30/64 ограничен 96 ГБ. Чтобы получить 256 или 512 ГБ, конфигуратор заставит взять старший 36/80. Для локальных моделей это меняет реальный ценник: «M5 Ultra за $5 499» — это машина на 96 ГБ, а под большие модели стартовая точка — $9 499.

При этом полоса памяти у обоих вариантов одинаковая, 1,2 ТБ/с. Отсюда наша оценка (не замер): если вам хватает 96 ГБ, по скорости генерации младший чип должен мало уступать старшему. Разница проявится в обработке промпта, которая упирается в число ядер GPU.

Реальная скорость M5 Ultra: маркетинг Apple и независимые тесты

Чтобы понять, откуда разрыв между «4,3x» и реальностью, нужно разделить работу модели на две фазы.

  • Prefill (обработка промпта) — модель читает всё, что вы прислали: системный промпт, историю диалога, документ. Это одно огромное матричное умножение, оно упирается в вычислительную мощность. Именно его ускоряют Neural Accelerators.
  • Decode (генерация) — модель выдаёт ответ по одному токену. Для каждого токена она заново читает из памяти все активные веса. Эта фаза упирается прежде всего в пропускную способность памяти.

Отсюда рабочее правило для единой памяти Mac: её объём решает, какая модель влезет, а пропускная способность — как быстро пойдёт ответ. Грубая оценка: токенов в секунду ≈ полоса памяти ÷ объём весов, читаемых на токен, с поправкой на реальную эффективность 60–80%.

Что показывают замеры Apple и MacStories

Apple сама опубликовала такую раскладку, но для базовых чипов. По замерам Apple Machine Learning Research (ноябрь 2025) M5 против M4 ускорил время до первого токена в 3,33–4,06 раза, а генерацию — только в 1,19–1,27 раза. Причину Apple назвала прямо: полоса памяти у M5 выросла на 28%.

Для M5 Ultra единственный на дату публикации контролируемый A/B-тест сделал Федерико Витиччи в обзоре MacStories (опубликован 21 сентября 2026). Условия: одна и та же модель в тех же байтах, macOS 27.0, сервер oMLX 0.7.0.dev2, одинаковые запросы. M3 Ultra с 512 ГБ против M5 Ultra с 256 ГБ.

Замер (MacStories, сентябрь 2026)M3 UltraM5 UltraПрирост
Qwen3.8-Flash-Next, генерация на коротком промпте (медиана трёх прогонов)70 ток/с108 ток/с×1,54
GLM-5.3-Flash, генерация на коротком промпте (медиана трёх прогонов)26 ток/с41 ток/с×1,58
Qwen3.8-Flash-Next, чтение промпта 16K1 143 ток/с2 887 ток/с×2,53
GLM-5.3-Flash, чтение промпта 16K428 ток/с1 107 ток/с×2,59
Flash-Next, ответ на 512 токенов после 16K контекста53,5 ток/с87,8 ток/с×1,64
Flash-Next, ответ на 512 токенов после 64K контекста45,3 ток/с83,8 ток/с×1,85
Flash-Next, ответ на 512 токенов после 256K контекста38,6 ток/с74,7 ток/с×1,94
Flash-Next, первый токен после 64K контекста59,7 с24,4 св 2,4 раза быстрее
Flash-Next, первый токен после 256K контекста244,9 с101,5 св 2,4 раза быстрее

В тех же тестах есть прогоны с очень короткими ответами (9–55 токенов): там прирост генерации гуляет от ×1,15 до ×1,87. На ответе в девять токенов скорость измеряется слишком грубо, поэтому мы опираемся на медианы и на серию с ответами по 512 токенов. Сам Витиччи в ежедневной работе насчитал в среднем около 70% прироста в генерации.

BYBIT EARNЗаставь крипту работатьПроценты на USDT и BTC без блокировки — деньги остаются под рукой.Разместить

Расчёт: почему 4,3x превращаются в 1,5–2,5x

Сведём цифры к одному знаменателю:

  1. Полоса памяти: 1 228,8 ÷ 819,2 = 1,50.
  2. Генерация на коротком промпте: 108 ÷ 70 = 1,54 и 41 ÷ 26 = 1,58. Прирост почти совпадает с приростом полосы: без длинного контекста decode упирается именно в память.
  3. Генерация на длинном контексте: ×1,64–1,94. Чем длиннее контекст, тем больше работы уходит на механизм внимания по накопленному кэшу, а это уже вычисления, и тут помогают Neural Accelerators. Это наше объяснение разброса, а не вывод автора теста.
  4. Prefill: 2 887 ÷ 1 143 = 2,53 и 1 107 ÷ 428 = 2,59. Заметно больше полосы, но и заметно меньше маркетинговых 4,3x (сам Витиччи оценивает пиковый GPU-компьют как «до 4,5x»).
  5. Вывод: 4,3x — это пиковая вычислительная мощность в идеальной задаче. В реальном prefill она превращается в ~2,5x, а в генерации — в +50–90% в зависимости от длины контекста, в среднем около +70%.

Для чата с короткими вопросами вы почувствуете рост примерно в полтора раза. Для агентов с длинным контекстом (Codex, Hermes, RAG по документам) эффект сильнее: они на каждом ходу заново скармливают модели десятки тысяч токенов, и ожидание первого слова на 64K сократилось с минуты до 24 секунд. Витиччи называет именно это главным изменением: агенты на локальной модели стали пригодны для работы.

Mac Studio M5 Ultra vs RTX 5090: 5090 быстрее на моделях до 32 ГБ

В том же обзоре MacStories есть сравнение с игровым ПК на RTX 5090. На промпте в 6 000 токенов M5 Ultra читал примерно 1 700 ток/с, RTX 5090 — около 3 000. Тензорные ядра NVIDIA всё ещё сильнее в матричных вычислениях. В генерации 5090 держит стабильное преимущество около 25%: её полоса 1,79 ТБ/с против 1,2 ТБ/с у Mac.

Но у 5090 всего 32 ГБ видеопамяти. Модель крупнее приходится частично выгружать в системную память через PCIe, и скорость обваливается. Второе отличие — быт: игровой ПК под длинными прогонами грел комнату и шумел, а Mac Studio, по словам автора, было не слышно, если не прикладывать ухо к корпусу. Если ваши модели помещаются в 32 ГБ, разумнее смотреть сборку на RTX 5090 для локального ИИ.

Что влезает в 256 и 512 ГБ памяти M5 Ultra: модели и кванты

Первое, что нужно знать: вся память модели не достаётся. По умолчанию macOS отдаёт видеоядру около 75% установленной памяти. На машине с 256 ГБ сервер oMLX у MacStories разрешал модели 200,4 ГБ и отказался грузить 8-битную версию Flash-Next, которой при загрузке требовалось 244,2 ГБ. На 512 ГБ по умолчанию выходит около 384 ГБ. Лимит поднимается системной настройкой iogpu.wired_limit_mb (до ~472 ГБ на 512-гигабайтной машине, оставив ~40 ГБ системе), но сбрасывается после перезагрузки.

Второе: для MoE-моделей (mixture of experts, «смесь экспертов») в памяти должны лежать все параметры, хотя на каждый токен работает лишь их часть. Поэтому объём памяти считают по полному размеру модели, а скорость — по активным параметрам.

Размеры — по карточкам моделей на Hugging Face, собранным Pinggy, в 4-битном кванте MLX, если не указано иное:

МодельПараметры: всего / активныхРазмер256 ГБ512 ГБЗамер скорости генерации
Qwen3.8-27B27B, плотная16,1 ГБдада—
gpt-oss-120b~120B, MoE~65 ГБ (MXFP4)дада—
Qwen3.8-Flash-Next125B / 6B~100 ГБдада108 ток/с (M5 Ultra, MacStories)
DeepSeek-V4-Flash284B / 13B151 ГБдада—
GLM-5.3-Flash320B / 18B177,6 ГБвпритык, мало места под контекстда41 ток/с (M5 Ultra, смешанный квант 4/8 бит)
MiniMax M3~427B, MoE~240 ГБнетда—
DeepSeek R1 671B671B, MoE404 ГБнетда, с поднятым лимитом17–18 ток/с (ещё на M3 Ultra)
GLM-5.2743B / 40B418 ГБнетда, это потолок17,7 ток/с (ещё на M3 Ultra)
Kimi K2.7-Code~1T / 32B641 ГБнеттолько 2-битный GGUF, 339 ГБ—
Kimi K32,8T / 104B1,56 ТБ (MXFP4)нетнет, даже 1-битный квант требует 610 ГБ—

Что следует из таблицы:

  • 256 ГБ с запасом под контекст закрывают модели до ~150 ГБ — DeepSeek-V4-Flash и всё, что меньше. GLM-5.3-Flash на 177,6 ГБ помещается впритык. Модели на 240 ГБ и больше требуют версии на 512 ГБ.
  • Спускаться ниже 4 бит дорого. По данным Unsloth для GLM-5.3, переход с 4-битного кванта на 2-битный экономит 229 ГБ, но стоит 16 пунктов точности top-1 (с 94,29% до 78,53%). Лучше взять модель поменьше в 4 битах, чем большую в 2.
  • Плотные модели крупнее ~120B на Mac практически бесполезны. Плотная Llama 405B на M3 Ultra выдавала 2,9 ток/с. Для плотной 70B в 4 битах расчёт Pinggy даёт потолок около 30 ток/с и реалистичные 20–25 на M5 Ultra — это оценка по полосе, а не замер.

У M3 Ultra с 512 ГБ есть преимущество, которое M5 Ultra вернёт только в конце октября: MacStories смог держать в памяти все четыре кванта Flash-Next на старой машине, а на новой 256-гигабайтной 6- и 8-битные версии запустились только с выгрузкой таблиц эмбеддингов на SSD.

DGX Spark или Mac Studio M5 Ultra: быстрая память против CUDA

Спор Mac Studio vs DGX Spark для local LLM (локального запуска языковых моделей) обычно сводят к одному числу — полосе памяти. Здесь Apple выигрывает без вариантов. Но решение о покупке чаще определяет другое.

ПараметрMac Studio M5 UltraNVIDIA DGX Spark
Память96 / 256 / 512 ГБ единой128 ГБ когерентной LPDDR5x
Пропускная способность1,2 ТБ/с273 ГБ/с
Цена$5 499 (96 ГБ), $9 499 (256 ГБ)$4 699 (с конца февраля 2026, старт был $3 999)
Цена за 1 ГБ памяти$57 (96 ГБ), $37 (256 ГБ)$37
Цена за 1 ГБ/с полосы$7,7 (256 ГБ)$17,2
СофтMLX, Metal, llama.cpp, LM Studio, Ollamaполный стек NVIDIA: CUDA, TensorRT-LLM, NIM, NeMo, NCCL
КластерThunderbolt 5 (до 120 Гбит/с по данным Apple) + RDMAConnectX-7 (200 Гбит/с), 2 машины — модели до 405B по заявлению NVIDIA

Цены — на 26 сентября 2026. Повышение цены DGX Spark NVIDIA объявила на своём форуме разработчиков 25 февраля 2026 и объяснила дефицитом памяти.

Три вывода из таблицы:

  • Генерация: Mac. Decode упирается в полосу, а полоса у M5 Ultra в 4,4 раза шире. Даже два DGX Spark с суммарными 256 ГБ обойдутся примерно в те же деньги, что один Mac на 256 ГБ, но каждая машина читает веса на своих 273 ГБ/с.
  • Цена за гигабайт — поровну. На 256 ГБ Mac и DGX Spark стоят около $37 за гигабайт. Mac дорог в базе на 96 ГБ, но не на большом объёме.
  • Экосистема: DGX Spark. Если вы дообучаете модели, пишете код под CUDA или выкатываете его потом на серверы NVIDIA Blackwell, Mac не подходит ни за какие деньги: CUDA на Apple Silicon нет. DGX Spark повторяет архитектуру датацентра, и, по позиционированию NVIDIA, код с рабочего стола переезжает в продакшн тем же путём.

Одна оговорка про prefill. В нашем сравнении DGX Spark, Mac Studio и Strix Halo главным козырем DGX Spark против M3 Ultra была именно обработка промпта. M5 Ultra ускорил её в 2,5 раза и разрыв сократил, но замера двух машин на одной модели и одном бекенде на дату публикации нет, поэтому победителя в prefill мы не называем. Отдельно о самом боксе NVIDIA, его софте и ограничениях — в разборе NVIDIA DGX Spark для нейросетей.

Про кластеры. Apple впервые официально поддерживает объединение нескольких Mac Studio через Thunderbolt 5 с RDMA (прямым доступом к памяти соседней машины). Для примера из четырёх машин Apple обещает до 3x ускорения инференса; это заявление компании, независимого замера пока нет. Четыре Mac на 512 ГБ дают пул 2 ТБ, и Pinggy рассчитывает запустить на нём Kimi K3 (1,56 ТБ весов). Но только с поднятым лимитом памяти для GPU: при стандартных ~75% четыре машины отдают модели около 1,5 ТБ, и K3 не помещается. У NVIDIA интерконнект ConnectX-7 на 200 Гбит/с построен на той же технологии RoCE, что и датацентровые кластеры; по оценке Petronella, это заметно больше, чем даёт Thunderbolt 5.

Цена Mac Studio M5 Ultra: апгрейд до 256 ГБ стоит $4 000

Цены по конфигурациям на 26 сентября 2026 (США, без налогов):

КонфигурацияЦена сейчасС чем сравнить
M5 Max, база$2 499M4 Max стартовал с $1 999, в июне 2026 подорожал до $2 499
M5 Ultra 30/64, 96 ГБ, 1 ТБ$5 499 (для образования $5 099)M3 Ultra с урезанным чипом и 96 ГБ: $3 999 на старте, $5 299 после июня 2026
M5 Ultra 36/80, 256 ГБ, 1 ТБ$9 499та же память на M3 Ultra 18 месяцев назад: $5 599
M5 Ultra, 512 ГБне объявлена, поставки с конца октября 2026M3 Ultra на 512 ГБ стартовал с $9 499

Переход с базы на 256 ГБ добавляет $4 000 — больше, чем стоит весь Mac Studio на M5 Max. Ars Technica предполагает, что версия на 512 ГБ выйдет за $20 000 и выше, но это прогноз журналиста, а не цена Apple.

В прессе для M3 Ultra встречаются две стартовые цены, $3 999 и $5 299. Противоречия нет, это одна конфигурация в разные месяцы: по данным Macworld, M3 Ultra стартовал в марте 2025 за $3 999, а при общем повышении цен в июне 2026 подорожал на $1 300, до $5 299. Поэтому M5 Ultra за $5 499 дороже стартовой цены предшественника на $1 500 (+37,5%), но всего на $200 дороже того, что M3 Ultra стоил этим летом. Для локального ИИ важнее сравнение на одинаковой памяти: 256 ГБ подорожали с $5 599 до $9 499, то есть на 70%.

Почему так дорого, объясняет хронология 2026 года (по данным FelloAI, Macworld и Ars Technica):

ДатаЧто произошлоМаксимум памяти в продаже
март 2025выходит M3 Ultra512 ГБ
5 марта 2026Apple убирает опцию 512 ГБ, апгрейд до 256 ГБ дорожает с $1 600 до $2 000256 ГБ
5 мая 2026убрана опция 256 ГБ96 ГБ
июнь 2026Apple поднимает цены на всю линейку Mac, M3 Ultra — до $5 29996 ГБ
25 августа 2026анонс M5 Ultra с памятью 96 / 256 / 512 ГБ512 ГБ (с конца октября)
22 сентября 2026старт продаж конфигураций на 96 и 256 ГБ256 ГБ

Причина — глобальный дефицит оперативной памяти: её скупают дата-центры под ИИ. Нынешняя цена — это не просто рост, а возвращение больших объёмов, которые полгода вообще нельзя было купить. Дефицит ослаб достаточно, чтобы Apple снова продавала 512 ГБ, но не настолько, чтобы память подешевела. Ars Technica отмечает, что большинство конфигураций Mac Studio было почти невозможно купить месяцами.

Риски M5 Ultra: CUDA-стена, фейковые бенчмарки, дефицит

  • Фейковые бенчмарки. До старта продаж 22 сентября в сети гуляли «точные» цифры токенов в секунду для M5 Ultra на Llama 3.3 70B и Llama 3.1 405B. Petronella Technology 26 августа прямо предупредила, что все они выдуманы: железа тогда не было ни у кого, а одна страница приписывала чипу полосу 600 ГБ/с вместо 1,2 ТБ/с. Проверяйте дату замера, версию софта и модель. Первые настоящие тесты вышли 21–23 сентября (MacStories, Ars Technica, Tom’s Hardware).
  • Сводные таблицы, собранные ИИ. На Reddit в r/LocalLLM 25 сентября выложили сравнение M5 Ultra с двумя DGX Spark, которое по просьбе автора синтезировала языковая модель из разрозненных цифр. Сама таблица признаёт, что замера на одной модели, одном кванте и одном софте не существует. Такие компиляции выглядят как бенчмарк, но им не являются.
  • CUDA-стена. Дообучение крупных моделей, библиотеки только под CUDA, продакшн-сервинг через vLLM и TensorRT-LLM — это территория NVIDIA. MLX умеет дообучение через LoRA, но это не замена стеку, на котором работает индустрия.
  • Цена и дефицит. Базовая цена выросла на $1 500 к стартовой цене M3 Ultra, 256 ГБ — на 70%. Поставки топовых конфигураций весь 2026 год были нестабильны, и это может повториться.
  • 512 ГБ без цены. Кто планирует бюджет под GLM-5.2 или DeepSeek 671B, покупает кота в мешке: ни цены, ни точной даты, только «конец октября».
  • Память не расширяется. Она распаяна в чип. Взяли 96 ГБ — через год не добавите.
  • Облако может оказаться дешевле. Критический разбор на YouTube «Don’t Buy a Mac Studio M5 Ultra for Local AI» считает, что те же открытые модели у стороннего хостинга обходятся дешевле и работают быстрее на длинных промптах. Локальная машина выигрывает, когда данные нельзя отдавать третьей стороне (NDA, требования регулятора) или когда задачи идут ночью и скорость не важна.

Кому брать Mac Studio M5 Ultra, а кому — DGX Spark или подождать

Выбор Mac Studio для LLM сводится к шести вопросам. Пройдите их по порядку: первый, на который ответили «да», и есть ваш сценарий.

  1. Модели помещаются в 32 ГБ (до ~30B в 4 битах)? Mac Studio M5 Ultra не нужен. Дискретная видеокарта даст больше токенов в секунду за меньшие деньги.
  2. Нужны CUDA, дообучение или перенос кода на серверы NVIDIA? Берите DGX Spark. Полоса памяти здесь не аргумент.
  3. Хватает 64–128 ГБ и бюджет ограничен? Смотрите Mac Studio на M5 Max (до 128 ГБ, 614 ГБ/с у 40-ядерного GPU, от $2 499) или младшие машины Apple — например, Mac Mini M4 Pro для нейросетей.
  4. Работаете с MoE-моделями на 100–150 ГБ и агентами с длинным контекстом? Это основной сценарий Mac Studio M5 Ultra на 256 ГБ за $9 499. Именно здесь ускорение prefill в 2,5 раза заметнее всего.
  5. Нужны модели на 240+ ГБ (MiniMax M3, GLM-5.2, DeepSeek 671B)? Ждите 512 ГБ в конце октября и объявления цены. Взять 256 ГБ «на вырост» не получится: память не докупается.
  6. Уже есть M3 Ultra на 512 ГБ? Обновление имеет смысл, если вы работаете с агентами и длинными промптами: ожидание первого токена сократилось в 2,4 раза, генерация ускорилась в 1,5–1,9 раза. Если вы держите в памяти модели на 300+ ГБ, переход на 256 ГБ — шаг назад до выхода версии на 512 ГБ.

Отдельно про ожидание следующего поколения. По данным AppleInsider (июнь 2026), которые приводит FelloAI, следующим чипом класса Ultra станет M7 Ultra, и его ждут в 2028 году. Это отчёт издания, а не заявление Apple, но если он верен, M5 Ultra останется вершиной линейки примерно два года.

FAQ

Сколько токенов в секунду выдаёт Mac Studio M5 Ultra на моделях уровня 70B? Независимого замера на плотной 70B на дату публикации нет. Расчёт по полосе памяти (Pinggy) даёт потолок около 30 ток/с и реалистичные 20–25 ток/с в 4-битном кванте. MoE-модели того же размера идут кратно быстрее: Qwen3.8-Flash-Next на 125B параметров в замере MacStories выдал 108 ток/с, потому что на каждый токен работает только 6B активных параметров.

Можно ли дообучать модели на Mac Studio M5 Ultra? Частично. Фреймворк Apple MLX поддерживает дообучение через LoRA, и для небольших адаптеров этого хватает. Но основные инструменты индустрии для обучения и продакшн-сервинга рассчитаны на CUDA, а её на Apple Silicon нет. Если дообучение — ваша основная работа, DGX Spark или сервер на видеокартах NVIDIA подойдут лучше.

Стоит ли ждать 512 ГБ конфигурацию или брать 256 ГБ сейчас? Если ваши модели весят до ~150 ГБ, 256 ГБ хватит уже сейчас: DeepSeek-V4-Flash, Qwen3.8-Flash-Next, gpt-oss-120b помещаются с запасом под контекст, GLM-5.3-Flash — впритык. Для моделей на 400+ ГБ (GLM-5.2, DeepSeek 671B) нужна версия на 512 ГБ, она выйдет в конце октября 2026. Цену Apple не объявила, а память потом не добавить.

Чем M5 Ultra отличается от M3 Ultra для локального ИИ, если у меня уже есть старая машина? Полоса памяти выросла с 819 до 1 229 ГБ/с, в GPU появились Neural Accelerators. По замерам MacStories генерация стала быстрее в 1,5–1,9 раза в зависимости от длины контекста, обработка промпта — в 2,5 раза. Минус для владельцев M3 Ultra на 512 ГБ: до конца октября новая машина есть только в версии на 256 ГБ.

Можно ли объединить несколько Mac Studio в кластер для больших моделей? Да. Apple впервые официально поддерживает кластеры через Thunderbolt 5 с RDMA: машины объединяют память в общий пул. По заявлению Apple, четыре Mac Studio дают до 3x ускорения инференса против одной машины. Четыре конфигурации на 512 ГБ — это пул 2 ТБ. Kimi K3 на 1,56 ТБ в него помещается только с поднятым лимитом памяти для GPU.

DGX Spark дешевле — зачем платить больше за Mac Studio? DGX Spark дешевле на входе ($4 699 против $5 499), но на 256 ГБ цена за гигабайт у них одинаковая, около $37. За эти деньги Mac даёт в 4,4 раза более быструю память, а значит, и заметно более быструю генерацию текста. Переплата оправдана, если вам нужен чистый инференс больших моделей без привязки к CUDA.

Bybit
$30,100 + $5,030
100 USDT в подарок
Получить →
Поделиться
Связаться:
Крипто- и data-аналитик, инженер-программист (факультет компьютерных наук ХНУРЭ). В IT с 2008 года: администрировал корпоративный мониторинг в «Vodafone Украина», семь лет разрабатывал и продвигал веб-проекты, пять лет руководил маркетингом на метриках — конверсия, CTR, ROI, LTV.Криптовалютными рынками занимаюсь с 2021 года: ончейн-метрики, токеномика, макроэкономические индикаторы. Разработал собственную data-driven модель анализа рынка на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математическая статистика и EDA; сбор и сверку данных автоматизирую AI-агентами.Принцип — «Don't trust, verify»: каждая цифра проверена по первоисточнику, ключевые — минимум по двум независимым; прогнозы — только сценарии с условиями. Тезис без данных не публикуется.