Mac Studio M5 Ultra для LLM: 4,3x — це prefill, а генерація швидша в 1,5–1,9 раза

29 хв. читання
BINANCE · СПОТ І ДЕРИВАТИВИ
Крипта з нуля
Комісія 0,1%, торги 24/7, старт з $10
Відкрити рахунок

Коротко (TL;DR)

  • Mac Studio M5 Ultra повертає до 512 ГБ єдиної пам’яті, а її пропускна здатність зросла до 1,2 ТБ/с. Це на 50% більше, ніж у M3 Ultra (819 ГБ/с), і приблизно в 4,4 раза більше, ніж у NVIDIA DGX Spark (273 ГБ/с).
  • Заявлені Apple «до 4,3x» — це пікова обчислювальна потужність для ШІ, а не швидкість відповіді. У незалежному замірі MacStories на двох моделях обробка промпту (prefill) прискорилася в 2,5 раза. Генерація тексту (decode) на короткому промпті зросла в 1,54–1,58 раза, на довгому контексті — до 1,9 раза, у середньому автор тесту нарахував близько 70%.
  • Ціна: від $5 499 за 96 ГБ, $9 499 за 256 ГБ (дані на 26 вересня 2026). Конфігурація на 512 ГБ надійде наприкінці жовтня 2026, ціну Apple не назвала.
  • Проти DGX Spark Mac виграє генерацію та обсяг, DGX Spark — екосистему CUDA й ціну входу. Донавчання і код під датацентровий стек NVIDIA — аргумент на користь Spark за будь-якої пропускної здатності.
  • Проти RTX 5090 Mac програє на моделях до 32 ГБ (5090 швидша і в prefill, і в генерації), але виграє все, що в 32 ГБ не вміщується.

Власної машини в нас немає, тож нижче немає рядків «ми прогнали». Це розбір чужих замірів із зазначенням, хто міряв, на якій моделі та яким софтом.

Що нового в Mac Studio M5 Ultra порівняно з M3 Ultra: чип і пам’ять

M5 Ultra — це чотири кристали в одному корпусі: два M5 Max, кожен із двох частин, з’єднані мостом UltraFusion із пропускною здатністю понад 4,4 ТБ/с між кристалами. Для локального ШІ важливі дві зміни. Перша — у кожному з 80 ядер GPU з’явився Neural Accelerator, блок для матричних обчислень. Друга — пам’ять стала швидшою на 50%.

Порівняння M5 Ultra з M3 Ultra та сусідами по лінійці (за офіційним анонсом Apple від 25 серпня 2026, таблицями Ars Technica і Pinggy):

ПараметрM5 Ultra 30/64M5 Ultra 36/80M3 Ultra (2025)M5 Max
CPU30 ядер36 ядер (12 super + 24 performance)до 32 ядер18 ядер
GPU64 ядра з Neural Accelerators80 ядер з Neural Acceleratorsдо 80 ядер, без нейроприскорювачівдо 40 ядер з Neural Accelerators
Єдина пам’ятьлише 96 ГБ96 / 256 / 512 ГБдо 512 ГБдо 128 ГБ
Пропускна здатність1 228,8 ГБ/с1 228,8 ГБ/с819,2 ГБ/с460 ГБ/с (32 ядра GPU) або 614 ГБ/с (40 ядер)
Стартова ціна$5 499 (96 ГБ)$9 499 (256 ГБ)$3 999 (березень 2025), $5 299 після підвищення в червні 2026$2 499

Попереднє покоління з усіма його цифрами ми розбирали в огляді Mac Studio M3 Ultra для нейромереж. Тут лише те, що змінилося.

BINANCE SIMPLE EARNЗмусь крипту працюватиВідсотки на USDT і BTC без блокування — гроші лишаються під рукою.Розмістити

Пастка конфігуратора: 256 і 512 ГБ лише зі старшим чипом

Сходинки пам’яті в M5 Ultra йдуть стрибками: 96 ГБ, далі одразу 256 ГБ, потім 512 ГБ. Проміжних 128 і 192 ГБ немає. І головне: базовий чип 30/64 обмежений 96 ГБ. Щоб отримати 256 або 512 ГБ, конфігуратор змусить узяти старший 36/80. Для локальних моделей це змінює реальний цінник: «M5 Ultra за $5 499» — це машина на 96 ГБ, а під великі моделі стартова точка — $9 499.

Водночас пропускна здатність пам’яті в обох варіантів однакова, 1,2 ТБ/с. Звідси наша оцінка (не замір): якщо вам вистачає 96 ГБ, за швидкістю генерації молодший чип має мало поступатися старшому. Різниця проявиться в обробці промпту, яка впирається в кількість ядер GPU.

Реальна швидкість M5 Ultra: маркетинг Apple і незалежні тести

Щоб зрозуміти, звідки розрив між «4,3x» і реальністю, треба розділити роботу моделі на дві фази.

  • Prefill (обробка промпту) — модель читає все, що ви надіслали: системний промпт, історію діалогу, документ. Це одне величезне матричне множення, воно впирається в обчислювальну потужність. Саме його прискорюють Neural Accelerators.
  • Decode (генерація) — модель видає відповідь по одному токену. Для кожного токена вона заново читає з пам’яті всі активні ваги. Ця фаза впирається насамперед у пропускну здатність пам’яті.

Звідси робоче правило для єдиної пам’яті Mac: її обсяг вирішує, яка модель вміститься, а пропускна здатність — як швидко піде відповідь. Груба оцінка: токенів за секунду ≈ пропускна здатність ÷ обсяг ваг, які читаються на токен, із поправкою на реальну ефективність 60–80%.

Що показують заміри Apple і MacStories

Apple сама опублікувала таке розкладання, але для базових чипів. За замірами Apple Machine Learning Research (листопад 2025) M5 проти M4 скоротив час до першого токена в 3,33–4,06 раза, а генерацію прискорив лише в 1,19–1,27 раза. Причину Apple назвала прямо: пропускна здатність пам’яті в M5 зросла на 28%.

Для M5 Ultra єдиний на дату публікації контрольований A/B-тест зробив Федеріко Вітіччі в огляді MacStories (опубліковано 21 вересня 2026). Умови: та сама модель у тих самих байтах, macOS 27.0, сервер oMLX 0.7.0.dev2, однакові запити. M3 Ultra з 512 ГБ проти M5 Ultra з 256 ГБ.

Замір (MacStories, вересень 2026)M3 UltraM5 UltraПриріст
Qwen3.8-Flash-Next, генерація на короткому промпті (медіана трьох прогонів)70 ток/с108 ток/с×1,54
GLM-5.3-Flash, генерація на короткому промпті (медіана трьох прогонів)26 ток/с41 ток/с×1,58
Qwen3.8-Flash-Next, читання промпту 16K1 143 ток/с2 887 ток/с×2,53
GLM-5.3-Flash, читання промпту 16K428 ток/с1 107 ток/с×2,59
Flash-Next, відповідь на 512 токенів після 16K контексту53,5 ток/с87,8 ток/с×1,64
Flash-Next, відповідь на 512 токенів після 64K контексту45,3 ток/с83,8 ток/с×1,85
Flash-Next, відповідь на 512 токенів після 256K контексту38,6 ток/с74,7 ток/с×1,94
Flash-Next, перший токен після 64K контексту59,7 с24,4 су 2,4 раза швидше
Flash-Next, перший токен після 256K контексту244,9 с101,5 су 2,4 раза швидше

У тих самих тестах є прогони з дуже короткими відповідями (9–55 токенів): там приріст генерації коливається від ×1,15 до ×1,87. На відповіді з дев’яти токенів швидкість вимірюється надто грубо, тому ми спираємося на медіани та на серію з відповідями по 512 токенів. Сам Вітіччі в щоденній роботі нарахував у середньому близько 70% приросту в генерації.

BINANCE SIMPLE EARNЗмусь крипту працюватиВідсотки на USDT і BTC без блокування — гроші лишаються під рукою.Розмістити

Розрахунок: чому 4,3x перетворюються на 1,5–2,5x

Зведімо цифри до одного знаменника:

  1. Пропускна здатність пам’яті: 1 228,8 ÷ 819,2 = 1,50.
  2. Генерація на короткому промпті: 108 ÷ 70 = 1,54 і 41 ÷ 26 = 1,58. Приріст майже збігається з приростом пропускної здатності: без довгого контексту decode упирається саме в пам’ять.
  3. Генерація на довгому контексті: ×1,64–1,94. Що довший контекст, то більше роботи йде на механізм уваги за накопиченим кешем, а це вже обчислення, і тут допомагають Neural Accelerators. Це наше пояснення розкиду, а не висновок автора тесту.
  4. Prefill: 2 887 ÷ 1 143 = 2,53 і 1 107 ÷ 428 = 2,59. Помітно більше за приріст пропускної здатності, але й помітно менше за маркетингові 4,3x (сам Вітіччі оцінює піковий GPU-комп’ют як «до 4,5x»).
  5. Висновок: 4,3x — це пікова обчислювальна потужність в ідеальному завданні. У реальному prefill вона перетворюється на ~2,5x, а в генерації — на +50–90% залежно від довжини контексту, у середньому близько +70%.

У чаті з короткими запитаннями ви відчуєте приріст приблизно в півтора раза. Для агентів із довгим контекстом (Codex, Hermes, RAG за документами) ефект сильніший: вони на кожному кроці заново подають моделі десятки тисяч токенів, і очікування першого слова на 64K скоротилося з хвилини до 24 секунд. Вітіччі називає саме це головною зміною: агенти на локальній моделі стали придатними для роботи.

Mac Studio M5 Ultra vs RTX 5090: 5090 швидша на моделях до 32 ГБ

У тому самому огляді MacStories є порівняння з ігровим ПК на RTX 5090. На промпті в 6 000 токенів M5 Ultra читав приблизно 1 700 ток/с, RTX 5090 — близько 3 000. Тензорні ядра NVIDIA досі сильніші в матричних обчисленнях. У генерації 5090 тримає стабільну перевагу близько 25%: її пропускна здатність 1,79 ТБ/с проти 1,2 ТБ/с у Mac.

Але в 5090 лише 32 ГБ відеопам’яті. Більшу модель доводиться частково вивантажувати в системну пам’ять через PCIe, і швидкість обвалюється. Друга відмінність — побутова: ігровий ПК під довгими прогонами грів кімнату й шумів, а Mac Studio, за словами автора, не було чути, якщо не прикладати вухо до корпусу. Якщо ваші моделі вміщуються в 32 ГБ, розумніше дивитися збірку на RTX 5090 для локального ШІ.

Що вміщується в 256 і 512 ГБ пам’яті M5 Ultra: моделі та кванти

Перше, що треба знати: уся пам’ять моделі не дістається. За замовчуванням macOS віддає відеоядру близько 75% установленої пам’яті. На машині з 256 ГБ сервер oMLX у MacStories дозволяв моделі 200,4 ГБ і відмовився завантажувати 8-бітну версію Flash-Next, якій під час завантаження потрібно було 244,2 ГБ. На 512 ГБ за замовчуванням виходить близько 384 ГБ. Ліміт піднімає системне налаштування iogpu.wired_limit_mb (до ~472 ГБ на машині з 512 ГБ, залишивши ~40 ГБ системі), але воно скидається після перезавантаження.

Друге: для MoE-моделей (mixture of experts, «суміш експертів») у пам’яті мають лежати всі параметри, хоча на кожен токен працює лише їхня частина. Тому обсяг пам’яті рахують за повним розміром моделі, а швидкість — за активними параметрами.

Розміри — за картками моделей на Hugging Face, які зібрав Pinggy, у 4-бітному кванті MLX, якщо не вказано інше:

МодельПараметри: всього / активнихРозмір256 ГБ512 ГБЗамір швидкості генерації
Qwen3.8-27B27B, щільна16,1 ГБтактак—
gpt-oss-120b~120B, MoE~65 ГБ (MXFP4)тактак—
Qwen3.8-Flash-Next125B / 6B~100 ГБтактак108 ток/с (M5 Ultra, MacStories)
DeepSeek-V4-Flash284B / 13B151 ГБтактак—
GLM-5.3-Flash320B / 18B177,6 ГБвпритул, мало місця під контексттак41 ток/с (M5 Ultra, змішаний квант 4/8 біт)
MiniMax M3~427B, MoE~240 ГБнітак—
DeepSeek R1 671B671B, MoE404 ГБнітак, із піднятим лімітом17–18 ток/с (ще на M3 Ultra)
GLM-5.2743B / 40B418 ГБнітак, це стеля17,7 ток/с (ще на M3 Ultra)
Kimi K2.7-Code~1T / 32B641 ГБнілише 2-бітний GGUF, 339 ГБ—
Kimi K32,8T / 104B1,56 ТБ (MXFP4)ніні, навіть 1-бітний квант потребує 610 ГБ—

Що випливає з таблиці:

  • 256 ГБ із запасом під контекст покривають моделі до ~150 ГБ — DeepSeek-V4-Flash і все, що менше. GLM-5.3-Flash на 177,6 ГБ вміщується впритул. Моделі на 240 ГБ і більше потребують версії на 512 ГБ.
  • Спускатися нижче 4 біт дорого. За даними Unsloth для GLM-5.3, перехід із 4-бітного кванту на 2-бітний економить 229 ГБ, але коштує 16 пунктів точності top-1 (з 94,29% до 78,53%). Краще взяти меншу модель у 4 бітах, ніж велику у 2.
  • Щільні моделі, більші за ~120B, на Mac практично марні. Щільна Llama 405B на M3 Ultra видавала 2,9 ток/с. Для щільної 70B у 4 бітах розрахунок Pinggy дає стелю близько 30 ток/с і реалістичні 20–25 на M5 Ultra — це оцінка за пропускною здатністю, а не замір.

У M3 Ultra з 512 ГБ є перевага, яку M5 Ultra поверне лише наприкінці жовтня: MacStories зміг тримати в пам’яті всі чотири кванти Flash-Next на старій машині, а на новій машині з 256 ГБ 6- і 8-бітні версії запустилися лише з вивантаженням таблиць ембедингів на SSD.

DGX Spark чи Mac Studio M5 Ultra: швидка пам’ять проти CUDA

Суперечку Mac Studio vs NVIDIA DGX Spark для local LLM (локального запуску мовних моделей) зазвичай зводять до одного числа — пропускної здатності пам’яті. Тут Apple виграє без варіантів. Але рішення про купівлю частіше визначає інше.

ПараметрMac Studio M5 UltraNVIDIA DGX Spark
Пам’ять96 / 256 / 512 ГБ єдиної128 ГБ когерентної LPDDR5x
Пропускна здатність1,2 ТБ/с273 ГБ/с
Ціна$5 499 (96 ГБ), $9 499 (256 ГБ)$4 699 (з кінця лютого 2026, на старті було $3 999)
Ціна за 1 ГБ пам’яті$57 (96 ГБ), $37 (256 ГБ)$37
Ціна за 1 ГБ/с пропускної здатності$7,7 (256 ГБ)$17,2
СофтMLX, Metal, llama.cpp, LM Studio, Ollamaповний стек NVIDIA: CUDA, TensorRT-LLM, NIM, NeMo, NCCL
КластерThunderbolt 5 (до 120 Гбіт/с за даними Apple) + RDMAConnectX-7 (200 Гбіт/с), 2 машини — моделі до 405B за заявою NVIDIA

Ціни — на 26 вересня 2026. Підвищення ціни DGX Spark NVIDIA оголосила на своєму форумі розробників 25 лютого 2026 і пояснила дефіцитом пам’яті.

Три висновки з таблиці:

  • Генерація: Mac. Decode упирається в пропускну здатність, а в M5 Ultra вона в 4,4 раза більша. Навіть два DGX Spark із сумарними 256 ГБ обійдуться приблизно в ті самі гроші, що один Mac на 256 ГБ, але кожна машина читає ваги на своїх 273 ГБ/с.
  • Ціна за гігабайт — порівну. На 256 ГБ Mac і DGX Spark коштують близько $37 за гігабайт. Mac дорогий у базі на 96 ГБ, але не на великому обсязі.
  • Екосистема: DGX Spark. Якщо ви донавчаєте моделі, пишете код під CUDA або згодом розгортаєте його на серверах NVIDIA Blackwell, Mac не підходить за жодні гроші: CUDA на Apple Silicon немає. DGX Spark повторює архітектуру датацентру, і, за позиціюванням NVIDIA, код із робочого столу переїжджає в продакшн тим самим шляхом.

Одне застереження щодо prefill. У нашому порівнянні DGX Spark, Mac Studio і Strix Halo головним козирем DGX Spark проти M3 Ultra була саме обробка промпту. M5 Ultra прискорив її в 2,5 раза й розрив скоротив, але заміру двох машин на одній моделі та одному бекенді на дату публікації немає, тому переможця в prefill ми не називаємо. Окремо про сам бокс NVIDIA, його софт і обмеження — у розборі NVIDIA DGX Spark для нейромереж.

Про кластери. Apple уперше офіційно підтримує об’єднання кількох Mac Studio через Thunderbolt 5 з RDMA (прямим доступом до пам’яті сусідньої машини). Для прикладу з чотирьох машин Apple обіцяє до 3x прискорення інференсу; це заява компанії, незалежного заміру поки немає. Чотири Mac на 512 ГБ дають пул 2 ТБ, і Pinggy розраховує запустити на ньому Kimi K3 (1,56 ТБ ваг). Але лише з піднятим лімітом пам’яті для GPU: за стандартних ~75% чотири машини віддають моделі близько 1,5 ТБ, і K3 не вміщується. У NVIDIA інтерконект ConnectX-7 на 200 Гбіт/с побудовано на тій самій технології RoCE, що й датацентрові кластери; за оцінкою Petronella, це помітно більше, ніж дає Thunderbolt 5.

Ціна Mac Studio M5 Ultra: апгрейд до 256 ГБ коштує $4 000

Ціни за конфігураціями на 26 вересня 2026 (США, без податків):

КонфігураціяЦіна заразЗ чим порівняти
M5 Max, база$2 499M4 Max стартував із $1 999, у червні 2026 подорожчав до $2 499
M5 Ultra 30/64, 96 ГБ, 1 ТБ$5 499 (для освіти $5 099)M3 Ultra з урізаним чипом і 96 ГБ: $3 999 на старті, $5 299 після червня 2026
M5 Ultra 36/80, 256 ГБ, 1 ТБ$9 499та сама пам’ять на M3 Ultra 18 місяців тому: $5 599
M5 Ultra, 512 ГБне оголошена, поставки з кінця жовтня 2026M3 Ultra на 512 ГБ стартував із $9 499

Перехід із бази на 256 ГБ додає $4 000 — більше, ніж коштує весь Mac Studio на M5 Max. Ars Technica припускає, що версія на 512 ГБ вийде за $20 000 і вище, але це прогноз журналіста, а не ціна Apple.

У пресі для M3 Ultra трапляються дві стартові ціни, $3 999 і $5 299. Суперечності немає, це одна конфігурація в різні місяці: за даними Macworld, M3 Ultra стартував у березні 2025 за $3 999, а під час загального підвищення цін у червні 2026 подорожчав на $1 300, до $5 299. Тому M5 Ultra за $5 499 дорожчий за стартову ціну попередника на $1 500 (+37,5%), але лише на $200 дорожчий, ніж M3 Ultra коштував цього літа. Для локального ШІ важливіше порівняння за однакової пам’яті: 256 ГБ подорожчали з $5 599 до $9 499, тобто на 70%.

Чому так дорого, пояснює хронологія 2026 року (за даними FelloAI, Macworld і Ars Technica):

ДатаЩо сталосяМаксимум пам’яті в продажу
березень 2025виходить M3 Ultra512 ГБ
5 березня 2026Apple прибирає опцію 512 ГБ, апгрейд до 256 ГБ дорожчає з $1 600 до $2 000256 ГБ
5 травня 2026прибрано опцію 256 ГБ96 ГБ
червень 2026Apple піднімає ціни на всю лінійку Mac, M3 Ultra — до $5 29996 ГБ
25 серпня 2026анонс M5 Ultra з пам’яттю 96 / 256 / 512 ГБ512 ГБ (з кінця жовтня)
22 вересня 2026старт продажів конфігурацій на 96 і 256 ГБ256 ГБ

Причина — глобальний дефіцит оперативної пам’яті: її скуповують дата-центри під ШІ. Нинішня ціна — це не просто зростання, а повернення великих обсягів, які пів року взагалі не можна було купити. Дефіцит послабшав достатньо, щоб Apple знову продавала 512 ГБ, але не настільки, щоб пам’ять подешевшала. Ars Technica зазначає, що більшість конфігурацій Mac Studio місяцями було майже неможливо купити.

Ризики M5 Ultra: CUDA-стіна, фейкові бенчмарки, дефіцит

  • Фейкові бенчмарки. До старту продажів 22 вересня в мережі гуляли «точні» цифри токенів за секунду для M5 Ultra на Llama 3.3 70B і Llama 3.1 405B. Petronella Technology 26 серпня прямо попередила, що всі вони вигадані: заліза тоді не було ні в кого, а одна сторінка приписувала чипу пропускну здатність 600 ГБ/с замість 1,2 ТБ/с. Перевіряйте дату заміру, версію софту й модель. Перші справжні тести вийшли 21–23 вересня (MacStories, Ars Technica, Tom’s Hardware).
  • Зведені таблиці, зібрані ШІ. На Reddit у r/LocalLLM 25 вересня виклали порівняння M5 Ultra з двома DGX Spark, яке на прохання автора синтезувала мовна модель із розрізнених цифр. Сама таблиця визнає, що заміру на одній моделі, одному кванті й одному софті не існує. Такі компіляції виглядають як бенчмарк, але ним не є.
  • CUDA-стіна. Донавчання великих моделей, бібліотеки лише під CUDA, продакшн-сервінг через vLLM і TensorRT-LLM — це територія NVIDIA. MLX уміє донавчання через LoRA, але це не заміна стеку, на якому працює індустрія.
  • Ціна й дефіцит. Базова ціна зросла на $1 500 порівняно зі стартовою ціною M3 Ultra, 256 ГБ — на 70%. Поставки топових конфігурацій увесь 2026 рік були нестабільними, і це може повторитися.
  • 512 ГБ без ціни. Хто планує бюджет під GLM-5.2 або DeepSeek 671B, купує кота в мішку: ні ціни, ні точної дати, лише «кінець жовтня».
  • Пам’ять не розширюється. Вона розпаяна в чипі. Узяли 96 ГБ — через рік не додасте.
  • Хмара може виявитися дешевшою. Критичний розбір на YouTube «Don’t Buy a Mac Studio M5 Ultra for Local AI» вважає, що ті самі відкриті моделі в стороннього хостингу обходяться дешевше й працюють швидше на довгих промптах. Локальна машина виграє, коли дані не можна віддавати третій стороні (NDA, вимоги регулятора) або коли завдання йдуть уночі й швидкість неважлива.

Кому брати Mac Studio M5 Ultra, а кому — DGX Spark або почекати

Вибір Mac Studio для LLM зводиться до шести запитань. Пройдіть їх по черзі: перше, на яке ви відповіли «так», і є ваш сценарій.

  1. Моделі вміщуються в 32 ГБ (до ~30B у 4 бітах)? Mac Studio M5 Ultra не потрібен. Дискретна відеокарта дасть більше токенів за секунду за менші гроші.
  2. Потрібні CUDA, донавчання або перенесення коду на сервери NVIDIA? Беріть DGX Spark. Пропускна здатність пам’яті тут не аргумент.
  3. Вистачає 64–128 ГБ і бюджет обмежений? Дивіться Mac Studio на M5 Max (до 128 ГБ, 614 ГБ/с у 40-ядерного GPU, від $2 499) або молодші машини Apple — наприклад, Mac Mini M4 Pro для нейромереж.
  4. Працюєте з MoE-моделями на 100–150 ГБ і агентами з довгим контекстом? Це основний сценарій Mac Studio M5 Ultra на 256 ГБ за $9 499. Саме тут прискорення prefill у 2,5 раза найпомітніше.
  5. Потрібні моделі на 240+ ГБ (MiniMax M3, GLM-5.2, DeepSeek 671B)? Чекайте 512 ГБ наприкінці жовтня та оголошення ціни. Узяти 256 ГБ «на виріст» не вийде: пам’ять не докуповується.
  6. Уже маєте M3 Ultra на 512 ГБ? Оновлення має сенс, якщо ви працюєте з агентами й довгими промптами: очікування першого токена скоротилося в 2,4 раза, генерація прискорилася в 1,5–1,9 раза. Якщо ви тримаєте в пам’яті моделі на 300+ ГБ, перехід на 256 ГБ — крок назад до виходу версії на 512 ГБ.

Окремо про очікування наступного покоління. За даними AppleInsider (червень 2026), які наводить FelloAI, наступним чипом класу Ultra стане M7 Ultra, і його чекають у 2028 році. Це звіт видання, а не заява Apple, але якщо він правильний, M5 Ultra залишиться вершиною лінійки приблизно два роки.

FAQ

Скільки токенів за секунду видає Mac Studio M5 Ultra на моделях рівня 70B? Незалежного заміру на щільній 70B на дату публікації немає. Розрахунок за пропускною здатністю пам’яті (Pinggy) дає стелю близько 30 ток/с і реалістичні 20–25 ток/с у 4-бітному кванті. MoE-моделі того самого розміру працюють у рази швидше: Qwen3.8-Flash-Next на 125B параметрів у замірі MacStories видав 108 ток/с, бо на кожен токен працює лише 6B активних параметрів.

Чи можна донавчати моделі на Mac Studio M5 Ultra? Частково. Фреймворк Apple MLX підтримує донавчання через LoRA, і для невеликих адаптерів цього вистачає. Але основні інструменти індустрії для навчання та продакшн-сервінгу розраховані на CUDA, а її на Apple Silicon немає. Якщо донавчання — ваша основна робота, DGX Spark або сервер на відеокартах NVIDIA підійдуть краще.

Чи варто чекати конфігурацію на 512 ГБ, чи брати 256 ГБ зараз? Якщо ваші моделі важать до ~150 ГБ, 256 ГБ вистачить уже зараз: DeepSeek-V4-Flash, Qwen3.8-Flash-Next, gpt-oss-120b вміщуються із запасом під контекст, GLM-5.3-Flash — впритул. Для моделей на 400+ ГБ (GLM-5.2, DeepSeek 671B) потрібна версія на 512 ГБ, вона вийде наприкінці жовтня 2026. Ціну Apple не оголосила, а пам’ять потім не додати.

Чим M5 Ultra відрізняється від M3 Ultra для локального ШІ, якщо в мене вже є стара машина? Пропускна здатність пам’яті зросла з 819 до 1 229 ГБ/с, у GPU з’явилися Neural Accelerators. За замірами MacStories генерація стала швидшою в 1,5–1,9 раза залежно від довжини контексту, обробка промпту — у 2,5 раза. Мінус для власників M3 Ultra на 512 ГБ: до кінця жовтня нова машина є лише у версії на 256 ГБ.

Чи можна об’єднати кілька Mac Studio в кластер для великих моделей? Так. Apple уперше офіційно підтримує кластери через Thunderbolt 5 з RDMA: машини об’єднують пам’ять у спільний пул. За заявою Apple, чотири Mac Studio дають до 3x прискорення інференсу проти однієї машини. Чотири конфігурації на 512 ГБ — це пул 2 ТБ. Kimi K3 на 1,56 ТБ вміщується в нього лише з піднятим лімітом пам’яті для GPU.

DGX Spark дешевший — навіщо платити більше за Mac Studio? DGX Spark дешевший на вході ($4 699 проти $5 499), але на 256 ГБ ціна за гігабайт у них однакова, близько $37. За ці гроші Mac дає в 4,4 раза швидшу пам’ять, а отже, і помітно швидшу генерацію тексту. Переплата виправдана, якщо вам потрібен чистий інференс великих моделей без прив’язки до CUDA.

BINANCE SIMPLE EARN
Крипта лежить?
Simple Earn: відсоток нараховується щодня
Відкрити Earn
Поділитися
Зв'язатися:
Крипто- та data-аналітик, інженер-програміст (факультет комп'ютерних наук ХНУРЕ). В IT з 2008 року: адміністрував корпоративний моніторинг у «Vodafone Україна», сім років розробляв і просував веб-проєкти, п'ять років керував маркетингом на метриках — конверсія, CTR, ROI, LTV.Криптовалютними ринками займаюся з 2021 року: ончейн-метрики, токеноміка, макроекономічні індикатори. Розробив власну data-driven модель аналізу ринку на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математична статистика та EDA; збір і звірку даних автоматизую AI-агентами.Принцип — «Don't trust, verify»: кожна цифра перевірена за першоджерелом, ключові — щонайменше за двома незалежними; прогнози — лише сценарії з умовами. Теза без даних не публікується.