MacBook Pro M5 Max для нейромереж: 128 ГБ у ноутбуці та 70B на 10–18 ток/с

37 хв. читання

Коротко (TL;DR)

  • MacBook Pro M5 Max із 40-ядерним GPU — єдиний ноутбук Apple зі 128 ГБ єдиної пам’яті (614 ГБ/с). Єдиним Mac із таким обсягом він був до 25 серпня 2026: тепер ті самі 128 ГБ дає Mac Studio на M5 Max, а Mac Studio на M5 Ultra — до 512 ГБ.
  • Щільні 70B-моделі в 4-бітному кванті працюють зі швидкістю 9,95–18 токенів за секунду залежно від джерела. Наш розрахунок фізичної стелі для такої моделі на 614 ГБ/с — близько 15 ток/с, тому ручний замір близько 10 ток/с ближчий до реальності, ніж лідерборди.
  • 128 ГБ справді окупаються на MoE-моделях: Qwen 4.1 32B-A3B — 78–82 ток/с, 35B-A3B — близько 100 ток/с, а Qwen3-235B-A22B у ~3 бітах — 18 ток/с, як щільна 70B за втричі більшого розміру.
  • Головний приріст покоління — обробка промпту (prefill): заяву Apple «до 4 разів швидше за M4 Max» підтверджено незалежно (3,5–4,5 раза). Генерація тексту зросла лише на ~20%.
  • Ціна: 14-дюймовий M5 Max стартує з $3 599, але це 36 ГБ. Конфігурація з 40-ядерним GPU, 128 ГБ і 2 ТБ коштує $6 699 за рекомендованою ціною (на 27 серпня 2026).
  • RTX 5090 генерує у 2–3 рази швидше, але лише те, що вміщується в її 32 ГБ. 70B-модель у 4 бітах важить близько 40 ГБ і в одну таку карту не влазить.

Усі цифри нижче — чужі заміри: біля кожної вказано, хто міряв, на якій моделі та яким рушієм. Власного прогону на цій машині в нас не було. Дані зібрано на 26 вересня 2026.

Лінійка MacBook Pro M5: для ШІ важлива пам’ять, а не ядра

MacBook Pro M5 Max — ноутбук Apple на старшому чипі покоління M5. Apple анонсувала його 3 березня 2026, продажі стартували 11 березня. Для локального ШІ (в англомовних оглядах — local AI, тобто нейромережа, яка працює на вашому комп’ютері без хмари) у ньому важливі не ядра CPU, а два параметри пам’яті: скільки її і як швидко вона читається. Драбина конфігурацій нижче — за технічними характеристиками Apple та анонсами компанії.

Кілька термінів, без яких далі буде складно:

  • Єдина пам’ять — спільна оперативна пам’ять для CPU і GPU. Модель не треба копіювати в окрему відеопам’ять, тому більша частина зі 128 ГБ доступна нейромережі.
  • Пропускна здатність — скільки гігабайтів за секунду пам’ять віддає чипу. Для генерації тексту це головний параметр.
  • Prefill — обробка вашого запиту до першого слова відповіді. Упирається в обчислювальну потужність.
  • Decode, або генерація — видача відповіді токен за токеном. Упирається в пропускну здатність пам’яті.
  • Токен — шматочок слова; швидкість міряють у токенах за секунду (ток/с).
  • Квант — стиснення ваг моделі: «4 біти» означає, що кожен параметр зберігається в 4 бітах замість 16. Модель легша, якість трохи нижча.
ЧипCPUGPUПропускна здатністьПам’ятьСтарт 14″Старт 16″
M510 ядер10 ядер153 ГБ/сдо 32 ГБ$1 599 (жовтень 2025)—
M5 Pro15 або 18 ядер16 або 20 ядер307 ГБ/с24 / 48 / 64 ГБ (64 — лише з 20-ядерним GPU)$2 199 (24 ГБ)$2 699
M5 Max, 32 ядра GPU18 ядер32 ядра460 ГБ/слише 36 ГБ$3 599$3 899 (M5 Max)
M5 Max, 40 ядер GPU18 ядер40 ядер614 ГБ/с48 / 64 / 128 ГБопція конфігуратораопція конфігуратора

Ціни — рекомендовані в США на момент анонсу. Для базового M5 у таблицях 2026 року (PCGuide, Local AI Master) трапляється і $1 699; причину джерела не називають, актуальну ціну показує apple.com.

З таблиці випливають три висновки, які визначають усю покупку.

Перший: 128 ГБ є лише в M5 Max із 40-ядерним GPU. Стартова версія M5 Max за $3 599 — це 32 ядра GPU, 460 ГБ/с і фіксовані 36 ГБ. На ній 70B-модель не запуститься взагалі.

Другий: швидкість генерації зростає разом із пропускною здатністю, а не з кількістю ядер. Щоб видати черговий токен, щільна модель читає з пам’яті всі свої ваги. Тому 614 ГБ/с проти 307 ГБ/с у M5 Pro — це приблизно вдвічі більше токенів за секунду на одній і тій самій моделі.

Третій: 128 ГБ не означають 128 ГБ під модель. macOS за замовчуванням віддає відеоядру близько 75% єдиної пам’яті, тобто приблизно 96 ГБ зі 128. Спільнота піднімає цей ліміт командою з розділу про софт нижче, до ~110 ГБ, і він скидається після перезавантаження (дані Local AI Master).

Для українського ринку орієнтир є лише щодо базової моделі. За оглядом у блозі Foxtrot від 1 квітня 2026, MacBook Pro M5 коштував від 88 999 грн за 16 ГБ і 512 ГБ, 99 499 грн за 16 ГБ і 1 ТБ, 111 999 грн за 24 ГБ і 1 ТБ. Для локального ШІ це машина класу моделей на 4–8 млрд параметрів. Конфігурацій M5 Max в офіційному українському роздрібному продажу на дату збору даних ми не знайшли.

Конфігурація M5 Max під LLM: що обрати і скільки коштує

Під локальні моделі має сенс збирати одну конкретну конфігурацію, а не «максимум усього». Розкладка за конфігуратором:

ПараметрЩо обратиЦіна на 27 серпня 2026Чому
ЧипM5 Max, 18 ядер CPU, 40 ядер GPUвходить у підсумок нижчелише з ним доступні 128 ГБ і 614 ГБ/с
Пам’ять128 ГБвходить у підсумок нижче70B із запасом під контекст, MoE-моделі на 100+ млрд параметрів
Накопичувачстандартні 2 ТБвходить у підсумок нижче70B-модель у 4 бітах важить близько 40 ГБ; SSD читає до 14,5 ГБ/с
Корпус16″, якщо модель працює годинами16″ дорожчий за 14″ на $300 у стартових цінахбільше запасу з охолодження, див. розділ про тротлінг
Разом, 14″, 40 GPU / 128 ГБ / 2 ТБ$6 699 рекомендована ціна

Ціну $6 699 за таку конфігурацію наводить AppleInsider на 27 серпня 2026: партнер Apple Expercom тоді продавав її за $5 299 зі знижкою $1 400 за обмеженого запасу. Точну ціну 16-дюймової версії зі 128 ГБ у джерелах ми не знайшли — її показує лише конфігуратор.

Наш розрахунок: скільки коштує перехід до 128 ГБ. Різниця між стартовим 14-дюймовим M5 Max ($3 599, 36 ГБ, 32 ядра GPU) і конфігурацією під локальний ШІ ($6 699) — $3 100. За ці гроші ви отримуєте +92 ГБ пам’яті, +33% пропускної здатності (614 проти 460 ГБ/с) і +8 ядер GPU. Якщо віднести всю доплату на пам’ять, виходить близько $34 за кожен додатковий гігабайт. Реальну «ціну гігабайта» Apple в цій зв’язці не розкриває, це наша груба оцінка.

Ціна цієї конфігурації радше зросте, ніж упаде. У 2026 році Apple посеред циклу прибирала опції великої пам’яті в Mac Studio на тлі дефіциту DRAM (за даними MacRumors у переказі Local AI Master), а в червні підняла стартову ціну Mac Studio з $1 999 до $2 499 (Macworld).

MacBook Pro M5 Max проти Mac Studio: хто тепер на вершині за пам’яттю

Коротка відповідь на 26 вересня 2026: за обсягом пам’яті на вершині Mac Studio на M5 Ultra (до 512 ГБ), а MacBook Pro M5 Max і Mac Studio на M5 Max ділять друге місце зі 128 ГБ. Ноутбук зберігає одну унікальну властивість — це єдині 128 ГБ, які можна закрити й забрати із собою.

Хронологія: як «єдиний Mac зі 128 ГБ» застарів за 9 днів

Гайд Local AI Master від 16 серпня 2026 назвав ноутбук на M5 Max найємнішим за пам’яттю Mac, який продає Apple («the highest-memory Mac Apple sells»). На дату публікації це було правдою. Ось як змінювалася картина:

ДатаЩо сталосяМаксимум пам’яті в Mac
11 березня 2026старт продажів ноутбука на M5 Max зі 128 ГБноутбук — 128 ГБ
березень 2026Apple прибирає опцію 512 ГБ у Mac Studio M3 UltraMac Studio — 256 ГБ
до травня 2026у Mac Studio зникають 256 і 128 ГБ, M3 Ultra лишається з фіксованими 96 ГБноутбук на M5 Max — 128 ГБ
16 серпня 2026Local AI Master: M5 Max MacBook Pro — «the highest-memory Mac Apple sells»правда на цю дату
25 серпня 2026Apple анонсує Mac Studio на M5 Max (до 128 ГБ) і M5 Ultra (до 512 ГБ, 1,2 ТБ/с)512 ГБ (анонс)
22 вересня 2026початок постачань нового Mac Studio; версія на 512 ГБ — наприкінці жовтня 2026128 ГБ у двох Mac, більше — у M5 Ultra

Джерела хронології — Local AI Master (з посиланням на MacRumors) та офіційний анонс Mac Studio від 25 серпня 2026. Попереднє покоління настільного Mac із його цифрами ми розбирали в огляді Mac Studio M3 Ultra для нейромереж.

Порівняння MacBook Pro vs Mac Studio на 26 вересня 2026

ПараметрMacBook Pro 14″ M5 MaxMac Studio M5 MaxMac Studio M5 Ultra
Максимум пам’яті128 ГБ128 ГБ512 ГБ (з кінця жовтня 2026)
Пропускна здатність614 ГБ/с (40 ядер GPU)614 ГБ/с (40 ядер GPU)1,2 ТБ/с
Стартова ціна в США$3 599 (36 ГБ); 128 ГБ — $6 699$2 499 за базову конфігурацію$5 499
Екран, клавіатура, батареяєнемаєнемає
Охолодження під тривалим навантаженнямобмежене корпусомнастільненастільне
Можна взяти із собоютакніні

Між MacBook Pro і Mac Studio на M5 Max за однакових 128 ГБ і однакових 614 ГБ/с різниця зводиться до корпусу: за ноутбук ви доплачуєте за екран, батарею й мобільність, а втрачаєте запас охолодження. Ціну Mac Studio M5 Max саме зі 128 ГБ Apple у пресрелізі не називає, тому в таблиці стоїть стартова. Якщо потрібно більше за 128 ГБ або швидше за 614 ГБ/с — це вже Mac Studio M5 Ultra; його пам’ять, реальні заміри й ціни за конфігураціями ми докладно розібрали в огляді Mac Studio M5 Ultra для LLM.

Частина спільноти обирає не «або», а «і». Користувач X 23 вересня 2026 написав, що 96 ГБ — це «ледь достатньо», і він збирається тримати свій MacBook Pro на M3 Max (36 ГБ) поруч із Mac Studio M5 Ultra на 256 або 512 ГБ. Схема робоча: ноутбук для дороги й невеликих моделей, настільна машина для важких.

Скільки токенів за секунду реально видає M5 Max на 70B і MoE-моделях

На щільних 70B-моделях у 4-бітному кванті M5 Max зі 128 ГБ видає від 9,95 до 18 токенів за секунду: розкид залежить від джерела, моделі та рушія. На MoE-моделях із ~3 млрд активних параметрів — 78–100 ток/с. Інакше кажучи, 70B відповідає зі швидкістю читання, а швидкі відповіді на цій машині дають MoE-моделі.

Щільні 70B: чотири заміри від 10 до 18 ток/с

ДжерелоМодель і квантРушійток/сТип даних
AI-Stat, березень 2026Llama 3.3 70B Q4_K_Mн/д9,95«точний замір» за текстом джерела
llmcheck.netDeepSeek R1 70BOllama11лідерборд
llmcheck.netLlama 3.3 70B Q4_K_MMLX15лідерборд
llmcheck.netLlama 5 70B Q4_K_MMLX18лідерборд

Лідерборд llmcheck.net усереднює три прогони на щойно завантаженій системі й зібрав 227 замірів на Apple Silicon (дані в переказі Local AI Master, серпень 2026). Показово, що сам AI-Stat у зведеній таблиці пише «70B Q4_K_M — 18–25 т/с», а рядком нижче наводить точний замір тієї самої моделі — 9,95 т/с. Дві цифри одного видання розходяться вдвічі.

Чому так буває: різні версії моделі (Llama 3.3 і Llama 5 — різні мережі), різний рушій (MLX швидший за Ollama, про це нижче), різна довжина контексту й відповіді. Коротка відповідь на свіжій системі завжди швидша, ніж довгий діалог із заповненим контекстом.

Розрахунок: стеля 70B на 614 ГБ/с — близько 15 ток/с

Якщо щільна модель на кожному токені читає всі ваги, швидкість генерації не може перевищити пропускну здатність, поділену на вагу моделі. 70B-модель у 4-бітному кванті важить близько 40 ГБ.

614 ГБ/с ÷ 40 ГБ ≈ 15,4 ток/с — теоретична стеля M5 Max на такій моделі. Звірмо з нею заміри:

Замірток/сЧастка від стелі 15,4 ток/с
AI-Stat, Llama 3.3 70B9,9565%
llmcheck.net, DeepSeek R1 70B, Ollama1171%
llmcheck.net, Llama 3.3 70B, MLX1597%
llmcheck.net, Llama 5 70B, MLX18117%

Результат понад 100% для щільної 4-бітної 70B на цій пам’яті неможливий без застережень. Отже, у цьому замірі модель була стиснута сильніше, використовувалося спекулятивне декодування (маленька модель-чернетка пропонує токени, велика перевіряє їх пачкою) або відрізнялася методика. Це наша інтерпретація: порядкової методики лідерборд не розкриває.

Той самий розрахунок для сусідів: у M4 Max (546 ГБ/с) стеля на 70B — близько 13,7 ток/с, у M5 Pro (307 ГБ/с) — близько 7,7 ток/с. У 64 ГБ M5 Pro модель на 40 ГБ формально вміщується, але працює повільно. Плануйте покупку під 10–11 ток/с на щільній 70B. Якщо вийде більше — це бонус, а не норма.

MoE-моделі та що вміщується в 128 ГБ

MoE (Mixture of Experts, «суміш експертів») — архітектура, у якій на кожен токен працює лише частина параметрів. Модель цілком лежить у пам’яті, але за крок читається лише її невелика частка. Тому MoE-модель на 32 млрд параметрів із 3 млрд активних генерує зі швидкістю маленької моделі, а знає як велика.

МодельТип і квантВагаВміщується в 128 ГБток/с на M5 MaxДжерело
Llama 3.1 8Bщільна, Q4_K_Mн/дтак, із великим запасом138llmcheck.net
Qwen 4.1 32B-A3BMoE, ~3 млрд активних, Q4_K_Mн/дтак78–82llmcheck.net
35B-A3BMoE, ~3 млрд активнихн/дтак~100учасник Hacker News, липень 2026
Llama 3.3 70Bщільна, Q4_K_M~40 ГБтак, лишається місце під контекст9,95–15AI-Stat, llmcheck.net
Qwen3-235B-A22BMoE, 22 млрд активних, ~3 біти~100 ГБтак, із піднятим лімітом пам’яті GPU18llmcheck.net
моделі від 220 млрд параметрів (MiniMax M2.5, DeepSeek V4)——за оцінкою AI-Stat, починають виходити за межі розумного; виняток — сильно стиснуті MoE на кшталт Qwen3-235B-A22B——

Найпоказовіший рядок — останній із цифрами. Qwen3-235B-A22B утричі більша за щільну 70B, а генерує з тією самою швидкістю, 18 ток/с. Близько 100 ГБ її ваг не вміщуються в 96 ГБ, які macOS віддає GPU за замовчуванням, але вміщуються в 128 ГБ, якщо підняти ліміт. Саме заради таких моделей і варто брати 128 ГБ, а не 64.

Для порівняння: на M5 Pro з 64 ГБ Qwen 4.1 32B-A3B дає 56 ток/с (llmcheck.net). Якщо ваш основний інструмент — MoE-модель такого класу для коду, M5 Pro закриває завдання дешевше.

Софт розганяє те саме залізо: MLX, LM Studio та Ollama

Швидкість на Mac визначає не лише чип, а й рушій, яким ви запускаєте модель. Приклад із вересня 2026: розробник в X (21 вересня) показав Qwen3.8-27B на ноутбуці з M5 Max у LM Studio Bionic з рушієм Splash — близько 120 ток/с в агентному завданні із субагентом. За його словами, на старті моделі трохи більше місяця тому та сама модель на тому самому ноутбуці видавала близько 20 ток/с. Цю цифру 22 вересня переказав інший користувач X — це не незалежний замір. Напрям однаково зрозумілий: цифри на день покупки — не фінальні.

Різницю між рушіями виміряно й у спокійніших умовах, хоча джерела розходяться у відсотках:

  • MLX — фреймворк Apple для машинного навчання. За AI-Stat (березень 2026), він на 20–30% швидший за llama.cpp і до 50% швидший за Ollama на генерації, а на prefill розрив сягає 3–5 разів.
  • Лідерборд llmcheck.net дає скромніший відрив MLX від Ollama — 5–15% на одній і тій самій моделі.
  • Причина розриву на prefill: нейроприскорювачі в ядрах GPU M5 доступні через Metal 4 TensorOps, які підтримує MLX. llama.cpp станом на березень 2026 їх не задіював.

Як розходяться Ollama, LM Studio і llama.cpp на одній моделі, ми окремо розбирали в замірі Ollama, LM Studio і llama.cpp. Мінімальний старт на MLX і зняття ліміту пам’яті GPU виглядають так (команди з гайду Local AI Master):

pip install mlx-lm
mlx_lm.chat --model mlx-community/Llama-3.3-70B-Instruct-4bit

# віддати GPU ~110 ГБ зі 128; скидається після перезавантаження
sudo sysctl iogpu.wired_limit_mb=110000

Після зняття ліміту стежте за графіком «Навантаження на пам’ять» у Моніторингу системи: поки він зелений, усе гаразд. Жовтий колір означає підкачку на диск, і швидкість генерації різко падає.

M5 Max проти M4 Max: prefill до 4 разів швидший, генерація +20%

Neural Accelerators — блоки для матричних обчислень, які Apple вбудувала в кожне ядро GPU покоління M5. Вони пришвидшують prefill, тобто читання вашого запиту, а не видачу відповіді. Apple заявляє для M5 Max обробку промпту LLM до 4 разів швидшу, ніж у M4 Max, і до 6,7 раза швидшу, ніж у M1 Max. Незалежні тести це підтверджують:

ДжерелоЩо мірялиM4 MaxM5 MaxПрискорення
Apple, анонс 3 березня 2026обробка промпту LLM——до 4x
Hardware Corner (у переказі AI-Stat)той самий промпт81 с18 с4,5x
jakkuh, YouTube, 22 березня 2026сценарій фільму цілком, Qwen 3.5 27B у 4 бітахпонад 80 сменше 23 с~3,5–4x
jakkuh, та сама модельгенерація відповіді19 ток/с22,5 ток/с+18%
llmcheck.netгенерація, Llama 5 70B, MLX, 128 ГБ15 ток/с18 ток/с+20%

Генерація зросла скромно, бо пропускна здатність пам’яті зросла лише з 546 до 614 ГБ/с. Звідси й перші розчаровані враження: на короткому запитанні prefill займає частки секунди, і користувач бачить тільки швидкість генерації. У jakkuh обидві машини були з 36 ГБ пам’яті, тобто M5 Max у тесті — версія з 32 ядрами GPU і 460 ГБ/с.

Де прискорення prefill помітне: RAG (відповіді за вашими документами), завантаження PDF і вебсторінок, робота з кодовою базою, ШІ-агенти, які знову й знову перечитують накопичений контекст. Де майже непомітне: звичайний чат із короткими запитаннями.

Наш приклад розрахунку. Візьмімо промпт із тесту Hardware Corner. Якщо агент за одне завдання 20 разів обробляє контекст такого розміру, на M4 Max очікування до першого токена сумарно становитиме близько 27 хвилин (81 с × 20), на M5 Max — близько 6 хвилин (18 с × 20). Генерація в обох випадках забере приблизно однаковий час. Тож якщо ви обираєте між MacBook Pro M5 Max і вже наявним M4 Max зі 128 ГБ, оновлення має сенс лише для роботи з довгим контекстом та агентами.

RTX 5090 проти M5 Max: GPU-башта чи ноутбук зі 128 ГБ

RTX 5090 виграє за швидкістю все, що вміщується в її 32 ГБ відеопам’яті. Ноутбук на M5 Max виграє все, що туди не вміщується. Це головне, що треба знати про порівняння.

ПараметрMacBook Pro, M5 Max, 128 ГБRTX 5090RTX PRO 6000 Blackwell
Пам’ять під модель128 ГБ єдиної пам’яті32 ГБ GDDR796 ГБ GDDR7
Пропускна здатність614 ГБ/с1 792 ГБ/с1 792 ГБ/с
Генерація на моделях, які вміщуютьсябазау 2–3 рази швидшена 50–65% швидше
Prefillбазаприблизно в 4 рази швидшешвидше
70B у 4 бітах (~40 ГБ)вміщуєтьсяв одну карту не вміщуєтьсявміщується
Ціна$6 699 за весь ноутбук$1 999 рекомендована, лише карта$8 800 лише за карту (березень 2026)
Споживанняблизько 100 Вт на всю систему575 Вт лише карта (TDP)600 Вт лише карта (TDP)
CUDAнемаєєє

Порівняння швидкості й ціна RTX PRO 6000 — за AI-Stat (березень 2026), пропускна здатність RTX 5090 і споживання ноутбука — за BuildMVPFast, рекомендована ціна RTX 5090 і TDP обох карт — за даними NVIDIA. Ціни на карти вказано без решти комп’ютера.

Пропускна здатність RTX 5090 майже втричі вища, звідси й кратний відрив у генерації. Але модель на 40 ГБ у 32 ГБ не влізе, і далі є два шляхи: дві карти або вивантаження частини шарів у звичайну оперативну пам’ять, яке різко знижує швидкість. У M5 Max такої проблеми на моделях до ~100 ГБ немає.

Що де обирати:

  • Моделі до 32 ГБ і максимальна швидкість — ПК з RTX 5090. Зведення чужих замірів для 5090, 4090 і 3090 ми зібрали в огляді RTX 5090, 4090 і 3090 у локальних LLM.
  • 70B без компромісів у швидкості та з CUDA — робоча станція на 96 ГБ відеопам’яті, як у нашому розборі робочої станції на RTX PRO 6000.
  • Моделі на 40–100 ГБ і мобільність — ноутбук на M5 Max зі 128 ГБ.

Якщо обираєте між платформами з єдиною пам’яттю загалом, подивіться наше порівняння DGX Spark, Mac Studio і Strix Halo: там ті самі питання розв’язуються на трьох різних архітектурах.

Тротлінг 14-дюймового MacBook Pro: що показують незалежні тести

Тротлінг — зниження частот і потужності чипа, коли корпус не встигає відводити тепло. Обидва знайдені джерела згодні в головному: 14-дюймовий MacBook Pro з M5 Max тротлить, а з M5 Pro — практично ні. Розходяться вони в ступені, бо міряли різне.

ДжерелоДатаМетодикаРезультат
HackerNoon, колонка Andrew Schwabe27 березня 2026«стале навантаження», стенд і тип навантаження не описано14″ M5 Max опускається приблизно до 42 Вт; 16″ з тим самим чипом тримає 62+ Вт і випереджає 14″ на 15–18% у реальних завданнях
jakkuh, YouTube22 березня 202620-хвилинний стрес-тест 3DMark (графіка)втрата продуктивності 3–5%; із вентиляторами на 100% — 2–3%; у M5 Pro тротлінгу автор не помітив

Чому джерела розходяться: вати проти балів 3DMark

HackerNoon говорить про потужність чипа під тривалим навантаженням і про різницю з 16-дюймовою версією, але не описує, чим навантажував. jakkuh наводить втрату балів у 20-хвилинному графічному тесті. Це дві різні величини: падіння потужності вдвічі не зобов’язане давати падіння балів удвічі, а 20 хвилин 3DMark — не те саме, що багатогодинний прогін моделі.

Для локального ШІ з цього випливає наш висновок, а не замір. Генерація на щільній моделі впирається в пропускну здатність пам’яті, тому урізана потужність має зачіпати її менше. Prefill і MoE-моделі більше навантажують обчислювальні блоки, тому тут обмеження потужності відчутніше. Опосередковано це підтверджує учасник Hacker News: на MoE 35B-A3B він отримує 80 ток/с у режимі високої потужності й 38 ток/с у режимі енергозбереження (модель його чипа в повідомленні не вказано). Обмеження потужності режимом енергозбереження зрізало швидкість на MoE більш ніж удвічі.

Якщо модель працюватиме годинами, обирайте 16-дюймову версію — це позиція і HackerNoon, і Local AI Master. Якщо потрібен саме компактний ноутбук і вистачає 64 ГБ, HackerNoon радить 14-дюймовий M5 Pro: цей чип вкладається в тепловий пакет корпусу.

Жар, шум і батарея під час роботи агентів

14-дюймовий M5 Max комплектується адаптером на 96 Вт, а батарея в нього — 72,4 Вт·год. За HackerNoon, чип може короткочасно брати до 96 Вт, і під важким навантаженням батарея розряджається навіть на зарядці. jakkuh наміряв під тривалим навантаженням 80–90 Вт із розетки. Наша груба оцінка: 72,4 Вт·год за 80–90 Вт — це менше години роботи від повної батареї, тому «ноутбук для ШІ в дорозі» на практиці означає «поруч із розеткою».

Власник MacBook Pro M5 зі 128 ГБ у тій самій гілці Hacker News (липень 2026) пише прямо: під час серйозної роботи з локальними моделями ноутбук обпікає пальці й шумить так, що працювати за ним некомфортно. Його порада — тримати модель на окремому Mac mini подалі від столу й підключатися мережею. Таку бюджетну точку входу ми розбирали в огляді Mac Mini M4 Pro для нейромереж.

Безвентиляторний MacBook Air M5 — окрема історія

MacBook Air M5 не має вентилятора взагалі й під тривалим навантаженням тротлить сильніше за будь-який MacBook Pro M5 — у цьому сходяться HackerNoon і порівняльний відеоогляд Air проти Pro. Для розмов із невеликою моделлю він годиться, для довгих сесій інференсу — ні. Плутати його з тротлінгом 14-дюймового Pro не варто: у Pro вентилятори є, але чип Max потужніший, ніж корпус може охолодити під постійним навантаженням.

Ризики ноутбука Apple для локального ШІ: CUDA, пам’ять, ціна

  • Немає CUDA. Дотренування моделей на Mac можливе (MLX-LM уміє QLoRA), але за оцінкою Local AI Master це робочий варіант для моделей на 7–14 млрд параметрів і далеко від екосистеми NVIDIA. Серйозне навчання — це оренда GPU NVIDIA.
  • Пам’ять скінченна навіть на 128 ГБ. Власник MacBook Pro зі 128 ГБ написав в X 19 вересня 2026, що вже впирається в ліміт пам’яті, коли паралельно працюють локальна модель і кілька сесій ШІ-кодингу.
  • Очікування щодо 70B. Лідерборди показують 15–18 ток/с, ручний замір — близько 10. Якщо купуєте заради щільних 70B, закладайтеся на 10–11 ток/с.
  • Жар і ціна. Про тротлінг і батарею — розділ вище. Конфігурація зі 128 ГБ може подорожчати або стати дефіцитною: Apple у 2026 році вже прибирала конфігурації з великою пам’яттю посеред циклу.
  • Надмірність. Колумніст vc.ru називає 16-дюймовий M5 Max «стріляниною з ядерної гармати по горобцях» для скриптів, інтеграцій та аналітики: така машина виправдана лише для важкого локального ШІ та дата-інженерії.

Що в цій статті застаріє першим: ціни (пам’ять дорожчає, Apple змінює конфігурації посеред циклу), швидкість у токенах за секунду (рушії MLX і LM Studio пришвидшуються з місяця в місяць) і картина з Mac Studio, де версія на 512 ГБ з’явиться наприкінці жовтня 2026. Свіжі ціни дивіться в конфігураторі Apple, свіжі заміри — на лідерборді llmcheck.net і в r/LocalLLaMA.

Кому варто переплачувати за M5 Max і 128 ГБ, а кому вистачить Pro

Рішення ухвалюється за моделлю, яку ви збираєтеся запускати, а не за чипом. Пройдіть кроками згори вниз і зупиніться на першому, що підходить:

  1. Моделі до 8 млрд параметрів і знайомство з локальним ШІ. Вистачить базового MacBook Pro M5: до 32 ГБ і 153 ГБ/с. За оцінкою Local AI Master, 8B-модель у 4 бітах дасть на ньому близько 30–35 ток/с. В Україні — від 88 999 грн (огляд Foxtrot, квітень 2026).
  2. Щодня працюєте з моделлю класу 32B, наприклад MoE-кодером. Вибір між MacBook Pro M5 і M5 Pro тут на користь M5 Pro з 64 ГБ: удвічі вища пропускна здатність, ніж у базового M5, 56 ток/с на Qwen 4.1 32B-A3B і відсутність тротлінгу в 14-дюймовому корпусі. Врахуйте: $2 199 — ціна M5 Pro з 24 ГБ, а 64 ГБ доступні лише з 20-ядерним GPU й коштують дорожче.
  3. Потрібні щільні 70B і MoE-моделі на 100+ млрд параметрів, причому в дорозі. Це і є сценарій старшого ноутбука: M5 Max, 40 ядер GPU, 128 ГБ, стандартні 2 ТБ. Для багатогодинної роботи — 16 дюймів.
  4. Машина стоятиме на столі. Mac Studio на M5 Max дає ті самі 128 ГБ і 614 ГБ/с; стартова ціна $2 499 — за базову конфігурацію, зі 128 ГБ дорожче. Mac Studio на M5 Ultra — до 512 ГБ і 1,2 ТБ/с.
  5. Уже маєте M4 Max зі 128 ГБ. Генерація зросте приблизно на 20%. Оновлення виправдане, лише якщо ви багато працюєте з довгим контекстом, RAG або агентами, де prefill став у 3,5–4,5 раза швидшим.
  6. Потрібна максимальна швидкість на моделях до 32 ГБ або дотренування. Це ПК з відеокартою NVIDIA і CUDA, а не Mac.

Окремо про те, для кого 128 ГБ надмірні. Якщо локальна модель потрібна для чату, невеликих правок коду й перекладу, 70B на 10–11 ток/с буде повільнішою й дорожчою, ніж MoE-модель на M5 Pro. 128 ГБ мають сенс, коли ви точно знаєте, яку модель на 70–235 млрд параметрів запускатимете, і вам треба робити це без хмари та не лише за столом.

FAQ

Скільки коштує MacBook Pro M5 Max зі 128 ГБ пам’яті?

14-дюймовий MacBook Pro з M5 Max (40 ядер GPU), 128 ГБ і 2 ТБ коштує $6 699 за рекомендованою ціною в США на 27 серпня 2026, за даними AppleInsider. Партнер Apple тоді продавав його зі знижкою за $5 299. Стартова ціна M5 Max у $3 599 стосується версії з 36 ГБ і 32 ядрами GPU, на якій 70B-моделі не запускаються.

MacBook Pro M5 Max — єдиний Mac зі 128 ГБ пам’яті?

Ні, з 25 серпня 2026. Того дня Apple анонсувала Mac Studio на M5 Max (до 128 ГБ) і на M5 Ultra (до 512 ГБ), постачання почалися 22 вересня. До цього ноутбук на M5 Max справді був єдиним Mac зі 128 ГБ. Тепер він єдиний ноутбук Apple із таким обсягом пам’яті.

Які моделі ШІ реально вміщуються в 128 ГБ пам’яті MacBook Pro?

Щільні моделі до 70 млрд параметрів у 4 бітах (близько 40 ГБ) із запасом під контекст, MoE-моделі на 100+ млрд параметрів і Qwen3-235B-A22B у ~3 бітах (близько 100 ГБ) — остання лише з піднятим лімітом пам’яті GPU. За замовчуванням macOS віддає відеоядру близько 96 ГБ зі 128. Більші моделі від 220 млрд параметрів, за оцінкою AI-Stat, починають виходити за межі розумного: Qwen3-235B-A22B вміщується лише завдяки стисненню до ~3 бітів.

Чи тротлить MacBook Pro M5 Max під час тривалої роботи з нейромережами?

14-дюймова версія тротлить, джерела розходяться в ступені. HackerNoon пише про падіння потужності приблизно до 42 Вт і відставання від 16-дюймової версії на 15–18%, 20-хвилинний тест 3DMark у jakkuh показав втрату 3–5%. Для багатогодинної роботи моделей краще 16-дюймовий корпус, у M5 Pro тротлінгу практично немає.

Що швидше для локального ШІ — MacBook Pro M5 Max чи RTX 5090?

RTX 5090 швидша у 2–3 рази в генерації та приблизно в 4 рази в prefill, але лише на моделях, які вміщуються в її 32 ГБ. 70B-модель у 4 бітах важить близько 40 ГБ і в одну карту не влазить, а M5 Max тримає моделі до ~100 ГБ. Швидкість на невеликих моделях — за NVIDIA, обсяг і мобільність — за Mac.

Чи варто переплачувати за M5 Max, якщо вистачає M5 Pro?

Ні, якщо ваші моделі вміщуються в 64 ГБ. M5 Pro з 64 ГБ видає 56 ток/с на Qwen 4.1 32B-A3B і не тротлить у 14-дюймовому корпусі. Стартові $2 199 — це версія з 24 ГБ; 64 ГБ потребують 20-ядерного GPU й коштують дорожче. Доплата за M5 Max зі 128 ГБ виправдана під щільні 70B і MoE-моделі на 100+ млрд параметрів.

Поділитися
Зв'язатися:
Крипто- та data-аналітик, інженер-програміст (факультет комп'ютерних наук ХНУРЕ). В IT з 2008 року: адміністрував корпоративний моніторинг у «Vodafone Україна», сім років розробляв і просував веб-проєкти, п'ять років керував маркетингом на метриках — конверсія, CTR, ROI, LTV.Криптовалютними ринками займаюся з 2021 року: ончейн-метрики, токеноміка, макроекономічні індикатори. Розробив власну data-driven модель аналізу ринку на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математична статистика та EDA; збір і звірку даних автоматизую AI-агентами.Принцип — «Don't trust, verify»: кожна цифра перевірена за першоджерелом, ключові — щонайменше за двома незалежними; прогнози — лише сценарії з умовами. Теза без даних не публікується.